9月21日、O'Reillyが「The Post-training Process OpenAI Used for ChatGPT」と題した記事を公開した。この記事では、OpenAIがChatGPTに用いたポストトレーニングパイプラインの内部構造と各手法の技術的詳細について詳しく紹介されている。以下に、その内容を紹介する。
なぜ今、ポストトレーニングが重要なのか
2022年11月のChatGPT登場以前、GPT-3に「なぜ人はゴールデンレトリバーを好きなのか?」と尋ねると、意味不明な回答が返ってくることが多かった。ポストトレーニングによって初めて、誰でもSMSを送るような感覚で、あらゆるトピックに対して筋の通った回答を得られるようになった。
本記事は、O'Reillyが公開中のポストトレーニング4部構成シリーズの第3弾だ(第1部・第2部)。核心は、OpenAIのInstructGPT論文に基づいたChatGPTの3段階パイプラインの解説にある。
ChatGPTの3段階パイプライン
Stage 1:SFT(教師あり微調整)
最初のステージは人間によるデモンストレーションを使ったSupervised Fine-Tuning(SFT)だ。
OpenAIは約40人の人間ラベラーを契約し、有害な出力を識別できる人材を厳選した。ラベラーはプロンプトに対する「理想的な回答」を手書きする。プロンプトの出所は2つ——OpenAI APIに実際のユーザーが投稿したものと、ラベラー自身が作成したものだ。ChatGPT以前の時代、API経由で指示形式のプロンプトを投げるユーザーはまだ少なかったため、ラベラー自身がプロンプトを補う必要があった。
最終的なSFTデータセットは約1万3,000件のプロンプトと人間ラベルの回答ペア。ベースモデルはポストトレーニングなしの素のGPT-3で、16エポック学習させた。興味深いのは、SFTステージ単体では1エポックで過学習が起きるが、あくまでRLHFへの中間ステージとして最良チェックポイントを選んだという点だ。次のRLフェーズの安定性のために、学習データに事前学習データを10%混入している。
Stage 2:報酬モデルの学習
次のステージは、RLフェーズで何百万もの回答を採点する報酬モデル(Reward Model)の構築だ。
学習にはペアワイズ比較データが必要になる——1つのプロンプトに対して2つの回答を提示し、どちらが良いかを人間が判定するデータだ。効率化のため、1プロンプトあたり4〜9通りの回答を生成してラベラーにランク付けさせた。N件のランキングからはN×(N-1)/2件のペアが得られるため、3万3,000プロンプト×4〜9回答というデータから、最終的に20万〜120万件のペアワイズ比較が得られた。
報酬モデルのサイズは6Bパラメータ。175BのGPT-3本体より大幅に小さいが、学習の安定性と計算効率の観点から意図的に抑えた設計だ。損失関数はクロスエントロピー損失で、「好まれる回答」と「好まれない回答」の報酬の差を最大化するよう学習させる。
報酬モデルの過学習対策として、1エポックのみの学習に制限したことも報告されている。また、同一プロンプトから生成したペアを同じバッチにまとめて処理することで、相関の高いデータが分散混入することによる過学習を防いだ。
Stage 3:RLHF(人間のフィードバックによる強化学習)
最後のステージがReinforcement Learning from Human Feedback(RLHF)だ。Stage 2で訓練した報酬モデルを「採点者」として使い、メインモデルのポリシーを最適化する。
ここで重要なのがKLダイバージェンス(KL divergence)ペナルティだ。RLフェーズで報酬スコアだけを最大化しようとすると、モデルは報酬モデルの盲点を突く「報酬ハッキング」——もっともらしく見えるが実際には意味のない出力——を学習してしまう。これを防ぐため、SFTモデルの出力からあまり外れないよう制約をかけている。
ポストトレーニングが実現する能力
パイプライン以外にも、ポストトレーニングが実現する主要な能力が整理されている。
ツール使用(Function Calling)は実用上の重要度が高い。検索エンジン・API・計算機・コードインタープリタ等の外部ツールを呼び出す能力は、主にSFTで教え込まれる。ツールを使うには、いつ使うべきかの判断、正しいAPI呼び出しの構築、結果の自然言語への変換という一連のステップを一貫してこなす必要がある。近年はModel Context Protocol(MCP)という標準規格も登場し、複数フロンティアモデルがポストトレーニングにMCPの学習を組み込んでいる。
推論(Reasoning)も大きなテーマだ。回答前に内部でChain-of-Thoughtを展開する「思考するモデル」はRLによって実現される。2024年のAIME数学試験では、GPT-4oの正答率が12%だったのに対し、OpenAIのo1は1回の試行で74%、1,000回試行+学習済みスコアリング関数によるリランキングで93%に達した。なお、一部のフロンティア推論モデルでは、RLのポストトレーニングフェーズが事前学習全体と同等の計算量を消費するとも述べられている。
安全性とアライメントについては、有害コンテンツの拒否・バイアス排除・ハルシネーション低減が挙げられる一方で、「安全性と有用性のトレードオフ」が常に存在する点が強調されている。どこに線を引くかは、現時点では各AIラボの人間が判断することだ、と記事は述べている。
まとめ
InstructGPTに基づくChatGPTのパイプラインは、SFT→報酬モデル→RLHFという3段階構造だ。現代のシステムはより複雑な手法を用いているが、このパイプラインはほぼすべてのアライメント手法の概念的な基盤となっている。約40人のラベラー、1万3,000件のSFTデータ、20万〜120万件のペアワイズ比較という具体的な数字が公開されているのは、実装を検討するエンジニアにとって参考になるだろう。
詳細はThe Post-training Process OpenAI Used for ChatGPTを参照していただきたい。