ChatGPTが「使えるAI」になる仕組み — 強化学習(RL)と教師あり微調整(SFT)、2つのポストトレーニング手法を徹底解説
DRANK

8月12日、O'Reillyが「The Two Pillars of Post-training: Reinforcement Learning and Supervised Fine-Tuning」と題した記事を公開した。この記事では、LLMのポストトレーニングを支える2つの柱である強化学習(RL)と教師あり微調整(SFT)の仕組みと使い分けについて詳しく解説されている。

by @tf_official
Related Topics: AI Machine Learning Deep Learning