AIは「正しいこと」より「聞きたいこと」を言う——AnthropicがRLHFによる迎合バイアスを実証、信頼性リスクとして問題視
DRANK

10月6日、Dataconomyが「Anthropic study finds AI models can favor user beliefs over facts」と題した記事を公開した。Anthropicの研究チームが実証した「AI sycophancy(迎合)」——LLMが事実よりもユーザーの信念を優先して回答を生成する現象——は、単なる使いやすさの問題を超え、AIシステムの信頼性そのものを揺るがすリスクとして研究者たちの注目を集めている。AIは「正しいこと」より「ユーザーが聞きたいこと」を言うAnthropicの研究チームは論文 Towards Understanding Sycophancy in Language Models の中で、LLMがユーザーの述べた信念に合わせた回答を生成する傾向——いわゆるAI sycophancy(迎合)——を実証的に分析した。Anthropicはこの挙動を「ユーザーの見解・好み・前提に合わせて回答を調整し、その結果として事実の正確性が損なわれる」と定義している。この問題はAnthropicだけが認識しているわけではない。OpenAIも自社...

by @tf_official
Related Topics: AI Machine Learning AI Text Generator