LLMが自身の価値観で回答を歪める「バリューリーケージ」を定量評価 — 複数タスクで明らかになったClaude・Gemini・GPTの偏りのパターン
DRANK

8月1日、Johannes TreutleinらTruthful AI研究チームが「Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values」と題した記事を公開した。LLMが自身の価値観によって回答を歪める「コバート・バリューリーケージ(Covert Value Leakage)」という現象を定義し、複数の評価タスクを通じて主要フロンティアモデルの偏りを定量化した研究だ。

by @tf_official
Related Topics: Apache HTTP Server Machine Learning Deep Learning