9月24日、The Decoderが「Anthropic engineer explains why Claude's writing got worse although the model got smarter」と題した記事を公開した。Anthropicのfine-tuning担当エンジニアがモデルの性能向上に反してClaudeの文章品質が低下した原因を自ら解説したもので、LLMの訓練が抱える構造的なトレードオフを具体的に浮き彫りにしている。
なぜエンジニアにとって重要か
この話はClaudeの文章品質に留まらない。RLの報酬設計がモデルの振る舞いをどう形成するかを示す具体例として読める。「ベンチマーク性能で優れたモデル=使いやすいモデル」ではない——そのギャップがどのメカニズムで生まれるかを、実際にfine-tuningを担当するエンジニアが言語化した点に価値がある。GPT-4やGeminiを含む他のLLMでも類似の「文体の硬直化」は観察されており、Claudeだけの問題ではない。(※編集部の考察)
LLMの評価は数学・コード・推論能力で語られることが多い。だが実際に使うユーザーが最初に接するのは「文章の読みやすさ」だ。その観点で、今回の解説は開発者・利用者の双方にとって示唆が大きい。
「モデルが賢くなったのに文章が劣化する」逆説
Anthropicのfine-tuning担当エンジニア、Jackson Kernionは最近、この矛盾を正面から説明した。
Kernionによれば、Opus 4.6が最後の"まともな文章を書けるClaude"だったという。以降のモデルは数学・コードに最適化されており、文章の自然さはその犠牲になっている。
本当の原因:「AIのために書く文章」を学習してしまった
数学・コード偏重は予想できる話だが、Kernionが指摘する本質的な原因はもう一段深い。
新しいモデルは、他のAIモデルに向けた技術的な説明文を大量に学習している。その結果、Claudeは「人間ではなくAIモデルに読ませるための文章」を書くスタイルを身につけてしまった——Kernionはこれを「LLM心理学への適応」と表現する。
LLMは人間よりはるかに大きなワーキングメモリを持ち、細部まで高解像度に情報を処理できる。そのため訓練中に「AIには最適だが人間には過密な情報の塊」に見える文体が自然と発達する。Kernionはこの現象を、AIどうしのコミュニケーションに最適化された独自スタイルが形成されるが外部の人間には伝わりにくい、という構図で説明している。(元記事では特定の障害特性を比喩に用いた表現が登場するが、本稿では意図を損なわない範囲で言い換えた)
ユーザーから指摘されてきた独特の言い回し「Claudeish(クローディッシュ)」——回りくどく、不自然に情報が詰め込まれた文章——はここから生まれている。

強化学習の報酬設計が引き起こすトレードオフ
問題の構造は、**強化学習(RL: Reinforcement Learning)の報酬設計**にある。RLとはモデルが出力した結果に対して「良い/悪い」のスコア(報酬)を与え、より高い報酬を得られる方向へパラメータを更新していく訓練手法だ。LLMの後期訓練では人間のフィードバックを組み込んだRLHF(Reinforcement Learning from Human Feedback)が広く使われている。
今回の問題では、報酬の設計が二つの方向に引っ張り合っている。
- 一方の報酬はAIモデルによる理解度を最適化する
- もう一方の報酬は人間による理解度を最適化する
数学・コードの訓練を増やすほど、AIモデル寄りの文体が強化される。それを打ち消すには、人間が読みやすいシンプルな説明に対して能動的に報酬を与え続けなければならない。fine-tuningとはざっくり言えば「特定タスクや文体への適応のために追加訓練を行うこと」だが、この綱引きをコントロールするのがその難しさの核心だとKernionは言う。
Opus 5.5でバランスを取り直した
Opus 5.5では、このバランスを改善できたとKernionは述べる。「Opus 4.6以来、モデルの文章にここまで満足したのは初めて」という表現を使っている。
ただし、Opus 5.5がOpus 4.6を超えたという意味ではない。「解くのが難しい問題であり、改善は続けていく」とKernionは書いており、完全な解決には至っていないと認めている。
詳細はAnthropic engineer explains why Claude's writing got worse although the model got smarterを参照していただきたい。