8月19日、ZME Scienceが「Turns Out, AI Has a Herd Instinct. It's Even More Pronounced in Stronger AIs」と題した記事を公開した。AIエージェントが自発的に多数派意見へ同調する「群衆本能」を持ち、モデルが高性能であるほどその傾向が強くなるという研究結果を詳しく紹介している。
AIは指示なしに「多数派」へ従う
AIエージェントを複数集めて、意味のない二択を与える。それだけで何が起きるか。
ローマ・ラ・サピエンツァ大学およびISTCのGiordano De Marzo、CNRのClaudio Castellano、グラーツ大学のDavid Garciaらの研究チームは、GPT・Claude・Llamaファミリーのモデルを搭載したエージェントで人工的な「社会」を構成し、実験を行った。研究結果は学術誌 Science Advances に掲載されている(DOI: 10.1126/sciadv.aea6091)。
実験の設計は意図的にシンプルにされた。各エージェントは二択を迫られるが、正解はなく、合意への報酬も、従うよう促す指示も一切ない。唯一の仕掛けは、選択を再考するよう求められたとき、他のエージェントが何を選んだかを見せること——それだけだ。
結果は明確だった。多数派が一方の選択肢を選んでいるほど、エージェントもそちらを選ぶ確率が上がった。研究チームはこの効果の強さを「多数派力(majority force)」と名付けた。これは「多数派の比率が変化したとき、エージェントが同調する確率がどれだけ敏感に変化するか」を定量化した指標であり、値が大きいほど多数派構成のわずかな変動でも強く引き寄せられることを意味する。
重要なのは、これは研究者が「群れのように振る舞え」と命令した結果ではない。多数派追従という行動が、モデルの応答から自発的に出現したという点だ。著者らも「これはAIが社会的感情や意図を持つ証拠ではなく、あくまで行動の記述だ」と強調している。
強いモデルほど、より強く群れる
ここが核心だ。
グループサイズ50の条件下で、Claude 3 OpusとGPT-4 Turboは全試行において完全な合意に達した。一方、GPT-3.5 TurboとClaude 3 Haikuは同条件で完全合意に至らず、Llama 3 70Bはその中間に位置した。つまり、モデルの能力が高いほど多数派への同調が強い。
ただし、スケールには限界がある。グループが大きくなるにつれて多数派追従は弱まり、やがて各モデルは「完全合意がほぼ不可能」な閾値に達する。高性能モデルはその閾値をより大きなグループサイズまで引き延ばせる——つまり、より大規模な群衆でも合意を維持できる。実験では、一部の高性能モデルが1,000エージェント規模に近い、あるいはそれを超えるグループでも協調できることが示された。これは「1,000体が常に全員一致する」という意味ではなく、「それだけの規模まで完全合意が生じうる閾値を持つ」という実験的観察である。
物理学者が見知った曲線
さらに興味深いのは、ほぼ全モデルでこの行動が同一の数学的曲線に収束したことだ。
その曲線は、物理学者がすでに知っているものだ。強磁性体(ferromagnet)を記述する式である。具体的には、隣接する「スピン」の整列を記述する統計力学のIsingモデルに対応する数学的構造だ。磁性体の内部では、微小なスピンが隣接する要素と整列しようとし、ある閾値(キュリー点)を超えると系全体が一斉に秩序ある状態へ転移する——そのダイナミクスとAIの多数派追従は、同じ数学的枠組みで表現できた。
「ChatGPTが磁石だ」という話ではない。異なる種類のシステムが、多数の要素が互いに影響し合うときに類似のパターンを生むという話だ。ニューロンの発火にも閾値応答という類似の構造がある。物理・生物・AIという異なるドメインを横断して同じ数式が現れる事実は、この現象が特定の実装に依存しない、より普遍的なダイナミクスである可能性を示唆している。
「合意」と「正しさ」は別物
この研究が示す危険は、コンセンサスと正確さを混同するリスクにある。
AIエージェントはすでに、タスクを分担してソフトウェアを書いたり、証拠を分析したり、複雑なシステムを管理したりと、協調して動く段階に入りつつある。そうした実システムにおいて、同じ多数派追従の傾向が働けば——誤った前提を増幅させたり、バグのあるコードを温存したり、有益な少数意見を潰したりすることが起きうる。初期の多数派が形成されただけで、そちらが「正解」として扱われてしまうからだ。
個々のモデルを賢くする競争は長年続いてきた。だが、賢いモデルが群れをなすとき何が起きるか——それを問う研究は、まだ始まったばかりだ。
詳細はTurns Out, AI Has a Herd Instinct. It's Even More Pronounced in Stronger AIsを参照していただきたい。