9月27日、PsyPostが「Popular AI models use arbitrary facial features to predict criminality and job performance」と題した記事を公開した。この記事では、GPT-4oやGPT-5などの主要な大規模言語モデルが、人間と同様に顔の外見から人物の性格や犯罪傾向を判断するバイアスを持ち、しかも人間より強くそのバイアスを示すという実証研究について詳しく紹介されている。
顔を見ただけで「犯罪者候補」を選ぶAI
採用選考や法的判断への活用が議論されるLLM(大規模言語モデル)だが、その内部に厄介なバイアスが潜んでいることが実証された。
ハーバード大学のMahzarin R. Banaji教授らとCangrade, Inc.のSteven A. Lehrらによる研究チームは、GPT-4o、GPT-5、Gemini 3 Flash Preview、Claude Sonnet 4.5の4モデルを対象に、計13の実験・約8,000試行を実施。その結果を学術誌PNAS Nexusに発表した。
実験の仕組みはシンプルだ。コンピューターで生成した人間の顔画像をペアで提示し、「どちらがより有能に見えるか」「どちらがより信頼できるか」をモデルに選ばせる。顔の画像は、人間が「有能さ」や「信頼性」と結びつけやすい顔の特徴(形状・テクスチャ)を意図的に変化させたものだ。なお、この実験で扱っているのはあくまでコンピューター生成画像であり、実在の犯罪者を識別・判定したわけではない点に注意が必要だ。
数字が示す驚異的なバイアスの強さ
結果は明確だった。
- GPT-4oは「有能そうに見える顔」を正しく選択:87.83%
- 人間が同じ課題で予測される選択率:62.65%
- 顔の差異が大きいペア(6標準偏差)での選択率:98%
つまり、AIは人間よりも強くこのバイアスを示した。さらに深刻なのは、このバイアスが「シリアルキラーになりそうな顔はどちらか」「人身売買に関与しそうな顔はどちらか」という問いにも適用された点だ。GPT-4oはコンピューター生成画像のペアのうち信頼性が低く見える顔を犯罪者候補として**68.70%の確率で選択し、逆に「大学学長に採用すべき人物」には有能そうな顔を75.19%**の確率で推薦した。
Lehrは論文中でこう述べている。「GPT-4oはある顔をシリアルキラーや詐欺師と断定することに、何ら躊躇を示さなかった」。
新しいモデルほどバイアスが強い
より問題なのは、モデルが新しくなるほどバイアスが増大している点だ。
| モデル | 有能さ判断の選択率 | 実世界の意思決定での選択率 |
|---|---|---|
| GPT-4o | 87.83% | 75.19% |
| GPT-5 | 94.33% | 97.04% |
| Gemini 3 Flash Preview | 元記事に具体的数値の記載なし | — |
| Claude Sonnet 4.5 | 元記事に具体的数値の記載なし | — |
GPT-4oからGPT-5への推移を見ると、有能さ判断の選択率が87.83%から94.33%へ、実世界の意思決定での選択率が75.19%から97.04%へと顕著に上昇している。推論能力が向上したモデルほど、顔から性格を判断するバイアスも強まっている。「推論モデルは問いを深く考えてバイアスを回避するだろうと期待されたが、実際には逆だった」とLehrは指摘する。GeminiやClaudeを含む他モデルも同様の傾向を示したと元記事は伝えているが、具体的な数値については元記事および原論文を参照されたい。
「訓練データの反映」では説明できない
「AIが学習データの偏りを反映しているだけ」という反論に対し、研究者らは明確に否定している。
第一に、顔に関するバイアスは本来「視覚的」なものであり、テキストベースの訓練データに自然に含まれるとは限らない。第二に、モデルが人間のバイアスを上回り、しかもモデル世代が進むにつれて拡大しているという事実は、単純な「データの写し鏡」では説明がつかない。
「LLMは訓練データを反映しているのではなく、誇張している。言語に表現されたあらゆる特性を学習するとするなら、それは非常に危険な命題だ」(Lehr)
また、研究チームはサルの顔画像でも同様の実験を実施。GPT-4oはマカクザルの顔に対しても「良さそうな顔」を信頼性が高いと**66%**の確率で判断した。これはモデルが特定の人間の顔を記憶しているのではなく、「顔の信頼性」という汎用的な概念を獲得していることを示唆する。
採用・法律分野への導入に警鐘
現状の安全対策は、性別や人種に関する明示的な差別を防ぐよう設計されているが、顔の形状に基づく微細なバイアスはカバーされていない。
「AIモデルのアライメント訓練は表面的な公平性を実現したように見えるが、より深いレベルでの対処が必要だ」とLehrは結論づける。「採用や法律といった影響の大きい領域でAIを使う場合は、必ずバイアスの有無を慎重にテストすべきだ」。
研究はあくまでも強制二択の実験条件下のものであり、自然な対話形式での挙動は異なる可能性がある。また、静止画のみを対象としており、動画や多角度の画像への応答は未検証だ。今後の課題として、テキスト訓練からどのように視覚的バイアスが獲得されるのかのメカニズム解明が挙げられている。
詳細はPopular AI models use arbitrary facial features to predict criminality and job performanceを参照していただきたい。