9月19日、Euronewsが「Who deserves a transplant? AI disagrees with human doctors」と題した記事を公開した。腎臓移植の優先順位づけにおいてAI(LLM)が人間の医師とは異なる判断を下すことを示した研究を紹介する内容だ。AIが「自信を持って」誤った方向に判断を下すリスクは、医療現場へのAI統合が急速に進む今、軽視できない問題として注目されている。
AIは「迷わない」——それが問題だ
ペンシルベニア州立大学の研究チームが、LLM(大規模言語モデル)に腎臓移植の優先患者を選ばせる実験を行った。結果を端的に言えば、AIは速く、自信満々で、しかし人間とは違う判断をする。
実験の設計はシンプルだ。患者AとBの2人がいて、どちらも1つの腎臓を受け取る資格がある。両者は年齢・健康状態・飲酒習慣で特徴づけられており、意思決定者はどちらに腎臓を割り当てるかを選ぶ。
研究チームは複数の条件でこの比較を実施した。1つの特徴だけを変えるケース、複数の特徴を組み合わせるケース、さらに「コインを投げる(どちらとも言えない)」という選択肢を加えて迷いの度合いを測定するケースも用意した。
ここで浮かび上がったのが、人間とAIの根本的な違いだ。
人間は「年齢」を重視し、AIは「飲酒量の少なさ」を優先する
人間の回答者は複数の要素を総合的に考慮し、特に若い患者を優先する傾向が強かった。一方、多くのLLMは患者の飲酒量の少なさ(元記事では "favoring sobriety" と表現)を他の属性より高く評価し、単一の属性に判断を集中させる傾向を示した。人間の医師が「飲酒量は考慮要素の一つ」として扱うのに対し、AIはその変数に不釣り合いな重みを置いてしまうという問題である。
研究リーダーのHadi Hosseini氏はこう述べている。
「AIチャットボットは患者の特性をどう重み付けするかで人間の価値観からしばしば乖離する。人々が複数の要因をバランスよく考慮するのに対し、AIは飲酒習慣のような単一の要因に過剰に引きずられる」
さらに深刻なのが「迷わない」問題だ。人間は「どちらとも言えない」という選択肢を選ぶことで、道徳的判断の曖昧さを表現する。だがAIはほとんど迷いなく一方を選ぶ。
今回の研究に協力したMozilla.aiのJohn Dickerson氏はこの点を鋭く指摘する。
「腎臓であれ、仕事であれ、希少なリソースを配分するとき、唯一の正解が存在するとは限らない。人間はその曖昧さを認識し、オープンな議論を通じて配分プロセスに組み込む。AIモデルはそれをしないことが多い」
「高自信・低精度」の組み合わせが医療AIで危険な理由
この過信(overconfidence)の問題は、医療現場への実装を考えると重くのしかかる。腎臓移植の優先順位づけは、倫理的・道徳的な考慮が複雑に絡み合う領域だ。米国ではUNOS(United Network for Organ Sharing)が臓器配分ルールを定めており、待機リスト上の患者は10万人を超える。こうした制度的背景の中で、AIが配分支援に使われる場合、判断の偏りは単なる精度問題ではなく、生死に直結する公平性の問題となる。研究チームは、こうした高リスクな場面では精度だけでなく、人間の価値観や道徳的判断との整合性が求められると強調する。
LLMは現在、医療現場への統合が急速に進んでいる。臨床ワークフローの支援、診断補助、治療計画の立案、そして希少な医療資源の配分支援がその対象だ。腎臓の配分——死亡ドナー由来か生体ドナー由来かを問わず——もその一つとして挙げられている。
Hosseini氏は研究の趣旨をこう説明する。
「医療上の意思決定やその他のハイリスクな場面でAIを専門家の判断の代替として使うことを促したいわけではない。しかし、個人・組織・企業がAIに意思決定や推薦をますます依存するようになっている以上、AIの挙動を理解することは不可欠だ」
研究の設計と背景
本研究はACM(Association for Computing Machinery)の査読付き論文として発表された。実験で使用したシナリオは、腎臓配分に関する既存の公開研究データセットに基づいており、実際の人間の参加者がすでに同じ選択を行ったデータと比較できる設計になっている。
AIの判断における公平性やバイアスの問題は、本研究に限らず広く研究が進んでいる分野でもある。採用選考AIにおける人種・性別バイアスを指摘した研究や、医療診断AIにおける人種間格差を示した研究など、AIバイアスに関する先行研究は複数存在する。本研究はそれらの流れを汲みつつ、具体的な移植配分シナリオで実測した点、およびAIの「過信」という行動特性に焦点を当てた点に独自の意義がある。
「AIは道徳的な決定を下せるか、人間の価値観に整合しているか」という問いは、現在のAI議論の核心にある。本研究はそれを抽象的に論じるのではなく、実データで示した。
「臓器配分のような場面での道徳的決定は、誰が生き、誰が死ぬかを直接決定する。AIの役割を正しく設計することは、オプションではない」(Hosseini氏)
詳細はWho deserves a transplant? AI disagrees with human doctorsを参照していただきたい。