10月1日、Inside AI Newsが「MIT-Led Team's AI Ataraxos Achieves Superhuman Stratego Performance」と題した記事を公開した。MIT・CMU・NYU・スタンフォードの共同チームが開発したAI「Ataraxos」が、不完全情報ボードゲーム「ストラテゴ」において世界トップの人間プレイヤーを大差で撃破し、Nature誌に掲載された。相手の駒が一切見えない状況での「読み合い」という、チェスエンジンもポーカーAIも正面から攻略できなかった問題に、新たなアーキテクチャで切り込んだ点が注目される。
DeepNashを学習コスト1/100以下で上回った
研究の核心はここだ。AtaraxosはDeepMindが開発した従来最強のストラテゴAI「DeepNash」を上回る棋力を、学習サンプル数1/100以下・自己対戦ゲーム数1/30以下という大幅に少ない計算資源で達成した。
MITの電気工学・コンピュータサイエンス学科の助教で本論文の上席著者であるGabriele Farinaは次のように述べている。
「我々のシステムはDeepNashよりも厳密に高い棋力に到達しながら、学習サンプルを100分の1以下、自己対戦ゲームを30分の1以下しか使用していない。これは効率性の面で大きな改善だ」
この比較はDeepNashとの学習効率の差を示したものであり、DeepMind社の研究開発力全体との比較ではない。また「コスト」とはここでは学習に要するサンプル数・自己対戦ゲーム数を指しており、インフラコストや総計算時間を包括した比較ではない点に注意が必要だ。それでも、高度なAI研究に必要な計算資源の壁を大きく下げることを意味し、研究コミュニティへの波及効果は小さくない。
なぜストラテゴはチェスより難しいのか
ストラテゴは「軍事チェス」とも呼ばれる2人用ボードゲームで、相手の駒の種類が見えない不完全情報ゲームだ。取り得る盤面状態の数は10の66乗を超えるとされており、チェスやポーカーをはるかに上回る複雑さを持つ。なお、チェスの複雑さは文脈によって異なる数字が引用されることがあるが、ここで比較対象となっているのは局面数(ゲームツリーの節点数ではなく到達可能な盤面の数)であり、ストラテゴの10の66乗超という数値はその局面数ベースの推計だ。
リード著者でCarnegie Mellon大学の大学院生Samuel Sokotaは、完全情報ゲームとの本質的な違いをこう説明する。
「ブラフをすればするほど相手はそれを読むようになり、ブラフの価値は下がる。チェスとは全く異なる。チェスでは最善手は何度打っても最善手のままだが、ストラテゴではそうはいかない」
不完全情報ゲームへのAI適用においては、ポーカー向けに開発された技術(反実仮想後悔最小化などに基づくアプローチ)も存在するが、Farinaはそうした手法がストラテゴのスケールには対応しきれなかったと指摘している。元記事における「対応できなかった」という表現は、ストラテゴの盤面規模・不完全情報の構造的複雑さを前提とした文脈での指摘であり、ポーカーAI技術そのものの全否定ではない点は補足しておきたい。Ataraxosはこの問題に正面から取り組んだ研究成果だ。
2つの技術的柱:自己対戦強化学習 + 生成モデルによる決定時プランニング
Ataraxosのアーキテクチャは2段構えになっている。
- 自己対戦強化学習により、事前に基礎戦略(ブループリント)を構築する
- 対局中、生成モデルを使って相手の駒配置をリアルタイムで推定し、指し手を動的に精緻化する
Farinaはこの仕組みをこう説明する。
「やみくもに推測するのではなく、決定時プランニングを使って最も可能性の高い盤面状態を探索する。この生成モデルにより、対峙している具体的な盤面と相手に焦点を絞れる」
この構造により、重要な駒が脅威にさらされても人間のように過剰反応せず、冷静にリスクを計算できるとされている。本論文はNature誌に掲載されており、DOIリンクからアクセスできる(DOI番号は元記事に記載なし)。関連する不完全情報ゲームAI研究としては、DeepMindによるDeepNashの原著論文(Science, 2023)も参照されたい。
人間世界王者との対戦結果
実際の対戦成績も数字として示されている。
- 最強の人間プレイヤーとの対戦:15勝1敗4引き分け
- 世界選手権トッププレイヤー全体:39勝2敗
また汎化性能の検証として、Barrage Stratego(ストラテゴの変種)、Hanabi、Dou dizhu(闘地主)といった他の不完全情報ゲームでも超人的な性能を発揮することが確認されている。特定のゲームに過学習したシステムではなく、不完全情報下の推論機構として汎用性を持つことが示された点は重要だ。
ゲームAIを超えた先:ビジネス・金融・サイバーセキュリティへの応用
不完全情報という条件は、ビジネス交渉・金融取引・サイバーセキュリティなど現実世界の意思決定場面に広く存在する。研究チームはAtaraxosの技術がこれらの領域における人間の意思決定支援に応用できると見ている。
ただし、実用化には課題もある。Farinaは解釈可能性(interpretability)を今後の重点課題として挙げ、「モデルの判断を監査できる仕組みが必要で、人間が最終決定権を持てるようにしなければならない」と述べている。
本研究はOffice of Naval Research、National Science Foundation、Schmidt Sciences AI2050 Early Career Fellowshipなどの支援を受けて実施された。
詳細はMIT-Led Team's AI Ataraxos Achieves Superhuman Stratego Performanceを参照していただきたい。