10月3日、The Decoderが「Open-source "BootLoops" harness supports AI models in performing precise scientific calculations」と題した記事を公開した。ハーバード大学の物理学者がAnthropicのClaudeを活用して開発したオープンソースの科学計算ハーネス「BootLoops」が、3ヶ月間で18分野・36本の論文原稿を生成した。なかには生態学で20年間解けなかった方程式を大規模に解くという成果も含まれる一方、モデルが早まって「完了」を宣言する問題など、実用上の限界についても率直に記述されている。
「Claudeの形に合った問題」を探す
ハーバード大学の物理学者でAnthropicのVisiting研究者(訪問研究者)でもあるMatthew Schwartz教授は、ClaudeをAIに向いている「Claude-shaped problems(Claudeの形に合った問題)」に絞って使うアプローチを提唱する。人間研究者の代替として使おうとするのではなく、AIの得意領域に合った課題を探すという発想だ。
この考え方から生まれたのが、オープンソースの科学計算ハーネス**BootLoops**だ(ソースコードはGitHubで公開中)。
Schwartzは「凸包(convex hull)」の概念を使って、AIが科学に貢献できる領域を説明する。凸包とは、複数の点を包む最小の凸形状を指す幾何学的概念で、ここでは「各分野の人間知識が届く範囲」の比喩として使われている。人間の知識は各分野がそれぞれの方向に伸びているが、分野間の「空白地帯」は誰も探索していない。あるラボが20年間、単一の遺伝子群を単一の手法で研究し続け、隣接する遺伝子や別のアプローチには手が届かない、というような状況だ。BootLoopsはその空白を埋めることを狙っている。

人間の知識が各分野に伸びる一方、分野間の空白は未踏のまま残る。BootLoopsはその空白を埋めるように設計されている。| 画像:Anthropic経由
3ヶ月で18分野・36本の論文原稿
実験の規模感がまず目を引く。3ヶ月間で、19名の共著者とともに18分野にわたる36本の論文原稿を生成した。
出発点は素粒子物理学の計算、具体的には散乱振幅と楕円積分だった。散乱振幅(scattering amplitudes)とは粒子同士の衝突・相互作用の確率を記述する量で、楕円積分(elliptic integrals)はその計算過程で頻出する特殊関数の一種だ。数週間でClaudeはBootLoopsを使って30個の積分を計算し、うち15個は既知の結果の再現、残る15個は初めて計算されたものだった。
特に印象的なのが生態学での成果だ。Claudeは中立生物多様性理論(Neutral Theory of Biodiversity)に関する、20年間解けなかった方程式を大規模に解くことに成功した。中立生物多様性理論は、1970年代にMacArthur & Wilsonらが島の生物地理学の研究で基礎を置き、2001年にHubbellが定式化した生態学の重要理論で、生物種の多様性や分布を個体ベースの確率モデルで説明しようとするものだ。その結果をデータに適用すると、パナマ運河のバロ・コロラド島における樹木の種構成が、理論の予測より4.5倍速く変化していることが判明した。生態学者James O'Dwyerがこの知見を受けてより優れた予測モデルの構築へとつなげた。
集団遺伝学では、1000 Genomes Projectから57億の変異ペアを解析し、「遺伝子変換(gene conversion)」と呼ばれるメカニズムの証拠を発見した。
経済学分野では、学術誌の4,452件の再現パッケージを自動チェックするAIデータ編集ツールを構築し、NBERワーキングペーパーとして発表した。言語学では3名の言語学者とともに6,072言語をカバーする単語アクセントデータベースを構築した。
「Pythonエンジニアリング入門はもはや不要」
Schwartzが示す変化の速さも、エンジニアにとって他人事ではない。以前なら「必須」と評価していた「エンジニア向けPythonコース」が、今日では「不要」だとSchwartzは言う。Claudeがその役割を担えるからだ。物理現象の研究に使うMLモデルの構築も同様で、ニューラルネットワークの深い知識があっても、Claudeが最新のML研究を即座に実装できる今、その優位性は限定的になっている。
なぜ3年間の研究助成金を申請してある計算に投資するのか、AIが一晩で解くかもしれないのに――という問いは、研究資金の調達や博士課程の育成という仕組みそのものへの疑問につながっている。
「必ず自分で全部確認せよ」
一方で、Schwartzはモデルの弱点についても率直に記述している。
- Claudeは早まって「完了」を宣言しがちで、「ほぼ完了、1点だけ」は「全然完了していない」を意味することが多い
- タスクにかかる時間の見積もりが甘い
- 洗練された解法よりブルートフォース(力技)に頼る傾向がある
- 自動チェックは信頼性に欠け、計算が正しくても結論が誤っていることがある
- 古くて引用数の多いトピックに引き寄せられ、真に新しい問いを立てにくい
- プロジェクト全体として計算コストとトークン消費が大きい
また、Schwartzは大規模数学問題の解決に関する過熱した報道(OpenAIが長年の未解決数学問題を解いたという話題など)にも警戒感を示す。過剰な期待は、現時点で実際に機能する応用から注意をそらすリスクがある。科学的方法論そのものが脅かされているわけではなく、人間の方向付けとセンスは依然として不可欠だと述べている。
詳細はOpen-source "BootLoops" harness supports AI models in performing precise scientific calculationsを参照していただきたい。