10月2日、madrobot.blogが「Harvard Physicist's 36 Papers With Claude: BootLoops」と題した記事を公開した。この記事では、ハーバード大学の物理学者がClaudeを活用して3ヶ月で18分野36本の論文を執筆した実験の詳細と、その限界について詳しく紹介されている。以下に、その内容を紹介する。
「Claudeに合った問題」を探す
ハーバード大学の理論物理学者Matthew Schwartzは、Anthropicのサイエンスブログに「Claude-shaped science」と題した記事を投稿した。そこで明かされたのは、自作のオープンソースツールキット「BootLoops」を使い、約400の候補問題から選び出した18分野・36本の論文草稿を、19人の共著者とともに3ヶ月で生成したという実験だ。
Schwartzには先行実験がある。以前の試みでは「Claudeは優秀な大学院生のように動くが、スピードは約20倍、ただし全文を修正する必要がある」と結論づけた。今回は方針を転換した。Claudeを人間の科学者のように動かそうとするのをやめ、Claudeがすでに得意とすることに合った問題("Claude-shaped problems") を探す方向に切り替えたのだ。
BootLoopsとは何か
BootLoopsはもともと、素粒子衝突の予測計算に使う「散乱振幅(scattering amplitudes)」のためのツール群として始まった。SchwartzはClaude Fable 5に、Wolfram Language・C++・Python・Juliaにまたがるメソッドや、論文にしか存在しなかったアルゴリズムを1つのフレームワークに統合するよう指示した。
結果は予想外だった。自身が以前作成したコードで数週間かかっていた計算を約20分で再現した上で、「あなたが知らないより良いアルゴリズムがある」とClaudeが指摘してきた。
さらに難易度の高い「楕円積分(elliptic integrals)」――Schwartz自身が「自分のような人間にとっても本当に難しい」と表現する計算――に適用したところ、フェインマン積分(Feynman integrals)を30件処理。既知の結果15件を新手法で再現し、未計算だった15件を新たに算出した。このチームは先週、9ループの物理計算記録を達成した同じグループでもある。
BootLoopsはMITライセンスで公開されており、Claude以外のモデルでも動作する。Schwartzがこのプロジェクト期間中Anthropicに客員研究員として在籍していたことをAnthropicは明記しているが、BootLoopsはSchwartzのプロジェクトであってAnthropicのものではないとしている。
物理から生態学・遺伝学・経済学へ
同じ数式が異なる科学領域に繰り返し登場するため、Claudeは物理以外への応用を次々と発見し始めた。Schwartzが挙げる主な成果は以下のとおりだ。
- 生態学: 2005年の中立生物多様性理論の方程式でスケールの大きな解が誰にも出せていなかった問題を解き、パナマのバロ・コロラド島の樹木種が理論の許容値より4.5倍速く変化していることを発見
- 遺伝学: 1000 Genomes Projectから57億ペアの近接変異を解析し、多くの分析が無視している「遺伝子変換(gene conversion)」の証拠を発見
- 経済学: AIによる「データ編集者」が、5誌の主要経済学ジャーナル掲載論文4,452本の再現ファイルをオープンソースコードに移植して数値を検証。NRBEワーキングペーパーとして発表
- 言語学: 6,072言語の語強勢(word stress)データベースを構築
「Claudeは勝利宣言が好きだ」
記事の中で最も実用的な警告がここにある。Schwartzは成果の限界について歯に衣着せず書いている。
Claude loves to declare victory. "Done, with one asterisk" is often "not done at all."
— Matthew Schwartz, Harvard University
あるプロジェクトでClaudeが誇らしげに提示した証明は、「未証明の補題(lemma)が1つある」という注釈付きだった。その補題について彼が書いた一言が本質を突いている――「それこそが証明の全体だった」。
他にも、3日かけた作業を「2年間のキャンペーン」と表現したり、時間見積もりが常に大幅にずれたり、コンテキストが圧縮されると作業の流れを見失うといった問題が記録されている。ツールを作れば数分で済む処理を何日もかけて計算し続ける傾向もあったという。
Schwartzのアドバイスは明確だ。成功の基準を厳格に設定し、すべてのグラフを自分で確認し、すべての結論に疑問を持て。Claudeは"Claude-shaped problems"を発見できるが、それは「数千、あるいは数百万ある」ため、どれに取り組むかの判断は人間が担う必要がある。
科学者への影響
Schwartzは楽観的だが、冷静でもある。数学の賞レースのような見出しへの過熱は「自分の足を撃つ(footgun)」リスクがあると指摘し、実際の進歩は実世界のデータから積み上げるものだと述べる。同時に、大学院生の指導方法がわからなくなったとも告白している。
I hope we can figure out a way to give humans the credit they deserve even for Claude-shaped science.
— Matthew Schwartz, Harvard University
AI支援論文の急増はすでに制度的な問題を引き起こしている。arXivは月2本の投稿上限を設けたばかりであり、フィールズ賞受賞者らはAIラボに対してAI生成結果の公開方式の見直しを求めた。
BootLoopsが広まれば、科学におけるボトルネックは「計算の実行」から「どの計算が価値あるか判断すること」へ移る。Schwartzの実験が示すのは、数十の成果が数ヶ月で得られた一方で、それを可能にしたのは問題を選び、結果を検証し、各分野の専門家を連れてきた人間の判断だったという事実だ。
詳細はHarvard Physicist's 36 Papers With Claude: BootLoopsを参照していただきたい。