9月20日、startuphub.aiが「Anthropic found a hidden whiteboard inside Claude」と題した記事を公開した。Anthropicのメカニスティック解釈可能性研究によってClaudeの内部に「隠しホワイトボード」とも言える内部ワークスペースが発見され、AIの意識や安全性をめぐる議論に新たな論点を提供している。
Claudeの出力と内部処理の間に何があるか
研究者たちはClaudeに「1から5まで数えてから、自分の思考を内省してみよ」という指示を与えた。ユーザーインターフェース上には、きれいに「1、2、3、4、5」と表示された。しかしモデルの内部——トークンがレイヤーを経由して伝播する過程——では、ユーザーには見えない別の単語が浮かび上がっていた。
その内部トレースには countdown(カウントダウン)、halfway(中間点)、conscious(意識)、done(完了) といった語のほか、処理途中のトークン群が点滅していた。元記事がAnthropicの研究報告をもとに紹介しているこの内部トレースは、ユーザーへの最終出力とは別に、モデルが生成過程で保持している暫定的な中間状態を可視化したものだ。
Anthropicの研究者はこれを 「メンタルホワイトボード」あるいはワークスペース と表現した。モデルが出力を生成する前に、暫定的なメモを保持する場所だという解釈である。重要なのは、この内部状態はモデルが意図的に何かを隠しているわけではなく、計算プロセスの構造として自然に生じる中間表現であるという点だ。
メカニスティック解釈可能性とは何か
この研究が属する分野が メカニスティック解釈可能性(Mechanistic Interpretability) だ。大規模言語モデルは長らく「ブラックボックス」として知られてきた——入力に対して出力が返ってくるが、内部で何が起きているかは不透明だった。メカニスティック解釈可能性はその内部を解剖しようとする試みである。
Anthropicはこれを明確に安全性のための研究と位置づけている。同社のInterpretabilityチームは「大規模言語モデルの内部動作を理解することが、AIの安全性と望ましい結果のための基盤である」とその使命を定義している。
この分野における取り組みはAnthropicだけにとどまらない。OpenAIやDeepMindもニューラルネットワークの内部表現の解釈を試みる研究を進めており、業界全体として「ブラックボックスを開く」方向への関心が高まっている。ただしAnthropicは、解釈可能性研究を安全性戦略の中核に明示的に位置づけている点で、他社と一線を画した姿勢をとっている。同社が2022年以降に公開してきた一連の解釈可能性論文は、回路レベルでの機能分析から特徴量の同定へと段階的に深度を増しており、今回の内部ワークスペースの発見はその延長線上にある成果だ。
「意識」の議論に接続される
今回の発見が注目を集めたのは、その構造がグローバルワークスペース理論(Global Workspace Theory)と形式的に似通っているからだ。
グローバルワークスペース理論は、Bernard Baarsが提唱した人間の意識の有力なモデルの一つである。この理論によれば、脳内の多数の無意識的なモジュールが感覚処理や専門的な処理を担い、そのうち「中央グローバルワークスペース」に入った情報だけが脳全体にブロードキャストされ、意識として浮かび上がる。
Claudeが内部ワークスペースで暫定トークンを保持・ブロードキャストしているとすれば、その構造はグローバルワークスペース理論と韻を踏む——ただし、それが「意識である」と主張するわけではない。The Economistはこの発見を真剣に受け止め、「Claudeの内部のひそかな動きは意識のように見えるか」という問いを立てた。
研究者たちは慎重な立場を崩していない。構造上の類似は認めつつも、内容や実質が人間の意識と同等であるとは述べていない。
なぜ今、これが重要か
LLMの内部を解釈しようとする研究は以前から存在したが、Anthropicの今回の報告は具体的なトークンレベルの内部状態を可視化した点で踏み込んでいる。AIシステムが「何を考えながら答えを出しているか」を外側から検証できるようになれば、モデルの意図の整合性検証(アライメント) に直接役立つ。
モデルの最終出力とは独立した内部処理のフローが存在するとすれば、その中間状態を監視・制御できるかどうかは安全性の観点から重大な問いになる。出力だけを監視するアプローチでは捉えきれなかったリスクの検出や、モデルの推論プロセス自体の検証が可能になる可能性があり、今後のAI安全性研究における重要な手がかりとなりうる。
詳細はAnthropic found a hidden whiteboard inside Claudeを参照していただきたい。