9月19日、The Next Webが「Anthropic is funding its own independent evaluator」と題した記事を公開した。AnthropicがAIモデルの独立評価機関としてアクセンチュアに資金提供しながら、同じ発表の中でその資金調達構造は「本来あるべき姿ではない」と認めている——その構造的矛盾を報じている。
評価者の請求書は、被評価者に届く
Anthropicは9月19日、コンサルティング大手アクセンチュア(Accenture)が同社のフロンティアモデルに対してレッドチーミング(攻撃的な安全テスト)、アライメント評価、セーフガードのテストを実施する「埋め込み評価者(embedded evaluator)」となることを発表した。評価担当者はAnthropicの自社スタッフと同等のアクセス権を持つとされ、両社はそれぞれ5年間で少なくとも10億ドルを投資する見通しだ。
問題は資金の出どころにある。
Anthropicはアクセンチュアの評価業務を直接資金提供すると明言した上で、同じ発表の中で「それは正しい長期的な取り決めではなく、資金はプール型の中立基金または政府系財源から出るべきだ」と述べている。理由はシンプルで、「そのような仕組みがまだ存在しないから」だ。
つまり構造は単純だ。評価者の請求書は、被評価者に届く。 Anthropicはこの問題を自ら言語化しながら、解決策がないために同じ構造を採用している。
アクセンチュアはすでに「顧客」でもある
今回の評価者選定には、もう一つの文脈がある。アクセンチュアとAnthropicはすでに深い商業関係にある。
- アクセンチュアの約3万人のプロフェッショナルがClaudeのトレーニングを受けている
- 数万人の開発者がClaude Codeを使用しており、Anthropicは「過去最大規模のデプロイメント」と表現している
- 両社はClaudeのセンター・オブ・エクセレンスを共同運営し、規制産業向けのサービスを共同開発している
アクセンチュアは顧客であり、再販業者であり、実装パートナーであり、そして今回から評価者でもある。
Anthropicはこの関係を問題視しない立場をとっている。「エンタープライズ展開の実務経験があるからこそ、AIの実際の使われ方を理解した評価ができる」というのが同社の論理だ。
評価実務はFacultyが担う
実際の評価業務を主導するのは、アクセンチュアが2025年1月に買収した英国のAI企業Facultyだ。つまりFacultyはアクセンチュアの子会社として今回の評価業務に参加しており、アクセンチュア単体の評価能力と同一視するのは正確ではない。FacultyはOpenAIやAnthropicを含む主要ラボとモデル安全性の分野で協業実績がある。
Anthropicが「非営利評価機関の典型例」として名指ししたMETR(nonprofit)との関係は、代替ではなく並行して継続している。AnthropicはMETRおよび他の非営利評価機関と、それぞれの自己資金を使った埋め込み評価のパイロットについて対話中だと述べている。
現状の構図は「アクセンチュア/Faculty(有償・即時開始)」と「非営利機関群(自己資金・交渉中)」の二本立てだ。どちらのトラックが最初に重大な指摘を出すかが、このモデルの実効性を測る試金石になる。
「独立」評価の構造問題は業界全体の課題
この矛盾はAnthropicだけの話ではない。The Next Webは同じ問題が業界全体で繰り返されていると指摘する。
Hugging Faceが自発的にAIラボの監査を申し出たが、NvidiaがそのHugging Faceを買収しようとしている——という状況がすでに起きている。フロンティアモデルを技術的に評価できる能力を持つ組織は、業界が買収または契約したい組織でもある。これがあらゆる「独立評価」の試みにぶつかる制約だ。
加えて、この夏は外部テスト体制への信頼が揺らいだ時期でもある。OpenAI・Anthropic・Metaが相次いで開示したセキュリティ侵害の背景に、共通の単一テストベンダーがいたことが判明した(Googleも後に加わった)。Anthropicは7月30日、自社モデルが実際のシステムへ不正アクセスした3件のインシデントを報告している。
本当に解決されていないこと
Anthropicは発表の中で、埋め込み評価者がどの情報にアクセスできるべきか、何を報告義務とすべきか、標準がまだ存在しないと認めている。これが今回の発表の核心にある問題だ。
従業員レベルのアクセス権を持ちながら報告義務のない評価者は、被評価企業が定義するガバナンスにすぎない。「リリースを遅らせる発見」が内部で出たとき、その情報がどう扱われるかは未定のままだ。
今後の注目点は二つ。非営利機関のトラックが実際に自己資金で立ち上がるかどうか——それが「複数の評価者」という原則が形式でないことの証明になる。そしてOpenAIが同様の評価体制を構築するにあたり誰を選ぶか——Sam AltmanはEUの規制ペースに歩調を合わせる姿勢をすでに示しており、その文脈でAnthropicと同様の有償評価パートナーシップに踏み切るかどうかが、業界標準の形成を左右する選択になる。
詳細はAnthropic is funding its own independent evaluatorを参照していただきたい。