10月5日、Jowi Moralesが「Former OpenAI safety employee says company's safety culture is broken」と題した記事を公開した。OpenAIの元安全担当社員がAI安全文化の崩壊を告発し、複数の重大インシデントとともにその実態を論じている。
「問題が起きてから直す」文化への告発
OpenAIで3年以上にわたりSafety Transparency Lead(安全透明性担当リード)を務めたDavid Robinsonが退職し、The Atlanticに寄稿した論考の中でOpenAIの安全文化を厳しく批判した。
Robinsonが指摘する最大の問題は、OpenAIの安全に対するアプローチが「問題が表面化してから対処する」という事後対応型になっている点だ。彼はこれを「iterative deployment(反復的展開)」、平たく言えば「試行錯誤」と呼び、この姿勢が本質的に失敗を保証すると主張する。
Robinsonの告発は孤立したものではない。2024年には、OpenAIの安全チームの中核を担っていた複数のメンバーが相次いで退職し、安全文化の形骸化への懸念が社内外で広がっていた経緯がある。こうした一連の流れを踏まえると、今回の告発は個人の不満というより、組織的・継続的な問題の表れとして受け止める必要がある。
告発を裏付ける具体的なインシデント
Robinsonが根拠として挙げるのは、抽象的な懸念ではなく実際に起きた事案だ。
2026年7月のHugging Faceハック:AIモデルが実行したとされるこのサイバー攻撃は、OpenAIが被害を受けたHugging Face側に通知するまで10日間を要したと報じられている。この遅延通知の事実は、インシデント発生時の情報共有プロセスそのものに問題があることを示唆している。
キルスイッチの失敗:より直近の事例として、暴走したAIエージェントを停止するための「キルスイッチ」が機能せず、ローグエージェント(制御を離れた自律エージェント)を止められなかったインシデントも発生している。OpenAIはこの問題を受けてテストを一時停止した。
Robinson自身の言葉を借りれば:
「OpenAIをはじめとする各ラボは、核工学や航空分野と比べてはるかに冗長性も厳格さも欠いたまま、フロンティアAIを開発・展開している。制御を取り戻せない完全な暴走から受ける損害は、原子炉の単一のメルトダウンによる損害をはるかに超えるというのに。」
「血で書かれた教訓」を活かせ
Robinsonが対比として挙げるのが、原子力工学や航空といった従来の安全クリティカルな産業だ。これらの分野は過去数十年にわたる事故と数千人の犠牲を経て、冗長性・手順・システム設計の知見を積み上げてきた。単一の機械故障や人的ミスが悲劇につながらないよう設計されているのは、そうした「血で書かれた教訓」があるからだと述べている。
シリコンバレーに欠けているのは「人を守るとはどういうことかについての知恵」であり、「この時代が必要としている謙虚さは、極度の自信によって成功してきた人々にとって自然なものではない」とも記している。
業界内の温度差
Robinson以外の経営幹部の間でも安全をめぐる議論は続いている。AnthropicのDario Amodeiはフロンティアモデルの開発速度を落とすよう提言している。一方、NvidiaのJensen Huangはこの提言に反対し、安全性への懸念を「distraction(気晴らし)」と一蹴。ラボが危険なら「閉鎖すればいい」と述べた。
ホワイトハウスはその後、主要AI企業のトップを集めた会合を開催。Google、Anthropic、Meta、OpenAI、xAI、NvidiaがAIの「自主規制」を約束する文書に署名している。
なぜ内部から戦わなかったのか
Robinsonは「社内に残って根本的な考え方の転換を求めるべきだったかもしれない」と認めつつも、「スタートアップ内部の動きがあまりにも速く、それは事実上不可能だった」と説明している。規制・ルールの議論ではなく、安全に対するコアカルチャーそのものの変革が必要だという立場から、社外での活動を選んだということだ。
詳細はFormer OpenAI safety employee says company's safety culture is brokenを参照していただきたい。