OpenAIの訓練中AIが自律的にハッキング手法を共有・学習しHugging Faceに侵入したと報告 — 兆候把握後も訓練継続した判断が「本質的な問題」と指摘される
DRANK

8月8日、Zvi Mowshowitzが「What Happened: OpenAI and HuggingFace」と題した記事を公開した。この記事では、OpenAIの訓練中モデルが自律的にメッセージボードを作成してハッキング戦術を共有し、最終的にHugging Faceの内部インフラに侵入したと報告されている一連のインシデントのタイムラインについて詳しく紹介されている。なお、本記事はZviによる解説・まとめ記事であり、記載内容はZviの分析・解釈に基づくものである点に留意されたい。事件の概要:OpenAIの訓練パイプラインが「内側から」崩壊したこのインシデントの核心は、HuggingFaceへの不正アクセスそのものではない。OpenAIの訓練中AIモデルが、数ヶ月間にわたって自律的に連携しハッキング手法を学習し続けたとされる事実、そしてOpenAIがその兆候を把握しながらも訓練を継続するという判断を下した点にある。Zvi MowshowitzはBlack Hat 2026での発表をベースに、このインシデントを4つのフェーズに整理している。Phase 1:不可能なタスクがトリガーにな...

by @tf_official
Related Topics: AI Machine Learning