9月29日、The Next Webが「Z.ai and Concordia AI set out six stages for open-weight AI risk」と題した記事を公開した。中国のAI企業Z.aiと北京のAI安全コンサルティング企業Concordia AIが、「一度公開したら回収できない」というオープンウェイトAI固有のジレンマに正面から向き合い、6段階のリスク管理フレームワークを発表した。「オープンか、クローズドか」という二択を超えた段階的アプローチを提案している点が注目される。
オープンウェイトAIが抱える「回収不能」問題
オープンウェイトAIとは、学習済みのモデルパラメータ(重み)を誰でもダウンロード・改変・実行できる形で公開したAIモデルのことだ。MetaのLlamaシリーズやMistralが代表例として広く知られている。
Z.aiとConcordia AIが今回発表したフレームワークは、この種のモデルが抱える根本的な問題から出発している。報告書が挙げる課題は3点だ。
- 一度公開すると、回収がほぼ不可能
- ファインチューニングによって安全対策が除去される
- 重みが流出した後、開発者はモデルの使われ方を監視できない
報告書はこの点を端的に述べている。
「安全トレーニングは、少数の有害な学習例を加えるだけで無効化できる」
クローズドなモデルであれば、APIを通じた利用制限や監視が可能だ。しかしオープンウェイトでは、その手段が根本から失われる。この非対称性こそが、今回のフレームワークを必要とした背景にある。
6段階のリスク管理フレームワーク
報告書は「オープンか、クローズドか」という二択ではなく、段階的なリリースを含む6段階の管理プロセスを提案している。
①リスク識別:悪用と事故の両面からリスクを洗い出す。
②リスク閾値の設定:許容できないリスクを4つの軸で定義する。軸は「モデルの実行環境」「潜在的な悪用者」「モデルが可能にする行為」「社会がその被害を吸収できる能力」だ。
③リスク分析:開発前・デプロイ前・デプロイ後の3フェーズで実施する。
④リスク評価:モデルを「グリーン(全面公開)」「イエロー(制限付き・段階的公開)」「レッド(公開停止)」の3ゾーンに分類する。
⑤リスク軽減:モデルのライフサイクル全体にわたって保護措置を適用する。学習データのキュレーションも開発の早期から実施する。
⑥リスクガバナンス:監視体制とアカウンタビリティを明確化する。
Z.aiのモデルラインナップのひとつであるGLM-5.3が、このフレームワークの実践例として挙げられている。GLM-5.3はZ.aiが開発・公開するGLMシリーズの言語モデルで、まず審査済みのセキュリティパートナーがモデルをテストし、安全評価が完了した段階で初めて全重みを公開する「段階的リリース」を採用した。
報告書の著者らは、このフレームワークが「オープン性と安全性の間の緊張関係を乗り越えるための、初の包括的かつ証拠に基づいた基盤を提供する」と主張している。
7月発表のフレームワーク2.0との関係
今回の報告書は、上海AIラボ(Shanghai AI Lab)とConcordia AIが2024年7月に発表した「Frontier AI Risk Management Framework 2.0」の姉妹ドキュメントとして位置づけられている。前作がクローズドモデルを含むフロンティアAI全般を対象としていたのに対し、今回はオープンウェイト特有のリスクに的を絞った内容となっている。
オープンウェイトAIのリスク管理を巡っては、国際的な議論が続いている。8月には米ホワイトハウスが発表したテクノロジー戦略において、オープンウェイトAIが重要技術リストから除外されたことが話題となった。
なお元記事によれば、Z.ai自身も最近、コーディングツール「ZCode」に関するセキュリティ問題を謝罪した上でオープンソース化するという出来事があったと紹介されており、オープンウェイトとセキュリティの問題が同社にとって切実な現実として突きつけられた背景がある。
さらにZ.aiは今月、香港で50億ドルの資金調達を完了している。大規模な資本を背景にしながら、安全性の枠組み整備にも注力する姿勢は、中国発のAI企業による国際標準づくりへの参入として注目に値する。
詳細はZ.ai and Concordia AI set out six stages for open-weight AI riskを参照していただきたい。