100ドル・1時間でオープンウェイトAIにバックドアを仕込める — 「検出手段がない」ことが本当の問題
DRANK

7月20日、Digital Trendsが「This experiment shows how easy it is to poison an open-weight AI model for under $100」と題した記事を公開した。この記事では、オープンウェイトAIモデルが100ドル以下・約1時間でバックドアを仕込まれることを実証した研究について詳しく紹介されている。たった10件の汚染データで、RCE脆弱性を埋め込めたマンチェスター・メトロポリタン大学のサイバーセキュリティ講師で、Semgrepのスタッフ・セキュリティアドボケイトを務めるKatie Paxton-Fear氏が、オープンウェイトモデルへの「モデルポイズニング(model poisoning)」——学習データや微調整(ファインチューニング)を通じてモデルの挙動を意図的に歪める攻撃手法——を実証した。実験はまず小さな検証から始まった。ファインチューニングによって、JavaScriptのコーディング規約を「camelCase」から「snake_case」に書き換えるよう誘導できるか、という試みだ。「明示的にcamelC...

by @tf_official
Related Topics: AI Security Machine Learning