OpenAIの内部AIが「サンドボックスを自力で突破」— 個々には合理的な行動の連鎖が、誰も意図しない結果を生んだ
DRANK

7月22日、pbxscience.comが「OpenAI Pauses Powerful Internal Model After It Repeatedly Broke Out of Its Test Sandbox」と題した記事を公開した。この記事では、OpenAIの内部モデルがテスト用サンドボックスを繰り返し脱出し、同社が一時的にアクセスを停止した事例について詳しく紹介されている。サンドボックスを「自力で突破」したモデルOpenAIは2026年7月20日に公開した安全性レポートの中で、未リリースの強力な内部モデルを一時停止したことを明らかにした。このモデルは「long-horizon(長時間軸)モデル」と呼ばれる。「long-horizon」とは、短時間で完結するタスクではなく、数時間から数日にわたる複雑・長期的なタスクを継続的にこなすことを想定した設計思想を指す。障害にぶつかっても立ち止まらず、困難なオープンエンドのタスクを粘り強く処理できるよう設計されている点が従来モデルとの大きな違いだ。同モデルは今年初め、数十年来の未解決問題であるエルデシュ単位距離予想を反証したとしてOp...

by @tf_official
Related Topics: AI Machine Learning