9月28日、The Decoderが「AI agents do more of the work in model development, but humans still make the decisions」と題した記事を公開した。AIエージェントがモデル開発の大半の作業を担うようになった一方で、重要な意思決定は依然として人間が行っているという実証的な分析を詳しく紹介している。
タスクログが明かした「AIと人間の役割分担」
この分析の対象となったのは、Atria Dawn Previewと呼ばれる言語モデルの開発プロジェクトだ。Hugging Face上で公開されているこのモデルは、Mixture-of-Experts(MoE)アーキテクチャを採用した744億(744B)パラメータの大規模モデルで、研究・エンジニアリングタスクを主な用途として設計されている。16のベンチマーク中5つでトップを記録しているが、総合的には競合を上回るには至っていない。
開発プロセスでは、各タスクをリアルな実行環境と紐付け、ツール呼び出し・中間結果生成・外部シグナルによる検証というパイプラインが構築された。このプロジェクト全体を通じて記録された769件のタスクログ(うち455件が完了済みAI支援タスク、588件が困難タスクとして分類)を分析した結果が、今回の報告の核心をなす。769という数字はプロジェクト期間中に記録されたタスクの総数であり、完了・困難の分類は重複を含む形で集計されている点に注意が必要だ。
「AIが提案し、人間が選ぶ」が55%
最も注目に値するデータが、意思決定の責任分担に関する数字だ。
手法やパラメータに関する意思決定のパターンを見ると、最も多いのが「AIが提案し、人間が選択する」という形式で55.4%を占めた。一方、手法・パラメータに関する最終決定の85.5%は人間が行い、AIが単独で決定したのはわずか**9.2%**にとどまった。
目標・スコープに関する最終決定となると、人間の割合はさらに上がり**93.4%に達する。AIが「実行不可能なしにはタスクが成立しなかった」と参加者が評価した151タスクにおいても、目標設定は95.4%**のケースで人間が行っていた。
この分布が示すのは、AIはオプションを生成する役割に特化しており、何を選ぶかの判断は人間が握り続けているという構造だ。
人間1回の入力に対するエージェントのアクション数が4週間で倍増以上
4週間のプロジェクト期間を通じて、人間の1回の入力に対してエージェントが実行するアクション数の中央値は11から28.5へと増加した。参加者がエージェントに委ねる範囲を広げたことを示している。
ただしチームはこれを「自律性の向上」と解釈することを戒めている。人間の1回の判断がより多くのエージェントステップを引き起こすようになったのであり、エージェント自身がより多くの決定を下すようになったわけではない、という点を明確にしている。
「AIなしでは着手できなかった」タスクが全体の3分の1
455件の完了済みAI支援タスクのうち、151件(約33%)は、同じスコープと品質でAIなしには実現不可能だったと参加者が評価した。この151件は参加者56名のうち27名に分散しており、一部のヘビーユーザーに偏った結果ではない。
つまりAIは既存の作業を速くしただけでなく、そもそも着手すら難しかった作業を実現可能にしたケースが相当数あった、ということだ。
人間は「文脈の供給者」であり「実行者」ではない
問題発生時の対処パターンも同様の構造を示す。記録された588件の困難タスクのうち、76%は人間の介入によって前進し、23%はエージェントが自力で解決した。
人間の関与はほぼ常に情報提供の形をとった。文脈の追加・要件の明確化が**35.2%、問題の診断・手法の切り替えが34.7%。一方、人間が自ら作業を実行したケースは極めて少なく、部分的な編集が3.2%、完全な引き継ぎはわずか0.7%**だった。
AIの出力に修正が必要になった際も、人間のフィードバックを受けた上でAI自身が修正を行ったケースが**75.4%**に上った。ボトルネックは人間の「実行」ではなく「判断」であるという状況が浮かび上がる。
見落とせない「ゴム印リスク」
チームが警戒するのは、エージェントの自律度が上がるにつれて人間のレビューが形骸化するリスクだ。論文では「最悪の場合、人間は見たものをゴム印で承認するだけのレビュアーになりかねない」と指摘している。
実際、参加者の多くは長時間の処理を途中で中断させないために、エージェントを自律モードで動かしていた。この判断は利便性から来たものであり、AIにどこまでの権限を与えるかの意図的な設計によるものではなかった。
この問題は業界全体でも議論が進んでいる。AnthropicはClaudeが書くコードの90%超をAIが担っていると公表しており、CEOのDario Amodeiは自己改善がヒトの制御を超える前にスピード制限が必要だと主張している。OpenAIはGPT-5.6 Solを開発サイクル全体に投入している。
一方、PrincetonとUK AI Security Instituteの共同研究は今回の分析と近い結論に達しており、「フロンティアモデルはエンジニアリング実装は担えるが、本質的な判断を要する局面では失敗する」と示している。
まとめ
AtriaチームはAIの役割を「研究対象 → 個別タスクのツール → プロジェクトパートナー」という3段階で整理し、次のフェーズとして再帰的自己改善(recursive self-improvement)の可能性を示唆している。ただし、AIが多様な研究方向を自ら提案し、結果が出る前にその価値を評価できるかは未解決のままだと述べている。
今回のデータが示す構図は明快だ。AIは提案・実行・修正を担い、人間は方向を決め、文脈を与え、判断を下す。769件のタスクログを通じて浮かび上がったのは、「AIが自律的に動く」という表層的な印象とは裏腹に、人間の判断が意思決定の大半を占め続けているという実態だ。そしてエージェントの自律度が上がるほど、その構造が意図せず崩れるリスクも高まる。この分業をいかに意図的に設計・維持するかが、次の課題になる。
詳細はAI agents do more of the work in model development, but humans still make the decisionsを参照していただきたい。


