9月26日、パキスタンの大手英字紙・The News(※OpenAI公式メディアではなく報道機関)が「OpenAI's own data shows AI automates execution, not decisions」と題した記事を公開した。OpenAIが社内で収集・公開した研究者の行動データをもとに、「AIは実行作業を自動化するが、意思決定は自動化しない」という傾向を定量的に分析した内容だ。
背景:OpenAIはなぜこのデータを公開したのか
OpenAIは2025年1月下旬から8月上旬にかけて、自社の研究者がAIツールをどのように活用しているかを社内で追跡・計測した。公開の目的は、AIが研究開発プロセスをどの程度、どの領域で加速しているかを定量的に把握することにある。
計測指標はAIによる支援アウトプット量(トークン数)で、「研究者1人・1日あたり何トークン分の出力をAIが補助したか」をタスク種別ごとに集計している。トークンとは、AIモデルが文章を処理する際の最小単位であり、おおむね英語で1単語≒1〜2トークンに相当する。出力トークン数が多いほど、そのタスクへのAI関与度が大きいと解釈できる。
The News の報道は、OpenAIが公開したこの内部データを引用・分析した二次報道であり、OpenAI公式のプレスリリースや研究論文とは性質が異なる点に留意されたい。
AIが最も得意とする仕事、最も苦手な仕事
AI支援による出力増加が最も大きかったのは以下の作業だ:
- 研究・インフラコードの作成:198,200トークン/日
- 技術的なヘルプとレビュー:158,800トークン/日
- 実行・モニタリング・デバッグ:133,100トークン/日
- 実験結果の分析:40,200トークン/日
これらはいずれも「コードが動くか動かないか」「バグが直ったかどうか」のように、成否が客観的に判断できるタスクである。AIは明確な正誤基準があるタスクに対して、大量かつ高速なアウトプットを生成しやすい。
意思決定タスクはほぼ動かない
対照的に、判断や優先順位付けを伴うタスクへのAI関与は極めて小さい:
- 研究・実験の計画立案:5,100トークン/日
- 何に注力するかの決定:2,300トークン/日
- 計算・人員配置の意思決定:1,500トークン/日
- 作業を継続するか停止するかの判断:200トークン/日
注目すべきはこの分布の形状だ。上位カテゴリ(コード作成:198,200)と下位カテゴリ(継続/停止判断:200)の差は約990倍に達するが、これはあくまで両極端の比較である。中間に位置する「実験結果の分析」(40,200)と「何に注力するかの決定」(2,300)の差でも約17倍あり、実行系と意思決定系の乖離は分布全体を通じて一貫している。
OpenAI自身の記述でも、「研究の優先順位付け、プロジェクトの追求価値の評価、システムのスケールアップ・ダウンの判断は、依然として人間が行っている」とされている。
なぜこの差が生まれるのか
この非対称性には構造的な理由がある。コードの実行やバグ修正は客観的な成功基準が存在するため、AIが自動化しやすい。テストがパスするか否か、エラーログが消えるか否か——結果が明示的にフィードバックされる領域では、AIは人間の数倍から数十倍のスループットを発揮できる。
一方、チームが何を作るべきか優先順位を決める作業には、組織の戦略的文脈、リソース制約、不確実なリターンの見積もりといった、定式化しにくい判断が必要だ。正解が事前に存在しないタスクは、現時点のAIが最も不得意とする領域である。
言い換えれば、AIは「いかに速くやるか」には強いが、「そもそも何をやるべきか」には弱い。
エンジニアのキャリアへの含意
このデータが示すのは、実行系スキル(コーディング、デバッグ、モニタリング)の市場価値が相対的に低下していく一方で、判断・優先順位付け・トレードオフの意思決定というスキルの希少性が増すという構図だ。
OpenAIのデータは「AIは実行を自動化する」という一般論を裏付けるだけでなく、その自動化がどの程度のスピードで、どのタスクから進むかを定量的に示している点で、キャリア設計やチーム編成を考えるうえで具体的な根拠になる。今後、実行作業の自動化が加速するほど、残る人間の仕事の中心は「何をすべきかを決める」ことに収斂していく。
その能力をどう鍛え、どう組織の中で発揮するかが、エンジニアとしての差別化軸になるだろう。
詳細はOpenAI's own data shows AI automates execution, not decisionsを参照していただきたい。