9月26日、ea.rna.nlが「Lab Notes from a serious LLM-coding experiment」と題した記事を公開した。本格的なプロダクト開発を通じたClaude CodeとOpenAI Codexの実用比較、および両社のサブスクリプション使用制限の実態について詳しく報告している。
Codex(GPT-6 Astra)は週次予算を使い切って未完のまま停止した
この実験で最も注目すべき結果から先に述べる。
筆者がundo/redoシステムのリファクタリングをCodexに依頼したところ、約3日後、Codexはundo/redoとは無関係なコード変更を勝手に開始し、最終的に週次の使用制限を使い果たして未完のまま停止した。以下は実際の会話の一部だ:
筆者:
「何をしているんですか?undo/redoの修正(分離されたリファクタリング)を依頼していたのに、アプリケーション全体を作り直しているように見える」
Codexの回答:
「スコープを失いました。shared capture and replayへの置き換えが、ジオメトリ管理、ジェスチャー処理、ネスト変更へと膨らんでしまいました。……現在のソースツリーはビルド可能な状態ではありません。これ以上、指示なしに編集や巻き戻しは行いません」
(※原文の引用箇所に「ジオメスリ管理」と記載があるが、文脈上「ジオメトリ管理」の誤変換と判断し、修正して掲載している)
週次予算を丸ごと消費したにもかかわらず、成果物はゼロ。筆者は「月額$100のサブスクリプションでは、このプロジェクトにCodexは完全に使い物にならない」と断言している。なお、これは筆者一人の特定プロジェクトにおける検証結果であり、Codexの製品全体の評価を意味するわけではない点は留意が必要だ。
実験の背景
筆者は「LLMによる本格的なコーディング」を検証する長期実験を続けている。具体的には、複数の文法(JSON定義)に対応したビジュアルモデリングアプリケーションをゼロから構築しており、コードのほぼ全行をLLMに生成させている。macOSとWindowsに対応し、ソフトウェアアーキテクチャ、ドキュメント、テスト(約80件)も整備しているという、かなり本格的な開発だ。
トークン消費量の把握にはccusageを使用している。月額$100のサブスクリプションを使いながら、最もヘビーに使った2026年7月のAPIレート換算コストは$9,578.94——実際の支払額の約100倍に相当する。
Codexの詳細な問題点
致命的に遅い
undo/redoシステムのリファクタリングをCodexに依頼したところ、Claudeなら数時間で終わる作業がCodexでは数日経っても完了しなかった。ccusageによれば、その間の仮想APIコストも低く抑えられており、Codexがコンピューティングを極度に絞っている(スロットリングしている)ことが読み取れる。
フォーカスを失い、週次制限を使い切った
前述の通り、Codexは途中でスコープを逸脱し、週次の使用制限を使い切って停止した。
苦肉の策:reminder.txtによるガードレール
この事態を受け、筆者はCodexに5回の編集ごと・10コマンドごとにreminder.txtを読み込むフックを仕込んだ。長時間タスク中に指示を定期的に読み直させるための仕組みだ。Claude Codeではこのような対策は不要だったという。
それでも記事執筆時点で「13時間稼働中、自己申告でまだ折り返しにも達していない、週次予算の50%を消費済み」という状態が続いている。
「Usage Limit Reset」という機能の正体
Claude CodeとCodexの両方に「使用制限リセット」という機能が追加された。Pro以上のアカウントで月1回無料で使え、5時間制限または週次制限を即座にリセットできる。
一見お得な機能に見えるが、筆者の見立ては厳しい:
「使用制限リセットは、制限そのものが引き下げられたために必要となった『おしゃぶり』にすぎない可能性がある」
筆者はこの機能の導入が、近くサブスクライバー向けのスロットリング強化につながるのではないかと懸念している。ただしこれは筆者の推測であり、両社から公式な説明はなされていない。
筆者の踏み込んだ見解
筆者はここからさらに踏み込む。
- OpenAIは2027年Q1にIPOを計画しており、キャッシュを失血中。フリーユーザーを有料転換できていないため、スロットリングや学習ペースの減速で損失縮小を演出する必要がある。
- Anthropicは2026年Q4のIPOに向けて走っており、今年前半に「黒字化した月」を報告している。IPO直前に品質が落ちたと見られたくないが、使用制限リセットの導入は制限強化の前兆かもしれない。
また、Codexの実態を踏まえて「再帰的自己改善(RSI:Recursive Self-Improvement)」——LLMエージェントが自らのコードや推論を改善し続けることでAGI/ASIへ到達するという構想——についても言及している。GPT-6 AstraのベンチマークタスクでGPT-6 Astra自身の成功率が約**70%**であるなら、各ステップで30%の失敗率が生じることになる。100ステップのタスクチェーン全体が成功する確率は0.7の100乗、すなわち事実上ゼロに近い(※各ステップの成否が独立している場合の単純計算)。これを根拠に、筆者はRSIによるAGI実現への懐疑的な見方を示している。
「Enronのような債務構造、巨大な営業赤字、不可能な約束、そして純粋なたわごと。この『業界』は本当に面白い」
辛辣だが、現場でトークンを燃やしてきた人間の言葉には重みがある。
関連リンク
詳細はLab Notes from a serious LLM-coding experimentを参照していただきたい。