10月2日、The Decoderが「AI beats licensed accountants on speed and accuracy, but still can't close the books without supervision」と題した記事を公開した。AIが速度・精度で公認会計士(CPA)資格者を上回る一方、単独での決算業務はまだ不可能であるという研究結果を詳しく紹介している。
AIが公認会計士の精度を超えた
人材マッチングプラットフォームを運営するMercorが、AIモデルと現役の公認会計士(CPA)を同一の会計タスクで比較した研究結果を公開した。
対象となったのは、平均5.5年の実務経験を持つCPA資格者12名。彼らにAPEXアカウンティングベンチマークから抽出した簡略化タスクに取り組ませた。人間の平均正答率は約**37%**だった。
18か月前、最良のAIモデルでもこの37%を下回っていた。現在は、同じタスクをほぼ完璧に解く。

モデルのリリース日別に見た、AIと人間(AIなし)の会計タスク正確性の比較。画像: Mercor
フルベンチマークでの現在地
ただし、今回の比較に使われたタスクは簡略版だ。フルのAPEXアカウンティングベンチマークは規模が大きく異なる。
- 160タスク、10社分の模擬企業データを対象
- 平均11年の実務経験を持つ40名以上のプロが問題を作成
APEXは「会計AIの能力を実務水準で測る」ことを目的に設計されたベンチマークであり、単純な知識問題ではなく、複数ステップにわたる実務処理を要求する点に特徴がある。このフルベンチマークでの現時点の上位モデルは以下のとおりだ:
| モデル | 達成率 |
|---|---|
| Claude Opus 5.5 | 61.8% |
| Fable 5.1 | 61.0% |
| GPT-6 Astra | 57.9% |
トップモデルでも、約60%のタスクは完全に解けていないとMercorは述べている。AIは単独で帳簿を締めるには至っていない。
「AIが得意なことだけ」を測っている
Mercorはこの研究の限界を率直に認めている。今回のタスクはAIが最も得意とする領域、つまり「細部の精査」と「指示への忠実な追従」に特化している。
一方で、以下の業務は意図的に除外された:
- クライアントとのコミュニケーション
- 同僚との状況確認・調整
- 長年の実務で蓄積されたコンテキストを踏まえた判断
Mercorはこれが「会計士が代替されない理由」だとしながらも、業界全体で大きな生産性向上が起きると見込むとしている。
ベンチマーク設計が結論を左右する
「AIと人間の定量比較研究」は会計分野に限らず今後も増えていく。今回の研究が示すより本質的な問題は、ベンチマークの設計が結論を大きく左右するという構造的な点にある。
APEXが「コミュニケーション」や「文脈に基づく判断」を評価対象から外しているのは、それらを定量化することが技術的に難しいからでもある。つまり、測りやすい部分だけを測った結果として「AIが人間を超えた」という見出しが生まれる側面がある。この構造は会計に限らず、医療・法律・教育など専門職とAIを比較するあらゆるベンチマーク研究に共通する。
会計AI領域では、Mercorの研究以前にも、Big4などの大手監査法人が内部でAI活用の効果測定を進めているとされるが、公開された比較研究はまだ少ない。APEXのような外部から検証可能なオープンなベンチマークが存在することは、この領域の議論を前進させる上で意義が大きい。数字の読み方とともに、「何を測っていないか」を常に問う視点が、AI能力評価の報道・研究を読み解く上で欠かせない。
詳細はAI beats licensed accountants on speed and accuracy, but still can't close the books without supervisionを参照していただきたい。