AIが会計士を速度と精度で上回る、Mercor調査もAPEXベンチマークでは決算を単独完遂できず
人材評価企業Mercorの調査で、最新AIモデルが構造化された会計タスクで資格を持つ会計士を速度・精度ともに上回った。一方、より難易度の高いAPEXベンチマークでは全タスクを完遂できるモデルはなく、人間の監督は依然不可欠だ。
人材評価企業Mercorが実施した調査によると、現在の主要AIモデルは構造化された会計タスクにおいて、資格を持つ公認会計士(CPA)を速度・精度の両面で上回った。もっとも、より実務に近い難易度の高いAPEXベンチマークでは、全タスクを完遂できたモデルは1つもなく、人間の監督なしに決算を締めることはまだできない。
1年半で逆転した精度
Mercorの調査はAPEX Accounting Benchmarkという会計タスク集を使い、AIモデルと経験豊富なCPAの成績を比較した。18か月前の時点では、AIモデルの精度はCPAが達成する約37%の正答率にすら届いていなかった。それが現在では、同様の問題をほぼ完璧な精度で処理できるようになっている。構造化された簿記作業において、AIはすでに新人会計士を大きく上回る速度・精度・コストを実現しているという。
現時点のモデル別順位は、Claude Opus 5.5が61.8%、Fable 5.1が61.0%、GPT-6 Astraが57.9%となっている。わずか1年半でCPAの正答率ラインを突破し、さらに上積みを続けている計算だ。
全タスクを解けるモデルはまだない
一方で、APEXベンチマークが課す課題の約60%は、どのモデルも完全には解けていない。Mercorの調査は、AIが得意とする構造化された定型作業に焦点を当てたもので、クライアントとのコミュニケーション、同僚への相談、長年の経験で培った文脈理解といった要素は対象外にしている。この限定的なスコープこそが、AIが会計士を完全に代替できない理由だとMercorは指摘する。業界としては、会計士が完全に不要になるわけではないが、生産性の大幅な向上は見込めるとしている。
読者への影響
会計事務所や企業の経理部門にとっては、定型的な検証作業をAIに任せつつ、監督・判断・クライアント対応は人間が担うという分業体制への移行が現実味を帯びてきた。Claude Opus 5.5やFable 5.1など上位モデル間の差は数ポイントに収まっており、どのモデルを採用するかより、どの業務をAIに委ねてどこに人間を残すかの設計が、今後の生産性を左右しそうだ。