AI評価機関のEpoch AIが実施した「家具組立ベンチマーク」で、OpenAIの最新モデル「GPT-6 Astra」がIKEA家具の組立ミスを見抜く精度80%を記録した。2025年11月時点の最高スコアだった28%から、わずか10ヶ月で3倍近くまで跳ね上がったことになる。

ベンチマークの中身

このベンチマークは、IKEA家具の組立写真60枚をAIモデルに見せ、説明書と照らし合わせて組立の誤りを特定できるかを測るものだ。写真には意図的な組立ミスが仕込まれており、モデルは画像から誤りの箇所を見つけ出し、何が間違っているかを説明する必要がある。単なる画像分類ではなく、視覚的な情報と手順書のテキストを突き合わせる空間推論能力が問われる設計だ。

現在のトップスコアはGPT-6 Astraの80%で、1枚あたりの処理には約3分を要する。比較対象では、Claude Fable 5.1が70%、Claude Opus 5が61%となっており、2025年11月時点の最高スコアだった28%から各社モデルが急速に精度を伸ばしている構図が見える。Epoch AIによると、中国製のオープンソースモデル(Kimi K3など)は最先端モデルからおよそ7ヶ月遅れている状況だという。

実用化にはまだ距離

精度は大きく向上した一方、Epoch AIは現状のスピードでは「リアルタイムでの組立支援には遅すぎる」と指摘している。1枚の写真を解析するのに3分かかるようでは、組立作業中にリアルタイムで誤りを指摘する用途には実用的でない。

とはいえ、視覚的空間認識タスクでの急速な進展は、家具の組立に限らず自動車修理や家電の分解・修理といった、写真1枚から手順の誤りを診断する用途への応用可能性を示している。撮影した写真をアップロードするだけで作業ミスを指摘してもらえる体験が、数ヶ月先には現実的な速度で使えるようになる可能性がある。

読者にとっての意味

このベンチマークが示すのは、AIモデルの画像理解能力が「物体が何か」を認識する段階から、「手順通りに組み立てられているか」という時系列・空間の整合性を検証する段階へと進んでいることだ。ChatGPTやClaudeに家具や機器の写真を送って組立の確認をするという使い方は、まだ実用速度ではないものの、数字の伸び方を見る限り遠くない未来に一般ユーザーが日常的に試せる機能になりそうだ。