タグ一覧に戻る

AI ベンチマーク

記事数: 2
AI モデルの現実的な限界が露呈——知識労働ベンチマークで最高性能モデルも3%の成功率

AI モデルの現実的な限界が露呈——知識労働ベンチマークで最高性能モデルも3%の成功率

Artificial Analysis が発表した AA-Briefcase ベンチマークで、複数情報源の統合が必要な現実的な知識労働タスクにおいて、最高性能の Claude Fable 5 でさえ完全な成功率はわずか3%であることが明らかになりました。

続きを読む

投資銀行 500 人が AI 出力を本番評価:ゼロ件が『そのまま送付可能』

投資銀行マン 500 人による実務レビューで、最高性能の GPT-5.4 でも 0 件が クライアント送付可。修正の出発点として使用可能は 16% のみ。Claude Opus 4.6、Gemini でも同様傾向。AI が高性能化する一方、実務信頼性の課題が明らかに。

続きを読む