Anthropic の Claude が 150 年来の数学難問「Riemann 予想」で進展——下限を 41.6% から 67.2% へ引き上げ
Anthropic が未発表のモデルを使い、150年以上未解決の Riemann 予想について、既知下限を大幅に改善。650 個のアプローチと 60 個のサブエージェントが協調し、3,100万トークン消費して成果達成。AI が基礎数学研究の最前線に進出した事例として学界で注目を集めている。
続きを読むAnthropic が未発表のモデルを使い、150年以上未解決の Riemann 予想について、既知下限を大幅に改善。650 個のアプローチと 60 個のサブエージェントが協調し、3,100万トークン消費して成果達成。AI が基礎数学研究の最前線に進出した事例として学界で注目を集めている。
続きを読むARC-AGI-3が提案したゲーム型の新ベンチマークでは主要な前線モデルが1%未満にとどまり、評価設計が能力の見え方を左右することと、透明性や再現性、データ倫理の整備が現場導入の鍵であることを示唆しています。
続きを読むOpenAIの研究者Sebastian BubeckとErnest Ryuは、数学が汎用AI(AGI)達成度の客観的測定基準であると主張。2年間で小学算数から研究数学へ進化したモデルの能力から、長期的推論能力の急速な拡張を指摘する。
続きを読むAlibaba の Qwen チームが開発した HopChain は、視覚言語モデルが複数ステップの推論で失敗する問題に対応。多段階の画像質問を自動生成し、ベンチマーク24個中20個で性能向上を実現した。
続きを読む