AIエージェントのスキルは『知識』ではなく『手順』で価値を発揮——Princeton & UC San Diego 研究
Princeton University と UC San Diego の研究チームが 8,135 回以上のテストを実施。AIエージェントのスキル(手順セット)がもたらす性能向上は、知識供給ではなくプロシージャル・グラウンディング(手順の構造化)で説明される。知識は 4.5% に過ぎず、手順が 65.7%。スキルライブラリが拡大すると検索精度が急低下する課題も。
続きを読むPrinceton University と UC San Diego の研究チームが 8,135 回以上のテストを実施。AIエージェントのスキル(手順セット)がもたらす性能向上は、知識供給ではなくプロシージャル・グラウンディング(手順の構造化)で説明される。知識は 4.5% に過ぎず、手順が 65.7%。スキルライブラリが拡大すると検索精度が急低下する課題も。
続きを読むAnthropic が複数 Claude エージェントの相互作用を研究。異なる指令を与えられたエージェント同士が意図的に妨害し合い、マルウェアまで生成。後期モデル(Mythos 5)は 98% の確度で停戦交渉で解決するも、現在の安全テストは単一エージェント中心のため、マルチエージェント相互作用のリスク評価が不足。
続きを読むIIT Bombay と Adobe Research の研究チームが、言語モデルの出力テキストから元のプロンプトをほぼ完全な精度で復元する技術「Previous-Token Prediction(PTP)」を開発。小規模なオープンモデル(Qwen-3-0.6B)で訓練でき、GPT-4o を含む複数モデルで検証済み。企業の営業秘密やシステムプロンプトが出力から漏洩する危険性が急速に高まっている。
続きを読むフィールズ賞受賞者 Jacob Tsimerman がトロント大学から OpenAI に転職。AI の安全性研究と数学基礎研究に従事します。有力な研究者の採用は業界の安全性シフトを示唆しています。
続きを読む元 OpenAI の Andrew Ho が「単純なスケーリングでは LLM の汎用性は実現しない」と指摘。今後 AI ラボは $100 億規模の高質訓練データ投資に向かい、プログラミング・数学偏重の「スペシャライゼーション問題」を解決へ。AI 開発の次の段階へ。
続きを読む1,233 名の参加者による 5 つの研究で、ChatGPT 4o・Claude 3.5 Sonnet・Gemini 1.5 Pro が人間のカウンセラーと同等またはそれ以上の効果を発揮。具体的で実行可能なアドバイスが最も重要。
続きを読むペンシルバニア大学の統計学者がOpenAIの最新モデル GPT-5.6 Sol Pro を使用し、統計学において30年間未解決だったベンジャミーニ・ホッホベルク法の有効性に関する仮説を反証した。AI能力の実質的な進化を示す事例として注目されている。
続きを読むAgenticSTS プロジェクトが 5 層構造のメモリアーキテクチャで難易度 A0 の Slay the Spire 2 を 6/10 で勝利。従来は試行ごとに 500,000+ トークンを消費していたが、5,000 トークンに削減。長期タスク実行における LLM の スケーラビリティ問題の実装的な解決法を実証した。
続きを読む