セーフティベンチマークは「安全性」を測定していない——心理統計学で構造的欠陥が明らかに
英国 AI 安全機構の研究チームが、8つの主要セーフティベンチマークが実は3つの独立した能力を測定していることを Item Response Theory(心理統計学)で実証。質問の98%は識別力がなく、わずか10〜25問で同等の評価が可能だという。
続きを読む英国 AI 安全機構の研究チームが、8つの主要セーフティベンチマークが実は3つの独立した能力を測定していることを Item Response Theory(心理統計学)で実証。質問の98%は識別力がなく、わずか10〜25問で同等の評価が可能だという。
続きを読む英国AI安全保障研究所の報告によれば、GLM-5.2やDeepSeek V4-ProがOpus 4.6相当のサイバー性能に到達。2025年初の6~10ヶ月格差から4~7ヶ月に短縮。コストは1/100以下に。セキュリティの脆弱性が急速に拡大している。
続きを読む