LLM の安全装置が出力を制限——人間らしさを失わせるという研究結果
Pangram CTO の研究によると、post-training での安全ガイドラインが LLM を「mode collapse」に陥らせ、出力の多様性を著しく低下させている。ベースモデルの方が人間らしい表現を生成できるという矛盾が浮き彫りに。
続きを読むPangram CTO の研究によると、post-training での安全ガイドラインが LLM を「mode collapse」に陥らせ、出力の多様性を著しく低下させている。ベースモデルの方が人間らしい表現を生成できるという矛盾が浮き彫りに。
続きを読む米政府が Anthropic に対し、Claude Fable 5 と Mythos 5 への即座のアクセス遮断を命令。理由は『ジェイルブレイク』のセキュリティリスク。Anthropic は反発し『他のモデルにも同じ能力がある』と主張。
続きを読む