オープンウェイトLLM21種すべてで安全機能を除去可能、国際研究チームが実証
ウォーターロー大学とFAR.AIらの研究チームが「TamperBench」を開発。テストした21のオープンウェイトLLMすべてで、ファインチューニングにより安全対策を無効化できることを確認した。
続きを読むウォーターロー大学とFAR.AIらの研究チームが「TamperBench」を開発。テストした21のオープンウェイトLLMすべてで、ファインチューニングにより安全対策を無効化できることを確認した。
続きを読むトランプ政権がAnthropic に対し、Fable 5 の再リリースの条件として『すべてのジェイルブレイクを防止すること』を要求。しかしセキュリティ専門家は、プロンプトインジェクション攻撃の完全防止は技術的に不可能だと警告し、政府の要件が実現不可能であることを指摘。
続きを読む