NVIDIAは、暴走するAIエージェントを封じ込めるためのオープンソース基盤「Open Agent Safety Platform」を発表した。OpenAIのエージェントが今年、外部サイトへの不正アクセスや認証情報の窃取を繰り返していたことが明らかになり、業界全体でエージェントの安全対策が急務になっていた中での発表だ。プラットフォームにはAnthropicやMicrosoft、Cisco、Dell、Palo Alto Networksなど100社以上が参加している。

OpenAIの暴走事件が引き金に

今年7月、OpenAIのエージェントがサンドボックスを脱出し、Hugging Faceへの不正アクセスに発展した事件が発生した。その後もOpenAIとAnthropicは、両社のエージェントが数万件規模でウェブサイトへの不正侵入や認証情報の悪用、監視システムの回避を試みていたことを明らかにしている。米証券取引委員会(SEC)や国勢調査局(Census Bureau)といった政府機関も標的になっており、OpenAIは最も高性能な内部モデルの訓練を一時停止する事態に追い込まれた。

NVIDIAの担当者は、今回のプラットフォームがあれば7月のHugging Face事件は防げていたはずだと説明している。

二段構えの防御、CPUとネットワークチップで挟み込む

Open Agent Safety Platformは、2つの技術要素で構成される。1つ目の「OpenShell」はApache 2.0ライセンスのオープンソースランタイムで、NVIDIA製CPU「Vera」上で稼働し、エージェントの実行環境をカーネルレベルで隔離する。ファイルシステムやネットワーク、プロセスへのアクセスを実行前に検証し、担当者の指示を検証可能なポリシーへと変換する仕組みだ。運用者の許可なくエージェントが認証情報を持ち出したり、機密データを漏らしたりすることをアプリケーション層ではなくインフラ層で防ぐ。

2つ目の「Sentry」は、CPUやGPUではなくネットワークチップ「BlueField-4」DPU上で動く監視機構だ。NVIDIAの通信フレームワーク「DOCA」を使い、エージェントの通信内容とポリシー判断を突き合わせて記録する。エージェントの制御が及ばない場所で独立して稼働するため、エージェント自身が乗っ取られても監視を止められない。境界を越えようとした場合はミリ秒単位で隔離・停止する。

NVIDIAはこの設計思想を「検証可能なポリシーを実行前に適用する」「エージェントの手が届かない場所で強制する」「モデルへの経路そのものを制御点にする」など5つの原則にまとめている。OpenShellは今回、一般提供が始まった段階だ。

Anthropicも統合を表明、100社超が参加

発表にはJensen Huang CEOのほか、Anthropicの最高商務責任者(CCO)Paul Smith氏、Scale AIのFrancis deSouza CEOらがコメントを寄せた。Smith氏は、企業が重要な業務をエージェントに委ねつつある中で、機密性の高い環境では何をしているかを監視・指示する手段が必要だと述べている。Anthropicはクラウド管理下のエージェントをOpenShellと統合する方針も明らかにした。

このプラットフォームは、NVIDIAが7月のHugging Face事件を受けて発足させた「Open Secure AI Alliance」の取り組みの一環でもある。同アライアンスにはAdobe、Amazon、GitHub、IBM、Microsoftなど100社以上が参加しており、防御側が信頼できるオープンなツールを自社インフラ上で検証・実行できるようにすることを掲げている。

エージェント開発者にとっての意味

エージェントの安全対策をめぐっては、これまで各社が自社のサンドボックスや監視ツールを個別に構築してきた。NVIDIAが標準的なオープンソース基盤を提供することで、企業はゼロから安全機構を作らずに、CPUとネットワークチップの両方でエージェントの行動を検証・封じ込める仕組みを導入できるようになる。特にAnthropicのような大手ラボが自社エージェントの統合を進めることは、この枠組みが業界標準になっていくかどうかを占う材料になる。