カーネギーメロン大学、ニューヨーク大学、スタンフォード大学、マサチューセッツ工科大学の研究チームが開発したAI「Ataraxos」が、ボードゲーム「Stratego」史上最強とされるプレイヤー、オランダ出身のピム・ニーマイヤー氏を20戦中15勝1敗4分で破った。両者が互いの駒の配置を伏せたまま対戦する不完全情報ゲームは、AIにとって人間最後の砦の一つとされてきた。成果は学術誌『Nature』に掲載された。

不完全情報ゲームという壁

Strategoは、対戦相手の駒の種類や配置が分からないまま戦略を組み立てる必要があるゲームだ。チェスや将棋のような完全情報ゲームと異なり、相手の手の内を推測しながら意思決定を重ねる点が特徴で、これまでGoogle DeepMindの先行システムを含め、AIが人間トップ選手を明確に上回る結果は出ていなかった。

学習コストを500分の1に圧縮

Ataraxosは、Nvidia H100 GPU16基を1週間、駒の配置を予測する信念ネットワーク用のGPU4基を4日間使って訓練された。推定費用は8000ドルに満たないという。対照的に、DeepMindの先行システムは1024基のTPUノードを2〜3カ月間稼働させ、当時の価格で300万〜450万ドルを要したと推定されている。計算コストは約500分の1、必要な訓練例の数も100分の1に削減された。

技術的な核心は、訓練中に戦略を多様化させる正則化の仕組みと、対戦相手の隠れた駒を予測する信念ネットワークにある。Ataraxosは手を選ぶたびに、この信念ネットワークの予測を踏まえて候補手を評価する。

不確実性下の意思決定への応用

研究チームは、この成果がStrategoという特定のゲームにとどまらず、金融市場や交渉のような不確実性を伴う現実の戦略的意思決定問題への応用が「実用的な範囲に入った」と位置づけている。情報が不完全な状況で相手の意図を推測しながら最適な行動を選ぶという課題は、ゲームの外にも広く存在する。

今回の学習コストの大幅な圧縮は、同種の研究に取り組む他のチームにとっても参入障壁を下げる意味を持つ。大規模な計算資源を持たない研究機関でも、不完全情報下の戦略的AIの開発に挑める可能性が見えてきた。