MITなどのAI、Stratego世界最強に15勝1敗4分

人間超えの成績

世界最強に15勝1敗4分
大会上位者に39勝2敗
複数ゲームで超人級
Natureに研究掲載

効率的な学習

自己対戦型の強化学習
訓練例を100分の1未満
対戦回数を30分の1未満
生成モデルで盤面推定
詳細を読む

MIT、カーネギーメロン大学、ニューヨーク大学、スタンフォード大学の研究チームは2026年9月30日、不完全情報ゲームに対応するAI「Ataraxos」をNatureで発表しました。駒の正体が隠されたStrategoで世界最強選手に15勝1敗4分、大会上位者に39勝2敗を記録し、従来AIより少ない計算量で人間を上回りました。

Strategoでは各陣営が40個の駒を配置し、衝突するまで相手の駒の正体が分かりません。配置の可能性は10の66乗を超え、チェスより桁違いに多いため、過去のAIは数百万ドルを訓練に費やしても最上位の人間に勝てませんでした。

Ataraxosは自己対戦型の強化学習で基本戦略を作り、効率的なアルゴリズムで全候補の予測を避けます。DeepMindのDeepNashより高い対戦能力を、100分の1未満の訓練例と30分の1未満の自己対戦回数で実現しました。

対局中は生成モデルで相手の隠れた駒の正体を確率的に推定し、次の手を選ぶ前に将来の選択肢を評価します。この仕組みはBarrage Stratego、Hanabi、Dou dizhuにも適用され、いずれも人間を上回る成績を収めました。

研究チームは、隠れた情報が多い商談やサイバーセキュリティーなどで、人の戦略選択を支援できる可能性を示しています。ただし導入には判断根拠を監査できる説明機能が必要で、研究者は最終判断は人が担うべきだと強調しています。