2026-08-19 · paper-digest
Battleday et al.: ルールを教えない70本のゲームで、AI の「発見する力」を測る — Fukai が読む
Ruairidh M. Battleday ら16名による arXiv preprint。ルールも勝利条件も伏せた 70 本の文字列ゲーム(7ティア、公開21本)で AI の「発見する力」を測ると、最強のモデルが 50 本・全モデル合計でも 57 本にとどまる一方、70 本すべてが少なくとも 1 人の人間に初回で解かれた。真のルールを渡すと同じモデルが 18 本から 69 本に跳ね上がり、エージェント型の仕掛けは標準の仕掛けを上回らなかった。