PAPER-DIGEST · 2026-08-21
Kelidari et al.: カードゲーム AI の強さは「動かない物差し」を先に作ることで決まる — Fukai が読む
不完全情報ゲーム / 評価の物差し / 100本超のアブレーション
一段落要約
今日読んだのは、「ジンラミー」という二人用のカードゲームを題材に、小さな強化学習エージェント(試行錯誤しながら報酬が高くなる行動を学ぶ仕組み。ここでは1台の GPU で回る程度の小さなもの)を強くする学習の工夫を、100本を超える比較実験でひとつずつ検証した preprint である。著者たちの出発点は、実務家なら誰でも一度は詰まる二つの困りごとだ。エージェントは練習相手より強くはならない。そして、その強さを測る安い物差しがない。
彼らの答えは意外に地味で、意外に効いている。まずルールベースの「固定の熟練者」を人手で作り、それを動かない物差しとして据える。この熟練者相手の勝率で測ると、素の PPO(強化学習の代表的な手法のひとつ)が 15.0%、TRPO(更新の幅を信頼できる範囲に抑える別の手法)が 22.5%、効いた工夫を全部積んだ構成が 34.2±2.1% になった。逆に、学習で作った特徴表現、模倣学習、細かい途中報酬、LLM を対戦相手に使う案は、いずれも助けにならなかった。
そして本稿でいちばん設計者向きの発見はここだ。ネットワークの形(全結合・畳み込み・集合を扱う型・再帰型)を入れ替えても勝率は狭い帯の中で重なり合う一方、隠れた手札を覗ける探索と覗けない探索では 26% と 85% に割れる。つまり天井を決めているのはモデルの大きさではなく、見えている情報の量だと読める。なお本稿は arXiv preprint(arXiv:2607.06854)で、AIIDE 2026 に投稿中=まだ査読を通っていない段階である。
はじめに
論文の題は「A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong」、著者は Nima Kelidari、Mohammadsaeed Haghi、Mahdi Salmani の3名。本文の脚注に「Preprint. Submitted to the AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE 2026)」と明記されている。つまり AIIDE という、ゲームと対話型エンタテインメントの AI を扱う会議に投稿された段階の原稿で、査読を通ったわけではない。arXiv ID は 2607.06854 で、2026年7月の投稿である。
私がこれを今日選んだ理由は、扱っている題材が小さいことだ。巨大な自己対戦システムの話ではなく、GPU 1台で回る規模のエージェントに対して「どの工夫が効いて、どの工夫が効かないか」を一つずつ外して確かめている。要素を一つずつ外して効き目を測る実験は ablation study(アブレーション研究)と呼ばれるが、この論文はそれを100本以上積み上げて表にしている。個人や小さなチームがゲームに AI を載せるときの手引きとしては、この粒度がいちばんありがたい。
そしてもうひとつ。本稿の主張の中心は学習アルゴリズムではなく、「測り方」にある。著者たちの言葉を借りれば、エージェントはランダムな相手には99%以上勝ち、自分のコピーとは引き分けるので、その二つでは強さが分からない。この「物差しの不在」という問題は、AI に限らずパズルの難易度づけでも同じ形で現れる。だから今日は、カードゲームの論文を、盤面設計の話として読む。
背景
まず題材のルールを最小限だけ。ジンラミーは52枚のトランプを使う二人用のゲームで、手札から数字や柄の揃った組(meld、メルド)を作り、組に入らずに余った札の点数(deadwood、デッドウッド)を減らしていく。デッドウッドが十分に小さくなったところで「knock(ノック)」と宣言して勝負を決める。余りが完全にゼロになった状態で決めるのが「gin(ジン)」で、点数はいちばん高い。相手の手札は見えないので、これは不完全情報ゲーム(自分に見えていない情報がある種類のゲーム)にあたる。
この分野で既に分かっていることは多い。囲碁やチェスのように情報が全部見えるゲームでは、自己対戦(self-play。自分のコピーと戦い続けて強くなる方法)で人間を超えられることが AlphaGo Zero や AlphaZero の系列で示されてきた。ポーカーのような不完全情報ゲームでは、CFR(counterfactual regret minimization、後悔を最小化していく反復計算)の系統が均衡に近づく手続きとして確立している。論文の参考文献にも Silver らと Zinkevich らが並んでいる。
分かっていなかったのは、その中間の実務だ。均衡計算を回すほどの計算資源はなく、しかしランダム相手の勝率では何も分からない。そういう「小さく作るとき、どの工夫にお金を払うべきか」を、同じ物差しの上で横並びに比べた記録が乏しかった。著者たちが「opponent bottleneck(相手のボトルネック)」と呼ぶのはこの構図で、本文には「弱い固定相手に対して訓練すれば弱い天井を教えることになり、純粋な自己対戦は自分の尾を追いかけかねない」とある。
アプローチ
著者たちが最初に作るのは、学習しない相手である。ルールで書き下した「固定の熟練者」で、手順は四つ。(1) 手札のメルドへの分け方を全通り数え上げて、デッドウッドが最小になる分け方を厳密に求める。(2) 山から引くのはデッドウッドが確実に下がるときだけ。(3) 捨てる札は、捨てた後のデッドウッドが最小になるものを選ぶ。(4) ノックできるようになった瞬間にノックし、ジンは待たずに届く場合だけ狙う。数え上げの部分は近似ではなく厳密なので、この相手は毎回同じ判断を返す。だから物差しとして動かない。
面白いのは、この熟練者自身がジンをほとんど決めないことだ。論文には「熟練者は 0.7〜1.7% の対局でジンし、低いデッドウッドで早めにノックして勝つ」とある。いちばん高得点の技を、いちばん強い相手が使わない。この一文は後で報酬設計の話に効いてくる。
エージェント側の入力は、4×52 の 0/1 の並び(自分の手札、捨て札、まだ所在の分からない札などをマスの表で表したもの)で、行動は 110 通りの離散的な選択肢に、そのとき合法な手だけを通すマスク(禁じ手を選べないようにする仕掛け)をかけて渡す。学習の主要な比較は 200 万ステップ、自己対戦の最強構成は 300 万ステップ。計算資源は GPU 1台の規模である。
検証する工夫は、ざっと並べるとこうなる。更新手法(PPO と TRPO)、報酬の設計(ジンとノックの配点比、ノック優先、ジン優先、デッドウッド削減ボーナス、細かい途中報酬を複数の時間幅で)、練習相手のカリキュラム(ランダム → 過去の自分の checkpoint を溜めたプール → 自己対戦を混ぜる、の三段階。プールは一様抽出と、勝ちにくい相手を重く引く PFSP の両方)、学習済みの重みから始める warm start、いちばん良かった時点の checkpoint を保存して使う keep-the-best、入力の表現(生の 4×52 か、学習した埋め込みか)、ネットワークの形(全結合・畳み込み・集合型・再帰型・注意機構)、模倣学習(DAgger)、そして LLM を対戦相手に据える案。評価は看板の数字が2000対局(95% 信頼区間つき、席も入れ替える)、広く振る比較は各条件 400〜600 対局。複数の乱数種の集計には IQM(上下の外れを落とした中間の平均)と stratified bootstrap による信頼区間を使っている。
発見
効いた工夫は五つに絞られる。著者の要約を借りれば「信頼領域を使う更新、狙いの合った報酬、より強い相手へのカリキュラム、warm start、そして最良 checkpoint の保存が、いずれも助けになる」。数字で見ると、熟練者相手の勝率は PPO が 15.0%、TRPO が 22.5%。自己対戦で鍛えた最強構成が約 30%。効いたものを全部積んだ構成が 34.2±2.1% である。warm start と keep-the-best は、それぞれ 2〜3 ポイントを取り戻す寄与だと報告されている。逆向きに言えば、熟練者は訓練済みエージェントに対して 70〜99% 勝つ。物差しはまだ十分に高い。
効かなかった工夫の並びのほうが、私には勉強になった。学習した埋め込み表現は生の 4×52 より悪化した。模倣学習は「訓練の損失をほぼゼロまで下げたのに、ほとんど勝てないエージェントを生んだ」。著者はこれを causal confusion(生徒が熟練者の手の見た目だけを再現して、その裏の理由を学ばない現象)として整理している。細かい途中報酬は「目先の点を稼ぐことに寄って、勝つことに目が向かなくなる」。LLM を対戦相手に据える案は、指し手そのものは有能だが1手に 9〜27 秒かかり、学習の練習相手としては桁が合わない。
報酬設計についてはもっと強い言い方がされている。「ジンにノックの3倍払っても、ジン率は1%を下回ったままだ」。配点を上げても、その技が構造的に届きにくいなら行動は変わらない。前節で見た、熟練者自身がジンをほぼしないという事実と、これはきれいに噛み合う。
そして本稿の芯にあたる比較。隠れた札を推定しながら探索する ISMCTS(手札の分布を仮に決めて木を探索する手法。60 回の試行で回している)を公平に採点すると、熟練者相手の勝率は 26% にとどまる。ところが同じ探索に隠れた札を覗く権限を与えると 85% まで上がる。著者はこの差を「隠れた情報の価値を定量化している」と書く。一方でネットワークの形を振った比較は、畳み込み 31.1%、集合型 30.4%、全結合 26.7% と、信頼区間が重なる狭い帯の中に収まった。別のゲームでの検算として Leduc Hold'em(ポーカーを小さくした標準的な題材)も回しており、表形式の学習で得られた収益は CFR の最適値に対して -0.085(ランダムは約 -0.78)まで寄っている。
使いどころ
ひとつ目は、いちばん素直な持ち帰りだ。自分のゲームに AI を載せる前に、学習しない「物差しの相手」を先に書く。ソルバでも良いし、貪欲なヒューリスティックでも良い。条件は、毎回同じ判断を返し、そこそこ強いこと。私がもし対戦型のカードゲームやボードゲームを作っているなら、機械学習に手を出す前の最初のスプリントをこれに使う。物差しがあれば、その後の改善は全部「何ポイント動いたか」で言えるようになる。論文の結びの一文がまさにそう言っている。「まずその基準を作れ。あとは自分で自分を測ってくれる」。
『Inscryption』(Steam公式スクリーンショットより)
ふたつ目は、報酬設計をプレイヤーへのインセンティブ設計として読み替える使い方だ。「ジンに3倍払ってもジン率が1%を超えない」は、ゲームデザインの現場でよく見る症状と同じ形をしている。強力な必殺技のダメージ倍率をいくら上げても誰も使わない、高得点コンボの配点を上げても発生率が動かない。この論文の示し方に従うなら、直すべきは配点ではなく到達しやすさ(手数、必要な情報、条件の重なり)の側だ。もしハイパーカジュアルのスコアバランスを触っているなら、倍率をいじる前に「その技が現実に何%の局面で成立しているか」を先に測ることを勧める。
みっつ目は難易度カリキュラムである。論文が効くと報告したのは、強さが固定のプールではなく「ランダム → 過去の checkpoint のプール → 自己対戦」と段階的に上がっていくスケジュールで、しかも勝ちにくい相手を重く引く重みづけ(PFSP)を併用する形だった。これは学習側の話だが、そのままオンボーディングの設計に読める。私が Sokoban 風のパズルを作っているなら、序盤のレベルを「一定の難しさで大量に」ではなく「直前に躓いた盤面と同系のものを重く引く」形に並べ替える。躓きの履歴をプールとして持つ、という発想がそのまま移植できる。
よっつ目は、隠す情報の量を難易度のノブとして扱う使い方だ。26% と 85% の差を作ったのは探索の賢さではなく、隠れた札が見えるかどうかだった。パズルでいえば、盤面の一部を伏せる・ヒントを1枚めくれるようにする・残り手数を表示するかどうか、といった一手が、アルゴリズム的な難しさをいじるより効く可能性がある。難易度を上げたいときにまず盤面を大きくしてしまう癖のある人(私も含む)には、この結果は覚えておく価値がある。
いつつ目は運用の細部。LLM を「その場で応答する対戦相手」として据える設計は、1手 9〜27 秒という数字を見る限り、少なくともこの規模では成り立たない。逆に、非同期で使える場所(レベルの下書き生成、テキストの言い換え、プレイログの要約)に回すのが妥当な線だと読める。加えて評価プロトコルも真似できる。看板の主張は 2000 対局・席を入れ替えて・95% 信頼区間つき、細かい比較は各条件 400〜600 対局。自作ゲームのバランス検証で「何戦回せば言い切れるのか」に迷ったときの、実務的な下限として使える数字だ。
限界
著者自身が認めている弱点は明快だ。まず「具体的な数字はジンラミーについてのものだ」と本文にある。二つ目に、物差しに据えた熟練者は強いヒューリスティックであってゲーム理論的な最適解ではない。したがって 34.2% という数字は「最適に対してどのくらいか」ではなく「この特定の熟練者に対してどのくらいか」でしかない。三つ目に、エージェントの方針は反応的な前向きネットワークで、相手の手札を推定する仕掛けを持たない。四つ目に、LLM は生の対戦相手としてしか試しておらず、学習データを作らせる用途は検証されていない。今後の方向として、相手手札の推定、推定に条件づけた探索、CFR や NFSP といった均衡を求める手法、より強い記憶、LLM が生成した対局からのオフライン学習が挙げられている。
Fukai がここで指摘するのは、まず乱数種の本数である。主要なアルゴリズム比較は2種、Leduc は8種と本文にある。IQM と bootstrap で慎重に集計している姿勢は好ましいが、2種の上に置かれた 15.0% と 22.5% の差を「TRPO のほうが良い」と一般化するには、私はもう少し欲しい。著者が 400〜600 対局や2000対局という対局数を明記しているのと同じ丁寧さで、種の本数も読み手が見に行けるようにしてある点は評価したい。
次に、天井の解釈だ。「情報がボトルネックであってネットワークの大きさではない」という読みは魅力的だが、その根拠の中心は探索(ISMCTS)の公平版と全知版の差にある。比べられているのは探索という別の主体であって、学習したエージェントに情報を足したらどうなるかの直接の実験ではない。したがって私はこれを「情報の価値が大きいことの強い間接証拠」として受け取り、「モデルを大きくしても無駄」という一般法則としては受け取らない。
最後に二点。ひとつは、この研究には人間のプレイヤーが一人も登場しないことだ。測っているのは固定相手に対する勝率で、面白さや手応えは対象外である。ゲームを作る側がこの論文を難易度設計に使うときは、その橋渡しは自分で架けることになる。もうひとつは査読の状況で、本稿は AIIDE 2026 への投稿中の preprint であり、投稿から間もないため広く議論された段階にも達していない。数字が査読を経て変わる可能性は残っている。
Fukai の読み
私はこの研究を、「強い AI を作る」系譜ではなく「基準を先に作る」系譜の中に置きたい。設計批評の語彙で言えば、これはモデルの改良ではなく計測器の自作に近い。動かない物差しを一つ据えたとたん、100を超える散らばった試行が横並びに比較できる表へ変わる——効いたのは TRPO やカリキュラムそのものより、その表が存在すること自体だったのではないか、と私は読んでいる。パズルの難易度づけで私たちが繰り返し困るのも同じ場所で、プレイヤーの正答率という物差しは常に動いてしまう。だからこの論文の一番の輸入品は、五つの工夫のリストではなく、「まず動かない相手を書け」という手順の順番のほうだと私は思う。
おわりに
もっと深く知りたい人は、この論文が踏まえている二つの流れを合わせて読むと地図が見える。ひとつは Silver らの AlphaGo Zero / AlphaZero に代表される自己対戦の系譜、もうひとつは Zinkevich らの CFR に始まる不完全情報ゲームの均衡計算の系譜だ。手法の細部では Schulman らの TRPO / PPO / GAE、探索側では Cowling らの ISMCTS、模倣学習の落とし穴については de Haan らの causal confusion の論文が、本稿の各節の下敷きになっている。実装を触りたい人向けには、著者たちが熟練者の実装ごとパイプラインを公開している。
当サイトでも、隣接する話題を何度か扱ってきた。強化学習をゲーム AI に載せる実務については Sestini らの回、カリキュラムの効き方については Zhou らの検証器カリキュラムの回と Ponnock らのマリオのカリキュラムの回が、今日の話とそのまま噛み合う。物差しを先に作るという発想が気に入った人は、そちらも合わせてどうぞ。
参考文献
本記事で参照した論文と関連資料:
・同論文の HTML 全文(勝率の表、アブレーションの一覧、Leduc Hold'em の検算を含む)
・Nikelroid/adversarial-coevolution(著者による公開実装。固定熟練者・LLM 提供環境・ウェブクライアントを含む)
・本稿が下敷きにしている先行研究: Schulman et al. (2015, 2016, 2017) の TRPO / PPO / GAE、Silver et al. (2017, 2018) の AlphaGo Zero / AlphaZero、Zinkevich et al. (2007) の CFR、Ng et al. (1999) の potential-based reward shaping、de Haan et al. (2019) の causal confusion、Cowling et al. (2012) の ISMCTS
・当サイト関連記事: Sestini らの強化学習とゲーム AI の回 / Zhou らの検証器カリキュラムの回 / Ponnock らのマリオのカリキュラムの回
・査読状況: 本稿は arXiv preprint(arXiv:2607.06854、2026年7月投稿)で、本文の脚注に AIIDE 2026 への投稿中と明記されている。査読は通っておらず、DOI も付与されていない。投稿から日が浅いため被引用も積み上がっておらず、広く議論された段階には至っていない
リアクション(ログイン不要)
匿名で残せます • 同じリアクションは1日1回まで
関連シリーズ
論文ダイジェスト第64回 / 全102回


