PAPER-DIGEST · 2026-06-19

Nasir ら: ゲームの「ルールそのもの」を進化させる — Fukai が読む MORTAR

自動ゲームデザインとメカニクス生成

🎧 音声で聴く

一段落要約

ゲームの「メカニクス」(プレイヤーの操作とその結果を決める、ゲームの根っこにあるルールのこと)を自動で設計できるか——そこに正面から挑んだ研究だ。これまでの自動生成研究の多くはレベルや地形の生成が中心で、メカニクスそのものを作って評価する試みは少なかった。著者らの MORTAR は、メカニクスを Python のコード片として扱い、大規模言語モデル(LLM。大量の文章を学習して続きや応答を生成するAI)に少しずつ書き換えさせながら、良いものを集めて広げていく仕組みである。

鍵になるのは「メカニクスは単体では良し悪しを判断できない、実際に遊んでみて初めて意味が分かる」という考え方だ。MORTAR は新しいメカニクスを完成したゲームに組み込み、強さの違うAIプレイヤー5体に遊ばせて、『強いプレイヤーがちゃんと勝てるゲームになっているか』を質の物差しにする。GPT-4o-mini を使い、1回の実行あたり著者らの報告で約30〜50ドルで動く研究用の試作だ。論文を開かなくても要点が掴めるよう、何を・どうやって・何が分かったかを順に解きほぐしていく。

はじめに

今日紹介するのは「MORTAR: Evolving Mechanics for Automatic Game Design」。著者は Muhammad U. Nasir、Yuchen Li、Steven James、Julian Togelius で、所属はウィットウォーターズランド大学(南アフリカ)とニューヨーク大学だ。Julian Togelius は手続き的生成(PCG、コンテンツの自動生成)やゲームAI分野を長年牽引してきた研究者で、この分野の地図を描くなら何度も名前が出てくる人物である。本稿は arXiv で2026年1月に公開された preprint(arXiv:2601.00105、まだ正式な査読を通したと確認できる情報がないため、ここでは preprint として扱う)だ。

私がこの論文を今日選んだのは、自動生成の議論がついに『レベル』から『ルールそのもの』へ踏み込んだ一例として、ゲームを作る人にとって示唆が多いと感じたからだ。レベル生成は多くの先行研究があるが、メカニクス——たとえば『鍵を拾うと扉が開く』『敵に触れると押し返される』といった相互作用のルール——を機械が一から作るとなると、評価の難しさが一気に跳ね上がる。著者らはそこを正面から扱っている。なお、生成されたゲームは著者らが公開した Web ページで実際に遊べる、とも論文に書かれている。

背景

PCG(Procedural Content Generation、コンテンツの自動生成)は長く研究されてきた領域で、ローグライクの実行時生成、デザイナーの発想支援、繰り返し作業の自動化など用途は幅広い。ただしその関心の多くは、地形やレベルの『構造』に向けられてきた。レベルなら『解けるか』『新しいか』といった指標で良し悪しを測りやすいからだ。

一方でメカニクス——ゲームの相互作用のルール——の自動生成には、相対的に光が当たってこなかった。著者らが強調するのは、メカニクスの価値は『それが引き起こす遊びの動き(ダイナミクス)』の中でしか立ち現れない、という点だ。見た目に目新しく複雑なメカニクスでも、腕前の差が結果に出る遊びを生まないなら退屈になりうる。だから生成だけでなく『評価』の設計こそが本質的に難しい、というのが出発点になっている。

この問題が重要なのは、メカニクスがプレイヤー体験の骨格を決めるからだ。何ができるかだけでなく、どんな戦略や創発的なふるまいが可能になるかを左右する。ここを自動化できれば、デザイナーの発想を広げる道具になりうる——ただし著者らは『完全なゲームを丸ごと作るためのものではなく、デザイナーを置き換えるのではなく後押しするためのもの』と明確に位置づけている。

アプローチ

MORTAR の土台は品質多様性アルゴリズム(Quality-Diversity。良い解を一つだけ探すのではなく、性質の異なる良い解をまんべんなく集める探索の枠組み)で、具体的には MAP-Elites と呼ばれる方式を使う。メカニクスは一つひとつが Python の関数として表され、二つの『棚の軸』で整理される。ひとつはメカニクスの種類(移動・相互作用・戦闘・進行・環境・パズル・資源管理・探索・時間操作の9種)、もうひとつはコードの複雑さ(プログラムの構造を解析し、関数呼び出しや代入の数から見積もる)だ。この二軸で作った格子の各マスに、良いメカニクスを一つずつ住まわせていく。

新しいメカニクスは LLM に書き換えさせて作る。既存のものに機能を足す『変異』、三つを見せて毛色の違うものを作らせる『多様化変異』、二つを混ぜる『交叉』、既存のゲームに馴染むものを作らせる『相性変異』——いずれも進化計算(生物の進化のように、変異と選択を繰り返して解を良くしていく手法)の操作を、LLM が実際のコード編集として担う。生成されたコードはまず構文と実行のエラーがないか試され、簡単なテスト環境で MCTS(モンテカルロ木探索。先の手をたくさん試し打ちして良い手を選ぶ探索手法)のAIに触らせて、ちゃんと動き、かつ自明でないかを確かめる。

肝心の『評価』はこうだ。一つのメカニクスを根として、そこに別のメカニクスを継ぎ足しながら木探索で完成したゲームを組み立てる。そのゲームを、強さの違う5体のAI——試し打ちの回数が10万・1万・1000回の MCTS が3体、でたらめに動くもの、何もしないもの——に遊ばせ、『期待される強さの順位』と『実際の勝率の順位』がどれだけ一致するかを順位相関(二つの並び順の一致度を測る指標)で数値化する。強い者がちゃんと強い、という順序が保たれているほど『腕前が報われる、奥行きのあるゲーム』とみなす考え方だ。数式そのものは割愛するが、要は『実力どおりの結果になるか』を質の代理指標にしている。

さらに著者らは CITS(Constrained Importance Through Search)という指標を導入する。これは、完成したゲームの質に各メカニクスがどれだけ寄与したかを、協力ゲーム理論の『シャープレイ値』(全員の貢献を公平に配分する考え方)に着想を得て見積もるものだ。本来この計算は組み合わせが爆発して手に負えないが、MORTAR は生成中に作った探索木の中だけで近似することで、現実的な計算量に抑えている。どのルールが面白さを生んでいるのかを、後から指差せるようにする工夫である。

発見

著者らは、評価の核である木探索による組み立てを、別の選び方(でたらめに選ぶ・LLM に選ばせる・最も成績の良いものを貪欲に選ぶ)と比べた。論文の Table 1 によれば、MORTAR は多様性の指標(QD スコア 31.18)、メカニクス貢献度の最大値(Max CITS 0.59)・平均値(Mean CITS 0.20)、棚を埋めた要素数(155)でいずれも最良だった。ただし『遊べるゲームになった割合』だけは貪欲な選び方(18.24)がわずかに上回り(MORTAR は16.97)、成績の良いメカニクスほど遊べるゲームになりやすい傾向がうかがえる、と著者らは述べている。

個別のゲームの例も興味深い。AllyCraft という生成ゲームは順位相関 0.8 と高く、味方を召喚して複数ユニットを操る複線的な戦略があり、奥行きが保たれていた。一方 TreasureHunt は 0.4 にとどまり、著者らは『最適な道筋を一度見つけると遊びの価値が下がる』ためだと整理している。順位相関が高いゲームほど、複数の有効な戦略が共存して飽きにくい、という対比だ。

人間による評価も行われた。10名の参加者が6本のゲームを3組に分けて遊び、『面白い・新しい・楽しい・分かりやすい・イライラする』の観点で比べた。総合点と順位相関はおおむね同じ方向を向いたが、3組目だけは逆の傾向を示し、自動指標と人間の好みを揃える難しさを著者ら自身が認めている。また2組目は『どちらでもない』票が多く(7票)、著者らはこれを『複雑すぎて意味を感じにくくなった』兆候と読み、ミニゲームは最大の複雑さではなく適度な複雑さが効く、と述べている。

使いどころ

では、ゲームやパズルを作る人はこれをどう使えるか。具体例を挙げる。第一に、メカニクスの『発想出し』だ。もし私がパズル系の小品を作っていて手詰まりなら、MORTAR のような仕組みに既存ルールを種として渡し、相性変異で『今ある仕組みに馴染む新ルールの候補』を大量に出させる使い方が考えられる。完成品ではなく、人間が選び取るためのたたき台として。

第二に、『腕前が報われているか』の自動チェックだ。本論文の評価方法——強さの違うAIに遊ばせて順位が崩れないか見る——は、メカニクス生成と切り離しても流用できる。もし自分が Sokoban-like(倉庫番のように箱を押すパズル)を作っているなら、手加減レベルの違う複数のソルバーを用意し、難しいレベルほど弱いソルバーが脱落するか、を簡易な『奥行き計測』として回せる。順位が崩れるレベルは、運や総当たりで解けてしまっている疑いがある、と読める。

第三に、『どのルールが効いているか』の切り分けだ。CITS の発想——完成したゲームの面白さを、個々のルールの貢献に分解する——は、複数の仕組みが絡み合うゲームのチューニングで役立つ。もし自分がハイパーカジュアルの PCG(自動生成)で複数ギミックを混ぜているなら、ギミックを一つずつ抜いて指標の変化を見るアブレーション(設計のどの部分が効いているかを、要素を一つずつ外して確かめる実験)に近い発想で、貢献の小さいギミックを削る判断材料にできる。

第四に、強化学習(reinforcement learning。試行錯誤しながら報酬が高くなる行動を学ぶ枠組み)の研究者にとっては、腕前の差が測れる多様なゲーム群そのものが、エージェントの汎化(未知の状況にも対応できる力)を試す試験場になる、と著者らは展望している。作る側だけでなく、AIを鍛える側にも使い道がある、という二面性がこの研究の面白いところだ。

限界

限界も率直に書かれている。著者ら自身が認めるのは、まず見た目の貧しさだ。描画は最低限でアニメーションがなく、スプライト(キャラクターの絵)も限られる。ユーザー評価でも参加者が視覚的な乏しさを繰り返し指摘した、と論文にある。次に、使った LLM が比較的小さい GPT-4o-mini であること。より強いモデルなら、もっと洗練されたメカニクスやコードになりうると述べている。さらに、2Dの見下ろし視点という設定が探索の幅を縛っていること、棚の初期化の仕方や木探索の回数が質と計算コストの綱引きになること、そして最も重要な点として、デザイナーが探索を誘導する仕組みが今はないことを挙げている。

Fukai がここで指摘するのは、評価指標そのものの偏りだ。『強いAIがちゃんと勝つか』を質の代理にする発想は明快だが、これは競争性や腕前の差が出るゲームに有利な物差しでもある。物語体験や雰囲気を味わうゲーム、あるいは『誰がやっても同じ結末でいい』タイプの体験は、この指標では低く出かねない。実際、人間評価の3組目で自動指標と好みが食い違ったのは、その境界を示している可能性があると私は読む。

もう一点、Fukai が気になったのは規模の小ささだ。人間評価は10名・6本と小規模で、著者らも『small』と明記している。5回の実行で平均を取っているとはいえ、結論を一般化するには更なる検証が要る段階だと読める。加えて、これは arXiv の preprint であり、執筆時点で広く議論された形跡は確認できない——まだ評価が定まっていない新しい提案として受け取るのが妥当だろう。

Fukai の読み

ここからは私の解釈だと断っておく。私はこの研究を、自動生成の重心が『見える成果物(レベル・地形)』から『見えない構造(ルールの関係)』へ移っていく流れの中に位置づけたい。設計批評の語彙で言えば、MORTAR がやっているのは『面白さを、腕前が結果に反映される度合いとして操作可能にする』試みに近い。面白さという曖昧なものを、いったん『実力どおりの順位が出るか』へ翻訳し、さらにその貢献をルール単位へ腑分けする——この二段の翻訳こそ本論文の核だと私は読む。完璧な物差しではないが、メカニクスを『語れるもの』にした点に価値がある、と整理できる。

おわりに

もっと深く知りたい人へ、地図になりそうな道筋を示しておく。本論文と同じ Togelius 周辺からは、PuzzleScript のパズルを LLM と木探索で生成する ScriptDoctor(Earle ら, 2025)があり、当サイトでも以前取り上げた。ボードゲームを品質多様性で進化させる GAVEL(Todd ら, 2024)、コードレベルでメカニクスを進化させる Pixie(Cook, 2025)も、MORTAR の隣に置くと『何を生成し、どう評価するか』の設計の違いが見えてくる。これらを合わせて読むと、自動ゲームデザインという領域の輪郭がつかめるはずだ。

私自身は、次の一歩として著者らが限界に挙げた『デザイナーが探索を誘導できる版』に期待している。発想出しの道具は、出すだけでなく『こちらの狙いに沿って出す』ことで初めて現場の相棒になる。濃いめのドリップコーヒーを片手に、生成されたゲームを実際に触ってみるのが、この論文の一番の読み方かもしれない。

参考文献

本記事で参照した論文と関連資料:

MORTAR: Evolving Mechanics for Automatic Game Design (Nasir, Li, James, Togelius, 2026, arXiv preprint)

・関連研究: ScriptDoctor: Automatic Generation of PuzzleScript Games via LLMs and Tree Search (Earle ら, 2025)

・関連研究: GAVEL: Generating Games via Evolution and Language Models (Todd ら, 2024)

・関連研究: Pixie: Code-level Mechanic Generation for Game Designers (Cook, 2025, AIIDE)

リアクション(ログイン不要)

匿名で残せます • 同じリアクションは1日1回まで

学ぶ — カリキュラム

学ぶ第6編 生成編 — 手で組む面、機械が生む面第16章 ルールを生む・ソルバーで測る6 / 10本

関連シリーズ

論文ダイジェスト第6回 / 全90回

次に読む

関連レビュー

編集部からのおすすめ