PAPER-DIGEST · 2026-08-23
Pfau & Vrettis: プレイヤーに自分だけのポケモンカードを作らせたら — Fukai が読む
PCG / トレーディングカードゲーム / 生成AIと作り手意識
一段落要約
「自分で考えたポケモンのカードが、20秒で本物らしい一枚になる」。今日読んだのは、それを本当にやってみた論文だ。プレイヤーが名前と短い設定を書き込むと、AI が絵と技と数値をまとめて1枚のカードに仕上げる。作ったのは学生49人、合計196枚である。
『Magic: The Gathering Arena』(Wizards of the Coast、2023年)のプレイ画面(Steam ストアページより)
面白いのは満足度の中身だ。見た目の満足は5点満点で平均4.25。そして「最終的な出来は誰の発想か」と聞くと、93.5%が「自分の発想だ」と答えた。AI に作らせたのに、自分のものだと感じている。著者はこれを「手続き的な関わり(procedural relatedness)」と呼ぶ。
ただし注意もある。できたカードは、まだ一度も対戦に使われていない。強すぎるカードも弱すぎるカードも、実戦では確かめられていないままだ。ここは記事の後半でしっかり書く。
この論文について
論文の題は "From LLM-Driven Trading Card Generation to Procedural Relatedness: A Pokémon Case Study"。著者は Johannes Pfau と Panagiotis Vrettis の2名で、どちらもオランダのユトレヒト大学に所属する。2026年4月30日に arXiv へ出た preprint(査読を通す前に公開される原稿)である。番号は arXiv:2604.27972v1、区分は cs.AI、ライセンスは CC BY-NC-ND 4.0 と表示されている。
私が今日これを選んだ理由は二つある。一つは、この欄で最近扱った論文が「AI にゲームを解かせて点をつける」型に偏っていたこと。もう一つは、この研究が珍しく「作った人の気持ち」を主役に据えていることだ。生成 AI の研究で、出来ばえではなく「自分のものだと思えたか」を測ったものは多くない。
投稿から4か月ほどしか経っておらず、被引用はまだほとんど無いと見てよい。広く議論された段階ではない。本文には査読を通ったという記載も見当たらなかった。そのつもりで読んでいく。
強いカードだけが残る問題
トレーディングカードゲーム(TCG。集めたカードで自分の山札を組んで戦うゲーム)は大きな産業だ。論文は1993年の『Magic: The Gathering』を出発点に挙げ、いまや数十億ドル規模だと書く。Magic だけで5,000万人を超える人が遊び、売上は10億ドルを上回るとも紹介している。
そこには繰り返し起きる問題がある。新しいカード群が出るたび、強い組み合わせが数か月で固まってしまうことだ。論文はこれを、メタゲーム(その時期に有力とされる戦法の全体像)が「限定的で、停滞し、繰り返しになる」と表現している。名目上は何千枚もあるのに、実際に使われるのはひと握りになる。
もう一つはパワークリープだ。新しいカードを魅力的に見せようとして、性能が少しずつ上がっていく現象を指す。論文はこれが「運営が続くゲームなら、ほぼどれにでも起きる」と書いている。
そして著者が一番惜しんでいるのは、カードへの愛着が消えることだ。かつては好きなキャラクターの一枚を大事に持っていた。強さだけで選別された環境では、その関係が残らない。ここを取り戻せないか、というのがこの研究の出発点である。
『Slay the Spire』(Mega Crit、2019年)のプレイ画面(Steam ストアページより)
カードの自動生成そのものは新しくない。論文は、ニューラルネットに Magic のカードを書かせた RoboRosewater(2015)、系列モデルでカードの記述を補完した Summerville & Mateas(2016)、文法でハースストーンのカードを作りバランスまで予測した Chen & Guy(2020)を先行研究として並べている。
この論文が新しいと主張するのは、そこに二つを足した点だ。一つは、技や数値だけでなく絵まで同時に作ること。もう一つは、プレイヤー本人を生成の入口に置くこと。著者が掲げる問いは3つある。生成 AI の進歩を、見た目と仕組みという複数の面でどう束ねるか。プレイヤー起点の生成で、本人の構想への忠実さと見た目の良さをどこまで保てるか。そして構想と生成のずれを詰めるのに、どんな直し方が向いているか、である。
5つの工程でカードを1枚組み立てる
仕組みは5つの工程に分かれている。順に、手本になるカードを集める、似たカードを引き当てる、文章モデルで数値と技を埋める、画像モデルで絵を描く、最後にカードの体裁に組み上げる、である。
論文が示す5工程の流れ(図解・筆者作成。論文の図の転載ではない)
1つ目。公式の Pokémon TCG Developer Portal API から15,411枚を取り込み、そこから993枚に絞る。第9世代までの「たね」ポケモンだけを残した形だ。カードは名前・説明文・タイプ・HP・技・弱点などが並ぶ構造化データ(JSON。項目名と値が対になった書式)として扱われる。
2つ目は検索だ。プレイヤーが書いた入力(名前・説明文・タイプ)に近い既存カードを探し出す。使うのは nomic-embed-text-v1.5 という埋め込みモデル(文章を数値の並びに直して、意味の近さを測れるようにする道具)である。近いものを手本として一緒に渡すこのやり方を、論文は RAG(Retrieval-Augmented Generation、検索でお手本を引いてから書かせる方式)と呼んでいる。
3つ目で文章モデルが穴を埋める。使われたのは Qwen3-14B。指示は「私が書き始めた JSON の hp・abilities・attacks・resistances・weaknesses・retreatCost を埋めよ」という形だ。白紙から作らせるのではなく、決まった欄を埋めさせている。
4つ目は絵だ。FLUX.1-dev-Q8 という画像生成モデルを、手元の ComfyUI で動かす。絵柄を揃えるため、Niji 系と「ポケモン(杉森建)風」の2つの LoRA(少ない追加データで絵柄を寄せる追加学習の手法)を混ぜている。5つ目では Pokécardmaker というウェブの道具で1枚の体裁に組む。1枚あたり約20秒、計算は NVIDIA RTX 5090 で行われた。
196枚が語ったこと
評価に参加したのは49人。ゲーム・メディア技術と人工知能の修士課程の学生で、内訳は男性75.5%・女性24.5%である。1人4枚ずつ作り、合計196枚が集まった。参加者は自分のパソコンに一式を入れても、用意されたサーバを使ってもよく、モデルや設定、指示文を自分で変える自由もあった。
採点は5段階だ。見た目の満足度は平均4.25(標準偏差0.9)。「思い描いた絵にどれくらい近いか」が3.95(1.07)。「技や数値が構想に合っているか」が4.04(0.75)。3つとも良い側に寄っている。
内訳のほうが示唆に富む。絵については35.5%が「一発で納得」、38.4%が「少し手直しして納得」。技や数値のほうは「一発で納得」が51.0%とさらに高い。最後まで納得できなかったのは、絵で11.6%、技や数値で10.2%だった。合計すると、絵は88.4%、仕組みは89.8%が最終的には納得に至っている。
直し方の内訳も出ている。指示文の書き直しが51.8%で最多。同じ指示でもう一度作り直したのが18.8%、元の構想のほうを変えたのが13.4%、細かい設定をいじったのが6.3%、手作業で描き足したのが0.9%。そして「あきらめた」が8.9%ある。
最後に、できあがりを「自分の発想」と答えた人が93.5%、「AI の発想」と答えた人は1.4%だった。14人は期待を超えたと明記し、7人は自分が最初に思い描いたものより生成結果のほうが好きだと答えている。
自由記述のほうは、著者2名がそれぞれ独立にコードを付ける手順(主題分析)で整理された。そこから、失敗を仕組みのせいではなくモデルの性能不足と受け取った人が10人いたことも分かっている。道具が未熟なだけで、やり方自体は筋が良い、と受け止められた形だ。
論文の図には実例が名前つきで並ぶ。うまくいった例として Glister、Ferrafox、Möbiusect などが挙がる。失敗例は Zagarin(技の説明が足りない)、Aurellune(強すぎる)、Oricrane(同じ記述の繰り返し)である。
作る側が持ち帰れること
一つ目。「自由に作らせる」のではなく「決まった欄を埋めさせる」設計にすること。この研究の仕組みは、既存カードの構造をそのまま雛形にしている。もし自分がデッキ構築ゲームを作るなら、AI に渡すのは白紙ではなく穴あきの様式にしたい。生成の自由度を落とすほど、使える結果の割合は上がるはずだ。
二つ目。直しの導線は「作り直し」より「言い直し」を主役にすること。半数以上(51.8%)が指示文の書き直しで解決している。作り直しボタンだけを大きく置く画面は、実際の直し方と噛み合っていない。入力欄をその場で書き換えられるほうが効く。
『Balatro』(LocalThunk / Playstack、2024年)のプレイ画面(Steam ストアページより)
三つ目。「あきらめた 8.9%」を数える仕組みを入れること。生成の道具の出来は、うまくいった作品だけ眺めていても分からない。何回目で離脱したか、どの工程で止まったかを記録しておくと、次に直す場所が見える。
四つ目。見た目と仕組みを別々に聞くこと。この研究では絵の満足度と技・数値の満足度が別々に測られ、値も分かれた。片方だけ直せば済む場面は多い。パズルの自動生成でも、「見た目の納得」と「解いた手応え」は分けて聞いたほうがよいと私は考えている。
五つ目。規模の話だ。この仕組みは、手元のパソコン1台で動いている。文章モデルは14B級、画像モデルは量子化した FLUX、生成は1枚約20秒。外部の API に頼らなくても、個人開発の範囲で試せる規模である。参加者が自分の環境に入れて動かせた事実が、それを裏づけている。
六つ目、これは注意のほうだ。生成したカードを、いきなり勝敗のある場所に入れないこと。理由は次の節に書く。まずは一人用、コレクション、見せ合いといった「負けても誰も困らない場所」から始めるのが安全である。
分かっていないこと
著者自身が認めている弱点は明快だ。最大のものは、作られたカードが一度も遊ばれていないことである。論文は、印刷版にもデジタル版にも投入していないと明記している。つまりバランスは未検証のままだ。
著者はバランスの重要性も認めている。生成物は、他を圧倒することも圧倒されることもなく成立していなければならない、という趣旨の一文がある。自分たちの対戦シミュレータに触れつつ、今回の範囲を大きく超えるとして先送りしていた。
ほかに著者が挙げるのは、参加者が49人のゲーム/AI 系修士学生に偏っていること、扱ったのがポケモンのカードだけで他の TCG では試していないこと、そして著作権や知的財産の懸念だ。モデル側の弱点としては、作り話(存在しない技を書いてしまう類い)、記憶と推論の限界、数の扱いの弱さ、同じ入力でも結果が揺れることを挙げている。カードが1枚ずつ独立に作られ、セット全体の文脈を見ていない点も認めていた。
Fukai がここで指摘するのは、採点の立ち位置だ。「思い描いた通りか」を採点したのは、そのカードを作った本人である。自分で手をかけたものは高く見えやすい。第三者が同じ196枚をどう評価するかは、この研究からは分からない。
Fukai がもう一点指摘するのは、比べる相手がいないことだ。「自分の発想」93.5%という値は天井に近い。しかし、たとえば「AI が勝手に作ったカードを渡された群」が無いので、この数字が高いのかどうかを判定する物差しが無い。著者の言う「手続き的な関わり」も、愛着そのものを測る尺度で確かめられてはいない、と読める。
Fukai の読み
私はこの研究を、「生成 AI をどこに置くか」という配置の問題として読みたい。この仕組みは、AI に発想させていない。発想はプレイヤーがやり、AI は決まった欄を埋める係に回っている。だから作り手意識が残ったのだと私は考えている。設計批評の言葉で言えば、これは「創造の自動化」ではなく「清書の自動化」に近い。もし順序を逆にして、構想のほうを AI に出させていたら、93.5%という数字は出なかったのではないか。これはあくまで私の読みで、論文が比較実験で示したことではない。
おわりに
この分野の地図を広げたい人のために、論文が下敷きにしている研究をいくつか挙げておく。RoboRosewater(2015)は、ニューラルネットに Magic のカードを書かせた初期の試みだ。Summerville & Mateas(2016)はカードの記述を系列モデルで補完した。Chen & Guy(2020)は文法でハースストーンのカードを生成し、バランスの予測まで踏み込んでいる。いずれも本記事では論文の引用として名前を挙げただけで、原典は読み直していない。
本サイトでは以前、ボードゲームの設計を発想から完成まで支援する AutoBG の論文も紹介した。あちらは「AI に設計させる」側の話である。今日の論文と並べて読むと、生成 AI をどこに座らせるかで結果がどう変わるのか、輪郭がはっきりしてくるはずだ。
参考文献
本記事で参照した論文と関連資料:
・同論文の HTML 全文(Approach の5工程、Evaluation の参加者と手続き、Results の数値、Limitations & Future Work を含む)
・Johannes Pfau の Google Scholar プロフィール(第一著者。ユトレヒト大学 Assistant Professor)
・本稿が下敷きにしている先行研究: Milewicz / RoboRosewater (2015) の Magic カード生成、Summerville & Mateas (2016) の系列モデルによるカード補完、Chen & Guy (2020) の文法によるハースストーン生成とバランス予測、Summerville et al. (2018) の PCG 総説、Maleki & Zhao (2024) の LLM×PCG 総説。いずれも本記事では論文の引用として名前を挙げただけで、原典は読み直していない。
・記事内のゲーム画像の出典: Magic: The Gathering Arena (Wizards of the Coast, 2023) の Steam ストアページ、Slay the Spire (Mega Crit, 2019) の Steam ストアページ、Balatro (LocalThunk / Playstack, 2024) の Steam ストアページ。いずれも論文とは無関係で、話題に合う実在のカードゲームとして引いた。
・5工程の図は筆者の自作であり、論文の図の転載ではない。
リアクション(ログイン不要)
匿名で残せます • 同じリアクションは1日1回まで
関連シリーズ
論文ダイジェスト第66回 / 全104回

