PAPER-DIGEST · 2026-09-29

Endrovski ら: 自動生成を一番使っていないのは、レベルを作る人たちだった — Fukai が読む

PCG・ツール設計 — 開発者120人に聞いた、自動生成ツールに本当に求めるもの

この論文は、何を明らかにしたのか?

結論から書く。ゲーム開発者 120 人に聞くと、レベルの自動生成を一番使っていないのは、本来レベルを作る側の人たちだった。アーティストの利用度は平均 0.58、デザイナーは 0.33 で、差は統計的にも偶然とは言いにくい(p = 0.001)。

もう一つの発見は、開発者が道具に求めているのが「全部おまかせ」ではないことだ。AI を使う生成ツールに望むことを聞くと、73.3% が「最終結果を自分で決められること」を選んだ。完全な自動化を望んだのは 6.7% にとどまる。著者らはこれを「AI を助手席に乗せるのはいい。だが運転席は譲らない」と表現している。

パズルを作る人にとっての要点は一つである。自動生成の道具は、賢さより「握れるハンドル」で選ばれている。生成器を作るなら、まず作り手が止められて、直せて、理由が見えるようにする。この記事では、その根拠になった数字を順に読んでいく。『Townscaper』のゲーム画面『Townscaper』(Oskar Stålberg, 2021)。置く場所を選ぶのは遊び手で、建物の形は自動で整う。論文が「実践者発のPCG」の例に挙げた作品の一つ。画像: Steam ストアページ

誰が、どこで発表した論文か?

論文の題は「What game developers actually want from procedural level generation tools」。書いたのは Bojan Endrovski(デルフト工科大学、ブレダ応用科学大学)、Joris Dormans(アムステルダムのスタジオ Ludomotion)、Rafael Bidarra(デルフト工科大学)の3人である。研究者2人に、現場のゲーム開発者が1人加わった顔ぶれだ。

発表先は、2026年8月10日にコペンハーゲンで開かれた第17回 PCG Workshop である。PCG は Procedural Content Generation の略で、ゲームの面や地形などをプログラムで自動生成することを指す。このワークショップは学会 FDG '26(Foundations of Digital Games)に併設されたもので、論文は ACM の論文集に DOI 付きで収録された。本会議の長い論文ではなく、短めのワークショップ論文である点は先に断っておく。

私がこの論文を今日選んだのは、この連載が生成技術の論文を何本も紹介してきたからだ。倉庫番を描く拡散モデルも、面を作るプログラムを進化させる研究も読んできた。だが「その道具を、現場の人は本当に使いたいのか」を正面から聞いた論文は少ない。技術の地図を読んだあとに、使い手の地図を重ねておきたかった。

自動生成は、なぜ現場に広がりきらないのか?

研究の世界では、レベル自動生成の手法は年々増えている。WFC(Wave Function Collapse。隣り合うタイルの決まりを守りながら、マス目を一つずつ確定させていく生成法)やグラフ文法(部屋のつながりを先に規則で組み立てる方法)がその代表だ。商用の道具でも Houdini や Unreal Engine の PCG 機能が広く使われている。

それでも、レベルそのものを丸ごと自動で作る商用ゲームは多くない。著者らは Steam で売れているローグライク上位20本(2026年2月時点)を調べた。レベルの形を全部手続き的に作っている作品は1本もなかった。半数近くは、レベル生成をまったく使っていなかったという(付録 Table 4)。

著者らが指摘する壁の一つは、多くの試作ツールが使い手に「アルゴリズム的な考え方」を求めることだ。中の仕組みを理解しないと、出力を思った方向に動かせない。一方で『Townscaper』や、文章生成ツールの Tracery のように広く愛された道具もある。これらは技術と設計感覚を両方持つ実践者が作ったものだ、と論文は整理している。

では、デザイナーは道具の何を大事にしているのか。著者らによれば、この問いは研究者にも道具の作り手にも重要なのに、これまであまり調べられてこなかった。この論文は、その空白を大規模なアンケートで埋めようとしている。『Slay the Spire』のゲーム画面『Slay the Spire』(Mega Crit, 2019)。論文の付録 Table 4 では、売れ筋ローグライクのうち「配置の生成(Layout Gen)」に分類されている。画像: Steam ストアページ

どうやって開発者の本音を集めたのか?

方法はオンラインのアンケートである。質問は21問で、単一選択、複数選択、段階評価、順位付け、自由記述を組み合わせた。どの質問も答えなくてよい作りにして、無理に埋めた回答が混ざらないようにしている。匿名で、個人を特定する情報は集めていない。

回答者は 120 人のゲーム開発の実務者だ。PCG 研究者のメーリングリスト、Discord のコミュニティ、大学のつながりを通じた LinkedIn で呼びかけた。公開されている分析ツールによると、募集期間は60日間である。所要時間は平均が約45分、中央値(真ん中の人の値)が10分だった。平均が大きいのは、開いたまま放置した人が一部いたためだと考えられる(これは私の推測である)。

集計には三つの道具を使っている。一つ目は数字の比較で、アーティストとデザイナーの差には Mann-Whitney U 検定(二つの集団の値の並び方がずれているかを確かめる方法)を使った。二つ目は自由記述の分類で、回答を読んで11の候補テーマを作り、最終的に9テーマにまとめた。

三つ目が面白い。過去の PCG Workshop のレベル生成論文59本と、アンケートの自由記述を並べ、それぞれでどんな話題の言葉が多いかを数えた。TF-IDF(ある文書に特によく出てくる言葉を浮かび上がらせる数え方)という手法である。研究者が書いていることと、現場が気にしていることのずれを、言葉の量で比べたわけだ。

数字から何が見えたのか?

まず回答者の顔ぶれ。多い順に、プログラマーと技術系デザイナーが 38.3%、テクニカルアーティストが 21.7%、ゲームデザイナーが 18.3%、レベルデザイナーが 10.0% だった。経験年数は0〜2年から10年以上までほぼ均等に散らばり、経験の長さで答えはあまり変わらなかったという。使っているエンジンは Unreal Engine が 65.8%、Unity が 41.7% である(複数回答)。

自動生成を何に使っているか(複数回答、Figure 5)。世界づくり(地形や背景)が 65.0%、レベルの配置や構造が 55.8%、敵の配置が 30.8% と続く。パズル生成は 12.5% だった。レベル生成を使う頻度は「いつも」10.0%、「よく」20.8%、「ときどき」23.3%、「めったに」35.8%、「使わない」9.2% である(Figure 6)。

ここで役割ごとの差が出る。「使わない」を0、「いつも」を1として点数にすると、アーティスト(30人)は平均 0.58、デザイナー(34人)は 0.33 だった(Table 2)。差は 0.25、アーティストが約76%高い。論文には「生成を自分の工程に欠かせないと答えたデザイナーは一人もいなかった」とある。レベル配置の生成の約6割は、デザイナー以外の人が担っていた。

何が不安かも聞いている(Figure 7)。多い順に「見た目や内容を思いどおりにできない」48.3%、「かける時間に見合う効果がない」44.2%、「不具合の原因を追いにくい」41.7%、「結果が読めない」38.3% である。自由記述の「その他」では、生成物が似たり寄ったりになる「procedural oatmeal(手続き的なオートミール)」問題を挙げる声が多かったという。

AI についての答えは、一つの方向にそろっていた。望む AI の役割は「特定の部品を強くする道具」が 43.3% で最多、「AI なしの規則ベースがいい」が 35.0%、「完全自動化」は 6.7% である(Figure 14)。AI への不安は「結果が読めない」48.3%、「中が見えない」43.3%、「作り手の主体性が失われる」42.5% だった(Figure 16)。著者らが関連項目をまとめ直すと、不安の 93% が「制御」に関わるものだったという(Table 3)。

最後に研究と現場のずれ(Figure 22)。千語あたりの出現数で見ると、研究論文は「アルゴリズムとモデル」が 41.0 と突出し、「制御と柔軟性」は 2.9 しかない。現場の自由記述は逆で、「制御と柔軟性」が 30.1、「アルゴリズムとモデル」は 2.7 だった。研究者が一番語る話題を、使い手はほとんど語っていない。

パズルを作る人は、この結果をどう使えるか?

一つ目。もし倉庫番のような押し出しパズルの面を自動で作る道具を書くなら、「一発で完成品を出す」より「途中で握れる」設計にする。論文の順位付けでは、生成の制約を操れること、手作りと自動生成を混ぜられること、すぐに見られるプレビューが上位に並んだ(Figure 10)。デザイナーが置いた壁や箱を「固定」でき、残りだけを生成器が埋める形にすれば、この三つを一度に満たせる。

二つ目。もし毎日1問のデイリーパズルを生成しているなら、生成の「理由」を残す。不安の上位に「不具合を追いにくい」41.7% と「結果が読めない」38.3% があった。盤面ごとに乱数の種(同じ盤面を再現するための番号)と、その盤面が選ばれた判定値を記録しておくとよい。そうすれば、変な問題が出た日にすぐ原因を追える。これは道具の作り手と使い手が同じ一人でも効く。

三つ目。もし小さなチームで、生成器はプログラマーが書き、面の良し悪しはデザイナーが決めているなら、つまみの名前をデザイナーの言葉にする。論文では、生成を担っているのはアーティストや技術職で、デザイナーは使っていなかった。「探索の深さ」ではなく「ひらめきが要る手数」のような名前にする。そうすれば、デザイナーが自分の判断を道具に乗せやすくなる。

四つ目。面を丸ごと生成するか、全部手で作るかの二択で悩んでいるなら、中間を検討する。付録 Table 4 の売れ筋ローグライクには、配置だけを生成する「Layout Gen」や、手作りの区画を組み合わせる「Chunk Assembly」に分類された作品が多く並ぶ。『Hades II』は後者に分類されている。パズルなら、手で磨いた小部屋を生成器が並べる形がこれに当たる。

五つ目。LLM(大規模言語モデル。大量の文章から学んだ、文章を作る AI)を工程に入れるなら、役割を狭く決める。望まれていたのは「特定の部品を強くする道具」で、完全自動化ではなかった。たとえばヒント文の下書きだけを任せ、盤面と正解は規則ベースの生成器と人が握る。そういう分担なら、不安の上位にあった「結果が読めない」をかなり避けられる。『Hades II』のゲーム画面『Hades II』(Supergiant Games, 2025)。論文の付録 Table 4 では「Chunk Assembly(手作りの区画を組み合わせる方式)」に分類されている。画像: Steam ストアページ

この結果は、どこまで信じてよいのか?

著者ら自身が認めている弱点は四つある。一つ目は、質問と選択肢の作り方や回答の分類に、自分たちの解釈が入り込んでいること。その対策として、データと分析ツールを公開している。二つ目は、プログラマーと技術系デザイナーを一つの役割にまとめたこと。著者らは振り返って、分けておくべきだったと書いている。

三つ目は、研究と現場の比較(Figure 22)の範囲が狭いこと。現場側は自由記述の質問1問だけ、研究側は PCG Workshop という一つの発表の場だけで代表させている。四つ目は、AI の質問で「AI」を生成 AI や LLM の意味でまとめて使ったこと。昔ながらの生成手法の多くも AI に含まれるという事実は、ここでは脇に置かれている。

Fukai がここで指摘するのは、まず回答者の集まり方である。呼びかけの中心は PCG のメーリングリストと Discord で、もともと自動生成に関心のある人が集まりやすい。「使わない」が 9.2% しかないのは、そのためかもしれない。業界全体の利用率として読むのは避けたほうがよい。

次に、比べている集団が小さい。中心の結果であるアーティストとデザイナーの差は、30人と34人の比較だ。レベルデザイナーは全体の 10.0%、約12人にすぎない。さらに注意確認の質問(きちんと読んでいるかを確かめる設問)は入っておらず、中央値は10分と短い。これらは結果を否定する理由ではないが、「方向を示す調査」として読むのが妥当だと私は考える。

最後に、パズル生成の声は薄い。パズル生成に使っている人は 12.5% で、回答の中心は 3D の世界やアクションのレベルづくりだろう。パズルは「解けるか」「解き筋が一つか」を厳密に確かめる必要があり、事情が違う面もある。上の使いどころは、その差を承知のうえで私が持ち帰ったものである。

Fukai の読み

ここからは私の意見である。私はこの論文を、2010年の Tanagra などに代表される「人と生成器が交代で手を入れる(mixed-initiative)」レベル設計ツールの流れの中に置きたい。その流れは十数年、「人に握らせる生成器」を作ろうとしてきた。この論文は、それがまだ現場の標準になっていないことを数字で確かめた形になっている。設計批評の語彙で言えば、デザイナーが手放したくないのは作業ではなく「判断」なのだと読める。だから生成器が判断の理由を見せない限り、どれほど良い面を出しても道具として選ばれにくい。著者らも最後に、デザイナーにとっての壁は技術ではないと推測している。私はそれを「生成器はまず、作り手の判断を映す鏡であるべきだ」と言い換えたい。

次に何を読むと、地図が見えるか?

もっと深く知りたい人は、まず著者らが公開している分析ツールを開いてみてほしい。役割や経験年数で絞り込みながら、全21問の回答を自分で眺められる。レベルデザイナーだけに絞ると何が見えるか、私も時間を見つけて試すつもりだ。

技術の側の地図としては、この連載の過去回が役に立つ。面ではなく「面を作るプログラム」を進化させる研究や、重力や時間を生成の座標にする研究は、生成器の「賢さ」を押し広げる仕事だ。LLM にデザインピラーを突いてもらう研究は、AI を助手席に置く試みとして今日の論文と並べて読める。

同じ PCG Workshop 2026 からは、詰まると易しくなるクロスワード生成の論文も出ている。こちらは作り手ではなく、遊び手に合わせて生成器が動く例だ。作り手に握らせる生成と、遊び手に合わせる生成。二つを並べると、自動生成の居場所がかなりはっきり見えてくる。

参考文献

本記事で参照した論文と関連資料:

・What game developers actually want from procedural level generation tools (Bojan Endrovski, Joris Dormans, Rafael Bidarra, 2026, PCG Workshop 2026 / FDG '26)(PDF を通読)

・DOI: 10.1145/3815598.3815682(ACM FDG '26 論文集)

・Procedural Level Generation Survey — 著者らが公開したデータと対話型分析ツール

・PCG Workshop 論文データベース(2026年の採択論文一覧を含む)

・関連研究: Tanagra: a mixed-initiative level design tool (Gillian Smith, Jim Whitehead, Michael Mateas, 2010, FDG '10)

リアクション(ログイン不要)

匿名で残せます • 同じリアクションは1日1回まで

関連シリーズ

論文ダイジェスト第96回 / 全98回

次に読む

編集部からのおすすめ