PAPER-DIGEST · 2026-10-03

Li: 「塔を高く」は通り、「中を空洞に」は通らなかった — AI 生成器の注文の効き目を地図にする — Fukai が読む

学習型 PCG — どの構造の条件なら生成器に学ばせられるか

まず要点(TL;DR)

「塔は高く、建物は左右対称に」。そう頼んだとき、AI の生成器はどの注文を本当に守ってくれるのか。東京の独立研究者 Alex Chengyu Li は、Minecraft の建物を作る学習型の生成器で、この問いを地図にした。

測った14の性質は三つに分かれた。指定どおりに大きく動く「操れる」が9つ、少しだけ動く「近づける」が4つ、ほぼ動かない「反応しない」が1つ(建物の中の空気の割合)。さらに、指定していない性質がどれだけ動くかは、学習データから事前にある程度読めた(順位相関 0.879)。ただし性質の数は10個だけで、著者自身が「予測として一般化するには小さい」と書いている。

はじめに — 「どの注文が通るか」を先に知りたい

おはよう。今朝もホットの濃いめのドリップコーヒーを淹れて、一本プリントした。紹介するのは Which Structural Constraints Are Learnable? A Regime Map for a Minecraft Voxel Generator(どの構造の制約なら学べるのか — Minecraft のボクセル生成器の「領域地図」)だ。

著者は Alex Chengyu Li。肩書きは東京在住の独立研究者で、大学や企業の研究所には属していない。発表先は FDG '26(Foundations of Digital Games。2026年8月10〜13日、コペンハーゲン)に併設された PCG Workshop(Procedural Content Generation、コンテンツの自動生成を扱う研究会)。査読を経たワークショップ論文で、DOI も振られている。

今日これを選んだのは、問いがとても実務的だからだ。生成 AI に「こうしてほしい」と条件を付ける話は多い。けれど「その条件が効くかどうかを、学習させる前に見積もる」話は少ない。作る側にとって、学習のやり直しは時間もお金もかかる。先に当たりを付けられるなら、それだけで価値がある。

なお、発表から2か月ほどの論文で、まだ広く議論されている段階ではない。その前提で読んでほしい。

背景 — 同じモデルの中でも、効く注文と効かない注文がある

論文の書き出しは、レベルデザイナーの困りごとだ。「塔は高く、建物は対称にしたい。生成器はどちらを守ってくれるのか」。学習型の自動生成(データから作り方を覚えるタイプ)は、条件を付けて出力を寄せることができる。ところが、ある条件はよく効き、別の条件はほとんど効かない。それが同じモデルの中で起きる、と著者は言う。

手で規則を書く生成なら、話は単純だ。規則に書いたことは必ず守られる。Townscaper のように、置いた場所に合わせて建物が組み上がる作品もある。規則を書く設計なら、その「守られる範囲」は作り手が把握できる。学習型ではそうはいかない。何が守られるかは、データとモデルの組み合わせ次第になる。Townscaper のスクリーンショットTownscaper(Oskar Stålberg)のストア掲載スクリーンショット。置いた場所に合わせて建物の形が自動で組み上がる。画像: Steam

著者が問題にしているのは、この「やってみないと分からない」状態だ。高価な実験を回す前に、作り手が頼れる目安がない。そこで論文は二つを問う。どの制約なら学べるのか。そして、それは学習データだけから予測できるのか。

アプローチ — 6つの「お題」を付けて建物を作らせ、14の性質を測る

材料は Minecraft の建物 10,310 件。3D-Craft など三つの出どころから集め、32×32×32 マスのボクセル(立方体のブロックで形を表す方式)にそろえた。ブロックの種類は 513 に整理している。

生成器は二段構えだ。まず VQ-VAE(形を小さな「部品番号」の並びに圧縮し、またもとに戻す仕組み)で、建物を 8×8×8 の番号の並びにする。次に、その番号を一つずつ順番に予想していくモデル(言葉を一語ずつ続ける言語モデルと同じ発想)で新しい建物を作る。それぞれ約4000万パラメータ(モデルの中の調整つまみの数)だ。Teardown のスクリーンショットボクセルで世界を組むゲームの例、Teardown(Tuxedo Labs)のストア掲載スクリーンショット。画像: Steam

条件の付け方は CFG(classifier-free guidance。条件ありとなしの出力の差を強調して、条件の方へ寄せる手法)。お題は6つ。高さ、ブロック数、敷地の広さ、左右対称か、囲まれた空間があるか、形の複雑さ。どれも「低・中・高」のような区分にしてある。

評価では、お題ごとに40個(5つの乱数の種 × 8個)を作り、14の性質を測った。そのうち4つ(高さ・ブロック数・対称性・囲い)はお題そのものだ。残る10は、お題としては指定していない性質で、論文はこれを「創発的な性質」と呼ぶ。階数、細長さ、表面の割合、上下の層のそろい方、建物の中の空気の割合などだ。効き目は「お題なしの平均から、最大で何%動いたか」で測り、ブートストラップ(データを何度も引き直してばらつきを見る方法)で95%の幅も付けた。

仕分けの線は単純だ。100%を超えて動けば「操れる(Controllable)」、20〜100%なら「近づける(Approachable)」、20%未満なら「反応しない(Unresponsive)」。この三つの区分を、14の性質それぞれに当てはめたものが、題名にある「領域地図」になる。地図にしておけば、新しい注文を足したとき、それがどの区分に入りそうかを見比べられる。

発見 — 9つは大きく動き、1つ「中の空気」だけが動かなかった

論文の Table 1 から主な数字を引く。100%を超えて動いた「操れる」は9つ。高さ 266%、ブロック数 632%、左右対称 237%、階数 182%、縦長さ 333% などだ。このうち7つは、95%の幅がすべて「操れる」の範囲に収まった。残る2つは境目にかかる。つながった塊の数(128%)は幅が下の区分にはみ出し、囲いの割合(564%)は元の値がほぼゼロのため、割合が大きく見えているだけだ。論文によれば、元の平均は 0.00003、実際の変化は約 0.006 しかない。

20〜100%の「近づける」は4つ。細長さ 64%、表面の割合 32%、層のそろい方 44%、敷地の詰まり具合 51%。20%未満の「反応しない」は1つだけで、建物の箱の中に占める空気の割合(hollowness)が 14% だった。

次が予測の話だ(Figure 1)。指定していない10の性質について、二つの量を掛け合わせた点数を作った。一つは、指定した性質とどれだけ連動しているか。もう一つは、学習データの中でその性質がどれだけばらついているか(変動係数)。この点数と実際の効き目の順位相関は 0.879(p=0.002、n=10)だった。片方だけだと 0.624 と 0.636 で、どちらも有意ではない。「連動していて、しかもデータに幅がある」性質ほど動きやすい、と読める。

最後に、CFG の強さを 0・2・4 と変えた(Table 2)。階数は 88% → 167% → 197% と上がり、「近づける」から「操れる」に移った。著者はこれを「頻度の床」(学習例が少ないだけで、押せば動く状態)の例としている。一方、中の空気の割合は 6% → 12% → 19% と少しずつしか上がらず、20%に届かなかった。もっと強く押せば越えるのかは「未検証」と著者は書いている。

使いどころ — 作り手が持ち帰れる3つの手順

一つ目。もし自分がボクセルや区画で建物・ダンジョンを作る生成器を育てるなら、学習の前に「注文したい性質のリスト」を作り、学習データで二つを測っておく。指定する性質と連動しているか。データの中でばらついているか。どちらも低い性質(この論文では中の空気の割合)は、学習だけに任せず、後から規則で直す前提で設計しておける。著者も、効かない性質には明示的な制約の仕組みを重ねる手を挙げている。

二つ目。もし倉庫番(Sokoban)のようなパズルの面を学習型で作っているなら、「解ける」「手数が中くらい」などの注文を同じ考え方で仕分けできる。条件の強さを2〜3段階で振って、効き目がどう伸びるかを見る。強くすると伸びるなら、データを足す・強く押す・追加学習するで届く見込みがある。ほとんど伸びないなら、仕組みそのものを変えるか、出てきた面をソルバー(解けるか確かめるプログラム)で選び直す方に投資する。

三つ目。生成器の仕様書やツールの説明に、「この条件は強く効く/ゆるく効く/効かない」の三段階表示を付ける。レベルデザイナーは、どのつまみを信じてよいかが分かる。期待しすぎて裏切られることも減る。特に、割合で見ると大きいが実際の変化は小さい項目(この論文の囲いの割合)には、元の値も並べて書いておくと誤解が防げる。

四つ目。もし毎日1問を自動で出すデイリーパズルを作っているなら、「難しさ」のような指定したい性質が、データの中で十分ばらついているかを先に確かめる。簡単な面ばかりのデータからは、難しい面を頼んでも出にくい。これは論文の「頻度の床」の考え方を、そのまま当てはめた読み方だ。足りない区分の面を手で作り足すのが、いちばん安い対策になりうる。

限界 — 一つの仕組み、小さなデータ、10個の点

著者自身が認めている弱点は多い。データは 10,310 件と、3D の学習型生成としては小さく、出どころもまちまちだ。仕組みは一つだけ。予測の相関は 10 個の性質から出したもので、95%の幅は 0.55〜0.97 と広い。著者は点数の作り方を「仮説であって検証済みではない」と書いている。お題そのものの性質4つは全部よく効いたため、「効かない例」がなく、そちらは一般化できない。

さらに、区分の境目にある判定は、どのお題で試したかに左右される。1お題40個が5つの乱数の種にまとまっているので、ばらつきを小さく見積もっている可能性もある。そして測ったのは形の反応だけで、見た目の良さは別に評価が要る。結論の節でも、結果はこの仕組みに限ったもので、より大きなデータ、別の構造、別の種類のコンテンツで試すべきだとしている。

Fukai がここで指摘するのは二点だ。一つは、人の評価がないこと。「操れる」は数字が動いたという意味で、デザイナーが欲しい形になったかとは別の話だ。もう一つは、「中の空気の割合」が動かなかった理由がまだ切り分けられていないこと。データに幅が少ない(変動係数 0.23)ことは書かれているが、強く押したら越えるのかは未検証だ。「効かない性質は仕組みを変えるべき」という提案を、この1例だけで受け取るのは早いと私は読む。

Fukai の読み — 生成器の「取扱説明書」を書く研究

ここからは私の意見だ。私はこの研究を、Smith と Whitehead が2010年に始めた「表現の幅」の分析(生成器がどんな出力の範囲を持つかを図にする方法)の流れの中に置きたい。あちらは「何が出てくるか」を描いた。こちらは「何を頼めば動くか」を描いている。設計批評の語彙で言えば、生成器のつまみ一つひとつに「効き目の表示」を付ける作業だ。モデルを賢くする研究ではなく、モデルを道具として使う人のための取扱説明書を書く研究、と整理できる。独立研究者が一人で、コードと学習済みモデルまで公開しているのも、その姿勢に合っている。

おわりに — 地図を広げるための次の一冊

もっと深く知りたい人は、まず Smith と Whitehead の表現の幅の論文を読むと、「生成器を測る」という発想の出発点が見える。次に、Karth と Smith の WaveFunctionCollapse の論文を読むと、学習ではなく規則で形を守る側の考え方が分かる。この論文が「効かない性質には規則を重ねよ」と言うとき、その規則の側の代表例だ。

条件付けの仕組みそのものに興味があれば、Ho と Salimans の classifier-free guidance の論文が原典になる。三本を並べると、「何が出るか」「何が守られるか」「どう寄せるか」の地図がそろう。著者は Zenodo にコードと実験結果、学習済みモデルを置いているので、自分のデータで同じ診断を試すこともできる。

参考文献

本記事で参照した論文と関連資料:

・Which Structural Constraints Are Learnable? A Regime Map for a Minecraft Voxel Generator (Alex Chengyu Li, 2026, PCG Workshop at FDG '26)

・DOI: 10.1145/3815598.3815669

・コード・実験結果・学習済みモデル(Zenodo): 10.5281/zenodo.20821894

・関連研究: Analyzing the expressive range of a level generator (Gillian Smith, Jim Whitehead, 2010, PCG Workshop 2010)

・関連研究: WaveFunctionCollapse is constraint solving in the wild (Isaac Karth, Adam M. Smith, 2017, FDG '17)

・関連研究: Classifier-Free Diffusion Guidance (Jonathan Ho, Tim Salimans, 2022, arXiv)

リアクション(ログイン不要)

匿名で残せます • 同じリアクションは1日1回まで

関連シリーズ

論文ダイジェスト第100回 / 全100回

次に読む

編集部からのおすすめ