PAPER-DIGEST · 2026-10-01
Lessard ら: シミュレーションが生んだ「面白い話」を、機械は掘り当てられるか — Fukai が読む
創発的ナラティブ — ストーリー・シフティングの実験と、その意外な結末
一段落要約
シミュレーションが勝手に生んだ出来事の山から、「面白い話」だけを機械に選ばせる。その試みを正直に報告した論文である。結論は意外だった。24人の読者に一番好まれたのは、何の工夫もせずに選んだ「対照」の話だったのだ。
著者たちは、22万8千件の出来事から話を拾う物差しとして「起こりにくさ」と「劇的状況」の2つを試した。拾った6つの話は、人間の書き手と GPT-4 がそれぞれ短編小説にした。読者はその12本を5段階で評価した。
物差しの効果ははっきりしなかった。代わりに見えてきたのは2つの力である。素材そのものの良し悪し(ストーリー効果)と、語り方の良し悪し(ナラティブ効果)だ。そして著者は、こうした話は「その世界を知っている人」にしか面白くないのではないか、と問い直している。
誰が、どこで発表した論文か
著者は Jonathan Lessard、Stephen Friedrich、Samuel Paré-Chouinard、Leila Kosseim の4人。全員がカナダ・モントリオールのコンコルディア大学に所属している。実験の舞台になったシミュレーションは、同大学の研究室 LabLabLab が作ったものだ。
発表先は、2026年8月10〜13日にコペンハーゲンで開かれた FDG '26(Foundations of Digital Games)に併設された PCG ワークショップである。PCG(Procedural Content Generation、コンテンツの自動生成)を扱う小さめの場で、論文もワークショップ論文らしく短い。DOI は 10.1145/3815598.3815687 で、CC BY 4.0 で公開されている。
私がこれを今日選んだ理由は単純だ。「うまくいかなかった」ことを、ここまで率直に書いた論文は珍しい。しかも失敗の理由を掘り下げた結果、ゲームを作る人にとって大事な問いが一つ浮かび上がっている。なお公開から日が浅く、まだ広く議論されていない段階の論文である。
「砂から金を探す」という発想
Dwarf Fortress や RimWorld のようなゲームでは、決まった筋書きがない。住人たちがそれぞれのルールで動き、その結果として「話」が生まれる。こうした話を創発的ナラティブ(emergent narrative。作者が書かず、システムの動きから自然に生まれる物語)と呼ぶ。
Dwarf Fortress(Steam ストアのスクリーンショット)。論文が「プレイヤーの語り直し」の先例として挙げる作品
問題は、出来事の大半が退屈なことだ。誰かが木を切った、誰かが食事をした。その中に、たまに「語りたくなる」出来事の連なりが埋もれている。研究者 James Ryan は2018年の博士論文で、これを「作りすぎて、あとで選ぶ」方法として整理した。後から話を探し出す処理を、ストーリー・シフティング(story sifting。出来事の山から物語になりそうな連なりをふるいにかけて拾う処理)と呼ぶ。
論文はこれを「砂金掘りが大量の砂をふるって、金の粒を探す姿」にたとえている。題名の「ゴールド・ディギング」はここから来ている。
先行研究もある。Kreminski らは2022年に「意外さ」で話を順位づける方法を提案した。ただし多くの研究が確かめてきたのは、アルゴリズムが正しく動くかや、道具が使いやすいかだった。読者が実際に「面白い」と感じるかを測った例は少ない。この論文はそこを狙っている。
どうやって「面白い話」を探したのか
舞台は、LabLabLab が2020〜2024年に作った社会シミュレーション Chroniqueur(クロニクール)だ。狩猟採集の集団が、自動生成された島を少しずつ埋めていく。資源が足りなくなると、農耕や牧畜、身分の差、都市化が進む。いわば新石器時代の変化を丸ごと動かす仕組みである。
Chroniqueur は、すべての出来事と、誰が関わったか、何が何を引き起こしたかを記録している(Ryan の言う「因果の帳簿づけ」)。実験に使った世界「Preparipate」では、ゲーム内で61年を回した。その結果、22万8千件の出来事と、2万7千本の出来事の連なりが生まれた。
まず著者たちは、物語論の研究者 Schmid が挙げた「出来事らしさ」の5つの条件を物差しにしようとした。関連性、起こりにくさ、取り返しのつかなさ、繰り返されないこと、後に残る影響、の5つだ。しかし多くは実装がうまくいかなかった。たとえば「後に残る影響」は、どう数えても同じ種類の出来事ばかりが上位に来た。
残ったのが「起こりにくさ」である。出来事の流れ全体を確率の連鎖として捉え、一番起こりにくい連なりを探す方法をとった(論文ではマルコフ連鎖、つまり「次に何が起きやすいか」の確率で流れを表すモデルを使ったとだけ書かれ、細部は示されていない)。
もう一つは「劇的状況」だ。1912年に Georges Polti がまとめた「36の劇的状況」のうち、10個がこの世界で検索できた。「嘆願」「復讐が追う犯罪」「身内同士の復讐」「敵を愛してしまう」などである。著者たちはこれらを使って話を検索し、並べ替える専用の画面も作った。
読者にどう評価してもらったか
選んだ話は6つ。「起こりにくさが最大の、復讐が追う犯罪」と「ランダムに選んだ、復讐が追う犯罪」。同じく「嘆願」の最大とランダム。そして「劇的状況なし」の最大とランダムだ。最後の「劇的状況なし・ランダム」が、何の物差しも使わない対照にあたる。
ここで著者は一工夫している。シミュレーションが出す定型文をそのまま読ませると、文章の拙さが評価を左右してしまう。そこで各話を、同じ一人の人間の書き手と GPT-4 の両方に、約500語の短編にしてもらった。GPT-4 への指示は「筋から外れずに、大衆小説のように楽しく書いて」というものだ。こうして素材の良し悪しと語りの良し悪しを分けて見ようとした。
読者は24人。コンコルディア大学の美術・歴史・英文学の教員と学生から集め、12人ずつ2組に分けた。各組は6つの話を1本ずつ読み、うち3本が人間版、3本が GPT 版になるよう組んである。「面白かった」「筋が通っていた」「読んで楽しかった」「人物に厚みがあった」「驚きがあった」「追いやすかった」の6項目を、5段階で答えてもらった。
何が分かったのか
一番の結果は、仮説と逆だった。論文は「皮肉なことに、はっきり一番好まれたのは対照の話だった」と書いている。起こりにくくもなく、劇的状況もない「Gossip(うわさ話)」という話だ。物差しを使って選んだ話が、使わずに選んだ話に勝てなかったのである。
人間版と GPT 版の比べ合いでは、概して人間版が好まれた。論文によれば「読んで楽しかった」の平均で人間版を上回った GPT 版は2本だけで、それも評価の低い話同士の比較だった(論文の Figure 4、話ごとの「楽しさ」の平均)。
語りの力がはっきり出たのが「Meteor(隕石)」の話だ。起こりにくさは最大級だが、劇的状況はない。この話の人間版は12本中3位だったのに、GPT 版は12位、つまり最下位だった。同じ出来事の連なりでも、語り方ひとつで評価がここまで割れる。著者はこれを「ナラティブ効果」と呼んでいる。
逆に「ストーリー効果」もあった。うわさ話や恋愛の話は、人間版でも GPT 版でも上位に来た。論文の言葉では「良い素材は、凡庸な語りでも光りうる」。一方で盗みと復讐の話は、人間版でも GPT 版でも下位だった。素材として弱かったと読める。
なお、この論文は平均値の具体的な数字や統計的な検定(差が偶然でないかを確かめる計算)を示していない。結果は主に Figure 4 の順位と、著者の考察として述べられている。読者からは「不倫」の筋が何度も出てくる、という感想もあったという。
ゲームを作る人は、これをどう使えるか
一つ目。もし自分がコロニー経営や村づくりのシミュレーションを作っているなら、「今週のできごと」をプレイヤーに見せる機能に効く。この論文が言うのは、統計的に珍しい出来事を選ぶだけでは足りない、ということだ。プレイヤーが名前を知っている住人、覚えている場所が絡む出来事を優先する方が、筋が良いと読める。
RimWorld(Steam ストアのスクリーンショット)。住人の行動から話が生まれる、創発的ナラティブの代表的なゲーム
二つ目。自動生成したパズルから「今日の一問」を選ぶ場面にも持ち帰れる。解の形が一番珍しい盤面が、一番面白いとは限らない。この論文の「起こりにくさ ≠ 面白さ」は、パズルの選別にもそのまま当てはまる警告だ。珍しさで候補を絞ったら、最後は人に遊んでもらって確かめる。その順番を守るのが安全だろう。
三つ目。LLM(大規模言語モデル。大量の文章から学び、文章を生成する AI)に出来事を語らせる機能を考えているなら、「Meteor」の結果は重い。同じ素材でも、語りが弱いと最下位まで落ちる。ここぞという場面の文面は人が書いた型を用意する。LLM は細部の肉付けに回す。そういう分担が考えられる。
四つ目。劇的状況のような「話の型」をテンプレートとして使うなら、繰り返しに注意がいる。著者は、型ごとに細部や背景の変化が十分にないと「型抜きのような」繰り返しになると書いている。読者の「不倫が何度も出てくる」という感想は、その兆しだろう。型の数を増やすより、同じ型に違う文脈をつける工夫が効きそうだ。
五つ目。結果シェアやリプレイ共有の設計にも示唆がある。創発的な話は、同じ世界を知る人同士で語り合うときに一番輝く、というのが著者の結論だ。ならば、話を「外の人向けに説明する」より、「同じゲームを遊んだ人に届ける」導線を用意する方が、面白さが伝わりやすいと整理できる。
どこまで信じてよいのか
まず著者自身が認めている弱点。読んだ話の種類が少なく、読者も24人と小さい。だから「この方法を丸ごと否定するのは早い」と著者は書いている。対照の話は1本だけで、しかもランダムに選んだものだった。Chroniqueur という特定のシミュレーションの癖が効いた可能性や、物差しの作り方が他にもありえた点も挙げている。
起こりにくさそのものの問題も、著者は指摘している。統計的に珍しいことと、物語として意味があることは別だ。長く回すと、説明のつかない極端な外れ値も出てくる。また、どの話にも同じ量の背景情報を渡す形に揃えたため、因果の連なりがかなり抽象的になったとも書いている。
Fukai がここで指摘するのは、次の3点だ。一つ目は、統計的な検定がないこと。「はっきり一番好まれた」という表現も、順位の図から読むしかない。二つ目は、人間の書き手が一人だけなこと。人間版の強さは「人間一般」ではなく「その一人の腕前」かもしれない。
三つ目は、読者が人文系の教員と学生で、ゲームのプレイヤーではないことだ。これは実は著者の結論とつながっている。この世界を知らない読者に読ませた時点で、「起こりにくさ」の面白さは伝わりにくかったのかもしれない。GPT-4 という一世代前のモデルを使っている点も、語りの比較を読むときには頭に置いておきたい。
Fukai の読み
ここだけは私の意見だ。私はこの論文を、「面白さは素材の中ではなく、素材と読み手の関係の中にある」という、ゲームデザインでよく知られた感覚の再発見として読みたい。パズルでも、ルールを覚えた人にしか「この一手の意外さ」は見えない。著者が最後に Steven Sych を引いて言うように、Dwarf Fortress の語り直しが面白いのは、その世界の「普通」を知る人だけが「変さ」に気づけるからだ。つまりストーリー・シフティングの次の課題は、話を選ぶことだけではない。読み手にその世界の「普通」をどう先に渡しておくか、という設計の問題でもある、と私は整理している。
次に何を読むと地図が見えるか
この論文の出発点は、James Ryan の博士論文『Curating Simulated Storyworlds』(2018年、カリフォルニア大学サンタクルーズ校)だ。創発的ナラティブの「作りすぎて、あとで選ぶ」という考え方を、正面から論じている。長いが、この分野の地図の中心にある。
「意外さ」を物差しにした先行研究としては、Kreminski らの「Select the Unexpected」(ICIDS 2022)がある。今回の論文が「うまくいかなかった」と報告した方向を、別の設計で試した研究として並べて読むと、どこが違ったのかが見えてくるはずだ。
参考文献
本記事で参照した論文と関連資料:
・関連研究: Curating Simulated Storyworlds (James Ryan, 2018, PhD thesis, UC Santa Cruz)
リアクション(ログイン不要)
匿名で残せます • 同じリアクションは1日1回まで
関連シリーズ
論文ダイジェスト第98回 / 全98回
