PAPER-DIGEST · 2026-06-29
Bazzaz et al.: 「AI 製だと思う」だけで体験が変わる — Fukai が読む
HCI / 生成コンテンツの知覚バイアスとプレイヤー体験
一段落要約
ゲームに生成 AI のコンテンツが急速に入り込む中、プレイヤーはそれをどう感じるのか。本論文は、横スクロールアクションの Super Mario Bros. と倉庫番系パズルの Sokoban(箱を押して目的地に運ぶグリッドパズル)を題材に、人間が作ったレベルと自動生成されたレベルを混ぜて 142 人に遊んでもらい、「これは AI 生成か人間制作か」の当てっこと、遊んだ感想を集めた。
結果、プレイヤーは作者をほとんど当てられず(正答率は偶然とほぼ同じ)、それでも「AI が作った」と信じたレベルほど、楽しくない・難しい・苛立たしいと評価した。つまり実際の作者ではなく「作者についての思い込み」が体験を左右していた、という観察である。本記事はこの一本を、論文を開かずに要点が掴めるよう解説する。
はじめに
著者は Mahsa Bazzaz と Seth Cooper の二人で、所属はいずれも米国の Northeastern University(ノースイースタン大学)である。発表先は ACM の CHI '26(2026 年の Human Factors in Computing Systems 会議。HCI=人とコンピュータの関わりを扱う分野で最も大きな国際会議の一つ)で、査読を通った会議論文として採録されている。プレプリント(査読前の原稿)は arXiv に 2026 年 2 月 15 日に投稿されており、本記事はその版を参照した。
私がこの論文を今日選んだのは、テーマが「作る人の実務」に直結しているからだ。生成 AI でレベルやアセットを作る動きは、もう研究室の話ではなく Steam の店頭に並ぶ現実になっている。論文によれば、Steam 上で「AI コンテンツ」タグの付いたゲームはおよそ 1 万本、「procedural content(手続き的な自動生成のコンテンツ)」タグはおよそ 1 万 200 本にのぼるという。そして 2026 年 4 月の会議で発表される本研究は、2024 年 1 月に Steam が導入した「AI の使い方を開示せよ」という方針を背景に置く。開示は本当にプレイヤーの判断を助けるのか——この問いに、実験で答えようとした論文である。
背景
この分野で繰り返し問われてきたのは「チューリングテスト」型の問いだった。チューリングテスト(機械の応答が人間と見分けられないかを試す古典的な枠組み)を応用し、「この生成コンテンツは人間が作ったものと見分けがつくか」を測る研究が、文章・画像・音声・アートで数多く行われてきた。ゲームでも、2009〜2012 年の Mario AI コンペに「チューリングテスト部門」があり、Sokoban のレベルでも 10 年ほど前に同様の比較が試みられている。
しかし著者たちは、見分けられるかどうかと、見分けたつもりになることが体験に与える影響は別の問題だ、と整理する。心理学にはプラセボ効果・ノセボ効果(本当は中身が変わっていなくても、効くと思えば良く、悪いと思えば悪く感じる現象)という頑健な枠組みがある。実際、過去研究では「難易度が自動で適応する」と偽って伝えただけでプレイヤーの没入感が上がり(Denisova と Cairns, 2015)、AI の支援を受けていると信じた被験者が単語パズルをより多く解いた、という観察がある。
本論文はこの線をゲームのレベル評価に持ち込む。ただし新しいのは、ラベルを貼って意図的に思い込ませる「プライミング(事前の刷り込み)」ではなく、プレイヤーが自発的に抱く推測を観察する設計を採った点だ。プラットフォームが十分な開示をしない現実の中で、プレイヤーが自分で「これは AI かも」と勝手に推測したとき何が起きるか——著者はそこを見ようとした。
アプローチ
方法は混合研究法(数値データと自由記述の両方を集めて分析するやり方)である。題材は 2D タイルベースの 2 作品——Super Mario Bros. と Sokoban。選んだ理由は、どちらも PCG(Procedural Content Generation、コンテンツの自動生成)研究の定番ベンチマークで、操作が単純でオンライン調査に向くからだという。ジャンルも目標も認知負荷も大きく違う 2 本を並べることで、結果が遊びの形を超えて成り立つかを見たかった、と著者は述べる。
レベルは合計 60 種類。各ゲームについて、人間作 15・AI 生成 15 を用意した。人間作の Mario は VGLC という公開データセットの原作 15 レベル、Sokoban は 1,150 レベルの公開集合から無作為に選んだ 15 個。AI 生成は、文献調査で選んだ 6 種類の生成手法(制約ベース、機械学習、大規模言語モデルなどを含む)から作った。ここで著者は二つの落とし穴に注意している。一つは「良い出力だけを選り抜く」と結果が歪むこと——だから無作為抽出にした。もう一つは、明らかな破綻(到達不能なゴールなど)があると一目で AI と分かってしまうこと——だから「クリア可能」かつ「見た目の破綻がない」レベルだけに絞った。
参加者は Prolific(オンラインの調査協力者プラットフォーム)で集めた 154 人。未完了などを除いた有効回答は 142 人で、各人が 60 種類から無作為に 6 レベルを遊んだ(合計 852 試行、1 レベルあたり約 14 人が評価)。各レベルにつき二択(「これは AI 生成か、人間制作か」)とその確信度、そして 5 つの体験指標——楽しさ、難しさ、苛立ち、意外性、見た目の出来——を 5 段階で評価し、最後に「なぜそう判断したか」を自由記述で書いた。分析には、人ごと・レベルごとのばらつきを吸収する統計モデル(順序ロジスティック回帰に変量効果を加えたもの。ここでは「個人差を差し引いて傾向を見る道具」のこと)が使われている。
発見
まず作者の当てっこ。正答率は 53%(812 試行中 430)で、人間作と AI 生成の試行数を揃えた上での検定では偶然(50%)と統計的に差がなかった(両側二項検定 p = .099、95% 信頼区間 [49.5%, 56.4%]、出典: 4.1 節)。人間作を AI と誤る率 26.6%、AI を人間作と誤る率 26.3% とほぼ対称で、要するにプレイヤーは作者を見分けられていない。さらに、よく遊ぶプレイヤーほど自分の判断に自信を持っていた(確信度にゲーム頻度の効果)が、正答率は上がらず、むしろ稀にしか遊ばない人の方が当てていた、と著者は報告する。
体験の評価はもっと鮮やかだった。実際の作者で分けると差は小さいのに、「プレイヤーが信じた作者」で分けると差が際立つ。人間が作ったと信じたレベルほど楽しいと評価され(信念の効果 β = 1.54、z = 9.52、p < .001。一方で実際の作者は有意でない)、見た目の出来も高く評価された(z = 10.480、p < .001)。逆に AI が作ったと信じたレベルほど苛立たしく(β = -1.17、z = -7.445、p < .001)、難しいと評価された(z = -2.41、p < .015、出典はいずれも 4.4 節)。表 1 の平均値で言えば、楽しさは「AI と感じた」群 2.92 に対し「人間と感じた」群 3.72、苛立ちは 3.60 対 2.84、見た目は 2.70 対 3.57(5 段階)。ただし「意外性」だけは信念と関係がなく、Sokoban が Mario より意外性が低いという差だけが出た。
判断の「根拠」を集めた自由記述の分析(評価者間の一致度 Cohen's κ は平均 0.76。κ は偶然の一致を差し引いて測った一致の指標)も面白い。プレイヤーは、体験の手触り・レイアウトの整合・到達可能性・設計の意図らしさ・既知のゲームとの比較、そして「AI ならこうするはず」という思い込み、といった手がかりを使っていた。だが著者が強調するのは、同じ手がかりが正反対の結論に使われたことだ。スポーン地点のすぐ横に敵を置く同一の仕掛けが、ある人には「人間が嫌がらせで作った証拠」、別の人には「人間ならこんな作りはしない=AI の証拠」と読まれた。著者はこれを、人間らしさの判断が主観的で当てにならない(原文では fallible=誤りやすい)ことの表れだ、と整理している。
最後に、PCG と生成 AI への態度。両者への評価分布は統計的にはっきり異なり(χ²(16) = 473.71、p < .001)、生成 AI への評価の方が否定的だった。生成 AI に肯定的な人ほど楽しさ(z = 3.247、p = .0011)と見た目(z = 2.391、p = .0168)を高く付けた。自由記述では、ルールベースで制御可能な PCG への信頼に対し、生成 AI には予測不能・誤りやすさ・学習データの倫理・環境負荷・雇用への影響といった懸念が並んだ、と著者は報告している。
使いどころ
では、ゲームやパズルを作る人はこの結果をどう使えるか。前提として、これは観察研究であり「AI だと思わせると必ずつまらなくなる」と因果を断言する論文ではない。その留保のうえで、私(Fukai)は次のような使い道を考えた。
第一に、もし自分が Sokoban-like のパズルを自動生成しているなら——生成器の品質を上げる努力と並行して、「AI 製だと思われた瞬間に評価が下がる」リスクを設計上の変数として扱うべきだ。本論文では、AI と信じられたレベルは楽しさ・見た目で一段低く、苛立ちで一段高く評価された。同じ盤面でも、提示の仕方やラベルの言葉づかいが体験スコアを動かしうる。生成物そのものの A/B テストだけでなく、「どう見せるか」も同じ重みでテストする価値がある。
第二に、もしハイパーカジュアルや探索型ゲームで PCG を売りにするなら——論文の自由記述では、ルールベースの PCG は「制御可能で信頼できる」と比較的好意的に受け止められ、生成 AI は十把一絡げの『AI』ラベルで身構えられていた。開示するなら「AI を使った/使わない」の二択ではなく、どこに・なぜ使ったか(例: アイデア出しには使うがアセットは人間が描く)を具体的に伝える nuanced disclosure(細やかな開示。著者の言葉)の方が、誤解による減点を避けやすい、と著者は論じている。
第三に、難易度キャリブレーション(難しさの調整)の解釈に注意したい。プレイヤーが「難しい」「苛立つ」と報告したとき、それが盤面の客観的な難しさなのか、「AI 製だと思ったから厳しく見た」のかは、本研究では切り分けられていない。もし自分が難易度を A/B でチューニングしているなら、作者についての先入観が混入していないかを疑う一手——たとえば作者情報を伏せる、提示順をランダム化する——を入れておくと、データの解釈を誤りにくい。加えて本論文が引く過去研究には、「適応難易度がある」と偽るだけで没入感が上がった例がある。提示の枠組みそれ自体が体験を動かす、という事実は、難易度設計の隠れた一変数として覚えておきたい。
限界
著者自身が認めている弱点から。第一に、題材は短い 2D タイルゲーム 2 作だけで、他ジャンルや長時間プレイに一般化できるかは不明だとする。第二に、体験指標が各 1 項目の 5 段階評価で、GEQ や GUESS のような確立した多項目尺度ほどの精度はないと断る。第三に、参加者はオンラインの一般層が中心で、熟練したレベルデザイナーが少なく、専門性の効果を検出する統計的な力が限られる。第四に——ここが最も重要だが——設計は観察的であり、因果は言えない。「AI だと思ったから粗探しをした」のか「苛立ったから AI だと推測した」のか、向きは決められないと著者は明記している。
Fukai がここで付け加えて指摘するのは二点だ。一つは、AI 生成レベルを「クリア可能で見た目の破綻がない」ものに絞った設計の含意である。比較を公平にする良い手続きだが、裏を返せば「破綻のある生成物が現場では多い」現実を意図的に外している。店頭の生成コンテンツの体験を語るには、むしろ破綻込みの分布を見たい場面もあるだろう。もう一つは、参加者が米国・英語話者・成人に限られている点だ。AI への態度は文化や世代で大きく変わりうるので、『生成 AI への否定的態度』という結果をそのまま他地域へ持ち込むのは慎重でありたい。
Fukai の読み
ここからは私(Fukai)の読みだ。私はこの研究を、「品質の自動化」から「信頼の設計」へと PCG 研究の重心が移っていく流れの中に置きたい。これまでの Turing テスト型研究は「人間と見分けがつかない出力を作れるか」を競ってきた。だがこの論文が突きつけるのは、見分けがつかなくなった後も、プレイヤーの頭の中の『作者像』が体験を着色し続ける、という事実だと読める。設計批評の語彙で言えば、これは生成器の性能問題ではなく、提示と開示という『メタな設計層』の問題だ。良い盤面を作るだけでは足りず、それがどんな文脈に置かれて受け取られるかまで含めて設計対象になる——少なくとも私はこの一本をそう読んだ。
おわりに
もっと深く知りたい人へ。本論文が踏まえている古典として、見分けがつかないこと自体を評価軸にした初期の Sokoban 研究や、Mario のプレイヤー信憑性を扱った Camilleri ら(2016 年)を合わせて読むと、ゲームにおけるチューリングテストの系譜が見えてくる。期待が体験を変える話では、Denisova と Cairns の『偽の適応 AI』研究(CHI PLAY 2015)が出発点として分かりやすい。経済学側からは、見分けられないと全体への信頼が崩れる『レモン市場』の議論(Akerlof)が、本論文の lemons dynamic という見立ての下敷きになっている。生成器そのものを触ってみたい人は、著者 Cooper の制約ベース生成 Sturgeon 系の論文群が入り口になるだろう。
参考文献
本記事で参照した論文と関連資料:
リアクション(ログイン不要)
匿名で残せます • 同じリアクションは1日1回まで
学ぶ — カリキュラム
学ぶ第9編 出す編 — 作って、届ける第20章 市場と届け方11 / 11本
関連シリーズ
論文ダイジェスト第15回 / 全91回


