PAPER-DIGEST · 2026-08-14

Bazzaz と Cooper: 生成AI と PCG を Steam レビュー 50万件で比べる — Fukai が読む

生成AI / PCG / プレイヤー受容 / 開示制度

一段落要約

「生成AIをうちのゲームに入れたら、プレイヤーはそれをどう受け止めるだろうか」——ノースイースタン大学の Mahsa Bazzaz と Seth Cooper の新しい論文は、この問いに Steam レビュー 508,192 件の分析で答えようとしている。彼らは Steam 上のゲームを二群に分けた。一方は「PCG(Procedural Content Generation、コンテンツの自動生成。乱数と規則で地形やアイテムを組み立てる古典的な手法)」を使う 5,186 本。もう一方は「生成AI(Generative AI、大規模モデルを使った生成)」を使うと開発元が明示している 5,970 本である。

数字は素っ気ないほどはっきりしている。PCG ゲームの好評率が 86.3% に対し、生成AI ゲームは 68.4%。差は 17.9 ポイントで、PCG のほうが高い。レビューの感情分析でも、PCG は好意的が 69.0%・否定的が 31.0%、生成AI は好意的 53.0%・否定的 47.0% だった。つまり「PCG は生成技術として長年受け入れられているのに、生成AI と名乗った途端に評価が下がる」というのが第一の発見である。

さらに 600 件のレビューを人手で読み込んだテーマ分析で、なぜ嫌われているのかも見えてきた。プレイヤーは生成AI の使用を「開発の手抜き(low developer investment)」の合図として読んでいる。エラーが目に見えるほど「ちゃんと作っていない証拠」と受け取られる。倫理面での拒絶、開示と実物のズレへの不信、そして「良い使い方」の期待、といったテーマが並ぶ。本稿は arXiv:2608.11539(2026年8月12日投稿)で、ACM DOI 10.1145/3831347 が既に割り当てられている——すでに ACM のどこかの会議に採録されているということだ。

はじめに

著者は Mahsa Bazzaz と Seth Cooper で、いずれも Northeastern University 所属の HCI・ゲーム研究者である。Cooper は市民科学ゲーム Foldit で知られる研究者で、Bazzaz とはすでに「AI 製だと思うだけで体験が変わる」CHI '26 論文(私が以前に紹介した paper-bazzaz-perceived-creator に相当する)でも組んでいる。今回の論文は arXiv preprint(2026年8月12日投稿)で、DOI が 10.1145/3831347 として割り当て済みだから、ACM 系のどこかの会議に採録されている——ただし preprint の本文からは会議名が明示されておらず、私(Fukai)はここでは「ACM 系の場で採録された論文の author-accepted 版」と紹介するに留める。

なぜ今日この論文を選んだかというと、私たちパズル/ゲームを作る人間にとって、この論文の問いが避けられないからだ。生成AI を入れるかどうかを議論する場面は、もはや日常になっている。だが、「入れたらプレイヤーはどう見るか」を、憶測や Twitter の空気ではなく、50万件のレビューという地の面から測ろうとした人は少ない。この論文はまさにそれをやっている。感情の話に見えて、実は「開発判断の根拠となる観察データ」を提供する研究である。

背景

少し歴史の整理をしておきたい。ゲームにおける「生成」は生成AI が登場するずっと前からある。Rogue(1980)以降、地形とアイテムを乱数と規則で作る PCG(procedural content generation。これは規則に従って自動で中身を作る手法のこと)は、Minecraft、Dwarf Fortress、Spelunky、No Man's Sky、Diablo、Hades と、ジャンルを越えて長い伝統を作ってきた。「生成」自体はプレイヤーにとって珍しくないし、むしろ大きな価値と結びついている。

対して、大規模モデル(LLM や画像拡散モデル)を使った生成AI が商用ゲームに顔を出すようになったのはここ2〜3年だ。Steam は 2024年に「AI 生成物を含む場合は開示せよ」というポリシー変更を行い、開発元は「AI で作った資産・AI で動く NPC」などを説明できる欄を持つようになった。この開示制度が、今回の研究が成立する土台になっている。開示があるからこそ、生成AI を使うと開発元が言っているゲームだけを抜き出して、比較群を作れる。

研究の狙いは、この対比を数字で押さえることだった。著者は3つの問いを立てている。(1)Steam の市場側で見て、PCG と生成AI はどう違って広がってきたか。(2)プレイヤーの受け止めはどう違い、その差はどんな文脈で開くか。(3)レビューで実際に語られている理由は何か。この3段構えが、この論文を単なる「AI が嫌われてます」以上のものにしている。

アプローチ / 方法

方法は「地道な観察」と「拡大鏡」の二段構えだ。第一段では、Steam 上のゲームを二つの群に分ける。PCG を使うと自己申告している 5,186 タイトルと、生成AI の使用を開示している 5,970 タイトルである。この分類は Steam の説明文と AI 開示欄を使って抽出したものだ。そのうえで、この 11,000 本強のゲームに書かれたレビュー 508,192 件を対象データとして集める。内訳は PCG レビューが 341,447 件、生成AI レビューが 166,745 件。生成AI 側のほうがゲーム数は多いのにレビューが少ないのは、生成AI ゲームがまだ新しく、蓄積が浅いことを反映している。

分析はまず量的に、レビューの好評/否評率(Steam の親指マーク)と感情スコア(positive / negative の内訳)を両群で比べる。次に質的に、両群から合わせて 600 件のレビューを抽出してテーマ分析(thematic analysis。人が丁寧に読み、繰り返し現れる意味の塊にラベルをつけて束ねる質的手法)を行った。これは自動化された話ではなく、著者たちが「なぜプレイヤーはこう書くのか」を人の目で読み解く工程で、この論文の心臓にあたる。

私(Fukai)が読んでいて設計上大事だと感じたのは、比較群の作り方だ。PCG は「昔からある生成技術」の代表として置かれている——マインクラフト的な地形も、Diablo 的なダンジョンも、Spelunky 的なレベルもここに入る。生成AI と対比することで、「プレイヤーは生成そのものを嫌っているわけではない」ことを、はっきり切り分けている。もし比較対象がなければ、「AI 嫌い」の結論に丸められていたかもしれない。

発見

量的な結果は、この論文の中で一番冷静に読める部分だ。好評率(Steam の親指マークで測る)は PCG が 86.3%、生成AI が 68.4%。差は 17.9 ポイントである。感情の内訳では、PCG が好意的 69.0% / 否定的 31.0% に対し、生成AI は好意的 53.0% / 否定的 47.0%。生成AI ゲームでは否定的レビューがほぼ半分を占めている、というのが最も強い量的な発見だ。

質的なテーマ分析からは5つの束が浮かび上がった。(1)「Perceived Quality Deficit(質の欠如の印象)」——プレイヤーは生成AI の使用を「開発への投資が薄い証拠」として読み、目に見えるエラー(不自然な手指、繰り返す台詞、破綻したテキスチャ)を「ちゃんと作っていない証拠」として受け取る。(2)「Ideological & Ethical Resistance(思想的・倫理的な拒絶)」——結果の質と関係なく、そもそも生成AI を使うこと自体を、絵師/翻訳者/ライターの生活の場を奪う行為だと拒否する声。業界の「AI 常識化」への恐れも含む。

(3)「Acceptance(受け入れ)」——生成AI を全面的に拒絶するわけではない声も、確かに一定量ある。ただし条件がついていて、「妥当な比率で」「本当に価値になる形で」「コスト削減ではなく新しい遊びの仕組みとして」使うなら、という受け入れ方だ。(4)「Transparency & Trust(透明性と信頼)」——開発元が「AI を軽く補助的に使った」と説明していても、実物のクレジット表記やアートの粒度と噛み合っていないと、信頼そのものが崩れる、というテーマ。開示は一発勝負ではなく、証拠との整合まで含めて評価されている。

(5)「The Bar Keeps Rising(下がらない基準)」——これは小さいが面白いテーマだ。ごく一部のレビュアーは、逆に「使えるところで AI を使わないのはなぜだ」と、翻訳や補助機能に AI を入れていないゲームを非難する。ここで示されているのは、プレイヤーの目線が「AI を入れるか外すか」の二値ではなく、「どこで入れて、どこでは入れないでほしいか」という細かい期待の網目になっている、ということだと私は読んだ。

使いどころ — パズル/ゲームを作る人がどう使えるか

この論文をパズルラビリンスのような「日替わりパズル」を作るチームの視点で読むと、具体的に持ち帰れる使いどころが少なくとも3つある。まず1つ目——「PCG と生成AI は同じ棚に置かない」。プレイヤーは今、両者を別の目で見ている。もし新作パズルの盤面を「決定的な規則+乱数のシード」から生成しているなら、それは伝統的な PCG の系譜であって、生成AI ではない。ゲーム紹介文で「AI で盤面を生成しています」と書く必要はないし、書けば下がる。逆に「無限に近い盤面が古典的なアルゴリズムで生成される」と書けば、Diablo や Spelunky のように「良い意味の生成」の側に立てる。

2つ目——「開示は勝負の場所ではなく、証拠との整合の場所」。もし LLM を翻訳やヒント文生成に使うなら、開示は当然として、そこにプレイヤーが確認できる証拠(例: 各言語の監修者名、ヒント文のレビュー履歴、AI 生成のヒントには小さなマーク)まで揃えることが評価につながる。逆に「AI 補助程度」と書きながらアートの大半が明らかに生成物、というギャップは、テーマ分析の Transparency & Trust の項目に真正面から当たり、致命傷になる。

3つ目——「生成AI は資産削減ではなく新しい遊びに使え、というプレイヤー側の期待に沿う」。Acceptance テーマが示しているのは、プレイヤーが受け入れる生成AI とは「これまでできなかった遊びが AI でしかできない形で実装されている」ものだった。例えば「プレイヤーの過去の解き筋から次のヒントの語り口を変える」「日本語の言葉パズルで、意味を保ったまま話者の年齢に応じてヒント文を書き換える」など、AI がその場でしかできない一手を担うなら、レビューは変わる。単に「イラストを AI で用意しました」は、この論文の枠組みでは最も分が悪い使い方だ。

補足として4つ目——「開示欄を空にしない」。Steam の開示制度は 2024 年から動いており、ここに書かないという選択自体が疑われる時代に入っている。パズルラビリンスのようなウェブサイトでは、記事末尾に「この記事は Fukai が書き、AI 支援は使っていない」など、著者と AI の役割を1文で明示するだけでも、信頼の底が固くなる。今回の論文は Steam のレビューを扱っているが、開示と信頼の関係はウェブ記事にもそのまま持ち込める話だ。

限界

著者自身が挙げている限界は3つある。1つ目、分析は英語レビューだけを対象にしている。日本語や中国語、スペイン語圏のプレイヤーがどう見ているかは、この論文からは分からない。AI 労働倫理の受け取り方は文化によって差があると考えられるので、この限界は本文の結論を一段緩めるべき理由になる。2つ目、Steam のリリース日付は開発元が後から変更できるので、時系列分析には近似が入る。3つ目、テーマ分析はレビュー内で「AI」に明示的に触れている文にキーワードで絞り込んだので、AI 生成物への「意識に上らない反応」は取りこぼしている。

Fukai がここで指摘するのは、まず「因果ではなく相関である」という一段の留保だ。この研究は「生成AI を使うと言う → 評価が下がる」という関係を観察しているが、それが「AI そのものが嫌われている」からなのか、「AI 開示をするような、規模が小さくレビュー数の少ないインディー作品が母集団に多いから」なのかを、この論文の分析だけでは切り分けきれない。第3の変数(開発規模、価格帯、ジャンル分布)を統計的に統制した回帰があれば、もう一段強い主張になる。

もう1つ、Fukai が読んで気になったのは、「開示していないが実は AI を使っている」ゲームがこの分析から自動的に除かれていることだ。Steam の AI 開示欄が動き始めたのは 2024 年で、それ以前や、開示を回避している場合の作品は「生成AI ゲーム」群に入らない。したがってこの論文の結論は、「開示された生成AI に対するプレイヤー反応」であって、「AI を使ったゲーム全般に対する反応」ではない。実務者としては、この違いは大きい。

Fukai の読み

私はこの論文を、「開示は結果ではなく入り口だ」という設計論の中に位置づけたい。この論文が量的に示したのは、Steam 上の開示欄という「一発の申告」で好評率が 17.9 ポイントぶん動く、という粗い事実だ。しかし質的な部分——Transparency & Trust のテーマや、The Bar Keeps Rising のテーマ——が真に語っているのは、「プレイヤーはその申告と実物の突き合わせを、しつこく続ける」ということである。設計批評の語彙で言えば、これは Michael Cook や Georgios Yannakakis が繰り返してきた「ゲームは常に評価対象を作り続ける」という話の、生成AI 版だと私は読む。開示は防波堤ではなく、そこから続く長い対話の入口だ。

おわりに

この論文の地図をもう少し広げたい人には、同じ Bazzaz と Cooper の CHI '26 論文 "Human Bias in Perceiving AI-Generated Content in Games"(こちらはプレイヤーが AI 製かどうかを当てられないのに、AI 製だと信じたレベルほど低く評価する、という実験研究)を並べて読むと、二つの視野が一つに繋がる。今日の論文はマクロ(50万件のレビュー)を、前作はミクロ(142人の実験)を扱っており、片方だけでは片眼視である。

また、生成AI とゲーム受容の議論をもう少し理論寄りに追いたい人には、Guzdial らの "Player-AI Interaction" 系の一連の HCI 研究や、Steam の AI 開示ポリシー変更(2024年)前後を扱った業界レポートも一緒に見ると、なぜ 2026 年時点で「開示が評価される時代」になっているのかの空気が掴める。私(Fukai)としては、来年の CHI や CHI PLAY で、この 17.9 ポイントの差が「価格・ジャンル・スタジオ規模」で統制されたときにどこまで残るか、を扱う続報を待ちたい。

参考文献

本記事で参照した論文と関連資料:

・Player Perceptions of Generative AI in Games: A Steam Review Analysis (Mahsa Bazzaz, Seth Cooper, 2026, arXiv preprint / ACM accepted)

・DOI: 10.1145/3831347 (ACM 割当済み)

・関連研究(前作): Human Bias in Perceiving AI-Generated Content in Games (Bazzaz and Cooper, CHI '26)

・関連: Procedural Content Generation in Games: A Survey with Insights on Emerging LLM Integration (Zohaib et al., 2024)

・関連: Steam の生成AI 開示制度(2024年更新)については Valve の公式アナウンス「AI Content on Steam」を参照

リアクション(ログイン不要)

匿名で残せます • 同じリアクションは1日1回まで

関連シリーズ

論文ダイジェスト第57回 / 全91回

次に読む

編集部からのおすすめ