SERIES — 連載

論文ダイジェスト

全105回 · 最新 2026-10-07 · 文: Fukai

レベル自動生成、難度推定、AI の思考——ゲーム研究の論文は面白いのに届いていない。Fukai が毎回1本を選び、手法と結論を誰にでも読める形にほどく。

第1回から読む →

連載一覧

  1. 第105回
    Cloos ら: 目的も点数もない島で、AIは塔を積み、自分で決めたルールで遊びはじめた — Fukai が読む
    2026-10-07

    Cloos、Norelli、Andreas、Rus、Isola らによる arXiv preprint(2026年10月5日投稿・査読前)。市販のプログラミング支援AIに体と記憶ファイルを与え、目的のない島に30時間放つと、13体は塔・絵・ボウリング・自作ルールの挑戦など「遊び」の特徴を示した。遊んだ経験は後の課題の成績を上げ、6体は作り手も知らなかった投げ技を見つけた。

  2. 第104回
    Yamamoto と Shiba: 両方に同じ額が付いていると、人はそこを読み飛ばした — Fukai が読む
    2026-10-06

    立教大学の Yamamoto と東洋大学の Shiba による査読誌論文(Judgment and Decision Making, 2026年5月13日)。事前登録した3実験(募集計1,400人)で、二つの選択肢に共通する支払いを人がほぼ無視し、違う部分の形だけで判断することを示した。総額が同じでも「投資」や「借金」の形に見せ直すと待てる度合いが変わり、本物のお金を使った実験では借金の形の効果が残った。

  3. 第103回
    Höhs ら: 「やるべき理由」は似ていて、「やめるべき理由」はバラバラだった — Fukai が読む
    2026-10-05

    テュービンゲン大学の Höhs、Rebholz、Hütter による査読誌論文(Judgment and Decision Making, 2026年7月23日)。賛成と反対の理由の違いを、事前登録した3実験(計623人)で調べた。賛成の理由は互いに似ていて「自分に関係がある」と感じられやすく、反対の理由はバラバラで「目新しい」と感じられやすかった。実験3では、反対の理由がそろって見えるほど、人は「やらない」側に動いた。

  4. 第102回
    Choi と DeKay: 本物のランダムでも、同じ色が4回続くと人は「次も同じ」を約7ポイント低く見積もった — Fukai が読む
    2026-10-04

    オハイオ州立大学の Choi と DeKay による査読誌論文(Judgment and Decision Making, 2026年9月29日)。「本物のランダムな列なら、確率で答えさせるとギャンブラーの誤謬は消える」とした2025年の研究データを再分析した。連続の長さで分けて集計し直すと誤謬ははっきり現れ、同じ色が4回続いた後の見積もりは平均7.17ポイント低かった。ただし個人単位ではっきり示したのは29.0%だった。

  5. 第101回
    Li: 「塔を高く」は通り、「中を空洞に」は通らなかった — AI 生成器の注文の効き目を地図にする — Fukai が読む
    2026-10-03

    Alex Chengyu Li による学習型の建物生成の論文。Minecraft の建物 10,310 件で学んだ生成器に6つの条件を付け、14の性質の効き目を測った。9つは大きく動き、4つは少し動き、建物の中の空気の割合だけはほぼ動かなかった。指定していない性質の動きやすさは学習データから順位相関 0.879 で読めたが、性質は10個だけで一般化はまだ早い。

  6. 第100回
    Engel ら: 迷路の正解が入れ替わったとき、人を早く切り替えさせたのは「他人の足跡」だった — Fukai が読む
    2026-10-03

    マックス・プランク共有財研究所の Engel・Holzhausen・Mischkowski による査読誌論文(Judgment and Decision Making, 2026年9月21日)。50面で身についた迷路の「近道ルール」がこっそり裏返ったとき、人はどう乗り換えるかを、事前登録した288人の実験で調べた。他人の足跡を見せると切り替わりやすさは51.0%高まり、有料のヒントボタンは有意な差を生まず、使えた人の55.21%しか押さなかった。

  7. 第99回
    Xu と Verbrugge: 5×5マスの並べ方を、小さなAIが「毎回ちがう技」に翻訳した — Fukai が読む
    2026-10-02

    Kaijie Xu と Clark Verbrugge によるスキル自動生成の論文。プレイヤーが5×5マスに並べた元素セルを、手元で動く言語モデルが戦闘スキルに翻訳する。モデルは元素の一致度0.994を保ちつつ同じ並びから毎回ちがう技を出し、4つの従来手法はこの両立ができなかった。一方、縦線の形はほぼ読めず、人による評価もまだない。

  8. 第98回
    Lessard ら: シミュレーションが生んだ「面白い話」を、機械は掘り当てられるか — Fukai が読む
    2026-10-01

    Jonathan Lessard らによる創発的ナラティブの論文。社会シミュレーションが生んだ22万8千件の出来事から「面白い話」を機械的に選び出す方法を「意外さ」と「劇的状況」で試し、24人の読者評価にかけた。結果、一番好まれたのは何の工夫もしていない対照の話だった。

  9. 第97回
    Surendran & Cooper: 単語を穴埋めして作るミニゲームで、詳しい設計書は短い指示に勝てなかった — Fukai が読む
    2026-09-30

    Akash Surendran と Seth Cooper による穴埋め式ミニゲーム生成の論文(PCG Workshop at FDG '26)。遊ぶ人が埋めた単語を LLM の指示文に差し込んで4ジャンル96本を生成し、詳しい設計書型と短い指示型を比べた。クリアできたのはどちらも約半分で、単語の取り込みとゲームの多様さは短い指示の方が上回った。

  10. 第96回
    Endrovski ら: 自動生成を一番使っていないのは、レベルを作る人たちだった — Fukai が読む
    2026-09-29

    Bojan Endrovski、Joris Dormans、Rafael Bidarra によるレベル自動生成ツールの論文。ゲーム開発者120人へのアンケートで、アーティストの利用度(平均0.58)がデザイナー(0.33)を大きく上回ること、AI に望むのは自動化より「最終結果を自分で決められること」(73.3%)であることを示した。

  11. 第95回
    Sears と Weisberg: AI が書いた短編を読者は見分けられず、「人の作」と聞くと評価を上げた — Fukai が読む
    2026-09-25

    Sydney Sears と Deena Skolnick Weisberg による、AI が書いた短編と人の短編の見分けに関する論文。3研究・2,500人超で、読者は AI の短編を人の作と見分けられず(正答 39.39% と 51.97%)、書き手を伏せると AI 作をむしろ高く評価し、「人の作」と告げると評価を上げることを示した。

  12. 第94回
    Kemmerly ら: 当たっていないのに自信がある人は、多く賭け、多く調べた — Fukai が読む
    2026-09-24

    Rowan Kemmerly らによる、根拠のない自信の論文。実際の正しさでは説明できない自信が気持ちと行動のどこに出るかを、事前登録した調査(参加者997人、大学フットボールの賭け)で調べ、自信が高い人ほど多く賭け、有料の情報も多く買う一方、情報で予想を直す度合いとはほぼ無関係だったことを報告した。

  13. 第93回
    von Gugelberg: 解き方の個人差は、難しさより「何問目か」で大きく開いた — Fukai が読む
    2026-09-23

    Helene M. von Gugelberg による図形マトリクス問題の視線研究。300人の目の動きを1問ずつ記録し、推論が得意な人ほど「先に答えを組み立てる」見方をすること、そして難しさへの反応より問題の位置による変化の方が個人差が大きいことを報告した。

  14. 第92回
    Chien ら: 「払い戻し90%」と書くと、勝てそうに見えて意味は伝わらなくなる — Fukai が読む
    2026-09-23

    Chien・Han・Ludvig・Eich によるギャンブルの確率表示の論文。同じ割合を「払い戻し90%」と「店側が10%を取る」の2通りで見せ、若年者187人と高齢者199人で理解度と「勝てそう感」を比べた事前登録実験。どちらの年齢層でも、払い戻し型の書き方は正答率を下げ、勝てそうな気持ちを高めた。

  15. 第91回
    Liquin: 答えが遠いと分かっても、知りたい気持ちは減らなかった — Fukai が読む
    2026-09-21

    Emily G. Liquin による好奇心と労力の論文。答えを得るのにかかる手間を知らせても好奇心の自己申告は動くのか、事前登録した3実験・参加者419人で検証し、手間は情報を取りに行く選択を減らす一方、知りたさそのものはほとんど変えないことを示した。

  16. 第90回
    Baghal: 解き方を一度も試さないAIが、解ける倉庫番を77.4%描いた — Fukai が読む
    2026-09-19

    Sina Baghal による preprint(arXiv:2608.15958、査読前)。倉庫番(Sokoban)の盤面を機械に作らせるとき、ふつうは作るたびに解答プログラムにかけて「解けるか」を確かめる。この原稿は、解答プログラムも報酬も「解ける/解けない」のラベルも一切使わず、盤面の穴埋めだけを学んだ4.9百万パラメータのモデルが、解ける盤面を 77.4% の割合で出したと報告する。解けなかった盤面の 94.5% は内側の壁を1マス消すだけで解けるようになり、実質 98.7% に届く。

  17. 第89回
    Guo ら: 人は10試合ほどで「目先の得」から離れたが、自己進化するAIは離れられなかった — Fukai が読む
    2026-09-18

    Yingying Guo ら5名による preprint(arXiv:2608.07490、査読前)。同じゲームを繰り返し遊んだとき、人とAIの「手の選び方」がどう変わるかを測る枠組みを提案した。学生32人に3種類の対戦ゲームを計709試合遊ばせ、同じ物差しで自己進化型のAIエージェント4種類も走らせている。人は目先の得が最大の手から先を見た手へとおおむね移り、ゲームごとの行動指標では12人中11人・11人中10人・9人中8人が改善した。一方AIの改善は短く途切れがちだった。著者らは「中心的な限界は振り返りが無いことではなく、振り返りを再利用できる行動の変化に変換できないことだ」と書いている。

  18. 第88回
    Williams ら: 数独を解く脳を撮った研究は、世界に6本しかなかった — Fukai が読む
    2026-09-17

    英・南アの3人による査読済みの系統的レビュー(Frontiers in Neuroimaging、2026年4月20日公開)。数独を解く脳を撮影した研究は世界に6本(fMRI 5本・fNIRS 1本)、参加者は合計119人しかいなかった。共通して前頭前野と頭頂葉の実行制御回路と前部帯状回が働き、難しい盤面ほど内向きの思考に関わる回路は静まっていた。ただし著者らは、数独の訓練効果がパズルの外へ広がるかには「さらなる証拠が必要」としている。

  19. 第87回
    Li ら: 頼んでいないのに助けに来るAIは、10人中5人に閉じられた — Fukai が読む
    2026-09-17

    Jiahong Li ら9名による査読済み論文(IEEE Conference on Games 2026 採録、arXiv:2609.13718)。並行プログラミングを学ぶパズルゲーム Parallel に、専門家注釈と他プレイヤーの盤面を検索するAI助言システム PEARL を組み込み、10人で評価した。既存の可視化ツールのほうが有用と評価され、少なくとも5人がAIを最小化または放棄。フラストレーション得点は43.2対56.5と開いた。著者らは「拒まれたのは助言の中身ではなく、頼んでいないのに出てくる渡し方だった」と結論し、自らの設計を『Clippyを作っていないか』と問い直している。

  20. 第86回
    Hendijani と Steel: 選ばせても伸びず、画面の隅に数字を出したら伸びた — Fukai が読む
    2026-09-16

    テヘラン大学とカルガリー大学の2人による査読済み論文(Frontiers in Psychology、2026年8月13日公開)。270人の記憶テストで「選ばせること」と「成果に応じた報酬」を同時に比べ、報酬は思い出せた語数を約7語増やしたが、選択は統計的に確かめられる効果を持たなかった。視線計測から、報酬の効果は「画面の報酬表示を見たこと」を経由していた。

  21. 第85回
    Melo Legarda ら: 心拍で難易度を変える前に、「変えない仕組み」を作った — Fukai が読む
    2026-09-15

    コロンビア・カウカ大学ほかの4人による査読済み論文(Applied Sciences 16(17):8511、2026年8月27日公開)。胸ベルト型の心拍センサーの値でゲームの難しさを自動調整する仕組みを作り、8回・のべ6時間48分の動作記録を取った。反応の遅れは平均2.06秒。注目すべきは、状態を実際に切り替えた191回に対し、切り替えを見送った回数が83回あること。切り替えの判断の三割近くが「変えない」側に倒れている。ただし遊んだ人の主観は一度も集めておらず、著者自身「面白くなった」とは主張していない。

  22. 第84回
    Dygert & Jarosz: 文の読み違いを直せる人は、ひらめき問題も解けていた — Fukai が読む
    2026-09-14

    Sarah K. C. Dygert と Andrew F. Jarosz による、ひらめきと文章理解の論文。袋小路文を読み直せる力とひらめき問題を解く力が同じ処理を共有しているかを、学部生 182 人の 2 実験で検証し、作業記憶と流動性知能を差し引いても両者が結び付き、分析型の問題とは結び付かないことを示した。

  23. 第83回
    Tudor ら: 開けば見える勝敗表を、AI は負ける直前まで開かなかった — Fukai が読む
    2026-09-11

    オックスフォード大学ほかの7人による arXiv preprint(2026年9月2日投稿)。『Sid Meier's Civilization VI』に76個の道具窓口を付け、AI に300ターン以上の1戦をまるごと遊ばせた。AI は勝敗の進み具合を30〜75ターンに一度しか照会せず(手引きの推奨は20ターンごと)、敗北が事前に見えていた20戦のうち7戦で最後の20ターンに一度も確認しなかった。自分で書いた計画が10ターン以内に実行された割合は 48.2%〜65.8% にとどまる。

  24. 第82回
    Nagaya ら: 「賭けない」を選択肢から消したら、危険な方を選ぶ人が倍になった — Fukai が読む
    2026-09-10

    山口大学の長谷和久・小野史典と同志社大学の中谷内一也による査読誌論文(Judgment and Decision Making, 2026年7月13日)。「損は得のおよそ2倍重い」とされてきた小額の賭けでの損失回避を、「賭ける/賭けない」ではなく「賭ける/賭ける」の二択に組み替えて測り直した。計1,345人の3実験で、危険な方を選んだ割合は 23.3% から 50.0% へ跳ね上がった。損失回避とされてきたものの大部分は、「動かない方を選びたい」という別の癖だった可能性がある。

  25. 第81回
    Macchi ら: 触らせても解けず、「部品に見える絵」に変えたら正答率が33ポイント上がった — Fukai が読む
    2026-09-09

    ミラノ・ビコッカ大学の Laura Macchi らによる査読誌論文(Journal of Intelligence, 2026年5月9日)。「材料を手で動かせるとひらめきやすくなる」という通説を二つの実験で検証した。六本の鉛筆で正三角形を四つ作る問題では、実物を渡しても正答率は 27.3% から 32.6% へ動いただけで有意差はなし。一方、マッチ棒の計算パズルを本物のマッチ棒の写真に差し替えると、触らせないまま正答率が 46.7% から 79.3% に上がった。効いていたのは手ではなく、「これは部品でできている」と絵が語ることだった。

  26. 第80回
    Ghasemi ら: 人は「最初から選ばれている方」の力を知っていて、味方と敵で置き方を反転させた — Fukai が読む
    2026-09-08

    ニューサウスウェールズ大学の Omid Ghasemi と Ben R. Newell らによる査読誌論文(Judgment and Decision Making, 2026年9月4日)。「人はデフォルトの威力を理解していない」とした2017年の有名な研究に、カードゲーム型の3つの実験で反論する。参加者は8割を超える場面で自分に有利な初期選択を置き、味方には価値の高いカードを、対戦相手には価値の低いカードを配った。さらに他人が置いた初期選択を見て、どちらが良い選択肢かを 79.5% の精度で逆算した。

  27. 第79回
    Baek ら: 「ゼルダを7割、マリオを3割」の面を、文章で注文する — Fukai が読む
    2026-09-07

    韓国の光州科学技術院(GIST)と東国大学校の Baek ら5名による論文(arXiv:2603.26782、査読前の preprint)。ゼルダ・Dungeon・ロードランナー・スーパーマリオブラザーズの計5,576面を1つの潜在空間に収め、文章と比率でゲームをまたいで面を混ぜられるようにした。1本ごとの専用生成器と比べた一致度の低下は全体で約4.4%にとどまり、比率を動かすと一致度が指定どおりに入れ替わる。ただし文章1本で混ぜる操作の効きはまだ弱い。

  28. 第78回
    Siper ら: 面ではなく「面を作るプログラム」を進化させ、部品棚を自分で育てる — Fukai が読む
    2026-09-06

    ニューヨーク大学とマルタ大学の Matthew Siper, Ahmed Khalifa, Julian Togelius による論文(arXiv:2608.17947、IEEE Conference on Games 2026 採録)。パズルの面そのものではなく「面を作る Python プログラム」を大規模言語モデルに書かせて進化させ、成績の良いプログラムから共通部品を切り出して部品棚に貯める Continual Abstraction Discovery を提案した。Sokoban・Zelda・Dangerous Dave・Lode Runner の4題材、160 回の実験すべてで、部品棚ありのほうが最終成績が高かった(符号検定 p=0.008)。

  29. 第77回
    Lee & Ko: 人の審判は、追い込むとストライクゾーンを 17 ポイント狭めていた — Fukai が読む
    2026-09-05

    延世大学校の Kichang Lee と JeongGil Ko による arXiv プレプリント。韓国プロ野球の自動ボール・ストライク判定の導入を「動かない物差し」として使い、投球 1,216,246 球からゾーンの境目の球だけを取り出して、人の審判の判定が状況でどう動いていたかを監査した。0ボール2ストライクではストライクと呼ばれる確率が 17.17 ポイント低く、3ボール0ストライクでは 6.61 ポイント高い——この模様は自動判定では消える。

  30. 第76回
    McCaughey ら: 人がヒントを買う量を変えるのは「値段が変わった」と聞いた瞬間だけ — Fukai が読む
    2026-09-04

    Linda McCaughey ら3名による、査読誌 Judgment and Decision Making 掲載のオープンアクセス論文。観測を1つ買うたびにお金がかかる課題を5実験・延べ755人で回し、人は情報の値段が変わると買う量を変えるが、その変化はほぼ「事前の計画」で起きており、遊んでいる最中の手応えではほとんど動かないことを示した。ヒントやスカウトに値段をつける設計者に直接効く結果である。

  31. 第75回
    Lohn: じゃんけんに最強の手を足しても、勝率は 55.6% までしか上がらない — Fukai が読む
    2026-09-03

    ジョージタウン大学 CSET の Andrew J. Lohn による、じゃんけんに「ダイナマイト」を足すと何が起きるかを解いた arXiv preprint。片方だけに最強の一手を渡しても勝率は 50% から 55.6% にしか上がらず、しかも勝ちを運ぶのはダイナマイトではなく石だった。手の総数を増やすと差はさらに縮み、支配されていない手が最適戦略から静かに消える。

  32. 第74回
    Elshamy ら: プレイヤーの腕前を見て、面そのものを描き換える — Fukai が読む
    2026-09-02

    エジプト日本科学技術大学(E-JUST)の Elshamy らによる、プレイヤーの腕前を推定して面の地形そのものを書き換える仕組みの論文。敵の体力やアイテムの出方を触る従来の動的難易度調整に対し、床・すき間・敵の配置をその場で組み替える。腕前判定の正解率は 97.82%、書き換え後に最後まで通れた面は 74.1% だった。

  33. 第73回
    O'Neill ら: 約束を守らせる仕組みが、どこにも無い盤面 — Fukai が読む
    2026-09-01

    カリフォルニア大学バークレー校の O'Neill らによる、交渉と裏切りを測るための4人用征服ゲーム「C2C」の論文。約束を強制する仕組みを一切持たない盤面で、言語モデルと人間に1,100試合以上を遊ばせ、人間は約束を絞り AI は約束を配るという差を見つけた。

  34. 第72回
    Gao & Dubé: プレイヤーが作った算数ゲームの面を、機械が下読みする — Fukai が読む
    2026-08-31

    McGill 大学の Jie Gao と Adam K. Dubé による arXiv preprint。子ども向けの算数ゲームには「作成モード」があり、上手なプレイヤーが自分で面を作れる。だが投稿された面を人間が全部見るのは無理がある。著者らは 206 面(専門家 86 + プレイヤー 120)から特徴量を取り出し、公開に値する面かどうかを機械学習で下読みさせた。ランダムフォレストが再現率と F1 で最も良く、外側の検証で正解率 82.42±5.71%、F1 72.70±9.22% だった。

  35. 第71回
    Ahmetovic ら: 腕が動かしにくい人が、操作の半分を誰かに預けて遊ぶ — Fukai が読む
    2026-08-29

    ミラノ大学の Ahmetovic らによる、上肢に障害のある人のゲーム操作の研究。市販ゲームで操作を分け合える枠組み GamePals を作り、13人が人間の助っ人とソフトの助っ人それぞれと『ロケットリーグ』を遊んだ。7人が「支援なしでは遊べなかった」と答える一方、助っ人の動きを自分の操作と取り違える混乱も観察された。

  36. 第70回
    Xu & Verbrugge: 「重力の向き」や「時間」をレベル生成の座標にする — Fukai が読む
    2026-08-28

    McGill 大学の Kaijie Xu と Clark Verbrugge による FDG 2026 の査読済み論文。レベル自動生成はこれまで地形を先に作り、重力反転や動く足場といった仕掛けを後付けで検査してきた。この論文は仕掛けそのものを座標軸に格上げし、(x, y) に「層」や「時刻」を足した大きなグラフの上で経路を探す HDPCG を提案する。切り替え間隔の誤差は 0.000〜0.002 まで下がり、迂回路の残りやすさは無誘導のベースラインの 9〜10 倍になった。

  37. 第69回
    Collins ら: 人は初見のゲームを「1手先・6回」だけ想像して判断する — Fukai が読む
    2026-08-27

    Katherine M. Collins ら(MIT ほか)による Nature 掲載の査読済み論文。三目並べの親戚にあたる新作ゲーム121種類を1,000人以上に見せ、遊ぶ前の「公平そうか」「面白そうか」の判断を測った。1手先だけ読む手選びを6回の模擬プレイに使う Intuitive Gamer モデルが、公平さの判断を R2=0.81(人のデータの上限は0.82)で説明し、深く読む Expert Gamer(0.65)や MCTS(0.60)を上回った。

  38. 第68回
    Byers ら: プレイヤーの時間は、誰のために設計されているのか — Fukai が読む
    2026-08-26

    Thomas Byers、Martin Gibbs、Bjorn Nansen によるCHI 2026の査読済み論文(Best Paper Honourable Mention)。AAA・インディー・モバイル・ライブサービスの開発者20人に1時間ずつ聞き取り、ゲームの「時間」がスタジオの中でどう決まるかを組み立てた。文書に残らない直感、秒から月まで並ぶ指標、そして「数字から逆算する」設計。著者は最後に4つの指針を出す。デイリーパズルを作る側に直結する話である。

  39. 第67回
    Hu et al.: 人は他人の満足を「選択肢の数」抜きで見積もる — Fukai が読む
    2026-08-24

    Beidi Hu、Alice Moon、Eric VanEpps による Psychological Science 掲載の査読済み論文(2026年1月)。事前登録済みの実験6本・参加者10,092人で、人は自分の満足には選択肢の数を反映させるのに、他人の満足を予想するときはほとんど反映させないことを示した。選択肢の数を並べて見せる、順位で答えさせる、数を言い直させる——この3つで見落としは小さくなる。プレイテストと選択率の読み方に直結する話である。

  40. 第66回
    Pfau & Vrettis: プレイヤーに自分だけのポケモンカードを作らせたら — Fukai が読む
    2026-08-23

    Johannes Pfau と Panagiotis Vrettis(ユトレヒト大学)による arXiv preprint(査読前)。プレイヤーが名前と設定を書くと、検索・文章モデル・画像モデルを通して約20秒でポケモン風のカードが1枚できる仕組みを作り、学生49人に196枚を作らせた。見た目の満足度は5点中4.25、技や数値の適合は4.04。そして93.5%が「これは自分の発想だ」と答えた。ただし生成カードはまだ一度も対戦に投入されておらず、バランスは未検証である。

  41. 第65回
    Zhao ら: 人はパズルを解きながら「自分専用の部品」を作る — Fukai が読む
    2026-08-22

    Pinzhe Zhao ら4名による arXiv preprint(査読前)。10×10 のマス目に絵を作る 14 問の課題で、参加者が途中の形を「部品」として保存し再利用する様子を観察した。部品を使った手の割合は 21% から 87% に上がり、後半では 9 割前後が同じ形を保存。人の解答時間と手数についてきたのは最短手順の長さ(r=-.20)ではなく、モデルが調べた候補の数(r=.82)だった。参加者 30 人・単一条件の探索的研究という留保つきで読む。

  42. 第64回
    Kelidari et al.: カードゲーム AI の強さは「動かない物差し」を先に作ることで決まる — Fukai が読む
    2026-08-21

    Nima Kelidari ら3名による arXiv preprint(AIIDE 2026 投稿中)。ジンラミーで「学習しない固定の熟練者」を物差しに据え、100本超の比較実験で小さな強化学習エージェントの学習の工夫を検証。熟練者相手の勝率は PPO 15.0%、TRPO 22.5%、効いた工夫を全部積んで 34.2±2.1% になり、ネットワークの形を変えても勝率は重なる一方、隠れた札が見える探索と見えない探索は 85% と 26% に割れた。

  43. 第63回
    Battleday et al.: ルールを教えない70本のゲームで、AI の「発見する力」を測る — Fukai が読む
    2026-08-19

    Ruairidh M. Battleday ら16名による arXiv preprint。ルールも勝利条件も伏せた 70 本の文字列ゲーム(7ティア、公開21本)で AI の「発見する力」を測ると、最強のモデルが 50 本・全モデル合計でも 57 本にとどまる一方、70 本すべてが少なくとも 1 人の人間に初回で解かれた。真のルールを渡すと同じモデルが 18 本から 69 本に跳ね上がり、エージェント型の仕掛けは標準の仕掛けを上回らなかった。

  44. 第62回
    Mannem et al.: 学べるパズルと、学べないパズルがある — Fukai が読む
    2026-08-18

    Gowrav Mannem ら(Algoverse AI Research)による arXiv preprint。ハノイの塔・川渡り・ブロックワールド・チェッカー跳びを難易度つまみ1本(N=1〜10、計 10,817 問 285,933 手)に揃えた RecurrReason で小型の系列モデルを訓練したところ、ブロックワールドは検証 97.27%・分布外 81.00% を出す一方、ハノイの塔は 11.11%・0.00%、チェッカー跳びは 1.11%・0.10%、川渡りは全条件 0.00% にとどまった。6000万パラメータの T5 が 1億2400万パラメータの GPT-2 に全パズルで勝ち、規模より構造だと著者らは結論している。

  45. 第61回
    Pereira & Zuidema: 推論モデルはハノイの塔の地図を持ち、そして途中で失くす — Fukai が読む
    2026-08-17

    Devin Pereira と Willem Zuidema(アムステルダム大学)による arXiv preprint。ハノイの塔の flat-to-flat 形式で、推論モデルはプロンプト末尾では盤面をほぼ完璧に(順位相関 0.935、最近傍一致 1.00)内部表現として持つのに、手順を書き出す過程でそれが崩れることを線形プローブと差し替え実験で示した。崩れかけた表現を注入し直すと Qwen3.6-27B の最適解は 33/81(41%)から 59/81(73%)へ回復した。

  46. 第60回
    Lu et al.: フローを生むのは「難しさ」か「注ぎ込んだ努力」か — Fukai が読む
    2026-08-17

    Hairong Lu らによるフローと心的努力の査読論文(Psychological Research, 2025)。視覚弁別課題で「難しさ」と「解けそうだという見込み」を別々に操作したところ、難しさの操作は強く効いた(ηp²=0.64)一方、期待の操作は試行単位でのみ弱く効き(d=0.04)、フローの逆U字は p=0.053 と境界、P300 はフローと無関係だった。N=37 の探索的研究である。

  47. 第59回
    Li et al.: ジグソーパズルで「AI は本当に形を見ているか」を測る — Fukai が読む
    2026-08-15

    Shawn Li らによる視覚言語モデルの空間推論ベンチマーク JigShape の論文。凸凹の噛み合うピースで正解を一意にし 4×4 から 16×16 まで 95,468 問を用意したところ、ゼロショットで乱数を超えたのは GPT-5.5 だけ(4×4 で 69.65%)、8×8 以降は微調整しても崩れ、凹凸を消すと 97% が 10% に落ちた。

  48. 第58回
    Randelshofer et al.: AAA スタジオの UX リーダー15人に、企画段階の意思決定を聞いた — Fukai が読む
    2026-08-14

    Ubisoft の Randelshofer 氏と Waterloo 大学 HCI Games グループらの共著による、AAA タイトルの UX リーダー15名(Blizzard、EA DICE、Guerrilla、Larian、Remedy、Ubisoft ほか)への半構造化インタビュー研究。企画段階の意思決定が「理論」「経験」「勘」の三つを場面に応じて混ぜて行われていること、strike/competency team という横断チーム構造、そして学術フレームワークが現場に届かない理由を反射的テーマ分析で整理する。arXiv preprint(2026年8月、査読前)。ゲーム制作の内側を UX の視点から覗ける貴重な質的研究である。

  49. 第57回
    Bazzaz と Cooper: 生成AI と PCG を Steam レビュー 50万件で比べる — Fukai が読む
    2026-08-14

    Northeastern の Bazzaz と Cooper による、Steam レビュー 508,192 件を分析した論文。生成AI 使用を開示したゲーム 5,970 本と PCG 使用の 5,186 本を比べ、好評率は PCG 86.3% に対し生成AI 68.4%(差 17.9 ポイント)、感情の内訳は生成AI 側で好意的 53.0%/否定的 47.0% と、ほぼ半々に割れた。600 件のテーマ分析からは「開発の手抜きの合図」「思想的拒絶」「条件付き受け入れ」「開示と実物の整合」「使うべきところで使わないことへの批判」の5テーマが立った。arXiv:2608.11539、ACM DOI 10.1145/3831347 割当済み。

  50. 第56回
    Cai et al.: 千人が同じ世界を見るために、学習モデルに「権威あるサーバ」を持ち込む — Fukai が読む
    2026-08-12

    Alaya Lab・北京大学・東京科学大学の Cai 氏ら9名による、マルチプレイ環境のワールドモデルの論文。オンラインゲームの「権威あるサーバ」の取り決めを学習モデルに移植し、型付きの共有状態を進める Logic Engine と、そこから各カメラの絵を作る Rendering Engine に分離した。条件を揃えたマルチプレイ Snake で状態復元スコア 0.764(映像ベース最良は 0.128)、同時視点の食い違いは構成上 0.000。1,024体のプレイヤー実体を10,000手進めた。arXiv preprint(2026年8月6日投稿、査読前)。

  51. 第55回
    Han et al.: 学ぶ順番が効く場面と効かない場面を、計算量で切り分ける — Fukai が読む
    2026-08-10

    カリフォルニア大学デービス校の Han 氏ら5名による、教育系列化の計算量を扱った論文。前提条件でつながった概念を学ぶ順序の最適化を確率的最短経路問題として定式化し、失敗によるやり直しという確率性はコストを成功確率で割るだけで厳密に消せること、それでも最適順序の決定は NP 困難であること、そして最適化の前に「順番をいじって得られる利得の上限」を安価に計算できることを示した。入門CS科目の70,893件の実データではその余地が0.2%未満だった一方、人工的な罠では貪欲な順序が28.3〜45.1%の損をした。arXiv preprint(2026年8月5日投稿、査読前)。

  52. 第54回
    Honda et al.: 「試す価値のある選択肢」を、減る不確実性の量で測る — Fukai が読む
    2026-08-09

    東京大学の本多氏ら6名による B-EUR モデルの論文。ある選択肢を試す価値を「行動と結果の対応についての不確実性がどれだけ減ると期待できるか」で定式化し、グラフ形当てゲームでシミュレーションと人間実験(44名)を行った。試す価値・楽しさ・選ばれやすさはいずれも一般化可能性が中程度のときに最大となる逆U字を示した。結果の見分けやすさは選択行動には効いたが、主観評定には有意な効果が出なかった。arXiv preprint(2026年8月6日投稿、査読前)。

  53. 第53回
    Tarun Kumar S: 人間の指し手を当てる AI に「直前の20手」と「残り時間」を教えたら — Fukai が読む
    2026-08-08

    Peargent Labs の Tarun Kumar S による、人間の指し手を予測するチェス AI「Otter」の論文。従来のモデルが各局面を独立に扱っていたのに対し、直前20手の履歴と持ち時間の残り具合を条件に加え、1530万パラメータで top-1 55.23% を達成。Maia 2 を 1.98 ポイント上回った。盤面のみのベースラインからの改善 +7.62 ポイントのうち、履歴が +5.24、時計が +2.38。arXiv preprint(2026年8月5日投稿、査読前)。

  54. 第52回
    Geheeb et al.: ゲームの「デザインピラー」を LLM に突いてもらう — Fukai が読む
    2026-08-07

    ミュンヘン工科大学の Julian Geheeb らによる、ゲームのデザインピラーと LLM の論文。業界で広く使われながら学術的にはほぼ未整理だったピラーに形式的な定義と品質基準を与え、試作ツール SPINE で構造チェック・矛盾検出・機能評価を LLM に任せた。42時間のゲームジャムと開発者4名のインタビューから、ピラーを言葉にする局面には有用、書き直しは反復するほど薄まる、矛盾指摘は意図的な対比を認識できない、という像が出た。査読を通った FDG '26 論文。

  55. 第51回
    Chen: 物語から「持続する世界」を先に復元してから遊べる場を作る — Fukai が読む
    2026-08-06

    Yi-Chun Chen による物語からのゲーム生成の論文。シーンやゲームプレイを個別に生成する前に、物語から「持続する世界」(実体・場所・関係・状態)を明示的に復元し、全工程が共有する計算対象として維持することを中心課題に据える。GPT-5-mini と制約付き世界補完で世界を組み、PyGame のタイルベース環境として実現。3ケースでの定性的な実行可能性の実証にとどまり、定量評価はない arXiv preprint。

  56. 第50回
    Huang et al.: 生成したゲームを AI に「遊ばせて」直させる — Fukai が読む
    2026-08-05

    Yixu Huang ら(復旦大学・小紅書ほか)によるゲーム生成の論文。画面を見て操作する GUI エージェントをテストプレイヤーとして生成ループに組み込む Play2Code と、200 本・1,548 項目の評価環境 PlaytestArena を提案する。3モデル平均の基準通過率は、一回書き切り 29.7%、コード検査のみの既存手法 52.2% に対し 66.8% だった。

  57. 第49回
    Wu et al.: 症例の文章を「決断が連なる物語」に組み替える — Fukai が読む
    2026-08-04

    Qian Wu ら(香港中文大学ほか)による医療教育ゲーミフィケーションの論文。静的な症例報告を Act / Scene / Decision Node の三層台本に変換し、さらに多モーダル生成の依存グラフへ落とす二段構えの枠組み MedGame を提案する。5,000 症例の評価セットで追加学習すると構造的妥当性は 79.4% から 99.1% へ上がるが、医学的正確さは 7 点前後で頭打ちのままだった。

  58. 第48回
    Wang et al.: パズルのソルバーを一手ごとの先生にする — Fukai が読む
    2026-08-03

    Yu Wang らによるゲーム AI の論文。長手数パズルで最後の勝敗しか報酬がない問題に対し、専用ソルバーが返す「ゴールまでの残り手数」の減り方を一手ごとの評価に変換して学習に混ぜる。Sokoban・Minesweeper・Rush Hour の三種平均で成功率を 16.6% から 62.1% へ、未学習難易度で 5.9% から 28.4% へ引き上げた。ソルバー問い合わせのコストは学習時間の 100 万分の 73 程度。

  59. 第47回
    Ponnock & Ho: マリオ 1-1 の「順番」には、測れる教育効果があった — Fukai が読む
    2026-08-02

    Jesse Ponnock と Lucas Ho による強化学習とレベルデザインの論文(arXiv preprint、査読前)。スーパーマリオブラザーズのワールド 1-1 をタイル格子として実装し直し、内容を固定したまま 6 区画の順序だけを入れ替えて学習させたところ、オリジナルの順番が収束最速・学習効率最高・破滅的失敗ゼロの唯一の条件だった。ただしこの順序効果はモンテカルロ法では現れ、再生バッファを持つ DQN では完全に消える。

  60. 第46回
    Jeong et al.: 同じ問題でも、答え方を変えると難しさが変わる — Fukai が読む
    2026-08-01

    Harim Jeong らによる認知負荷とインタラクション設計の論文(JMIR Serious Games、査読済み)。タブレット上のストループ課題で、刺激を固定したまま答え方だけを文字ラベルから色パッチに変えると、6〜12歳の子ども127人で正答率が 0.86 から 0.91 へ、反応時間が 85.4ms 短縮した。前頭前野の脳指標には有意差が出なかった。

  61. 第45回
    Zhou et al.: 検証器がカリキュラムである — 起動チェックだけでゲーム自動生成を鍛える — Fukai が読む
    2026-07-31

    Chenyu Zhou らによるゲーム自動生成の論文。採点モデルが騙せるという診断から出発し、Godot でエラーなく起動するかという白黒の判定だけを門番に自己蒸留を三周回して、未学習4ジャンルでの清潔な生成率を 8.8% から 42.2% へ、best-of-16 のカバー率を 18/25 から 25/25 へ引き上げた。門番を緩めると効果は消える。

  62. 第44回
    Gould & Ward et al.: パズルの難易度を「人間の所要時間」で測る — Fukai が読む
    2026-07-29

    Gould と Ward らによる AI 評価の論文。43 ベンチマーク・3万問超に「人間の所要時間」を付け、思考を書き出さないモデルが 50% 成功する課題の時間を測ったところ、6年で約373日ごとに倍増し GPT-5.5 で約3分に達した。数独やクロスワードを含む難易度計量の作法が、パズル設計にそのまま使える。

  63. 第43回
    Li et al.: 動画生成 AI をゲームエンジンとして読み直す——「状態」という残された難所 — Fukai が読む
    2026-07-28

    Zhen Li らによるインタラクティブ世界モデルのサーベイ。動画生成でゲーム世界を作る研究群を、ゲームエンジンの「行動—状態—観測」ループから取り出した4つの軸で整理し、残された難所がすべて「明示的なゲーム状態」に関わると指摘。『黒神話:悟空』の90時間超データセットも公開。

  64. 第42回
    Teo et al.: AI は「助けすぎる」——問題解決中の介入を測る Int-Bench — Fukai が読む
    2026-07-27

    Teo らによる LLM の介入行動の論文。AI アシスタントが問題解決中に「いつ・どれだけ助けるか」を Int-Bench という模擬環境で測り、AI は人間より早く頻繁に介入して答えを漏らしやすく、応用力を伸ばさないと報告。パズルのヒント設計に効く一本。

  65. 第41回
    Halina & Guzdial: レベルを「時間のケーキ」として生成する — Fukai が読む
    2026-07-26

    Halina と Guzdial による手続き的レベル生成の論文。レベルを「時間の各瞬間の盤面を積み重ねたケーキ表現」で表し、プレイの軌跡を組み替える PRP でレベルと解答を同時生成。倉庫番で六つの既存手法と比べ、遊べる率100%と高い多様性を、人手の制約や報酬なしで両立した。

  66. 第40回
    Hsu et al.: LLM がしゃべる NPC は、プレイヤーの頭を重くする——「諸刃の剣」の実験 — Fukai が読む
    2026-07-24

    Hsu ら(中国伝媒大学ほか)による LLM NPC の実証論文。同じゲームの「台本 NPC」版と「GPT-4.1 の LLM NPC」版を作り、130人の被験者間比較で検証。LLM NPC は認知負荷を有意に増やし(p<.001)、全体の面白さは有意に改善せず(p=.195)、自律感は上がるが使いやすさと信頼は下がる、と報告する。

  67. 第39回
    Wang ら: Tetris Block Puzzle の難易度を強い AI の学習速度で測る — Fukai が読む
    2026-07-23

    台湾・陽明交通大学と中央研究院のグループによる、スマホで人気の Tetris Block Puzzle の難易度を測る arXiv プレプリント。ルール変種の難しさを、強い AI(Stochastic Gumbel AlphaZero)がどれだけ速く高得点まで学習できるかで評価し、手札やプレビューを増やすと易しく、ブロック形状を追加すると難しく(T-pentomino が最大)なることを示した。

  68. 第38回
    Johnson ら: 大規模言語モデルを組み込むとゲームはどう変わるか — Fukai が読む
    2026-07-22

    カルガリー大学の Johnson らによる、LLM をゲームの構造に組み込んだ二本のゲーム開発の質的研究。LLM を「飾り」でなく「部品」として埋め込むとゲームプレイ・遊びやすさ・プレイヤー体験がどう変わるかを、開発者の内省から分析。変化と個人化が増える一方、正しさ・難易度較正・一貫性という新たな負担が生まれ、スキーマ強制と検証が鍵になると報告する。

  69. 第37回
    Earle et al.: レベル設計を「1人の作業」から「複数エージェントの協働」に組み替える — Fukai が読む
    2026-07-21

    Earle らによる強化学習レベル生成(PCGRL)の論文。1体のエージェントが盤面を編集する従来手法を、複数エージェントが手分けして同時編集するマルチエージェント問題に組み替え、エージェントを増やすほど生成の質・未知の盤面への一般化・計算効率が上がることを、迷路とダンジョンの二領域で示した。

  70. 第36回
    Bhaumik et al.: WFC と強化学習を縫い合わせて「遊べて綺麗な」レベルを作る — Fukai が読む
    2026-07-20

    Bhaumik らによる手続き的レベル生成の論文。「見た目は良いが遊べない」WFC と「遊べるが汚い」強化学習の弱点を、WFC の局所ルールで強化学習の行動を絞り込む WCRL で解こうとし、ロードランナーで見た目と遊べることを両立したレベルを生成した。

  71. 第35回
    Shyne et al.: パズルの「解答ループ数」は人間の難しさ体感とどこまで一致するか — Fukai が読む
    2026-07-19

    Shyne, Facey & Cooper による論理グリッドパズルの難易度研究。人間風ソルバーの反復回数「解答ループ数」を難易度の代理指標とし、品質多様性アルゴリズムで難易度違いのパズルを生成、63人の実験で解答ループ数が主観的難易度と有意に相関(c=0.30, p=0.015)することを示した。

  72. 第34回
    Nath ら: 配信で「映像が汚れる」ゲーム AI をどう鍛えるか — Fukai が読む
    2026-07-18

    Microsoft のチーム(Nath ら)による、配信されるビデオゲームの模倣学習エージェントの論文。クラウドゲーミングで映像に生じる時間的につながったノイズを人工的に作って学習に混ぜる「ストリーミング拡張」を提案。わずか5本のデモでも最大4割ほど達成率が上がり、通信遅延下の性能低下を 49.82% から 7.45% に抑えた。

  73. 第33回
    Ye ほか: 子ども向け知能検査で画像も扱う AI(MLLM)を測る — Fukai が読む
    2026-07-17

    ShanghaiTech 大学の Hengwei Ye らによる、子ども向け知能検査(ウェクスラー式)に着想した MLLM 評価ベンチマーク KidGym の論文(arXiv プレプリント)。実行・知覚推論・記憶・学習・計画の5能力を2Dグリッド上の12課題・難易度3段階で測り、9モデルを評価。上位モデルでも抽象図形パズルは最高0.30、数え上げは人間1.00に対し最高0.72にとどまった。

  74. 第32回
    Zeng et al.: ゲームバランス調整を LLM 同士の自己対戦で自動化する — Fukai が読む
    2026-07-16

    Zeng らによる自動ゲームバランス調整の論文。非対称戦略ゲームのバランス調整という問題を、複数の LLM の自己対戦を評価器に、ベイズ最適化でルールのパラメータを探索することで扱い、自作ゲーム CivMini で勝率差がほぼ0%になる設定へ収束できたと報告する。

  75. 第31回
    Waugh: 数独やスリザーリンクで AI の推論力を測る — Fukai が読む
    2026-07-15

    Approximate Labs の Justin Waugh による、ペンシルパズルで LLM の推論を測るベンチマーク Pencil Puzzle Bench の論文(arXiv プレプリント)。62,231 問・94 種類から 300 問を選び、一手ごとにルール違反を機械が検算できる点を核に 51 モデルを評価。最強の GPT-5.2 でもエージェント的解法で 56.0% にとどまり、約半分が未解決だった。

  76. 第30回
    Ahn et al.: パズルの難しさは「見た目」ではなく「概念」に宿る — Fukai が読む
    2026-07-14

    ボストン大学の Ahn らによる、抽象推論ベンチマーク ARC を人間向けに組み直した CogARC の論文(arXiv プレプリント)。のべ 260 人のグリッドパズル解答を一手ずつ記録し、難しさは盤面の大きさや色数ではなくルールの概念的複雑さで決まること、人は間違えるときも同じ誤答へそろって収束することを示した。

  77. 第29回
    Luo et al.: AI の「助け方」は助けの中身と同じくらい効く — Fukai が読む
    2026-07-13

    UC Santa Barbara の Luo らによる、混合主導 AI の「助け方」に関する論文。ラッシュアワー・パズルを題材に、ボタンで要求するオンデマンド助力と、無操作時間で自動発動するタイマー助力を比較し、成績はほぼ同じでもタイマー型のほうが AI への評価が高くなることを示した。IUI '26 採択。

  78. 第28回
    Ying et al.: あらゆる「人間のゲーム」で AI の一般知能を測る — Fukai が読む
    2026-07-12

    MIT・ハーバードらの研究チームによる、AI の一般知能を『人間が作ったゲーム』で測るプレプリント。App Store と Steam の人気作100本を LLM で作り直し、7つの最新視覚言語モデルに遊ばせたところ、最強でも人間の中央値100に対し8.5点にとどまり、記憶・計画・ルールの推測で人間に大きく及ばなかった。

  79. 第27回
    Triebel et al.: 名作物理パズルで、AI に「思考」と「手」の両方はあるか — Fukai が読む
    2026-07-11

    Triebel らによる、名作物理パズル『The Incredible Machine 2』を舞台にした VLM 評価の論文。画面操作 AI が人間のように問題を解けるかを VLATIM という5段階の物差しで測り、賢い大型モデルほど計画は立てられるのに正確なクリックができず、どのモデルも一つのパズルすら完走できなかった。

  80. 第26回
    Nasvytis & Fan: ひらめきと「転移」は話し方に表れる — Fukai が読む
    2026-07-10

    スタンフォードの Nasvytis と Fan による、ひらめきと転移を思考発話から捉えた論文。参加者189人にマッチ棒数式パズルを5問解かせ、同じ型を繰り返す群は初正解後も速く正確になり(試行5で正答率0.75)、問題の型を口に出す割合が約7倍に増えた。転移の印は『コツを言葉にできること』だと読める。

  81. 第25回
    Li et al.: 記号ソルバーを審判にして幾何問題を「検証可能」に解く — Fukai が読む
    2026-07-09

    Can Li らによる幾何問題解決(GPS)の arXiv プレプリント。図と文の問題を記号ソルバーが実行できる形式へ翻訳し、行き詰まりでは補助的な補題を提案してソルバー自身に検証させる SD-GPS を提案。要旨によれば Geometry3K・PGPS9K で既存手法を一貫して上回ったという。解けることを保証するパズル生成への応用を Fukai が読む。

  82. 第24回
    Sestini et al.: AAA ゲームの NPC を強化学習で「本物らしく」する — Fukai が読む
    2026-07-08

    Electronic Arts の研究チームによる vision 論文。AAA ゲームの NPC を強化学習で改良できるかを、EA SPORTS FC 25 のゴールキーパー位置取りと Battlefield 6 の歩兵移動という2つの実例で検証し、制作現場で RL を使うために満たすべき7つの要件を整理する。RL は既存のゲーム AI を置き換えるのではなく補強する道具だ、と結論づける。

  83. 第23回
    Xu ら: 生成AIが「遊びの芯」になるゲームとは — Fukai が読む AIネイティブゲーム調査
    2026-07-07

    Zhiyue Xu ら6名による、生成AIが中核ループそのものになる「AIネイティブゲーム」の調査論文(arXiv プレプリント)。「AIを外したら遊びが成立しないか」という反実仮想で定義し、実在53本をゲームの型(G)と支配的なAIの働き(N)の二軸で分類。物語系に偏り、ルールを裁く使い方は薄いことを示す。

  84. 第22回
    Wermann et al.: ゲーム内 AI の「言葉」と「実演」で学びと認知負荷はどう変わるか — Fukai が読む
    2026-07-06

    LMU ミュンヘンらによる、シリアスゲーム内の AI NPC が与える「言葉による支援」と「実演による支援」を比較した事前登録済みの実験。量子技術を学ぶゲーム Qookies で 152 名を3群に分け、学習効果には群間差が出なかったが、言葉+実演の群は言葉のみの群より内在的認知負荷が有意に低かった(d=0.60)。

  85. 第21回
    Aryan et al.: 行き詰まると世界が変わる——静的なRL環境を「適応の試験場」に変える AbideGym — Fukai が読む
    2026-07-05

    Abide AI の Aryan らによる強化学習の環境設計の論文(preprint)。訓練環境が最初から最後まで固定だとAIがもろくなる問題を、プレイ中にAIの「手が止まったこと」を引き金にルールや地形を変える AbideGym で扱い、覚えた手順を崩して立て直しを促す設計と既存手法との比較を示した(実験結果は未掲載)。

  86. 第20回
    Wang et al.: 視線から「頭の忙しさ」を読む LLM エージェント — Fukai が読む
    2026-07-04

    Meta Reality Labs らによる、視線データから認知負荷(頭の忙しさ)を推定する論文。従来手法の低い汎化性と解釈しにくさを、視線を構造化して LLM に文脈・個人差・お手本つきで推論させる枠組み GazeMind で扱い、3段階分類で 62.73% の精度(既存手法比 +20 ポイント超)を報告した。

  87. 第19回
    Mirowski et al.: 物語を「書く」から「見つける」へ — 作家コミュニティと育てた執筆AI「Fabula」 — Fukai が読む
    2026-07-03

    Google DeepMind による執筆支援AI「Fabula」の論文。物語を階層的に計画・生成する「ドラマ・マネージャ」を、42名の専門家との参加型デザインで批判的に育てた記録で、構造づくりは得意だが文体や意外性は苦手だと分かった。ゲームのインタラクティブ・ナラティブに直接効く知見を Fukai が読む。

  88. 第18回
    Özkan: レベルを生成する AI と攻略する AI を一緒に育てる — Fukai が読む
    2026-07-02

    Miraç Buğra Özkan による、強化学習でレベル生成と攻略を同時に学ばせる論文。Unity 上でハチドリ(攻略役)と浮遊島(生成役)の2体を互いの成績を見ながら学習させ、未知レイアウト100種で約90.2%の攻略成功率に到達した。

  89. 第17回
    Liu et al.: 記憶を増やすほど AI エージェントは協力しなくなる — Fukai が読む
    2026-07-01

    カーネギーメロン大学などのチームによる、LLM エージェントの「記憶の長さ」と協力の関係を調べた arXiv 論文。反復社会的ジレンマ4種を7モデル・最大80ラウンド分の履歴・500ラウンドで評価し、履歴を増やすほど28設定中18で協力が崩れる『記憶の呪い』を報告。原因は文脈長ではなく蓄積した裏切り記録の内容で、前向きな推論で部分的に緩和できると示す。

  90. 第16回
    Feng et al.: LLM エージェントは交易ゲームで賢く駆け引きできるか — Fukai が読む
    2026-06-30

    清華大学チームによる、LLM エージェントを協力かつ競争する交易ゲームで評価するベンチマーク SidConArena の論文。ボードゲーム Sidereal Confluence を題材に、交渉・生産・封印入札の三フェーズで評価し、フロンティアモデルは強いが、資源の価値の取り違え・受け身な交渉・長期投資計画の弱さが残ると報告する。

  91. 第15回
    Bazzaz et al.: 「AI 製だと思う」だけで体験が変わる — Fukai が読む
    2026-06-29

    Bazzaz と Cooper による、生成コンテンツの知覚バイアスを扱う CHI '26 論文。Super Mario Bros. と Sokoban で人間作・AI 生成レベルを混ぜて 142 人に遊ばせ、プレイヤーは作者をほぼ当てられないのに、AI 製だと信じたレベルほど楽しくない・難しい・苛立たしいと評価した、と報告する。

  92. 第14回
    Liu ほか: AI の手助けは「粘り」を奪う——独力とヒント設計への警告 — Fukai が読む
    2026-06-28

    Grace Liu らによる、AI支援が独力での問題解決と粘り強さに与える影響を調べた論文。計1,222人のランダム化比較試験で、AIは作業中の成績を上げる一方、AIを外すと成績が下がり途中で諦めやすくなることを示した。答えを直接もらった人ほど落ち込みが大きく、ヒント利用者は落ちなかった——ゲームのヒント設計に直結する。

  93. 第13回
    Jara Gonzalez & Guzdial: 敵の「形」を、動きで倒せる関門として自動生成する — Fukai が読む
    2026-06-27

    Jara Gonzalez と Guzdial による敵モーフォロジー(当たり判定の形)生成の論文。「特定の動きでだけ倒せる敵」を 4×4 グリッド上で生成する問題を、強化学習・A*探索・ニューラル生成の三手法で扱い、素朴な A* 到達可能性ルールが最良のゲート性能と多様性を最小コストで示した。

  94. 第12回
    Munk et al.: 小さな言語モデルでゲームのテキストを動的生成する — Fukai が読む
    2026-06-25

    コペンハーゲン IT 大学の Munk らによる、小規模言語モデル(SLM)でゲーム内テキストを動的生成する論文。クラウド LLM のオフライン化・コスト・一貫性という壁を、狭い仕事に特化させて微調整した小さなモデルで解こうとする。中世 RPG の中傷ビラ生成を担う DefameLM を概念実証とし、10 億パラメータ級モデルが家庭用 PC 上で数秒・高品質に届くことを示した。

  95. 第11回
    Zeytuncu: パズルの難しさは『使う数の個数』で決まる — Fukai が読む
    2026-06-24

    Yunus E. Zeytuncu による整数四則パズル(数を組み合わせて目標数を作るナンバーズ系)の難易度モデリング論文。約 347 万問を厳密ソルバーで生成し、難易度を最小手数で定義したうえで、最小解で使う数の個数だけが難易度を完璧に決める『最小十分統計量』だと示した。

  96. 第10回
    Chao et al.: ひらめきの正体は「遠くまで探す」こと — Fukai が読む
    2026-06-23

    Chao・Hsieh・Wu による洞察的問題解決(ひらめき)の論文。日本語版 RAT と計算機シミュレーションで「答えにたどり着く探索の道筋」を数値化し、脱固着は解決に必要だがひらめきを決める要因ではなく、ひらめきの目印は解の空間をより遠くまで探索することだと示した。

  97. 第9回
    Monti et al.: 一本道の倉庫番で、AI の「計画する力」を測る — Fukai が読む
    2026-06-22

    Monti らによる、推論モデルの長手順プランニング能力を倉庫番で測るベンチマーク SokoBench の論文。箱一つの一本道だけを並べて難しさを通路の長さ一本に絞り、最新の推論モデルでも 25〜30 手より先の見通しが要ると崩れることを示した。原因は「数え間違いの蓄積」にあると著者らは見る。

  98. 第8回
    Luo et al.: AI エージェントは実際のゲームエンジンで遊べるゲームを丸ごと作れるか — Fukai が読む
    2026-06-21

    Luo, Wang らによる、コーディングエージェントの End-to-End ゲーム生成を測る評価基盤 GameCraft-Bench の論文。自然言語仕様から Godot 上で遊べるゲームを丸ごと作らせ、起動・操作再生・映像採点で判定する 140 課題(15 ジャンル)を提案。最強の構成でも全体 41.46% にとどまり、エージェントは仕組みは作れても内容・見やすさ・仕上げを備えた完成品には届かない、と報告している。

  99. 第7回
    Li ら: ボードゲーム設計を発想から完成まで一気通貫で支援するAI「AutoBG」 — Fukai が読む
    2026-06-20

    Zizhen Li らによるボードゲーム設計支援AI「AutoBG」の論文(arXiv preprint)。発想・ルールブック生成・個別フィードバックという設計工程全体を、生成役と評価役を分ける Verifier-Gated Iteration で扱い、評価役 BG-Critic の診断の質は GPT-5.4 を上回ったと報告する。

  100. 第6回
    Nasir ら: ゲームの「ルールそのもの」を進化させる — Fukai が読む MORTAR
    2026-06-19

    Nasir・Togelius らによる自動ゲームデザインの論文。レベルではなく「メカニクス(ゲームのルール)」そのものを、品質多様性アルゴリズムと大規模言語モデルで進化させ、強さの違うAI同士の勝敗で質を測る MORTAR を提案。GPT-4o-mini で多様で遊べるゲームを生成し、各メカニクスの貢献度まで数値化した。

  101. 第5回
    Jiang ら: 言葉だけで「遊べるゲーム」は作れるか — Fukai が読む OpenGame
    2026-06-18

    Yilei Jiang ら(香港中文大学)による、自然言語からウェブ2Dゲームを丸ごと自動生成するエージェント OpenGame の論文。再利用できる骨組みと『生きたデバッグ手順書』で統合エラーを抑え、150課題で最高水準を達成。ただしパズルは最も苦手なジャンルとして残った。

  102. 第4回
    McConnell & Zhao: 遺伝的アルゴリズムで「ちょうどいい難しさ」のパズルをリアルタイム生成する — Fukai が読む
    2026-06-17

    McConnell と Zhao による、遺伝的アルゴリズムを使った適応的パズル生成の論文。Cosmic Express 風の経路パズルを、プレイヤーの解き方を記録するプレイヤーモデルに合わせて1問約7秒でリアルタイム生成し、18人の実験で「時間だけ」に頼る版が体感難易度・進行感で見劣りすることを示した。

  103. 第3回
    Li ら: LLM は2Dゲームを「遊んで勝てる」か — Fukai が読む GVGAI-LLM
    2026-06-16

    Li ら(NYU ほか)による GVGAI-LLM の論文。118本の2Dゲームを言語モデルに遊ばせ、推論力と空間把握を測るベンチマークを提案。盤面を ASCII 地図に翻訳して zero-shot で解かせると、GPT-4o-mini は540レベル中477で勝率0%、全体勝率10.27%にとどまり、古典的な探索アルゴリズムに及ばなかった。問題・方法・発見・使いどころ・限界の順に解きほぐす。

  104. 第2回
    Kar: 生成したコースが本当に通れるかを実行中に自動エージェントで検べる — Fukai が読む
    2026-06-14

    King's College London の Rishabh Kar による PCG(コンテンツの自動生成)の論文。生成したコースが本当に通れるかという検証を、ゲームを止めず実行中の同じループの中で行う仕組み Momentum を提案。プレイヤーの先を2体の自動エージェントが走り、空中からの幾何チェックと地上の NavMesh チェックで先回りして道を点検する。評価はコードから導いた構造的な見積もりで示される。

  105. 第1回
    Xu et al.: ゲームの「仕掛け」を座標に格上げして解けるレベルを自動生成する — Fukai が読む
    2026-06-13

    McGill 大学の Xu と Verbrugge による PCG(レベル自動生成)の論文。地形優先だった従来手法に対し、重力反転や移動床といった「仕掛け」を座標の一つに格上げした次元拡張グラフ上で経路探索を行い、解けることを生成の最中に保証する HDPCG を提案。Unity 上で実際に遊べるレベルまで再現してみせた。