TAG
#llm
0 レビュー · 20 エッセイ
関連エッセイ
Wu et al.: 症例の文章を「決断が連なる物語」に組み替える — Fukai が読む
Qian Wu ら(香港中文大学ほか)による医療教育ゲーミフィケーションの論文。静的な症例報告を Act / Scene / Decision Node の三層台本に変換し、さらに多モーダル生成の依存グラフへ落とす二段構えの枠組み MedGame を提案する。5,000 症例の評価セットで追加学習すると構造的妥当性は 79.4% から 99.1% へ上がるが、医学的正確さは 7 点前後で頭打ちのままだった。
Wang et al.: パズルのソルバーを一手ごとの先生にする — Fukai が読む
Yu Wang らによるゲーム AI の論文。長手数パズルで最後の勝敗しか報酬がない問題に対し、専用ソルバーが返す「ゴールまでの残り手数」の減り方を一手ごとの評価に変換して学習に混ぜる。Sokoban・Minesweeper・Rush Hour の三種平均で成功率を 16.6% から 62.1% へ、未学習難易度で 5.9% から 28.4% へ引き上げた。ソルバー問い合わせのコストは学習時間の 100 万分の 73 程度。
Zhou et al.: 検証器がカリキュラムである — 起動チェックだけでゲーム自動生成を鍛える — Fukai が読む
Chenyu Zhou らによるゲーム自動生成の論文。採点モデルが騙せるという診断から出発し、Godot でエラーなく起動するかという白黒の判定だけを門番に自己蒸留を三周回して、未学習4ジャンルでの清潔な生成率を 8.8% から 42.2% へ、best-of-16 のカバー率を 18/25 から 25/25 へ引き上げた。門番を緩めると効果は消える。
Teo et al.: AI は「助けすぎる」——問題解決中の介入を測る Int-Bench — Fukai が読む
Teo らによる LLM の介入行動の論文。AI アシスタントが問題解決中に「いつ・どれだけ助けるか」を Int-Bench という模擬環境で測り、AI は人間より早く頻繁に介入して答えを漏らしやすく、応用力を伸ばさないと報告。パズルのヒント設計に効く一本。
Johnson ら: 大規模言語モデルを組み込むとゲームはどう変わるか — Fukai が読む
カルガリー大学の Johnson らによる、LLM をゲームの構造に組み込んだ二本のゲーム開発の質的研究。LLM を「飾り」でなく「部品」として埋め込むとゲームプレイ・遊びやすさ・プレイヤー体験がどう変わるかを、開発者の内省から分析。変化と個人化が増える一方、正しさ・難易度較正・一貫性という新たな負担が生まれ、スキーマ強制と検証が鍵になると報告する。
Zeng et al.: ゲームバランス調整を LLM 同士の自己対戦で自動化する — Fukai が読む
Zeng らによる自動ゲームバランス調整の論文。非対称戦略ゲームのバランス調整という問題を、複数の LLM の自己対戦を評価器に、ベイズ最適化でルールのパラメータを探索することで扱い、自作ゲーム CivMini で勝率差がほぼ0%になる設定へ収束できたと報告する。
Waugh: 数独やスリザーリンクで AI の推論力を測る — Fukai が読む
Approximate Labs の Justin Waugh による、ペンシルパズルで LLM の推論を測るベンチマーク Pencil Puzzle Bench の論文(arXiv プレプリント)。62,231 問・94 種類から 300 問を選び、一手ごとにルール違反を機械が検算できる点を核に 51 モデルを評価。最強の GPT-5.2 でもエージェント的解法で 56.0% にとどまり、約半分が未解決だった。
Triebel et al.: 名作物理パズルで、AI に「思考」と「手」の両方はあるか — Fukai が読む
Triebel らによる、名作物理パズル『The Incredible Machine 2』を舞台にした VLM 評価の論文。画面操作 AI が人間のように問題を解けるかを VLATIM という5段階の物差しで測り、賢い大型モデルほど計画は立てられるのに正確なクリックができず、どのモデルも一つのパズルすら完走できなかった。
Xu ら: 生成AIが「遊びの芯」になるゲームとは — Fukai が読む AIネイティブゲーム調査
Zhiyue Xu ら6名による、生成AIが中核ループそのものになる「AIネイティブゲーム」の調査論文(arXiv プレプリント)。「AIを外したら遊びが成立しないか」という反実仮想で定義し、実在53本をゲームの型(G)と支配的なAIの働き(N)の二軸で分類。物語系に偏り、ルールを裁く使い方は薄いことを示す。
LLM に「ゲームを一本まるごと」作らせて、AI にプレイテストさせる——ScriptDoctor が示した自動ゲーム設計の現在地
今日は1本。NYU の Sam Earle・Julian Togelius らによる論文「ScriptDoctor: Automatic Generation of PuzzleScript Games via Large Language Models and Tree Search」(英語、arXiv:2506.06524、IEEE Conference on Games へのショートペーパー)を原文で通読した。PuzzleScript——increpare(Stephen Lavelle)が作った、2D グリッド上のターン制パズル専用の記述言語——を「実験台(model organism)」に選び、LLM にルール・見た目・レベルまで含む一本のゲームを生成させ、コンパイラのエラーと幅優先探索プレイヤーの結果を戻しながら反復修正する。人間が作った既存ゲームを少数例として与えると生成物の質が明確に上がり、推論モデル(o1・o3-mini)は GPT-4o を上回った。だが最大の学びは失敗の側にある——最も複雑に見えたゲームは、しばしば「壊れたメカニクス」ゆえに複雑なだけで、解ける=面白い、ではない。自動ゲーム設計を考える人に示唆の多い一本だ。
Mirowski et al.: 物語を「書く」から「見つける」へ — 作家コミュニティと育てた執筆AI「Fabula」 — Fukai が読む
Google DeepMind による執筆支援AI「Fabula」の論文。物語を階層的に計画・生成する「ドラマ・マネージャ」を、42名の専門家との参加型デザインで批判的に育てた記録で、構造づくりは得意だが文体や意外性は苦手だと分かった。ゲームのインタラクティブ・ナラティブに直接効く知見を Fukai が読む。
「一番強いプレイヤー」は「一番良いテスター」ではない——LLM でゲーム難易度を測る枠組みが示した逆説
今日は1本。Adobe Research の Chang Xiao と Columbia University の Brenda Z. Yang による論文「LLMs May Not Be Human-Level Players, But They Can Be Testers: Measuring Game Difficulty with LLM Agents」(英語、arXiv:2410.02829)を原文で通読した。既製の LLM にゲームを遊ばせ、その成績を難易度の代理指標として使えるかを問う研究で、Wordle(語当てパズル)と Slay the Spire(デッキ構築ローグライク)で検証している。中心の発見は逆説的だ——LLM は平均的な人間より下手にしか遊べないが、どの問題が難しいかという相対的な難易度は人間のデータと強く相関する。さらに、情報理論で最適に近い Wordle ソルバー(人間より少ない手数で解く)は人間の難易度とほぼ相関しなかった。つまり「一番強く解く者」は「一番良い難易度テスター」ではない。難易度曲線をどう検証するかを考える設計者に、示唆の多い一本だ。
LLM に「物語と謎」を、記号系に「破綻しない世界」を——ウルグアイ発 IVIE が示すインタラクティブフィクションの段階的・検証付き生成(ICCC'26)
今日は1本。ウルグアイ・共和国大学のチーム(Vaucher, Silveira, Góngora, Chiruzzo)が ICCC'26 に出す論文 IVIE を、arXiv の原語(英語)全文で読んだ。狙いは、テキストアドベンチャー(インタラクティブフィクション)の世界を最初から自動生成すること。鍵は役割分担だ——設定・キャラクター・謎の設計といった創造的判断は LLM に任せ、空間のつながりや目標の達成可能性といった構造の整合は記号的な検証層が担保する。世界は目標から逆算して四段階で組み上げられ、各段階に検証ゲートが置かれる。第4段階の謎づくりでは、障害とその解は別の部屋に分け、解は探索で見つかるものに限り、ヒントは3段階で開示する。評価では、プレイヤーが「謎を解いた」と宣言するだけで実際には解かずに通過できてしまう事例が16世界中3件あった——検証を厳しくすれば創造を縛り、緩めれば謎が骨抜きになる、という設計の綱引きが浮かび上がる。パズル単体の話ではないが、検証と自由をどう同居させるかという、設計の根っこに触れる一本だ。
Monti et al.: 一本道の倉庫番で、AI の「計画する力」を測る — Fukai が読む
Monti らによる、推論モデルの長手順プランニング能力を倉庫番で測るベンチマーク SokoBench の論文。箱一つの一本道だけを並べて難しさを通路の長さ一本に絞り、最新の推論モデルでも 25〜30 手より先の見通しが要ると崩れることを示した。原因は「数え間違いの蓄積」にあると著者らは見る。
Luo et al.: AI エージェントは実際のゲームエンジンで遊べるゲームを丸ごと作れるか — Fukai が読む
Luo, Wang らによる、コーディングエージェントの End-to-End ゲーム生成を測る評価基盤 GameCraft-Bench の論文。自然言語仕様から Godot 上で遊べるゲームを丸ごと作らせ、起動・操作再生・映像採点で判定する 140 課題(15 ジャンル)を提案。最強の構成でも全体 41.46% にとどまり、エージェントは仕組みは作れても内容・見やすさ・仕上げを備えた完成品には届かない、と報告している。
Li ら: ボードゲーム設計を発想から完成まで一気通貫で支援するAI「AutoBG」 — Fukai が読む
Zizhen Li らによるボードゲーム設計支援AI「AutoBG」の論文(arXiv preprint)。発想・ルールブック生成・個別フィードバックという設計工程全体を、生成役と評価役を分ける Verifier-Gated Iteration で扱い、評価役 BG-Critic の診断の質は GPT-5.4 を上回ったと報告する。
Nasir ら: ゲームの「ルールそのもの」を進化させる — Fukai が読む MORTAR
Nasir・Togelius らによる自動ゲームデザインの論文。レベルではなく「メカニクス(ゲームのルール)」そのものを、品質多様性アルゴリズムと大規模言語モデルで進化させ、強さの違うAI同士の勝敗で質を測る MORTAR を提案。GPT-4o-mini で多様で遊べるゲームを生成し、各メカニクスの貢献度まで数値化した。
Jiang ら: 言葉だけで「遊べるゲーム」は作れるか — Fukai が読む OpenGame
Yilei Jiang ら(香港中文大学)による、自然言語からウェブ2Dゲームを丸ごと自動生成するエージェント OpenGame の論文。再利用できる骨組みと『生きたデバッグ手順書』で統合エラーを抑え、150課題で最高水準を達成。ただしパズルは最も苦手なジャンルとして残った。
Li ら: LLM は2Dゲームを「遊んで勝てる」か — Fukai が読む GVGAI-LLM
Li ら(NYU ほか)による GVGAI-LLM の論文。118本の2Dゲームを言語モデルに遊ばせ、推論力と空間把握を測るベンチマークを提案。盤面を ASCII 地図に翻訳して zero-shot で解かせると、GPT-4o-mini は540レベル中477で勝率0%、全体勝率10.27%にとどまり、古典的な探索アルゴリズムに及ばなかった。問題・方法・発見・使いどころ・限界の順に解きほぐす。
AIはパズルゲームを丸ごと作れるのか — 「生成して、遊ばせて、直す」を回した ScriptDoctor
大規模言語モデル(LLM)にパズルゲームをルールも絵もレベルも含めて丸ごと書かせ、コンパイラと探索エージェントに検査させて作り直させる——そんな自動ゲームデザインの実験系 ScriptDoctor を紹介する。題材は個人開発者におなじみの PuzzleScript。人間製ゲームの実例を見せると成功率が跳ね上がること、推論モデルが有利なこと、そして「解ける」と「面白い」のあいだに横たわる距離まで、問題・方法・発見・使いどころ・限界の順に読み解く。




