TAG
#difficulty
0 レビュー · 28 エッセイ
関連エッセイ
Wang et al.: パズルのソルバーを一手ごとの先生にする — Fukai が読む
Yu Wang らによるゲーム AI の論文。長手数パズルで最後の勝敗しか報酬がない問題に対し、専用ソルバーが返す「ゴールまでの残り手数」の減り方を一手ごとの評価に変換して学習に混ぜる。Sokoban・Minesweeper・Rush Hour の三種平均で成功率を 16.6% から 62.1% へ、未学習難易度で 5.9% から 28.4% へ引き上げた。ソルバー問い合わせのコストは学習時間の 100 万分の 73 程度。
Ponnock & Ho: マリオ 1-1 の「順番」には、測れる教育効果があった — Fukai が読む
Jesse Ponnock と Lucas Ho による強化学習とレベルデザインの論文(arXiv preprint、査読前)。スーパーマリオブラザーズのワールド 1-1 をタイル格子として実装し直し、内容を固定したまま 6 区画の順序だけを入れ替えて学習させたところ、オリジナルの順番が収束最速・学習効率最高・破滅的失敗ゼロの唯一の条件だった。ただしこの順序効果はモンテカルロ法では現れ、再生バッファを持つ DQN では完全に消える。
Gould & Ward et al.: パズルの難易度を「人間の所要時間」で測る — Fukai が読む
Gould と Ward らによる AI 評価の論文。43 ベンチマーク・3万問超に「人間の所要時間」を付け、思考を書き出さないモデルが 50% 成功する課題の時間を測ったところ、6年で約373日ごとに倍増し GPT-5.5 で約3分に達した。数独やクロスワードを含む難易度計量の作法が、パズル設計にそのまま使える。
Teo et al.: AI は「助けすぎる」——問題解決中の介入を測る Int-Bench — Fukai が読む
Teo らによる LLM の介入行動の論文。AI アシスタントが問題解決中に「いつ・どれだけ助けるか」を Int-Bench という模擬環境で測り、AI は人間より早く頻繁に介入して答えを漏らしやすく、応用力を伸ばさないと報告。パズルのヒント設計に効く一本。
転がすという動詞 — 転がり運動のパズル設計文法(Bloxorz から Stephen's Sausage Roll へ)
転がすというひとつの動詞が、位置に「向き」という次元を足すことで、面数を増やさずに深い状態空間を作る。Kula World から Stephen's Sausage Roll まで、転がり運動のパズルを設計論として並べ直す。
Shyne et al.: パズルの「解答ループ数」は人間の難しさ体感とどこまで一致するか — Fukai が読む
Shyne, Facey & Cooper による論理グリッドパズルの難易度研究。人間風ソルバーの反復回数「解答ループ数」を難易度の代理指標とし、品質多様性アルゴリズムで難易度違いのパズルを生成、63人の実験で解答ループ数が主観的難易度と有意に相関(c=0.30, p=0.015)することを示した。
Ye ほか: 子ども向け知能検査で画像も扱う AI(MLLM)を測る — Fukai が読む
ShanghaiTech 大学の Hengwei Ye らによる、子ども向け知能検査(ウェクスラー式)に着想した MLLM 評価ベンチマーク KidGym の論文(arXiv プレプリント)。実行・知覚推論・記憶・学習・計画の5能力を2Dグリッド上の12課題・難易度3段階で測り、9モデルを評価。上位モデルでも抽象図形パズルは最高0.30、数え上げは人間1.00に対し最高0.72にとどまった。
運を設計から追い出す — マインスイーパから guessing-free ロジックパズルへ
マインスイーパの終盤に現れる50/50の賭けは、なぜ長く放置され、どう克服されたのか。Hexcells、Tametsi、14 Minesweeper Variants と系譜を辿り、推測を生まない盤面の設計条件と、その代償を考える。
Ahn et al.: パズルの難しさは「見た目」ではなく「概念」に宿る — Fukai が読む
ボストン大学の Ahn らによる、抽象推論ベンチマーク ARC を人間向けに組み直した CogARC の論文(arXiv プレプリント)。のべ 260 人のグリッドパズル解答を一手ずつ記録し、難しさは盤面の大きさや色数ではなくルールの概念的複雑さで決まること、人は間違えるときも同じ誤答へそろって収束することを示した。
Bennett Foddy の哲学 — 意味のなさと戦うために、失敗を設計する
『QWOP』『Getting Over It』の Bennett Foddy を、本人インタビューとブログだけを根拠に考察する。「ゲームは意味を持たない」という逆説から出発する哲学、フラストレーションを味で分類するこだわり、自作をクリアできなかった失敗談、励ましと嘲りのジレンマ、そして『Sexy Hiking』や古い理不尽なゲームという影響源まで。最後に、彼を「意味の欠如と戦うデザイナー」と読む私見を一段落だけ添える。
操作系がパズルの難しさを決めるとき — グリッド移動からドラッグ整理まで
倉庫番のグリッド移動、The Witness の線、Gorogoa と A Little to the Left のドラッグ、Return of the Obra Dinn のカーソル、The Gardens Between の時間、Golf Peaks のカード。入力の一手がどうパズルの難しさをかたちづくるかを、離散性・Undoコスト・アフォーダンスの三点から設計者視点で整理する。
Wang et al.: 視線から「頭の忙しさ」を読む LLM エージェント — Fukai が読む
Meta Reality Labs らによる、視線データから認知負荷(頭の忙しさ)を推定する論文。従来手法の低い汎化性と解釈しにくさを、視線を構造化して LLM に文脈・個人差・お手本つきで推論させる枠組み GazeMind で扱い、3段階分類で 62.73% の精度(既存手法比 +20 ポイント超)を報告した。
Özkan: レベルを生成する AI と攻略する AI を一緒に育てる — Fukai が読む
Miraç Buğra Özkan による、強化学習でレベル生成と攻略を同時に学ばせる論文。Unity 上でハチドリ(攻略役)と浮遊島(生成役)の2体を互いの成績を見ながら学習させ、未知レイアウト100種で約90.2%の攻略成功率に到達した。
「一番強いプレイヤー」は「一番良いテスター」ではない——LLM でゲーム難易度を測る枠組みが示した逆説
今日は1本。Adobe Research の Chang Xiao と Columbia University の Brenda Z. Yang による論文「LLMs May Not Be Human-Level Players, But They Can Be Testers: Measuring Game Difficulty with LLM Agents」(英語、arXiv:2410.02829)を原文で通読した。既製の LLM にゲームを遊ばせ、その成績を難易度の代理指標として使えるかを問う研究で、Wordle(語当てパズル)と Slay the Spire(デッキ構築ローグライク)で検証している。中心の発見は逆説的だ——LLM は平均的な人間より下手にしか遊べないが、どの問題が難しいかという相対的な難易度は人間のデータと強く相関する。さらに、情報理論で最適に近い Wordle ソルバー(人間より少ない手数で解く)は人間の難易度とほぼ相関しなかった。つまり「一番強く解く者」は「一番良い難易度テスター」ではない。難易度曲線をどう検証するかを考える設計者に、示唆の多い一本だ。
読める失敗 — パズルの『詰み』をどう可視化するか
パズルにおける失敗とは死ではなく『詰み』だ。倉庫番の不可逆な押し、Stephen's Sausage Roll の見えない手詰まり、Witness と COCOON の詰みを作らない設計。失敗を罰するかではなく、失敗を読ませられるかという可視性の設計問題を考察する。
Zeytuncu: パズルの難しさは『使う数の個数』で決まる — Fukai が読む
Yunus E. Zeytuncu による整数四則パズル(数を組み合わせて目標数を作るナンバーズ系)の難易度モデリング論文。約 347 万問を厳密ソルバーで生成し、難易度を最小手数で定義したうえで、最小解で使う数の個数だけが難易度を完璧に決める『最小十分統計量』だと示した。
「もう一つ何かを」——Capcom『Pragmata』が挑む“パズル×シューター”の同居設計(Game Developer)
今日は1本。専門メディア Game Developer の設計記事(Alessandro Fillari、2026年4月14日)を英語原文で読んだ。題材は Capcom の新作三人称シューター『Pragmata(プラグマタ)』——敵を弱体化させるために、戦闘中にリアルタイムで“スネーク風”のハッキング・パズルを解く、という珍しい「パズル・シューター」だ。開発陣(ディレクター Cho Yonghee、プロデューサー Naoto Oyama・Edvin Edsö)が語る設計上の最大の難所は「反復に感じさせないこと」。射撃という土台の上に戦略性としてのハッキングを重ね、二つの技能を同時に捌く“流れ”を成立させるため、長い開発期間の多くをバランスと手触りの調整に費やしたという。注目作の風変わりな仕掛けを、設計の視点から追う。
Chao et al.: ひらめきの正体は「遠くまで探す」こと — Fukai が読む
Chao・Hsieh・Wu による洞察的問題解決(ひらめき)の論文。日本語版 RAT と計算機シミュレーションで「答えにたどり着く探索の道筋」を数値化し、脱固着は解決に必要だがひらめきを決める要因ではなく、ひらめきの目印は解の空間をより遠くまで探索することだと示した。
パズルは「難しくする」ためではなく「システムを見せる」ために作る——Patrick Traynor が語る Patrick's Parabox の系統的設計(GDC 2024)
今日は1本。Patrick Traynor(Patrick's Parabox 作者)が GDC 2024 で行った講演『System-Centric Puzzle Design in Patrick's Parabox』の公式スライドを読んだ。彼の出発点は逆説的だ——「パズルの目的はクールなパズルを作ることではない。パズルの目的は、このクールなシステム(再帰する箱)を見せることだ」。だから難易度は挑戦のためではなく“伝達”のために設計され、できる限り易しく、しかしアイデアが伝わるぎりぎりまで簡略化される。学習曲線の平滑化(挿入・修正・削除・並べ替え・任意化)、ナレーション付き動画プレイテスト約15回、「相互作用を見つけて無理にでも成立させる」という発想法、そして「そのシステムで何問作れるか」を良いパズルシステムの指標とする考え方。出荷364問の裏に未使用600問超。GDC 2024 の講演だが、設計の前提を問い直す内容として今読む価値がある。
一画面に閉じる設計 — ワンスクリーンパズルが鍛える密度
倉庫番、Baba Is You、Snakebird、Patrick's Parabox。思考系パズルの中核作品ほど、盤面を一画面に収めている。同時可視性がなぜ思考を深めるのか、そしてスクロールを許す判断はどこで下すべきかを、Adventures of Lolo や Chip's Challenge まで遡って設計者視点で考える。
Sun et al.: なぜ人は理不尽に難しいゲームに没頭するのか — Fukai が読む
Sun らによる Soulslike ゲームの難易度設計に関する論文。なぜプレイヤーが理不尽に難しいゲームに没頭するのかを、600 件の Steam レビューの質的分析で探り、挫折に意味づけを与えることで没入が保たれる「レジリエント・フロー」という概念を提案する。
ヒント機能の設計 — どう示し、どう隠すか
InvisiClues の透明インク、The Witness の沈黙、The Case of the Golden Idol の摩擦、Return of the Obra Dinn の三人確定。ヒント機能をどう示し、どう隠すかという設計を、詰まったプレイヤーへの姿勢の宣言として整理する。
『ちょうどいい難しさ』をどう作るか — 機械が難易度を合わせにいく道(カナダの研究)と、人が意味で設計する道(米国の開発者)
信頼できるソースだけで組み直した版。本日は2本、どちらも『プレイヤーにちょうどいい難しさをどう届けるか』という問いに、正反対の道から答えている。1本目はカナダの研究者 Matthew McConnell と Richard Zhao による研究論文(2025年9月、arXiv)。遺伝的アルゴリズムでパズルをリアルタイム生成し、プレイヤーごとに難易度を自動調整する仕組みを作り、被験者実験で検証した。重要な発見は『クリア時間(time-on-task)だけ』を指標にすると難易度調整がうまくいかない、というものだ。2本目はゲームデザイナー Michael Hicks へのインタビュー(Game Developer)。難しいパズルを量産するのは簡単で、本当に難しいのは『面白いアイデアを見つけること』だと彼は言う。機械が難易度を合わせにいく道と、人が意味で難易度を設計する道。出典はいずれも査読研究と専門メディアで、作り手が読み返す価値のあるものに絞った。
『プレイヤーを締め出さない』ための二つの設計判断 — パズルと射撃を同時に走らせる Pragmata と、『解けない人』をどう扱うか
本日は2本。どちらも『プレイヤーをパズルから締め出さないために、設計者は何ができるか』という一つの問いに、まったく別の角度から触れている。1本目は Game Developer のインタビュー記事(2026年4月14日)。Capcom の新作 Pragmata が、リアルタイムの Snake 風ハッキングパズルを三人称シューティングの上に重ねる『パズルシューター』として、どうやって『繰り返しに感じさせない』設計を組んだかを開発者本人が語る。2本目は、ゲームデザイナー Cheryl-Jean Leo が2017年に書いたエッセイ『Are You Creating Impossible Puzzles?』。『どんなに丁寧に設計しても、誰かにとっては解けないパズルを必ず作ってしまう』という前提から、ゲーム内で答えを与えることの是非を論じる。新作の現場と、9年前の批評。並べると、難易度設計の核がほのかに見えてくる。
動詞の少なさが豊かさを生むとき — 減算設計の系譜
倉庫番、Snakebird、Stephen's Sausage Roll、A Monster's Expedition、Bonfire Peaks。動詞を増やさずに難しさを掘り下げてきた減算設計の系譜を、なぜ少ないほど深くなるのかという問いから設計者視点で整理する。
Baba Is You への反論 — Steam低評価から読み直す
Komugi が 9.5/10 と評価した Baba Is You に対し、Steam と各種レビューサイトで繰り返される 5 つの低評価パターン――難易度の壁、単一解の押し付け、変数の氾濫、フラストレーション支配、難易度のばらつき――を検証する。私はどこに同意し、どこに反論するか。
Undo の倫理 — 試行を許すか、罰するか
Undo ボタンひとつで、パズルの体験は根底から変わる。Sokoban の再起動、Braid の巻き戻し、Baba Is You の無制限 Undo。試行を許す設計と罰する設計の分岐点を考察する。
学習曲線の刻み方 — Baba から学ぶ垂直の壁の作り方
プレイヤーをいつ、どれだけ詰まらせるか。Baba Is You の悪名高い垂直の壁、Cocoonの止まらない流れ、その間にある設計哲学を比較する。










