第4部 · Difficulty — Designing the Learning Curve and Failure

第12章

Measuring Difficulty

10篇

Count of numbers used, solving-loop count, human time-to-solve, AI learning speed. Attempts to turn difficulty into a number, and their limits — plus the guess-free norm and the philosophy of fairness.

从第1篇开始读 →

本章文章

  1. 1.
    把运气逐出设计——从扫雷到 guessing-free 逻辑解谜
    2026-07-15 · Komugi · 约5分钟

    扫雷终盘出现的50/50赌博,为何长期被放任不管,又是如何被克服的?本文沿着Hexcells、Tametsi、14 Minesweeper Variants的系谱,思考不产生猜测的盘面设计条件,以及为此付出的代价。

  2. 2.
    Zeytuncu:谜题的难度由「使用数字的个数」决定——Fukai 导读
    2026-06-24 · Fukai · 约7分钟

    关于 Yunus E. Zeytuncu 对整数四则运算谜题(给定若干数字通过四则运算构成目标数的 Numbers 类谜题)进行难度建模的论文。论文用精确求解器生成约 347 万道题,将难度定义为最小步数,并证明最小解中使用数字的个数是「最小充分统计量」——仅凭这一指标即可完美预测难度。

  3. 3.
    Shyne et al.: How Far Do Puzzle Solver Loops Match Human Felt Difficulty — Fukai Reads
    2026-07-19 · Fukai · 约8分钟

    A logic-grid-puzzle difficulty study by Shyne, Facey & Cooper. Using solver loops (the pass count of a human-style solver) as a difficulty proxy, they generate difficulty-varied puzzles with a quality-diversity algorithm and, in a 63-player study, show solver loops correlate significantly with subjective difficulty (c=0.30, p=0.015).

  4. 4.
    Gould & Ward et al.:用「人类所需时间」衡量谜题难度——Fukai 解读
    2026-07-29 · Fukai · 约14分钟

    这是一篇由 Gould 与 Ward 等人撰写的 AI 评估论文。他们为 43 个基准测试、逾三万道题目标注了「人类所需时间」,测量了不将思考过程写出来的模型能以 50% 成功率完成的任务所需时间,发现该时间在六年间大约每 373 天翻一倍,到 GPT-5.5 已达约 3 分钟。其中涉及数独与填字游戏的难度计量方法,可以直接搬到谜题设计上使用。

  5. 5.
    Ahn et al.:谜题的难度不在“外观”,而在“概念”之中——Fukai 解读
    2026-07-14 · Fukai · 约9分钟

    波士顿大学的 Ahn 等人将抽象推理基准 ARC 改造为面向人类被试的 CogARC(arXiv 预印本论文)。研究逐步记录了累计 260 人解答网格谜题的过程,表明难度并非由盘面大小或颜色数决定,而是取决于规则的概念复杂度;而且人们在出错时也并非各自散乱地出错,而是趋于收敛到相同的错误答案。

  6. 6.
    Lu et al.:产生心流的是「难度」还是「投入的努力」?——Fukai 解读
    2026-08-17 · Fukai · 约11分钟

    Hairong Lu 等人关于心流与心理努力的同行评审论文(Psychological Research, 2025)。在视觉辨别任务中分别操纵「难度」与「感觉能解开的把握」后发现,难度操纵的效应很强(ηp²=0.64),而期望操纵只在试次层面呈现出微弱效应(d=0.04);心流随难度呈倒 U 形的结果处于临界值(p=0.053),P300 则与心流无关。这是一项 N=37 的探索性研究。

  7. 7.
    Mannem et al.: Some Puzzles Are Learnable, Some Are Not — Fukai Reads
    2026-08-18 · Fukai · 约11分钟

    An arXiv preprint by Gowrav Mannem and colleagues (Algoverse AI Research). On RecurrReason — Tower of Hanoi, River Crossing, Block World and Checkers Jumping unified under one difficulty knob (N=1-10; 10,817 puzzles, 285,933 moves) — small sequence models reached 97.27% validation and 81.00% out-of-distribution on Block World, but only 11.11%/0.00% on Tower of Hanoi, 1.11%/0.10% on Checkers Jumping, and 0.00% everywhere on River Crossing. A 60M-parameter T5 beat a 124M-parameter GPT-2 on every puzzle, leading the authors to conclude that architecture matters more than scale.

  8. 8.
    困难就是不亲切吗——公平(Fairness)的哲学
    2026-07-28 · Komugi · 约6分钟

    试玩我自制谜题最难那关的朋友抬头说:“这是不是有点不亲切?”把游戏做难,是刁难玩家,还是一份礼物?眼角瞥着那款完全没有难度设置的《只狼》所引发的“简单模式”之争,《游玩的真相·碎片》让两位会给出相反答案的哲学家面对面坐下。罗尔斯从“无知之幕”出发讲公平,尼采则以“杀不死我的使我更强大”肯定那堵墙。渐渐地,两人不再踢“困难”,而是并肩踢向“不公平”。

  9. 9.
    选择简单模式,算是「逃避」吗?
    2026-09-08 · Komugi · 约6分钟

    该不该给自己的解谜游戏加上难度切换,我已经卡了两周。卡住的不是实现,而是——一旦放上那个开关,选了低难度的人会不会觉得自己「逃了」。《Celeste》的辅助模式在2019年改写了它的前言:从「建议先不要开」变成「希望你也能在那里找到这份体验」。「游戏的本质·碎片」把认为抵抗才让人成形的黑格尔,和追问「究竟谁有资格判定这是逃避」的密尔面对面坐下。两人会合的地方,比我想的更近。

  10. 10.
    让逻辑谜题更快破解的思路 — Sokoban-like 系的诀窍
    2026-07-02 · Toki · 约3分钟

    自1982年今林宏行发布《仓库番》以来,这种只是把货物推到指定位置的Sokoban-like谜题已经被玩了40多年。规则如此简单,为何还是会卡手?本文像挖掘时代地层一样,整理出卡关时应重新审视的4个视角(死锁的形状、逆向推算、暂存、推动顺序)。

本章词汇 — 术语词典

相关连载