PAPER-DIGEST · 2026-07-29
Gould & Ward et al.:用「人类所需时间」衡量谜题难度——Fukai 解读
AI 评估与难度计量/作为单位的时间地平
一段摘要
要用一个数字说清楚「这道谜题有多难」,比想象中更困难。是数一数所需的推理步骤,还是测量正确率,抑或直接打三颗星?这篇论文给出的答案很朴素——人类解题所需的时间。由 Dewi Gould 与 Francis Rhys Ward 领衔、共二十余人组成的团队(Redwood Research、Astra Fellows Program 等)为 43 个基准测试、逾三万道题目标注了「人类所需时间」,并把 AI 模型的成绩排列在这条时间轴上。所标注的所需时间跨度从 0.5 秒到超过 15 小时不等。
这篇论文本来的目的并非谜题,而是 AI 安全。他们所测量的是「模型在不把思考过程写成文字的情况下,能进行多深的推理」。结果是:在不写出思考过程的状态下,能保持 50% 正确率的任务所对应的人类所需时间,在这六年间大约每 373 天翻一倍(95% 置信区间为 167 至 691 天),到最新的 GPT-5.5 已达约 3 分钟。不过,我今天选择这篇论文,与其说是因为这个结论,不如说是因为他们在得出结论的过程中搭建起来的「用人类时间衡量难度」的这套工具,可以原封不动地被谜题制作者借用。
前言
论文题为《Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models》。Dewi Gould 与 Francis Rhys Ward 为并列第一作者,此后还列有 Anders Cairns Woodruff、Rauno Arike 等二十余人。所属机构横跨 Redwood Research、Astra Fellows Program、Aether Research、MATS Research、加泰罗尼亚理工大学、帝国理工学院、剑桥大学、芝加哥大学、杜伦大学、MIT、牛津大学、格拉斯哥大学以及 Constellation。编号为 arXiv:2606.07157v1,领域为 cs.AI,投稿日期为2026年6月5日。论文本身在开头明确标注为「Preprint」,尚未经过同行评审;由于发布不久,目前也还谈不上被广泛讨论。这两点,在阅读时应当预先记在心里。
老实交代一下我今天选这篇论文的理由。我平常每天早上都会浏览 arXiv 上 cs.HC 与 cs.AI 的新论文,寻找与谜题相关的内容,但今天这个方向的新论文很少。取而代之吸引我目光的,是这篇论文的基准测试列表中列有《纽约时报》填字游戏、数独、Lichess 的国际象棋谜题、KenKen、Puzzle Baron 的逻辑谜题,以及 Tower of London 任务(一种通过重新排列圆盘以达到目标配置、用于测量计划能力的经典心理学任务)。这是一项若不认真地将谜题难度数值化便无法成立的研究,光是这一部分单独拿出来看也值得一读。此外,以下内容仅限于我在正文中能够确认的范围。附录 D 中关于各基准测试的细节,并未包含在我取得的正文之中,因此本文不涉及。
背景
为什么是「时间」?在衡量 AI 能力时,基准测试的正确率固然方便,但作为比较的坐标轴却很脆弱——难度不同的基准测试无法直接并列比较,而「拿到 85%」对人类来说究竟意味着什么,也无从得知。于是 Kwa 等人(METR)提出了「50% 任务完成时间地平(time horizon,以下简称 TH)」这一构想:某个模型能以 50% 的概率完成的任务,人类需要花多少分钟解决——把这一点变成一个单一的数值。由于单位是「分钟」,即便是外行人也能理解其含义。
这个想法其实早已在谜题世界中被默默使用。数独应用里的「简单/普通/困难」,追根究底不过是给所需时间分布贴上的名称。填字游戏爱好者会记录自己的解答时间,以此衡量自己的水平并与他人比较。也就是说,「人类所需时间」可以说是谜题文化中最古老、最朴素的难度单位。这篇论文把它带到了 AI 评估这一侧。
过去尚不清楚的是,这个朴素的单位究竟能被处理得多么严谨。人类所需时间因题而异,波动很大,也会随解题者而变化;而且许多题目根本不存在任何人类记录。这篇论文在方法论上的贡献,在于并不抹去这种不确定性,而是把它作为附着在测量值上的误差,一路带到最终结论。作者本人也写道,这是他们的核心贡献之一。
方法
先说整体框架。43 个基准测试,逾三万道题目,运行于英国 AI Security Institute 的测试执行框架 Inspect 之上。基准测试分为三类:只需简短给出答案的任务、生成代码或文本的任务,以及反复调用工具的多轮任务。正文的主要分析聚焦于其中 32 个短答型基准测试。评估对象是从 GPT-2(2019年)到 GPT-5.5(2026年)共14个模型,每道题尝试8次,温度设为0.7。
先说明一下 no-CoT 的含义。这是指封锁 CoT(Chain-of-Thought,让模型把思考过程写成文字的技巧)。通过提示词与少量示例,引导模型「不写出思考、只给出答案」;如果这样做之后仍有超过5%的输出混入了中间推理,就对输出格式加以结构性限制。也就是说,这里测量的是模型仅在「脑内」(论文用词为 latently,即潜在地)能进行多深的推理。安全方面的动机很明确:如果模型能够在不写出思考过程的情况下完成复杂推理,那么通过读取其思考过程来进行监控的方法就会失效。
那么人类所需时间是如何被标注上去的?这才是本文的重点所在。43 个基准测试中,有20个本身就带有现成的人类所需时间数据。剩余当中的12个,作者招募了17名专家参与者,收集了733次挑战记录。在此基础上,他们向 Claude Opus 4.7 展示同一领域内最多50组(题目、所需时间)配对,让其推测其余题目的所需时间。这一推测的准确度,在拥有真实数据的20个基准测试上得到了验证:在最佳提示设置下,MALR(mean absolute log ratio,即对实测值与推测值之比取对数后再取绝对值并求平均的指标,可用于横向比较跨越不同数量级的任务)为0.55,论文将其换算为「平均偏差约为1.7倍」。剩下的11个基准测试,则依赖专家经验法则加上语言模型的推测。
误差的传递方式也十分具体。他们把推测时间与实测时间之间的关系,在对数空间中拟合为一个正态分布(对应配对共1075组)。在此基础上运行一万次分层自助法(hierarchical bootstrap,一种将数据分成若干层级、有放回地重新抽样、以观察估计值波动程度的方法)。重新抽样的对象共四类:基准测试本身、其中的题目、每道题的模型尝试,以及人类所需时间本身。最后这一项——即把「人类时间的估计本身也存在误差」纳入考量——正是与以往方法的不同之处。若不使用公式来说明:把成功率相对于所需时间的对数拟合成一条平滑的 S 形曲线,这条曲线穿过50%的那个位置,就被称为 TH。
他们还准备了另一条难度坐标轴,这一点也很有意思。作为不依赖人类时间的衡量标准,他们引入了「推理 token 地平」:解决某道题目,作为基准的推理模型(从12个候选中选出的 o3-mini)至少需要多少思考 token。让同一道题尝试8次,取答对的那些尝试中 token 数最少的一次。与人类时间不同,这条坐标轴上并未纳入误差的考量。
发现
主要结果如下:在不写出思考过程的状态下,50% 时间地平在6年间大约每373天翻一倍(95% 置信区间167至691天,R² = 0.84)。个别数值为:GPT-4 约0.9分钟,Sonnet 3.7 约1.1分钟,Opus 4.7 约2.8分钟,GPT-5.5 约3.0分钟(论文 Figure 5)。推理 token 地平方面,则是每437天翻一倍(置信区间341至571天,R² = 0.92),GPT-4 为290个 token,Sonnet 3.7 为584个 token,Opus 4.7 与 GPT-5.5 均约为1500个 token。这两条坐标轴在对数空间中相关性密切,但并非完全一致(斜率约0.85,R² 约0.95)。
论文也报告了与写出思考过程的情形之间的差异。Kwa 等人报告的、带有 CoT 的时间地平翻倍周期为182天,no-CoT 的翻倍速度大约慢了一倍。论文指出,这一差距是从 GPT-4 出现开始扩大的。至于未来,若延长中位数斜率进行推算,则2028年约为7分钟(范围4至30分钟),2030年约为28分钟(范围9至615分钟)。从这一区间的宽度就能看出,作者本人也对这种外推的不确定性给予了强烈保留。
对谜题制作者最有用的数值,其实藏在附录里。他们按每个基准测试分别测量了「任务所需时间翻倍时,失败几率会变成多少倍」(Figure 13)。在大多数(模型、基准测试)配对中,几率比大约在2左右,也就是说所需时间翻倍,成功概率大约减半。但数独与 N-hop 参照任务的这一数值格外突出,位居排列的最上端;反过来,国际象棋谜题与填字游戏则位于下端。时间轴上斜率的中位数为1.03,token 轴上为0.64,论文据此指出「人类所需时间对每道题难度的区分能力更强」。也就是说,即便同样是「所需时间翻倍」,不同题材之间悬崖的陡峭程度完全不同。
稳健性检验也做得十分细致。即便把误差模型拆分成两段区间重新拟合,翻倍时间仍为368天(169至720天),几乎没有变化。加入生成型任务后为397天,再加入多轮工具使用任务后为319天。按领域来看,数学与科学为246天,语言与推理为387天,存在一定差异,但作者保留意见,称这「有启发性,但噪声较大」。在另一项针对35个开放权重模型(1B至1T)的补充实验中,要让时间地平翻倍,总参数量需增加4.2倍,层数需增加1.3倍。若以层数衡量,密集模型与 Mixture-of-Experts(专家混合,一种按题目仅使用部分组件的结构)的斜率大致相同;但若以总参数量衡量,两者差异很大——密集模型为2.2倍,MoE 则为8.1倍。
顺带一提。插入像「....」这样毫无意义的填充 token,几乎不会改变 no-CoT 的正确率;但仅仅把题目文字重复一遍,就在部分基准测试中带来了10到20个百分点的提升。
可应用之处
第一点:把难度标签的单位换成「所需时间的中位数」。如果你在制作每日谜题,那么难度与其用内部求解器的步数来定义,不如用真实玩家所需时间的中位数来定义,这样更能让读者理解。仿照论文的做法,把完答率相对于所需时间的对数拟合成一条 S 形曲线,就能得到一个数值:「我的读者中有50%能完成的题目,最长可以到几分钟」。这样一来,难度就不必凭直觉命名,而可以用这个数值来管理。
第二点:用自己的题材来测量难度曲线的陡峭程度。论文中「所需时间翻倍时几率变为多少倍」的分析,可以直接拿来给谜题题材做性格诊断。像数独那样陡峭的悬崖型题材,若不把关卡切得很细,玩家就会一下子跌落;而像填字游戏那样平缓的斜坡型题材,即便切得粗糙一些,体验依然连贯。如果你在制作仓库番类谜题,理应先用自己的日志测出这个斜率,再据此调整关卡阶梯的间隔。这也解释了为什么同样是「难度五档」,在不同题材里会显得或过粗或过细。
第三点:只给语言模型看少量实测日志,让它推测所需时间,并在「大约存在1.7倍偏差」的前提下使用这一推测值。做了100道新谜题却还没有实际游玩数据的情况(所谓的冷启动)很常见。论文的做法只是从自己的日志中挑出约50组(题目、实测时间)配对作为少量示例展示给模型。不过,由此得出的数值带有1.7倍的误差,因此我认为,与其把它用作最终的难度显示,不如用于「剔除明显过难的题目」「制作关卡顺序的草案」这类初步分拣工作,更为妥当。
第四点:重新审视排行榜的前提。不写出思考过程的模型,能以50%的概率答对人类需要约3分钟才能解决的题目——这个长度已经涵盖了许多超休闲的每日谜题。如果你运营的排行榜是建立在「玩家没有使用 AI」这一前提之上,那么这个地平每年几乎翻一倍的事实就不容忽视。反过来,从一开始就设立一个默认允许与 AI 协同解题的组别,也是一种可行的设计方向。
第五点:在冷启动阶段,把推理 token 数当作第二条难度坐标轴。让手头的推理模型尝试8次,测出「答对所需的最小思考 token 数」,这本身就能成为难度的参考指标。虽然应当记住论文所说「人类时间的区分能力更强」这一点,但用来给生成的关卡做一个临时排序,应该已经足够。
局限
首先是作者自己承认的弱点。第一,no-CoT 的测量依赖于「不让模型写出思考」这种引导方式。尤其是要求给出简短或单个 token 的答案,对最近的推理模型而言是一种偏离常态的情形(out-of-distribution),作者自己写道,这可能导致对潜在推理能力及其翻倍速度的系统性低估。第二,这种测量并未干净地区分开潜在推理与依靠记忆、经验法则进行的模式匹配。因此论文明确指出,不应把由此得到的地平解读为对「内部深思程度」的直接测量,它测量的终究只是「在不把推理写出来的情况下能解决的任务难度」这一点被数值化的结果。
我(Fukai)在此想指出的是,「人类所需时间」的内容并非铁板一块。《纽约时报》填字游戏的所需时间,来自那些会把自己的记录发布到 xwstats 之类网站上的爱好者群体;Lichess 的国际象棋谜题,则来自带有等级分的玩家的记录;数独用的是 Wang(2024, IEEE Access)那份带有玩家实际体验难度指标的数据集。这些各自都是了不起的数据,但其背后的人类分布完全不同。就论文本身的目的(对 AI 与人类进行相对比较)而言,这种混杂在一定程度上是可以容忍的;但当谜题制作者要借用同一个数值时,就需要格外留意——你的读者的中位数,可不是那种每天记录解题时间的填字游戏爱好者。
我(Fukai)再补充两点。其一,50% 时间地平只是单一的一个标量,正如附录的斜率分析所示,它相当程度地压缩了各题材之间的结构差异——「3分钟」这个数字内部,其实同时住着数独型的悬崖和填字游戏型的斜坡。其二,这项研究所测量的是所需时间,而非趣味性。时间作为难度的代理指标不错,但并不能作为体验好坏的代理指标——这篇论文没有任何地方说过,耗时越长的谜题就是越好的谜题。此外,为了防止数据集混入未来的训练数据,该数据集并未公开(需向作者索取),加之这是一篇尚未经过同行评审的 preprint,被引用次数也几乎还没有积累。这些数值,正确的读法是把它们当作「目前为止的估计值」。
Fukai 的解读
以下是我个人的解读。我想把这项研究放在这样一个脉络里来定位:与其说它是一篇 AI 安全论文,不如说它是为「难度计量」这一古老问题带来了一套新做法的论文谱系中的一员。用设计批评的语汇来说,这与其说是难度显示的自动化,不如说更接近于把「测量难度」这一行为本身变得诚实。他们所做的,是不舍弃人类所需时间这个朴素的单位,而是为它赋予误差结构,并将这份误差一路带到最终的结论——写的不是「这道题大约4分钟」,而是「大约4分钟,但平均会偏差1.7倍」。在谜题制作的现场,做到这一点的例子,我知道得不多。难度通常用星星的数目来显示,而那些星星究竟有多可信,却从不显示出来。我读到的是,这篇论文最值得被「出口」的部分,既不是3分钟这个数字,也不是373天这个数字,而是那种在数字旁边必定附上区间的书写习惯。
结语
写给想要深入了解的读者。时间地平这一框架本身,出自 Kwa 等人的《Measuring AI Ability to Complete Long Software Tasks》(arXiv:2503.14499),先读那篇文章,能更清楚地看出本论文在其基础上添加了什么。至于时间地平如何因领域而异,METR 的一篇博客文章对此做了简要总结。作为实际运行评估的框架,英国 AI Security Institute 的 Inspect 已经公开发布。
也列一下谜题这一侧的资料。以人类体验衡量数独难度的数据集见 Wang(2024, IEEE Access),这也正是本论文所使用的原始数据。若想了解填字游戏解答时间的分布,可以从 xwstats 入手;国际象棋谜题则可以 Lichess 的公开数据库为起点。仅仅浏览这三者,就能看出「用时间衡量难度」这一想法在谜题文化中扎根有多深。
参考文献
本文所参考的论文与相关资料:
・相关研究:Measuring AI Ability to Complete Long Software Tasks (Kwa et al., 2026) —— 时间地平框架的出处
・How does time horizon vary across domains? (METR, 2025)
・Inspect AI (UK AI Security Institute) —— 本论文用于运行评估的框架
Reactions (no login)
Anonymous • one of each per visitor per day