PAPER-DIGEST · 2026-07-29

Gould & Ward et al.:用「人类所需时间」衡量谜题难度——Fukai 解读

AI 评估与难度计量/作为单位的时间地平

一段摘要

要用一个数字说清楚「这道谜题有多难」,比想象中更困难。是数一数所需的推理步骤,还是测量正确率,抑或直接打三颗星?这篇论文给出的答案很朴素——人类解题所需的时间。由 Dewi Gould 与 Francis Rhys Ward 领衔、共二十余人组成的团队(Redwood Research、Astra Fellows Program 等)为 43 个基准测试、逾三万道题目标注了「人类所需时间」,并把 AI 模型的成绩排列在这条时间轴上。所标注的所需时间跨度从 0.5 秒到超过 15 小时不等。

这篇论文本来的目的并非谜题,而是 AI 安全。他们所测量的是「模型在不把思考过程写成文字的情况下,能进行多深的推理」。结果是:在不写出思考过程的状态下,能保持 50% 正确率的任务所对应的人类所需时间,在这六年间大约每 373 天翻一倍(95% 置信区间为 167 至 691 天),到最新的 GPT-5.5 已达约 3 分钟。不过,我今天选择这篇论文,与其说是因为这个结论,不如说是因为他们在得出结论的过程中搭建起来的「用人类时间衡量难度」的这套工具,可以原封不动地被谜题制作者借用。

前言

论文题为《Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models》。Dewi Gould 与 Francis Rhys Ward 为并列第一作者,此后还列有 Anders Cairns Woodruff、Rauno Arike 等二十余人。所属机构横跨 Redwood Research、Astra Fellows Program、Aether Research、MATS Research、加泰罗尼亚理工大学、帝国理工学院、剑桥大学、芝加哥大学、杜伦大学、MIT、牛津大学、格拉斯哥大学以及 Constellation。编号为 arXiv:2606.07157v1,领域为 cs.AI,投稿日期为2026年6月5日。论文本身在开头明确标注为「Preprint」,尚未经过同行评审;由于发布不久,目前也还谈不上被广泛讨论。这两点,在阅读时应当预先记在心里。

老实交代一下我今天选这篇论文的理由。我平常每天早上都会浏览 arXiv 上 cs.HC 与 cs.AI 的新论文,寻找与谜题相关的内容,但今天这个方向的新论文很少。取而代之吸引我目光的,是这篇论文的基准测试列表中列有《纽约时报》填字游戏、数独、Lichess 的国际象棋谜题、KenKen、Puzzle Baron 的逻辑谜题,以及 Tower of London 任务(一种通过重新排列圆盘以达到目标配置、用于测量计划能力的经典心理学任务)。这是一项若不认真地将谜题难度数值化便无法成立的研究,光是这一部分单独拿出来看也值得一读。此外,以下内容仅限于我在正文中能够确认的范围。附录 D 中关于各基准测试的细节,并未包含在我取得的正文之中,因此本文不涉及。

背景

为什么是「时间」?在衡量 AI 能力时,基准测试的正确率固然方便,但作为比较的坐标轴却很脆弱——难度不同的基准测试无法直接并列比较,而「拿到 85%」对人类来说究竟意味着什么,也无从得知。于是 Kwa 等人(METR)提出了「50% 任务完成时间地平(time horizon,以下简称 TH)」这一构想:某个模型能以 50% 的概率完成的任务,人类需要花多少分钟解决——把这一点变成一个单一的数值。由于单位是「分钟」,即便是外行人也能理解其含义。

这个想法其实早已在谜题世界中被默默使用。数独应用里的「简单/普通/困难」,追根究底不过是给所需时间分布贴上的名称。填字游戏爱好者会记录自己的解答时间,以此衡量自己的水平并与他人比较。也就是说,「人类所需时间」可以说是谜题文化中最古老、最朴素的难度单位。这篇论文把它带到了 AI 评估这一侧。

过去尚不清楚的是,这个朴素的单位究竟能被处理得多么严谨。人类所需时间因题而异,波动很大,也会随解题者而变化;而且许多题目根本不存在任何人类记录。这篇论文在方法论上的贡献,在于并不抹去这种不确定性,而是把它作为附着在测量值上的误差,一路带到最终结论。作者本人也写道,这是他们的核心贡献之一。

方法

先说整体框架。43 个基准测试,逾三万道题目,运行于英国 AI Security Institute 的测试执行框架 Inspect 之上。基准测试分为三类:只需简短给出答案的任务、生成代码或文本的任务,以及反复调用工具的多轮任务。正文的主要分析聚焦于其中 32 个短答型基准测试。评估对象是从 GPT-2(2019年)到 GPT-5.5(2026年)共14个模型,每道题尝试8次,温度设为0.7。

先说明一下 no-CoT 的含义。这是指封锁 CoT(Chain-of-Thought,让模型把思考过程写成文字的技巧)。通过提示词与少量示例,引导模型「不写出思考、只给出答案」;如果这样做之后仍有超过5%的输出混入了中间推理,就对输出格式加以结构性限制。也就是说,这里测量的是模型仅在「脑内」(论文用词为 latently,即潜在地)能进行多深的推理。安全方面的动机很明确:如果模型能够在不写出思考过程的情况下完成复杂推理,那么通过读取其思考过程来进行监控的方法就会失效。

那么人类所需时间是如何被标注上去的?这才是本文的重点所在。43 个基准测试中,有20个本身就带有现成的人类所需时间数据。剩余当中的12个,作者招募了17名专家参与者,收集了733次挑战记录。在此基础上,他们向 Claude Opus 4.7 展示同一领域内最多50组(题目、所需时间)配对,让其推测其余题目的所需时间。这一推测的准确度,在拥有真实数据的20个基准测试上得到了验证:在最佳提示设置下,MALR(mean absolute log ratio,即对实测值与推测值之比取对数后再取绝对值并求平均的指标,可用于横向比较跨越不同数量级的任务)为0.55,论文将其换算为「平均偏差约为1.7倍」。剩下的11个基准测试,则依赖专家经验法则加上语言模型的推测。

误差的传递方式也十分具体。他们把推测时间与实测时间之间的关系,在对数空间中拟合为一个正态分布(对应配对共1075组)。在此基础上运行一万次分层自助法(hierarchical bootstrap,一种将数据分成若干层级、有放回地重新抽样、以观察估计值波动程度的方法)。重新抽样的对象共四类:基准测试本身、其中的题目、每道题的模型尝试,以及人类所需时间本身。最后这一项——即把「人类时间的估计本身也存在误差」纳入考量——正是与以往方法的不同之处。若不使用公式来说明:把成功率相对于所需时间的对数拟合成一条平滑的 S 形曲线,这条曲线穿过50%的那个位置,就被称为 TH。

他们还准备了另一条难度坐标轴,这一点也很有意思。作为不依赖人类时间的衡量标准,他们引入了「推理 token 地平」:解决某道题目,作为基准的推理模型(从12个候选中选出的 o3-mini)至少需要多少思考 token。让同一道题尝试8次,取答对的那些尝试中 token 数最少的一次。与人类时间不同,这条坐标轴上并未纳入误差的考量。

发现

主要结果如下:在不写出思考过程的状态下,50% 时间地平在6年间大约每373天翻一倍(95% 置信区间167至691天,R² = 0.84)。个别数值为:GPT-4 约0.9分钟,Sonnet 3.7 约1.1分钟,Opus 4.7 约2.8分钟,GPT-5.5 约3.0分钟(论文 Figure 5)。推理 token 地平方面,则是每437天翻一倍(置信区间341至571天,R² = 0.92),GPT-4 为290个 token,Sonnet 3.7 为584个 token,Opus 4.7 与 GPT-5.5 均约为1500个 token。这两条坐标轴在对数空间中相关性密切,但并非完全一致(斜率约0.85,R² 约0.95)。

论文也报告了与写出思考过程的情形之间的差异。Kwa 等人报告的、带有 CoT 的时间地平翻倍周期为182天,no-CoT 的翻倍速度大约慢了一倍。论文指出,这一差距是从 GPT-4 出现开始扩大的。至于未来,若延长中位数斜率进行推算,则2028年约为7分钟(范围4至30分钟),2030年约为28分钟(范围9至615分钟)。从这一区间的宽度就能看出,作者本人也对这种外推的不确定性给予了强烈保留。

对谜题制作者最有用的数值,其实藏在附录里。他们按每个基准测试分别测量了「任务所需时间翻倍时,失败几率会变成多少倍」(Figure 13)。在大多数(模型、基准测试)配对中,几率比大约在2左右,也就是说所需时间翻倍,成功概率大约减半。但数独与 N-hop 参照任务的这一数值格外突出,位居排列的最上端;反过来,国际象棋谜题与填字游戏则位于下端。时间轴上斜率的中位数为1.03,token 轴上为0.64,论文据此指出「人类所需时间对每道题难度的区分能力更强」。也就是说,即便同样是「所需时间翻倍」,不同题材之间悬崖的陡峭程度完全不同。

稳健性检验也做得十分细致。即便把误差模型拆分成两段区间重新拟合,翻倍时间仍为368天(169至720天),几乎没有变化。加入生成型任务后为397天,再加入多轮工具使用任务后为319天。按领域来看,数学与科学为246天,语言与推理为387天,存在一定差异,但作者保留意见,称这「有启发性,但噪声较大」。在另一项针对35个开放权重模型(1B至1T)的补充实验中,要让时间地平翻倍,总参数量需增加4.2倍,层数需增加1.3倍。若以层数衡量,密集模型与 Mixture-of-Experts(专家混合,一种按题目仅使用部分组件的结构)的斜率大致相同;但若以总参数量衡量,两者差异很大——密集模型为2.2倍,MoE 则为8.1倍。

顺带一提。插入像「....」这样毫无意义的填充 token,几乎不会改变 no-CoT 的正确率;但仅仅把题目文字重复一遍,就在部分基准测试中带来了10到20个百分点的提升。

可应用之处

第一点:把难度标签的单位换成「所需时间的中位数」。如果你在制作每日谜题,那么难度与其用内部求解器的步数来定义,不如用真实玩家所需时间的中位数来定义,这样更能让读者理解。仿照论文的做法,把完答率相对于所需时间的对数拟合成一条 S 形曲线,就能得到一个数值:「我的读者中有50%能完成的题目,最长可以到几分钟」。这样一来,难度就不必凭直觉命名,而可以用这个数值来管理。

第二点:用自己的题材来测量难度曲线的陡峭程度。论文中「所需时间翻倍时几率变为多少倍」的分析,可以直接拿来给谜题题材做性格诊断。像数独那样陡峭的悬崖型题材,若不把关卡切得很细,玩家就会一下子跌落;而像填字游戏那样平缓的斜坡型题材,即便切得粗糙一些,体验依然连贯。如果你在制作仓库番类谜题,理应先用自己的日志测出这个斜率,再据此调整关卡阶梯的间隔。这也解释了为什么同样是「难度五档」,在不同题材里会显得或过粗或过细。

第三点:只给语言模型看少量实测日志,让它推测所需时间,并在「大约存在1.7倍偏差」的前提下使用这一推测值。做了100道新谜题却还没有实际游玩数据的情况(所谓的冷启动)很常见。论文的做法只是从自己的日志中挑出约50组(题目、实测时间)配对作为少量示例展示给模型。不过,由此得出的数值带有1.7倍的误差,因此我认为,与其把它用作最终的难度显示,不如用于「剔除明显过难的题目」「制作关卡顺序的草案」这类初步分拣工作,更为妥当。

第四点:重新审视排行榜的前提。不写出思考过程的模型,能以50%的概率答对人类需要约3分钟才能解决的题目——这个长度已经涵盖了许多超休闲的每日谜题。如果你运营的排行榜是建立在「玩家没有使用 AI」这一前提之上,那么这个地平每年几乎翻一倍的事实就不容忽视。反过来,从一开始就设立一个默认允许与 AI 协同解题的组别,也是一种可行的设计方向。

第五点:在冷启动阶段,把推理 token 数当作第二条难度坐标轴。让手头的推理模型尝试8次,测出「答对所需的最小思考 token 数」,这本身就能成为难度的参考指标。虽然应当记住论文所说「人类时间的区分能力更强」这一点,但用来给生成的关卡做一个临时排序,应该已经足够。

局限

首先是作者自己承认的弱点。第一,no-CoT 的测量依赖于「不让模型写出思考」这种引导方式。尤其是要求给出简短或单个 token 的答案,对最近的推理模型而言是一种偏离常态的情形(out-of-distribution),作者自己写道,这可能导致对潜在推理能力及其翻倍速度的系统性低估。第二,这种测量并未干净地区分开潜在推理与依靠记忆、经验法则进行的模式匹配。因此论文明确指出,不应把由此得到的地平解读为对「内部深思程度」的直接测量,它测量的终究只是「在不把推理写出来的情况下能解决的任务难度」这一点被数值化的结果。

我(Fukai)在此想指出的是,「人类所需时间」的内容并非铁板一块。《纽约时报》填字游戏的所需时间,来自那些会把自己的记录发布到 xwstats 之类网站上的爱好者群体;Lichess 的国际象棋谜题,则来自带有等级分的玩家的记录;数独用的是 Wang(2024, IEEE Access)那份带有玩家实际体验难度指标的数据集。这些各自都是了不起的数据,但其背后的人类分布完全不同。就论文本身的目的(对 AI 与人类进行相对比较)而言,这种混杂在一定程度上是可以容忍的;但当谜题制作者要借用同一个数值时,就需要格外留意——你的读者的中位数,可不是那种每天记录解题时间的填字游戏爱好者。

我(Fukai)再补充两点。其一,50% 时间地平只是单一的一个标量,正如附录的斜率分析所示,它相当程度地压缩了各题材之间的结构差异——「3分钟」这个数字内部,其实同时住着数独型的悬崖和填字游戏型的斜坡。其二,这项研究所测量的是所需时间,而非趣味性。时间作为难度的代理指标不错,但并不能作为体验好坏的代理指标——这篇论文没有任何地方说过,耗时越长的谜题就是越好的谜题。此外,为了防止数据集混入未来的训练数据,该数据集并未公开(需向作者索取),加之这是一篇尚未经过同行评审的 preprint,被引用次数也几乎还没有积累。这些数值,正确的读法是把它们当作「目前为止的估计值」。

Fukai 的解读

以下是我个人的解读。我想把这项研究放在这样一个脉络里来定位:与其说它是一篇 AI 安全论文,不如说它是为「难度计量」这一古老问题带来了一套新做法的论文谱系中的一员。用设计批评的语汇来说,这与其说是难度显示的自动化,不如说更接近于把「测量难度」这一行为本身变得诚实。他们所做的,是不舍弃人类所需时间这个朴素的单位,而是为它赋予误差结构,并将这份误差一路带到最终的结论——写的不是「这道题大约4分钟」,而是「大约4分钟,但平均会偏差1.7倍」。在谜题制作的现场,做到这一点的例子,我知道得不多。难度通常用星星的数目来显示,而那些星星究竟有多可信,却从不显示出来。我读到的是,这篇论文最值得被「出口」的部分,既不是3分钟这个数字,也不是373天这个数字,而是那种在数字旁边必定附上区间的书写习惯。

结语

写给想要深入了解的读者。时间地平这一框架本身,出自 Kwa 等人的《Measuring AI Ability to Complete Long Software Tasks》(arXiv:2503.14499),先读那篇文章,能更清楚地看出本论文在其基础上添加了什么。至于时间地平如何因领域而异,METR 的一篇博客文章对此做了简要总结。作为实际运行评估的框架,英国 AI Security Institute 的 Inspect 已经公开发布。

也列一下谜题这一侧的资料。以人类体验衡量数独难度的数据集见 Wang(2024, IEEE Access),这也正是本论文所使用的原始数据。若想了解填字游戏解答时间的分布,可以从 xwstats 入手;国际象棋谜题则可以 Lichess 的公开数据库为起点。仅仅浏览这三者,就能看出「用时间衡量难度」这一想法在谜题文化中扎根有多深。

参考文献

本文所参考的论文与相关资料:

Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models (Dewi Gould, Francis Rhys Ward et al., 2026, arXiv preprint arXiv:2606.07157)

・相关研究:Measuring AI Ability to Complete Long Software Tasks (Kwa et al., 2026) —— 时间地平框架的出处

・相关研究:A Dataset of Sudoku Puzzles With Difficulty Metrics Experienced by Human Players (Sheng-Wei Wang, 2024, IEEE Access 12:104254-104262)

How does time horizon vary across domains? (METR, 2025)

Inspect AI (UK AI Security Institute) —— 本论文用于运行评估的框架

・数据来源:XW Stats (NYT 填字游戏解答时间统计) / Lichess puzzle database

Reactions (no login)

Anonymous • one of each per visitor per day