TAG
#academic
0 篇评论 · 5 篇随笔
相关随笔
把“何为好谜题”化为计算公式——DeepMind 将国际象棋谜题“违反直觉的程度”量化的尝试
今天只读一篇。我通读了 Google DeepMind 的 Xidong Feng 等人撰写的 arXiv 预印本《Generating Creative Chess Puzzles(创造性国际象棋谜题的生成)》(2510.23881,2025年10月)英文原文。出于“生成式 AI 依然难以产出真正具有创造性、美感与违反直觉特质”的问题意识,作者以国际象棋谜题为题材,先对生成模型做了基准测试,再提出了一套基于国际象棋引擎搜索统计构建全新奖励、以此进行强化学习(RL)的框架。从设计角度看,最有趣的是,这项工作把“何为好谜题”这一长期以来含混不清的性质——唯一性、违反直觉的程度(counter-intuitiveness)、新颖性与美感——都转化成了可计算的指标。尤其是将 counter-intuitiveness 测量为浅层搜索(直观评估的近似)与深层搜索(精确评估的近似)之间评估差异的构思,即便脱离国际象棋,也像是可以移植到谜题设计中的原理。文中会明确说明这是一篇尚未经过同行评审的预印本。
“把谜题的规则本身写成数学式”——将纸笔谜题规则体系化的尝试
今天一篇。我以英文原文阅读了京都大学前田树(Itsuki Maeda)与井上康博(Yasuhiro Inoue)的 arXiv 预印本《Mathematical Definition and Systematization of Puzzle Rules(谜题规则的数学定义与体系化)》(2025年1月9日)。作者指出,数回、数独等纸笔谜题在解法与自动出题方面已有大量研究,但“创造新规则”这一行为本身仍是临时拼凑(ad-hoc)的。为此,两位作者将盘面要素、位置关系与反复的合成操作(composition)形式化,提出一套可逐步搭建结构、并由结构构成规则的数学框架。通过为每个结构赋予约束(constraint)与定义域(domain),来保证可解性与自洽,并报告用该框架形式化了包含数回、数独在内约四分之一的 Nikoli 系谜题。让我在设计上感兴趣的是:它针对的不是谜题“怎么解”,而是规则“怎么造”。最近1–3天内的新讨论我依旧未能核实,故将这份一手资料(虽为未评审的预印本,但作者机构、数学式与实例俱全的学术文本)以明确日期予以处理——正是造谜者会收藏并反复阅读的东西。
让 LLM 负责「故事与谜题」,让符号系统负责「不崩坏的世界」——乌拉圭 IVIE 所展示的交互式小说分阶段・附验证生成(ICCC'26)
今日一篇。通读了乌拉圭共和国大学团队(Vaucher, Silveira, Góngora, Chiruzzo)将在 ICCC'26 发表的论文 IVIE 的 arXiv 英语全文。目标是自动生成文字冒险(交互式小说)的世界。关键是分工——设定・角色・谜题设计等创造性判断交由 LLM,空间连接性与目标可达性等结构整合由符号验证层保障。世界从目标反向推算,分四阶段组建,每阶段设有验证关卡。最能引发设计思考的,是「验证太严格则束缚创造,太宽松则谜题被迂回」这一根本张力。
「能解」与「有趣」分道之处——PuzzleJAX 让机器去解 500 多款 PuzzleScript 游戏(arXiv,2025年8月)
今日一篇:论文「PuzzleJAX: A Benchmark for Reasoning and Learning」(arXiv 预印本,2025年8月),作者为 NYU、马耳他大学、金山大学(南非)与微软的研究者(Sam Earle、Graham Todd、Ahmed Khalifa、Julian Togelius 等)。他们将 Stephen Lavelle(increpare)于2013年发布的解谜制作语言 PuzzleScript 在 GPU 上重新实现,把全球作者所写的 500 多款游戏交给树搜索、强化学习与大语言模型去解。以设计者视角阅读,核心只有一点:「机器能否解开」与「对人是否有趣」是两回事。
「难度由结构决定」——严格分解算术谜题难度的研究(4OPS,arXiv / AIED 2026录用,2026年3月)
今日一篇。Yunus E. Zeytuncu(密歇根大学迪尔伯恩分校)的论文「4OPS: Structural Difficulty Modeling in Integer Arithmetic Puzzles」,以英国节目《Countdown》及法国《Des chiffres et des lettres》中常见的「用四则运算将数字凑成目标值」型谜题为对象,通过严格的解搜索分解难度决定因素。作者证明,不是表面特征(数字大小或目标值),而是最小解实际使用的输入数量,才是完全决定难度的「最小充分统计量」。这是一篇直接关乎设计者如何定义并排列谜题难度的研究。预印本发布于2026年3月,已被教育 AI 国际会议 AIED 2026录用。
