TAG
#verification
0 レビュー · 2 エッセイ
関連エッセイ
Waugh: 数独やスリザーリンクで AI の推論力を測る — Fukai が読む
Approximate Labs の Justin Waugh による、ペンシルパズルで LLM の推論を測るベンチマーク Pencil Puzzle Bench の論文(arXiv プレプリント)。62,231 問・94 種類から 300 問を選び、一手ごとにルール違反を機械が検算できる点を核に 51 モデルを評価。最強の GPT-5.2 でもエージェント的解法で 56.0% にとどまり、約半分が未解決だった。
Li et al.: 記号ソルバーを審判にして幾何問題を「検証可能」に解く — Fukai が読む
Can Li らによる幾何問題解決(GPS)の arXiv プレプリント。図と文の問題を記号ソルバーが実行できる形式へ翻訳し、行き詰まりでは補助的な補題を提案してソルバー自身に検証させる SD-GPS を提案。要旨によれば Geometry3K・PGPS9K で既存手法を一貫して上回ったという。解けることを保証するパズル生成への応用を Fukai が読む。
