TAG
0 レビュー · 1 エッセイ
Gould と Ward らによる AI 評価の論文。43 ベンチマーク・3万問超に「人間の所要時間」を付け、思考を書き出さないモデルが 50% 成功する課題の時間を測ったところ、6年で約373日ごとに倍増し GPT-5.5 で約3分に達した。数独やクロスワードを含む難易度計量の作法が、パズル設計にそのまま使える。