TAG
#benchmark
0 レビュー · 12 エッセイ
関連エッセイ
Battleday et al.: ルールを教えない70本のゲームで、AI の「発見する力」を測る — Fukai が読む
Ruairidh M. Battleday ら16名による arXiv preprint。ルールも勝利条件も伏せた 70 本の文字列ゲーム(7ティア、公開21本)で AI の「発見する力」を測ると、最強のモデルが 50 本・全モデル合計でも 57 本にとどまる一方、70 本すべてが少なくとも 1 人の人間に初回で解かれた。真のルールを渡すと同じモデルが 18 本から 69 本に跳ね上がり、エージェント型の仕掛けは標準の仕掛けを上回らなかった。
Mannem et al.: 学べるパズルと、学べないパズルがある — Fukai が読む
Gowrav Mannem ら(Algoverse AI Research)による arXiv preprint。ハノイの塔・川渡り・ブロックワールド・チェッカー跳びを難易度つまみ1本(N=1〜10、計 10,817 問 285,933 手)に揃えた RecurrReason で小型の系列モデルを訓練したところ、ブロックワールドは検証 97.27%・分布外 81.00% を出す一方、ハノイの塔は 11.11%・0.00%、チェッカー跳びは 1.11%・0.10%、川渡りは全条件 0.00% にとどまった。6000万パラメータの T5 が 1億2400万パラメータの GPT-2 に全パズルで勝ち、規模より構造だと著者らは結論している。
Li et al.: ジグソーパズルで「AI は本当に形を見ているか」を測る — Fukai が読む
Shawn Li らによる視覚言語モデルの空間推論ベンチマーク JigShape の論文。凸凹の噛み合うピースで正解を一意にし 4×4 から 16×16 まで 95,468 問を用意したところ、ゼロショットで乱数を超えたのは GPT-5.5 だけ(4×4 で 69.65%)、8×8 以降は微調整しても崩れ、凹凸を消すと 97% が 10% に落ちた。
Huang et al.: 生成したゲームを AI に「遊ばせて」直させる — Fukai が読む
Yixu Huang ら(復旦大学・小紅書ほか)によるゲーム生成の論文。画面を見て操作する GUI エージェントをテストプレイヤーとして生成ループに組み込む Play2Code と、200 本・1,548 項目の評価環境 PlaytestArena を提案する。3モデル平均の基準通過率は、一回書き切り 29.7%、コード検査のみの既存手法 52.2% に対し 66.8% だった。
Ye ほか: 子ども向け知能検査で画像も扱う AI(MLLM)を測る — Fukai が読む
ShanghaiTech 大学の Hengwei Ye らによる、子ども向け知能検査(ウェクスラー式)に着想した MLLM 評価ベンチマーク KidGym の論文(arXiv プレプリント)。実行・知覚推論・記憶・学習・計画の5能力を2Dグリッド上の12課題・難易度3段階で測り、9モデルを評価。上位モデルでも抽象図形パズルは最高0.30、数え上げは人間1.00に対し最高0.72にとどまった。
Waugh: 数独やスリザーリンクで AI の推論力を測る — Fukai が読む
Approximate Labs の Justin Waugh による、ペンシルパズルで LLM の推論を測るベンチマーク Pencil Puzzle Bench の論文(arXiv プレプリント)。62,231 問・94 種類から 300 問を選び、一手ごとにルール違反を機械が検算できる点を核に 51 モデルを評価。最強の GPT-5.2 でもエージェント的解法で 56.0% にとどまり、約半分が未解決だった。
Ying et al.: あらゆる「人間のゲーム」で AI の一般知能を測る — Fukai が読む
MIT・ハーバードらの研究チームによる、AI の一般知能を『人間が作ったゲーム』で測るプレプリント。App Store と Steam の人気作100本を LLM で作り直し、7つの最新視覚言語モデルに遊ばせたところ、最強でも人間の中央値100に対し8.5点にとどまり、記憶・計画・ルールの推測で人間に大きく及ばなかった。
Triebel et al.: 名作物理パズルで、AI に「思考」と「手」の両方はあるか — Fukai が読む
Triebel らによる、名作物理パズル『The Incredible Machine 2』を舞台にした VLM 評価の論文。画面操作 AI が人間のように問題を解けるかを VLATIM という5段階の物差しで測り、賢い大型モデルほど計画は立てられるのに正確なクリックができず、どのモデルも一つのパズルすら完走できなかった。
Monti et al.: 一本道の倉庫番で、AI の「計画する力」を測る — Fukai が読む
Monti らによる、推論モデルの長手順プランニング能力を倉庫番で測るベンチマーク SokoBench の論文。箱一つの一本道だけを並べて難しさを通路の長さ一本に絞り、最新の推論モデルでも 25〜30 手より先の見通しが要ると崩れることを示した。原因は「数え間違いの蓄積」にあると著者らは見る。
Luo et al.: AI エージェントは実際のゲームエンジンで遊べるゲームを丸ごと作れるか — Fukai が読む
Luo, Wang らによる、コーディングエージェントの End-to-End ゲーム生成を測る評価基盤 GameCraft-Bench の論文。自然言語仕様から Godot 上で遊べるゲームを丸ごと作らせ、起動・操作再生・映像採点で判定する 140 課題(15 ジャンル)を提案。最強の構成でも全体 41.46% にとどまり、エージェントは仕組みは作れても内容・見やすさ・仕上げを備えた完成品には届かない、と報告している。
Jiang ら: 言葉だけで「遊べるゲーム」は作れるか — Fukai が読む OpenGame
Yilei Jiang ら(香港中文大学)による、自然言語からウェブ2Dゲームを丸ごと自動生成するエージェント OpenGame の論文。再利用できる骨組みと『生きたデバッグ手順書』で統合エラーを抑え、150課題で最高水準を達成。ただしパズルは最も苦手なジャンルとして残った。
Li ら: LLM は2Dゲームを「遊んで勝てる」か — Fukai が読む GVGAI-LLM
Li ら(NYU ほか)による GVGAI-LLM の論文。118本の2Dゲームを言語モデルに遊ばせ、推論力と空間把握を測るベンチマークを提案。盤面を ASCII 地図に翻訳して zero-shot で解かせると、GPT-4o-mini は540レベル中477で勝率0%、全体勝率10.27%にとどまり、古典的な探索アルゴリズムに及ばなかった。問題・方法・発見・使いどころ・限界の順に解きほぐす。




