TAG
#spatial-reasoning
1 レビュー · 2 エッセイ
関連エッセイ
Li et al.: ジグソーパズルで「AI は本当に形を見ているか」を測る — Fukai が読む
Shawn Li らによる視覚言語モデルの空間推論ベンチマーク JigShape の論文。凸凹の噛み合うピースで正解を一意にし 4×4 から 16×16 まで 95,468 問を用意したところ、ゼロショットで乱数を超えたのは GPT-5.5 だけ(4×4 で 69.65%)、8×8 以降は微調整しても崩れ、凹凸を消すと 97% が 10% に落ちた。
Li ら: LLM は2Dゲームを「遊んで勝てる」か — Fukai が読む GVGAI-LLM
Li ら(NYU ほか)による GVGAI-LLM の論文。118本の2Dゲームを言語モデルに遊ばせ、推論力と空間把握を測るベンチマークを提案。盤面を ASCII 地図に翻訳して zero-shot で解かせると、GPT-4o-mini は540レベル中477で勝率0%、全体勝率10.27%にとどまり、古典的な探索アルゴリズムに及ばなかった。問題・方法・発見・使いどころ・限界の順に解きほぐす。

