PAPER-DIGEST · 2026-08-15

Li et al.: ジグソーパズルで「AI は本当に形を見ているか」を測る — Fukai が読む

視覚言語モデルの空間推論 / ベンチマーク設計

一段落要約

「絵柄が見えている」ことと「ピースがはまるかどうか分かる」ことは、同じ能力なのだろうか。南カリフォルニア大学らのチームが公開した JigShape は、その問いをジグソーパズルで測ろうとしたベンチマーク(共通のものさしとして使う問題集と採点方法のこと)だ。狙いは視覚言語モデル(VLM。Vision-Language Model。画像と文章を一緒に受け取って文章で答える AI)が、空間や幾何の制約をどこまで扱えるかを見ることにある。

従来のジグソー型ベンチマークはピースを四角に切っていた。すると空や芝生のような一様な領域では、並べ方が違っても見た目が区別できず、正解が一つに決まらない。JigShape は凸(tab)と凹(blank)が噛み合う形にピースを切ることで正解を一意にし、4×4 から 16×16 までの細かさを揃えた。

結果は厳しい。何も学習させない状態で乱数当てを明確に上回ったのは GPT-5.5 だけで、4×4 のピース正解率 69.65%(乱数の目安は 6.25%)。それが 8×8 では 4.37% まで落ちる。微調整すれば 4×4 で 97% 台に届くが、12×12 では 5% を切る。さらに凹凸の形を消すと 97% が 10% まで落ちた。モデルは絵柄ではなく形の手がかりを頼りにしていた、と読める。arXiv のプレプリント(2026年7月30日投稿、8月4日改訂、査読前)である。

はじめに

論文は arXiv:2607.27670、主分類は cs.CV(コンピュータビジョン)で cs.AI にも登録されている。著者は Shawn Li、Wei Yang、Jike Zhong ら14名で、所属は南カリフォルニア大学、シンガポール国立大学、Adobe Research、テキサス A&M 大学、ライス大学、ノースカロライナ大学チャペルヒル校にまたがる。abstract ページには会議名や採録の記載がないので、現時点では査読を通ったとは書かれていないプレプリントとして扱うのが正確だ。投稿からまだ二週間ほどで、広く議論されている段階でもない。

私がこれを今日選んだのは、パズルを作る側にとって「AI はこのパズルを解けるのか」が、そろそろ実務の問いになりつつあるからだ。自動で難易度を推定したい、自動でプレイテストしたい、あるいは読者が盤面のスクリーンショットをそのまま AI に投げてしまう。どれも「今の AI は視覚的なパズルをどこまで解けるのか」という一点にぶら下がっている。

この論文は、その一点に具体的な数字を与えてくれる。しかも扱っているのがジグソーパズルという、誰でも手触りの分かる題材だ。以下、この記事だけで要点が掴めるように書く。

背景

すでに分かっていたのは、視覚言語モデルが「何が写っているか」を言い当てる仕事(認識やキャプション生成)ではかなり強い一方で、空間の基本的な関係でつまずく、ということだ。左右・上下・前後・奥行きといった関係の判定は、VSR(Liu ら, 2023)や BLINK(Fu ら, 2024)といったベンチマークで繰り返し弱点として報告されてきた。

ジグソーパズルを使う発想自体は新しくない。Jigsaw-Puzzles(Lyu ら, 2025)は 2×2 と 3×3 の盤面を画像1,100枚で作った。JPwLEG(Song ら, 2023)は 3×3 と 5×5 で、ピースの間に隙間を空ける方式を採った。Visual Jigsaw(Wu ら, 2025)は 118,000 件規模で、ジグソーを解くこと自体をモデルの後訓練(事前学習のあとに追加で行う学習)の課題として使っている。いずれも四角い切り口だ。

著者らが問題視したのは二点。ひとつは曖昧さで、四角く切ると一様なテクスチャの領域では複数の並べ方が視覚的に区別できなくなり、著者らの表現で問題設定が "ill-posed"(解が一意に定まらない、悪条件の)になってしまう。もうひとつは粗さで、2×2 から 5×5 程度では組合せの負荷を十分にかけられない。この二点を同時に潰そうというのが JigShape の出発点だ。

アプローチ

核になるのは切り方だ。ピースの辺は三種類しかない。tab は外側に張り出す凸型の半円、blank は内側に切り込む凹型の半円、flat は直線で、これは外周にしか現れない。そして隣り合うピースは、凸と凹が相補的に噛み合っていなければならない。この幾何的な制約があるおかげで、絵柄が一様でも正解の並べ方は一つに定まる。物理的なジグソーで、空の部分でもピースを差し込めば正解が分かるのと同じ理屈だ。

四角い切り口では一様な領域で正解が一意に定まらないのに対し、凸凹の噛み合う切り口では正解が一意に定まることを示す概念図図は Li ほか「JigShape」(arXiv:2607.27670, CC BY 4.0) の Figure 1 より

盤面の細かさは四段階。4×4 は16ピースで並べ方がおよそ2×10の13乗通り、tab の比率は 0.15。8×8 は64ピースで10の89乗通り、比率 0.20。12×12 は144ピースで10の249乗通り、比率 0.24。16×16 は256ピースで10の507乗通り、比率 0.28。細かくなるほど tab を深くして、小さくなっても凹凸が見えるように調整している(論文の Table 2)。

素材は写真で、DIV2K から900枚、DIV8K から1,500枚、Unsplash から選んだ21,342枚、合わせて23,742枚。各画像から四段階それぞれ一問ずつ作り、総計 95,468 問になる。出題は、シャッフルしたピースを ID の順に並べて見せる形で、正しい位置に並べては見せない。モデルは各ピース ID を(行, 列)に対応づけた表を出力する。

採点はひとつの数字ではなく四つある。Piece Accuracy(正しい位置に置けたピースの割合)、Exact Match(全ピースが正解だった問題の割合)、Adjacency Accuracy(本来隣り合うべきペアが、予測でも隣り合っている割合)、Shape Compatibility(予測した隣接のうち、凹凸が実際に噛み合っている割合)。乱数で答えた場合の目安は Piece Accuracy が 4×4 で 6.25%、16×16 で 0.39%、Shape Compatibility が 30.8% から 44.1% とされている。この四つを分けたこと自体が、後で述べるように設計者にとっての読みどころになる。

発見

評価されたのはゼロショット(追加学習なし)の6構成 — GPT-5.5、GPT-5.4-mini、Claude Opus 4.8、Grok-4.2(推論あり・なし)、Llama-4-Maverick。各グリッド250問。Table 4 の主要な数字はこうだ。4×4 で GPT-5.5 が Piece Accuracy 69.65%、Exact Match 26.40%。残りは乱数の 6.25% と大差ない。Claude Opus 4.8 が 8.50%、Grok-4.2(推論あり)が 11.97%、Grok-4.2(推論なし)が 6.90%、GPT-5.4-mini が 6.75%、Llama-4-Maverick が 6.62%。Exact Match は GPT-5.5 以外すべて 0.00% だった。

そして崖が来る。GPT-5.5 でも 8×8 では 4.37%、12×12 では 0.67%(この盤面の乱数の目安は 0.69%)。著者らはこれを "scaling cliff"(規模が上がった途端に性能が崖のように落ちる現象)と呼び、ピース数が増えても制約を守り続けることができていない、と述べている。

解かせるだけでなく、学習させたらどうなるか。Qwen3-VL-8B と Gemma3-12B を、四段階を混ぜた6,500件(4×4 が3,000、8×8 が2,000、12×12 が1,000、16×16 が500)で教師あり微調整した。4×4 では Qwen3-VL-8B が 97.28% / Exact Match 90.80%、Gemma3-12B が 97.82% / 89.20% と跳ね上がる。だが 8×8 では 27.34%(Exact Match 0.00%)と 33.58%(同 0.40%)、12×12 で 3.44% と 4.57%、16×16 では 0.40% と 0.35%。崖は学習で埋まらなかった。

この論文で一番示唆的なのは、最後のアブレーション研究(設計のどの部分が効いているかを、要素を一つずつ外して確かめる実験)だ。同じ4×4の問題500組について、凹凸の形を消して四角い切り口にすると、Qwen3-VL-8B の Piece Accuracy は 97% から 10% へ落ちた。乱数のすぐ上だ。著者らはここから、モデルは形の手がかりを利用することを学んだのであって、視覚的な内容の統合は限定的だ、と述べている。

使いどころ

ひとつめ。視覚的な配置パズルの自動プレイテストや自動難易度推定を、現行の視覚言語モデルに任せる計画は、今日の時点では成立しないと考えたほうがいい。16ピースを超えたあたりで乱数と区別がつかなくなる以上、「盤面の画像を AI に見せて、これは難しいか聞く」設計は当てにならない。もし自分がジグソーやスライドパズルの日替わり出題を作るなら、画像ではなく記号表現(どのピースがどの形か、どこと噛み合うか)を渡して、組合せ的なソルバに解かせる。難易度は探索の手数で測るほうが確実だ。

ふたつめ。難易度のつまみは「ピース数」だけではない、という話。アブレーションが暴いたのは、形の手がかりを削った瞬間に難しさが跳ね上がるということだった。裏返せば、ジグソー的なパズルの難易度は、tab の比率(噛み合う辺がどれだけあるか)と絵柄の一様さという二本の軸で設計できる。空や芝生のような一様な領域を増やし、輪郭の個性を減らせば、ピース数を増やさずに難しくできる。ピース数を増やすと単調な作業時間が伸びるだけになりがちなので、この二軸のほうが体験としては上等だと私は思う。

みっつめ。「AI に一発で解かれにくいデイリーパズル」を作りたいなら、視覚と幾何を同時に使う制約充足はまだかなり堅い。8×8 以上の盤面は、この論文で試された範囲のモデルでは事実上お手上げだった。ただし GPT-5.5 が 4×4 で 69.65% を出している以上、小さい盤面はもう射程に入っている。この数字はあくまで論文が試した時点のモデル群での話であって、来年も同じとは限らない。

よっつめとしてベンチマーク設計そのものの教訓を挙げたい。この論文の一番の工夫は、凹凸で切ることによって正解を一意にした点にある。これはパズル設計の話にそのまま翻訳できる。自作の生成器が複数解のある盤面を吐いているなら、そこで測っている難易度指標は別のものを測ってしまっている。数独が一意解を要求するのと同じ理由だ。そして採点を Piece Accuracy と Adjacency Accuracy に分けた発想は、ヒントや進捗表示の設計に使える。「正しい位置に置けているか」より「正しく隣り合っているか」のほうが、途中経過を励ます指標として素直に機能する。

限界

まず著者側。私が読めた範囲では、この論文に独立した Limitations の節は見当たらない(構成は結論と、倫理・再現性のステートメントで閉じている)。限界は結果の議論に埋め込まれている形だ。著者らが明示的に認めているのは二点で、ひとつはフロンティアモデルの 16×16 評価を省いたこと — 12×12 の時点ですでに低いため、と書かれている。もうひとつは、微調整したモデルが形の手がかりに依存しており、視覚内容の統合が限定的だという点だ。

Fukai がここで指摘するのは三点。ひとつめは出題形式だ。モデルは256ピースなら256行の対応表をテキストで書き下さなければならない。これはパズルを解く力とは別に、長い出力を崩さずに並べきる力を測ってしまう。崖の一部はそこから来ている可能性があるが、論文はこの二つを切り分けていないように読める。

ふたつめは標本の小ささ。ゼロショット評価は各グリッド250問だ。95,468 問という総量に対して、実際に採点に使われた数はかなり絞られている。Exact Match の 0.00% と 0.40% を並べて論じるには、この規模はやや心もとない。

みっつめは素材の偏りだ。画像は DIV2K・DIV8K・Unsplash という、いずれも写真のデータセットから来ている。写真の統計に寄った素材なので、イラストや抽象的なパターン、単色に近い図形でも同じ崖が現れるかどうかは、この論文からは分からない。パズルを作る側の関心はむしろそちら側にあることが多いので、ここは今後の課題だと思う。

Fukai の読み

ここからは Fukai の解釈だ。私はこの研究を、「見る」と「はまる」を切り分ける試みとして読みたい。設計批評の語彙で言えば、ジグソーには二種類の信号がある。絵柄が連続しているかという内容の信号と、辺の凹凸が噛み合うかという形式の信号だ。アブレーションが暴いたのは、微調整されたモデルが形式の信号だけで 97% を取り、内容の信号をほとんど使っていなかったことだった。これ自体は責める話ではない。人間のジグソー好きだって、まず外周と角のピースを拾い、次に形で当たりをつける。むしろ気になるのは、ベンチマークの側が「視覚的推論を測っている」つもりで、実際には「制約充足の器用さ」を測っていた可能性があるという点だ。パズルを設計する立場から言えば、これは他人事ではない。私たちが難易度だと思って調整しているつまみが、本当は別の何かのつまみだったということは、十分に起こりうる。

おわりに

もっと深く知りたい人は、先行研究をいくつか並べて読むと地図が見える。Jigsaw-Puzzles(Lyu ら, 2025)は同じジグソーでも 2×2・3×3 の小さい盤面で、見ることから理解、推論へと段階を分けている。Visual Jigsaw(Wu ら, 2025)は逆に、ジグソーを測るためではなく学習させるために使った例だ。空間関係そのものの弱さを追うなら BLINK(Fu ら, 2024)や VSR(Liu ら, 2023)が出発点になる。

記号側のパズルで AI の推論を測る話に興味があれば、当サイトで以前に扱った Pencil Puzzle Bench の記事(数独やスリザーリンクで LLM を評価するベンチマーク)と並べて読むと、視覚と記号でどこが同じでどこが違うのかが見えてくると思う。JigShape の学習用データは HuggingFace で公開されているので、手元で盤面を眺めてみるのも早い。

私自身は、この論文を読んだあと、印刷した紙の上で 4×4 と 8×8 の間に何が起きているのかを線で囲んでいた。16ピースと64ピースのあいだにあるのは四倍ではなく、10の76乗倍の組合せだ。その落差の前で、人間があっさりジグソーを完成させてしまうことのほうが、実は不思議なのかもしれない。

参考文献

本記事で参照した論文と関連資料:

・JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles (Shawn Li, Wei Yang, Jike Zhong ほか, 2026, arXiv:2607.27670 プレプリント・査読前)

・同論文の HTML 版(本文・Table 2 / Table 4 を参照)

・JigShape-Train データセット (HuggingFace)

・関連研究: Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models (Lyu ほか, 2025)

・関連研究として論文中で言及: JPwLEG (Song ほか, 2023) / Visual Jigsaw (Wu ほか, 2025) / BLINK (Fu ほか, 2024) / VSR (Liu ほか, 2023)

リアクション(ログイン不要)

匿名で残せます • 同じリアクションは1日1回まで

関連シリーズ

論文ダイジェスト第59回 / 全91回

次に読む

関連レビュー

編集部からのおすすめ