PAPER-DIGEST · 2026-08-17

Pereira & Zuidema: 推論モデルはハノイの塔の地図を持ち、そして途中で失くす — Fukai が読む

創発的世界モデル / 機械論的解釈可能性 / パズルの計画

一段落要約

ハノイの塔は、3本の杭のあいだで円盤を1枚ずつ動かすだけの古典パズルで、子どもの計画能力を測る課題としても使われてきた。ところが、長い思考の途中経過を書き出しながら答えに向かう最新の「推論モデル」は、このパズルのある形式をいまだに半分ほどしか最適に解けない。今日読んだ論文は、その失敗が「どこで」起きているのかを、モデルの内部を覗き込んで特定しようとしたものである。

著者らが見つけたのは、少し意外な事実だった。モデルは問題文を読み終えた瞬間には、パズルの盤面全体の地図を、幾何学的にほぼ正確な形で内部に持っている。持っていないから解けないのではない。手順を書き出しているあいだに、その地図が薄れていく。著者らはこれを「世界モデルの不在ではなく、維持の失敗」と整理している。

さらに、薄れかけた内部表現を外から押し戻す介入を加えると、Qwen3.6-27B では最適解が 33/81(41%)から 59/81(73%)まで戻った。パズルを作る側から読むと、これは「LLM にヒントを出させる/解かせる」設計の勘所が、モデルの賢さの上積みではなく、盤面状態をどう持たせ続けるかにある、という一本だと読める。ただしこれは arXiv preprint(2026年8月7日投稿)であり、査読は通っていない段階のものだ。

はじめに

著者は Devin Pereira と Willem Zuidema、いずれもアムステルダム大学(University of Amsterdam)。論文タイトルは Transformers Struggle to Use Their Emergent World Models: Revisiting the Tower of Hanoi, and the Illusion of Thinking、arXiv:2608.07077 として 2026年8月7日に公開された。分類は cs.AI。会議に採択された査読済み論文ではなく、現時点では arXiv preprint である。公開から日が浅く被引用もまだ立っていないので、広く議論を経た知見ではない、という前提で読んでいる。

私がこの論文を今日選んだ理由は単純だ。題材がパズルそのものだから、である。ハノイの塔は、このサイトの読者にとっても説明が要らないほど馴染みのある問題だろう。そしてこの論文は、そのパズルを「AI が解けるか」ではなく「AI の中で盤面がどう表現され、いつ壊れるか」という角度から扱っている。パズルを設計する人間にとって、後者のほうがはるかに使える。

もう一つ。この論文は、2025年に議論を呼んだ Shojaee らの The Illusion of Thinking への応答という性格を持っている。あの論文は、推論モデルが問題の複雑さを上げると性能が崩れることを示し、「考えているように見えて実は違うのではないか」という読みを広めた。本論文は、その崩れ方をモデルの内部から観察して、別の読み方を提案する。結論を先に言えば、「考えていない」ではなく「途中で忘れている」だ。

背景

下敷きになっているのは「創発的世界モデル(emergent world model。次の一手を当てる訓練しか受けていないのに、モデルの内部に盤面や状況の像が自然に立ち上がる現象)」という研究の系譜である。Li ら(2022)はオセロの棋譜だけで訓練したモデルの内部から盤面が読み出せることを示し、Toshniwal ら(2022)はチェスで、Spies ら(2025)は迷路で似た現象を報告してきた。

ただし本論文が指摘するように、この系譜はこれまで「ゲームや迷路で訓練した小さな Transformer」にほぼ限られていた。何十層もある巨大な推論モデルが同じような世界モデルを持っているかどうかは、著者らの言葉では「まだ確立されていない」。小さなモデルで見えた現象が、大きなモデルでも同じ形で起きるのか。ここが空白だった。

もう一方の背景がハノイの塔そのものだ。全部の円盤が1本の杭に載った状態から、別の1本にすべて移す形(tower-to-tower)は、有名な再帰的手順で解けるため、現行の推論モデルにとってはすでに飽和している。一方、初期状態も目標状態も円盤が複数の杭に散らばってよい形(flat-to-flat)では、最適経路が初期と目標の組み合わせに依存し、暗記した再帰テンプレートでは出てこない。ここでフロンティアモデルの最適解率は約51%まで落ちる。

アプローチ

研究は二段構えになっている。前半は自前の小さなモデルだ。著者らは GPT-2 型の decoder-only Transformer(直前までの並びから次の一語を当てる形式のモデル)を、記号的に生成した flat-to-flat の解答手順だけで訓練した。規模は6層、隠れ次元128、ヘッド4、50エポック。円盤4枚・杭3本のとき有効な配置は81通りで、初期と目標が異なる順序対は 6,480 通り。これを 5,184 の訓練問題と 1,296 の検証問題に分けている。

内部を覗く道具は「線形プローブ(linear probe。モデルの内部状態から、知りたい情報が単純な線形変換だけで取り出せるかを調べる小さな読み取り器)」である。ここでのプローブは少し変わっていて、配置を2次元の点に写したときの点どうしの距離が、パズルの盤面グラフ上での手数の距離と一致するように学習させる。つまり「配置を当てられるか」ではなく「配置と配置の位置関係が保たれているか」を測っている。

なぜ距離なのか。ハノイの塔の状態空間は、全体で一つの三角形、その中に小さな三角形が3つ、さらにその中に……という入れ子構造、いわゆるシェルピンスキーの三角形になっているからだ。合法手はこの図の隣り合う点どうしの移動に対応し、三角形の3つの頂点は全円盤が1本の杭に載った配置にあたる。3つの小三角形は、いちばん大きい円盤がどの杭にあるかで空間を分けている。この図がモデルの中に見えるかどうかが、前半の焦点になる。

後半は因果の確認である。使うのは activation patching(ある問題を処理している最中のモデルの内部状態の一部を、別の問題のときの内部状態にすり替えて、出力がその別の問題の答えのほうへ動くかを見る実験)と、activation steering(内部状態に「こちらの方向へ」というベクトルを足し込んで出力を誘導する操作)。前者で「その表現は本当に使われているのか」を、後者で「壊れた表現を戻せば性能も戻るのか」を確かめる。

発見

まず小さなモデル。問題文と解答のあいだの区切りトークン(SEP)の位置では、内部から盤面がほぼ完璧に読み出せた。プローブの順位相関(Spearman)は 0.938、値そのものの相関(Pearson)は 0.902(いずれも第5層で最良)。最も近い配置を当てる正解率は 100.0%、円盤ごとの分類も4枚すべて 100.0% である。幾何は中間の深さで組み上がる、と著者らは書いている。

面白いのはその先だ。SEP の位置では、円盤ごとの情報が互いに重なり合った一つの空間にまとまって入っている(円盤ごとの部分空間の主角度が平均 54.7°)。ところが手順を書き出すトークンの位置では、それがほぼ直交する形(76.5°)へ組み替わる。円盤ごとに独立して読めるようになる代わりに、大きい円盤の復元が落ちる。円盤2で 90.7%、円盤3で 79.25%。著者らはこれを unified から factored への移行と呼んでいる。差し替え実験でも、第6層では部分的な転移が 78.74% に達し、出力を壊してしまう割合は 0.00%(第4層では 12.42%)。深い層ほど、その表現が実際に使われている。

次に大きなモデル。対象は Qwen3.6-27B と DeepSeek-R1-Distill-Qwen-32B(どちらも64層・隠れ次元5,120)。プロンプトの末尾(著者らの言う位置A)では、順位相関 0.935 と 0.936、最近傍の一致率 1.00 と、小さなモデルと見分けがつかないほど正確に盤面が入っていた。ところが長い思考を書き終えて手順を出す直前(位置B)では、Qwen は全体の幾何こそ 0.92 前後を保つのに、最近傍の一致が落ち、円盤ごとの分類はほぼ偶然の水準まで崩れる。DeepSeek はさらに落ちて 0.74〜0.81。手を書き出しているあいだ(位置C)には、円盤ごとの符号化が部分的に戻ってくる。小さなモデルで見えた unified から factored への移行と、同じ形である。

最後に介入。著者らは正しい盤面に対応する内部状態をあらかじめ控えておき、生成中にそちらへ向かうベクトルを足し込んだ。現在の盤面は、手順を読んで初期状態から再生する記号的なトラッカーが外部で管理している。Qwen3.6-27B(第28層)では、最も弱い設定でも失敗問題の 52% が最適解に変わり、最も強い設定では最適解が 33/81(41%)から 59/81(73%)へ上がった。残った失敗は書式の崩れではなく非合法手だった。一方 DeepSeek-R1-Distill(第44層)では、最良でも 72問中6問しか救えていない(Qwen は 48問中26問)。強度を上げるとパース不能な出力が増え、72問中29問から60問へ膨らんだ。

使いどころ

一つ目。パズルゲームにヒント機能や自動ソルバーを載せるとき、LLM に盤面を覚えさせないことだ。たとえば倉庫番ライクを作っていて、詰まったプレイヤーに「次の一手」を返す機能を LLM で実装するとしよう。この論文の読み方に従えば、長い応答のあいだ盤面を内部で保持させるのは最も脆い部分になる。一手ごとに現在の盤面を文字列で渡し直し、モデルには一手だけ考えさせる。設計としては退屈だが、論文が救済に外部トラッカーを使わざるを得なかったこと自体が、その退屈さの正当化になっている。

二つ目。難易度設計の道具として flat-to-flat の発想を借りる。同じパズルでも、初期状態だけをばらすのではなく目標状態もばらすと、暗記した定石やテンプレートが効かなくなる、というのがこの論文の出発点だった。人間向けのパズルでも同じ操作は使える。ルールを変えずに、初期と目標の両方を自由化するだけで、解法が「思い出す」から「探す」へ移る。ただしこれが人間にとって面白いかどうかは別問題で、そこは論文の外の話だと断っておく。

三つ目。LLM を使った自動プレイテストの読み替え。「LLM が解けなかったから難しい面だ」と扱っているなら、この論文はその指標に一段の疑いを差し込む。解けなかった原因が問題の難しさではなく、手順が長すぎて途中で状態を見失っただけかもしれないからだ。実務的には「何手目から崩れ始めたか」を記録し、崩れ位置が解答長に強く依存するなら、それは難易度ではなく計測系の限界として扱ったほうがよい。盤面を数手ごとに再提示して、崩れ位置が動くかを見る対照実験も安い。

四つ目、これは人間側への持ち帰りだ。「地図は持っているのに、書き出しているあいだに薄れる」という失敗の形は、長手数パズルを解く人間の作業記憶の話と重なって見える。だとすれば、UI 側でできることは盤面の再掲示、手順履歴の可視化、任意の地点への巻き戻しである。ただし、これは論文が人間について述べたことではない。私が持ち帰った類推であることは明示しておきたい。

限界

著者自身が認めている弱点は率直だ。実験は単一のパズル、単一のサイズ(円盤4枚)に限られており、しかもハノイの塔は再帰構造がきれいに出る例外的な題材である。もっと幾何的でない状態空間に一般化するかは未確認だと書かれている。対象にした2つのモデルはどちらも Qwen 系列なので、転移の話はその範囲で読むべきだとも断っている。さらに、教師ありのプローブは「モデルが使っていない構造」でも当てはめられてしまうという方法論上の穴があり、これは差し替えと介入の実験で部分的に埋めている、という自己評価だ。救済に使った手法が外部の状態トラッカーに依存している点、そして世界モデルを操作できる能力そのものが安全上の論点になりうる点にも触れている。

Fukai がここで指摘するのは、その外部トラッカーの位置づけである。トラッカーは、すでに正しい盤面を知っている装置だ。つまりこの介入実験が示しているのは「正解の状態を知っている側が教えれば直る」ということで、因果の証明としては筋が通っているが、そのまま応用の手法として読むと循環になる。正しい盤面が手元にあるなら、そもそもモデルに解かせる必要が薄い場面も多い。論文はこの点を scalability の限界として自分で書いているが、私はもう一歩強く、実務家が読むときの最大の落とし穴だと思う。

もう一点、数字の読み方を挙げておく。この論文には Qwen の最適解率として、最大の推論予算のもとでの約51%と、介入実験のベースラインである 33/81(41%)の二つが出てくる。条件が違うので矛盾ではないが、「51%が73%になった」と要約するのは誤りだ。また、状態空間が81通りしかない題材でプローブを当てているので、幾何が綺麗に出ること自体は驚きが小さいという見方もできる。驚くべきなのは、その幾何が生成の途中で崩れる、という時間方向の観察のほうだと私は読んだ。

Fukai の読み

ここからは私の解釈である。私はこの研究を、「モデルは賢いか」という問いから「モデルは覚えていられるか」という問いへ、評価の軸をずらす流れの中に位置づけたい。The Illusion of Thinking 以降の議論は、崩壊が起きるという観察を、能力の天井の話として受け取ってきた面がある。この論文はそこに、時間という軸を差し込む。同じモデルが、同じ問題について、最初の瞬間には正確な地図を持ち、数百トークン後には持っていない。パズル設計の語彙に翻訳するなら、これは難易度の話ではなく盤面提示の話だ。私たちが人間のプレイヤーに対して、盤面を画面に出しっぱなしにし、手順を記録し、巻き戻しを許してきたのは、人間の記憶を信用していないからではなく、記憶を要求しない場所では要求しないほうが設計として素直だからである。同じ配慮を機械に向ける段階に来た、と読める。

おわりに

この論文の位置を地図の上で掴みたい人には、まず Shojaee ら(2025)の The Illusion of Thinking を勧める。本論文が応答している相手であり、崩壊という現象そのものはそちらのほうが丁寧に測られている。あわせて、その論文に対する公開コメント(Lawsen, 2025)を読むと、実験設定の詰め方でどれだけ結論が変わりうるかが分かって面白い。

内部表現のほうに興味が向いたなら、Li ら(2022)のオセロの論文が出発点として今も最良だ。棋譜だけで訓練したモデルの中に盤面が立ち上がる、という一枚絵を先に入れておくと、本論文の「シェルピンスキーの三角形が見える」という主張が、突飛な話ではなく系譜の中の一歩として読める。今日の一本は、その系譜が小さなモデルから巨大な推論モデルへ橋を架けようとした最初期の試みである。橋が架かったかどうかの判定は、査読と追試を待ちたい。

参考文献

本記事で参照した論文と関連資料:

・Transformers Struggle to Use Their Emergent World Models: Revisiting the Tower of Hanoi, and the Illusion of Thinking (Devin Pereira, Willem Zuidema, University of Amsterdam, 2026, arXiv preprint arXiv:2608.07077 / 未査読)

・同論文の HTML 全文(本記事の数値はここから引用)

・関連研究: The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity (Parshin Shojaee ら, 2025, arXiv:2506.06941)

・関連研究: Comment on The Illusion of Thinking (A. Lawsen, 2025, arXiv:2506.09250)

・関連研究: Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task (Kenneth Li ら, 2022, arXiv:2210.13382)

リアクション(ログイン不要)

匿名で残せます • 同じリアクションは1日1回まで

関連シリーズ

論文ダイジェスト第61回 / 全99回

次に読む

編集部からのおすすめ