PAPER-DIGEST · 2026-08-09

Honda et al.: 「試す価値のある選択肢」を、減る不確実性の量で測る — Fukai が読む

設計探索 / 認識的価値 / 能動的推論と好奇心

一段落要約

「この選択肢は試す価値があるか」。設計でもパズル制作でも毎日ぶつかる問いだが、これを計算モデルとして書き下した論文が arXiv に出た。東京大学の本多氏らによる B-EUR(Bayesian Expected Uncertainty Reduction、ベイズ期待不確実性減少)モデルである。ある行動を試す価値を、「それを試したら、行動と結果の対応関係についての自分の無知がどれだけ減ると期待できるか」という一点だけで測る。無知の量はエントロピー(散らばりの大きさを表す情報理論の指標)で表され、観測前のエントロピーから観測後に残ると予想される平均エントロピーを引いた差が、その行動の価値になる。

検証には「グラフ形当てゲーム(Graph-Shape Guessing Game)」という抽象的な課題を使う。隠された一本の曲線について、好きな横位置をひとつ選ぶとその点の高さだけが見える。これを10回繰り返して全体の形を推測する。ここで環境の性質を2つ動かす。一般化可能性(1点を見たとき、その知識が隣の候補にどれだけ届くか)と、結果の見分けやすさ(候補どうしの結果がどれだけはっきり違うか)である。シミュレーションと、44人分のデータを分析した2つの人間実験の両方で調べている。

結果の中心はひとつだ。一般化可能性が中くらいのとき、試す価値も、楽しさも、選ばれやすさも最大になる。低すぎると1点見ても隣が分からず、高すぎると数点で全部分かってしまう。どちらも「試す意味」を殺す。なお本稿は 2026年8月6日に arXiv に投稿されたばかりの preprint(査読前原稿)であり、まだ広く議論されていない段階であることは先に断っておく。

はじめに

著者は本多至門(Shimon Honda)、宮口拓真(Takuma Miyaguchi)、小泉浩司(Koji Koizumi)、佐野貴紀(Takanori Sano)——いずれも東京大学大学院工学系研究科機械工学専攻——に、フランスの Arts et Métiers ParisTech 製品設計・イノベーション研究室(LCPI)の Tristan Briard 氏、そして責任著者の柳澤秀吉(Hideyoshi Yanagisawa)氏を加えた6名である。arXiv:2608.05642、分類は cs.AI、投稿日は 2026年8月6日。査読を通った論文ではなく preprint であり、現時点で被引用は事実上ゼロと考えてよい。DOI は arXiv 自身が付与するもの(10.48550/arXiv.2608.05642)だけである。

私が今日この論文を選んだのは、書かれている領域が「工業製品の設計」なのに、読んでいる間ずっとパズルの盤面のことを考えていたからだ。パズルを作る仕事は、突き詰めれば「試す価値のある一手」を盤面の上に並べる仕事である。押しても何も動かないマスばかりでは退屈だし、どこを押しても全部が一斉に決まってしまう盤面も退屈だ。この論文は、その退屈さの両端を、ひとつの量の両側として説明しようとしている。

もうひとつ、この論文には人間実験がついている。モデルの予測と主観評定と選択行動の3つを突き合わせているところが、読む価値にしていると思う。

背景

設計研究では、不確実性が探索を駆動するという見方が繰り返し語られてきた。工学設計では不確実性を二種類に分ける。認識的不確実性(epistemic uncertainty。知識が足りないことから生じ、情報を得れば減らせるもの)と、偶然的不確実性(aleatory uncertainty。対象そのもののばらつきから生じ、原理的に減らせないもの)である。本論文が扱うのは前者だけで、後者は観測ノイズとしてモデルの外側に置かれている。

この分野には UDA モデル(Uncertainty Driven Action model。Cash と Kreye による、設計活動を「情報収集」「知識共有」「表現」という行動の連なりとして捉え、不確実性の知覚がその選択と進行を決めるとする枠組み)がある。著者らはこの枠組みを踏まえたうえで、「不確実性の知覚の変化が、では具体的にどうやって行動選択を決めるのか」が未解決のまま残っていると書いている。B-EUR はその未解決部分の一部分——候補行動を選ぶ前に評価する仕組み——だけを担当する、と著者は明示的に範囲を限定している。

もう一方の系譜が能動的推論(active inference。Friston らによる、脳を予測誤差の最小化装置とみなす自由エネルギー原理を行動選択にまで広げた枠組み)である。ここでは行動の価値が実利的価値(望ましい結果が得られるか)と認識的価値(観測によって不確実性がどれだけ減ると期待できるか)に分けられる。B-EUR はこの認識的価値の定義をそのまま設計探索に持ち込む。著者らはまた、試行回数を増やせば学習や成果が伴うとは限らないという先行研究(Abhyankar and Ganapathy, 2014)を引き、「どういう環境なら試行が実るのか」を特定する必要があると述べている。

アプローチ

課題はこうだ。画面には隠れた一本の曲線があり、参加者はスライダーで横位置をひとつ選んで「確定」を押すと、その位置の高さだけが点として現れる。これを10回。最後に指定された位置の高さを予測させ、精度に応じて S+ から D までのランクが表示される。ただしランクは報酬を変えない。著者らはこの設計を、空間的に相関のある多腕バンディット課題(選択肢を順に試して学ぶ実験パラダイム)の変種と位置づけつつ、標準的なそれと違って「高い値を取ること」自体には価値を置かない点を強調している。実利的価値を課題から抜き、認識的価値だけを残すためだ。

曲線はガウス過程(点と点のあいだの相関の仕方を決めて、そこから滑らかな関数をランダムに生成する数学的な道具)で作る。ここに調整つまみが二つある。ひとつは相関長で、これを大きくすると曲線がなだらかになり、1点の観測が遠くまで効く——つまり一般化可能性が上がる。もうひとつは振幅で、これを大きくすると上下の振れ幅が広がり、候補どうしの結果の差がはっきりする——つまり結果の見分けやすさが上がる。数式は本稿では省くが、やっていることはこの二つのつまみを回すだけである。

B-EUR モデル本体が学ぼうとしているのは「ある行動を取ったら、次にどの結果の状態になるか」という対応表である。その対応表がどれくらい曖昧かをエントロピーで測り、ある行動を試したあとに残るであろう曖昧さの平均を予測して、差を取る。この差が認識的価値だ。エージェントは全候補について認識的価値を計算し、値が高い候補ほど選ばれやすい方策(softmax。確率を値の大きさに応じて滑らかに配分する選び方)で1点を選ぶ。ここに一つ工夫があって、観測した点だけを更新するのではなく、相関長に比例した幅で近傍の信念も一緒に更新する。人間が限られた試行で近傍に知識を汎化させることを示した先行研究(Wu et al., Schulz et al.)に合わせた設計である。

発見

シミュレーションからは4つの予測が出る。第一に、観測前の曖昧さ(事前エントロピー)は振幅が大きいほど増え、相関長が大きいほど減る。第二に、認識的価値は相関長に対して逆U字を描き、中間の相関長で最大になる。第三に、認識的価値は振幅が大きいほど高い。第四に、認識的価値の時間的な減り方は、相関長が大きいほど速く、振幅が大きいほど緩やかになる。著者らは価値の時間変化に指数関数を当てはめて減衰係数を出しており、振幅を 2.0 に固定した図では、相関長 0.01 では最初から低いまま、1.0 では序盤で急落し、0.25 では比較的高いまま保たれる、と報告している。

人間実験は東京大学デザイン工学研究室で行われた。20〜39歳の成人46名を募集し、教示手順の不備や課題遂行の問題で2名を除外、最終的に44名(男性23名、女性21名)を分析している。所要時間は実験1と2を合わせて約70分、謝礼は2,000円分のギフトカード。倫理審査承認番号は KE26-13。刺激は振幅2水準(1.0、2.0)と相関長4水準(0.020、0.054、0.147、0.400)の計8条件。解析は R の線形混合モデルと一般化線形混合モデル(参加者ごとの個人差を織り込みながら効果を推定する統計手法)で、評定は参加者ごとに標準化されている。

実験1では、主観的な不確実性は振幅が大きいほど上がり(β=0.106、SE=0.023、t=4.598、p<.001)、相関長が大きいほど下がった(β=−0.441、SE=0.010、t=−42.743、p<.001)。ここまでは予測どおりである。ところが「試す価値」については、振幅の主効果が有意にならなかった(β=−0.030、SE=0.054、t=−0.565、p=.572)。一方で相関長の二乗項が負に有意で(β=−0.161、SE=0.014、t=−11.196、p<.001)、逆U字が確認された。楽しさも同じ形で、振幅は効かず(β=−0.026、SE=0.098、t=−0.261、p=.794)、二乗項が負に有意だった(β=−0.188、SE=0.049、t=−3.839、p<.001)。また試す価値は観測を重ねるほど下がり、相関長が大きいほどその下がり方が急だった(β=−0.056、SE=0.004、t=−12.558、p<.001)。

実験2は選択行動を見る。8条件の見本を同時に並べ、「いちばん楽しそうに見えるもの」を選ばせる。ここでは振幅が明確に効いた(β=1.035、SE=0.080、z=12.906、p<.001)。相関長の二乗項も負に有意で(β=−0.816、SE=0.046、z=−17.834、p<.001)、やはり中間の相関長が選ばれやすい。つまり、結果の見分けやすさは「一つずつ評価するとき」には評定に現れず、「並べて選ぶとき」には効いた。著者らはこの食い違いについて、この課題では試す価値が出力の振れ幅よりも「観測が隣にどれだけ効くか」に強く依存していたためだろうと説明し、隠れた曲線が正弦波であれば振幅を変えても波長と位相さえ掴めば予測できてしまう、という例を挙げている。

使いどころ

第一に、演繹型パズルの1手の設計である。ナンプレやピクロスで「このマスを埋めると周りがどれだけ決まるか」は、まさに相関長そのものだ。1マス埋めても周囲が何も動かない盤面は総当たりになり、逆に1マスから連鎖的に全部が確定する盤面は最初の一手を見つけた瞬間に終わる。この論文の言葉を借りるなら、どちらも認識的価値が低い。もし自分がデイリーの論理パズルを作っているなら、「1手あたりに確定するマス数の分布」を生成時の指標として持ち、極端に小さい値と極端に大きい値の両方を弾く運用にすると思う。

第二に、レベルパックの並べ方だ。手続き的生成(PCG。Procedural Content Generation、コンテンツの自動生成)でステージ群を作るとき、隣り合うステージの類似度が相関長に当たる。似すぎていれば作業になり、違いすぎていれば前のステージで学んだことが次に持ち越せない。論文の設計への含意の節で著者らが「変えるのは、応答に差を生みつつその差が似た選択肢にも一般化するような要素にせよ」と書いているのは、そのままレベルデザインの助言として読める。もしパズルゲームのチュートリアル群を作っているなら、一度に変えるルールは一つ、ただしそのルールは以降の面にも効くもの、という原則になる。

第三に、フィードバックの粒度である。振幅は「結果の見分けやすさ」だった。正解か不正解かだけを返すのか、どれくらい惜しかったかまで返すのかは、この軸の話だ。ここで実験1と実験2の食い違いが効いてくる。一つずつ遊んでいるときの主観的な「試す価値」には振幅は効かなかったが、複数を並べて選ぶときには効いた。断定は避けるが、ゲームの選択画面やモード選択のように候補を並べて見せる場面では、結果の差が見えることが選ばれやすさを押し上げる可能性はある、と読める。

第四に、1プレイの長さの決め方だ。シミュレーションの第四の予測——一般化可能性が高いほど認識的価値が速く減衰する——は、そのまま「盤面の情報が横に広く効くパズルほど、短く切り上げるべき」という設計則になる。実験でも、相関長が大きいほど試す価値の減り方が急だった。手数や制限時間を後から縮めるとき、私はこの向きの根拠として使えると思う。

第五に、難易度の言い換えである。この論文が測っているのは「難しさ」ではなく「学べる余地」だ。難易度を成功率ではなく1手あたりに減る不確実性で記述し直すと、簡単すぎる面と理不尽な面が同じ指標の両端に並ぶ。

限界

著者自身が挙げている限界は三つある。第一に、グラフ形当てゲームは設計プロセス全体を再現していない。行動と結果の対応を学ぶという一側面を切り出しただけであり、B-EUR は UDA モデルが言う情報収集・知識共有・表現という行動類型の区別や、その間の遷移を扱わない。第二に、入力と出力の関係を一次元の関数に抽象化している。実際の製品評価は視覚・触覚・聴覚・操作感といった複数の感覚にまたがり、機能性・使いやすさ・美しさ・品質・満足度といった複数の次元を持つ。本モデルはそれらの間の相関や相互作用を明示的には捉えていない。第三に、実際の探索は認識的価値だけでは動かない。実利的価値、資源の制約、熟練度、組織文化が絡む。本研究は実利的価値を意図的に排除しているので、その分だけ現場から遠い。

ここから先は Fukai が読んで気づいた点である。まず、相関長の水準は4つしかなく、対数目盛で 0.02 から 0.4 の範囲に限られている。一方シミュレーション側の図は 0.01 から 1.0 の範囲を扱っている。逆U字の「頂点の位置」がモデルと人間で一致するかどうかは、この論文からは読み取れない。逆U字そのものは二次項の符号で検定されているが、二次項が有意であることと、検定した範囲の内側に頂点があることは、厳密には別の主張である。

次に、二つの環境特性が実験操作としては綺麗に分離できていない。振幅を上げると結果の見分けやすさが上がると同時に、事前の不確実性そのものも上がる(著者らの S1 がまさにそれだ)。つまり振幅は少なくとも二つの経路で結果に効く。実験1で振幅が「試す価値」に効かなかったという結果を、「結果の見分けやすさは主観的価値に効かない」と読むのは早い、と私は思う。

最後に二点。参加者への教示は「ゲームを楽しむことが目的」だったと書かれている。楽しさの評定を主要指標のひとつに使う設計としては、この教示は評定を押し上げる方向に働きうる。また44名は極端に小さい標本ではないが、単一の研究室・単一の課題・単一の文化圏のデータであり、事前登録や追試についての記述は私が読んだ範囲では見当たらなかった。この研究の条件下でそう観察された、という以上には言えない。

Fukai の読み

ここからは私の解釈である。私はこの研究を、「面白さ」を測る試みの系譜——Berlyne の覚醒ポテンシャル理論(新奇さや複雑さが中程度のときに快が最大になるという古い仮説)から、好奇心研究の「学べる見込みがあるときに探索する」という流れまで——の、いちばん実装寄りの端に置きたい。著者ら自身も考察でこの二つに触れている。だが私が面白いと思ったのは、この論文が「面白さ」を対象の属性としてではなく、対象と観測者のあいだの関係の属性として測っている点だ。相関長は曲線の性質だが、認識的価値は「いまの自分が何を知っているか」に依存して刻々と下がっていく。設計批評の語彙で言えば、これは難易度曲線の自動化ではなく、「飽き」を時間の関数として定義しようとする試みに近い。パズルの難易度を静的な数値として貼るのをやめて、プレイヤーの信念状態に対する関数として持つ——そこまで踏み込めるなら、この定式化には使い道があると私は読んでいる。

おわりに

この論文だけを読むと抽象度が高く感じられるかもしれない。地図が欲しい人には、まず能動的推論側から Friston らの自由エネルギー原理の解説論文を、次に責任著者の柳澤研究室が出している一連の情報理論的な感性研究——新奇さや興味を情報量として扱う流れ——を合わせて読むことを勧めたい。本論文の「認識的価値=期待される不確実性の減少」という定義が、どういう蓄積の上に立っているかが見えてくる。

ゲーム側から入りたい人には、本論文が引いている Wu らや Schulz らの空間相関つき多腕バンディット研究が入口になる。人が限られた試行でどこまで隣に知識を汎化させるかという問いは、レベル設計の「学習の持ち越し」の問題とほとんど同じ形をしている。

参考文献

本記事で参照した論文と関連資料:

Bayesian Expected Uncertainty Reduction (B-EUR) Model: A Computational Account of What Makes Design Options Worth Trying (Shimon Honda, Takuma Miyaguchi, Koji Koizumi, Takanori Sano, Tristan Briard, Hideyoshi Yanagisawa, 2026, arXiv preprint arXiv:2608.05642)

DOI: 10.48550/arXiv.2608.05642(arXiv が付与する DOI。査読誌の DOI ではない)

同論文の HTML 版(本文・図表・付録)

東京大学 柳澤研究室(Design Engineering Laboratory)の発表論文一覧(責任著者の関連研究)

・関連研究: Information-Theoretic Free Energy as Emotion Potential: Emotional Valence as a Function of Complexity and Novelty (Yanagisawa et al., 2020, arXiv:2003.10073)

リアクション(ログイン不要)

匿名で残せます • 同じリアクションは1日1回まで

関連シリーズ

論文ダイジェスト第54回 / 全91回

次に読む

編集部からのおすすめ