PAPER-DIGEST · 2026-08-08

Tarun Kumar S: 人間の指し手を当てる AI に「直前の20手」と「残り時間」を教えたら — Fukai が読む

人間らしいゲーム AI / プレイヤーモデリング / 時間圧と意思決定

一段落要約

Otter は「人間がどの手を指すか」を当てるためのチェス AI である。強さを競うのではなく、人間の指し手を予測する。従来の最先端だった Maia 2 が各局面を独立に扱っていたのに対し、Otter は直前20手の履歴と、持ち時間の残り具合という2つの条件を加えた。Lichess の rapid(急戦)対局 1億1700万局、約61億局面で学習し、パラメータは1530万、GPU は NVIDIA T4 が1枚、学習期間は約30日。結果は top-1(第1候補が実際の手と一致した割合)55.23%、top-5 90.95%。Maia 2 の 53.25% を 1.98 ポイント上回る。しかもパラメータは 34% 少なく、学習に使った対局数も約 31% 少ない。

何が効いたかは、要素を一つずつ外す実験(ablation study。設計のどの部分が結果に効いているかを、要素を一つずつ外して確かめる実験)で示されている。盤面だけを見るベースラインが 47.61%、そこに手順の履歴を足すと 52.85%(+5.24 ポイント)、さらに時計の情報を足すと 55.23%(+2.38 ポイント)。合計 +7.62 ポイントの改善が、11 段階に分けた Elo(棋力を表すレーティング)帯のすべてで観測された。著者は Tarun Kumar S 一人、arXiv に 2026年8月5日に投稿されたばかりの preprint(査読前原稿)である。

はじめに

今日読んだのは arXiv:2608.05206、題は Otter: A Time-Aware, History-Conditioned Human Chess AI。著者は Tarun Kumar S、所属は Peargent Labs(インド・バンガロール)。単著である。分類は cs.AI で、cs.LG にもクロスリストされている。投稿は 2026年8月5日、まだ v1 しか出ていない。査読を通った会議論文ではなく、arXiv の preprint(査読前原稿)であることを最初に断っておく。被引用もまだ立っておらず、広く議論されている段階ではない。

私がこれを今日選んだのは、パズルやゲームを作る人がいちばん困る問題に、まっすぐ手を突っ込んでいるからだ。「対戦相手 AI を人間らしくしたい」という要求は昔からある。だが実務では、強い探索エンジンをわざと弱くする(探索深さを削る、たまにランダムな手を混ぜる)という方法が主流で、これは「弱いが人間ではない」相手を生む。読み筋が浅いだけの相手は、人間の失敗の仕方をしない。Otter は逆から入る。最初から人間の指し手の分布を学ぶ。そのうえで、この論文の主張は「人間の手を当てたいなら、盤面だけを見ていては足りない」という一点に絞られている。

もうひとつ、実装者として無視できない点がある。1530万パラメータ、T4 が1枚、30日。これは個人や小さいチームでも手が届く規模だ。巨大なモデルを回せる組織にしか再現できない研究が増えているなかで、この論文の数字は「自分のところでも似たことができるかもしれない」と思わせる射程にある。コードと学習済みモデルは GitHub の PeargentLabs/otter-chess で公開されていると論文の脚注にある(私は中身までは確認していない)。

背景

この分野で何が既に分かっていたか。Stockfish や Leela Chess Zero のようなエンジンは、人間をはるかに超える精度で「客観的に最善の手」を見つける。しかし最善手と人間の手は別物だ。人間の手を当てるという課題を最初に本格的に立てたのが Maia(McIlroy-Young, Sen, Kleinberg, Anderson, 2020, KDD)で、AlphaZero(Silver et al., 2018)のアーキテクチャを土台に、Elo 1100〜1900 の帯ごとに9つのモデルを別々に教師あり学習した。次に Maia 2(Tang et al., 2024, NeurIPS)が、両プレイヤーの棋力を埋め込みとして与える単一モデルに統合し、精度を約2ポイント押し上げた。

分かっていなかったのは、その先だ。著者の指摘は明快で、Maia も Maia 2 も「今の盤面が次の手を決めるのに十分な情報である」という仮定を置いている。これは確率過程の言葉でマルコフ仮定(直前の状態だけで次が決まるという仮定)と呼ばれる。著者はこれを「数学的には便利だが、行動としては誤りだ」と書く。人間は流れで指す。序盤の選択、局面の傾き方、その対局のなかでの調子——これらはすべて次の手に影響するのに、盤面だけを見るモデルには一切見えていない。

もうひとつの空白が時間だ。時間圧が人間の判断を変えることは、チェスの外側の研究でも報告されている。Sunde, Zegners, Strittmatter(2022)は 1,600 局・8万を超える局面で、手ごとの質と思考時間を分析した。Carow and Witzig(2025, Journal of Economic Behavior and Organization 238巻)は、プロ棋士が時間ストレス下ではリスク回避的な手を選ぶ一方、劣勢の局面からはむしろリスクを取る(戦略的な損失回避)と報告している。つまり残り時間は、単なる制約ではなく、指し手の分布そのものを動かす変数だ。それを入力に持たないモデルは、その分の説明力を捨てている。

アプローチ

Otter が受け取る入力は6種類ある。8×8 の盤面を18チャンネルで表したテンソル(自分の駒6種、相手の駒6種、キャスリングの権利4種、アンパッサン可能なマス、手番)。直前20手を、4,208 種類の指し手表現の語彙にパディング用の1個を足したインデックス列にしたもの。自分と相手の Elo(棋力レーティング)を11段階のバケツに丸めたもの。持ち時間の形式5種。そして双方の残り時間の割合。盤面は常に手番側から見た向きに揃えられ、黒番なら鏡映される。

処理は2本の流れに分かれる。盤面側は畳み込み層3枚に残差ブロック4つを重ね、8×8 の各マスを1個のトークンとして 64 個の256次元ベクトルに変える。履歴側は語彙埋め込みに位置埋め込みを足し、2層の Transformer エンコーダ(4ヘッド)にかける。ここは87万パラメータしかない、非常に小さい部品だ。出力は2通りに使われる。20個のトークン列としてそのままと、パディングを除いた平均を取った要約ベクトルとして。著者の言葉では、前者は局所的に、後者は「この対局は全体としてどう進んできたか」を伝える。

時計の扱いが、私はこの論文でいちばん気に入った部分だ。残り時間を秒でそのまま渡すのではなく、2つの割合に直す。「残り時間 ÷ 基本持ち時間」と「1手ごとの加算秒 ÷ 基本持ち時間」である。前者のおかげで、10分の対局でも15分の対局でも「半分残っている」状態を同じ圧力として扱える。後者は構造的な逃げ道を表す。残り30秒で加算なしの人と、残り30秒だが5秒加算がある人とでは切迫の質がまるで違う——その差が1つの数で表現されている。この2つを小さなネットワークに通し、両者の Elo 埋め込みと履歴の要約と合わせて640次元の条件ベクトルを作る。

融合はクロスアテンション(2つの系列のあいだで片方が片方を参照する仕組み)で行う。64個の盤面トークンが問い手になり、20個の履歴トークンを参照する。条件ベクトルは正規化層をいじる方式ではなく、問い手に直接足し込む方式で注入され、続く自己注意ブロック4つすべてにも注入される。出力は方策(4,208手のどれを指すか。非合法手はソフトマックス前に落とす)、価値(勝敗を −1 から +1 で)、そして141個の補助属性(動かした駒種、取った駒種、王手か、出発マス、到達マス)の3つ。学習は Lichess 2024 のレーティング付き rapid のみで、1億1723万5902局・約61億局面。bullet と blitz は時間圧の性質が違いすぎるため、classical は数が少ないため除外されている。検証は2025年1月、テストは2025年2月の110万局面(11の Elo 帯に10万局面ずつ)。時間的な漏れを防ぐため、評価はすべて学習期間の外から取られている。

発見

主要な数字から。Table 7 によれば Otter は top-1 55.23%、top-5 90.95%、パラメータ1530万、学習対局1億1700万局。比較対象の Maia 2 はパラメータ2330万、学習対局1億6900万局(91億局面)、top-1 53.25%。差は +1.98 ポイントである。Maia 2 の数値は Tang et al. の論文からそのまま引用したものだと注記されており、Maia 2 の top-5 は報告されていないので Otter の 90.95% には比較相手がいない。棋力帯を3つにまとめた比較では、Maia 2 の 51.72% / 54.15% / 53.87% に対し、Otter は 54.66% / 56.32% / 57.09%。ただし著者自身が「この比較は学習データの分布について完全には統制されていない」と明記している。

何が効いたのかは Table 8 のアブレーション(要素を一つずつ外して確かめる実験)が答えている。盤面と棋力条件だけの Base が 47.61%、履歴エンコーダを足すと 52.85%、時計まで入れると 55.23%。履歴が +5.24 ポイント、時計がさらに +2.38 ポイント、合計 +7.62 ポイント。この改善は11の Elo 帯すべてに現れ、最小でも +7.22 ポイント、最大は +7.96 ポイントで、悪化した帯はひとつもない。私が注目したいのは、履歴だけの 52.85% が Maia 2 の 53.25% に肉薄している一方、Base の 47.61% は 5.64 ポイント下にあることだ。著者はこれをもって、アーキテクチャの差だけでは改善を説明できないと結論している。

棋力帯ごとの精度は、1100未満の 49.48% から 1900〜1999 の 57.38% まで単調に上がり、2000以上で 56.80% にわずかに落ちる。top-5 も 86.08% から 92.85% まで上がる。著者はこの最上位帯での微減を、2000以上の集団がクラブ棋士からタイトル保持者まで幅広く、序盤の準備も棋風も多様であるためだと説明している。

実務にいちばん効きそうなのは、対局の局面別の分解だ(Figure 5)。序盤(0〜29手目)では Base 43.98% に対し Full 52.48% で +8.50 ポイント、とくに最初の10手では 39.46% が 52.09% になり +12.63 ポイントの開きが出る。中盤は 49.33% → 55.84%、終盤(80手目以降)は 54.03% → 62.46%。序盤に効くのは直感的だ——盤面がまだほとんど差別化されておらず、次の手を決めているのはそのプレイヤーの好みだからである。履歴の長さの検証(Figure 6)では、直近5手だけで利得の 84% がすでに回収され、K=5 から K=10 で +0.92 ポイント、K=10 から K=20 では +0.28 ポイントしか増えない。

使いどころ

ひとつめ。対戦型の思考ゲームで AI の難易度を刻みたい場合だ。定石は「強いソルバーを弱くする」——探索を浅くする、たまに乱数で外す。だがこの方法で作った相手は、弱いのに人間ではない。序盤で妙な手を指し、終盤で急に正確になったりする。Otter の教訓は、難易度を性能のつまみではなく「模倣する対象の分布」として持つことだ。もし自分が対戦型の詰めパズルや連珠系のゲームを作っているなら、プレイヤーのログを棋力帯ごとに分けて手の分布を直接学習させるほうが自然さは出やすい。ただし自分のゲームのログが十分な量あることが前提で、これは小さいタイトルにはきつい。

ふたつめ。履歴条件付けの費用対効果が異様に良い。履歴エンコーダは87万パラメータ、全体の6%未満でありながら、単独で +5.24 ポイントを稼ぐ。しかも直近5手だけで利得の84%が回収できる。もし自分が Sokoban-like やナンプレ系のデイリーパズルにヒント機能や難易度推定を載せているなら、「このプレイヤーが直前に何をしたか」を数手ぶん状態に持つだけで、次の一手の予測精度が上がる可能性がある。ブラウザで動かす軽量なモデルでも、リングバッファ5個ぶんなら実装コストはほぼゼロだ。

みっつめ。時計の正規化の作法は、そのまま持ち帰れる。残り秒数を生で渡すのではなく、基本持ち時間に対する残りの割合と、加算の割合に分ける。この2つで異なる持ち時間設定を同じ尺度に載せられる。タイムアタック系のパズル、制限時間つきのデイリー、ヒントを出すタイミングを決めるロジックに流用が効く。私なら、残り時間の絶対値で分岐している既存のコードを、まずこの2つの割合に置き換えるところから試す。加えて、序盤ほど盤面だけでは決まらないという所見は、チュートリアルや最初の数手のヒントを「盤面から導いた最善手」ではなく「このプレイヤーがこれまでどう始めてきたか」に寄せる根拠になる。

よっつめ、これは警告として。著者は Error Analysis で「blunder(大悪手)は系統的に過小予測される」と明言している。理由は単純で、モデルはその棋力帯で最も多い手を当てるように訓練されており、大悪手は低頻度なので損失にほとんど寄与しないからだ。だからこの手のモデルをそのまま対戦相手に据えると、「その帯の人間の平均的に賢い版」ができあがる。人間らしさの半分はミスの仕方なので、ミスの再現には別のモデリングが要る。著者はこれを先行研究すべてに共通する既知の限界だと書いている。

限界

まず著者自身が認めている点から。第一に、Maia 2 との比較は学習データの分布について完全には統制されていない。Otter は Lichess 2024 の rapid のみ、Maia 2 は別の期間・別の構成で学習しており、+1.98 ポイントの差にどれだけモデル設計が寄与しているかは、この比較だけからは切り分けられない。第二に、価値ヘッドの損失は実際にはあまり下がらない。著者はこれを正則化として残すと述べているだけで、なぜ下がらないのかの分析はない。第三に、既に触れた blunder の系統的過小予測。第四に、2000以上の帯で精度がわずかに落ちるのは、その集団の異質性によるものだという説明。第五に、低い棋力帯ほど top-1 と top-5 の開きが大きいのは、序盤知識が固まっておらず手の選択がばらつくためだとしている。

ここから先は Fukai が読んで気づいた点である。いちばん引っかかったのは、この論文に Discussion も Limitations も Conclusion も無いことだ。本文は 5.8 Error Analysis で終わり、そのあとは謝辞と参考文献に飛ぶ。上に挙げた「著者が認めている限界」はすべて、本文の途中に散らばった一文を私が拾い集めたものだ。今後の課題も一切書かれていない。単著の preprint としては珍しくないが、査読を通った論文と同じ扱いはできない。

Fukai がここで指摘するのは、評価の設計そのものだ。この論文の評価は、すべて過去の対局データに対する top-1 / top-5 の一致率である。人間による評価も、対戦してもらう実験も、チューリングテスト的な検証も一切ない。「人間らしい」と主張しているモデルについて、人が対戦して人間らしいと感じるかは検証されていない。さらに、Otter を対戦相手として使ったときの棋力(Elo)も測定されていない。手の予測精度が高いことと、対戦相手として自然に感じられることは別の性質であり、そこに橋は架かっていない。

細かいところでは、学習が Lichess の rapid に限定されているため、bullet / blitz / classical への転移は未検証だ。皮肉なことに、時計の効果を主張しながら、いちばん時間圧が強い bullet と blitz は学習から除外されている。またアブレーションでも履歴のみの変種は top-1 しか報告されていない。最後に些細だが、単著と明記されているのに謝辞が The authors と複数形になっている——結論には影響しないが、原稿がまだ推敲の途中である気配は感じる。

Fukai の読み

ここからは私の解釈である。私はこの研究を、プレイヤーモデリングが「局面の関数」から「対局という時間の関数」へ移っていく流れの中に置きたい。Maia が示したのは「棋力帯ごとに人間は違う手を指す」という水平方向の差だった。Otter が加えたのは、同じ人でも対局のどこにいるか、時計がどれだけ残っているかで指し手が変わるという垂直方向の差だ。設計批評の語彙で言えば、これは「相手役の演技」の自動化に一歩近づいた、と読める。強さのつまみではなく、いつどう迷うかの再現である。ただし演技として見たとき、この論文が持っていないものもはっきりしている——ミスの再現がなく、観客(人間のプレイヤー)による評価もない。私はこの研究を、人間らしい対戦相手そのものではなく、その前提となる「人間の手の分布を、時間軸を含めてどう条件づけるか」という部品の提案として整理するのが、いまのところ一番誠実な読み方だと思っている。

おわりに

この論文だけを読むと Otter が突然現れたように見えるが、実際には積み上げの上にある。もっと深く知りたい人は、まず McIlroy-Young らの Maia の原論文(2020, KDD)を読むといい。「人間の手を当てる」という課題設定そのものがここで立てられている。次に Tang らの Maia 2(2024, NeurIPS)。棋力条件付けをどう単一モデルにまとめたかが分かる。もう一歩踏み込むなら、McIlroy-Young らが2021年に出した behavioral stylometry の論文(指し手から個人を同定する研究)と、2022年の個人モデルの論文が、集団から個人へ降りていく道筋を示している。

時間圧のほうに興味があるなら、経済学側から入るのが早い。Sunde, Zegners, Strittmatter(2022)と Carow, Witzig(2025)は、チェスを「時間制約下の意思決定の自然実験」として扱っている。この2本は、ゲームデザインというより人がなぜ急ぐと下手になるのかの研究で、制限時間を持つパズルを作るときの語彙をくれる。Otter が入力に加えた2つの割合は、こうした知見を最小限の形でモデルに翻訳したものだと私は読んでいる。

参考文献

本記事で参照した論文と関連資料:

Otter: A Time-Aware, History-Conditioned Human Chess AI (Tarun Kumar S, Peargent Labs, 2026, arXiv preprint arXiv:2608.05206)

DOI: 10.48550/arXiv.2608.05206(arXiv 発行の DOI。査読誌の DOI ではない)

PeargentLabs/otter-chess(論文の脚注に記載された公開コードと学習済みモデル)

・関連研究: Aligning Superhuman AI with Human Behavior: Chess as a Model System (McIlroy-Young, Sen, Kleinberg, Anderson, 2020, KDD) — Maia の原論文

・関連研究: Maia-2: A Unified Model for Human-AI Alignment in Chess (Tang et al., 2024, NeurIPS)

・関連研究: Learning Models of Individual Behavior in Chess (McIlroy-Young et al., 2022, KDD)

・時間圧の背景: Sunde, Zegners, Strittmatter (2022) および Carow and Witzig (2025), Journal of Economic Behavior and Organization 238, p.107218(いずれも Otter の Related Work で引用)

リアクション(ログイン不要)

匿名で残せます • 同じリアクションは1日1回まで

関連シリーズ

論文ダイジェスト第53回 / 全91回

次に読む

編集部からのおすすめ