PAPER-DIGEST · 2026-09-25

Sears と Weisberg: AI が書いた短編を読者は見分けられず、「人の作」と聞くと評価を上げた — Fukai が読む

意思決定・読書の心理 — 書き手のラベルは、作品の評価をどう変えるか

一段落要約

AI が書いた短編小説を、読者は見分けられなかった。しかも、何も知らされずに読むと、AI の短編の方を「質が高い」と評価した。ところが「人が書いた」と聞かされると、同じ話でも評価が上がった。

査読誌 Judgment and Decision Making に 2026 年 8 月 5 日付で載った、Villanova 大学の Sydney Sears と Deena Skolnick Weisberg の論文である。3つの研究で、合計 2,500 人を超える参加者を調べている。

ゲームの文章(フレーバーテキスト、ヒント、会話)を作る人にとって、これは「読者は中身より、書き手が誰だと思うかで評価を変える」という話でもある。

誰が、どこに書いた論文か

著者は Villanova 大学 心理・脳科学科の Sydney Sears と Deena Skolnick Weisberg。Weisberg は、人がフィクションをどう受け止めるかを長く研究してきた発達心理学者だ。

掲載誌は判断と意思決定の研究を扱う査読誌で、論文番号は e21、DOI は 10.1017/jdm.2026.10042。ライセンスは CC BY-NC で、誰でも全文を読める。使った小説や質問項目は OSF(研究資料の公開サイト)に置かれている。ただし著者自身が明記している通り、どの研究も事前登録(実験の前に分析計画を公開しておくこと)はしていない。

私がこれを今日選んだのは、ゲームの文章に生成 AI を使うかどうかが、いま多くの開発者の目の前にある問題だからだ。そして「見分けられるか」という問いは、そのままパズルにもなる。 『The Turing Test』のゲーム画面『The Turing Test』(Bulkhead Interactive, 2016)。題名そのものが「機械と人を見分ける試験」から来ている一人称パズル。画像: Steam ストアページ

「AI の文章は見抜ける」は、どこまで確かだったのか

機械が人のふりをできるかという問いは古い。論文は、1972 年の ELIZA(初期の会話プログラム)の研究で、判定者が機械を当てられたのは 48% だったという例を引いている。当てずっぽうと変わらない数字だ。

近年は、AI が書いた広告文や説明文が、人の文章と同じくらい、あるいはそれ以上に高く評価される結果が続いている。詩でも、ChatGPT の詩は人の詩と見分けにくく、しかも「AI 作」と知ると評価が下がると報告されていた(Porter と Machery, 2024)。 『The Talos Principle』のゲーム画面『The Talos Principle』(Croteam, 2014)。パズルの合間に端末の文章を読み、「書き手は人か機械か」を考えさせる作品。画像: Steam ストアページ

一方で、人は「AI に本物の創作はできない」と考えがちだ。この、機械の出したものを割り引いて見る傾向を、研究者は algorithm aversion(アルゴリズム嫌悪。機械の判断や作品を、同じ質でも低く見てしまう傾向)と呼ぶ。

まだ分かっていなかったのは、物語、つまり筋と人物のある短編でも同じことが起きるのか、という点だ。もう一つは、見分ける力を支えるのは文学の知識か、AI の知識か、という点である。

どうやって確かめたのか

材料は6本の短編だ。3本は文芸誌や短編集に載った人の作品(Emilie Fox の "FISH"、Susie Maguire の "High Heels"、Patrick Smyth の "Inisfree")。残り3本は、それぞれの主題や時代設定を指示して ChatGPT 4.0 に書かせた。どれも約 1,000 語で、数分で読める長さである。

研究1(1,682 人、除外後)は評価の実験だ。参加者は1本だけ読む。組み合わせは「本当の書き手(人/AI)」と「告げられた書き手(人/ChatGPT)」の 2×2 である。つまり、人の作品を「AI 作」と告げられる人もいる。読後に、物語への没入感(話に引き込まれた度合い)と、筋・人物・主題・文体の質を答えた。

研究2(424 人)は見分ける実験だ。人の作品と AI の作品を1本ずつ読み、「どちらが人(または ChatGPT)の作か」を選ぶ。自信の度合い、判断に使った手がかり(言葉づかい、人物、主題、筋、象徴、楽しさ)、AI と文学についての知識も尋ねた。

研究3(481 人)は研究2の追試である。材料と手順は同じで、AI の知識だけを、妥当性が確かめられた AI リテラシー尺度(AI をどれだけ理解し使えるかを測る 12 項目の質問票)に置き換えた。どの研究も、内容の確認問題に答えられなかった人は除いている。

何が分かったのか

研究1では、AI の短編の方が高く評価された。質の平均は AI 作が 1.54、人の作が 0.97。没入感も AI 作が 1.42、人の作が 1.00 だった(没入感は −3〜+3 の尺度)。

同時に、「人が書いた」と告げられた方が評価は上がった。質は 1.40 対 1.12、没入感は 1.32 対 1.10 である。本当の書き手と告げられた書き手の効果は、互いに打ち消し合わずに別々に働いていた(交互作用は有意でない)。AI に好意的な人ほど、「ChatGPT 作」と告げられても評価を下げにくかった。

研究2では、正しく見分けられたのは 424 人中 167 人、39.39% だった。偶然の 50% より有意に低い。二択なので、間違えた人は AI の作品の方を「人の作」と選んだことになる。「言葉づかい」を手がかりにした人ほど間違えやすかった。

研究3では、正答は 481 人中 250 人、51.97% だった。50% と差はない(p = .41)。研究2の「偶然より低い」は再現されず、「偶然と同じ」に落ち着いた形だ。どちらの研究でも、自信の強さと正しさには関係がなかった。研究2では、読むのにかけた時間(平均 569.88 秒)も正しさと関係がなかった。

見分ける力と結びついていたのは AI の知識だった。研究2では AI の知識が多いほど正答しやすく(β = .13, p < .001)、研究3でも AI リテラシーが高いほど正答しやすかった(β = .29, p = .041)。一方、文学の知識は、研究2(β = −.006, p = .87)でも研究3(β = .004, p = .91)でも効いていなかった。

ゲームを作る側は、これをどう使えるか

1つ目は、文章のプレイテストのやり方だ。テスターに「この文は AI っぽいか」と聞いても、この研究では自信と正しさが一致しなかった。文章の良し悪しを比べたいなら、書き手を伏せて並べて評価してもらう方がよい。書き手を知らせた評価には、ラベルの効果(この研究では質の平均で約 0.3 の差)が混ざる。

2つ目は、AI を使ったことを伝えるかどうかの判断だ。この研究は、「AI 作」と知らされると評価が下がることを示している。だからといって隠せばよい、という話ではない。Steam のように開示を求める場もあるし、隠していたと後で知られる方が信頼を大きく損なうだろう。私が読み取るのは、「開示したうえで、中身で評価を取り戻す設計が要る」ということだ。

3つ目は、「人か機械か」を当てるパズルそのものだ。『The Turing Test』や『The Talos Principle』のように、この問いは物語の題材として強い。ただ、見分けのゲームを作るなら注意がいる。この研究では、多くの人が頼った「言葉づかい」は当てにならなかった。答えを文体のなめらかさだけに置くと、正解率は五分五分に近づき、解いた手応えのないパズルになりかねない。 『Her Story』のゲーム画面『Her Story』(Sam Barlow, 2015)。証言映像の言葉づかいから真相を推理する作品。「言葉の手触りで見抜く」遊びの代表例。画像: Steam ストアページ

では、どんな手がかりなら公平か。『Her Story』のように、言葉の中身と事実の食い違い(時系列、固有名、前に言ったことと矛盾する点)を拾わせる方が、プレイヤーは推理できる。研究3では「象徴」を手がかりにした人がやや正答しやすい傾向も報告されている(有意水準の境目)。

4つ目は、短いゲーム内テキストの書き方だ。著者らは考察で、AI の文章が高く評価された理由として、読みやすさ(すっと頭に入ること)や明るい調子を挙げている。これは検証された結論ではなく、著者の解釈である。それでも、数分で読まれる文章では「読みやすさ」が評価を大きく左右しうる、という見立ては、アイテム説明やヒント文にもそのまま当てはまりそうだ。

5つ目は、チームの中の役割分担だ。見分ける力が文学の知識ではなく AI の知識と結びついていたことから、AI 生成の文章を点検する担当には、文章のうまい人より、AI の出力を日頃から多く読んでいる人が向いているかもしれない。これは研究の直接の結論ではなく、私の応用である。

どこまで信じてよいのか

著者自身が認めている限界から挙げる。まず、話が短いこと。数分で読める長さで、長編やシリーズものに同じことが言えるかは分からない。次に、研究2と3は「片方が人、片方が AI」と先に教えている。現実にはこの前提は無い。質の尺度も、この研究のために作ったもので、事前の検証を経ていない。

さらに、話の組は3組だけで、AI は ChatGPT 4.0 の1種類、参加者は Prolific で集めた米国の一般の人である。プロの書き手は AI の話を低く評価したという先行研究(Chakrabarty ら, 2023)もあり、読み手が変われば結果も変わりうると著者は述べている。

Fukai がここで指摘したいのは、研究2と3の結果の食い違いだ。研究2の 39.39% は「偶然より悪い」、研究3の 51.97% は「偶然と同じ」。同じ材料でこれだけ動くなら、「人は AI の話を人の作だと思い込みやすい」と言い切るのは早い。確かに言えるのは「当てられなかった」までだと私は読む。

もう一つ、研究1の「AI 作の方が質が高い」は、3組の話の選び方に強く左右されうる。人の作品は実際に出版されたもので、AI の作品はその主題に合わせて後から書かせている。さらに、どの研究も事前登録がない。標本は大きく、研究3という追試もあるが、心理学の知見として扱うなら「この条件では」と留保をつけて読むのがよい。

Fukai の読み

ここだけは私の意見である。私はこの研究を、「作品の価値は、作品の外にある物語(誰が、どれだけ苦労して作ったか)にも宿る」という古い問題の、新しい測り方として読みたい。ゲームで言えば、手作りのパズルに感じる「作者の意図」への信頼に近い。プレイヤーが難しい面を最後まで粘れるのは、「この面には答えがあり、誰かが意図して置いた」と信じられるからだ。AI が作った面や文章に同じ信頼を寄せてもらうには、中身の質だけでは足りず、「誰かがこれを選び、確かめた」と伝わる設計が要る、と私は整理している。

次に何を読むと地図が見えるか

詩について同じ問いを立てた Porter と Machery(2024)は、この論文の出発点の一つだ。見分けられないのに AI 作と知ると評価が下がる、という同じ形の結果が出ている。

プロの書き手の目で AI の物語を評価した Chakrabarty ら(2023)は、「読み手が変われば結果が変わる」側の証拠として並べて読むとよい。また、AI 作と知らされると物語への入り込み(transportation)が弱まったという Messingschlager と Appel(2022)は、研究1のラベル効果と同じ方向の結果である。

Puzzlebyrinth では、以前に AI がパズルの面を作る研究も読んできた。「AI が作ったものを人がどう受け取るか」という視点を加えると、生成の研究とこの研究が一枚の地図につながる。

参考文献

本記事で参照した論文と関連資料:

・Bot or not: Can people tell the difference between stories written by a human or by an AI system? (Sydney Sears, Deena Skolnick Weisberg, 2026, Judgment and Decision Making 21, e21、査読あり)

・DOI: 10.1017/jdm.2026.10042

・研究資料(使用した短編と質問項目、OSF)

・関連研究: Porter と Machery (2024)、Chakrabarty ら (2023)、Messingschlager と Appel (2022)(いずれも上記論文の参考文献に所収)

リアクション(ログイン不要)

匿名で残せます • 同じリアクションは1日1回まで

関連シリーズ

論文ダイジェスト第95回 / 全98回

次に読む

関連レビュー

編集部からのおすすめ