RÉSUMÉ DE RECHERCHE · 2026-07-03

Mirowski et al. : faire passer le récit de « l'écrire » au « le trouver » — Fabula, une IA d'écriture cultivée avec une communauté d'auteurs — lu par Fukai

récit interactif / génération narrative / conception participative d'IA

En bref

Une équipe de recherche de Google DeepMind a créé « Fabula », une application d'aide à l'écriture destinée aux auteurs de romans, de scénarios et de pièces de théâtre, puis l'a fait évoluer de façon critique avec une communauté d'auteurs. Au centre du dispositif se trouve un « gestionnaire de drame » (Drama Manager) : un mécanisme qui planifie puis génère un récit en le découpant hiérarchiquement en scènes, elles-mêmes composées de leur plus petite unité, la « beat ». En sollicitant à de multiples reprises un grand modèle de langage (LLM, une IA qui a appris les enchaînements du langage à partir d'immenses quantités de texte), le système construit peu à peu l'ossature du récit puis le script.

Grâce à des entretiens et des séances d'écriture menés avec 42 experts, les auteurs remettent en question, un par un, leurs propres choix de conception. Pour résumer d'emblée : Fabula excelle dans la construction structurelle du récit, mais peine sur le style et sur la production de l'« inattendu », et c'est auprès des débutants et des auteurs venus de l'image que l'outil a le plus séduit. Si j'ai choisi cet article aujourd'hui, c'est que le terme même de « gestionnaire de drame » appartient déjà en propre au vocabulaire de la recherche sur le récit interactif (une expérience où l'histoire évolue selon les actions du joueur) dans le jeu vidéo.

Introduction

Les auteurs sont Piotr Mirowski, Ben Wedin, Reinald Kim Amplayo, Richard Evans et leurs collègues (tous chez Google DeepMind, avec Lion Schulz de Bertelsmann comme coauteur). Le texte a été publié comme préimpression sur arXiv (arXiv:2606.14411, cs.HC, déposé le 12 juin 2026, licence CC BY 4.0) ; la version que j'ai lue ne mentionne pas avoir été relue par les pairs. Je le traite donc ici comme une préimpression non encore évaluée.

L'auteur principal, Mirowski, est aussi celui de « Dramatron » (2023), un outil qui écrit des scénarios par enchaînement hiérarchique d'invites (partant d'un logline, une accroche en une ligne, pour générer progressivement personnages, intrigue puis dialogues). Fabula peut se lire comme le prolongement de ce travail.

Je suis tombé sur cet article ce matin, un jour où les nouveautés en IA manquaient d'articles accessibles sur les puzzles, en parcourant les dernières publications de cs.HC — et ce texte de 41 pages a retenu mon attention. Ce qui m'intéresse ici n'est pas tant la génération de récit en elle-même que la façon dont les auteurs se servent du processus de conception de l'outil comme d'un révélateur des tensions entre développeurs et écrivains.

Contexte

Reprenons le contexte. Les LLM récents écrivent des textes longs avec fluidité, mais les auteurs humains leur reprochent de s'appuyer sur des clichés, de manquer de sous-entendus et de symbolique, et de tendre vers des dénouements moralisateurs et prévisibles (les auteurs citent Chakrabarty et al., 2024). Les auteurs notent cependant aussi que les compétences créatives des modèles s'améliorent à mesure qu'ils se renouvellent.

Les outils d'aide à l'écriture se multiplient. AI Dungeon et Lore Machine penchent vers une expérience immersive, proche du jeu vidéo, mais rendent difficile la vue d'ensemble de l'arc narratif ou la modification de passages déjà écrits. Sudowrite Muse et SAGA font établir un plan structurel en amont. Dramatron a ouvert la voie de l'enchaînement hiérarchique d'invites. Fabula superpose à tout cela une « IA participative » qui associe l'auteur à la conception.

Les auteurs de l'article posent ici un constat critique. Les travaux antérieurs sur la conception participative, tout en se réclamant de ce terme, ont souvent été critiqués pour ne traiter la parole des utilisateurs que comme un matériau destiné à améliorer l'outil — une attitude que d'autres chercheurs ont qualifiée de « participation washing » (une participation d'alibi). Fabula, à l'inverse, utilise le prototype lui-même comme une « sonde culturelle » (cultural probe, un dispositif posé pour faire émerger les valeurs des gens), afin de faire apparaître les frictions entre les valeurs des développeurs et celles des auteurs. Pourquoi cela importe : cette même friction entre IA générative et métier de la création se retrouve telle quelle dans la production narrative des jeux vidéo.

Approche

Le cœur de la méthode est le « gestionnaire de drame ». Il s'agit d'un dispositif fondé sur un LLM qui traite le récit à trois niveaux d'abstraction — le plan de l'histoire (story plan), le plan des beats (beat plan) et le script effectif (script) — avec des rôles de génération de plan, de génération des lignes du script, et de mise à jour dynamique du plan. Un récit est une suite de « scènes », chaque scène étant elle-même une suite de « beats ». Une beat est un segment de quelques lignes où survient un événement dramatiquement significatif ; entrées et sorties de personnages, changements de lieu, de sujet, d'émotion ou de rapport de force, ou encore changement de l'objectif d'un personnage servent de « signaux de bascule ».

Les auteurs empilent des modules destinés à élever la qualité du récit. Dès la phase de planification, des « exigences narratives » (desiderata) — unité thématique, suspense, surprise, escalade, résolution, cohérence, amplitude émotionnelle — sont explicitement fixées. Pour chaque personnage, en empruntant à la théorie théâtrale de Stanislavski et aux travaux de fiction interactive (Versu), on impose de définir un objectif, un enjeu et un obstacle (Objective / Stakes / Obstacle). Ainsi, ce sont les intentions des personnages, et non les commodités de l'intrigue, qui sont censées conduire les scènes.

Les gestionnaires de drame les plus avancés font tourner une boucle de recherche « générer → évaluer → sélectionner » (auto-critique : produire plusieurs propositions, faire lister par un LLM jouant le rôle d'éditeur leurs qualités et défauts, puis choisir la meilleure). La qualité augmente, mais le coût de calcul et le temps de latence aussi. Les auteurs ont mis en œuvre 26 gestionnaires de drame différents pour explorer l'équilibre entre qualité et rapidité de réponse. L'évaluation combine un « auto-évaluateur » (auto-rater, un LLM qui note les productions à la place d'un humain) s'appuyant sur 63 critères tirés de manuels de théorie de l'écriture, et une méthode d'« autojeu » (self-play) où des agents aux personnalités différentes rédigent librement des récits. Le modèle utilisé à l'époque de l'étude était Gemini 2.5 Flash (puis, plus tard, la famille Gemini 3). Dit sans formule : on traduit la qualité d'un récit en une liste de critères, et on laisse l'IA elle-même s'auto-noter.

Pour l'interface, les auteurs ont délibérément évité le format chatbot, en proposant deux modes de travail : le « Jardinier » (Gardener) et l'« Architecte » (Architect). Le Jardinier permet une co-création fine, instant par instant ; l'Architecte construit la structure de haut en bas. Derrière ces choix se trouve l'idée de « trouver » un récit plutôt que de le « fabriquer » — à la manière de la nouvelle de Borges « La Bibliothèque de Babel » — un cadre que les auteurs nomment « itération convergente » (convergent iteration), une exploration répétée d'un espace où tous les récits préexistent déjà en germe.

Résultats

Voici ce que l'étude révèle, avec les chiffres du texte original. La validité de l'auto-évaluateur, mesurée par sa concordance avec la « préférence globale » des humains, atteint 0,72 pour la version naïve fondée sur les critères, et 0,83 pour la version améliorée (les données de préférence humaine utilisées pour la comparaison présentent un kappa de Fleiss de 0,46, p < 0,01, N = 150, trois catégories). Les auteurs indiquent que la boucle de recherche par auto-critique « produit, selon leurs évaluations, des récits nettement plus qualitatifs », mais au prix d'une latence accrue (l'ampleur précise de cet écart n'est pas donnée en chiffres dans les passages que j'ai lus).

Le jugement des auteurs invités s'est révélé partagé. Beaucoup ont reconnu la supériorité du système sur les aspects « mécaniques » : structure, découpage des scènes, construction de l'arc émotionnel (« la manière dont une idée se transforme en une scène parfaitement fonctionnelle est remarquable », W4). En revanche, dialogues et style sont apparus faibles, les productions étant jugées « génériques », « toc », « niveau créativité 101 » (élémentaire), avec des tentatives d'imiter le style de Brecht, Pinter ou Beckett qui échouent l'une après l'autre. Les auteurs qualifient ce phénomène de « plafond stylistique », une convergence vers une moyenne sans risque.

Sur le plan quantitatif, le Creativity Support Index (un indice mesurant le degré de soutien apporté à la créativité, construit sur la base du NASA-TLX, qui mesure la charge de travail) recueilli auprès de 25 créateurs s'est révélé le plus élevé chez les autodéclarés « débutants » et les personnes venues du monde de l'image, et le plus bas chez celles venues du théâtre. Dans l'interface, le mode Architecte a été accueilli favorablement (« comme créer sa fiche de personnage de Donjons et Dragons », W15), mais a aussi suscité des plaintes sur sa « rigidité en trois colonnes » : modifier la scène 3 pouvait rompre la cohérence avec la scène 6. Le mode Jardinier, lui, a été jugé « comme un jeu vidéo » (W18), plaisant, et générateur de développements plus inattendus. Un biais culturel a également été observé : même sans consigne explicite, les personnages tendaient vers des figures blanches, cisgenres et masculines, les personnages féminins basculant volontiers vers des stéréotypes comme « timide et discrète ».

Applications possibles

Voici, très concrètement, ce que peuvent en tirer les créateurs de jeux et de puzzles. Premièrement, pour qui conçoit un récit interactif ou un jeu d'aventure (ADV), le gestionnaire de drame peut être détourné en « couche de contrôle narratif à l'exécution ». La co-création instant par instant du mode Jardinier se rapproche précisément du récit interactif. Les auteurs eux-mêmes citent, dans leur résumé, le « récit interactif » comme piste future, et l'image évoquée par un participant (P5) — un « terrain de jeu où l'on lâche des personnages dans un monde régi par une IA pour observer ce qui engendre le conflit » — recoupe exactement la conception d'un récit émergent (un jeu où l'histoire se construit sur le moment).

Deuxièmement, un pipeline de génération narrative procédurale. La hiérarchie à trois niveaux — plan de l'histoire → plan des beats → script — peut être empruntée comme modèle de données pour la génération de quêtes ou de dialogues. Les déclencheurs de changement de beat (entrées et sorties de personnages, changements de lieu, d'émotion ou de rapport de force, changement d'objectif) correspondent presque terme à terme aux changements d'état d'un jeu. Si je devais ajouter un récit à un jeu Sokoban-like, je commencerais la conception à partir de cette correspondance « changement d'état = frontière de beat ».

Troisièmement, un test automatisé de la qualité narrative. La méthode de construction de l'auto-évaluateur — noter selon 63 critères, en faisant d'abord rédiger l'argumentaire de chaque note de 1 à 5 pour limiter le biais de position (la tendance à choisir la première ou la dernière option) — peut être détournée en filtre de première ligne pour trier des quêtes ou répliques générées, avant relecture humaine. Quatrièmement, le schéma d'écriture des PNJ fondé sur objectif, enjeu et obstacle constitue un gabarit prêt à l'emploi pour concevoir des personnages secondaires de JRPG ou de roman visuel. Cinquièmement, la leçon du « cadran d'absurdité » réclamé par les auteurs expérimentés — ne pas maximiser à l'excès la cohérence, mais exposer un bouton permettant d'ajuster la nouveauté — s'applique directement à la génération narrative des roguelikes et de la PCG (Procedural Content Generation, génération automatique de contenu).

Limites

Passons aux limites. D'abord, celles que les auteurs reconnaissent eux-mêmes. La stratégie consistant à peaufiner un unique gestionnaire de drame ne peut pas rendre compte de toutes les manières culturelles de raconter. La structure hiérarchique scène-beat est biaisée en faveur de la narratologie occidentale, et le style tend à se rapprocher de l'écriture scénaristique (screenwriting). Le mode Architecte est rigide : une modification locale peut se répercuter sur l'ensemble et rompre la cohérence causale entre les scènes. Enfin, les auteurs écrivent honnêtement que plus l'auto-évaluateur optimise la « cohérence », plus il risque d'éliminer les « ruptures productives » et les effets de surprise que les auteurs chevronnés utilisent comme tremplins créatifs.

Voici, à partir d'ici, les points que j'ai relevés en le lisant. Fukai souligne d'abord qu'il s'agit d'une préimpression non encore évaluée par les pairs, et que le cœur de l'évaluation qualitative repose sur un échantillon restreint de 25 personnes. Les sous-groupes du Creativity Support Index, répartis par domaine, sont nécessairement encore plus réduits ; la conclusion selon laquelle l'outil « a le plus séduit les débutants » doit donc être reçue comme une tendance, non comme une affirmation ferme. Le passage de 0,72 à 0,83 pour l'auto-évaluateur n'est, lui aussi, qu'un taux d'accord avec un unique jeu de données externe, sur une tâche que les auteurs eux-mêmes qualifient de fondamentalement subjective ; et l'affirmation selon laquelle la boucle de recherche « améliore nettement » la qualité n'est, dans les passages que j'ai lus, appuyée par aucun chiffre précis.

La lecture de Fukai

À partir d'ici, voici la lecture de Fukai (je précise qu'il ne s'agit que de mon opinion). Je choisis de situer cette étude comme un exemple soigneusement documenté, sur le terrain de la création, du paradoxe suivant de l'IA générative : plus un système s'auto-améliore, plus il tend vers la moyenne. La boucle d'évaluation automatique qui vise à élever la « qualité » attire le récit vers ce qui est sûr et facile à lire — alors même que ce que les auteurs valorisaient, c'était précisément l'inattendu qui brise cette sécurité. En langage de critique de conception, on peut lire ceci comme un problème où l'indicateur qui élève la qualité est, en même temps, l'indicateur qui aplatit la voix. Quiconque utilise un auto-évaluateur comme signal de récompense pour un récit de jeu vidéo devrait garder cette étape à l'esprit — c'est, en tout cas, ma lecture.

Pour aller plus loin

Pour qui souhaite approfondir. Le concept de « gestionnaire de drame » plonge ses racines dans la recherche sur le drame interactif depuis « Façade », la pièce dialoguée de Mateas et Stern. On peut d'abord lire, du même Mirowski et de ses collègues, « Dramatron » (2023), qui permet de visualiser le chemin allant de l'enchaînement hiérarchique d'invites jusqu'à ce travail-ci. « Versu », d'Evans, à l'origine de l'idée d'objectif et d'obstacle des personnages, constitue également un compagnon de lecture intéressant, dans la lignée des récits mus par la simulation sociale. Cet article a été rédigé pour se suffire à lui-même, mais le texte original conserve encore beaucoup des voix brutes des auteurs interrogés.

Références

Article et documents connexes cités dans ce texte :

· Fabula: Building a Narrative Storytelling Sidekick with the Writers' Community (Mirowski, Wedin, Amplayo, Evans et al., 2026, préimpression arXiv 2606.14411 [cs.HC])

· Travaux connexes : Co-Writing Screenplays and Theatre Scripts with Language Models (Dramatron ; Mirowski, Mathewson, Evans, CHI 2023)

· Fabula (Google DeepMind, page de demande d'accès)

Reactions (no login)

Anonymous • one of each per visitor per day

関連シリーズ

Paper Digest第19回 / 全98回

Read next