PAPER-DIGEST · 2026-07-03
Mirowski et al.: Geschichten nicht „schreiben“, sondern „finden“ — die mit einer Autor:innen-Community gewachsene Schreib-KI „Fabula“ — gelesen von Fukai
Interaktive Narrative / Story-Generierung / partizipatives KI-Design
Kurz gesagt
Ein Forschungsteam von Google DeepMind hat mit „Fabula“ eine Schreib-Unterstützungs-App für Autor:innen von Romanen, Drehbüchern und Theaterstücken entwickelt und diese gemeinsam mit einer Community von Schreibenden kritisch weiterentwickelt. Im Zentrum steht der „Drama Manager“ — ein Mechanismus, der eine Geschichte in eine Hierarchie aus Szenen und deren kleinster Einheit, den „Beats“, gliedert, plant und generiert. Er ruft wiederholt ein großes Sprachmodell (LLM; eine KI, die aus riesigen Textmengen sprachliche Zusammenhänge gelernt hat) auf, um Gerüst und Drehbuch der Geschichte zusammenzusetzen.
In Gesprächen und Schreibsitzungen mit 42 Fachleuten stellen die Autor:innen ihre eigenen Designentscheidungen Schritt für Schritt infrage. Vorweggenommen das Ergebnis: Fabula ist stark im Aufbau der Erzählstruktur, aber schwach bei Stil und beim Erzeugen von „Unerwartetem“, und traf am ehesten den Nerv von Anfänger:innen und Autor:innen aus dem Filmbereich. Ich habe diesen Fachartikel heute ausgewählt, weil der darin verwendete Begriff „Drama Manager“ genau das Vokabular der Forschung zu interaktiven Narrativen in Spielen ist — Erzählungen, die sich abhängig vom Spielerhandeln entfalten.
Einleitung
Die Autoren sind Piotr Mirowski, Ben Wedin, Reinald Kim Amplayo, Richard Evans und weitere (alle bei Google DeepMind, Ko-Autor Lion Schulz bei Bertelsmann). Veröffentlicht wurde der Text als arXiv-Preprint (arXiv:2606.14411, cs.HC, eingereicht am 12. Juni 2026, Lizenz CC BY 4.0); in der von mir gelesenen Fassung wird nicht angegeben, dass ein Peer-Review-Verfahren durchlaufen wurde. Ich behandle den Text daher als „Preprint vor Begutachtung“.
Erstautor Mirowski ist zugleich der Urheber von „Dramatron“ (2023), das Drehbücher über eine hierarchische Prompt-Verkettung schreibt — eine Methode, die von einer einzeiligen Logline ausgehend schrittweise Figuren, Handlung und Dialoge erzeugt. Fabula lässt sich als Fortsetzung dieser Forschungslinie lesen.
Ich griff heute Morgen zu diesem Text, weil an einem Tag mit wenig neuen, leicht zugänglichen Rätsel-Fachartikeln dieses 41-seitige Werk in den Neuerscheinungen von cs.HC auffiel. Interessanter als die Story-Generierung selbst ist, wie die Autor:innen den Entwicklungsprozess des Werkzeugs als Mittel nutzen, um Konflikte zwischen Entwickler:innen und Schreibenden offenzulegen.
Hintergrund
Zunächst zum Hintergrund. Aktuelle LLMs können lange Texte flüssig schreiben, wurden von menschlichen Autor:innen aber wiederholt kritisiert: Sie griffen zu Klischees, es fehle ihnen an Subtext und Symbolik, und die Enden gerieten belehrend und vorhersehbar (die Autoren zitieren hier Chakrabarty et al., 2024). Zugleich wird festgestellt, dass die kreativen Fähigkeiten der Modelle mit jeder neuen Generation zunehmen.
Auch Schreib-Werkzeuge nehmen zu. AI Dungeon und Lore Machine setzen eher auf ein spielartiges, immersives Erlebnis, erschweren aber den Überblick über den Handlungsbogen und das nachträgliche Bearbeiten früherer Abschnitte. Sudowrite Muse und SAGA lassen vorab ein strukturelles Gerüst entwerfen. Dramatron erschloss die hierarchische Prompt-Verkettung. Fabula legt darüber eine „partizipative KI“, die Autor:innen in die Gestaltung einbindet.
Hier formulieren die Autoren ein Problembewusstsein: Frühere Forschung hat kritisiert, dass Nutzerstimmen trotz des Etiketts „partizipativ“ oft nur als Material zur Verbesserung eines Werkzeugs behandelt werden — ein Vorgehen, das man als „Participation Washing“ (Partizipations-Feigenblatt) bezeichnet hat. Fabula geht den umgekehrten Weg und nutzt den Prototyp selbst als „kulturelle Sonde“ (cultural probe — ein Instrument, das eingesetzt wird, um die Werte von Menschen offenzulegen), um Wertekonflikte zwischen Entwickler:innen und Autor:innen sichtbar zu machen. Warum das wichtig ist: Genau diese Reibung zwischen generativer KI und schriftstellerischem Handwerk tritt auch bei der Erzählproduktion in Spielen unmittelbar auf.
Vorgehen
Kern der Methode ist der „Drama Manager“. Dies ist ein LLM-basiertes System, das eine Geschichte auf drei Abstraktionsebenen behandelt — Story Plan (Gesamtplan der Geschichte), Beat Plan (Planung auf Ebene der Beats) und Script (das eigentliche Drehbuch) — und Rollen für das Erzeugen von Plänen, das Generieren von Drehbuchzeilen und die dynamische Aktualisierung von Plänen übernimmt. Eine Geschichte ist eine Abfolge von „Szenen“, jede Szene eine Abfolge von „Beats“. Ein Beat ist ein kurzer Abschnitt von wenigen Zeilen, in dem etwas dramatisch Bedeutsames geschieht; als „Umschlagsignale“ gelten Auf- und Abtritte, Ortswechsel, Wechsel von Thema, Emotion oder Machtverhältnis sowie Veränderungen im Ziel einer Figur.
Die Autoren schichten Module übereinander, um die Qualität zu steigern. Bereits in der Planungsphase werden explizite „narrative Desiderata“ vorgegeben, um die Aufmerksamkeit der Leserschaft zu binden — thematische Einheit, Spannung, Überraschung, Eskalation, Auflösung, Stimmigkeit und emotionale Bandbreite. Für Figuren wird, angelehnt an Stanislawskis Schauspieltheorie und Forschung zu interaktiver Fiktion (Versu), stets ein Ziel, ein Einsatz und ein Hindernis (Objective / Stakes / Obstacle) festgelegt. Dadurch sollen Szenen von der Absicht der Figuren angetrieben werden, nicht von den Erfordernissen der Handlung.
Fortgeschrittenere Drama Manager durchlaufen zudem eine Generieren-Bewerten-Auswählen-Suchschleife (Selbstkritik: mehrere Varianten erzeugen, eine als „Lektor“ fungierende LLM listet Vor- und Nachteile auf und wählt die beste aus). Das steigert die Qualität, erhöht aber Rechenaufwand und Wartezeit. Um die Balance zwischen Qualität und Reaktionsgeschwindigkeit auszuloten, implementierten die Autoren 26 verschiedene Drama-Manager-Varianten. Zur Bewertung dient ein „Auto-Rater“ (eine LLM, die Ausgaben anstelle von Menschen bewertet) anhand von 63 aus Lehrbüchern des kreativen Schreibens entnommenen Richtlinien, kombiniert mit „Self-Play“, bei dem Agenten mit unterschiedlichen Persönlichkeiten eigenständig Geschichten schreiben. Als Modell diente zum Zeitpunkt der Untersuchung Gemini 2.5 Flash (später die Gemini-3-Reihe). Ohne Formeln gesagt: Man übersetzt die Güte einer Geschichte in eine sprachliche Checkliste und lässt die KI sich selbst danach benoten.
Bei der Benutzeroberfläche wurde ein Chatbot bewusst vermieden; stattdessen gibt es zwei Arbeitsmodi — „Gardener“ (Gärtner) für die minutiöse Ko-Kreation von Moment zu Moment, und „Architect“ (Architekt) für den Aufbau von oben nach unten. Dahinter steht der Gedanke, eine Geschichte nicht zu „erschaffen“, sondern zu „finden“ — angelehnt an Borges' Erzählung „Die Bibliothek von Babel“ ein Rahmen namens „konvergente Iteration“ (convergent iteration), bei dem wiederholt ein Raum durchsucht wird, in dem bereits jede mögliche Geschichte verborgen liegt.
Ergebnisse
Die Ergebnisse, mitsamt den Originalzahlen. Die Validität des Auto-Raters wurde über die Übereinstimmung mit der „Gesamtpräferenz“ menschlicher Bewerter:innen gemessen: 0,72 für die naive Richtlinienversion, 0,83 für die verbesserte Version (die zum Vergleich herangezogenen menschlichen Präferenzdaten hatten ein Fleiss-Kappa von 0,46, p < 0,01, N = 150, drei Kategorien). Die Selbstkritik-Suchschleife erzeuge „laut unserer Bewertung deutlich hochwertigere Geschichten“, so die Autoren, allerdings auf Kosten längerer Wartezeit (die genaue Größe des Unterschieds wird in den von mir gelesenen Abschnitten nicht in Zahlen angegeben).
Die Einschätzungen der Schreibenden fielen geteilt aus. Viele erkannten an, dass das System bei „mechanischen“ Aspekten wie Struktur, Szenenaufteilung und dem Aufbau eines emotionalen Bogens überzeugt („Hervorragend darin, eine Idee in eine perfekt funktionierende Szene zu zerlegen“, W4). Dialoge und Stil hingegen blieben schwach: Die Ausgaben wurden als „generisch“, „billig“ und „Creative 101“ (Anfängerniveau) bezeichnet, und Versuche, den Stil von Brecht, Pinter oder Beckett nachzuahmen, scheiterten reihenweise. Die Autoren beschreiben dies als eine „stilistische Obergrenze“, die zu einem unauffälligen Durchschnitt hin konvergiert.
Quantitativ lag der Creativity Support Index (ein an den Arbeitslast-Index NASA-TLX angelehntes Maß dafür, wie gut ein Werkzeug Kreativität unterstützt) bei 25 Kreativschaffenden am höchsten bei selbsterklärten „Anfänger:innen“ und Personen aus der Filmbranche, am niedrigsten bei Leuten aus dem Theaterbereich. In der Oberfläche wurde der Architect-Modus als „wie das Anlegen eines D&D-Charakterbogens“ (W15) begrüßt, zugleich aber als „starr in den drei Spalten“ kritisiert, da eine Änderung an Szene 3 die Stimmigkeit mit Szene 6 zerstören konnte. Der Gardener-Modus wurde als „wie ein Computerspiel“ (W18) empfunden — unterhaltsam und ergiebiger an überraschenden Wendungen. Auch kulturelle Verzerrungen wurden beobachtet: Figuren tendierten ohne explizite Vorgabe zu weiß, cisgeschlechtlich und männlich, weibliche Figuren gerieten häufig zu Klischees wie „ängstlich und still“.
Wo es nützlich ist
Konkret für Macher:innen von Spielen und Rätseln. Erstens: Wer interaktive Narrative oder Adventures entwickelt, kann den Drama Manager als „Laufzeit-Steuerungsschicht“ für die Erzählung wiederverwenden. Die minutiöse Ko-Kreation des Gardener-Modus liegt nah an interaktivem Erzählen, und auch die Autoren selbst nennen „interaktives Storytelling“ im Fazit als künftige Möglichkeit. Das Bild, das eine Teilnehmerin (P5) beschrieb — ein „Spielplatz, auf dem man Figuren in die Welt der KI loslässt und beobachtet, was Konflikte erzeugt“ — deckt sich unmittelbar mit dem Design emergenter Narrative (Spiele, in denen sich die Geschichte erst im Spielverlauf ergibt).
Zweitens: eine Pipeline für prozedurale Erzählgenerierung. Die dreistufige Hierarchie Story Plan → Beat Plan → Script lässt sich als Datenmodell für die Generierung von Quests oder Dialogen übernehmen. Die Auslöser für Beat-Wechsel (Auf- und Abtritte, Ortswechsel, Veränderungen von Emotion oder Machtverhältnis, Zielwechsel) entsprechen fast eins zu eins Zustandsänderungen in einem Spiel. Würde ich einem Sokoban-artigen Spiel eine Geschichte hinzufügen, würde ich das Design genau bei dieser Entsprechung „Zustandsänderung = Beat-Grenze“ beginnen.
Drittens: automatisiertes Playtesting für Erzählungen. Die Bauweise des Auto-Raters — Bewertung anhand von 63 Richtlinien, wobei für jede Note von 1 bis 5 zuerst eine Begründung verlangt wird, um Positionsverzerrung (die Neigung, die erste oder letzte Option zu wählen) zu unterdrücken — lässt sich als erste Vorauswahl übertragen, um generierte Quests oder Dialogzeilen vor der menschlichen Durchsicht zu filtern. Viertens dient das Schema Objective / Stakes / Obstacle als fertige Vorlage für die Gestaltung von Nebenfiguren in Rollenspielen und Visual Novels. Fünftens greift die von erfahrenen Autor:innen gewünschte Lehre des „Absurditätsreglers“ — Konsistenz nicht überzuoptimieren, sondern einen einstellbaren Regler für Neuartigkeit vorzusehen — unmittelbar bei der Erzählgenerierung für Roguelikes und PCG (Procedural Content Generation, automatisierte Inhaltserzeugung).
Grenzen
Zu den Grenzen. Zunächst die von den Autoren selbst eingeräumten Schwächen. Ein Ansatz, der einen einzigen Drama Manager verfeinert, kann nicht jede Erzähltradition aller Kulturen erfassen. Die hierarchische Szenen-Beat-Struktur ist westlich geprägt, und der Stil neigt zum Drehbuchschreiben. Der Architect-Modus ist starr: lokale Änderungen können sich auf das Ganze auswirken und die Kausalität zwischen Szenen zerstören. Und je stärker der Selbstbewerter auf „Konsistenz“ optimiert, desto eher besteht die Gefahr, genau jene „produktiven Brüche“ und Überraschungsmomente zu beschneiden, die erfahrene Autor:innen als Sprungbrett für ihre Kreativität nutzen — das räumen die Autoren offen ein.
Ab hier folgen Beobachtungen, die mir, Fukai, beim Lesen aufgefallen sind. Zunächst: Es handelt sich um einen Preprint vor Begutachtung, und der Kern der qualitativen Bewertung stützt sich auf eine kleine Stichprobe von 25 Personen. Die nach Fachrichtung aufgeschlüsselten Untergruppen beim Creativity Support Index dürften noch kleiner sein, weshalb die Schlussfolgerung, das System habe „am ehesten bei Anfänger:innen den Nerv getroffen“, eher als Tendenz denn als feste Aussage zu lesen ist. Auch die Werte 0,72 auf 0,83 beim Auto-Rater sind lediglich die Übereinstimmung mit einem einzigen externen Datensatz zu einer Aufgabe, die die Autoren selbst als grundsätzlich subjektiv bezeichnen. Und die Behauptung, die Suchschleife habe „die Qualität deutlich gesteigert“, wird in den von mir gelesenen Abschnitten nicht mit einer Zahl für die Größe des Unterschieds belegt.
Fukais Lesart
Ab hier folgt Fukais eigene Lesart (ich weise ausdrücklich darauf hin, dass dies allein meine Meinung ist). Ich würde diese Studie als eine sorgfältige Feldaufzeichnung eines Paradoxons generativer KI einordnen: Je stärker sich ein System selbst verbessert, desto stärker driftet es zum Durchschnitt. Die Bewertungsschleife, die die „Qualität“ steigern soll, zieht Geschichten in Richtung des Unauffälligen und leicht Lesbaren. Was die Schreibenden aber schätzten, war genau das Unerwartete, das diese Unauffälligkeit durchbricht. In der Sprache der Designkritik lässt sich das so lesen: Die Kennzahl, die die Qualität hebt, ist zugleich die Kennzahl, die die individuelle Stimme einebnet. Wer einen Auto-Rater als Belohnungssignal für die Erzählgenerierung in Spielen einsetzt, sollte diesen einen Schritt im Hinterkopf behalten — so lese ich es.
Zum Schluss
Für alle, die tiefer einsteigen möchten: Das Konzept des „Drama Managers“ wurzelt in der Forschung zu interaktivem Drama seit „Façade“, dem Dialogtheaterstück von Mateas und Stern. Zunächst lohnt sich die Lektüre von „Dramatron“ (2023) desselben Mirowski-Teams, um die Linie von der hierarchischen Prompt-Verkettung zu dieser Arbeit als Landkarte zu sehen. Auch Evans' „Versu“, der Ursprung des Gedankens von Ziel und Hindernis einer Figur, ist als Vertreter einer Erzähllinie interessant, die Geschichten über soziale Simulation antreibt. Dieser Artikel wurde so geschrieben, dass er die zentralen Punkte allein vermittelt, doch im Original stecken noch viele unmittelbare Stimmen der Schreibenden.
Quellen
In diesem Artikel herangezogene Fachartikel und verwandte Materialien:
· Verwandte Arbeit: Co-Writing Screenplays and Theatre Scripts with Language Models (Dramatron; Mirowski, Mathewson, Evans, CHI 2023)
Reactions (no login)
Anonymous • one of each per visitor per day
関連シリーズ
Paper Digest第19回 / 全98回