PAPER-DIGEST · 2026-07-07

Xu et al.: Wenn generative KI zum Kern des Spiels wird — Fukai liest die Studie zu KI-nativen Spielen

Definition und Klassifikation KI-nativer Spiele / Spiele-KI

Zusammenfassung in einem Absatz

Der Einsatz generativer KI (Systeme, die automatisch Text, Bilder und Ähnliches erzeugen) in Spielen nimmt zu, aber „viel generieren können" und „als Spiel unterhaltsam sein" sind zwei verschiedene Dinge. Dieses Papier nennt Spiele, bei denen generative KI selbst zur Kernschleife (dem sich wiederholenden Herzstück des Spielens) wird, „KI-native Spiele" und sammelt und klassifiziert 53 real existierende Beispiele. Das Prüfkriterium der Autoren ist ein Gedankenexperiment (die Frage „was wäre, wenn"): Würde das Spiel ohne diese KI nicht mehr funktionieren? Die gesammelten Werke neigen zu narrativen Genres, während die Nutzung von KI zur Regelentscheidung noch dünn ist. Wenn man diesen Artikel auf einen Satz verdichten will: Der Schlüssel, generative KI in Spiel zu verwandeln, besteht laut dem Papier darin, „freie Bedeutungserzeugung" auf ein „unbewegliches Gerüst" zu setzen.

Einleitung

Was ich heute ausgedruckt und mit dem Rotstift bearbeitet habe, ist „AI Native Games: A Survey and Roadmap" von den sechs Autoren Zhiyue Xu, Fandi Meng, Kaijie Xu, Clark Verbrugge, Simon Lucas und Jian Zhao. Es handelt sich um ein Übersichtspapier (Survey, eine Art Aufsatz, der ein Feld überblickt und ordnet), das erst am 1. Juli 2026 auf arXiv eingereicht wurde. Vorab sei angemerkt, dass es sich um einen Preprint vor der Begutachtung handelt (ein Manuskript im Einreichungsstadium, das noch kein Peer-Review durchlaufen hat). Es gibt bislang kaum Zitationen, und es steht noch vor der Phase breiter Diskussion.

Warum ich das heute ausgewählt habe: Beiträge über den Einsatz generativer KI in Spielen erscheinen fast täglich unter den Neuerscheinungen, aber die meisten behandeln KI als „Werkzeug für die Macher". Dieses Papier verschiebt den Blickwinkel um einen Grad und schneidet nur jene Spiele heraus, bei denen die KI während des Spielens läuft und ohne die das Spiel nicht bestehen würde. Für Leute, die Rätsel oder Spiele entwickeln, ist das weniger eine Landkarte, um Trends zu folgen, als ein Maßstab für Designentscheidungen. Deshalb wollte ich es vorstellen.

Hintergrund

Bisherige Spiele-KI (Feindverhalten, Pfadsuche und Ähnliches) operierte grundsätzlich innerhalb eines Rahmens, den Menschen zur Entwicklungszeit festgelegt hatten. Es gibt auch Anpassungen zur Laufzeit, etwa Systeme für dynamische Schwierigkeit oder den „AI Director" von Left 4 Dead (ein System, das den Stresspegel der Spieler beobachtet und Auftauchen und Verteilung der Gegner anpasst). Die Autoren ordnen diese jedoch als „Mechanismen ein, die lediglich aus vorab festgelegten bedingten Verzweigungen auswählen". Die Eigenschaft, dass sich der Bereich dessen, was ein Spieler bedeuten kann, zur Laufzeit selbst erweitert, fehlte dort.

Large Language Models (LLMs – mit großen Textmengen trainierte Systeme, die Sprache interpretieren und erzeugen) haben diese Voraussetzung verändert. Sie können die freien Worte eines Spielers interpretieren und an Ort und Stelle eine Antwort oder Geschichte generieren. Zugleich bringen sie jedoch Instabilität mit: brüchige Konsistenz, erfundene Fakten (Halluzination), Latenz, Sicherheitsrisiken und Kosten, die bei jedem Aufruf anfallen. Weil Spiele verlangen, dass „Regeln konstant bleiben, Reaktionen verlässlich sind und Zustände bestehen bleiben", schmerzt diese Instabilität besonders. Genau hier liegt das zentrale Problem dieses Papiers: wie sich die Freiheit der Generierung mit der Struktur des Spiels vereinbaren lässt.

Ansatz / Methode

Die Methode der Autoren beginnt damit, die Definition streng einzugrenzen. Ein „KI-natives Spiel" bezeichnet ein Spiel, bei dem generative KI der konstitutive Mechanismus ist, der die Kernschleife trägt, sodass das Kernspiel ohne diese KI nicht mehr funktionieren oder zu etwas völlig anderem würde. Die Beurteilung erfolgt über ein Gedankenexperiment (die Frage, was wäre, wenn diese KI nicht da wäre). Daraus ergeben sich drei notwendige Bedingungen: (1) generative KI ist zur Laufzeit vorhanden, (2) die Kernschleife hängt von dieser KI ab, (3) sie lässt sich nicht ohne Weiteres durch eine endliche Menge handgefertigten Materials oder einen festen Mechanismus ersetzen.

Diese drei Bedingungen bilden die Autoren in einer Kreuztabelle ab. Kreuzt man „Ist generative KI der Kern?" mit „Hat es überhaupt die Form eines Spiels mit Zielen, Regeln und Sieg/Niederlage?", ergeben sich vier Felder: KI-nativ / KI-unterstützt (KI ist vorhanden, aber der Kern überlebt auch ohne sie) / KI-Grenzfall (KI ist zentral, aber die Spielform ist dünn) / nicht relevant. Formeln kommen nicht vor – es ist schlicht ein Rahmen, den man mit Ja oder Nein beantwortet.

Auch das Sammeln war mühsam. Nicht nur wissenschaftliche Arbeiten, sondern auch Steam, itch.io, offizielle Websites und Angaben der Entwickler wurden durchsucht, um 93 Kandidaten zusammenzutragen; was zugänglich war, wurde tatsächlich ausprobiert, und was die Bedingungen nicht erfüllte, wurde ausgeschlossen, sodass am Ende 53 Werke übrig blieben. Jedes Werk wurde entlang sieben Dimensionen kodiert (Coding – die Arbeit, Merkmale in Klassifikationslabels zu überführen), etwa „Rolle der KI", „Schicht, in die die KI eingebettet ist", „Grad der Laufzeitabhängigkeit", „Form der Ein-/Ausgabe" und „wie die Generierung eingeschränkt wird". Daraus wurden induktiv (aus den Daten heraus entwickelt) zwei Klassifikationsachsen abgeleitet.

Ergebnisse

Die erste Achse ist der „Spieltyp (G)" und gliedert sich in neun Klassen. Am häufigsten ist das narrative Adventure (G1) mit 24 von 53 (45,3%), gefolgt von RPG (G2) mit 8 (15,1%) und Puzzle (G3) mit 7 (13,2%) (Quelle: Paper, Table IV, Figure 2). Danach folgt ein dünner, langer Schwanz. Die Autoren erklären, dass es naheliegend sei, dass sich Designs auf sprachzentrierte Typen konzentrieren, da Sprache die reifste Fähigkeit generativer KI sei.

Die zweite Achse ist der „dominierende KI-Mechanismus (N)" mit sechs Klassen. In absteigender Häufigkeit: epistemische Interaktion (N1 – Verhöre und Deduktion, die verborgene Informationen ans Licht bringen) mit 17 (32,1%), generative Erzählung / KI-Spielleiter (N3 – Fortsetzung der Erzählwelt je nach Eingabe) mit 14 (26,4%), soziale Beeinflussung (N2 – Überreden, Verhandeln mit oder Umstimmen von KI-Figuren) mit 11 (20,8%). Der Mechanismus, der der Regelebene am nächsten steht, die „semantische Entscheidung" (N4 – die KI entscheidet direkt, ob eine Handlung gültig ist), ist mit 6 (11,3%) selten, Multi-Agenten-Simulation (N5) und generative Konstruktion (N6) sind noch seltener (Quelle: Paper, Table V, Figure 3). N1 und N3 machen zusammen rund 60% des gesamten Korpus aus.

Kreuzt man die beiden Achsen, zeigt sich, dass dichte Kombinationen (narratives Adventure × epistemische Interaktion, Erzählung × KI-Spielleiter usw.) etablierte Muster sind, während die Zeile Beziehung/Begleiter (G8) und die Spalte generative Konstruktion (N6) fast leer bleiben – unerschlossenes Gebiet. Und was die Autoren immer wieder betonen: Je stabiler ein Werk ist, desto stärker bindet es generative KI an „klare Ziele, überprüfbare Zustände und nachvollziehbare Konsequenzen". Sie nennen dies „semantische Offenheit über mechanischen Invarianten". In meinen eigenen Worten liest sich das so: Man lässt die Spieler frei sprechen, rührt aber niemals an dem Gerüst, das diese Worte in Spielzustände übersetzt.

Anwendungsbereiche

Für Leute, die Rätsel entwickeln, halte ich den Rahmen der „semantischen Entscheidung (N4)" für am nützlichsten. Baut man beispielsweise ein Rätsel, das frei formulierte Zaubersprüche akzeptiert, rät das Papier davon ab, alles der KI zu überlassen: Stattdessen sollte das Ergebnis nach verborgenen Prinzipien wie Material, Absicht, Kosten, Risiko, Gegenmaßnahmen und Umgebung entschieden werden. Als konkretes Beispiel wird OneSpellFitsAll genannt, das frei erfundene Zaubersprüche nach verborgenen Kriterien bewertet. Der Schlüssel, um Willkür zu vermeiden, sei, dass Spieler sich eine „Theorie" darüber bilden können, wie der KI-Richter funktioniert.

Wer ein Verhör- oder Deduktionsspiel bauen will, für den ist „epistemische Interaktion (N1)" das etablierte Muster. Verdächtige dürfen frei antworten, aber ihr Wissen, ihre Motive und ihre Lügen müssen in einem verborgenen Fallmodell (einem im Hintergrund vorbereiteten Bauplan der Fakten) verwurzelt sein. Die Idee ist, die KI nicht als freien Sprechmund zu gestalten, sondern als Wächter, der eine verborgene Wahrheit schützt. Couch Detective und Vaudeville im Korpus fallen in diesen Typ.

Was in der Umsetzung wirkt, ist die Arbeitsteilung zwischen „Vorschlagen und Prüfen". Man lässt das Modell Dialoge, Ereignisse, Gegenstände und Regelinterpretationen „vorschlagen" und prüft Legalität, Konsistenz und Erreichbarkeit mit festen Mechanismen (einem Constraint-Solver oder einem simulierten Durchspielen, das testet, ob das Level wirklich lösbar ist); scheitert die Prüfung, fängt man dies mit Reparatur, erneuter Generierung, Rückfragen an den Spieler oder einem Ausweichen auf handverfasste Inhalte auf. Baute ich selbst hyperkasuale PCG (Procedural Content Generation, die automatische Erzeugung von Inhalten), würde ich daraus lesen: Erst diese Prüfstufe vorbereiten, bevor man sich an die Generierung wagt.

Auch die Ausführungen zu Kosten und Wartezeit sind praxisnah. Das Papier nennt als Beispiel Infinite Craft, das das Ergebnis einer einmal erzeugten Kombination speichert und wiederverwendet, und stellt fest: „Caching (das Speichern und Wiederverwenden eines einmal berechneten Ergebnisses) verwandelt flüchtige Generierung in dauerhaften Zustand." Auch Designs wie der Einsatz kleiner, rollenspezifischer lokaler Modelle werden angeführt: häufige, risikoarme Vorgänge dem lokalen Modell überlassen, nur seltene, folgenreiche Generierung dem großen Modell zuweisen. Wer ein Spiel baut, das zur Laufzeit ein Modell aufruft, dem sticht der Hinweis ins Auge, die Inferenzkosten von Anfang an als Designmaterial zu behandeln – nicht als „versteckte Rechnung".

Grenzen

Ich beginne mit den Schwächen, die die Autoren selbst einräumen. Es handelt sich um eine qualitative Werkanalyse, und sowohl der Umfang von 53 Werken als auch die neun- beziehungsweise sechsteilige Klassifikation beruhen auf der induktiven Kodierung der Autoren (eine Person kodierte, zwei prüften und einigten sich im Konsens). Je nach Granularität der Klassifikation können sich die Zahlen also verschieben – tatsächlich hält das Papier selbst offen, ob die Seltenheit von Beziehung/Begleiter (G8) eine echte Designlücke oder ein Artefakt der Kodierung ist. Auch die Feststellung, dass viele Werke noch im Early Access oder Prototypenstadium sind und dieses Feld eher ein Experimentierfeld als eine ausgereifte Kategorie ist, stammt von den Autoren selbst.

Ich selbst möchte zwei Punkte ergänzen. Erstens kann der Korpus zu öffentlichen, im englischsprachigen Raum leicht auffindbaren Steam- und itch.io-Werken tendieren; Werke aus dem japanischsprachigen Raum oder solche, die von außen schwer sichtbar sind, laufen Gefahr, übersehen zu werden. Zweitens verfügt das Papier noch nicht über Spielerstudien oder Kennzahlen, die Spaß messen – ein Maßstab für „ist es spielbar" wird nur als künftige Aufgabe genannt. Die Definition über das Gedankenexperiment ist elegant, aber wo genau die Grenze verläuft, ob „der Kern kollabiert", erfordert Urteilsvermögen. Auch möchte ich noch einmal betonen, dass es sich um einen noch nicht begutachteten Preprint mit kaum Zitationen handelt.

Fukais Lesart

Ich schreibe dies ausdrücklich als meine eigene Deutung. Ich möchte diese Studie weniger als Erweiterung von PCG lesen denn als Schaubild einer „Neuverteilung von Gestaltungsmacht". Herkömmliche Spiele legen den Großteil von Inhalt und Regeln vor der Veröffentlichung fest. KI-native Spiele geben einen Teil davon – Interpretation, Generierung, Entscheidung, Weltveränderung – an die Laufzeit ab. Die Arbeit des Designers verschwindet deshalb nicht, sondern verlagert sich hin zum Bauen von Einschränkungen, Schnittstellen, Prüfmechanismen, Gedächtnis und Ausweichstrategien. Im Vokabular der Designkritik ist das eine Verschiebung von „Regeln schreiben" zu „den Ort vorbereiten, an dem Regeln entstehen". Für einen Rätselautor liegt das wirklich Neue, so lese ich es, nicht darin, Antworten bereitzuhalten, sondern darin, die verborgenen Prinzipien so zu gestalten, dass die KI als Richter erlernbar und vorhersehbar handelt.

Zum Schluss

Für alle, die tiefer einsteigen möchten: Der Ausgangspunkt dieses Papiers ist der Begriff „KI-nativ", der in Yuqian Sun et al.s 1001 Nights vorgeschlagen wurde – die Idee, generative KI nicht als Randwerkzeug, sondern als Substanz des Spiels zu behandeln. Blickt man weiter in die Geschichte zurück, wird das interaktive Drama Façade von Mateas und Stern als Vorfahre genannt, das gezeigt hat, dass Sprache und Erzählung das Hauptmaterial von Spiel sein können. Liest man beides zusammen, entsteht eine Landkarte davon, woher die heutigen KI-nativen Spiele kommen.

Die Autoren verteilen die vollständige Liste der Klassifikation (53 Werke) als öffentlichen Korpus auf GitHub. Am schnellsten geht es als Fortsetzung dieses Artikels, Titel, die einen interessieren – Gandalf, OneSpellFitsAll, Infinite Craft, Vaudeville – tatsächlich selbst auszuprobieren. Auch ich habe heute Morgen, während ich mir einen kräftigen Filterkaffee aufgebrüht habe, ein paar davon geöffnet. Anfassen statt nur lesen lässt die Frage „würde es ohne die KI nicht funktionieren" im eigenen Körper spürbar werden.

Quellen

In diesem Artikel referenzierte Arbeiten und verwandte Materialien:

・AI Native Games: A Survey and Roadmap (Zhiyue Xu, Fandi Meng, Kaijie Xu, Clark Verbrugge, Simon Lucas, Jian Zhao, 2026, arXiv preprint 2607.00527)

・Der von den Autoren veröffentlichte Korpus KI-nativer Spiele (GitHub)

・Verwandte Arbeiten: das interaktive Drama „Façade" (Mateas & Stern) und „1001 Nights" (Yuqian Sun et al.) — Werke, die dieses Papier als gedankliche Vorfahren nennt

Reactions (no login)

Anonymous • one of each per visitor per day

関連シリーズ

Paper Digest第23回 / 全102回

Read next

Related reviews