PAPER-DIGEST · 2026-08-17

Lu et al.: Entsteht Flow durch „Schwierigkeit“ oder durch den „investierten Aufwand“? — Fukai liest

Flow-Erleben / mentaler Aufwand / Schwierigkeitsdesign (Psychologie)

Zusammenfassung in einem Absatz

Passt man die Schwierigkeit an das Können der spielenden Person an, tritt Flow ein — jener Zustand versunkener, zeitvergessender Konzentration. Das ist eine der am häufigsten zitierten Grundannahmen im Game-Design. Das heute besprochene Paper versucht, in diese Annahme einen Schnitt zu setzen. Wird Flow von der Schwierigkeit der Aufgabe selbst angetrieben, oder von der Menge an Aufwand, den die spielende Person dabei tatsächlich investiert? Bislang wurden beide als ein Bündel behandelt.

Die Autor:innen verwendeten eine visuelle Diskriminationsaufgabe (zwei Gitterbilder werden gezeigt, und die Testperson beurteilt, ob sie identisch sind oder sich um ein verschobenes Feld unterscheiden). Die Feinheit des Gitters variierte die „Schwierigkeit“, eine vorab angekündigte Prozentzahl an Trials mit Unterschied variierte das „Motiv, Aufwand zu investieren“ — beides getrennt voneinander. Zugleich wurde das EEG-P300 gemessen. Die Studie erschien in der peer-reviewten Fachzeitschrift Psychological Research (Springer, 2025).

Die Ergebnisse passten in kein einfaches Schema. Die Schwierigkeitsmanipulation wirkte massiv (Effektstärke ηp²=0.64), während die Erwartungsmanipulation auf individueller Ebene keine Wirkung zeigte und nur auf Trial-Ebene schwach wirkte (d=0.04 in der schwierigen Bedingung). Flow zeigte gegenüber der Schwierigkeit ein umgekehrtes U, allerdings nur grenzwertig (p=0.053), und P300 zeigte überhaupt keinen Zusammenhang mit Flow (b=-0.003, p=0.97). Mitzunehmen ist keine Schlussfolgerung, sondern eine Landkarte: Das eine Wort „Schwierigkeit“ zerfällt in mindestens drei getrennte Regler.

Einleitung

Der Titel des Papers lautet Disentangling the effects of task difficulty and effort on flow experience. Die Autor:innen sind Hairong Lu, Dimitri Van der Linden und Arnold B. Bakker, angesiedelt am Department of Industrial Psychology and People Management der University of Johannesburg. Erschienen ist es in Psychological Research (Springer), Band 89, Ausgabe 4, Artikel-Nr. 113, Online-Veröffentlichung am 26. Juni 2025, DOI 10.1007/s00426-025-02128-x. Kein arXiv-Preprint, sondern ein Paper, das den Peer-Review durchlaufen hat.

Ich habe dieses Paper ausgewählt, weil für jemanden, der täglich Rätsel herausbringt, die Platzierung der Schwierigkeit die größte Designvariable ist — und ich die psychologische Grundannahme, auf die man sich dabei gewöhnlich beruft, nicht einfach ungeprüft glauben möchte. Wenn ich mich schon auf eine Grundannahme stütze, will ich die Studie gelesen haben, die diese Annahme selbst geprüft hat. Genau das tut dieses Paper: Es schiebt eine zweite erklärende Variable in die im Zentrum der Flow-Forschung stehende Erklärung des „Passung von Herausforderung und Können“.

Vorab jedoch ein Vorbehalt. Es handelt sich um ein einzelnes psychologisches Laborexperiment mit 37 Teilnehmenden, das die Autor:innen selbst als explorativ einordnen. Auch ein Hinweis auf ein Preregistration (das vorherige Veröffentlichen von Hypothesen und Analyseplänen vor dem Experiment, um zu verhindern, dass Interpretationen erst nach Sichtung der Ergebnisse angepasst werden) fehlt. In diesem Artikel trenne ich, was gezeigt wurde, von dem, was noch nicht gezeigt wurde.

Hintergrund

Die gängige Annahme der Flow-Forschung lautet so: Versinken entsteht, wenn die Herausforderung der Aufgabe mit dem Können der spielenden Person im Gleichgewicht steht; ist die Aufgabe zu leicht, entsteht Langeweile, ist sie zu schwer, entsteht Angst. Flow zeichnet also gegenüber der Schwierigkeit ein umgekehrtes U (hoch in der Mitte, niedrig an beiden Enden). Genau diese Kurve zitieren die meisten Lehrbücher des Game-Designs.

Doch es gibt eine andere Forschungslinie, die fast dieselbe Kurve zeichnet: die Forschung zum mentalen Aufwand (mental effort, die Menge an geistiger Kraft, die in eine Aufgabe investiert wird). Nach der Theorie der motivationalen Intensität (motivational intensity theory — dem Rahmen, wonach der Aufwand weiter steigt, solange der Erfolg trotz Schwierigkeit erreichbar erscheint, und in dem Moment abrupt einbricht, in dem die Aufgabe als unmöglich eingeschätzt wird) zeichnet auch der Aufwand gegenüber der Schwierigkeit ein umgekehrtes U. Beide teilen sich sogar physiologische Marker wie die Pupillenerweiterung.

Daraus ergibt sich ein Problem. Wenn Flow und Aufwand am selben Punkt der Schwierigkeitsachse denselben Gipfel bilden, könnte das, was wir bisher als „Flow, weil Herausforderung und Können zusammenpassten“ erklärt haben, in Wirklichkeit „Flow, weil dort am leichtesten Aufwand zu investieren war“ sein. Die Frage der Autor:innen lautet, ob sich beide experimentell trennen lassen. Kann man den Aufwand bewegen, ohne die Schwierigkeit zu verändern, wird die Trennung möglich.

Ansatz / Methode

Das Experiment folgte einem Within-Subjects-Design (dieselben Teilnehmenden erleben alle Bedingungen): 3 (Schwierigkeit) × 2 (Erwartung), also sechs Zellen. Die Aufgabe war eine visuelle Diskrimination: Zwei Gitterbilder aus weißen und hellgrauen Feldern werden gleichzeitig gezeigt, und die Testperson beurteilt, ob sie identisch sind oder um ein verschobenes Feld abweichen. Die Schwierigkeit wurde über die Feinheit des Gitters manipuliert — 2×2 (leicht), 8×8 (mittel), 14×14 (schwer). Je feiner das Gitter, desto schwerer ist eine Verschiebung um ein Feld zu erkennen.

Der Aufwand musste dagegen bewegt werden, ohne die Aufgabe selbst zu verändern. Dafür nutzten die Autor:innen EPDD (expected probability of detecting differences — die vorab mitgeteilte Wahrscheinlichkeit, mit der ein Unterschied gefunden werden kann). In der Kontrollbedingung wurde mitgeteilt, dass 50% der Trials in diesem Block einen Unterschied enthielten; in der Hocherwartungsbedingung waren es 80%. Die Manipulation folgt dem Gedanken der Kontrollwerterwartung (expected value of control): Je höher die eingeschätzte Erfolgsaussicht, desto eher gilt der Aufwand als lohnend.

Gemessen wurde Viererlei. Flow: eine 10-Punkte-Skala mit einem einzelnen Item („Wie stark, glauben Sie, waren Sie im Flow-Zustand?“), eingesetzt nach einem vorherigen Gespräch, in dem die Bedeutung von Flow den Teilnehmenden erklärt wurde. Subjektive Schwierigkeit: eine 7-stufige Skala von -3 bis +3 (passt die Aufgabe zum eigenen Können?). Als Stellvertreter für Aufwand: Reaktionszeit und Trefferquote. Und als physiologisches Maß: das EEG-P300 (ein etwa 300 Millisekunden nach dem Stimulus auftretender Gipfel der Gehirnwelle, der mit der Zuteilung von Aufmerksamkeitsressourcen in Verbindung gebracht wird), erfasst an der Pz-Elektrode im Zeitfenster 300–400 Millisekunden.

Teilnehmende waren 37 Studierende (29 weiblich, Durchschnittsalter 19.87 Jahre, SD 1.78) — diese Zahl gilt nach Ausschluss einer Person wegen fehlender EEG-Daten und einer weiteren, die den Begriff Flow missverstanden hatte. Sechs fünfminütige Blöcke wurden in randomisierter Reihenfolge durchgeführt. Die Analyse erfolgte über gemischte Modelle (ein Verfahren, das den allgemeinen Trend schätzt, während individuelle Unterschiede zwischen Teilnehmenden als Zufallsfaktor absorbiert werden), und für die Post-hoc-Vergleiche wurde eine Korrektur für multiples Testen angewendet.

Befunde

Zunächst: Die Manipulationen ließen sich wie beabsichtigt trennen. Die subjektive Schwierigkeit verschob sich stark mit der Feinheit des Gitters, F(180,2)=162.80, p<0.001, Effektstärke ηp²=0.64. Die leichte Bedingung wurde gegenüber der mittleren um d=1.24 und gegenüber der schweren um d=2.30 als leichter empfunden. Die Erwartungsmanipulation dagegen bewegte die subjektive Schwierigkeit nicht (F(180,1)=0.85, p=0.36). Schwierigkeit und Erwartung funktionierten also als getrennte Regler. Hinzuzufügen ist, dass die Zelle mittel × hohe Erwartung fast genau auf dem Punkt landete, an dem „Können und Herausforderung im Gleichgewicht“ sind (Mittelwert -0.11, nicht signifikant von null verschieden).

Wie steht es um den Aufwand? Auf individueller Ebene bewegte sich die Reaktionszeit dramatisch mit der Schwierigkeit (F(180,2)=1202.45, p<0.001, ηp²=0.93), ebenso die Trefferquote (F(180,2)=533.53, p<0.001, ηp²=0.86), doch ein Haupteffekt der Erwartung blieb aus (Reaktionszeit: F(180,1)=1.69, p=0.195). Erhöht man jedoch die Granularität auf Trial-Ebene (8,785 Trials), tritt der Erwartungseffekt hervor: F(1,8743.1)=11.93, p<0.001. Sieht man sich die Aufschlüsselung an, gab es in der leichten Bedingung keinen Unterschied (p=0.436, d=0.01), und nur in der mittleren (p=0.005, d=0.05) und der schweren Bedingung (p=0.003, d=0.04) erhöhte die hohe Erwartung die Reaktionszeit. Die Effektstärken sind äußerst klein.

Der entscheidende Punkt, Flow, lag im Gesamtmittel bei 6.14 (SD 1.977, auf einer 10-Punkte-Skala). In der Kontroll-Erwartungsbedingung war eine umgekehrte U-Form gegenüber der Schwierigkeit erkennbar, jedoch nur grenzwertig (quadratischer Koeffizient b=-0.66, p=0.053). In der Hocherwartungsbedingung verschwand dieses umgekehrte U (b=-0.35, p=0.292). Auch der Haupteffekt der Schwierigkeit erreichte keine Signifikanz (F(2,180)=2.63, p=0.074), und selbst der Vergleich von hoher Erwartung mit der Kontrollbedingung in der schweren Bedingung war mit t(36)=1.69, p=0.099, d=0.28 nicht signifikant. Die Autor:innen schreiben, die Bewegung von Flow habe die Bewegung des Aufwands nachzuzeichnen geschienen, halten aber ausdrücklich fest, dass die Interaktion nicht signifikant war.

Das physiologische Maß war ein klarer Fehlschlag. P300 zeigte weder in der Kontroll- noch in der Hocherwartungsbedingung ein umgekehrtes U gegenüber der Schwierigkeit (p=0.706 / p=0.140), und auch keinen Zusammenhang mit Flow (b=-0.003, p=0.97). Die Autor:innen weisen darauf hin, dass ähnliche Null-Befunde auch in Teilen früherer Studien berichtet wurden, und ordnen das Ergebnis als eines ein, das die Annahmen über die neuronalen Korrelate von Flow infrage stellt.

Anwendungsbereiche

Erstens, der Umgang mit Schwierigkeitsanzeigen. Eine Anzeige wie „heutige Lösequote: 68%“ ist ein Werkzeug, das ausschließlich die eingeschätzte Erfolgsaussicht bewegt, ohne das Spielfeld selbst zu verändern. Diese Studie legt nahe, dass eine solche Erwartungsmanipulation auf Block-Ebene kaum wirkt und nur auf Trial-Ebene schwach wirkt. Wenn dem so ist, lässt sich daraus lesen, dass eine Rückmeldung, die während des Lösens laufend aktualisiert wird — mehr feststehende Felder, weniger Kandidaten, sichtbare verbleibende Züge — die Erwartung leichter bewegt als ein einmaliges Banner vor Beginn.

Zweitens, die Gestaltung von Hinweisen. Würde ich ein Sokoban-like bauen, würde ich einen Hinweis, der die Herangehensweise bestätigt („diese Kiste wird zuletzt bewegt“), vor einen Hinweis stellen, der die Arbeit übernimmt („diese Kiste hierhin“). Ersterer verringert den eigentlichen Aufwand, Letzterer erhöht nur die eingeschätzte Erfolgsaussicht, während der Aufwand erhalten bleibt. Im Rahmen dieser Studie entspricht Letzteres einem Eingriff, der EPDD erhöht. Angesichts der kleinen Effektstärken lohnt es sich als Richtung, ausprobiert zu werden, mehr aber auch nicht.

Drittens, die Messgranularität von Playtests. Die praktischste Lehre dieses Papers liegt vielleicht darin, dass ein und dieselbe Manipulation auf individueller Ebene unsichtbar, auf Trial-Ebene aber sichtbar war. Würde ich eine Änderung an einem Daily Puzzle bewerten, würde ich feingranulare Verhaltensprotokolle — Zeit pro Zug, Anzahl der Rücknahmen, Abbruchpunkte — zum Hauptmaß machen, statt nur eine einzelne Frage wie „hat es heute Spaß gemacht“ zu erheben und auszuwerten. Die subjektive Skala rückt dabei in eine unterstützende Rolle.

Viertens, die Platzierung der Schwierigkeitskurve. Am nächsten an dem Punkt „Können und Herausforderung im Gleichgewicht“ lag in diesem Experiment die Bedingung mittlere Schwierigkeit plus hohe Erwartung (subjektive Schwierigkeit im Mittel -0.11). Für eine Hypercasual-PCG (Procedural Content Generation, automatische Erzeugung von Inhalten), die die Schwierigkeit laufend anpasst, wäre demnach eine zweistufige Anordnung — auf die Mitte der Lösequoten-Verteilung zielen und darüber ein Signal „das ist lösbar“ legen — unter diesen Bedingungen zumindest keine unvernünftige Platzierung.

Grenzen

Die Autor:innen selbst nennen zahlreiche Schwächen. Da die Erwartungsmanipulation auf Block-Ebene erfolgte, könnte sich ihr trialweiser Effekt verdünnt haben, was die kleinen Effektstärken erklären könnte. Der Wert von 50% in der Kontrollbedingung war bereits hoch, sodass ein Deckeneffekt einen Unterschied zu einer niedrigeren Erwartungsbedingung verdeckt haben könnte. Die Stichprobengröße von 37 sei, wie ausdrücklich angegeben, nicht durch eine Poweranalyse, sondern durch praktische Erwägungen bestimmt worden. Der Pupillendurchmesser war aufgrund der Natur der Aufgabe (lange Verarbeitungszeiten, häufige Augenbewegungen) nicht nutzbar, wodurch P300 das einzige physiologische Maß blieb. Und insgesamt beschreiben die Autor:innen die Ergebnisse selbst nur als „vorläufige, aber neue Hinweise“.

Was ich, Fukai, hier anmerken möchte, ist zunächst die Reihe der p-Werte. Die zentralen Ergebnisse häufen sich bei 0.053, 0.074 und 0.099 — allesamt grenzwertig. Ein einzelner solcher Wert ließe sich als Zufall abtun, doch bei einer solchen Häufung ist die genauere Lesart: „Ein Effekt mag existieren, aber diese Stichprobe konnte ihn nicht sicher belegen.“ Das ist jedenfalls kein Material, um zu behaupten, Flow werde nicht durch Schwierigkeit, sondern durch Aufwand bestimmt. Auch der auf Trial-Ebene signifikant gewordene Erwartungseffekt liegt mit d=0.04 bis 0.05 in einer Effektstärke, die man in der Praxis kaum als spürbar bezeichnen kann.

Ein weiterer Punkt ist die Natur der Aufgabe. Die Aufgabe in diesem Experiment ist eine abstrakte visuelle Diskrimination — ohne Erzählung, ohne Ziel, ohne Blick anderer. Der Flow, der in Puzzlespielen entsteht, wird zu einem großen Teil von der „Bedeutung des Gelösten“ getragen, und ich möchte vorsichtig sein, den bei einer Aufgabe gemessenen Flow, aus der genau dieser Anteil entfernt wurde, unverändert auf ein Daily Puzzle zu übertragen. Hinzu kommt, dass die Teilnehmenden 37 Studierende derselben Universität waren, Durchschnittsalter 19.87 Jahre — keine Population, die sich mit einer allgemeinen Löserschaft überschneidet.

Insgesamt lässt sich sagen: Der Wert dieses Papers liegt darin, gezeigt zu haben, dass sich ein Experiment zur Trennung von Flow und Aufwand konstruieren lässt — nicht darin, festgestellt zu haben, wie diese Trennung im Ergebnis ausfällt. Da kein Preregistration angegeben ist und die Autor:innen die Studie selbst als explorativ einordnen, ist es angemessen, die Befunde bis zu einer Replikation als Hypothese zu behandeln. Angesichts der Replikationsprobleme in der Psychologie ist diese Zurückhaltung sicher nicht übertrieben.

Fukais Lesart

Ab hier folgt meine eigene Interpretation. Ich möchte diese Studie in die Bewegung einordnen, die die in das eine Wort „Schwierigkeit“ gepresste Designvariable zerlegt. Die Schwierigkeit der Aufgabe selbst, der Aufwand, den die spielende Person tatsächlich investiert, und die Erfolgsaussicht — in der Design-Praxis wurden diese drei stets als ein einziger Regler behandelt. Was dieses Paper vorlegt, ist meiner Lesart nach keine Schlussfolgerung, sondern eine Landkarte, die zeigt, dass es mindestens drei Regler gibt. Im Vokabular der Designkritik gesprochen, geht es beim Schwierigkeitsdesign weniger darum, die Aufgabe leichter zu machen, als eher darum, die Bedingungen zu gestalten, unter denen die spielende Person den investierten Aufwand für lohnend hält. Diese Lesart selbst ist allerdings nicht das, was dieses Paper belegt hat.

Zum Schluss

Wer tiefer einsteigen möchte, dem empfehle ich zusätzlich die 2023 in PLOS ONE veröffentlichte Studie von Strojny und Kolleg:innen. Sie prüft die Theorie der motivationalen Intensität an einem tatsächlichen Spiel (Icy Tower) mit 39 Teilnehmenden über vier Schwierigkeitsstufen. Ihr Fazit: Das Engagement steigt mit der Schwierigkeit, solange die Aufgabe erreichbar bleibt, und fällt scharf ab, sobald sie unerreichbar wird. Sie betrachtet von der Seite eines echten Spiels aus denselben Rahmen, den das heutige Paper mit einer abstrakten Laboraufgabe behandelt hat. Legt man beide Studien nebeneinander, ergibt sich eine Landkarte, bis wohin die Beziehung zwischen Schwierigkeit, Aufwand und Engagement verstanden ist — und wo dieses Verständnis endet.

Die Flow-Forschung selbst hat eine jahrzehntelange Geschichte, und das heutige Paper setzt nur an einer Stelle davon eine Prüfung an. Genau deshalb wäre es ein Irrtum, aus diesem einen Paper zu schließen, das Wesen von Flow sei nun geklärt. Richtiger ist meines Erachtens die Lesart, dass das, was bisher unter dem Wort „Flow“ zusammengefasst wurde, gerade beginnt, durch experimentelle Hände zerlegt zu werden. Was diejenigen, die Rätsel bauen, tun können, ist, die Zwischenergebnisse dieser Zerlegung an ihrem eigenen Spielfeld zu überprüfen.

Quellen

In diesem Artikel referenzierte Paper und begleitende Materialien:

・Disentangling the effects of task difficulty and effort on flow experience (Hairong Lu, Dimitri Van der Linden, Arnold B. Bakker, 2025, Psychological Research 89(4), Article 113 / peer-reviewed)

・DOI: 10.1007/s00426-025-02128-x

・Open-Access-Fassung desselben Papers (PubMed Central, PMC12202627)

・Verwandte Studie: Player involvement as a result of difficulty: An introductory study to test the suitability of the motivational intensity approach to video game research (Paweł Strojny, Agnieszka Strojny, Krzysztof Rębilas, 2023, PLOS ONE)

Reactions (no login)

Anonymous • one of each per visitor per day

Learn — Curriculum

LearnTeil 4 Difficulty — Designing the Learning Curve and FailureKapitel 12 Measuring Difficulty6 / 10

関連シリーズ

Paper Digest第60回 / 全99回

Read next