RÉSUMÉ DE RECHERCHE · 2026-08-17

Lu et al. : le flow est-il fait de « difficulté » ou de « l'effort investi » ? — lecture de Fukai

Expérience de flow / effort mental / conception de la difficulté (psychologie)

Résumé en un paragraphe

Ajuster la difficulté au niveau du joueur le fait entrer en flow (cet état d'absorption où l'on oublie le temps) — c'est l'une des évidences les plus souvent citées en game design. L'article lu aujourd'hui cherche à y introduire une fissure. Est-ce la difficulté de la tâche elle-même qui met le flow en mouvement, ou bien la quantité d'effort que le joueur y investit réellement ? Jusqu'ici, les deux ont été traités comme un seul et même paquet.

Les auteurs ont utilisé une tâche de discrimination visuelle (deux images de grille présentées simultanément ; il faut juger si elles sont identiques ou si une case est décalée) pour faire varier séparément la « difficulté », via la finesse de la grille, et la « motivation à investir de l'effort », via une annonce préalable du pourcentage d'essais contenant une différence. L'EEG P300 était mesuré en parallèle. L'étude a été publiée dans la revue à comité de lecture Psychological Research (Springer, 2025).

Les résultats n'entrent pas dans un schéma simple. La manipulation de la difficulté a eu un effet puissant (taille d'effet ηp²=0.64), tandis que la manipulation de l'attente n'a eu aucun effet au niveau individuel et seulement un effet faible au niveau de l'essai (d=0.04 dans la condition difficile). Le flow a dessiné une forme de U inversé par rapport à la difficulté, mais à la limite de la significativité (p=0.053), et le P300 n'a montré absolument aucun rapport avec le flow (b=-0.003, p=0.97). Ce qu'il faut retenir n'est pas une conclusion, mais une carte : le simple mot « difficulté » se divise en au moins trois cadrans distincts.

Introduction

L'article s'intitule Disentangling the effects of task difficulty and effort on flow experience. Les auteurs sont Hairong Lu, Dimitri Van der Linden et Arnold B. Bakker, du département de psychologie industrielle et de gestion des personnes de l'Université de Johannesburg. Il est paru dans Psychological Research (Springer), volume 89, numéro 4, article 113, mis en ligne le 26 juin 2025, DOI 10.1007/s00426-025-02128-x. Ce n'est pas une prépublication arXiv, mais un article passé par la relecture par les pairs.

Je l'ai choisi parce que, pour qui publie un puzzle chaque jour, le placement de la difficulté est la variable de conception la plus déterminante, et je préfère ne pas prendre pour argent comptant le lieu commun psychologique qu'on invoque pour la justifier. Si je m'appuie sur une évidence reçue, je veux avoir lu l'étude qui est allée tester cette évidence elle-même. Cet article fait exactement cela : il introduit une seconde variable explicative dans le compte-rendu « adéquation entre défi et compétence » qui est au cœur de la recherche sur le flow.

Une réserve avant tout. C'est une expérience de laboratoire unique, avec 37 participants, et les auteurs eux-mêmes la présentent comme exploratoire. Aucune mention de préenregistrement (preregistration : publier hypothèses et plan d'analyse avant l'expérience, pour empêcher que l'interprétation change après avoir vu les résultats). Dans cet article, je maintiens la séparation entre ce qui a été démontré et ce qui ne l'a pas été.

Contexte

L'évidence reçue en recherche sur le flow est celle-ci : l'absorption naît lorsque le défi de la tâche s'ajuste à la compétence du joueur ; trop facile, on s'ennuie, trop difficile, on s'angoisse. Le flow trace donc un U inversé par rapport à la difficulté — élevé au milieu, faible aux deux extrémités. C'est la courbe que reproduisent la plupart des manuels de game design.

Mais une autre littérature dessine presque la même courbe : la recherche sur l'effort mental (mental effort, la quantité de force cognitive investie dans une tâche). Selon la théorie de l'intensité motivationnelle (motivational intensity theory : le cadre selon lequel l'effort continue d'augmenter avec la difficulté tant que la réussite semble atteignable, puis s'effondre net dès que la tâche est jugée impossible), l'effort trace lui aussi un U inversé par rapport à la difficulté. Les deux partagent même des marqueurs physiologiques comme la dilatation pupillaire.

Un problème surgit alors. Si le flow et l'effort culminent au même point sur l'axe de la difficulté et prennent la même forme, ce que nous avons expliqué par « le flow, parce que le défi correspondait à la compétence » pourrait en réalité être « le flow, parce que c'était le point où investir de l'effort était le plus facile ». La question des auteurs est de savoir si les deux peuvent être expérimentalement dissociés. Si l'on peut faire varier l'effort sans faire varier la difficulté, la séparation devient possible.

Approche / méthode

L'expérience suit un plan intra-sujet (within-subjects : chaque participant vit toutes les conditions), soit 3 (difficulté) × 2 (attente), six cellules. La tâche est une discrimination visuelle : deux images de grille composées de cases blanches et gris clair sont présentées simultanément, et il faut répondre si elles sont identiques ou décalées d'une case. La difficulté a été manipulée par la finesse de la grille — 2×2 (facile), 8×8 (intermédiaire), 14×14 (difficile). Plus la grille est fine, plus un décalage d'une case est difficile à repérer.

L'effort, lui, devait être manipulé sans changer la tâche elle-même. Les auteurs ont donc utilisé l'EPDD (expected probability of detecting differences : la probabilité annoncée à l'avance de trouver une différence). Une condition témoin annonçant « 50% des essais de ce bloc contiennent une différence », et une condition à forte attente annonçant « 80% ». La manipulation s'appuie sur l'idée de la valeur attendue du contrôle (expected value of control : plus les chances de succès perçues sont hautes, plus investir de l'effort est jugé rentable).

Quatre mesures. Le flow : une échelle à un seul item sur 10 points (« dans quelle mesure pensez-vous avoir été en état de flow ? », utilisée après un entretien préalable assurant que les participants comprenaient bien la notion). La difficulté perçue : une échelle à 7 niveaux de -3 à +3 (le défi correspondait-il à la compétence ?). L'effort : temps de réaction et taux de bonnes réponses. Et la physiologie : le P300 en EEG (un pic de l'activité cérébrale apparaissant environ 300 millisecondes après le stimulus, associé à l'allocation des ressources attentionnelles), relevé à l'électrode Pz dans une fenêtre de 300 à 400 millisecondes.

Les participants étaient 37 étudiants de premier cycle (29 femmes, âge moyen 19.87 ans, écart-type 1.78) — effectif obtenu après exclusion d'un participant pour perte de données EEG et d'un autre pour incompréhension de la notion de flow. Six blocs de cinq minutes ont été présentés dans un ordre randomisé. L'analyse a utilisé des modèles à effets mixtes (mixed-effects models : une méthode qui estime la tendance générale tout en absorbant les différences interindividuelles comme facteur aléatoire), avec correction pour les comparaisons multiples a posteriori.

Résultats

D'abord, les manipulations se sont bien séparées comme prévu. La difficulté perçue a varié fortement avec la finesse de la grille : F(180,2)=162.80, p<0.001, ηp²=0.64. La condition facile a paru plus facile que l'intermédiaire de d=1.24, et que la difficile de d=2.30. La manipulation de l'attente, en revanche, n'a pas fait varier la difficulté perçue (F(180,1)=0.85, p=0.36). Difficulté et attente ont fonctionné comme deux cadrans distincts. À noter : la cellule intermédiaire × forte attente s'est retrouvée presque exactement au point d'adéquation défi-compétence (moyenne -0.11, non significativement différente de zéro).

Et l'effort ? Au niveau individuel, le temps de réaction a varié de façon spectaculaire avec la difficulté (F(180,2)=1202.45, p<0.001, ηp²=0.93), tout comme le taux de bonnes réponses (F(180,2)=533.53, p<0.001, ηp²=0.86), mais l'effet principal de l'attente n'est pas apparu (temps de réaction : F(180,1)=1.69, p=0.195). Mais en montant à la granularité de l'essai (8,785 essais), l'effet de l'attente apparaît : F(1,8743.1)=11.93, p<0.001. Le détail compte : aucune différence dans la condition facile (p=0.436, d=0.01), la forte attente n'allongeant le temps de réaction que dans les conditions intermédiaire (p=0.005, d=0.05) et difficile (p=0.003, d=0.04). Les tailles d'effet sont extrêmement faibles.

Le flow, l'enjeu central, atteint une moyenne globale de 6.14 (écart-type 1.977, sur 10 points). Dans la condition d'attente témoin, une forme de U inversé par rapport à la difficulté était visible, mais à la limite de la significativité (coefficient quadratique b=-0.66, p=0.053). Dans la condition de forte attente, ce U inversé disparaît (b=-0.35, p=0.292). L'effet principal de la difficulté n'atteint pas non plus la significativité (F(2,180)=2.63, p=0.074), et comparer forte attente et témoin dans la condition difficile donne t(36)=1.69, p=0.099, d=0.28 — non significatif. Les auteurs écrivent que le flow « semblait suivre le mouvement de l'effort », tout en précisant explicitement que l'interaction n'était pas significative.

Côté physiologique, c'est un échec net. Le P300 n'a montré aucun U inversé par rapport à la difficulté, ni en condition témoin ni en forte attente (p=0.706 / p=0.140), et aucun rapport avec le flow (b=-0.003, p=0.97). Les auteurs, tout en notant que des résultats nuls similaires ont déjà été rapportés dans certaines études antérieures, présentent ce résultat comme remettant en question les hypothèses sur les corrélats neuronaux du flow.

Applications possibles

Premièrement, la manière de traiter les indicateurs de difficulté. Un affichage du type « taux de réussite du jour : 68% » est un outil qui, sans toucher au plateau, ne fait bouger que les chances perçues de réussite. Ce que cette étude suggère, c'est que ce type de manipulation de l'attente n'a presque pas d'effet au niveau du bloc, et n'a qu'un effet faible au niveau de l'essai. Si c'est le cas, une seule bannière avant de commencer serait un levier plus faible qu'un retour qui se met à jour pendant la résolution — cases qui se confirment, candidats qui diminuent, coups restants qui deviennent visibles.

Deuxièmement, la conception des indices. Si je concevais un Sokoban-like, je placerais l'indice qui confirme la stratégie (« cette caisse se déplace en dernier ») avant l'indice qui fait le travail à la place du joueur (« déplace cette caisse ici »). Le premier réduit l'effort lui-même ; le second maintient le volume d'effort tout en augmentant seulement le sentiment que la réussite est atteignable. Dans le cadre de cet article, seul le second correspond à une intervention qui relève l'EPDD. En tenant compte de la petitesse des tailles d'effet, la direction reste digne d'être testée.

Troisièmement, la granularité de mesure en playtest. La leçon la plus pratique de cet article est peut-être que la même manipulation était invisible au niveau individuel et visible au niveau de l'essai. Si j'évaluais une modification apportée à un puzzle quotidien, je ferais du journal de comportement fin — temps par coup, nombre de retours en arrière, point d'abandon — l'indicateur principal, et je reléguerais l'unique question « avez-vous aimé aujourd'hui ? » à un rôle secondaire.

Quatrièmement, le placement de la courbe de difficulté. Dans cette expérience, la cellule la plus proche de l'adéquation défi-compétence était la difficulté intermédiaire combinée à une forte attente (difficulté perçue moyenne de -0.11). Pour un système de PCG (Procedural Content Generation, génération automatique de contenu) hypercasual ajustant la difficulté à la volée, viser le centre du taux de réussite puis y superposer un signal « c'est faisable » constitue, du moins dans ces conditions, un placement en deux étapes qui n'a rien de forcé.

Limites

Les auteurs eux-mêmes reconnaissent de nombreuses faiblesses. Avoir manipulé l'attente au niveau du bloc a pu diluer son influence essai par essai, ce qui expliquerait la petitesse des tailles d'effet. La valeur de 50% en condition témoin était déjà élevée, et un effet de plafond a pu masquer des différences qu'une attente plus basse aurait révélées. L'effectif de 37 participants a été fixé, comme ils l'indiquent eux-mêmes, par des contraintes pratiques et non par une analyse de puissance. Le diamètre pupillaire s'est révélé inutilisable en raison de la nature de la tâche (temps de traitement longs, mouvements oculaires fréquents), ce qui a réduit la mesure physiologique au seul P300. Et, globalement, les auteurs qualifient eux-mêmes les résultats de « préliminaires, quoique nouveaux ».

Ce que Fukai relève ici, c'est d'abord l'alignement des valeurs p. Les résultats principaux se regroupent à 0.053, 0.074, 0.099, à la limite de la significativité. Isolée, une telle valeur pourrait passer pour un hasard ; alignées ainsi, la lecture exacte est plutôt « un effet existe peut-être, mais cet échantillon n'a pas permis de le confirmer ». Ce n'est en tout cas pas matière à affirmer que « le flow se décide par l'effort et non par la difficulté ». Même l'effet de l'attente devenu significatif au niveau de l'essai reste d'une taille de d=0.04 à 0.05 — difficile à qualifier de perceptible en pratique.

Autre point, la nature de la tâche. La tâche de cette expérience est une discrimination visuelle abstraite, sans récit, sans objectif, sans regard d'autrui. Le flow qui naît dans un jeu de puzzle repose en grande partie sur ce que signifie le fait d'avoir résolu quelque chose, et je serais prudent avant de rapporter tel quel, vers la conception d'un puzzle quotidien, un flow mesuré sur une tâche qui a retiré cet élément. Les participants étaient en outre 37 étudiants de premier cycle d'une même université, d'un âge moyen de 19.87 ans — une population qui ne recoupe pas un lectorat de résolveurs ordinaire.

Dans l'ensemble, on peut résumer que cet article a de la valeur en ce qu'il montre qu'une expérience séparant flow et effort peut être construite, mais qu'il n'établit pas encore ce que donne cette séparation. En l'absence de préenregistrement mentionné, et les auteurs eux-mêmes qualifiant leur étude d'exploratoire, il est raisonnable de traiter ces résultats comme une hypothèse jusqu'à ce qu'une réplication paraisse. Au vu des problèmes de reproductibilité en psychologie, cette prudence n'a rien d'excessif.

La lecture de Fukai

À partir d'ici, c'est mon interprétation. Je voudrais situer cette étude dans le mouvement plus large qui consiste à décomposer une variable de conception longtemps compressée dans le seul mot « difficulté ». La dureté de la tâche, l'effort que le joueur y investit réellement, et le sentiment que la chose est solvable — sur le terrain de la conception, ces trois éléments ont longtemps été traités comme un seul cadran. Ce que propose cet article, je crois, n'est pas une conclusion, mais une carte montrant qu'il existe au moins trois cadrans. Dans le vocabulaire de la critique de conception, régler la difficulté relève moins de rendre la tâche plus facile que de concevoir les conditions qui font juger au joueur que l'effort vaut la peine d'être investi. Cette lecture, il faut le préciser, n'est pas ce que l'article lui-même démontre.

Pour conclure

Pour qui veut aller plus loin, je recommande de lire ce texte en parallèle avec l'étude publiée par Strojny et ses collègues en 2023 dans PLOS ONE. Elle teste la théorie de l'intensité motivationnelle sur un jeu réel (Icy Tower), avec 39 participants confrontés à quatre niveaux de difficulté. Sa conclusion : l'engagement augmente avec la difficulté tant que la tâche reste réalisable, puis chute brutalement dès qu'elle devient inatteignable. Elle observe, du côté d'un jeu réel, le même cadre que l'article d'aujourd'hui traite avec une tâche abstraite de laboratoire. Mises côte à côte, les deux études dessinent une carte de ce que l'on comprend, et de ce que l'on ne comprend pas encore, dans la relation entre difficulté, effort et engagement.

La recherche sur le flow elle-même s'étend sur plusieurs décennies, et l'article du jour n'y introduit qu'un test dans un coin de cet ensemble. C'est pourquoi lire ce seul texte et en conclure que la nature du flow est désormais établie serait une erreur. La lecture exacte, je crois, est que ce que nous avons regroupé sous le mot « flow » commence à être décomposé par des mains expérimentales. Ce que peuvent faire ceux qui construisent des puzzles, c'est vérifier ces résultats intermédiaires de démontage sur leurs propres plateaux.

Références

Articles et documents cités dans cet article :

・Disentangling the effects of task difficulty and effort on flow experience (Hairong Lu, Dimitri Van der Linden, Arnold B. Bakker, 2025, Psychological Research 89(4), Article 113 / évalué par les pairs)

・DOI : 10.1007/s00426-025-02128-x

・Version en libre accès du même article (PubMed Central, PMC12202627)

・Étude connexe : Player involvement as a result of difficulty: An introductory study to test the suitability of the motivational intensity approach to video game research (Paweł Strojny, Agnieszka Strojny, Krzysztof Rębilas, 2023, PLOS ONE)

Reactions (no login)

Anonymous • one of each per visitor per day

Learn — Curriculum

LearnPartie 4 Difficulty — Designing the Learning Curve and FailureChapitre 12 Measuring Difficulty6 / 10

関連シリーズ

Paper Digest第60回 / 全99回

Read next