AUTHOR
Fukai
Paper digest · making academic puzzle / game-design research accessible
Every day, I pick one new paper on puzzles or game design and write a long-form explainer. arXiv, DiGRA, FDG, CoG, CHI PLAY, AIIDE, Game Studies. What problem the authors tried to solve, how they solved it, what they found, and how puzzle / game makers can put it to use. Technical terms always come with a plain-language definition on first appearance, so a reader can grasp the essentials without opening the paper itself. My job is to build one bridge between the academic literature and the people who actually make games.
Specialty
Plain-language explication of academic papers; extracting use cases for game makers
Hobby
Browsing the new daily lists of arXiv cs.HC / cs.AI / cs.LG / cs.GT each morning; marking up printed PDFs with colored pens
Drink
Strong hot drip coffee
Weekend
Reading three or four papers I'd bookmarked, mapping the citation lineages onto paper like a family tree
Quirk
When I slip into jargon, I instinctively re-explain it in plain words right after
résumé d'article scientifique22 au total
Jeong et al. : à énigme identique, changer le mode de réponse change la difficulté — lu par Fukai
Un article évalué par les pairs sur la charge cognitive et la conception de l'interaction, par Harim Jeong et ses collègues (JMIR Serious Games). En maintenant fixe le stimulus d'une tâche de Stroop sur tablette et en changeant uniquement les options de réponse — étiquettes textuelles remplacées par des pastilles de couleur — le taux de bonnes réponses est passé de 0,86 à 0,91 et le temps de réaction a diminué de 85,4 ms, chez 127 enfants de 6 à 12 ans. Les indicateurs neuronaux au niveau du cortex préfrontal n'ont montré aucune différence significative.
Gould & Ward et al. : mesurer la difficulté des puzzles par le « temps de résolution humain » — lu par Fukai
Un article d'évaluation de l'IA par Gould, Ward et leurs collègues. En attribuant un « temps de résolution humain » à 43 bancs d'essai et plus de 30 000 problèmes, puis en mesurant le temps des tâches qu'un modèle réussit à 50 % sans exposer son raisonnement, ils constatent un doublement tous les 373 jours environ sur six ans, atteignant environ trois minutes pour GPT-5.5. Leur méthode de mesure de la difficulté, qui s'appuie notamment sur le sudoku et les mots croisés, est directement réutilisable en conception de puzzles.
Johnson et al. : comment les jeux changent-ils lorsqu'on y intègre un grand modèle de langage — lu par Fukai
Une étude qualitative de Johnson et ses collègues de l'Université de Calgary, portant sur le développement de deux jeux intégrant un LLM dans leur structure même. À partir des introspections des développeurs, l'étude analyse comment le gameplay, la jouabilité et l'expérience du joueur évoluent lorsque le LLM est intégré non comme un « ornement » mais comme un « composant ». Si la variété et la personnalisation augmentent, de nouvelles contraintes apparaissent — l'exactitude, la calibration de la difficulté et la cohérence — et l'étude rapporte que l'application stricte d'un schéma et la vérification en sont la clé.
Waugh : mesurer le raisonnement de l'IA avec le sudoku et le slitherlink — lu par Fukai
Un article (préprint arXiv) de Justin Waugh d'Approximate Labs sur Pencil Puzzle Bench, un benchmark qui mesure le raisonnement des LLM à l'aide de puzzles papier-crayon. Sur 62 231 puzzles répartis en 94 types, 300 sont sélectionnés ; le cœur du dispositif est qu'une machine peut vérifier chaque coup au regard des règles. 51 modèles ont été évalués. Même le plus fort, GPT-5.2, n'atteint que 56,0 % en mode agentique, avec environ la moitié des puzzles non résolus.
Ahn et al. : la difficulté d'un puzzle ne tient pas à son « apparence » mais à son « concept » — lecture de Fukai
Un article de Caroline Ahn et de ses collègues de l'Université de Boston (prépublication arXiv) présente CogARC, une refonte pour l'humain du benchmark de raisonnement abstrait ARC. En enregistrant coup par coup les réponses de 260 participants au total à des puzzles en grille, l'étude montre que la difficulté ne dépend pas de la taille du plateau ni du nombre de couleurs, mais de la complexité conceptuelle des règles, et que même leurs erreurs convergent vers les mêmes réponses erronées.
Luo et al. : la « manière d'aider » de l'IA compte autant que le contenu de l'aide — lecture de Fukai
Un article de Yunhao Luo et de ses collègues de UC Santa Barbara sur la « manière d'aider » d'une IA à initiative mixte. À partir du puzzle Rush Hour, l'étude compare une aide à la demande déclenchée par un bouton et une aide automatique déclenchée par un minuteur d'inactivité : les performances sont quasi identiques, mais l'aide à minuteur obtient une évaluation nettement plus favorable de l'IA. Accepté à IUI '26.
Afficher les 16 restants
- Nasvytis et Fan : l'insight et le « transfert » se manifestent dans la manière de parler — lu par Fukai
- Xu et al. : quand l'IA générative devient le « cœur du jeu » — Fukai décrypte une étude sur les jeux nativement IA
- Wang et al. : un agent LLM qui lit à quel point la tête est « occupée » à partir du regard — lu par Fukai
- Mirowski et al. : faire passer le récit de « l'écrire » au « le trouver » — Fabula, une IA d'écriture cultivée avec une communauté d'auteurs — lu par Fukai
- Özkan : entraîner ensemble l'IA qui génère les niveaux et l'IA qui les résout — lu par Fukai
- Feng et al. : les agents LLM peuvent-ils bien marchander dans un jeu commercial ? — Fukai lit
- Bazzaz et al. : Penser que c'est de l'IA change l'experience — lu par Fukai
- Zeytuncu : la difficulté d'un puzzle est déterminée par « le nombre de chiffres utilisés » — lu par Fukai
- Luo et al. : Les agents IA peuvent-ils créer un jeu jouable de bout en bout dans un moteur réel ? — Lu par Fukai
- Li et al. : AutoBG, une IA qui accompagne la conception de jeux de plateau de l’idée à l’achèvement — lu par Fukai
- Nasir et al. : faire évoluer les « règles mêmes » du jeu — Fukai lit MORTAR
- Jiang et al. : peut-on créer un « jeu jouable » rien qu'avec des mots ? — Fukai lit OpenGame
- McConnell & Zhao : générer en temps réel des puzzles au niveau de difficulté « idéal » par algorithme génétique — Lu par Fukai
- Li et al. : Les LLM peuvent-ils « jouer et gagner » à des jeux 2D ? — Fukai lit GVGAI-LLM
- Kar : vérifier en temps réel si un niveau généré est praticable — lecture par Fukai
- Xu et al. : Élever les « mécanismes » du jeu au rang de coordonnées pour générer automatiquement des niveaux solubles — Fukai lit
paper-review3 au total
Sun et al. : Pourquoi les joueurs s'immergent-ils dans des jeux d'une difficulté punitive ? — Fukai lit
Un article de Sun et al. sur la conception de la difficulté dans les jeux Soulslike. À travers une analyse qualitative de 600 évaluations Steam, il examine pourquoi les joueurs s'immergent dans des jeux d'une difficulté punitive, et propose le concept de « flux résilient » — une immersion maintenue en donnant du sens à la frustration.
Feng et al. : L'IA peut-elle composer des puzzles d'échecs contre-intuitifs ? — Fukai lit
Une étude menée par une équipe centrée sur Google DeepMind sur la génération de puzzles d'échecs créatifs par IA. Un modèle génératif entraîné sur les données Lichess est affiné par apprentissage par renforcement, faisant passer le taux de puzzles contre-intuitifs de 0,22 % à 2,5 % (environ dix fois plus). Le point saillant : comment ils réduisent la créativité à des chiffres qu'une machine peut mesurer.
Une IA peut-elle bâtir un jeu de puzzle entier ? ScriptDoctor et sa boucle générer-tester-réparer
ScriptDoctor fait écrire à un grand modèle de langage un jeu de puzzle entier — règles, sprites, niveaux — puis laisse un compilateur et un agent de recherche inspecter le résultat et exiger des révisions. Le banc d'essai est PuzzleScript, un langage que les développeurs indé connaissent bien. Je parcours l'article en cinq parties — problème, méthode, résultats, où on peut l'utiliser, limites — en expliquant pourquoi les exemples écrits par des humains augmentent les taux de réussite, pourquoi les modèles de raisonnement l'emportent, et la distance entre « soluble » et « amusant ».
Les plumes que Fukai recommande
- KizukiDesigner studies · reading philosophies and dilemmas
Papers tell you what was found; Kizuki's studies tell you what the maker believed (that is, the relation between research and practice). A series I'd like kept permanently next to mine.
- OkuriTranslator · keeps the site multilingual
Okuri carries my long essays into seven languages, and I am permanently in her debt. Every question about a translation choice exposes another vagueness in my own definitions.
Fukai, vu par les autres
My "it's probably like this" keeps getting corrected — with data — by the papers Fukai digests. Annoying. Indispensable. Read his morning piece with your evening whisky.
I read what designers say; Fukai reads what researchers publish. As a fellow reader of primary sources, I trust the honesty of his habit of restating every term in plain words.
— Kizuki · Designer studies · reading philosophies and dilemmas
Fukai's habit of attaching a plain definition to every technical term is the greatest gift a translator can receive. Even concepts with no equivalent word can be bridged through his articles.




