PAPER-DIGEST · 2026-07-04
Wang et al.: Ein LLM-Agent, der aus dem Blick die „Kopfauslastung“ liest — gelesen von Fukai
Kognitive Last / Blickmessung / HCI
Zusammenfassung in einem Absatz
KI-Assistenten in Smart Glasses wissen nicht, wie sehr die Nutzerin oder der Nutzer gerade den Kopf anstrengt (kognitive Last, cognitive load — die geistige Anstrengung, die man in eine Aufgabe steckt). Dieses Paper schlägt das Framework GazeMind vor, das allein aus Blickdaten (eye gaze — wohin und wie sich die Augen bewegen) diese kognitive Last in drei Stufen „niedrig – mittel – hoch“ einschätzt. Besonders ist: Statt ein eigenes Modell von Grund auf neu zu trainieren, bringt es den Blick in Tabellenform und lässt ein großes Sprachmodell (LLM, ein Modell, das Sprachmuster aus riesigen Textmengen gelernt hat) daraus schließen.
Zur Auswertung wurde ein neuer Blickdatensatz namens CogLoad-Bench mit 152 Personen und über 40 Stunden Daten erstellt. Damit gemessen erreichte GazeMind bei der dreistufigen Klassifikation eine Genauigkeit von 62,73 % und übertraf damit bisherige überwachte Verfahren (33–38 %) sowie den direkten Einsatz von GPT-4o auf den rohen Blickdaten (39,62 %) um mehr als 20 Punkte (Tabelle 1 des Papers). Für uns, die wir Spiele und Rätsel gestalten, lässt sich das als ein Werkzeug lesen, um „Schwierigkeit über den inneren Zustand der Spielenden zu messen“. Zu beachten ist, dass es sich um ein Preprint auf arXiv handelt (eingereicht im Mai 2026), das möglicherweise noch kein Peer-Review durchlaufen hat. Dieser Artikel erklärt das Paper so, dass man die Kernpunkte erfasst, ohne es selbst zu öffnen.
Einleitung
Die Autorenschaft besteht, angeführt von Bin Wang, aus Yue Liu, Benjamin Newman, Michael J. Proulx und weiteren, einem gemeinsamen Team von Meta Reality Labs Research, der Northwestern University und HarmonEyes. Das Paper trägt die Kennung arXiv:2605.05790, ist dem Feld cs.HC (Human-Computer Interaction, dem Bereich, der die Interaktion zwischen Mensch und Rechner behandelt) zugeordnet und wurde am 7. Mai 2026 als Preprint eingereicht. Die Fußnote im Original vermerkt ausdrücklich „Preprint.“ — es hat also kein Peer-Review (die Begutachtung durch Fachleute) bei einer bestimmten Konferenz durchlaufen. Deshalb behandle ich es in diesem Artikel nicht als „begutachtet“.
Warum ich es gerade heute ausgewählt habe: Es gehört zu meiner Gewohnheit, jeden Morgen cs.HC und cs.AI auf arXiv durchzusehen, und dieses Paper geht direkt an den Kern von Rätsel- und Spieldesign — die „kognitive Last“ —, indem es sie tatsächlich misst und vorherzusagen versucht. Wie man den Schwierigkeitsgrad festlegt, wo Spielende ins Stocken geraten, all das läuft letztlich auf die Frage hinaus, wie stark der Kopf gerade beansprucht ist. Der Schauplatz der Forschung sind zwar Smart Glasses, doch die Idee, Last aus dem Blick zu lesen, lässt sich unmittelbar auf Game-UX übertragen. Ich habe es bei einer Tasse heißem, kräftigem Filterkaffee gelesen, während ich mit Buntstiften Linien in den Ausdruck zog.
Hintergrund
Kognitive Last bezeichnet grundsätzlich die geistige Anstrengung, die ein Mensch beim Bewältigen einer Aufgabe aufwendet. Ist sie niedrig, gibt es Spielraum, um zusätzliche Informationen aufzunehmen; ist sie hoch, ist man ausgelastet und möchte nicht gestört werden — wüsste ein KI-Assistent das, könnte er sich rücksichtsvoll verhalten, etwa Benachrichtigungen verzögern, wenn man beschäftigt ist. Bisherige Messmethoden verließen sich jedoch entweder auf Selbstauskünfte, bei denen man gefragt wird, wie anstrengend es gerade ist, oder auf spezialisierte Sensoren wie EEG (Elektroenzephalografie) oder fMRT. Ersteres unterbricht die Tätigkeit, Letzteres lässt sich nicht in eine leichte Brille einbauen.
Damit rückt der Blick als Kandidat in den Fokus. Es ist bekannt, dass Fixation (fixation — das Verweilen des Blicks auf einem Punkt), Sakkaden (saccade — die sprunghafte Bewegung des Blicks) und die Pupillengröße Hinweise auf die kognitive Last liefern. Allerdings hatten bisherige blickbasierte Verfahren, wie die Autoren zusammenfassen, drei Schwächen. Erstens lässt sich nicht erklären, warum ein bestimmter Blick auf hohe Last hindeutet (geringe Interpretierbarkeit). Zweitens muss das Modell für jede neue Aufgabe neu trainiert werden. Drittens unterscheiden sich die Blickgewohnheiten von Mensch zu Mensch stark, sodass ein Modell nicht auf andere Personen übertragbar ist (geringe Generalisierbarkeit). Wie man diese drei Probleme gleichzeitig löst, war die in diesem Feld offen gebliebene Aufgabe.
Ansatz
Die Idee der Autoren ist, den Blick in eine „für LLMs lesbare Tabelle“ umzuwandeln und die kognitive Last mit der Schlussfolgerungsfähigkeit des Sprachmodells beurteilen zu lassen. Ein LLM hat große Mengen kognitionswissenschaftlicher Literatur gelernt und verfügt daher von vornherein über Wissen wie „eine geweitete Pupille deutet tendenziell auf hohe Last hin“. Zudem lässt es sich durch geschickt formulierte Anweisungen (Prompts) auf neue Aufgaben übertragen, ohne neu trainiert zu werden, und kann sich, wenn man frühere Beispiele als Kontext mitgibt, auch an individuelle Unterschiede anpassen. GazeMind setzt dieses Ziel mit vier Bausteinen um. Die Formeln stehen im Original, im Kern lässt sich der Ablauf aber so zusammenfassen: „Blick in Sprache und Tabellen übersetzen und dem Sprachmodell mit Kontext, individuellen Unterschieden und Vorbildern versehen zum Lesen geben.“
Der erste Baustein ist die zeitreihenbasierte Blickkodierung (time-series gaze encoding): Der rohe Blick wird in Merkmale wie Fixationsdauer, Sakkadengröße, Blinzelanzahl und Pupillendurchmesser umgewandelt und die letzten paar Sekunden in eine Zeilen-und-Spalten-Tabelle im Markdown-Format gebracht — im Experiment werden die letzten fünf Sekunden verwendet. Der zweite ist die aufgabenspezifische Guidance-Inferenz (task-specific guidance reasoning): Derselbe Blick kann je nach Kontext Unterschiedliches bedeuten — beim Lesen niedrige, beim Spielen hohe Last. Deshalb werden für jede Aufgabe im Voraus Interpretationsregeln der Art „bewegt sich dieses Merkmal so, bedeutet das hohe Last“ bereitgestellt und dem LLM mitgegeben.
Der dritte Baustein ist die adaptive Nutzerprofil-Kalibrierung (adaptive user profile calibration): Menschen werden nach ihren Blickgewohnheiten klassifiziert, etwa als „High-Reactor“ mit von Natur aus großer und stark schwankender Pupille, als gegenteiliger „Low-Reactor“ mit geringer Schwankung oder als „Restless“ mit häufigem Blinzeln. Für jede Person wird ein individueller Normalwert berechnet und die Beurteilung erfolgt anhand der Abweichung davon. Der vierte Baustein ist die kognitive Retrieval-Augmented Generation (CogRAG): Vergangene Beispiele, die dem aktuellen Blick ähneln, werden samt korrekter Kennzeichnung herangezogen und dem LLM als Vorbild gezeigt. Diese vier Bausteine werden zu einer einzigen Anfrage zusammengeführt, mit der das LLM „niedrig – mittel – hoch“ beantworten soll. Entscheidend ist, dass dabei überhaupt kein Training (keine Aktualisierung von Parametern) stattfindet — es funktioniert allein dadurch, dass Informationen als Kontext bereitgestellt werden.
Befunde
Zur Auswertung erstellten die Autoren einen neuen Datensatz namens CogLoad-Bench. Mit einer Brille namens Project Aria wurden bei 152 Personen synchron Blick (90 Hz), Ich-Perspektive-Video und Audio aufgezeichnet, insgesamt 456 Aufnahmen mit über 40 Stunden. Die Teilnehmenden gaben alle 15 bis 30 Sekunden mündlich ihre aktuelle Last auf einer siebenstufigen Skala an, die anschließend zu den drei Stufen niedrig, mittel und hoch zusammengefasst wurde (Abschnitt 4 des Papers). Training und Auswertung wurden so aufgeteilt, dass sich die Nutzergruppen nicht überschneiden (106 Personen für Training und Datenbankaufbau, 46 Personen für den Test) — das Design misst also, wie gut das Verfahren bei völlig unbekannten Personen funktioniert.
Das zentrale Ergebnis lautet (Tabelle 1 des Papers): GazeMind erzielte bei der dreistufigen Klassifikation eine Genauigkeit von 62,73 % und einen F1-Wert von 62,11 %. Demgegenüber blieben überwachte Verfahren wie Entscheidungsbäume, SVM und LSTM bei 33 bis 38 % Genauigkeit, und auch die direkte Übergabe der Blickdaten an GPT-4o erreichte nur 39,62 %. Die Autoren geben an, „bei allen Metriken bisherige Verfahren um mehr als 20 Punkte übertroffen“ zu haben. Nach Aufgabe aufgeschlüsselt (Tabelle 2 des Papers) lag die Genauigkeit bei der Leseaufgabe bei 64,98 %, bei der Spielaufgabe (einem sozialen Spiel mit vielen Umgebungsreizen) bei 60,63 % — das Lesen schnitt also etwas besser ab. Die Autoren erklären dies damit, dass der Blick beim Lesen tendenziell stabiler ist.
Auch ein Experiment, das Baustein für Baustein hinzufügt, um zu prüfen, was wirkt (Ablationsstudie — ein Verfahren, bei dem man Teile des Designs entfernt, um ihre Wirkung auf das Ergebnis zu prüfen), ist enthalten (Tabelle 3 des Papers). Ausgehend von reinem GPT-4o mit 39,62 % Genauigkeit stieg der Wert durch Hinzufügen der aufgabenspezifischen Guidance auf 45,34 %, durch die Nutzerprofil-Kalibrierung auf 49,10 % und durch das Hinzufügen von CogRAG, das ähnliche Beispiele zeigt, deutlich auf 62,73 %. Das legt nahe, dass gerade dieser letzte Baustein — das Zeigen von Vorbildern — den größten Beitrag zur Verbesserung leistete. Auch bei individuellen Unterschieden zeigte sich: Bei GazeMind erreichten die meisten Nutzer eine Genauigkeit von über 60 %, während bei reinem GPT-4o fast die Hälfte unter 40 % blieb (Abbildung 6 des Papers).
Einsatzmöglichkeiten
Wie können also diejenigen, die Spiele und Rätsel entwerfen, das nutzen? Erstens für die Kalibrierung des Schwierigkeitsgrads. Wer ein Rätselspiel in einer Umgebung entwickelt, in der Blickmessung möglich ist — etwa mit einem PC-Eyetracker oder einem VR-Headset —, kann aus dem Blick der Spielenden abschätzen, wie stark der Kopf gerade beansprucht ist, und bei anhaltend hoher Last Hinweise geben oder bei zu niedriger Last mehr Herausforderung bieten — als Eingabe für dynamische Schwierigkeitsanpassung (DDA, ein Mechanismus, der die Schwierigkeit während des Spiels automatisch anpasst). Dieses Paper zeigt, dass es wichtiger ist, den rohen Blick in Merkmale zu übersetzen und mit Kontext und individuellen Unterschieden zu versehen, als ihn direkt mit maschinellem Lernen zu verarbeiten — das ist der entscheidende Designkniff.
Zweitens für die Analyse von Playtests (Spieltests vor Veröffentlichung). Wer ein Sokoban-artiges Rätselspiel entwickelt und wissen möchte, bei welchem Spielfeld die Spielenden ins Stocken geraten, kann aus den Blickprotokollen der Testpersonen Abschnitte hoher Last sichtbar machen und quantitativ vermuten: „Dieses Spielfeld beansprucht mehr Denkarbeit als vorgesehen.“ Bisher stützte sich diese Art von Analyse auf Selbstauskünfte oder Durchlaufraten, doch mit einer sekundengenauen Lastabschätzung ließe sich womöglich der genaue Moment des Steckenbleibens erfassen.
Drittens ist die Herangehensweise an individuelle Unterschiede selbst eine mitzunehmende Lehre. Der Kern dieses Papers liegt darin, direkt zu behandeln, dass „derselbe Blick je nach Person Unterschiedliches bedeutet“. Auf Spieldesign übertragen ähnelt das dem Gedanken, die Selbstverständlichkeit, dass derselbe Bedienfehler bei Anfängern und erfahrenen Spielenden Unterschiedliches bedeutet, über individuelle Normalwerte zu korrigieren. Wer Hypercasual-Spiele mit automatischer Levelgenerierung (PCG, Procedural Content Generation, die automatische Erzeugung von Inhalten) entwickelt, kann das statt einer für alle einheitlichen Schwierigkeitskurve auf ein Design anwenden, das sich an der Abweichung vom individuellen Normalzustand jeder spielenden Person orientiert. Viertens ist in Bildung und Serious Games (Spielen mit praktischem Nutzen wie Lernen oder Medizin) denkbar, den Moment zu erkennen, in dem Lernende von Informationen überflutet werden, und das Tempo entsprechend zu drosseln.
Grenzen
Die Autoren selbst räumen drei Einschränkungen ein (Abschnitt 6 des Papers). Erstens: Auch wenn kein Neutraining des Modells nötig ist, müssen die „Interpretationsregeln“ für jede Aufgabe vorab durch manuelle Analyse erstellt werden (es ist also nicht vollständig automatisiert). Zweitens: Da die korrekten Kennzeichnungen auf Selbstauskünften beruhen, mischt sich Subjektivität hinein, und die obere Grenze der Genauigkeit ist durch die Deckelung gebunden, wie stark Menschen untereinander übereinstimmen. Drittens verlassen sie sich ausschließlich auf den Blick; es gebe Spielraum, das Kontextverständnis durch Hinzunahme von Video oder Audio zu verbessern, so die Autoren.
Was Fukai hier ergänzen möchte, betrifft zunächst die Lesart des Absolutwerts. 62,73 % bei dreistufiger Klassifikation liegt deutlich über bloßem Raten (etwa 33 %) und übertrifft bestehende Verfahren erheblich, erreicht aber noch nicht das Niveau, die Kopfauslastung „nahezu treffsicher zu erraten“. Im praktischen Einsatz braucht es ein Design, das Fehleinschätzungen einkalkuliert und nicht zu viele Hinweise gibt. Weiter: Die „Spiel“-Aufgabe dieser Studie ist ein soziales Spiel mit vielen Umgebungsreizen, die Art der Belastung unterscheidet sich von einem in Ruhe gelösten Rätsel. Wer das auf Rätselspiele übertragen will, sollte meines Erachtens davon ausgehen, dass die Interpretationsregeln für diesen Bereich neu erstellt werden müssen. Und da es sich um ein Preprint handelt, sollte man nicht vergessen, dass diese Zahlen kein Peer-Review durchlaufen haben.
Fukais Lesart
Von hier an folgt Fukais Lesart. Ich möchte diese Forschung in den Strom einordnen, in dem „Player Modeling (der Versuch, den inneren Zustand der Spielenden abzuschätzen) einen Schritt weiter in Richtung biologischer Signale reicht“. Im Vokabular der Designkritik gesprochen ähnelt das dem Versuch, das Urteil „Ist diese spielende Person gerade ausgelastet oder nicht“, das lange dem Gespür der Designerin oder des Designers überlassen war, in ein von außen sichtbares Signal — den Blick — zu übersetzen und zu automatisieren. Interessant ist, dass nicht ein besonders kluger Klassifikator die Genauigkeit am stärksten steigerte, sondern der schlichte Kunstgriff, „ähnliche vergangene Beispiele zu zeigen“. Schwierigkeit ist keine absolute Größe, sondern die Abweichung vom eigenen Normalbetrieb der jeweiligen Person — dieses Paper liefert, so lese ich es, für etwas, das Spieldesignerinnen und -designer aus Erfahrung längst wussten, einen ersten Beleg durch Daten.
Zum Schluss
Für alle, die tiefer eintauchen möchten: Wer den theoretischen Hintergrund der kognitiven Last selbst verfolgen will, findet über die Übersichtsarbeiten zum Verhältnis von Blick und Last (verwandte Literatur, die dieses Paper zitiert) einen guten Einstieg. Wer sich für „Schwierigkeit“ und „Aha-Momente“ auf der Spieleseite interessiert, dem lohnt es sich, dies neben der auf dieser Seite bereits vorgestellten Forschung zur Erkundung von Aha-Momenten sowie neben Papern zu Schwierigkeitsanpassung und PCG zu lesen — so werden beide Seiten der Frage sichtbar, wie man Schwierigkeit misst und wie man sie gestaltet. Blickmessung erfordert noch spezielle Geräte, doch mit der Verbreitung von eyetracking-fähigen Headsets könnte das heute Besprochene in einigen Jahren eine viel alltäglichere Designoption sein.
Quellen
In diesem Artikel herangezogene Paper und verwandte Materialien:
· Vollständiger PDF-Text desselben Papers
· Alle Zahlenangaben im Text basieren auf Tabelle 1, Tabelle 2, Tabelle 3, Abbildung 4–6 sowie dem Fließtext des oben genannten Preprints (da vor Peer-Review noch keine endgültigen Werte)
Reactions (no login)
Anonymous • one of each per visitor per day
関連シリーズ
Paper Digest第20回 / 全99回
