LEXIC: лёгкая модель айтрекинга с приростом 2,2 п.п. за счёт сложности текста

Группа исследователей представила LEXIC — два лёгких механизма, которые улучшают предсказание понимания прочитанного по движениям глаз. Разработанные модели не требуют тяжёлых языковых сетей, а полагаются на простые сигналы сложности текста, что открывает путь к быстрым решениям для анализа чтения в

LEXIC: лёгкая модель айтрекинга с приростом 2,2 п.п. за счёт сложности текста

Группа исследователей представила LEXIC — два лёгких механизма, которые улучшают предсказание понимания прочитанного по движениям глаз. Разработанные модели не требуют тяжёлых языковых сетей, а полагаются на простые сигналы сложности текста, что открывает путь к быстрым решениям для анализа чтения в реальном времени. Работа основана на бенчмарке EyeBench, где текстовые модели достигают 56–63% AUROC, а модели только по взгляду работают на уровне случайности. LEXIC показывает, что даже минимальные лингвистические подсказки могут существенно повысить точность айтрекинга.

Что такое LEXIC и как он работает

LEXIC расшифровывается как Lightweight Eye-tracking eXtension via Injected Complexity. Это два варианта архитектуры, построенные на основе свёрточной сети AhnCNN. Основная идея — добавить к сигналам фиксации взгляда три простых числовых признака: сюрпризность по модели GPT-2 (насколько слово неожиданно в контексте), частотность слова в языке и длину слова в символах. Эти признаки вычисляются заранее и не требуют запуска большой языковой модели в реальном времени.

Первый вариант — LEXIC-Concat — просто конкатенирует три признака с входными данными фиксации. Второй — LEXIC-Res — использует остаточный механизм: специальная «голова» предсказывает типичный отклик читателя, а энкодер обучается на отклонении от этого типичного отклика. Такой подход позволяет модели быстрее адаптироваться к индивидуальным особенностям читателя.

Почему улучшение на 2,2 п.п. — это значимый результат

Проблема айтрекинга без языковых моделей долгое время оставалась одной из ключевых в понимании чтения. Традиционные модели, использующие только координаты взгляда, работают немногим лучше случайного угадывания. Добавление даже простых сигналов сложности текста даёт прирост до 2,2 процентных пункта AUROC на задаче OneStop reading comprehension. Для сравнения: полные языковые модели показывают 56–63% AUROC, а LEXIC-Res на невидимых текстах достигает прироста +2,2 п.п. (p ≤ 0,065). Хотя p-значение не достигает строгой статистической значимости, тренд устойчив и подтверждается на других метриках.

Особенно важен результат LEXIC-Concat на невидимых читателях: +2,9 п.п. (p = 0,010) — это уже статистически значимый прирост. Это означает, что модель способна обобщать на новых людей, не проходивших в обучении. Для практических приложений, таких как адаптивные системы обучения или диагностика нарушений чтения, это критически важно.

Как LEXIC сравнивается с существующими подходами

Современные методы айтрекинга можно разделить на три группы. Первая — модели только по взгляду, которые игнорируют текст и работают на уровне случайности. Вторая — модели с полным языковым представлением (например, на базе BERT или GPT), которые требуют больших вычислительных ресурсов и не подходят для реального времени. Третья — гибридные подходы, которые используют лёгкие лингвистические признаки. LEXIC относится именно к третьей группе и показывает, что даже минимальные признаки (всего три числа на слово) дают существенный выигрыш.

Авторы сравнили LEXIC с базовой моделью AhnCNN без дополнительных признаков. На задаче с ансамблем из K=5 моделей по десяти фолдам LEXIC-Concat и LEXIC-Res дали прирост AUROC на невидимых текстах +1,8 и +2,2 п.п. соответственно. На невидимых читателях LEXIC-Concat показал +2,9 п.п., а LEXIC-Res — +1,8 п.п. (p = 0,19). Снижение прироста LEXIC-Res на новых читателях объясняется тем, что его «голова» калибруется на обучающих читателях и требует донастройки для обобщения.

Какие практические применения открывает LEXIC

Разработчики систем айтрекинга получают возможность создавать лёгкие модели, которые работают в реальном времени на обычных компьютерах без GPU. Это важно для образовательных платформ, где нужно анализировать чтение студентов без дорогого оборудования. Исследователи в области психолингвистики могут использовать LEXIC для изучения, как сложность текста влияет на движения глаз, без необходимости разворачивать тяжёлые языковые модели.

Специалисты по человеко-компьютерному взаимодействию могут интегрировать LEXIC в интерфейсы, которые адаптируются к уровню понимания пользователя. Например, система может упрощать текст, если видит, что читатель «застревает» на сложных словах. Также LEXIC может применяться в диагностике дислексии: отклонения от типичных паттернов взгляда могут указывать на проблемы с чтением.

Какие ограничения есть у LEXIC

Пока неизвестно, как LEXIC поведёт себя на других бенчмарках и языках. Все эксперименты проведены на английском языке с использованием одного датасета OneStop. Для русского, китайского или арабского языков признаки частотности и длины слов могут работать иначе. Кроме того, авторы использовали только одну базовую архитектуру AhnCNN — на других свёрточных или рекуррентных сетях результаты могут отличаться.

LEXIC-Res требует донастройки для обобщения на новых читателях. Это означает, что для каждого нового пользователя может потребоваться небольшое количество данных для калибровки. Впрочем, авторы отмечают, что LEXIC-Concat лишён этого недостатка и показывает стабильные результаты без донастройки.

Какие следующие шаги возможны для развития LEXIC

Исследователи планируют расширить набор признаков сложности текста, включив, например, синтаксическую сложность или когнитивную нагрузку. Также возможно объединение LEXIC с лёгкими языковыми моделями, такими как DistilBERT, для дальнейшего повышения точности без значительного роста вычислительных затрат. Ещё одно направление — проверка на многозыковых данных и создание универсальной модели айтрекинга, не зависящей от языка.

В долгосрочной перспективе LEXIC может стать основой для систем анализа чтения в реальном времени, которые работают на мобильных устройствах. Это особенно актуально для дистанционного образования, где нет возможности использовать стационарные айтрекеры.

Что такое EyeBench и почему он важен для айтрекинга

EyeBench — это бенчмарк для оценки моделей предсказания понимания прочитанного по движениям глаз. Он включает данные фиксаций взгляда и ответы на вопросы по тексту. Модели оцениваются по метрике AUROC — площади под ROC-кривой. Текстовые модели (например, на основе BERT) показывают 56–63% AUROC, а модели только по взгляду — около 50% (случайный уровень). LEXIC приближается к текстовым моделям, но при этом значительно легче и быстрее.

Использование EyeBench позволяет объективно сравнивать разные подходы. То, что LEXIC даёт прирост даже на таком сложном бенчмарке, подтверждает эффективность предложенных механизмов.

Как внедрить LEXIC в существующие системы

Для интеграции LEXIC в существующие системы айтрекинга потребуется: - Получать координаты фиксаций взгляда в реальном времени. - Вычислять три признака для каждого слова: сюрпризность (можно предрассчитать для всех слов текста), частотность (из готового списка) и длину. - Подавать эти признаки вместе с координатами в предобученную модель LEXIC.

Авторы опубликовали код и веса модели в открытом доступе, что упрощает внедрение. Разработчикам не нужно обучать модель с нуля — достаточно донастроить на своих данных, если требуется.

LEXIC открывает новые возможности для лёгкого и точного айтрекинга, делая технологию доступнее для широкого круга приложений.