Thunder-Tok: новый токенизатор сокращает количество токенов на 25% без потери качества

Новый токенизатор Thunder-Tok, описанный в статье arXiv:2506.15138v2, позволяет уменьшить количество токенов, необходимых для представления текста, примерно на 25% для английского языка и на 9% для корейского, не снижая при этом качество работы языковых моделей. Это достигается за счёт двухэтапного

Thunder-Tok: новый токенизатор сокращает количество токенов на 25% без потери качества

Новый токенизатор Thunder-Tok, описанный в статье arXiv:2506.15138v2, позволяет уменьшить количество токенов, необходимых для представления текста, примерно на 25% для английского языка и на 9% для корейского, не снижая при этом качество работы языковых моделей. Это достигается за счёт двухэтапного подхода: сначала строится большой словарь из подстрок корпуса с фильтрацией структурно неполных кандидатов, затем словарь сокращается на основе вероятностной оценки токенов. Такое снижение плодовитости токенизатора напрямую влияет на эффективность инференса больших языковых моделей, сокращая длину последовательности и стоимость генерации.

Почему токенизация так важна для языковых моделей

Токенизация — это процесс разбиения текста на более мелкие единицы, называемые токенами, которые затем обрабатываются языковой моделью. От того, насколько эффективно работает токенизатор, зависит не только качество понимания текста, но и скорость работы модели, а также затраты на её использование. Фрагментированная токенизация, когда одно слово разбивается на несколько токенов, увеличивает длину последовательности, что приводит к росту вычислительных затрат и времени генерации ответа. Поэтому снижение среднего количества токенов на слово без потери качества является важной задачей для оптимизации LLM.

Как работает Thunder-Tok: двухэтапный подход

Thunder-Tok использует двухэтапный алгоритм для построения эффективного словаря токенов. На первом этапе из корпуса текста извлекаются все возможные подстроки, которые затем фильтруются. Отбрасываются структурно неполные кандидаты, такие как недействительные фрагменты байтов Unicode и токены, нарушающие границы слов. Это позволяет исключить заведомо неэффективные варианты и сократить пространство поиска. На втором этапе оставшиеся кандидаты оцениваются с помощью вероятностной метрики, основанной на равномерной нижней границе Йенсена вероятности обучающих данных. Это позволяет выбрать наиболее информативные токены, которые максимально сохраняют семантику при минимальной длине последовательности.

Какие результаты показал Thunder-Tok в экспериментах

В ходе экспериментов Thunder-Tok сравнивался со стандартным токенизатором BPE. Для английского языка снижение плодовитости составило около 25%, а для корейского — около 9%. При этом качество работы модели, измеряемое по стандартным бенчмаркам, осталось на конкурентоспособном уровне. Это означает, что при использовании Thunder-Tok можно обрабатывать тот же объём текста быстрее и с меньшими затратами, не жертвуя точностью. Такие результаты особенно важны для приложений, где требуется высокая скорость генерации, например, в чат-ботах или системах машинного перевода.

Кому будет полезен новый токенизатор

Разработчики и исследователи в области обработки естественного языка (NLP) получат инструмент для улучшения эффективности своих моделей. Инженеры, работающие над оптимизацией инференса больших языковых моделей, смогут сократить время ответа и снизить операционные расходы. Компании, использующие языковые модели для генерации текста в коммерческих продуктах, также выиграют от уменьшения стоимости каждого запроса. Кроме того, Thunder-Tok может быть интегрирован в существующие пайплайны, что упрощает его внедрение.

Какие ограничения и неизвестные аспекты остаются

Несмотря на впечатляющие результаты, остаётся несколько открытых вопросов. Пока не опубликованы подробные данные о производительности Thunder-Tok на других языках, кроме английского и корейского. Также отсутствует прямое сравнение с более современными токенизаторами, такими как SentencePiece или Unigram. Неясна масштабируемость подхода для очень больших корпусов — сможет ли алгоритм эффективно обрабатывать терабайты текста без потери скорости. Дополнительные исследования помогут оценить, насколько Thunder-Tok универсален и готов к промышленному использованию.

Перспективы применения Thunder-Tok в индустрии

Снижение количества токенов на 25% может существенно повлиять на экономику работы LLM. Например, для популярных моделей, таких как GPT-4 или LLaMA, это означает уменьшение затрат на вычисления и память. Thunder-Tok может стать стандартным компонентом в пайплайнах предобработки данных, особенно для задач, где важна скорость, например, в real-time системах. Кроме того, его вероятностный подход к отбору токенов может быть адаптирован для других типов данных, таких как код или аудио, что открывает новые возможности для мультимодальных моделей.

Заключение

Thunder-Tok представляет собой значительный шаг вперёд в области токенизации для языковых моделей. Он демонстрирует, что можно существенно сократить количество токенов без потери качества, что напрямую улучшает эффективность и снижает стоимость работы LLM. Хотя остаются вопросы о его применимости к другим языкам и масштабируемости, текущие результаты внушают оптимизм. Разработчикам и исследователям стоит обратить внимание на этот подход и рассмотреть его интеграцию в свои проекты.