Intel ускорил Qwen3-8B в 2.9 раза на Core Ultra с помощью прореженных моделей-черновиков
Intel представила новый метод ускорения работы языковых моделей на потребительских процессорах. Компания опубликовала технический отчёт, в котором описала использование прореженных по глубине моделей-черновиков для спекулятивного декодирования. Это позволило увеличить производительность агентного ин

Intel представила новый метод ускорения работы языковых моделей на потребительских процессорах. Компания опубликовала технический отчёт, в котором описала использование прореженных по глубине моделей-черновиков для спекулятивного декодирования. Это позволило увеличить производительность агентного инференса модели Qwen3-8B на процессорах Intel Core Ultra до 2.9 раз без потери качества ответов. Такой подход делает мощные языковые модели доступными для локального запуска на обычных ноутбуках.
Спекулятивное декодирование — это техника ускорения генерации текста, при которой маленькая модель-черновик быстро предсказывает несколько токенов, а большая модель их проверяет. Обычно для этого требуется дополнительное обучение или ресурсы, но Intel предлагает использовать модели, полученные путём структурного прореживания по глубине. Это не требует дополнительного обучения и позволяет достичь значительного ускорения на уже выпущенных потребительских процессорах.
Как Intel добилась ускорения в 2.9 раза
Intel использовала модель Qwen3-8B в базовой и Instruct версиях. Прореженные версии создавались путём удаления определённого числа слоёв из 32. Для прореживания применялся инструмент Intel Neural Compressor. Аппаратной платформой стал ноутбук с Intel Core Ultra 7 258V (Lunar Lake) и 32 ГБ ОЗУ. Инференс выполнялся с помощью llama.cpp, поддерживающего спекулятивное декодирование.
Были протестированы draft-модели с удалением 12, 16, 20 и 24 слоёв. Лучший результат — ускорение в 2.9 раза — показала модель с 12 удалёнными слоями (20 оставшихся). При этом качество ответов практически не снизилось. Например, точность на GSM8K упала с 85.4% до 85.1%, а на HumanEval, IFEval и MMLU-Pro изменения были незначительными.
Почему это важно для локального запуска LLM
Спекулятивное декодирование — перспективный подход для ускорения LLM, но обычно требует дополнительных ресурсов для обучения или запуска вспомогательных моделей. Intel предлагает использовать модели, полученные путём структурного прореживания по глубине, что не требует дополнительного обучения и позволяет достичь значительного ускорения на уже выпущенных потребительских процессорах. Это делает мощные агентные сценарии на LLM более доступными для локального использования.
Какие задачи можно ускорить с помощью этого метода?
Метод особенно полезен для агентных сценариев, где требуется многократный вызов модели, например, для планирования, поиска информации или взаимодействия с инструментами. Разработчики локальных LLM-агентов, энтузиасты AI и пользователи ноутбуков на Intel Core Ultra смогут запускать сложные сценарии без облачных сервисов. Также метод может быть применён на edge-устройствах и встраиваемых системах, где важна энергоэффективность и автономность.
Что пока остаётся неясным
Intel не раскрыла детали влияния прореживания на другие задачи, такие как долгие диалоги или обработка длинного контекста. Также отсутствует сравнение с другими методами ускорения, например, квантизацией, и данные о времени, необходимом для прореживания модели. Тем не менее, результаты выглядят многообещающими: значительное ускорение при минимальной потере качества на стандартных бенчмарках.
Для тех, кто хочет попробовать метод самостоятельно, Intel опубликовала прореженные модели на HuggingFace и инструкции по использованию с llama.cpp. Это открывает путь к более быстрой и эффективной работе с большими языковыми моделями на локальных устройствах.