Intel выпустила AutoRound: точное квантование LLM и VLM с открытым исходным кодом
Компания Intel представила новый инструмент для квантования больших языковых моделей (LLM) и мультимодальных моделей (VLM) под названием AutoRound. Этот метод, доступный в открытом доступе через библиотеку Hugging Face, позволяет значительно уменьшить размер моделей и ускорить их инференс без сущест

Компания Intel представила новый инструмент для квантования больших языковых моделей (LLM) и мультимодальных моделей (VLM) под названием AutoRound. Этот метод, доступный в открытом доступе через библиотеку Hugging Face, позволяет значительно уменьшить размер моделей и ускорить их инференс без существенной потери качества. Квантование — одна из ключевых техник для развертывания LLM на устройствах с ограниченными ресурсами, и AutoRound обещает улучшенную точность по сравнению с существующими решениями, что делает его перспективным для промышленного использования.
Что такое AutoRound и как он работает AutoRound использует метод раундирования на основе оптимизации, который минимизирует ошибку квантования. В отличие от стандартных подходов, таких как округление до ближайшего целого, AutoRound применяет итеративный процесс, подбирая оптимальные значения для каждого веса с учетом их влияния на выход модели. Это позволяет сохранить больше информации при переводе чисел с плавающей точкой в целочисленные форматы. Инструмент поддерживает различные форматы, включая INT4 и INT8, и работает с популярными архитектурами моделей, такими как LLaMA, Mistral и другие. По заявлению Intel, AutoRound обеспечивает более высокую точность, чем стандартные методы, такие как GPTQ или AWQ, особенно при низкой разрядности.
Почему квантование важно для современных моделей Современные LLM содержат миллиарды параметров, что требует огромных вычислительных ресурсов и памяти для работы. Квантование снижает требования к памяти в 4-8 раз и ускоряет инференс на 2-4 раза в зависимости от аппаратного обеспечения. Это особенно важно для развертывания моделей на периферийных устройствах, мобильных платформах или в облаке, где стоимость и энергопотребление имеют значение. AutoRound позволяет достичь этих преимуществ с минимальной потерей точности, что делает его привлекательным для компаний, стремящихся оптимизировать свои AI-решения.
Как AutoRound сравнивается с другими методами квантования На рынке уже существуют популярные инструменты квантования, такие как GPTQ, AWQ и GGUF. GPTQ использует оптимальное квантование на основе ошибки, а AWQ фокусируется на сохранении важных весов. Intel утверждает, что AutoRound превосходит их по точности, особенно при квантовании до 4 бит. В тестах на моделях LLaMA-2-7B и Mistral-7B AutoRound показал меньшую потерю перплексии и более высокие результаты на бенчмарках понимания языка. Однако пока нет независимых публичных бенчмарков, и сообщество ожидает более детальных сравнений.
Кому будет полезен AutoRound Инструмент ориентирован на разработчиков, инженеров машинного обучения и компании, которые занимаются развертыванием LLM и VLM. Он будет полезен для оптимизации производительности и снижения затрат на инфраструктуру. Например, стартапы, использующие облачные GPU, могут сократить расходы на инференс, а разработчики мобильных приложений — запускать модели прямо на устройстве. AutoRound также может быть интегрирован в пайплайны MLOps для автоматического квантования моделей перед деплоем.
Какие ограничения и неизвестные моменты существуют Несмотря на заявленные преимущества, пока отсутствуют конкретные бенчмарки точности для различных моделей на стандартных наборах данных. Также нет данных о поддержке аппаратных ускорителей Intel, таких как Habana Gaudi или Intel Arc GPU. Это может ограничить применение AutoRound для пользователей, которые хотят максимальной производительности на специализированном оборудовании. Кроме того, инструмент находится на ранней стадии, и сообщество может выявить баги или несоответствия при использовании в продакшене.
Как начать использовать AutoRound AutoRound доступен в виде Python-пакета на Hugging Face и GitHub. Для установки достаточно выполнить команду pip install autoround. Инструмент поддерживает интеграцию с библиотекой Transformers, что позволяет квантовать модели в несколько строк кода. Intel предоставляет примеры для популярных моделей и архитектур, а также документацию по настройке параметров квантования. Для тестирования можно использовать Google Colab или локальную машину с GPU.
Какие перспективы у AutoRound для индустрии AI AutoRound может стать важным инструментом для демократизации доступа к большим моделям. Снижение требований к ресурсам позволит малым компаниям и исследователям использовать LLM без дорогостоящего оборудования. Если Intel продолжит развитие и добавит поддержку своего железа, AutoRound может занять значительную долю рынка квантования. Однако конкуренция со стороны открытых решений, таких как llama.cpp, и коммерческих продуктов от NVIDIA и AMD будет высокой.
В целом, AutoRound — это многообещающий инструмент, который уже сейчас можно протестировать. Разработчикам стоит обратить на него внимание, особенно если они работают с моделями, требующими низкой разрядности. Следите за обновлениями от Intel и публикациями бенчмарков, чтобы оценить реальную эффективность метода.