Как запустить Ornith-35B на ноутбуке с 8 ГБ VRAM: 99 ток/с на AMD Strix Halo
Запуск языковой модели с 35 миллиардами параметров на ноутбуке с 8 ГБ видеопамяти — задача, которая ещё недавно казалась невыполнимой. Однако команда энтузиастов добилась этого, используя встроенную графику AMD Strix Halo и комбинацию передовых техник оптимизации. В результате модель Ornith‑1.0‑35B

Запуск языковой модели с 35 миллиардами параметров на ноутбуке с 8 ГБ видеопамяти — задача, которая ещё недавно казалась невыполнимой. Однако команда энтузиастов добилась этого, используя встроенную графику AMD Strix Halo и комбинацию передовых техник оптимизации. В результате модель Ornith‑1.0‑35B не только уместилась в ограниченный объём памяти, но и показала скорость 99 токенов в секунду — почти втрое быстрее типичных показателей для таких моделей. Более того, в тесте Terminal‑Bench она обошла гигантскую Qwen3.5‑397B, а в агентном кодинге продемонстрировала отличные результаты. Рассказываем, как это стало возможным и что это значит для разработчиков.
Как запустить 35B-модель на 8 ГБ VRAM
Секрет кроется в комбинации нескольких техник. Во-первых, разработчики использовали Vulkan — кроссплатформенный графический API, который позволяет эффективно задействовать вычислительные ресурсы GPU на Windows. Во-вторых, они применили селективную квантизацию: модель загружалась в 4-битном формате, но критически важные слои оставались в 8-битном или даже 16-битном представлении. Это сохранило качество, одновременно сократив потребление памяти. Третьим ключевым элементом стала техника MTP (Multi-Token Prediction) — она предсказывает сразу несколько следующих токенов, ускоряя генерацию. Дополнительно использовался n-gram reuse: повторяющиеся фрагменты текста не обрабатывались заново, а брались из кэша.
Какие методы не дали прироста?
Не все эксперименты оказались успешными. Например, попытки использовать исключительно CPU-вычисления приводили к скорости менее 10 ток/с — это неприемлемо для интерактивной работы. Также не оправдала себя полная квантизация до 2–3 бит: модель теряла в точности, особенно на задачах кодинга. Разработчики отказались и от стандартного подхода с offloading на CPU — он создавал узкое место из-за медленной шины PCIe. В итоге именно комбинация Vulkan + селективная квантизация + MTP дала результат.
Предыстория и контекст
Запуск больших моделей на ограниченном оборудовании — давняя головная боль разработчиков. Обычно для модели в 35 миллиардов параметров требуется не менее 20 ГБ VRAM, а с учётом контекстного окна — все 24–32 ГБ. Попытки использовать CPU-вычисления или облачные сервисы часто упираются в задержки или высокую стоимость. AMD Strix Halo — это гибридный процессор с мощной встроенной графикой, которая поддерживает до 256 ГБ/с пропускной способности памяти. Именно эта особенность позволила экспериментировать с нестандартными подходами. Ранее подобные ускорители использовались в основном для игр, но теперь они становятся инструментом для AI-инференса.
Технические подробности: архитектура и производительность
Ornith‑1.0‑35B основана на архитектуре Transformer с 35 миллиардами параметров. Модель обучалась на смеси кодовых и текстовых данных, что объясняет её успех в Terminal‑Bench и агентном кодинге. Для инференса использовался Vulkan-бэкенд llama.cpp — популярной библиотеки для запуска LLM. Пропускная способность памяти AMD Strix Halo до 256 ГБ/с оказалась решающим фактором: при 4-битной квантизации модель занимала около 18 ГБ в оперативной памяти, но благодаря быстрому доступу к данным удалось избежать узких мест. Скорость 99 ток/с была достигнута при размере батча 1 и контекстном окне 2048 токенов. При увеличении окна до 8192 токенов скорость падала до 45–50 ток/с — всё ещё впечатляющий результат.
Как это повлияет на разработчиков и бизнес?
Это открытие в первую очередь полезно разработчикам и AI-энтузиастам, которые хотят запускать большие модели локально без дорогих серверов. Владельцы ноутбуков с AMD Strix Halo или аналогичными APU теперь могут получить доступ к мощным языковым моделям прямо на своём устройстве. Для бизнеса это означает возможность развёртывания AI-агентов на периферии без облачных затрат. В российском контексте, где доступ к зарубежным GPU ограничен, такие решения особенно актуальны — они позволяют использовать доступное оборудование для сложных AI-задач. Однако стоит учитывать, что не все модели будут работать одинаково хорошо: успех зависит от архитектуры и возможности квантизации.
Что будет дальше
Разработчики планируют оптимизировать код для других гибридных процессоров, включая будущие поколения AMD и Intel. Также ожидается, что техника селективной квантизации будет внедрена в основные инструменты, такие как llama.cpp и Ollama. Возможно, в ближайшие месяцы мы увидим аналогичные эксперименты с моделями до 70 миллиардов параметров. Пока что Ornith‑35B остаётся демонстрацией возможностей, но уже сейчас можно скачать готовые сборки и попробовать запустить модель на своём ноутбуке.
Итог
Запуск Ornith‑35B на 8 ГБ VRAM — это не технический курьёз, а практическое доказательство, что современные методы оптимизации могут радикально снизить требования к оборудованию. Сочетание Vulkan, селективной квантизации и MTP позволило достичь скорости 99 ток/с, что делает локальный инференс больших моделей реальностью для обычных ноутбуков. Следите за развитием технологий — возможно, скоро такие возможности станут стандартом.