AMD и Cerebras создают платформу инференса ИИ с рекордно низкой задержкой
Компании AMD и Cerebras Systems объявили о стратегическом партнёрстве для создания высокопроизводительной платформы инференса — этапа выполнения уже обученных моделей искусственного интеллекта. В основе проекта лежит объединение графических процессоров AMD Instinct со специализированными ускорителям

Компании AMD и Cerebras Systems объявили о стратегическом партнёрстве для создания высокопроизводительной платформы инференса — этапа выполнения уже обученных моделей искусственного интеллекта. В основе проекта лежит объединение графических процессоров AMD Instinct со специализированными ускорителями Cerebras на базе памяти SRAM. Цель — достичь рекордно низкой задержки при обработке запросов, что критически важно для развивающегося направления агентного ИИ, где системы должны принимать решения в реальном времени.
AMD и Cerebras бросают вызов Nvidia и Groq
Партнёрство призвано составить конкуренцию существующим решениям на рынке инференса, в частности платформам Nvidia и Groq. Если GPU традиционно доминируют в обучении моделей, то для инференса требуется иной подход: высокая пропускная способность памяти и минимальные задержки. Cerebras известна своими гигантскими чипами Wafer-Scale Engine (WSE), которые содержат огромное количество вычислительных ядер и встроенной SRAM-памяти, что позволяет обрабатывать модели без обращений к внешней памяти. AMD, в свою очередь, предлагает мощные GPU Instinct, оптимизированные для рабочих нагрузок ИИ. Объединение этих технологий может создать гибридную систему, где GPU отвечают за вычислительные задачи, а ускорители Cerebras обеспечивают быстрый доступ к данным.
Предыстория и контекст: почему инференс стал узким местом
Долгое время основное внимание в индустрии ИИ уделялось обучению моделей — именно здесь GPU Nvidia заняли лидирующие позиции. Однако по мере внедрения ИИ в реальные приложения — от автономных автомобилей до финансовых алгоритмов — критическим стал этап инференса. Традиционные GPU, даже мощные, не всегда способны обеспечить задержки в миллисекунды, необходимые для агентных систем, которые должны анализировать данные и принимать решения без заметной паузы. Cerebras решила эту проблему на аппаратном уровне, разместив всю модель в SRAM на кристалле. AMD, стремясь расширить своё присутствие в ИИ-сегменте, нашла в Cerebras идеального партнёра для создания законченного решения.
Как работает новая платформа?
Платформа будет строиться на базе серверов, в которых установлены GPU AMD Instinct и ускорители Cerebras. Ключевая идея — разделение нагрузки: GPU занимаются тяжёлыми вычислениями, а ускорители Cerebras, благодаря встроенной SRAM-памяти, обеспечивают сверхбыстрый доступ к весам модели и промежуточным данным. Это позволяет избежать узкого места в виде внешней памяти DRAM, которая является основным источником задержек в традиционных системах. В результате инференс моделей, особенно небольших и средних, может выполняться в десятки раз быстрее, чем на одних GPU.
Технические подробности: архитектура и производительность
Cerebras использует чип WSE-3, который содержит 4 триллиона транзисторов и 44 ГБ встроенной SRAM. Этого достаточно для размещения моделей с сотнями миллиардов параметров непосредственно на кристалле. AMD Instinct MI300X, в свою очередь, обеспечивает до 192 ГБ памяти HBM3 с пропускной способностью 5,3 ТБ/с. В составе гибридной системы память GPU может использоваться для хранения больших моделей или кэширования данных, а SRAM-ускоритель — для операций с максимальными требованиями по задержке. Первые тесты показывают, что такая связка способна обрабатывать запросы к языковым моделям с задержкой менее 1 миллисекунды, что значительно ниже показателей Nvidia H100 (около 5–10 мс) и сопоставимо с Groq, который также использует SRAM.
Кого затронет и как: разработчики, бизнес и потребители
Для разработчиков ИИ-приложений появление новой платформы означает возможность создавать агентные системы, которые работают практически мгновенно. Это критично для чат-ботов реального времени, голосовых ассистентов, алгоритмов трейдинга и систем управления роботами. Бизнес, внедряющий ИИ, получит альтернативу дорогим решениям Nvidia, что может снизить стоимость инференса в долгосрочной перспективе. Потребители, в свою очередь, увидят более отзывчивые и интеллектуальные сервисы. В России и СНГ партнёрство может стимулировать локальных разработчиков к созданию гибридных систем на базе оборудования AMD и Cerebras, если поставки будут налажены.
Что будет дальше: дорожная карта и перспективы
Компании планируют представить первые коммерческие решения во второй половине 2025 года. Ожидается, что платформа будет доступна как в виде готовых серверов, так и в облаке через партнёров. Cerebras также работает над поддержкой популярных фреймворков, таких как PyTorch и TensorFlow, чтобы упростить миграцию разработчиков. Если партнёрство окажется успешным, AMD может значительно укрепить свои позиции в сегменте инференса, который, по прогнозам, будет расти быстрее рынка обучения. Nvidia и Groq, вероятно, ответят собственными гибридными архитектурами, что ускорит развитие всей отрасли.
Итог
Объединение AMD и Cerebras — это попытка создать платформу, которая сочетает сильные стороны GPU и специализированных SRAM-ускорителей. Если проект реализует заявленные характеристики, индустрия получит инструмент для инференса с рекордно низкой задержкой, открывающий новые возможности для агентного ИИ. Следить за развитием партнёрства стоит всем, кто работает с ИИ в реальном времени: от разработчиков до инвесторов.