Как AT&T и Microsoft обработали триллион токенов для ИИ на AMD и NVIDIA
AT&T и Microsoft совместно обработали около одного триллиона токенов для обучения ИИ-модели OTel2.0, используя платформу Microsoft Foundry Managed Compute, открытые модели ИИ и графические процессоры AMD и NVIDIA. Это первый случай, когда столь масштабная нагрузка выполнена на гибридной инфраструкту

AT&T и Microsoft совместно обработали около одного триллиона токенов для обучения ИИ-модели OTel2.0, используя платформу Microsoft Foundry Managed Compute, открытые модели ИИ и графические процессоры AMD и NVIDIA. Это первый случай, когда столь масштабная нагрузка выполнена на гибридной инфраструктуре с участием ускорителей AMD, что открывает новые возможности для телеком-индустрии и бизнеса, стремящегося к масштабированию ИИ без привязки к одному поставщику.
Как AT&T и Microsoft обработали триллион токенов
Проект стартовал в 2024 году, когда AT&T решила модернизировать свою систему обработки данных с помощью искусственного интеллекта. Компания выбрала Microsoft Foundry — платформу для разработки и развертывания ИИ-решений, предоставляющую управляемые вычислительные ресурсы. Для обучения модели OTel2.0, предназначенной для анализа телекоммуникационных данных, потребовалось обработать около триллиона токенов. Это эквивалентно нескольким миллионам книг или всему объему текстов, доступных в открытом интернете.
Инфраструктура включала кластеры графических процессоров AMD Instinct MI300X и NVIDIA H100. AT&T использовала открытые модели, такие как Llama и Mistral, адаптированные под свои задачи. Microsoft Foundry обеспечил автоматическое масштабирование ресурсов, что позволило выполнить обучение за приемлемое время — несколько недель, а не месяцев. Гибридная архитектура продемонстрировала, что разнородное оборудование может эффективно работать вместе под управлением единой платформы.
Почему AT&T выбрала Microsoft Foundry и AMD?
AT&T уже несколько лет инвестирует в ИИ для оптимизации сетей, обслуживания клиентов и анализа данных. Однако предыдущие проекты были ограничены масштабом: компания могла обрабатывать лишь миллиарды токенов. Переход на триллион стал возможен благодаря партнерству с Microsoft и использованию AMD. Ранее Microsoft активно продвигала свои собственные ускорители Maia, но в этом проекте ставка сделана на открытые стандарты и совместимость с разными GPU. AMD, в свою очередь, стремится закрепиться на рынке ИИ-ускорителей, который сейчас доминирует NVIDIA. Участие в таком крупном проекте — важный сигнал для рынка: AMD может конкурировать в сегменте высокопроизводительных вычислений.
Для AT&T выбор AMD также был стратегическим: это снижает зависимость от одного поставщика и позволяет использовать более доступные по цене ускорители. Microsoft Foundry, в свою очередь, предоставил гибкость в управлении ресурсами и интеграцию с облачными сервисами Azure.
Какие технологии использовались для обработки триллиона токенов
Обучение модели OTel2.0 проводилось на кластере из тысяч графических процессоров AMD Instinct MI300X и NVIDIA H100. Microsoft Foundry Managed Compute динамически распределял нагрузку, обеспечивая максимальную утилизацию ресурсов. Использовались открытые модели с архитектурой Transformer, которые дообучались на телеком-данных AT&T. Для обработки триллиона токенов потребовалось несколько недель непрерывной работы.
Ключевой особенностью стала поддержка AMD ROCm — открытого программного стека для GPU, который совместим с популярными фреймворками, такими как PyTorch и TensorFlow. Это позволило легко переносить код между разными типами ускорителей. По заявлениям Microsoft, производительность AMD MI300X в задачах обучения была сопоставима с NVIDIA H100, хотя точные цифры не раскрываются. Использование открытых моделей, таких как Llama и Mistral, также упростило адаптацию под специфические задачи телекома.
Какие преимущества дает обработка триллиона токенов для телеком-индустрии?
Телеком-компании генерируют огромные объемы данных: сетевые логи, записи звонков, метрики качества обслуживания. Обработка этих данных вручную невозможна, а традиционные алгоритмы не справляются с масштабом. ИИ-модели, обученные на триллионах токенов, способны выявлять аномалии, прогнозировать сбои и автоматизировать рутинные задачи. Для AT&T модель OTel2.0 станет основой для новых продуктов, включая интеллектуальную маршрутизацию трафика и систему раннего предупреждения о перегрузках.
Масштабирование до триллиона токенов позволяет модели улавливать сложные паттерны, которые были бы незаметны при меньших объемах данных. Это особенно важно для телекома, где сетевые события могут быть редкими, но критическими. Кроме того, использование открытых моделей и гибридной инфраструктуры снижает затраты и ускоряет внедрение ИИ в отрасли.
Кого затронет этот проект и как?
Разработчики ИИ-решений для телекома и других отраслей получают подтверждение, что масштабирование до триллионов токенов возможно на открытых платформах. Бизнес, использующий Microsoft Foundry, может рассчитывать на снижение затрат за счет выбора более дешевых GPU AMD. Для российских компаний, сталкивающихся с ограничениями на поставки NVIDIA, это альтернативный путь: AMD доступна на рынке, а открытые модели не требуют лицензионных отчислений.
Конкуренты — NVIDIA и облачные платформы, такие как AWS и Google Cloud, — получают вызов: им придется доказывать, что их проприетарные решения лучше открытых экосистем. В то же время, партнерство AT&T и Microsoft укрепляет позиции Azure в сегменте ИИ-инфраструктуры.
Что будет дальше: планы AT&T, Microsoft и AMD
AT&T планирует внедрить OTel2.0 в производственные системы к концу 2025 года. Microsoft продолжит развивать Foundry, добавляя поддержку новых GPU и моделей. AMD, вероятно, будет использовать этот кейс для продвижения Instinct MI400, выход которого ожидается в 2026 году. В более широком смысле, проект демонстрирует тренд на гетерогенные вычисления, где заказчики не привязаны к одному поставщику.
Ожидается, что другие телеком-компании последуют примеру AT&T, особенно те, кто ищет способы снизить затраты на ИИ-инфраструктуру. Microsoft Foundry может стать стандартом для управления такими проектами, а AMD — получить долю рынка, ранее принадлежавшую NVIDIA.
Итог
Совместный проект AT&T и Microsoft с использованием AMD — это веха в масштабировании ИИ: триллион токенов обработан на открытой платформе с разнородным оборудованием. Это доказывает, что крупные телеком-компании могут внедрять ИИ без привязки к одному вендору, снижая риски и затраты. Следите за развитием этой истории: она задает стандарты для всей индустрии.