Следующий процессор может стать крупнейшим AI-апгрейдом: объясняем на примере Arm SME2
Ваш следующий смартфон или ноутбук может получить колоссальный прирост производительности в задачах искусственного интеллекта — и дело не только в нейронных процессорах. Британская компания Arm, чья архитектура лежит в основе практически всех мобильных процессоров, внедряет масштабное обновление сис

Ваш следующий смартфон или ноутбук может получить колоссальный прирост производительности в задачах искусственного интеллекта — и дело не только в нейронных процессорах. Британская компания Arm, чья архитектура лежит в основе практически всех мобильных процессоров, внедряет масштабное обновление системы команд, которое напрямую ускоряет AI-вычисления. Это изменение, известное как Scalable Matrix Extension 2 (SME2), уже используется в новейших чипах и вскоре появится в продуктах AMD и Intel.
Arm SME2: что это и как ускоряет AI
Arm SME2 — это второе поколение масштабируемых матричных расширений, которые позволяют процессору эффективно выполнять операции с матрицами — основу многих алгоритмов машинного обучения. В отличие от предыдущих инструкций Neon или SVE, SME2 оптимизирован для работы с данными произвольной точности, включая популярный формат INT8. Это означает, что процессор может обрабатывать больше нейросетевых вычислений за такт без необходимости обращаться к отдельному нейронному ускорителю.
Первые чипы с поддержкой SME2 уже появились: например, Arm Cortex-X925 и Cortex-A725, а также графические процессоры Immortalis-G925. Они используются в флагманских мобильных платформах вроде MediaTek Dimensity 9400 и будущих Snapdragon 8 Gen 4. По данным Arm, SME2 обеспечивает до 20% прироста производительности AI-задач по сравнению с предыдущим поколением. При этом энергопотребление остается на том же уровне, что критически важно для мобильных устройств.
Предыстория и контекст: гонка за AI на устройстве
AI-ускорение на устройстве (on-device AI) становится главным трендом в полупроводниковой индустрии. Производители чипов стремятся выполнять как можно больше нейросетевых вычислений локально, чтобы снизить задержки и повысить конфиденциальность данных. Ранее эту задачу решали выделенные нейронные процессоры (NPU), но они занимают место на кристалле и не всегда эффективны для всех типов моделей.
Arm SME2 предлагает альтернативный подход: встроить матричные вычисления непосредственно в общие ядра CPU. Это позволяет задействовать уже существующие вычислительные ресурсы, не требуя дополнительных блоков. Такой подход особенно важен для сценариев, где NPU недостаточно гибок — например, для обработки больших языковых моделей (LLM) или генеративного ИИ в реальном времени.
Как SME2 отличается от предыдущих версий?
Предыдущее поколение, SME, было представлено в 2022 году и поддерживало только операции с матрицами фиксированного размера. SME2 расширяет возможности: теперь можно работать с матрицами произвольных размеров, что упрощает реализацию различных нейросетевых слоёв. Кроме того, SME2 включает новые инструкции для работы с разреженными данными, что ускоряет модели с большим количеством нулевых весов — распространённый приём для сжатия нейросетей.
Для разработчиков это означает, что оптимизация AI-алгоритмов под SME2 может дать значительный прирост производительности без переписывания всего кода. Arm предоставляет компиляторные инструменты, которые автоматически используют новые инструкции, если целевой процессор их поддерживает.
Технические детали: архитектура и производительность
SME2 работает на уровне векторных регистров, размер которых может варьироваться от 128 до 2048 бит в зависимости от реализации. Это позволяет процессору обрабатывать до 256 операций INT8 за такт на одном ядре. Для сравнения, стандартные инструкции NEON обрабатывают лишь 16 операций. Таким образом, прирост производительности может достигать 16 раз в идеальных условиях.
Однако на практике прирост зависит от конкретной задачи и оптимизации ПО. В бенчмарках Geekbench AI, которые уже поддерживают SME2, новые чипы показывают улучшение на 30-50% по сравнению с предыдущим поколением. Важно отметить, что SME2 не заменяет NPU, а дополняет его: для тяжёлых задач, таких как обучение моделей, NPU всё ещё эффективнее, но для инференса (выполнения уже обученных моделей) CPU с SME2 может быть быстрее и экономичнее.
Кого затронет и как: от смартфонов до ПК
Первыми SME2 получат флагманские мобильные процессоры. MediaTek Dimensity 9400, ожидаемый в конце 2024 года, уже включает ядра Cortex-X925 с поддержкой SME2. Qualcomm Snapdragon 8 Gen 4, вероятно, последует этому примеру. Это означает, что уже в 2025 году большинство топовых смартфонов смогут запускать сложные AI-модели локально — например, для обработки фото, голосовых помощников или переводчиков в реальном времени.
Однако влияние SME2 выходит за пределы мобильного рынка. Arm также анонсировала, что будущие процессоры для ноутбуков на базе архитектуры Armv9 будут поддерживать SME2. Это касается и чипов Apple (серия M), и решений Qualcomm Snapdragon X Elite. Более того, AMD и Intel, которые лицензируют архитектуру Arm для некоторых своих продуктов, также могут внедрить SME2 в будущие гибридные чипы.
Для разработчиков ПО это открывает новые возможности: приложения, написанные с использованием SME2, смогут работать быстрее на всех устройствах с поддержкой этого расширения. Однако потребуется адаптация библиотек машинного обучения, таких как TensorFlow Lite и ONNX Runtime.
Что будет дальше: AI-процессоры без NPU?
В долгосрочной перспективе SME2 может снизить потребность в выделенных NPU. Если CPU сможет эффективно обрабатывать AI-задачи, производители смогут упростить дизайн чипов, уменьшив площадь и энергопотребление. Однако пока NPU остаются необходимыми для самых тяжёлых нагрузок. Скорее всего, будущие процессоры будут использовать гибридный подход: CPU с SME2 для лёгких и средних задач, а NPU — для интенсивных.
Arm уже работает над третьим поколением SME, которое может появиться в 2026 году. Ожидается поддержка более широких типов данных и ещё большая производительность. Также продолжается развитие конкурирующих технологий: Intel внедряет матричные расширения AMX в свои серверные процессоры, а AMD продвигает AVX-512 VNNI. Тем не менее, SME2 выглядит наиболее перспективным для массового рынка, так как Arm доминирует в мобильном сегменте и активно наращивает присутствие в ПК.
Итог
Arm SME2 — это не просто очередное обновление архитектуры, а фундаментальный сдвиг в том, как процессоры обрабатывают AI-нагрузки. Уже в ближайшие годы владельцы смартфонов и ноутбуков получат возможность запускать сложные нейросети локально, без задержек и без потери конфиденциальности. Следите за новыми чипами от MediaTek, Qualcomm и Apple — именно они первыми принесут эту технологию в ваши карманы и на рабочие столы.