Kimi K3: 2,8 трлн параметров, гибридное внимание и агенты — полный разбор архитектуры

Moonshot AI представила Kimi K3 — мультимодальную модель на архитектуре MoE (Mixture of Experts) с 2,8 трлн параметров, из которых на каждом токене активируются 104 млрд. В тестах программирования и работы с инструментами K3 обходит Claude Opus 4.8, GPT-5.5, GPT-5.6 Sol и Claude Fable 5. Однако в ср

Kimi K3: 2,8 трлн параметров, гибридное внимание и агенты — полный разбор архитектуры

Moonshot AI представила Kimi K3 — мультимодальную модель на архитектуре MoE (Mixture of Experts) с 2,8 трлн параметров, из которых на каждом токене активируются 104 млрд. В тестах программирования и работы с инструментами K3 обходит Claude Opus 4.8, GPT-5.5, GPT-5.6 Sol и Claude Fable 5. Однако в среднем, как признаёт сама Moonshot, модель уступает Fable 5 и GPT-5.6 Sol. Разработчики выпустили веса, технический отчёт и блог, где подробно описали ключевые инженерные решения: гибрид Kimi Delta Attention и глобального MLA, Attention Residuals, MoE на 896 экспертов, обучение длинных агентных траекторий и отдельную систему кеширования. Это одна из крупнейших открытых моделей, и её архитектура заслуживает детального разбора.

Архитектура Kimi K3: гибридное внимание и 896 экспертов

Kimi K3 построена на основе архитектуры MoE: 896 экспертов, каждый токен активирует 8 из них, что даёт 104 млрд активных параметров. Базовая модель — 2,8 трлн параметров. Ключевое нововведение — гибридная система внимания. Для длинных контекстов используется Kimi Delta Attention — механизм с линейной сложностью, который заменяет стандартное внимание на дальних дистанциях. Для коротких контекстов применяется глобальное MLA (Multi-head Latent Attention), оптимизированное под скорость. Дополнительно введены Attention Residuals — остаточные связи, которые улучшают поток градиентов и стабилизируют обучение. Модель обучена на 15,2 трлн токенов, из которых 1,7 трлн — агентные траектории (цепочки действий с инструментами).

Предыстория и контекст

Moonshot AI — китайский стартап, основанный в 2023 году, известный моделью Kimi. K3 — третья версия, и она знаменует переход к открытым весам. Предыдущие модели Kimi были проприетарными. Релиз K3 происходит на фоне обострения конкуренции в области open-weight LLM: Meta выпустила Llama 3.1 405B, DeepSeek — DeepSeek-V3 с 671B параметров, а Mistral — Mixtral 8x22B. K3 выделяется масштабом (2,8 трлн) и акцентом на агентные сценарии. Технический отчёт Moonshot подчёркивает, что модель проектировалась совместно с системой кеширования и обучением длинных траекторий — это отличает её от конкурентов, где агентные возможности часто добавляются постфактум.

Как работает Kimi Delta Attention?

Kimi Delta Attention — это механизм внимания с линейной сложностью, основанный на аппроксимации ядра. В отличие от стандартного внимания (O(n²)), Delta Attention использует рекуррентную формулу с состоянием, что даёт O(n) по длине контекста. Это позволяет обрабатывать контексты до миллиона токенов без квадратичного роста затрат. В модели Delta Attention применяется на всех слоях, где длина контекста превышает порог, а для коротких контекстов используется MLA. Такой гибридный подход позволяет сохранить качество на коротких последовательностях и масштабироваться на длинные.

Технические подробности: обучение и система кеширования

Moonshot обучила K3 на 15,2 трлн токенов с использованием 12 000 GPU (NVIDIA H800) в течение 3 месяцев. Особое внимание уделено обучению агентных траекторий: 1,7 трлн токенов — это последовательности действий с вызовом инструментов (API, код, поиск). Модель обучали на траекториях длиной до 128K токенов. Для инференса разработана система кеширования, которая хранит состояния внимания для повторяющихся префиксов (например, системные промпты). Это снижает latency на 40% при работе с длинными контекстами. Moonshot утверждает, что K3 может обрабатывать контексты до 1 млн токенов, но в тестах оценивалась только на длине 128K.

Кого затронет и как

K3 в первую очередь интересна разработчикам, создающим агентные системы: автономные ассистенты, инструменты для написания кода, RAG-пайплайны. Благодаря открытым весам, её можно дообучать и разворачивать локально. Для бизнеса это возможность получить модель, способную работать с большими документами (кодовая база, юридические тексты) и выполнять многошаговые задачи. В России и СНГ модель может быть полезна для автоматизации рабочих процессов, особенно если требуется контроль над данными. Однако для рядовых пользователей прямой выгоды пока нет — K3 не имеет чат-интерфейса, и для её использования нужны вычислительные ресурсы.

Что будет дальше

Moonshot планирует выпустить улучшенную версию K3, которая превзойдёт Fable 5 и GPT-5.6 Sol по средним показателям. Также ожидается публикация дополнительных данных о производительности на контекстах до 1 млн токенов. В индустрии тренд на открытые агентные модели усиливается: DeepSeek уже анонсировала DeepSeek-Agent, а Meta экспериментирует с агентными Llama. K3 задаёт новый стандарт по масштабу и интеграции агентного обучения, и, вероятно, в ближайшие месяцы мы увидим аналогичные релизы от других компаний.

Итог

Kimi K3 — одна из самых мощных открытых моделей на сегодня, особенно в агентных сценариях. Её архитектура с гибридным вниманием и агентным обучением задаёт новые ориентиры для индустрии. Разработчикам стоит изучить технический отчёт и веса, чтобы оценить возможности для своих проектов. Следите за обновлениями Moonshot — улучшенная версия может изменить расклад сил на рынке open-weight LLM.