Kimi K3 на PAC1 и ECOM1: 204 задачи, результаты и анализ ошибок модели
Двадцать седьмого июля Moonshot AI открыла веса модели Kimi K3 и опубликовала её результаты на coding- и агентных бенчмарках. Мы решили проверить, как эти показатели переносятся на реальные рабочие операции — работу с файлами, счетами, корзинами, платежами, возвратами и отчётами. Для этого модель пр

Двадцать седьмого июля Moonshot AI открыла веса модели Kimi K3 и опубликовала её результаты на coding- и агентных бенчмарках. Мы решили проверить, как эти показатели переносятся на реальные рабочие операции — работу с файлами, счетами, корзинами, платежами, возвратами и отчётами. Для этого модель прошла 204 задачи из бенчмарков PAC1 и ECOM1, набрав 61/104 и 44,75/100 соответственно. В статье разбираются публичные трассы успешных задач и повторяющиеся отказы: нарушение точной схемы, частично выполненные транзакции, ошибки в длинных таблицах, неоптимальные маршруты и пропущенные проверки доверия. Все запуски и трассы доступны для проверки.
Результаты Kimi K3 на PAC1 и ECOM1
Moonshot AI представила Kimi K3 как модель, способную конкурировать с ведущими мировыми аналогами в задачах программирования и агентного взаимодействия. На PAC1, бенчмарке, оценивающем способность выполнять процедурные действия (например, работа с файлами и базами данных), модель показала 61 успешное выполнение из 104 задач. На ECOM1, ориентированном на электронную коммерцию (корзины, платежи, возвраты, отчёты), результат составил 44,75 балла из 100. Эти цифры были получены в ходе серии запусков, и все трассы опубликованы для независимой верификации.
Предыстория и контекст
Бенчмарки PAC1 и ECOM1 были разработаны для оценки агентных способностей языковых моделей в реалистичных бизнес-сценариях. PAC1 фокусируется на точности выполнения процедурных инструкций, а ECOM1 — на комплексных транзакциях в электронной коммерции. Ранее аналогичные тесты проходили модели от OpenAI, Anthropic и Google, но результаты Kimi K3 интересны именно открытым доступом к весам, что позволяет сообществу самостоятельно проверять и улучшать модель. Это особенно важно для задач, где требуется высокая надёжность, например, в финансовых операциях.
Какие типичные отказы показала модель?
При анализе трасс были выявлены несколько повторяющихся типов отказов. Во-первых, нарушение точной схемы: модель иногда игнорировала строгий формат ввода данных, что приводило к ошибкам валидации. Во-вторых, частично выполненные транзакции — например, создание заказа без подтверждения оплаты. В-третьих, ошибки в длинных таблицах: модель теряла строки или путала столбцы при работе с большими объёмами данных. Также отмечены неоптимальные маршруты (выбор не самого эффективного пути выполнения задачи) и пропущенные проверки доверия, такие как верификация пользователя перед списанием средств.
Технические детали: архитектура и подход
Kimi K3 построена на архитектуре, сочетающей разрежённое внимание и модуль планирования. Модель использует многоуровневый декодер с возможностью динамического выделения ресурсов на сложные подзадачи. В тестах на PAC1 и ECOM1 применялась версия с 32 миллиардами параметров, оптимизированная для агентных сценариев. Открытые веса позволяют разработчикам дообучать модель для конкретных бизнес-процессов, что может существенно повысить её точность на узких доменах.
Кого затронут результаты и как
Результаты Kimi K3 в первую очередь важны для разработчиков, создающих агентные системы для автоматизации бизнес-процессов. Например, компании, использующие ИИ для обработки счетов или управления корзинами, увидят, что модель пока ещё не готова к полностью автономной работе из-за ошибок в длинных таблицах и частичных транзакций. Однако для задач с чёткими, короткими инструкциями Kimi K3 может быть эффективна. Потребители вряд ли заметят изменения напрямую, но бизнесы, внедряющие такие модели, должны предусмотреть ручную верификацию критических операций. В России и СНГ открытая модель может быть интересна для локальной адаптации, особенно если требуется работа с русскоязычными документами.
Что будет дальше
Moonshot AI планирует продолжить улучшение модели, уделяя особое внимание снижению ошибок в длинных контекстах и повышению надёжности транзакций. Ожидается, что в ближайшие месяцы выйдет обновлённая версия с исправлениями выявленных отказов. Сообщество уже начало экспериментировать с дообучением Kimi K3 на специализированных датасетах, что может ускорить прогресс. Наиболее вероятный сценарий — модель станет основой для ряда нишевых решений в автоматизации документооборота и e-commerce, но до полной автономности ещё далеко.
Итог
Kimi K3 от Moonshot AI показала обнадёживающие, но не идеальные результаты на бенчмарках PAC1 и ECOM1. Модель успешно справляется с простыми процедурными задачами, но допускает характерные ошибки в сложных сценариях с длинными таблицами и многошаговыми транзакциями. Открытые веса дают сообществу возможность самостоятельно улучшать модель, что может привести к быстрому прогрессу в ближайшие месяцы. Если вы работаете с агентными системами, стоит внимательно изучить опубликованные трассы и учесть выявленные ограничения.