Как сообщество обучило Gemma рассуждать: хакатон Tunix на TPU от Google
На платформе Kaggle компания Google провела хакатон Tunix, поставив перед участниками амбициозную задачу: превратить небольшую базовую модель Gemma в полноценный движок рассуждений. Победители справились с этим, используя многоэтапные пайплайны пост-обучения, сочетающие Supervised Fine-Tuning (SFT)

На платформе Kaggle компания Google провела хакатон Tunix, поставив перед участниками амбициозную задачу: превратить небольшую базовую модель Gemma в полноценный движок рассуждений. Победители справились с этим, используя многоэтапные пайплайны пост-обучения, сочетающие Supervised Fine-Tuning (SFT) с продвинутыми методами выравнивания, такими как GRPO и SimPO. Этот эксперимент показал, что даже компактные открытые модели можно дообучить до уровня структурированного мышления, используя доступные ресурсы — в частности, Kaggle TPU.
Что произошло на хакатоне Tunix Хакатон Tunix стал площадкой, где сообщество Kaggle получило доступ к ограниченному вычислительному бюджету и TPU от Google. Участники должны были взять базовую версию Gemma — небольшой языковой модели с открытым весом — и улучшить её способность к логическим рассуждениям. Ключевой техникой, которая привела к успеху, стала комбинация SFT для начальной настройки и методов GRPO (Group Relative Policy Optimization) и SimPO (Simple Preference Optimization) для тонкой настройки предпочтений. Победители смогли реализовать полный цикл обучения в открытой среде, что ранее считалось прерогативой крупных лабораторий с огромными вычислительными мощностями.
Почему это важно для разработчиков ИИ Этот хакатон продемонстрировал, что барьер входа в разработку специализированных моделей ИИ значительно снижается. Если раньше для обучения моделей рассуждению требовались кластеры из тысяч GPU, то теперь достаточно одного TPU, доступного через Kaggle. Это открывает двери для небольших команд, стартапов и индивидуальных исследователей, которые могут создавать узкоспециализированные модели под свои задачи. Более того, успех Tunix показывает, что открытые модели, такие как Gemma, не уступают проприетарным аналогам в гибкости и потенциале дообучения.
Как проходило обучение: SFT, GRPO и SimPO Процесс пост-обучения состоял из нескольких этапов. Сначала модель проходила Supervised Fine-Tuning на размеченных данных, чтобы освоить базовые паттерны рассуждений. Затем применялись методы выравнивания: GRPO оптимизировал политику модели на основе групповых сравнений ответов, а SimPO упрощал этот процесс, используя предпочтения без сложных вычислений. Комбинация этих подходов позволила модели не просто запоминать ответы, а генерировать логически обоснованные цепочки мыслей. Участники отмечали, что ключевым фактором стало именно сочетание SFT и продвинутого выравнивания, а не какой-то один метод.
Какие ресурсы использовали участники Ограниченный вычислительный бюджет стал главным вызовом хакатона. Каждая команда имела доступ только к одному Kaggle TPU v3-8, что эквивалентно примерно 8 ядрам TPU. Для сравнения, обучение больших моделей вроде GPT-4 требует тысяч таких устройств. Тем не менее, победители смогли эффективно использовать TPU, оптимизировав пайплайны и применив техники, такие как градиентное накопление и смешанная точность. Это доказывает, что даже скромные ресурсы могут быть достаточны для серьёзных задач, если подойти к ним с умом.
Кого затронут результаты хакатона Прежде всего, это разработчики ИИ, которые ищут способы создавать рассуждающие модели без огромных бюджетов. Исследователи из академических кругов также выиграют, получив проверенный рецепт дообучения. Участники сообщества Kaggle теперь имеют практический пример, как использовать платформу для серьёзных AI-проектов. Наконец, любой, кто интересуется доступными методами обучения моделей рассуждению, может изучить подходы победителей и адаптировать их под свои нужды.
Что пока остаётся неизвестным Несмотря на успех, многие детали остаются за кадром. Архитектура победивших решений не раскрыта полностью — неизвестно, какие именно данные использовались для SFT и как настраивались гиперпараметры GRPO и SimPO. Точные метрики производительности, такие как точность на бенчмарках рассуждений, тоже не опубликованы. Кроме того, неясны планы Google по дальнейшей поддержке подобных инициатив: будет ли новый хакатон или расширение программы Tunix. Пока сообщество может лишь строить догадки, опираясь на общие принципы, озвученные организаторами.
Перспективы развития открытых моделей рассуждений Хакатон Tunix показал, что сообщество способно на многое, даже с ограниченными ресурсами. Возможно, в будущем мы увидим целую экосистему специализированных моделей, дообученных на TPU через Kaggle. Это может привести к демократизации ИИ, где каждый сможет создать своего «рассуждающего» ассистента. Однако для этого потребуется больше прозрачности от Google: открытые датасеты, бенчмарки и готовые пайплайны. Пока же успех Tunix остаётся вдохновляющим примером, но не готовым рецептом.