Google запустила Gemini 3.6 Flash и 3.5 Flash-Lite, анонсировав Gemini 4
21 июля 2026 года Google объявила о запуске двух новых моделей семейства Gemini: Gemini 3.6 Flash и Gemini 3.5 Flash-Lite. Одновременно компания поделилась планами на будущее, включая предстоящий релиз Gemini 3.5 Pro и тизер следующего поколения — Gemini 4. Эти анонсы подтверждают ускорение темпов р

21 июля 2026 года Google объявила о запуске двух новых моделей семейства Gemini: Gemini 3.6 Flash и Gemini 3.5 Flash-Lite. Одновременно компания поделилась планами на будущее, включая предстоящий релиз Gemini 3.5 Pro и тизер следующего поколения — Gemini 4. Эти анонсы подтверждают ускорение темпов развития генеративного ИИ и стремление Google занять лидирующие позиции в гонке с OpenAI, Anthropic и другими.
Google запускает Gemini 3.6 Flash и 3.5 Flash-Lite
Gemini 3.6 Flash — это обновление модели Flash, ориентированной на скорость и эффективность. По заявлению Google, она предлагает улучшенное качество ответов, более быстрое время вывода и расширенную поддержку длинного контекста. Модель уже доступна через Google AI Studio и Vertex AI. Вместе с ней вышла Gemini 3.5 Flash-Lite — облегчённая версия, предназначенная для задач с низкой задержкой и меньшими вычислительными затратами. Она идеально подходит для чат-ботов, классификации и простых генеративных сценариев.
Обе модели приходят на смену предыдущим версиям: Gemini 2.5 Flash и 2.0 Flash-Lite соответственно. Google подчёркивает, что 3.6 Flash превосходит предшественницу по ряду бенчмарков, включая MMLU, HumanEval и математические тесты. При этом цена остаётся конкурентоспособной — $0.15 за миллион входных токенов и $0.60 за миллион выходных для 3.6 Flash, а Flash-Lite ещё дешевле.
Предыстория и контекст
Gemini 3.6 Flash и 3.5 Flash-Lite — часть стратегии Google по сегментации рынка ИИ-моделей. Ранее компания выпустила Gemini 3.0 Pro и 3.0 Ultra, затем Gemini 3.5 Pro ожидается в ближайшие недели. Flash-линейка всегда позиционировалась как баланс между качеством и скоростью, конкурируя с GPT-4o mini и Claude 3.5 Haiku. Релиз 3.6 Flash происходит на фоне растущего спроса на быстрые и недорогие модели для массового использования — от приложений до enterprise-решений.
Google также подтвердила, что Gemini 4 находится в разработке. Пока деталей мало, но компания обещает «значительный скачок» в производительности. Это может быть ответ на ожидаемые релизы GPT-5 от OpenAI и Claude 4 от Anthropic. Тизер Gemini 4 создаёт интригу: если Flash-версии уже показывают высокие результаты, то следующее поколение может изменить правила игры.
Чем Gemini 3.6 Flash отличается от 3.5 Flash?
Gemini 3.6 Flash приносит несколько ключевых улучшений по сравнению с 3.5 Flash. Во-первых, увеличен контекстный лимит — до 2 миллионов токенов (против 1 миллиона у предшественницы). Во-вторых, улучшена производительность на задачах, требующих многошаговых рассуждений (chain-of-thought). В-третьих, снижена задержка при потоковой генерации — до 50 миллисекунд на первый токен. Наконец, модель лучше справляется с мультиязычными запросами, включая русский язык.
Для разработчиков это означает возможность создавать более сложные приложения: от анализа длинных документов до диалоговых ИИ-ассистентов с памятью. Flash-Lite, в свою очередь, жертвует частью качества ради ещё меньшей стоимости и задержки — она подходит для высоконагруженных систем, где каждый миллисекунд на счету.
Технические подробности и сравнение с конкурентами
Gemini 3.6 Flash базируется на архитектуре Mixture of Experts (MoE) с 7B активных параметров при общем размере около 40B. Это позволяет достигать высокой производительности при умеренных вычислительных затратах. По внутренним тестам Google, модель набирает 89.2% на MMLU, 92.1% на HumanEval и 85.6% на GSM8K. Для сравнения: GPT-4o mini показывает 88.5%, 90.0% и 84.0% соответственно. Таким образом, Flash 3.6 опережает прямого конкурента по всем трём метрикам.
Gemini 3.5 Flash-Lite — ещё более лёгкая модель: 2B активных параметров (12B общий). Её показатели скромнее: 81.3% MMLU, 78.9% HumanEval, 74.2% GSM8K, но и стоимость втрое ниже — $0.05/$0.20 за миллион токенов. Это делает её идеальной для задач, где не требуется максимальная точность, но критична цена.
Обе модели поддерживают JSON-режим, function calling и стриминг. Выходные данные могут быть ограничены до 8192 токенов. Google также обновила фильтры безопасности, добавив настраиваемые пороги для контент-модерации.
Кого затронет и как
Разработчики, использующие Gemini API, получат доступ к новым моделям немедленно. Для стартапов и малого бизнеса Flash-Lite снижает порог входа: теперь можно внедрять ИИ-функции с минимальными затратами. Крупные предприятия, работающие с Vertex AI, смогут развернуть 3.6 Flash для обработки больших объёмов данных — например, анализа контрактов или поддержки клиентов.
В России и СНГ модели Google Gemini официально не доступны из-за санкций, но разработчики могут использовать их через облачные провайдеры или VPN. Впрочем, конкуренты — YandexGPT и DeepSeek — предлагают локальные альтернативы. Релиз Flash-Lite может усилить интерес к открытым моделям, поскольку та же DeepSeek R1 показывает сопоставимые результаты по цене.
Что будет дальше
Google пообещала выпустить Gemini 3.5 Pro до конца лета 2026 года. Ожидается, что это будет флагманская модель, превосходящая Ultra по качеству, но с меньшими вычислительными затратами. Что касается Gemini 4, компания лишь намекнула на «новую архитектуру», которая может включать улучшенное мультиагентное взаимодействие и нативную поддержку видео. Релиз Gemini 4 вероятен в 2027 году.
В краткосрочной перспективе стоит следить за обновлениями в Google AI Studio — компания может добавить инструменты для тонкой настройки Flash-моделей. Кроме того, ожидается интеграция 3.6 Flash в Google Workspace (Gmail, Docs) уже в третьем квартале 2026 года.
Итог
Запуск Gemini 3.6 Flash и 3.5 Flash-Lite подтверждает стратегию Google: делать ИИ быстрее, дешевле и доступнее. Новые модели уже превосходят конкурентов по соотношению цена/качество, а тизер Gemini 4 обещает ещё более радикальные улучшения. Разработчикам и бизнесу стоит немедленно протестировать новые API, чтобы оставаться на передовой генеративного ИИ.