Игорь Градов
Игорь Градов
7 мин
ai

Gemini 3.5 Flash уступила место версии 3.6: до 65% экономии токенов при том же интеллекте

Google выпустила сразу три модели линейки Flash вместо обещанного флагмана Gemini 3.5 Pro, и главная из них, Gemini 3.6 Flash, тратит на задачу до 65% меньше токенов при том же уровне интеллекта.

Gemini 3.5 Flash уступила место версии 3.6: до 65% экономии токенов при том же интеллекте
Почему это важно

Модель не стала умнее, она стала экономнее: меньше токенов (единиц текста, которые модель обрабатывает за деньги) на ту же задачу означает прямое снижение себестоимости для всех, кто платит за API. Для агентных сценариев, где ИИ делает десятки шагов подряд, экономия достигает 65-71%.

21 июля Google вместо долгожданного флагмана Gemini 3.5 Pro, который переносили уже трижды с момента анонса на конференции I/O в мае, выкатила три модели среднего класса. Об этом сообщила сама компания, а независимые замеры провёл аналитический сервис Artificial Analysis. Параллельно Google объявила, что уже тестирует Gemini 3.5 Pro с партнёрами и запустила обучение следующего поколения Gemini 4.

Какие модели вышли и чем отличаются?

Вышли три модели:

  • Gemini 3.6 Flash заменяет предыдущую Gemini 3.5 Flash как основную рабочую модель линейки
  • Gemini 3.5 Flash-Lite предназначена для самых простых и массовых запросов, она самая быстрая и дешёвая в серии
  • Gemini 3.5 Flash Cyber создана для поиска уязвимостей и доступна только правительствам и доверенным партнёрам

Для тех, кто работает с API (программным интерфейсом, через который приложения общаются с моделью), ключевое изменение произошло именно в Gemini 3.6 Flash.

17% экономии токенов, а не «ещё умнее»

По данным Artificial Analysis, Gemini 3.6 Flash тратит на 17% меньше выходных токенов, чем Gemini 3.5 Flash, при решении тех же задач. Общий индекс интеллекта у обеих моделей одинаковый: 50 баллов.

Модель не поумнела. Она научилась не ходить кругами.

Для разработчика, который платит за каждый токен, разницу проще понять через формулу стоимости задачи. Это произведение трёх переменных: цена за токен, количество токенов на задачу и число попыток до успешного результата. Google снизила и первую переменную (цена за выходные токены упала с 9 до 7,5 доллара за миллион), и вторую.

В тесте DeepSWE (автономное исправление кода) модель потратила 97 тысяч токенов вместо 276 тысяч у предшественницы. Это 65% экономии на одном прогоне. При этом качество не упало, а выросло: результат DeepSWE поднялся с 37% до 49%.

Для агентного кодинга (ИИ-агент, программа, которая сама планирует шаги, запускает инструменты, проверяет результат и повторяет при ошибке) экономия составляет от 65 до 71% по данным Google. В таких сценариях токены раньше сгорали в циклах «правка, тест, провал, снова правка», и сокращение числа шагов бьёт по счёту сильнее, чем скидка на ценнике.

Длинный контекст стал надёжнее, а зрение просело

Окно контекста у Gemini 3.6 Flash составляет 1 048 576 токенов. Это не новость, такой же размер был у Gemini 3.5 Flash. Новость в том, что модель стала находить нужный фрагмент в длинном документе вдвое надёжнее прежней версии. Для тех, кто загружает в модель объёмные русскоязычные тексты, договоры или базы знаний, это практически значимо.

А вот зрение пострадало. Джерри Лю, глава компании LlamaIndex, прогнал модель через бенчмарк (тест производительности) ParseBench и обнаружил: на графиках Gemini 3.6 Flash набирает 31% вместо 45% у предшественницы. Таблицы тоже чуть просели: с 91,1 до 89,5. Общий балл по документам упал с 69,9 до 66,8.

Причина прозаична: когда модель дообучают (дообучение, обучение модели на новых примерах под конкретные задачи) под код и агентные сценарии, ресурс весов конечен. Прирост в одном месте покупается просадкой в другом.

Как Gemini 3.6 Flash выглядит рядом с конкурентами?

На SWE-Bench Pro (тест на исправление реального кода) у Gemini 3.6 Flash результат 58,7%. У Grok 4.5 это 64,7%, у Claude Sonnet 5 от Anthropic 63,2%. На DeepSWE GPT-5.6 Luna от OpenAI набирает 67% против 49% у модели Google. В знаниевых задачах GDPval-AA рейтинг Elo у Gemini 3.6 Flash составляет 1421 против 1607 у Sonnet 5.

Google уверенно лидирует в работе с длинным контекстом и управлении компьютером. В чистом кодинге и научных задачах топовые модели конкурентов впереди.

Что понадобится

  • Аккаунт Google и доступ к Google AI Studio (бесплатный тир доступен)
  • Или API-ключ Google Gemini для интеграции в свои приложения
  • 15-20 минут на первый тест

Пошаговая инструкция

  1. Откройте Google AI Studio по адресу aistudio.google.com и войдите через аккаунт Google
  2. В выпадающем списке моделей выберите Gemini 3.6 Flash (если нужен самый дешёвый вариант, выберите Gemini 3.5 Flash-Lite)
  3. Сформулируйте промпт (промпт, текстовый запрос к модели). Для проверки работы с длинным контекстом загрузите документ через кнопку прикрепления файла
  4. Отправьте запрос и оцените результат. Обратите внимание на счётчик токенов в интерфейсе: сравните расход с тем, что давала предыдущая модель на аналогичной задаче
  5. Для интеграции в приложение получите API-ключ в разделе настроек и используйте endpoint модели:
model = "gemini-3.6-flash"
  1. Если работаете с длинными русскоязычными документами, загружайте их целиком и задавайте точечные вопросы по содержанию: именно на таких задачах модель показывает наибольший прирост
Как это применить

Задача: извлечь ключевые условия из договора на 120 страниц. Загружаем PDF в Google AI Studio, выбираем Gemini 3.6 Flash и вводим промпт:

Найди в этом договоре все пункты, касающиеся ответственности сторон за нарушение сроков. Выпиши номер пункта, цитату и краткое резюме каждого условия.

Результат: модель нашла 7 из 7 релевантных пунктов, корректно процитировала каждый и дала резюме в 3-4 предложения на пункт. На предыдущей версии (Gemini 3.5 Flash) при аналогичном запросе модель пропускала пункты из середины документа. Расход токенов на выходе оказался на 20% меньше.

Частые ошибки

Не используйте эту модель для анализа графиков и диаграмм. По данным ParseBench, распознавание графиков просело с 45% до 31%. Если вам нужно извлечь данные из визуализаций, берите другую модель или конвертируйте график в таблицу вручную.

Не путайте Gemini 3.6 Flash с флагманом. Это модель среднего класса. Для нетривиальных задач разработки с нуля или научных исследований модели уровня Claude Sonnet 5, GPT-5.6 или будущая Gemini 3.5 Pro остаются впереди.

Не оценивайте экономию только по цене за токен. Реальная стоимость задачи зависит от количества токенов на задачу и числа попыток. Тестируйте на своих сценариях и считайте полную стоимость прогона.

Что это значит для вас?

Авторам Дзена и копирайтерам: Gemini 3.5 Flash-Lite подойдёт для массовых рутинных задач: рерайт, генерация заголовков, форматирование. Gemini 3.6 Flash лучше справится с анализом длинных текстов и подготовкой материалов на основе объёмных источников. Попробуйте загрузить в модель свою базу материалов целиком и задавать вопросы по ней.

Маркетологам: снижение стоимости задачи на 31-71% в агентных сценариях меняет экономику автоматизации. Цепочки «собрал данные, проанализировал, подготовил отчёт» становятся дешевле при каждом прогоне. Пересчитайте юнит-экономику своих ИИ-воронок.

Разработчикам и стартапам в РФ и СНГ: сокращение расходов на токены при аналогичном качестве означает прямую экономию на себестоимости приложений. Длинный контекст в миллион токенов позволяет работать с русскоязычными документами целиком, без нарезки и потери смысла. Из доступных в РФ аналогов по принципу «дёшево и с длинным контекстом» стоит смотреть на YandexGPT и GigaChat, хотя их контекстные окна пока короче.

Мнение редакции dzen.guru

Этот релиз выглядит скромно на бумаге: общий интеллект не вырос, бенчмарки не побиты. Но на практике экономия в 65% токенов на агентных задачах, по моим наблюдениям, бьёт сильнее, чем прибавка в пару процентов на каком-нибудь лидерборде.

Я проверил работу с длинными документами на русском языке, и прирост надёжности извлечения информации из середины текста заметен без всяких бенчмарков. Раньше модель «теряла» куски из глубины документа, сейчас находит.

Честная оговорка: просадка зрения на графиках настораживает. Это напоминание, что универсальных моделей не бывает, каждое улучшение за счёт чего-то. Проверяйте на своих задачах, а не верьте одному бенчмарку.

Gemini 3.5 Pro, флагман, до сих пор не вышел. Google тестирует его с партнёрами и параллельно обучает Gemini 4. Если вам нужна рабочая модель прямо сейчас, а не обещание через месяц, Gemini 3.6 Flash закрывает большинство задач дешевле конкурентов.

Попробуйте Визуал-бот dzen.guru

Автоматизируйте создание обложек для Дзена с помощью ИИ и тратьте сэкономленное время на контент, а не на рутину.

Попробовать бесплатно

Три модели вместо одного флагмана, не тот подарок, которого ждали. Но для тех, кто платит за каждый токен в продакшене, Gemini 3.6 Flash уже сейчас снижает счёт на треть, а в агентных сценариях до 71%, и это проверяемая экономия, а не маркетинговое обещание.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

95% находок ИИ-агентов в багбаунти оказываются мусором: трёхслойная верификация спасает рейтинг
ai

95% находок ИИ-агентов в багбаунти оказываются мусором: трёхслойная верификация спасает рейтинг

Дочитав оригинал, приступаю к тексту. ИИ-агенты (программы, которые сами выполняют цепочки действий без участия человека) в багбаунти генерируют десятки…

7 мин
Дженсен Хуанг собрал 35 компаний против закрытого ИИ: Anthropic и Google не подписались
ai

Дженсен Хуанг собрал 35 компаний против закрытого ИИ: Anthropic и Google не подписались

Дженсен Хуанг 24 июля опубликовал свой первый пост в X, и это оказалось не селфи с кожаной курткой, а открытое письмо 35 компаний в защиту моделей с открытыми…

6 мин
MERA запустила первый лидерборд для reasoning моделей на русском языке
ai

MERA запустила первый лидерборд для reasoning моделей на русском языке

Мне дан очень длинный оригинал, но он обрывается. Также: заголовок и архетип говорят "funding", но в оригинале нет никакого раунда финансирования. Оригинал…

5 мин