Gemini 4 Argon лидирует в 13 из 19 тестов: втрое меньше галлюцинаций и вдвое дешевле Astra
Google запустила Gemini 4 Argon 30 сентября 2026 года, первую за семь месяцев модель уровня выше Flash, и она лидирует в 13 из 19 публичных тестов, опережая GPT-6 Astra и Claude Opus 5.5.

Впервые модель способна выдавать до 1 млн токенов (единиц текста) за один ответ, а галлюцинации (случаи, когда ИИ уверенно выдумывает факты) втрое ниже, чем у главного конкурента, при цене вдвое дешевле за задачу.
До сих пор Google DeepMind не обновляла линейку выше Flash с февраля 2026 года, когда вышла модель 3.1 Pro. За это время конкуренты выпустили модели класса Fable и Astra. Как сообщает AI-дайджест Latent Space, анонс Gemini 4 Argon стал ответом на вопрос, когда Google догонит рынок. Пока модель доступна только в ограниченном режиме для кибербезопасности, но доступ для разработчиков и бизнеса обещан «как можно скорее».
| Показатель | Значение | Источник |
|---|---|---|
| Место в тестах | Первое в 13 из 19 бенчмарков | TheRundownAI |
| DeepSWE (код) | 77,9% (против 74,2% у Opus 5.5 и 74,1% у Astra) | TheRundownAI |
| Intelligence Index | 53 балла (столько же у Astra, у GPT-6.1 Sol 52) | Artificial Analysis |
| Лимит вывода | До 1 млн токенов (с 64 тыс.) | GoogleAI |
| Стоимость (со скидкой) | $2 / $10 за млн токенов ввода / вывода | Artificial Analysis |
| Стоимость за задачу | $1,99 против $3,26 у Astra | Artificial Analysis |
| Галлюцинации (AA-Omniscience) | 15% против 51% у Astra | aipulseda1ly |
| Vals Index | 68,9%, первое место | ValsAI |
| Text Arena | 1525, первое место | Arena |
Что именно тестировали?
Gemini 4 Argon проверяли на 19 публичных бенчмарках (стандартных наборах задач, по которым сравнивают модели). Среди них задачи на написание кода (DeepSWE, Vibe Code Bench), агентную работу (AutomationBench-AA), математику, кибербезопасность (CyberBench) и общее качество ответов (Vals Index, Text Arena).
Отдельно измеряли «Long Decode Continuation» (длинное продолжение вывода). Это новая функция API (интерфейса для разработчиков), которая ставит длинный ответ на паузу и возобновляет его через повторные вызовы. По данным Artificial Analysis, именно так удалось выйти на 1 млн токенов вывода. При этом Vals фиксирует максимум в 262 тыс. токенов без этой функции.
Где Argon лидирует, а где отстаёт?
- Код. На DeepSWE Gemini 4 Argon набрала 77,9%. Opus 5.5 показала 74,2%, Astra 74,1%. На Vibe Code Bench модель безупречно собрала 30 приложений из 30 (у Opus 5 получилось 25, у Astra 24), по данным ValsAI.
- Агентная работа. Первое место на AutomationBench-AA с 77,5%. Но на Terminal Bench 4 результат 57%, это ниже, чем у Sonnet 5.5, Opus 5.5 и Astra, по данным ValsAI.
- Галлюцинации. 15% на AA-Omniscience против 51% у Astra. Но за низкий уровень выдумок модель платит точностью: 50% против 63% у Astra, по данным aipulseda1ly. Меньше врёт, но чаще не отвечает.
- Стоимость задачи. $1,99 за задачу со скидкой против $3,26 у Astra. Но экономия идёт от цены, а не от эффективности: Argon тратит в среднем 62 тыс. токенов вывода на задачу, а Astra всего 27 тыс., по данным Artificial Analysis.
- Кибербезопасность. 70% на CyberBench, 100% на задачах IOI 2024 до 2026, по данным ValsAI. Это объясняет, почему первый доступ получили именно специалисты по кибербезопасности в программе Fairwind.
- Юридические задачи. 19,6% на бенчмарке Harvey, тогда как Muse Spark 1.2 показывает 25,42%, по данным BlackHC. Слабое место.
Google сообщает о внутреннем применении: агенты на Argon освободили более 300 ТиБ памяти в дата-центрах и переводят более 800 тыс. строк кода с C/C++ на Rust. В одном случае агенты заменили 32 тыс. строк SIMD-кода (низкоуровневые инструкции процессора) безопасным Rust-кодом, ускорив работу видеодекодера в 2,7 раза.
Не все цифры бесспорны. Часть наблюдателей усомнилась в опубликованных результатах, указывая на возможную «подгонку под тесты» (benchmaxxing), когда модель оптимизируют под конкретные бенчмарки, а не под реальные задачи. Претензии касались в том числе результатов DeepSWE. Кроме того, лимит в 1 млн токенов достижим только через экспериментальную функцию Long Decode Continuation, а без неё Vals фиксирует максимум 262 тыс. На юридических задачах модель заметно уступает конкуренту. Модель пока недоступна для широкой публики: доступ ограничен программой Fairwind для госструктур и специалистов по кибербезопасности.
Что делать с этим прямо сейчас?
Разработчику и техническому автору. Gemini 4 Argon пишет код лучше всех текущих конкурентов на DeepSWE и Vibe Code Bench. Если вы строите агентов для автоматизации, стоимость $2/$10 за млн токенов (ввод/вывод) со скидкой делает длинные цепочки вызовов дешевле, чем у Astra ($3,26 за задачу). Дата окончания скидки не объявлена. Пример миграции 800 тыс. строк C/C++ на Rust через агентов можно использовать как шаблон для аналогичных проектов.
Автору Дзена и маркетологу. Миллион токенов вывода означает, что один запрос может генерировать объём текста размером с книгу. Для контент-конвейеров это снимает ограничение, когда приходилось дробить задачу на десятки вызовов. Но модель пока закрыта, так что планировать на неё рабочие процессы рано.
Предпринимателю в РФ и СНГ. Доступ к Gemini 4 Argon ограничен даже на глобальном рынке. В России сервисы Google и так работают с ограничениями. Из доступных в РФ инструментов для кодирования стоит смотреть на YandexGPT и GigaChat. Как только Argon откроют для разработчиков, доступ через API можно будет получить через VPN или партнёрские платформы, но пока это не рабочий вариант.
По моим наблюдениям, Google сделала ровно то, что от неё ждали: выкатила ответ на Astra с хорошими цифрами по коду и заметно низким уровнем галлюцинаций. Но есть два момента, которые я бы не стал игнорировать. Первый: модель тратит вдвое больше токенов на задачу, чем Astra. Дешевле за счёт цены, а не за счёт ума. Второй: доступ ограничен кибербезопасностью, и «как можно скорее» у Google может означать месяцы. Я бы сейчас экспериментировал с GPT-6.1 Sol, который по данным Artificial Analysis стоит $0,72 за задачу при тех же $2/$10 за токены и уже доступен шире.
Для тех, кто строит агентные системы, главная практическая новость не в том, что Argon лидирует в тестах, а в том, что миллион токенов вывода за один вызов снимает архитектурные ограничения. Как только модель выйдет из закрытого доступа, стоит первым делом проверить, держит ли Long Decode Continuation качество на ваших задачах, или 262 тыс. токенов без этой функции окажутся реальным потолком.
По данным Latent Space / AI News

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Новые модели ИИ вдвое дешевле, но OpenAI раскрыла 9 случаев потери контроля
Почему это важно Две крупнейшие лаборатории ИИ выпустили новые модели ИИ дешевле и точнее прежних, а OpenAI впервые публично раскрыла девять случаев, когда её…

OpenAI DevDay 2026: агенты Dots работают без пользователя, а Sol стоит в 5 раз дешевле Astra
Почему это важно OpenAI впервые сделала ставку не на новую модель, а на постоянно работающих ИИ-агентов с жёсткими границами контроля, и это напрямую касается…

Opus 5.5: нейросеть для генерации видео на 60% дешевле конкурентов возглавила SimpleBench
Opus 5.5 вышла на этой неделе и сразу возглавила рейтинг SimpleBench с результатом 88,4%, а сообщество признало её лучшей нейросетью для генерации…
Комментарии