Игорь Градов
Игорь Градов
5 мин
aggregator

Gemini 4 Argon лидирует в 13 из 19 тестов: втрое меньше галлюцинаций и вдвое дешевле Astra

Google запустила Gemini 4 Argon 30 сентября 2026 года, первую за семь месяцев модель уровня выше Flash, и она лидирует в 13 из 19 публичных тестов, опережая GPT-6 Astra и Claude Opus 5.5.

Gemini 4 Argon лидирует в 13 из 19 тестов: втрое меньше галлюцинаций и вдвое дешевле Astra
Почему это важно

Впервые модель способна выдавать до 1 млн токенов (единиц текста) за один ответ, а галлюцинации (случаи, когда ИИ уверенно выдумывает факты) втрое ниже, чем у главного конкурента, при цене вдвое дешевле за задачу.

До сих пор Google DeepMind не обновляла линейку выше Flash с февраля 2026 года, когда вышла модель 3.1 Pro. За это время конкуренты выпустили модели класса Fable и Astra. Как сообщает AI-дайджест Latent Space, анонс Gemini 4 Argon стал ответом на вопрос, когда Google догонит рынок. Пока модель доступна только в ограниченном режиме для кибербезопасности, но доступ для разработчиков и бизнеса обещан «как можно скорее».

Показатель Значение Источник
Место в тестах Первое в 13 из 19 бенчмарков TheRundownAI
DeepSWE (код) 77,9% (против 74,2% у Opus 5.5 и 74,1% у Astra) TheRundownAI
Intelligence Index 53 балла (столько же у Astra, у GPT-6.1 Sol 52) Artificial Analysis
Лимит вывода До 1 млн токенов (с 64 тыс.) GoogleAI
Стоимость (со скидкой) $2 / $10 за млн токенов ввода / вывода Artificial Analysis
Стоимость за задачу $1,99 против $3,26 у Astra Artificial Analysis
Галлюцинации (AA-Omniscience) 15% против 51% у Astra aipulseda1ly
Vals Index 68,9%, первое место ValsAI
Text Arena 1525, первое место Arena

Что именно тестировали?

Gemini 4 Argon проверяли на 19 публичных бенчмарках (стандартных наборах задач, по которым сравнивают модели). Среди них задачи на написание кода (DeepSWE, Vibe Code Bench), агентную работу (AutomationBench-AA), математику, кибербезопасность (CyberBench) и общее качество ответов (Vals Index, Text Arena).

Отдельно измеряли «Long Decode Continuation» (длинное продолжение вывода). Это новая функция API (интерфейса для разработчиков), которая ставит длинный ответ на паузу и возобновляет его через повторные вызовы. По данным Artificial Analysis, именно так удалось выйти на 1 млн токенов вывода. При этом Vals фиксирует максимум в 262 тыс. токенов без этой функции.

Где Argon лидирует, а где отстаёт?

  • Код. На DeepSWE Gemini 4 Argon набрала 77,9%. Opus 5.5 показала 74,2%, Astra 74,1%. На Vibe Code Bench модель безупречно собрала 30 приложений из 30 (у Opus 5 получилось 25, у Astra 24), по данным ValsAI.
  • Агентная работа. Первое место на AutomationBench-AA с 77,5%. Но на Terminal Bench 4 результат 57%, это ниже, чем у Sonnet 5.5, Opus 5.5 и Astra, по данным ValsAI.
  • Галлюцинации. 15% на AA-Omniscience против 51% у Astra. Но за низкий уровень выдумок модель платит точностью: 50% против 63% у Astra, по данным aipulseda1ly. Меньше врёт, но чаще не отвечает.
  • Стоимость задачи. $1,99 за задачу со скидкой против $3,26 у Astra. Но экономия идёт от цены, а не от эффективности: Argon тратит в среднем 62 тыс. токенов вывода на задачу, а Astra всего 27 тыс., по данным Artificial Analysis.
  • Кибербезопасность. 70% на CyberBench, 100% на задачах IOI 2024 до 2026, по данным ValsAI. Это объясняет, почему первый доступ получили именно специалисты по кибербезопасности в программе Fairwind.
  • Юридические задачи. 19,6% на бенчмарке Harvey, тогда как Muse Spark 1.2 показывает 25,42%, по данным BlackHC. Слабое место.

Google сообщает о внутреннем применении: агенты на Argon освободили более 300 ТиБ памяти в дата-центрах и переводят более 800 тыс. строк кода с C/C++ на Rust. В одном случае агенты заменили 32 тыс. строк SIMD-кода (низкоуровневые инструкции процессора) безопасным Rust-кодом, ускорив работу видеодекодера в 2,7 раза.

Как это читать

Не все цифры бесспорны. Часть наблюдателей усомнилась в опубликованных результатах, указывая на возможную «подгонку под тесты» (benchmaxxing), когда модель оптимизируют под конкретные бенчмарки, а не под реальные задачи. Претензии касались в том числе результатов DeepSWE. Кроме того, лимит в 1 млн токенов достижим только через экспериментальную функцию Long Decode Continuation, а без неё Vals фиксирует максимум 262 тыс. На юридических задачах модель заметно уступает конкуренту. Модель пока недоступна для широкой публики: доступ ограничен программой Fairwind для госструктур и специалистов по кибербезопасности.

Что делать с этим прямо сейчас?

Разработчику и техническому автору. Gemini 4 Argon пишет код лучше всех текущих конкурентов на DeepSWE и Vibe Code Bench. Если вы строите агентов для автоматизации, стоимость $2/$10 за млн токенов (ввод/вывод) со скидкой делает длинные цепочки вызовов дешевле, чем у Astra ($3,26 за задачу). Дата окончания скидки не объявлена. Пример миграции 800 тыс. строк C/C++ на Rust через агентов можно использовать как шаблон для аналогичных проектов.

Автору Дзена и маркетологу. Миллион токенов вывода означает, что один запрос может генерировать объём текста размером с книгу. Для контент-конвейеров это снимает ограничение, когда приходилось дробить задачу на десятки вызовов. Но модель пока закрыта, так что планировать на неё рабочие процессы рано.

Предпринимателю в РФ и СНГ. Доступ к Gemini 4 Argon ограничен даже на глобальном рынке. В России сервисы Google и так работают с ограничениями. Из доступных в РФ инструментов для кодирования стоит смотреть на YandexGPT и GigaChat. Как только Argon откроют для разработчиков, доступ через API можно будет получить через VPN или партнёрские платформы, но пока это не рабочий вариант.

Мнение редакции dzen.guru

По моим наблюдениям, Google сделала ровно то, что от неё ждали: выкатила ответ на Astra с хорошими цифрами по коду и заметно низким уровнем галлюцинаций. Но есть два момента, которые я бы не стал игнорировать. Первый: модель тратит вдвое больше токенов на задачу, чем Astra. Дешевле за счёт цены, а не за счёт ума. Второй: доступ ограничен кибербезопасностью, и «как можно скорее» у Google может означать месяцы. Я бы сейчас экспериментировал с GPT-6.1 Sol, который по данным Artificial Analysis стоит $0,72 за задачу при тех же $2/$10 за токены и уже доступен шире.

Для тех, кто строит агентные системы, главная практическая новость не в том, что Argon лидирует в тестах, а в том, что миллион токенов вывода за один вызов снимает архитектурные ограничения. Как только модель выйдет из закрытого доступа, стоит первым делом проверить, держит ли Long Decode Continuation качество на ваших задачах, или 262 тыс. токенов без этой функции окажутся реальным потолком.

По данным Latent Space / AI News

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Новые модели ИИ вдвое дешевле, но OpenAI раскрыла 9 случаев потери контроля
aggregator

Новые модели ИИ вдвое дешевле, но OpenAI раскрыла 9 случаев потери контроля

Почему это важно Две крупнейшие лаборатории ИИ выпустили новые модели ИИ дешевле и точнее прежних, а OpenAI впервые публично раскрыла девять случаев, когда её…

7 мин
OpenAI DevDay 2026: агенты Dots работают без пользователя, а Sol стоит в 5 раз дешевле Astra
aggregator

OpenAI DevDay 2026: агенты Dots работают без пользователя, а Sol стоит в 5 раз дешевле Astra

Почему это важно OpenAI впервые сделала ставку не на новую модель, а на постоянно работающих ИИ-агентов с жёсткими границами контроля, и это напрямую касается…

6 мин
Opus 5.5: нейросеть для генерации видео на 60% дешевле конкурентов возглавила SimpleBench
aggregator

Opus 5.5: нейросеть для генерации видео на 60% дешевле конкурентов возглавила SimpleBench

Opus 5.5 вышла на этой неделе и сразу возглавила рейтинг SimpleBench с результатом 88,4%, а сообщество признало её лучшей нейросетью для генерации…

5 мин