Gemini 4 Argon лидирует в 12 из 18 тестов: что это значит для юристов и финансистов
Google Gemini 4 Argon пока закрыта для широкой публики, но уже сейчас можно разобраться, как модель работает с длинными документами и многошаговым анализом, чтобы подготовиться к запуску и понять, подойдёт ли она для ваших задач.

Argon выдаёт до миллиона токенов (токен, это кусочек текста, примерно три четверти английского слова; в русском на слово уходит больше токенов) за один ответ и, по таблице Google, лидирует в 12 из 18 тестов, включая юридические и финансовые бенчмарки (бенчмарк, стандартизированный экзамен для модели), что напрямую касается тех, кто работает с контрактами, налоговыми расчётами и длинными аналитическими текстами на русском.
Что стоит за цифрами Google?
30 сентября Google показала Gemini 4 Argon, свой первый флагман почти за год. По данным самой Google, модель опережает GPT-6 Astra, Claude Opus 5.5 и Claude Fable 5.1 в 12 тестах из 18. Argon фактически заменяет так и не вышедшую версию 3.5 Pro: до анонса лучшая модель Google, по данным индекса Artificial Analysis, отставала от лидера на 17 пунктов.
Пока доступ открыт только участникам Fairwind, спецпрограммы Google по кибербезопасности. Сундар Пичаи заявил, что доступ расширят, «как только это можно будет сделать безопасно». Сроков компания не назвала.
Что понадобится
- Аккаунт Google (для будущего доступа через API или интерфейс Gemini, когда модель откроют)
- Понимание своей задачи: какой документ анализировать, какой результат нужен
- Текст документа в электронном виде (контракт, налоговый расчёт, аналитическая записка)
- 15 минут на подготовку промпта (промпт, текстовая инструкция для модели) и проверку результата
Пошаговая инструкция: как подготовиться и использовать Argon для анализа длинных документов
-
Определите задачу конкретно. Не «проанализируй договор», а «найди в этом договоре аренды все пункты, которые позволяют арендодателю повысить ставку, и выпиши условия повышения с номерами пунктов». Gemini 4 Argon держит контекстное окно (контекстное окно, сколько входного текста модель удерживает «в голове» за раз) в 1 млн токенов, поэтому можно загрузить весь документ целиком, не разбивая на части.
-
Подготовьте документ. Скопируйте текст контракта или расчёта. Уберите колонтитулы, нумерацию страниц и мусорное форматирование. Чем чище вход, тем точнее выход.
-
Составьте промпт с ролью и форматом ответа.
Ты — юрист, специализирующийся на арендном праве РФ.
Вот полный текст договора аренды:
[вставьте текст]
Задача:
1. Найди все пункты, позволяющие арендодателю изменить арендную ставку.
2. Для каждого пункта укажи: номер, дословную цитату, условие активации, срок уведомления.
3. Оцени, какие из этих пунктов типичны для рынка, а какие необычны.
4. Ответ оформи таблицей.
-
Отправьте промпт одним сообщением. Argon способна выдать до миллиона токенов за один ответ (по пересчёту Google, это около 750 тысяч слов, больше «Войны и мира»). Поэтому не нужно просить «продолжи»: модель обработает запрос за один заход.
-
Проверьте результат вручную. Откройте оригинал документа и сверьте каждую цитату и номер пункта. Галлюцинации (галлюцинация, когда модель уверенно выдумывает то, чего не было) никуда не делись, ни одна модель от них не застрахована.
-
Итерируйте. Если ответ неполный, уточните: «Ты пропустил раздел 7. Проверь пункты 7.1 и 7.3 по тем же критериям».
Где Argon показывает лучшие результаты?
По таблице Google, самый заметный отрыв Gemini 4 Argon именно в «знаниевой» работе:
- Vals Index (оценка экономической пользы в финансах, коде, юриспруденции и налогах): 68,9% у Argon против 67% у Claude Opus 5.5
- Vals Finance Agent v2 (многошаговое финансовое исследование): 65,4% против 58,9% у ближайшего конкурента
- Harvey's Legal Agent Benchmark (юридические исследования и составление документов): 19,6% против 6,7% у Claude Fable 5.1
- AutomationBench от Zapier (доведение бизнес-процессов до конца): 51,3% против 42,5% у Opus 5.5
По длинному контексту модель тоже выделяется: на GraphWalks (обход графа, описанного прямо в промпте) от 256 тысяч до миллиона токенов Argon удерживает 84,2% против 71,8% у Astra.
Важный нюанс: результаты DeepSWE подсчитывала сама Google, а у конкурентов подсчёты проводили независимые компании. На Vals Index, Vibe Code Bench и ряде других тестов разрыв, по подсчётам издания The New Stack, меньше двух пунктов, то есть укладывается в погрешность.
Где модель проигрывает?
Argon уступает в пяти из 18 тестов:
- FrontierSWE v2: 55% против 65,5% у Astra
- Terminal-Bench 4.0: 57,4% против 66,4% у Opus 5.5
- PostTrainBench, Terminal-Bench Science и OSWorld-2.0 (управление компьютером)
На двух первых Argon замыкает список из четырёх моделей. Кроме того, на CWE-bench v1 модели OpenAI и Anthropic тестировались в своих агентских (агентный, способный самостоятельно выполнять цепочку действий) оболочках Codex и Claude Code, так что сравнивались не голые модели, а модели вместе с инструментами.
Как читать чужие бенчмарки за три вопроса?
Любую таблицу результатов стоит проверять тремя вопросами:
- Кто считал? Если компания считала свои результаты сама, это конфликт интересов.
- В какой обвязке? Обвязка (харнесс), программа, которая даёт модели инструменты вроде терминала и браузера. Разные обвязки дают разные цифры.
- Отрыв больше шума? Разница меньше двух пунктов не говорит почти ни о чём.
По данным Google, Opus 5.5 набрал 66,4% на Terminal-Bench 4.0. По методике Artificial Analysis тот же Opus 5.5 получил 59,6%, и разрыв с Argon (57,4%) сжимается с девяти пунктов примерно до двух. Настройки разные, напрямую сравнивать нельзя, но картина принципиально меняется.
Что делать прямо сейчас, по ролям?
Авторам Дзена и копирайтерам. Если вы работаете с длинными материалами (обзоры законодательства, разборы судебной практики, аналитические лонгриды), Gemini 4 Argon потенциально позволит загрузить весь массив источников одним промптом и получить структурированный черновик. Пока модель закрыта, отрабатывайте этот подход на Gemini 2.5 Pro с окном в 1 млн токенов, оно уже доступно. Из российских аналогов для длинных текстов можно пробовать YandexGPT и GigaChat, хотя их контекстные окна значительно меньше.
Юристам и финансистам. Harvey's Legal Agent Benchmark и Vals Finance Agent v2 показывают, что Argon лучше конкурентов справляется именно с многошаговым анализом документов. Для контрактов на русском языке это критично: в русском на слово приходится больше токенов, чем в английском, и миллионное окно здесь не роскошь, а необходимость для загрузки объёмного договора целиком.
Предпринимателям в РФ и СНГ. Прямого доступа к Gemini 4 Argon пока нет ни у кого, кроме участников программы Fairwind (кибербезопасность). Дату открытия Google не назвала. Готовьтесь: соберите типовые задачи, которые хотите автоматизировать, и протестируйте их на текущем Gemini 2.5 Pro через VPN или API. Когда Argon откроют, у вас будут готовые промпты.
Промпт:
Ты — налоговый консультант.
Вот текст договора поставки (47 страниц):
[вставьте текст]
1. Определи налоговые последствия для покупателя по НДС и налогу на прибыль.
2. Найди пункты, которые могут вызвать вопросы при налоговой проверке.
3. Предложи формулировки, снижающие налоговые риски.
4. Ответ структурируй по разделам договора.
На выходе (по логике работы модели с длинным контекстом) вы получите таблицу с номерами пунктов, цитатами из договора, описанием рисков и альтернативными формулировками. Весь документ обрабатывается за один заход, без разбивки на части.
Не доверяйте цифрам без проверки. Модель может «галлюцинировать» номера статей Налогового кодекса или ссылки на судебную практику. Каждую ссылку проверяйте в первоисточнике.
Не путайте бенчмарки с гарантией качества. 68,9% на Vals Index не означает, что модель правильно ответит на ваш конкретный вопрос. Бенчмарк показывает среднюю температуру по больнице.
Не загружайте конфиденциальные документы без оценки рисков. Данные, отправленные в облачную модель, могут использоваться для дообучения (дообучение, обучение модели на ваших примерах под узкую задачу), если это не запрещено условиями API. Читайте пользовательское соглашение.
Не игнорируйте разницу в токенизации. Русский текст расходует больше токенов, чем английский. Документ на 100 страниц по-русски займёт больше контекстного окна, чем такой же по-английски. Считайте заранее.
Gemini 4 Argon на бумаге выглядит убедительно для тех, кто работает с длинными документами на русском: юридические и финансовые бенчмарки дают заметный отрыв от конкурентов. Но я бы остудил энтузиазм по трём причинам.
Во-первых, таблицу составила сама Google, а часть результатов конкурентов взята из их же отчётов. Независимая проверка по методике Artificial Analysis уже сжала один разрыв с девяти до двух пунктов.
Во-вторых, все бенчмарки проводились на английском. Как Argon справится с русскоязычными контрактами и налоговыми расчётами, пока не проверял никто.
В-третьих, доступа нет. Модель закрыта даже для разработчиков, не говоря об авторах и бизнесе.
Что делать сейчас: возьмите свою самую муторную аналитическую задачу (разбор договора, сверка отчётности, анализ судебной практики), оформите её в промпт по схеме из инструкции выше и прогоните через Gemini 2.5 Pro. Когда Argon откроют, вы запустите тот же промпт и сразу увидите, стоит ли переходить.
Напишите свой первый рабочий промпт
В бесплатном генераторе промптов dzen.guru подставьте свою задачу и получите готовую инструкцию для любой модели, включая Gemini.
Попробовать генераторТри вещи, которые стоит запомнить из этого анонса: миллион токенов на выходе меняет подход к длинным документам, юридические и финансовые тесты у Argon действительно сильнее конкурентов по таблице Google, но таблицу составлял сам производитель, и до независимой проверки на русском языке относитесь к цифрам как к заявке, а не к факту.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Microsoft выпустила нейросеть для распознавания речи: первое место среди 38 моделей при WER 2,5%
Microsoft первого октября выпустила MAI Transcribe 2 Streaming, свою первую нейросеть для распознавания речи в реальном времени, которая, по независимым…
NVIDIA DGX Spark 64GB для локальных ИИ агентов
Microsoft второго июня запустила DGX Spark 64GB, компактный настольный компьютер на суперчипе Grace Blackwell, который позволяет держать ИИ-агентов и открытые…
Datalab открыла бенчмарки нейросетей для всех: 620 документов, 6 типов вердиктов, Apache 2.0
Microsoft второго июня запустила OmniExtractBench, и нет, подождите, это не Microsoft. Перечитаю источник внимательно. Компания Datalab выпустила…
Комментарии