Игорь Градов
Игорь Градов
4 мин
ai

Gemini 3.7 Flash решил 7 открытых математических задач, работая без человека сутками

Google Antigravity в связке с Gemini 3.7 Flash доказала, что команда ИИ-агентов способна решать открытые математические задачи, проектировать процессоры и улучшать код крупных библиотек, работая автономно часами и днями без участия человека.

Gemini 3.7 Flash решил 7 открытых математических задач, работая без человека сутками
Почему это важно

Впервые публично показано, как многоагентная система на базе одной языковой модели закрывает задачи уровня ведущих научных конференций и вносит оптимизации в промышленный опенсорс-код, который используют тысячи разработчиков по всему миру.

Google обновила Teamwork, фреймворк (программную среду для совместной работы нескольких ИИ-агентов) внутри проекта Antigravity. Агенты в Teamwork умеют спорить друг с другом, критиковать решения и дорабатывать результат итерациями на протяжении часов или даже суток. Связка этого фреймворка с моделью Gemini 3.7 Flash ускорила решение задач сразу в трёх направлениях: математика, системная инженерия и вклад в открытые библиотеки.

Показатель Значение Источник
Решённые открытые математические задачи 7, по публикациям ведущих площадок FOCS и JMLR Google Antigravity Blog
Результат на TCSBench (бенчмарк по теоретической информатике) 71% Google Antigravity Blog
Ошибка тактовой точности RISC-V-симулятора 0,71% относительно аппаратного эталона Google Antigravity Blog
Ускорение вставки в ParlayHash 2 раза Google Antigravity Blog
Сокращение потребления памяти ParlayHash 25% Google Antigravity Blog

Что именно измеряли?

Teamwork устроен просто по идее, но сложно по реализации. Несколько ИИ-агентов (каждый на Gemini 3.7 Flash) получают общую задачу. Один предлагает решение, другой его критикует, третий ищет ошибки, четвёртый дорабатывает. Цикл повторяется, пока команда не сойдётся на результате или не исчерпает лимит итераций.

Представьте рабочую группу из пяти инженеров, где каждый проверяет работу соседа, только вместо людей работают копии одной модели с разными ролями. Google проверяла эту схему на задачах трёх типов: чистая математика с доказательствами, проектирование процессора с нуля, оптимизация реального кода в популярных библиотеках.

Семь задач, которые считались открытыми

Самый громкий результат: команда агентов решила семь открытых математических задач, опубликованных на площадках уровня FOCS (ведущая конференция по теоретической информатике) и JMLR (Journal of Machine Learning Research, один из главных журналов по машинному обучению).

Среди них:

  • Гипотеза Кнута о циклах. Доказательство формально верифицировано в Lean (язык для строгих математических доказательств, который не пропускает логических ошибок), объём доказательства превышает 40 страниц.
  • Разрежённая выпуклая оптимизация и доказуемая квантизация LLM (сжатие больших моделей с математической гарантией качества).
  • Факторизация префиксных матриц, задача из теории алгоритмов.

На бенчмарке TCSBench (набор тестов по теоретической информатике) система набрала 71%.

Процессор с нуля и промышленный код

В инженерной части агенты построили потактово точный симулятор процессора RISC-V (открытая архитектура, альтернатива ARM и x86) с внеочередным исполнением команд. Симулятор запустил операционную систему xv6 до командной строки. Расхождение с реальным железом составило 0,71% по тактам.

Для открытых библиотек агенты подготовили патчи, которые приняли мейнтейнеры:

  • Eigen (библиотека линейной алгебры, используется в тысячах проектов): добавлены SIMD-оптимизации (ускорение за счёт параллельной обработки данных процессором).
  • ParlayHash (хеш-таблица для параллельных вычислений): скорость вставки выросла вдвое, потребление памяти сократилось на 25%.

Важный нюанс: патчи не просто сгенерированы, а приняты в основную ветку кода. Это значит, что качество кода прошло ревью живых разработчиков.

Как это читать

Google не раскрыла, сколько итераций и вычислительных ресурсов потребовалось на каждое решение. Формулировка «часы или дни» не даёт понять стоимость одного прогона. Бенчмарк TCSBench пока не стал общепринятым стандартом, и 71% сложно сравнить с результатами других систем без единой таблицы лидеров. Все результаты опубликованы в блоге самой Google, независимой проверки на момент публикации нет.

Что это значит для вас?

Авторам Дзена и копирайтерам. Многоагентный подход, когда несколько ИИ-агентов критикуют друг друга, уже перестал быть лабораторной идеей. Если вы используете Gemini для генерации текста, имейте в виду: та же модель в связке с «командой» агентов способна неделями дорабатывать сложный результат. Для контента это пока избыточно, но для технических статей и аналитики горизонт применения близок.

Разработчикам в РФ и СНГ. Симулятор RISC-V и патчи в Eigen напрямую касаются вас: Eigen входит в стек многих российских ML-проектов, а RISC-V активно рассматривается как основа для отечественных процессоров. Автоматизация написания и оптимизации такого кода сокращает рутину на порядок.

Предпринимателям. Gemini 3.7 Flash доступна через Google AI Studio и Vertex AI. В России доступ возможен с ограничениями. Из локальных аналогов многоагентного подхода стоит следить за развитием YandexGPT и GigaChat, хотя публичных данных о подобных фреймворках у них пока нет.

Мнение редакции dzen.guru

Я обратил внимание на деталь, которая важнее цифр: патчи в Eigen и ParlayHash приняты живыми мейнтейнерами. Это не синтетический бенчмарк, а реальный код в продакшене. Для меня это самый убедительный аргумент в пользу того, что Gemini 3.7 Flash внутри многоагентной системы выдаёт результат промышленного качества. Но стоимость прогона Google не называет, и пока непонятно, окупается ли «команда агентов на несколько дней» по сравнению с одним опытным инженером за те же сутки. Жду независимых воспроизведений, тогда станет ясно, насколько результат зависит от инфраструктуры Google, а насколько от самой модели.

Факт остаётся: автономная команда ИИ-агентов на Gemini 3.7 Flash закрыла открытые математические задачи и внесла принятый код в библиотеки, которыми пользуются разработчики по всему миру, включая Россию.

По данным Google Antigravity Blog

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Circleback обнулил цену входа: инструменты для заметок с ИИ теряют платный порог
ai

Circleback обнулил цену входа: инструменты для заметок с ИИ теряют платный порог

Circleback, стартап из программы Y Combinator, 10 июня открыл бесплатный тариф для своего ИИ-блокнота встреч, чтобы перехватить пользователей на фоне резко…

4 мин
ai

Авито перевела 65 витрин данных с Vertica на Trino: локальные LLM справились без облака

Команда BI-разработчиков Авито поделилась инженерным решением, которое позволило перевести около 65 витрин данных с Vertica SQL на Trino SQL при помощи…

5 мин
ai

Автоматизация 1С нейросетями: агент уже правит код, но галлюцинации ломают конфигурации

Нейросети в 1С пока придумывают несуществующие процедуры, но уже правят конфигурации сами: пять свежих инструментов из «Базы знаний» Платформа Infostart.ru…

5 мин