Игорь Градов
Игорь Градов
6 мин
ai

Grok Build выходит в опенсорс: задача по коду обходится в 2,49 доллара против 11,80 у Claude Code

Grok Build выходит в опенсорс на Rust, а под капотом скрывается модель, которую xAI тихо обкатывает на живой арене и тренирует на триллионах токенов реальной разработки из Cursor.

Grok Build выходит в опенсорс: задача по коду обходится в 2,49 доллара против 11,80 у Claude Code
Почему это важно

xAI строит не отдельную модель, а замкнутый контур: модель плюс агентная среда плюс данные реальных разработчиков, и впервые выкладывает агентный runtime с открытым кодом, чтобы конкурировать с Cursor и Claude Code по цене за задачу.

Одиннадцатого августа пользователь Harshith обнаружил на LLM Arena четыре новых варианта, скрытых под именем Grok 4.5, и предположил, что это Grok 4.6 с разными уровнями «мыслительных усилий». Официальной карточки модели пока нет: в документации xAI на 12 августа значится только Grok 4.5 без отдельного идентификатора, цены и описания для версии 4.6. Параллельно xAI собирает связку продуктов: Grok Build, Workflows, Grok Bot, Grok Imagine Image 2.0 и обновлённый harness (оболочка, которая запускает модель, проверяет результат и управляет инструментами).

Показатель Значение Источник
Скорость инференса Grok 4.5 около 80 токенов в секунду xAI
Цена входных токенов Grok 4.5 2 доллара за миллион xAI
Цена выходных токенов Grok 4.5 6 долларов за миллион xAI
Output-токенов на задачу SWE-Bench Pro, Grok 4.5 15 954 xAI
Output-токенов на задачу SWE-Bench Pro, Opus 4.8 max 67 020 xAI
Стоимость задачи Grok 4.5 в Coding Agent Index около 2,49 доллара Artificial Analysis
Стоимость задачи GPT-5.5 в Codex 5,07 доллара Artificial Analysis
Стоимость задачи Fable 5 в Claude Code 11,80 доллара Artificial Analysis
Данные Cursor в обучении триллионы токенов взаимодействий разработчиков с агентом Cursor

Что здесь измеряли и проверяли?

Сообщество тестировало модель в двух плоскостях. Первая: классические кодовые задачи через SWE-Bench Pro (стандартный набор реальных багов из открытых проектов, которые модель должна починить сама). Вторая, и она интереснее: генерация интерактивных 3D-сцен с нуля по одному промпту (промпт, текстовая инструкция для модели).

Harshith просил модель собрать 3D-модель индийского локомотива WDP-4D на Three.js (библиотека для 3D в браузере). На низком уровне рассуждений модель выдала рабочий 3D-объект с характеристиками. На среднем добавила интерфейс, переключатели видов и техническую панель. На высоком локомотив стал визуально ближе к реальному: маркировка, кабины, тележки, параметры тяги.

Второй тест, Voxelcraft, мир в стиле Minecraft: меню, управление, блоки, дневные и ночные сцены. Здесь проверялась уже не отдельная модель объекта, а связность: модель собирает объект, сцену, интерфейс и поведение в один работающий прототип.

Что обнаружили?

  • Grok 4.5 тратит в 4,2 раза меньше выходных токенов на задачу, чем Opus 4.8 max на SWE-Bench Pro: 15 954 против 67 020. Меньше токенов при сопоставимом результате означает меньший счёт за каждую решённую задачу.
  • Стоимость задачи Grok 4.5 в агентном индексе Artificial Analysis составила около 2,49 доллара против 5,07 у GPT-5.5 в Codex и 11,80 у Fable 5 в Claude Code. Разница в два-пять раз.
  • Модель обучали на триллионах токенов данных Cursor. Cursor подтвердил это и уточнил: внутри не просто код, а следы реальной работы разработчиков. Как люди ходят по репозиторию, какие инструменты вызывают, где ошибаются, как чинят, как проверяют результат. Обучение шло совместно со SpaceXAI.
  • 3D-генерация вышла на уровень работающих прототипов. Раньше модели обычно ломались в двух местах: либо геометрия была приблизительной, либо интерактив переставал работать после первого клика. Здесь модель выдаёт запускаемый прототип с интерфейсом.
Как это читать: оговорки и ограничения

Grok 4.6 пока не существует официально. Нет карточки модели, нет цены, нет SLA, нет release notes. Всё, что известно, основано на наблюдениях тестеров за LLM Arena и тредах в X. Cursor отдельно признал риск загрязнения данных: ранний снимок кодовой базы Cursor случайно попал в обучающие данные и мог дать Grok 4.5 преимущество на CursorBench. Данные удалили для будущих моделей, но утверждать, что Grok 4.6 обучен на всей выборке Cursor, нельзя. Все цифры по стоимости задач относятся к конкретному индексу Artificial Analysis и могут отличаться от реальных сценариев.

Grok Build: агентный runtime с открытым кодом

Grok Build легко принять за терминал для промптов. В репозитории xai-org/grok-build лежит полноценный агентный runtime на Rust: интерактивный режим, режим без интерфейса для скриптов и CI (непрерывная интеграция, автоматическая сборка и проверка кода), протокол Agent Client Protocol для встраивания в редакторы, работа с файлами, shell-команды, поиск, MCP (протокол подключения внешних инструментов к модели), навыки, хуки, плагины, песочница, управление правами, субагенты.

Грубая аналогия: если Hermes от Anthropic для вас был «агентом, который живёт в проекте и сам себя контролирует», то Grok Build идёт в ту же сторону, только работает на токенах подписки Grok и с моделью xAI внутри.

В последних релизах xAI дорабатывала рабочую механику, а не маркетинг:

  • Запрос разрешений показывает конкретные shell-команды
  • MCP-изображения передаются без обрывов
  • Песочница стабильнее работает в больших директориях
  • Фоновые задачи можно отменять
  • Режимы plan, agent и ask стали предсказуемее
  • Контекст меньше ломается на больших git-репозиториях

Что это значит для вас?

Авторам Дзена и копирайтерам. Grok Build пока заточен под код, но паттерн «агент, который сам ходит по проекту, проверяет результат и дорабатывает» через полгода-год доберётся до контентных задач. Следите за тем, как работает агентный (agentic, когда ИИ сам решает, какие шаги предпринять) подход в коде: именно так будут устроены будущие инструменты для текста и вёрстки.

Маркетологам. Стоимость задачи в 2,49 доллара против 5-12 у конкурентов меняет экономику автоматизации. Если ваша команда уже использует ИИ-агентов для генерации лендингов, писем, прототипов, считайте заново.

Предпринимателям в РФ и СНГ. Grok Build доступен как опенсорс (открытый код) на GitHub, Rust-код можно развернуть локально. Модели xAI доступны через API, но в России могут быть ограничения по оплате и скорости. Из ближайших аналогов: Cursor работает через VPN, Claude Code официально недоступен в РФ. YandexGPT и GigaChat пока не предлагают сопоставимого агентного runtime для разработки.

Мнение редакции dzen.guru

Самое интересное здесь не модель, а данные. Триллионы токенов реальных сессий из Cursor, это не учебные задачки, а «грязная» разработка: сломанные окружения, неполные требования, агенты, которые ошибаются, и люди, которые их поправляют. Если модель действительно учится на таких траекториях, она оптимизируется не под «ответить красиво», а под «дотащить задачу до зелёных тестов». По моим наблюдениям, именно это отличает полезный инструмент от демо-игрушки. Но пока Grok 4.6 не получил официальную карточку, всё это остаётся обещанием, пусть и хорошо подкреплённым цифрами.

xAI строит не «ещё одну модель», а замкнутый контур: дешёвый инференс (инференс, работа модели на запросе пользователя), агентный runtime с открытым кодом и данные, которых нет ни у кого другого. Вопрос один: доведёт ли Маск эту связку до стабильного продукта или, как бывало, обгонит собственный дедлайн.

По данным наблюдений сообщества LLM Arena, тредов Harshith и J A Z I I в X, документации xAI и публикаций Cursor и Artificial Analysis

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

OpenAI новости: четвёртый топ-менеджер уходит перед IPO, компания теряет архитектора бизнеса
ai

OpenAI новости: четвёртый топ-менеджер уходит перед IPO, компания теряет архитектора бизнеса

Брэд Лайткэп, один из старейших руководителей OpenAI, объявил об уходе из компании, чтобы запустить собственный проект, и стал уже не первым топ-менеджером,…

4 мин
Google TV Freeplay добавил 10 000 фильмов по запросу: всё бесплатно и без подписки
ai

Google TV Freeplay добавил 10 000 фильмов по запросу: всё бесплатно и без подписки

Google запустила в Google TV Freeplay бесплатную библиотеку из более чем 10 000 фильмов и шоу по запросу, а число бесплатных телеканалов в сервисе выросло до…

3 мин
Xiaomi выпустила метрики удаления объектов с видео без эталона: оценка в 13,7 раза дешевле аналогов
ai

Xiaomi выпустила метрики удаления объектов с видео без эталона: оценка в 13,7 раза дешевле аналогов

Команда MiLM Plus из Xiaomi выпустила PROVE, набор метрик для оценки качества удаления объектов из видео без эталонного кадра, и статью приняли на конференцию…

6 мин