Grok Build выходит в опенсорс: задача по коду обходится в 2,49 доллара против 11,80 у Claude Code
Grok Build выходит в опенсорс на Rust, а под капотом скрывается модель, которую xAI тихо обкатывает на живой арене и тренирует на триллионах токенов реальной разработки из Cursor.

xAI строит не отдельную модель, а замкнутый контур: модель плюс агентная среда плюс данные реальных разработчиков, и впервые выкладывает агентный runtime с открытым кодом, чтобы конкурировать с Cursor и Claude Code по цене за задачу.
Одиннадцатого августа пользователь Harshith обнаружил на LLM Arena четыре новых варианта, скрытых под именем Grok 4.5, и предположил, что это Grok 4.6 с разными уровнями «мыслительных усилий». Официальной карточки модели пока нет: в документации xAI на 12 августа значится только Grok 4.5 без отдельного идентификатора, цены и описания для версии 4.6. Параллельно xAI собирает связку продуктов: Grok Build, Workflows, Grok Bot, Grok Imagine Image 2.0 и обновлённый harness (оболочка, которая запускает модель, проверяет результат и управляет инструментами).
| Показатель | Значение | Источник |
|---|---|---|
| Скорость инференса Grok 4.5 | около 80 токенов в секунду | xAI |
| Цена входных токенов Grok 4.5 | 2 доллара за миллион | xAI |
| Цена выходных токенов Grok 4.5 | 6 долларов за миллион | xAI |
| Output-токенов на задачу SWE-Bench Pro, Grok 4.5 | 15 954 | xAI |
| Output-токенов на задачу SWE-Bench Pro, Opus 4.8 max | 67 020 | xAI |
| Стоимость задачи Grok 4.5 в Coding Agent Index | около 2,49 доллара | Artificial Analysis |
| Стоимость задачи GPT-5.5 в Codex | 5,07 доллара | Artificial Analysis |
| Стоимость задачи Fable 5 в Claude Code | 11,80 доллара | Artificial Analysis |
| Данные Cursor в обучении | триллионы токенов взаимодействий разработчиков с агентом | Cursor |
Что здесь измеряли и проверяли?
Сообщество тестировало модель в двух плоскостях. Первая: классические кодовые задачи через SWE-Bench Pro (стандартный набор реальных багов из открытых проектов, которые модель должна починить сама). Вторая, и она интереснее: генерация интерактивных 3D-сцен с нуля по одному промпту (промпт, текстовая инструкция для модели).
Harshith просил модель собрать 3D-модель индийского локомотива WDP-4D на Three.js (библиотека для 3D в браузере). На низком уровне рассуждений модель выдала рабочий 3D-объект с характеристиками. На среднем добавила интерфейс, переключатели видов и техническую панель. На высоком локомотив стал визуально ближе к реальному: маркировка, кабины, тележки, параметры тяги.
Второй тест, Voxelcraft, мир в стиле Minecraft: меню, управление, блоки, дневные и ночные сцены. Здесь проверялась уже не отдельная модель объекта, а связность: модель собирает объект, сцену, интерфейс и поведение в один работающий прототип.
Что обнаружили?
- Grok 4.5 тратит в 4,2 раза меньше выходных токенов на задачу, чем Opus 4.8 max на SWE-Bench Pro: 15 954 против 67 020. Меньше токенов при сопоставимом результате означает меньший счёт за каждую решённую задачу.
- Стоимость задачи Grok 4.5 в агентном индексе Artificial Analysis составила около 2,49 доллара против 5,07 у GPT-5.5 в Codex и 11,80 у Fable 5 в Claude Code. Разница в два-пять раз.
- Модель обучали на триллионах токенов данных Cursor. Cursor подтвердил это и уточнил: внутри не просто код, а следы реальной работы разработчиков. Как люди ходят по репозиторию, какие инструменты вызывают, где ошибаются, как чинят, как проверяют результат. Обучение шло совместно со SpaceXAI.
- 3D-генерация вышла на уровень работающих прототипов. Раньше модели обычно ломались в двух местах: либо геометрия была приблизительной, либо интерактив переставал работать после первого клика. Здесь модель выдаёт запускаемый прототип с интерфейсом.
Grok 4.6 пока не существует официально. Нет карточки модели, нет цены, нет SLA, нет release notes. Всё, что известно, основано на наблюдениях тестеров за LLM Arena и тредах в X. Cursor отдельно признал риск загрязнения данных: ранний снимок кодовой базы Cursor случайно попал в обучающие данные и мог дать Grok 4.5 преимущество на CursorBench. Данные удалили для будущих моделей, но утверждать, что Grok 4.6 обучен на всей выборке Cursor, нельзя. Все цифры по стоимости задач относятся к конкретному индексу Artificial Analysis и могут отличаться от реальных сценариев.
Grok Build: агентный runtime с открытым кодом
Grok Build легко принять за терминал для промптов. В репозитории xai-org/grok-build лежит полноценный агентный runtime на Rust: интерактивный режим, режим без интерфейса для скриптов и CI (непрерывная интеграция, автоматическая сборка и проверка кода), протокол Agent Client Protocol для встраивания в редакторы, работа с файлами, shell-команды, поиск, MCP (протокол подключения внешних инструментов к модели), навыки, хуки, плагины, песочница, управление правами, субагенты.
Грубая аналогия: если Hermes от Anthropic для вас был «агентом, который живёт в проекте и сам себя контролирует», то Grok Build идёт в ту же сторону, только работает на токенах подписки Grok и с моделью xAI внутри.
В последних релизах xAI дорабатывала рабочую механику, а не маркетинг:
- Запрос разрешений показывает конкретные shell-команды
- MCP-изображения передаются без обрывов
- Песочница стабильнее работает в больших директориях
- Фоновые задачи можно отменять
- Режимы plan, agent и ask стали предсказуемее
- Контекст меньше ломается на больших git-репозиториях
Что это значит для вас?
Авторам Дзена и копирайтерам. Grok Build пока заточен под код, но паттерн «агент, который сам ходит по проекту, проверяет результат и дорабатывает» через полгода-год доберётся до контентных задач. Следите за тем, как работает агентный (agentic, когда ИИ сам решает, какие шаги предпринять) подход в коде: именно так будут устроены будущие инструменты для текста и вёрстки.
Маркетологам. Стоимость задачи в 2,49 доллара против 5-12 у конкурентов меняет экономику автоматизации. Если ваша команда уже использует ИИ-агентов для генерации лендингов, писем, прототипов, считайте заново.
Предпринимателям в РФ и СНГ. Grok Build доступен как опенсорс (открытый код) на GitHub, Rust-код можно развернуть локально. Модели xAI доступны через API, но в России могут быть ограничения по оплате и скорости. Из ближайших аналогов: Cursor работает через VPN, Claude Code официально недоступен в РФ. YandexGPT и GigaChat пока не предлагают сопоставимого агентного runtime для разработки.
Самое интересное здесь не модель, а данные. Триллионы токенов реальных сессий из Cursor, это не учебные задачки, а «грязная» разработка: сломанные окружения, неполные требования, агенты, которые ошибаются, и люди, которые их поправляют. Если модель действительно учится на таких траекториях, она оптимизируется не под «ответить красиво», а под «дотащить задачу до зелёных тестов». По моим наблюдениям, именно это отличает полезный инструмент от демо-игрушки. Но пока Grok 4.6 не получил официальную карточку, всё это остаётся обещанием, пусть и хорошо подкреплённым цифрами.
xAI строит не «ещё одну модель», а замкнутый контур: дешёвый инференс (инференс, работа модели на запросе пользователя), агентный runtime с открытым кодом и данные, которых нет ни у кого другого. Вопрос один: доведёт ли Маск эту связку до стабильного продукта или, как бывало, обгонит собственный дедлайн.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

OpenAI новости: четвёртый топ-менеджер уходит перед IPO, компания теряет архитектора бизнеса
Брэд Лайткэп, один из старейших руководителей OpenAI, объявил об уходе из компании, чтобы запустить собственный проект, и стал уже не первым топ-менеджером,…

Google TV Freeplay добавил 10 000 фильмов по запросу: всё бесплатно и без подписки
Google запустила в Google TV Freeplay бесплатную библиотеку из более чем 10 000 фильмов и шоу по запросу, а число бесплатных телеканалов в сервисе выросло до…

Xiaomi выпустила метрики удаления объектов с видео без эталона: оценка в 13,7 раза дешевле аналогов
Команда MiLM Plus из Xiaomi выпустила PROVE, набор метрик для оценки качества удаления объектов из видео без эталонного кадра, и статью приняли на конференцию…
Комментарии