Fireworks Nexus маршрутизирует открытые языковые модели и закрытые, снижая расходы на API в 3–5 раз
Fireworks AI 26 июля 2026 года запустила Nexus, платформу, которая автоматически распределяет запросы разработчиков между дорогими закрытыми и дешёвыми открытыми языковыми моделями и, по данным компании, снижает расходы на API в 3-5 раз.

Forbes сообщал, что Uber исчерпал весь бюджет на ИИ за 2026 год всего за четыре месяца. Nexus предлагает конкретный механизм: платить за мощную модель только там, где задача действительно сложная, а рутину отдавать дешёвой открытой модели.
Проблема на поверхности: большинство команд прогоняют даже простые задачи через дорогие закрытые модели (closed-source, модели с платным доступом без открытого кода) вроде Claude или GPT, потому что переключаться между провайдерами сложно технически. Fireworks AI, компания-разработчик инфраструктуры для инференса (inference, выполнение запросов к модели), выпустила Nexus как «прослойку», которая берёт эту сложность на себя. Источник анонса и независимых тестов, публикация Fireworks AI от 26 июля 2026 года с данными Faros AI и Arize.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Fireworks Nexus, платформа маршрутизации и управления ИИ-моделями | 26 июля 2026 | Fireworks AI | Компания не раскрыла тарифы в анонсе |
Из чего состоит Nexus?
-
Контроль бюджета и прозрачность расходов. Команда или компания задаёт лимиты, отслеживает окупаемость каждой модели и управляет политиками из одной панели. Запросы обрабатываются на серверах Fireworks в США с нулевым хранением данных и покрытием в 20 дата-центрах по всему миру.
-
FireConnect для бесшовного подключения. Плагин с открытым кодом (лицензия Apache 2.0), который устанавливается одной командой. После установки Claude Code, Codex и OpenCode продолжают работать без изменений, но запросы идут через Fireworks. API совместим с форматами Anthropic и OpenAI, поэтому большинству инструментов достаточно сменить адрес сервера и идентификатор модели.
-
Маршрутизатор по сложности. Специально обученная модель оценивает каждый запрос. Простые задачи уходят на дешёвую открытую модель (open weights, модель с доступными весами, которую можно запускать самостоятельно). Сложные передаются на закрытую модель через ваш собственный ключ, который, по заявлению Fireworks, на их серверах не сохраняется.
Маршрутизатор пока работает в режиме исследовательского превью. Сейчас он распределяет запросы между Claude Opus 5 и GLM-5.2, поэтому для прохода на закрытую модель нужен ключ Anthropic. Есть и полностью открытая конфигурация: маршрутизация между Kimi K3 и GLM-5.2, без ключей закрытых провайдеров.
Что показали независимые тесты?
Fireworks ссылается на два внешних исследования, а не только на собственные замеры.
Faros AI прогнала 211 реальных инженерных задач из 12 репозиториев. Claude Code на GLM-5.2 набрал 0,568 балла по рубричной оценке, а Claude Code на Opus 4.8 набрал 0,521. При этом стоимость задачи составила $0,92 против $1,76. Faros подчёркивает: выборка специфична для конкретной компании и не является универсальным рейтингом.
Arize совместно с Fireworks протестировала 10 моделей на 40 задачах Terminal-Bench, по шесть попыток на каждую, итого 2 400 прогонов за $626. На лёгких задачах открытая модель Kimi K2.6 прошла 73% тестов, тогда как GPT-5.5 прошёл 69%. На сложных задачах картина обратная: GPT-5.5 решил 51%, а Kimi K3 только 32%.
Симуляция маршрутизации поверх этих данных обошлась в $0,525 за успешно решённую задачу при 32,3 решённых из 40. GPT-5.5 в одиночку стоил $0,636 и решил 25 из 40. Важная деталь: наивная эскалация через все десять моделей подряд дала $1,319 за задачу, хуже любой отдельной модели. То есть маршрутизация работает только при продуманной «лестнице» эскалации.
Как попробовать?
-
Самый простой путь. Установите FireConnect одной командой из панели Fireworks Dashboard. Плагин сам пропишет настройки Claude Code с резервной копией и даст команды
/fireconnect:on,/fireconnect:offдля переключения. -
Без плагина. Укажите переменную
ANTHROPIC_BASE_URLи ключ Fireworks, либо смените адрес сервера и идентификатор модели в OpenAI-совместимом клиенте. -
Маршрутизатор перед контрактом. Подключите роутер Nexus перед существующим провайдером закрытой модели: он будет перехватывать простые запросы и отправлять их на открытые языковые модели.
Есть ли аналог в России?
Прямого аналога Nexus с автоматической маршрутизацией по сложности запроса на российском рынке пока нет. YandexGPT и GigaChat предоставляют API к собственным моделям, но каждый работает как отдельный провайдер: вы выбираете модель вручную и платите по его тарифу. Для тех, кто работает с несколькими моделями в России, переключение между ними остаётся ручной задачей.
Что это значит для вас?
-
Автору Дзена и копирайтеру. Nexus заточен под инженерные задачи и код, не под генерацию текстов. Но сам принцип «лёгкие запросы на дешёвую модель, сложные на дорогую» стоит перенять вручную: рутинные рерайты через бесплатную открытую модель, сложные аналитические тексты через платную.
-
Маркетологу. Если ваша компания тратит на API языковых моделей ощутимый бюджет, покажите техническому директору результаты Arize: $0,525 против $0,636 за задачу, при большем числе решённых задач.
-
Предпринимателю из РФ. Fireworks размещает серверы в США, данные проходят через американскую инфраструктуру. Для работы с персональными данными российских пользователей это создаёт регуляторные ограничения. Проверьте, подпадает ли ваш сценарий под требования закона о локализации данных.
Идея Nexus убедительна: данные Arize показывают, что на простых задачах открытые языковые модели не уступают дорогим закрытым. Но маршрутизатор находится в статусе исследовательского превью и работает только с двумя парами моделей. Все цифры экономии, это предварительные данные программы раннего доступа. Я бы подождал публичного релиза с расширенным набором моделей, прежде чем переводить на Nexus рабочую нагрузку. Если вы уже платите за API больше $500 в месяц, зарегистрируйтесь на превью и прогоните свои реальные задачи: оценочный фреймворк Arize доступен в открытом коде, его можно запустить на своих данных.
Частые вопросы
Nexus работает только с кодом?
Сейчас да. Платформа спроектирована для инженерных команд и подключается к инструментам разработки: Claude Code, Codex, OpenCode. Для задач контент-маркетинга или генерации текстов прямого применения пока нет.
Мои данные остаются на серверах Fireworks?
По заявлению компании, платформа работает с нулевым хранением данных (zero data retention). Ключи к закрытым моделям, по их утверждению, на серверах не сохраняются. Независимого аудита этих заявлений в анонсе не упоминается.
Можно ли обойтись без ключа Anthropic?
Да. В полностью открытой конфигурации маршрутизатор работает с Kimi K3 и GLM-5.2, обе модели с открытыми весами (open weights). Ключ Anthropic нужен только если вы хотите, чтобы сложные запросы уходили на Claude Opus 5.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Что такое ИИ-агент с памятью: паттерн LLM Wiki сводит 37 000 файлов к 70 страницам
Компания‑автор оригинала не указана; текст представляет собой практическое руководство разработчика, описывающего реализацию паттерна LLM Wiki поверх…
Модерация промтов изнутри: почему ChatGPT, Claude и Grok блокируют разное
Нейросети по-разному реагируют на один и тот же чувствительный промпт: одна блокирует мгновенно, другая просит уточнить контекст, а третья выполняет задание…

Fish Audio привлекла $52 млн на AI синтез голоса: 8 млн пользователей и $21 млн выручки
Fish Audio, стартап из Пало-Альто, во вторник объявил о привлечении 52 миллионов долларов на посевном раунде, чтобы развивать модели синтеза голоса, которыми…
Комментарии