Игорь Градов
Игорь Градов
5 мин
ai

Fireworks Nexus маршрутизирует открытые языковые модели и закрытые, снижая расходы на API в 3–5 раз

Fireworks AI 26 июля 2026 года запустила Nexus, платформу, которая автоматически распределяет запросы разработчиков между дорогими закрытыми и дешёвыми открытыми языковыми моделями и, по данным компании, снижает расходы на API в 3-5 раз.

Fireworks Nexus маршрутизирует открытые языковые модели и закрытые, снижая расходы на API в 3–5 раз
Почему это важно

Forbes сообщал, что Uber исчерпал весь бюджет на ИИ за 2026 год всего за четыре месяца. Nexus предлагает конкретный механизм: платить за мощную модель только там, где задача действительно сложная, а рутину отдавать дешёвой открытой модели.

Проблема на поверхности: большинство команд прогоняют даже простые задачи через дорогие закрытые модели (closed-source, модели с платным доступом без открытого кода) вроде Claude или GPT, потому что переключаться между провайдерами сложно технически. Fireworks AI, компания-разработчик инфраструктуры для инференса (inference, выполнение запросов к модели), выпустила Nexus как «прослойку», которая берёт эту сложность на себя. Источник анонса и независимых тестов, публикация Fireworks AI от 26 июля 2026 года с данными Faros AI и Arize.

Что Когда Кто выпустил Цена
Fireworks Nexus, платформа маршрутизации и управления ИИ-моделями 26 июля 2026 Fireworks AI Компания не раскрыла тарифы в анонсе

Из чего состоит Nexus?

  • Контроль бюджета и прозрачность расходов. Команда или компания задаёт лимиты, отслеживает окупаемость каждой модели и управляет политиками из одной панели. Запросы обрабатываются на серверах Fireworks в США с нулевым хранением данных и покрытием в 20 дата-центрах по всему миру.

  • FireConnect для бесшовного подключения. Плагин с открытым кодом (лицензия Apache 2.0), который устанавливается одной командой. После установки Claude Code, Codex и OpenCode продолжают работать без изменений, но запросы идут через Fireworks. API совместим с форматами Anthropic и OpenAI, поэтому большинству инструментов достаточно сменить адрес сервера и идентификатор модели.

  • Маршрутизатор по сложности. Специально обученная модель оценивает каждый запрос. Простые задачи уходят на дешёвую открытую модель (open weights, модель с доступными весами, которую можно запускать самостоятельно). Сложные передаются на закрытую модель через ваш собственный ключ, который, по заявлению Fireworks, на их серверах не сохраняется.

Маршрутизатор пока работает в режиме исследовательского превью. Сейчас он распределяет запросы между Claude Opus 5 и GLM-5.2, поэтому для прохода на закрытую модель нужен ключ Anthropic. Есть и полностью открытая конфигурация: маршрутизация между Kimi K3 и GLM-5.2, без ключей закрытых провайдеров.

Что показали независимые тесты?

Fireworks ссылается на два внешних исследования, а не только на собственные замеры.

Faros AI прогнала 211 реальных инженерных задач из 12 репозиториев. Claude Code на GLM-5.2 набрал 0,568 балла по рубричной оценке, а Claude Code на Opus 4.8 набрал 0,521. При этом стоимость задачи составила $0,92 против $1,76. Faros подчёркивает: выборка специфична для конкретной компании и не является универсальным рейтингом.

Arize совместно с Fireworks протестировала 10 моделей на 40 задачах Terminal-Bench, по шесть попыток на каждую, итого 2 400 прогонов за $626. На лёгких задачах открытая модель Kimi K2.6 прошла 73% тестов, тогда как GPT-5.5 прошёл 69%. На сложных задачах картина обратная: GPT-5.5 решил 51%, а Kimi K3 только 32%.

Симуляция маршрутизации поверх этих данных обошлась в $0,525 за успешно решённую задачу при 32,3 решённых из 40. GPT-5.5 в одиночку стоил $0,636 и решил 25 из 40. Важная деталь: наивная эскалация через все десять моделей подряд дала $1,319 за задачу, хуже любой отдельной модели. То есть маршрутизация работает только при продуманной «лестнице» эскалации.

Как попробовать?

  1. Самый простой путь. Установите FireConnect одной командой из панели Fireworks Dashboard. Плагин сам пропишет настройки Claude Code с резервной копией и даст команды /fireconnect:on, /fireconnect:off для переключения.

  2. Без плагина. Укажите переменную ANTHROPIC_BASE_URL и ключ Fireworks, либо смените адрес сервера и идентификатор модели в OpenAI-совместимом клиенте.

  3. Маршрутизатор перед контрактом. Подключите роутер Nexus перед существующим провайдером закрытой модели: он будет перехватывать простые запросы и отправлять их на открытые языковые модели.

Есть ли аналог в России?

Прямого аналога Nexus с автоматической маршрутизацией по сложности запроса на российском рынке пока нет. YandexGPT и GigaChat предоставляют API к собственным моделям, но каждый работает как отдельный провайдер: вы выбираете модель вручную и платите по его тарифу. Для тех, кто работает с несколькими моделями в России, переключение между ними остаётся ручной задачей.

Что это значит для вас?

  • Автору Дзена и копирайтеру. Nexus заточен под инженерные задачи и код, не под генерацию текстов. Но сам принцип «лёгкие запросы на дешёвую модель, сложные на дорогую» стоит перенять вручную: рутинные рерайты через бесплатную открытую модель, сложные аналитические тексты через платную.

  • Маркетологу. Если ваша компания тратит на API языковых моделей ощутимый бюджет, покажите техническому директору результаты Arize: $0,525 против $0,636 за задачу, при большем числе решённых задач.

  • Предпринимателю из РФ. Fireworks размещает серверы в США, данные проходят через американскую инфраструктуру. Для работы с персональными данными российских пользователей это создаёт регуляторные ограничения. Проверьте, подпадает ли ваш сценарий под требования закона о локализации данных.

Мнение редакции dzen.guru

Идея Nexus убедительна: данные Arize показывают, что на простых задачах открытые языковые модели не уступают дорогим закрытым. Но маршрутизатор находится в статусе исследовательского превью и работает только с двумя парами моделей. Все цифры экономии, это предварительные данные программы раннего доступа. Я бы подождал публичного релиза с расширенным набором моделей, прежде чем переводить на Nexus рабочую нагрузку. Если вы уже платите за API больше $500 в месяц, зарегистрируйтесь на превью и прогоните свои реальные задачи: оценочный фреймворк Arize доступен в открытом коде, его можно запустить на своих данных.

Частые вопросы

Nexus работает только с кодом?

Сейчас да. Платформа спроектирована для инженерных команд и подключается к инструментам разработки: Claude Code, Codex, OpenCode. Для задач контент-маркетинга или генерации текстов прямого применения пока нет.

Мои данные остаются на серверах Fireworks?

По заявлению компании, платформа работает с нулевым хранением данных (zero data retention). Ключи к закрытым моделям, по их утверждению, на серверах не сохраняются. Независимого аудита этих заявлений в анонсе не упоминается.

Можно ли обойтись без ключа Anthropic?

Да. В полностью открытой конфигурации маршрутизатор работает с Kimi K3 и GLM-5.2, обе модели с открытыми весами (open weights). Ключ Anthropic нужен только если вы хотите, чтобы сложные запросы уходили на Claude Opus 5.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Что такое ИИ-агент с памятью: паттерн LLM Wiki сводит 37 000 файлов к 70 страницам
ai

Что такое ИИ-агент с памятью: паттерн LLM Wiki сводит 37 000 файлов к 70 страницам

Компания‑автор оригинала не указана; текст представляет собой практическое руководство разработчика, описывающего реализацию паттерна LLM Wiki поверх…

7 мин
ai

Модерация промтов изнутри: почему ChatGPT, Claude и Grok блокируют разное

Нейросети по-разному реагируют на один и тот же чувствительный промпт: одна блокирует мгновенно, другая просит уточнить контекст, а третья выполняет задание…

6 мин
Fish Audio привлекла $52 млн на AI синтез голоса: 8 млн пользователей и $21 млн выручки
ai

Fish Audio привлекла $52 млн на AI синтез голоса: 8 млн пользователей и $21 млн выручки

Fish Audio, стартап из Пало-Альто, во вторник объявил о привлечении 52 миллионов долларов на посевном раунде, чтобы развивать модели синтеза голоса, которыми…

5 мин