Prime Intellect запустила serverless ИИ на Blackwell: триллион токенов в день и 100% аптайм
Компания Prime Intellect запустила Prime Inference, платформу для запуска открытых моделей в режиме serverless ИИ, которая до публичного релиза обрабатывала почти триллион токенов в день на собственных GPU.
Впервые европейская команда предлагает serverless ИИ для открытых моделей с заявленным 100-процентным аптаймом и автоматическим переключением между дата-центрами, создавая прямую альтернативу API от OpenAI и крупных облаков.
Prime Intellect, компания, известная открытым стеком для обучения моделей, закрыла последнее звено цепочки: инференс (запуск готовой модели для получения ответов). До сих пор команда предлагала инструменты для дообучения (обучения модели на ваших примерах под узкую задачу), верификации и песочниц. Теперь развёрнутые модели генерируют рабочие логи, которые можно подать обратно в обучение. Источник анонса: блог Prime Intellect и страница документации платформы.
| Параметр | Данные |
|---|---|
| Компания | Prime Intellect |
| Продукт | Prime Inference |
| Тип сделки | Запуск продукта (коммерческий релиз) |
| Модель на старте | GLM-5.3 |
| Оборудование | NVIDIA Blackwell (GB200 NVL72), Vera Rubin заявлена следующей |
| Аптайм | 100% с момента запуска (данные Prime Intellect) |
Что именно запустили?
Prime Inference работает в двух режимах. Первый: serverless ИИ, когда вы платите только за фактически использованные токены (минимальные единицы текста, которые обрабатывает модель) и не держите сервер. Второй: зарезервированные мощности для постоянной нагрузки, например, если ваш ИИ-агент (программа, которая сама выполняет цепочку действий) работает круглосуточно.
Платформа совместима с OpenAI SDK. На практике это означает, что разработчику достаточно заменить адрес API на https://api.pinference.ai/api/v1, и существующий код продолжит работать без переписывания.
Трафик до публичного запуска шёл от внутренних задач: обучение с подкреплением, генерация синтетических данных, оценка моделей и работа агентов для написания кода.
Как устроен стек изнутри?
Техническая основа собрана из четырёх компонентов: NVIDIA Dynamo, vLLM, Mooncake и FlashInfer. Стек построен совместно с Inferact и NVIDIA, исправления отправляются в открытые репозитории.
Главная инженерная идея: разделение prefill (первичная обработка длинного промпта) и decode (генерация ответа по токену) на отдельные группы GPU. По данным Prime Intellect, это снизило задержку между токенами (p90) почти на 40%.
Маршрутизатор Dynamo учитывает, какая часть промпта уже закэширована на конкретном декодере. Сессия остаётся на том же декодере между ходами агента, что критично для агентных сценариев, где каждый шаг добавляет около 6 тысяч токенов к промпту длиной 140 тысяч токенов.
Цифры производительности GLM-5.3 на GB200 NVL72
Целевой показатель: 100 токенов в секунду на пользователя от начала до конца. При соотношении prefill к decode 1:4 платформа обслуживала 66 одновременных сессий на группу prefill при 101 токене в секунду на пользователя.
Несколько деталей из тестов Prime Intellect:
- Сжатие кэша NVFP4: каждая строка кэша уменьшилась с 576 до 352 байт. Количество закэшированных токенов на декодер выросло с 1,09 до 1,63 миллиона.
- Уменьшение шага prefill с 8 до 4 тысяч токенов на GPU сократило медианное ожидание в очереди с 550 до 110 миллисекунд. Время до первого токена упало примерно на 20%.
- Надёжные вызовы инструментов: команда добавила в Dynamo структурный генератор тегов для формата инструментов GLM. vLLM маскирует токены, нарушающие схему, что даёт почти нулевой процент ошибок в вызовах.
Релиз вышел с конкретными бенчмарками на реальном агентном трафике (SemiAnalysis AgentX), а не на синтетических тестах. Для serverless ИИ это нетипичная прозрачность.
Эндпоинт GLM-5.3 входит в число самых быстрых на OpenRouter, с почти нулевым процентом ошибок в вызовах инструментов и 100-процентным аптаймом с момента запуска. : Prime Intellect (блог компании)
Почему это сдвигает рынок открытых моделей?
До сих пор запустить открытую модель (модель с доступными весами, которую можно скачать и модифицировать) на serverless ИИ можно было через несколько облачных провайдеров, в основном американских. Prime Intellect базируется в Европе и строит инфраструктуру на собственных GPU в нескольких дата-центрах с автоматическим переключением при сбое.
Совместимость с OpenAI SDK убирает порог входа. Не нужно учить новый API: если вы уже работаете с OpenAI или любым совместимым клиентом, переключение занимает одну строку кода.
Ближайшие планы, по данным компании: пакетный инференс и развёртывание выделенных серверов в один клик. Полный прайс по моделям на момент публикации ещё не опубликован в документации.
Что делать с этим прямо сейчас, по ролям
Разработчику в РФ и СНГ. Если вы используете GLM-5.3 или другие открытые модели, Prime Inference даёт европейскую точку доступа, совместимую с любым OpenAI SDK. Проверьте доступность API из вашего региона и сравните задержку с текущим провайдером. Из российских аналогов для инференса открытых моделей доступны, например, сервисы на базе API VK Cloud и MTS AI, но с другим набором моделей.
Автору Дзена и копирайтеру. Serverless ИИ для открытых моделей означает, что инструменты на базе таких моделей станут стабильнее и быстрее. Если ваш рабочий сервис использует открытую модель под капотом, качество ответов может вырасти без вашего участия.
Предпринимателю. Гарантированный аптайм и автоматическое переключение между дата-центрами делают открытые модели пригодными для продакшен-сервисов. Но прайс пока не опубликован полностью, поэтому считать экономику рано.
Я вижу здесь два сигнала. Первый: открытые модели дозревают до уровня, где им нужна инфраструктура уровня закрытых API, с аптаймом, маршрутизацией и гарантией задержки. Второй: европейская альтернатива американским облакам для инференса, это вопрос не только цены, но и юрисдикции данных. Для команд в РФ и СНГ пока неясно, будет ли доступ стабильным, но сам факт появления такой платформы за пределами US-облаков расширяет выбор. Оговорка: заявленные 100% аптайма и «почти нулевой процент ошибок» основаны на данных самой компании; независимых аудитов на момент публикации нет. Практический шаг: зарегистрируйтесь, протестируйте API на своей задаче, замерьте реальную задержку из вашего региона и сравните с тем, чем пользуетесь сейчас.
Пакетный инференс и выделенные серверы в один клик заявлены следующими в дорожной карте. Если платформа выдержит обещания по стабильности под реальной нагрузкой, у разработчиков на открытых моделях появится инфраструктура, которой до сих пор не хватало для серьёзных продуктов.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
IBM Bob вышел в режиме self-hosted: разработка ИИ-агентов теперь возможна без облака
IBM Bob теперь можно развернуть внутри собственной инфраструктуры, и для российских компаний, которым запрещено отправлять код и данные в чужое облако, это…

ChatGPT запустил примерку одежды по фото: OpenAI идёт за рынком Google и Pinterest
ChatGPT второго июня получил виртуальную примерку одежды и аксессуаров прямо в чате, и теперь любой пользователь может загрузить своё фото и увидеть, как вещь…
Microsoft выпустила нейросеть для распознавания речи: первое место среди 38 моделей при WER 2,5%
Microsoft первого октября выпустила MAI Transcribe 2 Streaming, свою первую нейросеть для распознавания речи в реальном времени, которая, по независимым…
Комментарии