Игорь Градов
Игорь Градов
5 мин
ai

Prime Intellect запустила serverless ИИ на Blackwell: триллион токенов в день и 100% аптайм

Компания Prime Intellect запустила Prime Inference, платформу для запуска открытых моделей в режиме serverless ИИ, которая до публичного релиза обрабатывала почти триллион токенов в день на собственных GPU.

Почему это важно

Впервые европейская команда предлагает serverless ИИ для открытых моделей с заявленным 100-процентным аптаймом и автоматическим переключением между дата-центрами, создавая прямую альтернативу API от OpenAI и крупных облаков.

Prime Intellect, компания, известная открытым стеком для обучения моделей, закрыла последнее звено цепочки: инференс (запуск готовой модели для получения ответов). До сих пор команда предлагала инструменты для дообучения (обучения модели на ваших примерах под узкую задачу), верификации и песочниц. Теперь развёрнутые модели генерируют рабочие логи, которые можно подать обратно в обучение. Источник анонса: блог Prime Intellect и страница документации платформы.

Параметр Данные
Компания Prime Intellect
Продукт Prime Inference
Тип сделки Запуск продукта (коммерческий релиз)
Модель на старте GLM-5.3
Оборудование NVIDIA Blackwell (GB200 NVL72), Vera Rubin заявлена следующей
Аптайм 100% с момента запуска (данные Prime Intellect)

Что именно запустили?

Prime Inference работает в двух режимах. Первый: serverless ИИ, когда вы платите только за фактически использованные токены (минимальные единицы текста, которые обрабатывает модель) и не держите сервер. Второй: зарезервированные мощности для постоянной нагрузки, например, если ваш ИИ-агент (программа, которая сама выполняет цепочку действий) работает круглосуточно.

Платформа совместима с OpenAI SDK. На практике это означает, что разработчику достаточно заменить адрес API на https://api.pinference.ai/api/v1, и существующий код продолжит работать без переписывания.

Трафик до публичного запуска шёл от внутренних задач: обучение с подкреплением, генерация синтетических данных, оценка моделей и работа агентов для написания кода.

Как устроен стек изнутри?

Техническая основа собрана из четырёх компонентов: NVIDIA Dynamo, vLLM, Mooncake и FlashInfer. Стек построен совместно с Inferact и NVIDIA, исправления отправляются в открытые репозитории.

Главная инженерная идея: разделение prefill (первичная обработка длинного промпта) и decode (генерация ответа по токену) на отдельные группы GPU. По данным Prime Intellect, это снизило задержку между токенами (p90) почти на 40%.

Маршрутизатор Dynamo учитывает, какая часть промпта уже закэширована на конкретном декодере. Сессия остаётся на том же декодере между ходами агента, что критично для агентных сценариев, где каждый шаг добавляет около 6 тысяч токенов к промпту длиной 140 тысяч токенов.

Цифры производительности GLM-5.3 на GB200 NVL72

Целевой показатель: 100 токенов в секунду на пользователя от начала до конца. При соотношении prefill к decode 1:4 платформа обслуживала 66 одновременных сессий на группу prefill при 101 токене в секунду на пользователя.

Несколько деталей из тестов Prime Intellect:

  • Сжатие кэша NVFP4: каждая строка кэша уменьшилась с 576 до 352 байт. Количество закэшированных токенов на декодер выросло с 1,09 до 1,63 миллиона.
  • Уменьшение шага prefill с 8 до 4 тысяч токенов на GPU сократило медианное ожидание в очереди с 550 до 110 миллисекунд. Время до первого токена упало примерно на 20%.
  • Надёжные вызовы инструментов: команда добавила в Dynamo структурный генератор тегов для формата инструментов GLM. vLLM маскирует токены, нарушающие схему, что даёт почти нулевой процент ошибок в вызовах.

Релиз вышел с конкретными бенчмарками на реальном агентном трафике (SemiAnalysis AgentX), а не на синтетических тестах. Для serverless ИИ это нетипичная прозрачность.

Эндпоинт GLM-5.3 входит в число самых быстрых на OpenRouter, с почти нулевым процентом ошибок в вызовах инструментов и 100-процентным аптаймом с момента запуска. : Prime Intellect (блог компании)

Почему это сдвигает рынок открытых моделей?

До сих пор запустить открытую модель (модель с доступными весами, которую можно скачать и модифицировать) на serverless ИИ можно было через несколько облачных провайдеров, в основном американских. Prime Intellect базируется в Европе и строит инфраструктуру на собственных GPU в нескольких дата-центрах с автоматическим переключением при сбое.

Совместимость с OpenAI SDK убирает порог входа. Не нужно учить новый API: если вы уже работаете с OpenAI или любым совместимым клиентом, переключение занимает одну строку кода.

Ближайшие планы, по данным компании: пакетный инференс и развёртывание выделенных серверов в один клик. Полный прайс по моделям на момент публикации ещё не опубликован в документации.

Что делать с этим прямо сейчас, по ролям

Разработчику в РФ и СНГ. Если вы используете GLM-5.3 или другие открытые модели, Prime Inference даёт европейскую точку доступа, совместимую с любым OpenAI SDK. Проверьте доступность API из вашего региона и сравните задержку с текущим провайдером. Из российских аналогов для инференса открытых моделей доступны, например, сервисы на базе API VK Cloud и MTS AI, но с другим набором моделей.

Автору Дзена и копирайтеру. Serverless ИИ для открытых моделей означает, что инструменты на базе таких моделей станут стабильнее и быстрее. Если ваш рабочий сервис использует открытую модель под капотом, качество ответов может вырасти без вашего участия.

Предпринимателю. Гарантированный аптайм и автоматическое переключение между дата-центрами делают открытые модели пригодными для продакшен-сервисов. Но прайс пока не опубликован полностью, поэтому считать экономику рано.

Мнение редакции dzen.guru

Я вижу здесь два сигнала. Первый: открытые модели дозревают до уровня, где им нужна инфраструктура уровня закрытых API, с аптаймом, маршрутизацией и гарантией задержки. Второй: европейская альтернатива американским облакам для инференса, это вопрос не только цены, но и юрисдикции данных. Для команд в РФ и СНГ пока неясно, будет ли доступ стабильным, но сам факт появления такой платформы за пределами US-облаков расширяет выбор. Оговорка: заявленные 100% аптайма и «почти нулевой процент ошибок» основаны на данных самой компании; независимых аудитов на момент публикации нет. Практический шаг: зарегистрируйтесь, протестируйте API на своей задаче, замерьте реальную задержку из вашего региона и сравните с тем, чем пользуетесь сейчас.

Пакетный инференс и выделенные серверы в один клик заявлены следующими в дорожной карте. Если платформа выдержит обещания по стабильности под реальной нагрузкой, у разработчиков на открытых моделях появится инфраструктура, которой до сих пор не хватало для серьёзных продуктов.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

IBM Bob вышел в режиме self-hosted: разработка ИИ-агентов теперь возможна без облака

IBM Bob теперь можно развернуть внутри собственной инфраструктуры, и для российских компаний, которым запрещено отправлять код и данные в чужое облако, это…

6 мин
ChatGPT запустил примерку одежды по фото: OpenAI идёт за рынком Google и Pinterest
ai

ChatGPT запустил примерку одежды по фото: OpenAI идёт за рынком Google и Pinterest

ChatGPT второго июня получил виртуальную примерку одежды и аксессуаров прямо в чате, и теперь любой пользователь может загрузить своё фото и увидеть, как вещь…

5 мин
ai

Microsoft выпустила нейросеть для распознавания речи: первое место среди 38 моделей при WER 2,5%

Microsoft первого октября выпустила MAI Transcribe 2 Streaming, свою первую нейросеть для распознавания речи в реальном времени, которая, по независимым…

5 мин