Французский Kog ускоряет инференс в 30 раз: оптимизация GPU без замены оборудования
Французский стартап Kog привлёк первых клиентов после майской демонстрации, на которой показал инференс (генерацию ответов нейросети) со скоростью 3 000 токенов в секунду на стандартных серверных GPU, пообещав ускорить большие языковые модели в 30 раз.

Kog делает ставку не на специализированные чипы, а на программную оптимизацию GPU, которые уже стоят в дата-центрах, и если подход сработает на больших моделях, это снизит стоимость и время ответа нейросетей без замены оборудования.
До сих пор ускорение инференса шло двумя путями: либо покупка дорогих специализированных чипов (как у Cerebras, вышедшей на IPO в мае), либо оптимизация на уровне самой модели. Kog предлагает третий вариант: выжать из обычных видеокарт то, на что те формально не рассчитаны, чисто программными методами. О стартапе рассказало издание TechCrunch со слов основателя и CEO Гаэля Делалло.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Kog Inference Engine (KIE), движок для ускорения инференса на стандартных GPU | Техническое превью в мае 2025 года, релиз для крупных моделей ожидается в сентябре 2025 года | Kog (Франция), основатель Гаэль Делалло | Не раскрыта |
Что показала демонстрация и в чём обещание?
- 3 000 токенов в секунду на один запрос. Такую скорость Kog показал на открытой модели Laneformer 2B с 2 миллиардами параметров, которую компания выложила в открытый доступ. Демонстрация прошла на серверных GPU AMD MI300X и Nvidia H200.
- Цель: ускорение в 30 раз для больших моделей. Пока результат получен на небольшой модели, но CEO заявил TechCrunch, что к сентябрю 2025 года планирует показать первую крупную модель с десятикратным ускорением.
- 200 бизнес-лидов после публикации. Техническое превью попало на главную страницу Hacker News, и, по словам Делалло, стартап получил 200 конкретных запросов от потенциальных клиентов.
- Фокус на программную инженерию. Первый сценарий использования, по данным обратной связи, это разработка кода. Пользователи Claude Code от Anthropic знают, что ответ иногда приходится ждать часами. Anthropic сама берёт доплату за быстрый режим «Fast Mode».
- Партнёры из сегмента генерации приложений. У Kog есть дизайн-партнёры, чьи сервисы генерируют игры и приложения по промпту (текстовому запросу). Для них быстрее инференс означает больше выручки.
Почему GPU, а не специальные чипы?
Делалло утверждает, что мнение о неприспособленности GPU к декодированию стало заблуждением. Новые поколения видеокарт получают всё больше пропускной способности памяти, которую никто пока не раскрывает до конца.
Подход Kog основатель сравнивает не с конкурентами вроде французской ZML, которая обходит проприетарную среду CUDA от Nvidia и поддерживает чипы разных производителей, а с лабораторией Hazy Research при Стэнфорде. Разница в глубине: команда Kog работает на уровне ассемблера и двоичного кода, то есть разбирает поведение каждого конкретного чипа почти вручную.
Делалло пришёл в тему из необычной комбинации: физика твёрдого тела в парижской Политехнической школе (École Polytechnique) плюс наступательная кибербезопасность, то есть «белый» хакинг. Четырёхкратный финалист хакерского турнира DEFCON CTF, он привык «разбирать систему до винтика и использовать её для целей, для которых она не проектировалась».
Где подвох?
Ручная оптимизация GPU занимает недели и месяцы на каждый новый чип. Команда Kog составляет 11 человек, и это ограничивает число поддерживаемых видеокарт. В перспективе компания надеется автоматизировать процесс через агентные пайплайны (цепочки, где ИИ-агенты выполняют этапы оптимизации сами).
Стартап пока не доказал, что подход работает на моделях с десятками и сотнями миллиардов параметров. Демонстрация на Laneformer 2B впечатляет скоростью, но 2 миллиарда параметров и, скажем, 70 миллиардов это разные задачи для памяти и вычислений.
Финансирование: Kog привлёк посевной раунд (seed), который соинвестировал фонд Varsity VC. Стартап также поддержан облачным провайдером Scaleway, государственным инвестбанком Bpifrance и программой French Tech 2030. Раунд Series A основатель планирует поднять после демонстрации на крупной модели в сентябре.
Как попробовать?
- Следите за обновлениями Kog. Модель Laneformer 2B уже в открытом доступе. Техническое превью движка KIE доступно, но ориентировано на владельцев серверных GPU (AMD MI300X, Nvidia H200), а не пользовательских видеокарт.
- Оцените свои задачи. Если вы используете Claude Code или подобные инструменты генерации кода и тратите часы на ожидание, следите за сентябрьским релизом Kog для крупных моделей.
- Для тестов с локальными моделями в России используйте существующие инструменты оптимизации GPU: llama.cpp, vLLM, Ollama. Они не дают тридцатикратного ускорения, но заметно снижают время отклика на потребительских видеокартах.
Что из этого доступно в России?
Движок Kog ориентирован на серверные GPU в западных дата-центрах и пока не предлагает доступ для российских пользователей. Прямого аналога KIE в России нет.
Из доступных вариантов для тех, кто работает с нейросетями локально или через облако:
- YandexGPT и GigaChat работают через API и не требуют от пользователя думать об оптимизации GPU: вычисления на стороне провайдера. Скорость ответов зависит от нагрузки серверов.
- Локальные модели через Ollama или llama.cpp позволяют запускать открытые модели на собственном оборудовании и частично управлять оптимизацией GPU, но глубина настройки несравнима с тем, что обещает Kog.
Для аудитории в РФ главный практический вывод: оптимизация GPU на программном уровне пока остаётся экспериментальной и недоступной «из коробки», но сам тренд важен, потому что снижение стоимости инференса рано или поздно отразится на ценах облачных API, которыми пользуются и российские сервисы.
Kog пока доказал свой подход только на маленькой модели. Это честно признаёт и сам основатель: сентябрь назван точкой, где обещание либо подтвердится, либо нет. Но идея ценная и для нас в России: если программная оптимизация GPU действительно даст кратное ускорение инференса на стандартном железе, это снизит порог входа для всех, кто запускает нейросети локально или арендует серверы.
Я бы не стал прямо сейчас менять рабочий стек ради Kog. Но автору Дзена, который генерирует тексты или изображения через локальные модели, стоит запомнить название: если к осени результаты подтвердятся на крупных моделях, движок KIE может стать реальным способом получить быстрые ответы без покупки дорогих видеокарт. Маркетологу и предпринимателю важнее следствие: каждое удешевление инференса в мире постепенно давит цены облачных API вниз, и это касается в том числе российских провайдеров.
Частые вопросы
Можно ли использовать Kog на домашней видеокарте?
Нет. Демонстрация проводилась на серверных GPU (AMD MI300X, Nvidia H200). CEO Kog подтвердил TechCrunch, что на пользовательские видеокарты в ноутбуках технология пока не распространяется.
В чём отличие Kog от Cerebras?
Cerebras выпускает собственные специализированные чипы для ИИ. Kog не производит оборудование, а оптимизирует работу существующих GPU на программном уровне, вплоть до ассемблерного кода. Подходы решают одну задачу (ускорение инференса), но разными путями.
Когда ждать результат на больших моделях?
По словам основателя Kog Гаэля Делалло, первую крупную модель с десятикратным ускорением компания планирует показать в сентябре 2025 года.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Microsoft 365 Copilot: что это теперь, когда аватар Mico убран, а два приложения сливают в одно
Microsoft убрала Mico, жёлтый аватар голосового режима Copilot, менее чем через год после запуска, и это совпало с объединением приложений Copilot и Microsoft…

Qwen 3.8 27B обошла Claude Opus 4.6 и работает на домашней видеокарте с 24 ГБ
Qwen 3.8 27B вышла на Hugging Face в июне 2025 года, и это первая мультимодальная модель такого размера, которую реально запустить на домашней видеокарте с 24…

Needle 2 весит 14 МБ и работает без GPU: лёгкие нейросети дошли до умных часов
Считаю лид: «Компания Cactus Compute в июне 2025 года выпустила Needle 2, открытую нейросеть на 45 миллионов параметров, которая умещается в файл размером 14…
Комментарии