Мегакернели в программировании на GPU: 41% прироста скорости или тупик, который закроет NVIDIA Rubin
Последние дни в среде разработчиков, занятых программированием на GPU, разгорелся спор, который напрямую влияет на стоимость и скорость работы нейросетей: мегакернели, ещё недавно считавшиеся перспективным способом ускорить инференс (процесс генерации ответа моделью), объявлены одновременно «мёртвыми» и «вернувшимися».

Для авторов и предпринимателей это не абстрактная инженерная тема. От того, какой подход к оптимизации победит, зависит, сколько будет стоить каждый токен (единица текста, которую генерирует нейросеть) и насколько быстро ИИ-сервисы смогут отвечать на ваши запросы.
Спор о мегакернелях определяет экономику инференса на ближайшие годы: если аппаратные решения NVIDIA Rubin снимут проблемы, ради которых мегакернели создавались, миллиарды долларов на вычислениях можно будет экономить проще и без двухмесячной ручной оптимизации кода.
Дискуссия развернулась в подкасте Inference Engineering Masterclass от Latent Space в начале августа 2026 года. Инженеры обсуждали практический вопрос: стоит ли продолжать вкладывать месяцы работы в написание мегакернелей или аппаратные улучшения от NVIDIA делают этот подход ненужным. Одновременно команда Cursor (ИИ-редактор кода) выложила в открытый доступ собственный мегакернель Mixture of Kittens, показав прирост скорости на 41%.
Что такое мегакернель и зачем он нужен?
Кернель (kernel) в программировании на GPU означает небольшую программу, которая выполняется на видеокарте. Обычно нейросеть при генерации ответа запускает десятки таких программ последовательно. Каждый запуск означает паузу, переключение, накладные расходы.
Мегакернель объединяет множество этих операций в одну большую программу. Представьте конвейер на заводе: вместо того чтобы останавливать ленту после каждой операции и перенастраивать станок, вы собираете один станок, который делает всё сразу.
Звучит логично. Но на практике написание такого «суперстанка» занимает около двух месяцев квалифицированной работы и порождает код объёмом в десятки тысяч строк, который крайне сложно поддерживать и отлаживать.
Доводы за мегакернели
- Измеримый прирост скорости. Команда Cursor выпустила мегакернель Mixture of Kittens (название отсылает к проекту ThunderKittens Бена Спектора). По данным Cursor, он даёт прирост в 41% по количеству токенов в секунду. При масштабе крупного сервиса это «миллиарды долларов экономии», как заявляют авторы.
- Устранение накладных расходов. Каждый запуск отдельного кернеля означает задержку. Мегакернель убирает эти паузы, данные остаются в быстрой памяти GPU и не перемещаются туда-сюда.
- Исследовательская ценность. Даже скептики признают, что мегакернели как направление исследований дали ценное понимание узких мест в программировании на GPU.
Доводы против мегакернелей
- Сложность написания и поддержки. Участник дискуссии Али (Ali) прямо заявил: создать хорошо оптимизированный мегакернель «очень сложно». Код в 67 000 строк, написанный вручную, превращается в инженерный кошмар.
- Производственные системы их не используют. По словам Али, компании, которые экспериментировали с мегакернелями, «очень часто не запускают их в продакшене», потому что модульные кернели (например, из библиотеки TensorRT-LLM) оказываются быстрее за счёт того, что каждый компонент можно оптимизировать отдельно и запускать параллельно.
- Аппаратное решение от NVIDIA. Один из технических руководителей NVIDIA опубликовал спецификации архитектуры Rubin. Кайл Кранен (Kyle Kranen) анонсировал механизм «dependency triggers» (триггеры зависимостей), который решает ту самую проблему «отстающих блоков» (straggler CTAs), ради обхода которой и создавались мегакернели. Если GPU сам умеет запускать следующий кернель, не дожидаясь завершения всех блоков предыдущего, главный мотив для объединения кернелей исчезает.
Мегакернели, честно говоря, вызывают у меня большой скепсис. Это было хорошее исследовательское направление, и интуитивно, теоретически, выглядит красиво. Но GPU спроектирован так, что он убивает мегакернели. Похоже, это целое исследовательское направление не будет продолжено. : Али, участник подкаста Inference Engineering Masterclass
Что делать с этим прямо сейчас, по ролям?
Авторам Дзена и копирайтерам. Тема инференса и стоимости токенов напрямую влияет на ваш кошелёк при работе с ИИ-ассистентами. Следите за тем, какие модели работают на оптимизированной инфраструктуре: чем дешевле инференс, тем доступнее сервисы. Сейчас среди самых дешёвых вариантов называют DeepSeek-V4-Flash.
Маркетологам. Экономика инференса меняет продуктовые решения. Дешёвые модели уже используют как «всегда включённых помощников» на каждый промпт для генерации метаданных. Это значит, что автоматизация рутинных маркетинговых задач станет ещё доступнее.
Предпринимателям в РФ и СНГ. Прямого доступа к Cursor и его мегакернелю в России нет, но результаты этой оптимизации придут через сервисы, которые на ней построены. Из доступных в РФ решений для инференса стоит следить за YandexGPT и GigaChat, а для собственных задач программирования на GPU использовать открытые библиотеки вроде TensorRT-LLM.
Спор о мегакернелях, на мой взгляд, уже решён практикой: если ни одна крупная компания не запускает их в продакшен, значит модульный подход побеждает. Но результат Cursor с приростом в 41% показывает, что для специфических задач вроде генерации кода мегакернель всё ещё оправдан. Я думаю, реальная картина такая: мегакернели не умерли как исследовательский инструмент, но и не станут стандартом индустрии. Архитектура Rubin от NVIDIA, скорее всего, закроет большинство проблем, ради которых их создавали. Для тех, кто пользуется ИИ-сервисами, а не пишет кернели, главный вывод простой: стоимость генерации будет падать и без мегакернелей, благодаря аппаратным улучшениям.
Результат Cursor в 41% получен на их конкретной задаче. Переносить эту цифру на любой ИИ-сервис некорректно. Кроме того, архитектура Rubin пока анонсирована, но не выпущена массово, а физические ограничения, о которых упоминали участники подкаста, остаются нерешёнными.
Ближайший год покажет, сможет ли NVIDIA с Rubin действительно снять проблемы, ради которых инженеры тратили месяцы на ручную оптимизацию. Если dependency triggers заработают так, как обещано, мегакернели останутся нишевым исследовательским инструментом для экстремальных задач, а основная экономия на инференсе придёт от железа, а не от героического кода. Для пользователей ИИ-сервисов это хорошая новость: токены подешевеют в любом случае.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Что такое ИИ-агент: Luna подешевела в 12 раз, и автоматизация стала доступнее
Компания OpenAI 5 июня снизила стоимость модели GPT-5.6 Luna на 80%, а GPT-5.6 Terra на 20%, и одновременно анонсировала новую модель Astra, которая уже решила…

ChatGPT Work набрал 10 млн пользователей за три недели и скоро вольётся в основной чат
ChatGPT Work вышел 9 июля 2025 года и за три недели набрал 10 миллионов пользователей, превратив облачного ИИ-агента из инструмента для разработчиков в рабочую…

Белый дом предложил тестировать безопасность искусственного интеллекта до релиза: схема может стать глобальной
Компания OpenAI, Anthropic, Meta и Google получили приглашение в Белый дом для обсуждения новой добровольной схемы тестирования кибербезопасности передовых…
Комментарии