Память не успевает за ядрами: почему ИИ-ускоритель простаивает даже с HBM3E
Производители ИИ-ускорителей (специализированных чипов для нейросетей) наращивают число вычислительных ядер и осваивают компактные форматы данных вроде FP8 и FP4, но упираются в скорость памяти, которая не успевает подавать данные вычислительным блокам.
Понимание того, почему ИИ-ускоритель простаивает из-за памяти, а не из-за нехватки ядер, помогает авторам и предпринимателям трезво оценивать обещания производителей и выбирать оборудование для своих задач.
Проблема касается каждого, кто работает с нейросетями или планирует запускать локальные модели. Источник, материал dzen.guru, разбирает архитектуру памяти HBM (High Bandwidth Memory, память с высокой пропускной способностью) и объясняет, почему даже дорогой чип с десятками миллиардов транзисторов может простаивать в ожидании данных. Ниже, пошаговый разбор: как устроено узкое место, что делают Samsung и другие производители и как это влияет на практику генерации текста.
Что понадобится
- Время: 10-15 минут на чтение и осмысление
- Базовое понимание: что такое нейросеть, токен (минимальная единица текста, которую обрабатывает модель) и инференс (процесс, когда обученная модель выдаёт результат, например генерирует ответ)
- Необязательно, но полезно: опыт запуска локальных моделей (LLaMA, Mistral и подобных) на своём компьютере или арендованном сервере с GPU
Пошаговая инструкция: как разобраться в проблеме памяти ИИ-ускорителей
-
Поймите, что делает ИИ-ускоритель при генерации текста. Большая языковая модель хранится как набор числовых параметров (весов). При каждом новом токене ускоритель проходит все слои модели, считывает веса из памяти, выполняет матричные операции и записывает промежуточные результаты. Этот цикл повторяется для каждого слова в ответе.
-
Разделите два ограничения: вычислительную мощность и пропускную способность памяти. Допустим, в ИИ-ускоритель поставили вдвое больше тензорных ядер (блоков, выполняющих матричные умножения). На бумаге производительность удвоилась. На практике она удвоится только если все ядра постоянно заняты. Если память не подаёт данные с нужной скоростью, часть блоков стоит без дела.
-
Запомните ключевое понятие: вычислительная интенсивность. Это количество операций на один байт данных. Когда блок данных загружается один раз и используется многократно, скорость зависит от ядер. Когда значения постоянно считываются заново, ограничением становится память. Добавлять вычислительные блоки в такой ситуации бесполезно.
-
Примените это к генерации текста. При последовательной генерации для каждого нового токена ускоритель перечитывает веса всех слоёв из памяти. Если модель обрабатывает мало запросов одновременно, переиспользовать веса не получается. Скорость генерации ограничивает не мощность ядер, а пропускная способность памяти.
-
Учтите рост KV-кеша. KV-кеш (key-value cache, хранилище ключей и значений для уже обработанных токенов) растёт вместе с длиной контекста. Чем длиннее диалог и чем больше запросов обрабатывается параллельно, тем больше данных нужно читать. Объём памяти определяет, поместятся ли модель и рабочие данные, а пропускная способность определяет, насколько быстро система с ними справится.
-
Разберитесь, почему обычная DDR-память не справляется. DDR подключается к процессору узкими каналами шириной 64 бита и стоит на отдельных модулях. Для тысяч параллельно работающих блоков ИИ-ускорителя этого мало.
-
Поймите принцип HBM. В HBM кристаллы DRAM (динамической памяти) укладываются друг на друга и соединяются через TSV (through-silicon vias, сквозные каналы в кремнии). Стек размещается рядом с вычислительным чипом на общей подложке. Короткие линии связи позволяют использовать широкую шину и передавать данные с меньшими энергозатратами. Уже первое поколение HBM получило 1024-битный интерфейс, а HBM3E, основа современных ИИ-ускорителей, превысила 1 ТБ/с на стек.
-
Оцените, зачем расширяют шину, а не просто поднимают частоту. Повышать частоту бесконечно нельзя: растут помехи, искажения сигнала, нужны сложные схемы коррекции, которые занимают место и потребляют энергию. В HBM4 шину расширили с 1024 до 2048 бит. Принцип как с дорогой: чтобы пропустить вдвое больше машин, не обязательно заставлять их ехать быстрее, можно удвоить число полос.
-
Следите за планами Samsung по HBM5. Samsung заявила цель: удвоить производительность относительно HBM4E и повысить эффективность на ватт на 20%. Пропускная способность одного стека может приблизиться к 4 ТБ/с благодаря шине 4096 бит. Но компания пока не подтвердила 4096-битную шину как спецификацию, назвала только целевые показатели без деталей реализации. Ширину интерфейса и пропускную способность около 4 ТБ/с следует считать инженерным прогнозом, а не финальной характеристикой.
-
Не забывайте про софтверные методы обхода. Разработчики пробуют кеширование, предварительную загрузку, переход на FP8 и FP4 (форматы с пониженной точностью, которые уменьшают объём передаваемых данных). Но SRAM (быстрая память на кристалле) занимает много места, хранить в ней десятки гигабайт весов невозможно. А модели и их контексты продолжают расти, поэтому освободившаяся пропускная способность быстро заполняется.
Допустим, вы запускаете модель с длинным контекстом на локальном сервере с GPU. Вы отправляете ей документ на 50 000 токенов и просите написать краткое содержание. Модель загружает веса, обрабатывает входной текст и начинает генерировать ответ. При генерации каждого нового токена GPU перечитывает веса из памяти. KV-кеш к этому моменту уже занимает значительную часть видеопамяти, потому что хранит ключи и значения для всех 50 000 входных токенов. Вы видите в мониторинге, что загрузка вычислительных ядер GPU падает до 30-40%, хотя карта стоит дорого и должна бы работать на полную. Узкое место не ядра, а скорость, с которой память отдаёт данные. Переход на формат FP8 (вместо FP16) уменьшит объём данных вдвое и ускорит генерацию, но при дальнейшем росте контекста эффект снова съедается.
- Гнаться за числом ядер, игнорируя память. При выборе GPU или ИИ-ускорителя для локального инференса смотрите не только на терафлопсы, но и на пропускную способность видеопамяти (ГБ/с) и её объём (ГБ). Карта с огромной вычислительной мощностью, но медленной памятью не ускорит генерацию текста.
- Путать объём памяти и пропускную способность. Объём определяет, поместится ли модель. Пропускная способность определяет, как быстро она будет работать. Модель на 70 млрд параметров может поместиться в 80 ГБ видеопамяти, но генерировать медленно, если шина узкая.
- Считать, что FP4 и FP8 решают проблему навсегда. Пониженная точность уменьшает поток данных, но модели растут, контексты удлиняются, и выигрыш от квантизации (снижения точности ради компактности) быстро расходуется.
- Игнорировать KV-кеш при планировании. Для задач с длинным контекстом (анализ документов, длинные диалоги) KV-кеш может занять больше памяти, чем сама модель. Это часто становится сюрпризом.
Что делать с этим прямо сейчас?
Авторам Дзена и копирайтерам. Если вы используете локальные модели для генерации текста и упираетесь в медленную генерацию, проблема, скорее всего, не в модели, а в памяти вашей видеокарты. Попробуйте квантизованные версии моделей (FP8, INT4) или сократите длину контекста. Это даст заметное ускорение без покупки нового оборудования.
Маркетологам. Когда подрядчик или платформа обещает «мощный ИИ-ускоритель с рекордной производительностью», спрашивайте не про терафлопсы, а про объём и пропускную способность памяти. Для задач генерации контента это важнее.
Предпринимателям РФ и СНГ. Серверные GPU с HBM3E (NVIDIA H100, H200) доступны через облачных провайдеров, в том числе российских. HBM4 и тем более HBM5 появятся в серверах не раньше 2026 года. Планируя инфраструктуру сейчас, закладывайте запас по памяти, а не по вычислительной мощности.
Разрыв между вычислительной мощностью и скоростью памяти, главная причина, по которой обещания производителей ИИ-ускорителей расходятся с реальностью. Я наблюдаю это каждый раз, когда тестирую новые модели локально: карта загружена на треть, а генерация идёт медленно. Samsung называет цели по HBM5, но не раскрывает, как их достигнет. Пока это инженерный прогноз. Практический вывод для нас в России: при выборе оборудования для работы с нейросетями смотрите на пропускную способность памяти в первую очередь. Вычислительных ядер на рынке уже с избытком, а быстрой памяти по-прежнему не хватает.
Протестируйте промпты для генерации контента
В dzen.guru собрана библиотека промптов, которые помогают выжать максимум из доступных моделей, даже на ограниченном оборудовании.
ПопробоватьГонка за терафлопсами без соразмерного роста памяти напоминает расширение автомагистрали, к которой ведёт одна узкая подъездная дорога. Samsung обозначила направление с HBM5, но до реальных чипов пройдёт не один год. Тем, кто работает с нейросетями сегодня, полезнее разобраться в ограничениях текущей памяти и научиться с ними жить, чем ждать аппаратного прорыва.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

ИИ-контент схлопывается в однообразие: почему turbotext и другие генераторы дают одинаковый результат
Всё больше кафе и ресторанов доверяют нейросетям оформление меню, и результат уже заметен невооружённым глазом: блюда на картинках выглядят подозрительно…

UC Berkeley выпустил открытую платформу для обучения ИИ-агентов: инфраструктура дешевле в 4,6 раза
Команда исследователей из Калифорнийского университета в Беркли выпустила CUA-Lite, открытую платформу, которая впервые объединяет все четыре компонента…

Completion gate: как отличить реальный ответ локальной языковой модели от заглушки
Локальные языковые модели выдают валидный JSON и проходят автоматические проверки, но за аккуратной структурой часто прячутся заглушки, обрезанные ответы и…
Комментарии