Нейросимвольный ИИ Шумского работает на CPU без GPU: что это даёт российским командам
Сергей Шумский, кандидат физико-математических наук и известный в российском IT-сообществе исследователь, предложил альтернативу трансформерной архитектуре: модель, которая обучается через послойное сжатие данных на обычном процессоре, без градиентного спуска и без GPU.

Нейросимвольный ИИ Шумского работает на CPU и обходится без градиентного спуска, а значит, потенциально снимает главный барьер для российских команд: зависимость от дорогих и дефицитных видеокарт.
Подход строится на стыке двух парадигм. Символьный ИИ (системы, которые манипулируют явными правилами и знаками, как экспертные системы 1980-х) давал предсказуемые ответы, но ломался на сложных задачах. Нейросети на базе трансформеров (архитектура, на которой работают ChatGPT и другие большие языковые модели) обобщают данные, но плохо объясняют свои решения и регулярно галлюцинируют (уверенно выдумывают то, чего не было). Шумский пытается взять лучшее от обоих подходов. Доклад, на котором были заданы уточняющие вопросы автору, описан в источнике блога Алексея Хахунова.
| Показатель | Значение | Источник |
|---|---|---|
| Тип обучения | Счётные процедуры вместо градиентного спуска | Доклад Шумского |
| Необходимое оборудование | CPU, GPU не требуется | Доклад Шумского |
| Принцип оптимизации | Минимальная длина описания (модель + закодированные данные) | Доклад Шумского |
| Окно предсказания на уровне символов | Около 10 единиц | Доклад Шумского |
| Окно предсказания на уровне слов | 3-4 единицы | Доклад Шумского |
| Рост стоимости окна у табличного предсказателя | Экспоненциальный | Доклад Шумского |
| Рост стоимости окна у трансформера | Квадратичный | Доклад Шумского |
Как устроено послойное сжатие?
Вместо предсказания следующего токена (минимального фрагмента текста) модель Шумского сжимает цепочки данных, и грамматически, и семантически, слой за слоем.
В основе лежит принцип минимальной длины описания: чем короче запись модели плюс закодированных ею данных, тем модель лучше. Проще говоря, система ищет самый компактный способ описать текст, и если новая единица экономит биты, она попадает в словарь.
Первый слой работает похоже на трансформер: предсказывает следующий символ. Но цель другая. Система ищет момент, когда точность предсказания резко падает. В этой точке ставится граница, цепочка кодируется и проверяется на экономию битов.
На следующем уровне найденные единицы становятся новыми символами, и процесс повторяется. В теории выстраивается пирамида: морфемы (части слов), затем слова, фразы, предложения, понятия.
Внутри каждого уровня работают два вида сжатия. Сначала без потерь: поток нарезается на повторяющиеся единицы для пополнения словаря. Затем с потерями: каждая единица представляется распределением своих контекстов и сжимается до короткого кода. Эти коды передаются на следующий уровень как новые символы.
Второй этап, по сути, формирует векторные представления из контекстной статистики. Близость в таком пространстве означает похожесть употребления. Автор рассчитывает, что это даст гибкость, которой не хватало чистому символьному ИИ. Обобщение же должна обеспечить сама иерархия слоёв.
Где нейросимвольный ИИ Шумского пока буксует?
Автор, по свидетельству источника, честно признаёт ограничения проекта и ищет инженерные решения. Вот ключевые проблемы:
-
Редкие смыслы выпадают. Статистическая система игнорирует то, что встречается редко. У команды есть методика «размножения» таких единиц, но это фактически ручная работа с данными. Часть различений производит не модель, а человек, что возвращает к старой проблеме символьного ИИ: необходимости ручного формирования правил.
-
Антонимы неразличимы. Косинусное сходство (метрика, измеряющая похожесть двух векторов по углу между ними) плохо работает с противоположностями. «Сегодня очень холодно» и «сегодня очень жарко» оказываются в одинаковом контексте, и система считает их близкими, хотя значения противоположны. То же с отрицанием: «работает» и «не работает» стоят в одних конструкциях. Эта проблема знакома разработчикам RAG-систем (дополнение ответов модели внешними документами), но при агрессивном сжатии Шумского она обостряется.
-
Потери копятся от слоя к слою. На каждом уровне сжатие с потерями передаёт наверх только то, что помогает предсказанию. Различения, не влияющие на продолжение, отбрасываются. Каждый уровень работает с проекциями проекций.
-
Пирамида может не вырасти. Единица окупается, если даёт экономию на длине, а экономия пропорциональна числу вхождений. Морфем в языке тысячи, и они встречаются миллионы раз. Фраз уже миллионы, и частота их резко падает. Предложения из-за комбинаторики практически уникальны. На верхних уровнях повторяемости может не хватить для формирования устойчивых единиц.
Проект Шумского находится на стадии концепции с инженерной проработкой отдельных слоёв. Публичных бенчмарков, сравнивающих его с трансформерными моделями на стандартных задачах, источник не приводит. Проблемы антонимов, накопления потерь и масштабируемости пирамиды автор признаёт открыто, но решения пока описаны как направления работы, а не готовые механизмы. Оценивать проект стоит как раннее исследование с нетривиальной идеей, а не как замену существующим моделям.
Что это значит для вас?
Авторам Дзена и копирайтерам. Нейросимвольный ИИ пока не даёт готового инструмента для генерации текстов. Но сам принцип послойного сжатия полезно понимать: он объясняет, почему трансформеры галлюцинируют (предсказывают токен за токеном без жёсткой структуры) и чем может отличаться следующее поколение моделей. Если концепция дозреет, модели на CPU станут доступны без подписок и без облака.
Маркетологам и предпринимателям в РФ и СНГ. Главная практическая ценность подхода Шумского: отсутствие требований к GPU. Российские компании, у которых нет доступа к кластерам NVIDIA из-за санкционных ограничений, получают потенциальное направление для собственных разработок. Пока это исследование, не продукт. Но если послойное сжатие на CPU покажет приемлемое качество хотя бы на узких задачах (классификация, извлечение сущностей), экономия на инфраструктуре будет кратной.
Всем, кто следит за рынком ИИ. Из доступных в РФ решений YandexGPT и GigaChat остаются основными рабочими инструментами. Проект Шумского не конкурирует с ними сегодня, но показывает, что альтернативы трансформерам исследуются в том числе российскими учёными.
Проект Шумского интересен не как готовый продукт, а как честная попытка решить три боли, которые трансформеры пока не закрыли: непрозрачность, галлюцинации и зависимость от дорогого железа. То, что система работает на CPU, для российского рынка ценнее любого бенчмарка. Проблемы, которые автор признаёт (антонимы, накопление потерь, рост пирамиды), серьёзны, и не факт, что решаемы в текущей архитектуре. Но именно такие исследования двигают индустрию: даже если нейросимвольный ИИ Шумского не заменит трансформер, отдельные идеи (сжатие контекста, иерархические словари) могут оказаться внутри будущих гибридных моделей. Следить за проектом стоит, вкладываться в него как в единственную ставку пока рано.
Для тех, кто работает с ИИ в условиях ограниченных ресурсов, проект Шумского формулирует правильный вопрос: обязательно ли платить за миллиарды параметров и GPU-кластеры, чтобы получить рабочую языковую модель. Ответа пока нет, но сам вопрос уже стоит внимания.
По данным блога Алексея Хахунова

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

FreeToken запускает большие языковые модели до 753B на одной видеокарте: в 2 раза быстрее аналогов
Текст содержит разрыв в оригинале: последний пункт Key Takeaways обрезан. Работаю строго по тому, что есть. Исследователи из Калифорнийского университета в…

Нейросети для редактирования фото стирают «отпечаток» камеры: доказать подлинность снимка больше нельзя
Нейросети для редактирования фото обрабатывают снимок целиком, даже если вы поправили только угол кадра, и это уничтожает криминалистический след камеры,…

MCP-протокол подключили к антидетект-браузеру: ИИ-агент управляет Camoufox одним промптом
Компания-разработчик yvv4git выпустила открытый пакет go-juggler-mcp, который связывает MCP протокол (Model Context Protocol, стандарт подключения инструментов…
Комментарии