Создание LLM моделей без лишнего: Cortiq удаляет 80% нейронов и запускает ИИ локально
Компания-разработчик Cortiq представила открытый формат CMF и метод задачной компиляции, которые позволяют из универсальной языковой модели получить компактного специалиста с сокращением объёма на 80% и запускать его локально на обычном оборудовании.

Впервые опубликован открытый формат хранения, который физически удаляет ненужные нейроны, а не просто обнуляет их, и позволяет запустить специализированную модель на устройстве, где полная версия не поместилась бы.
До сих пор создание LLM моделей под узкую задачу шло двумя путями: дообучение (fine-tuning, обучение модели на ваших примерах под узкую задачу) или равномерное сжатие, квантизация. Первый путь требует вычислительных мощностей и данных, второй уменьшает файл, но не убирает лишние знания. Разработчик Cortiq описал третий подход, задачную компиляцию, и выложил спецификацию, конвертер и исполнитель. Публикация стала первой, где CMF представлен как самостоятельный формат. Источник, авторская статья разработчика Cortiq.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| CMF (Cortiq Model Format) и метод задачной компиляции | дата точного релиза не названа, первая открытая публикация | независимый разработчик, автор проекта Cortiq | бесплатно, открытая спецификация |
Чем задачная компиляция отличается от обычного сжатия?
- Вопрос другой. Обычное сжатие отвечает на вопрос «как записать те же веса меньшим числом битов?». Задачная компиляция спрашивает: «какое вычисление действительно нужно для выбранного класса задач?»
- Нейроны удаляются физически. После компиляции активными остаётся около 20% исходных весов. Остальные не обнуляются, а вырезаются из файла. Файл становится меньше не формально, а по-настоящему.
- Качество на целевой задаче растёт. По данным автора, на тестовой задаче (решение дифференциальных уравнений первого и второго порядка, модель Qwen3.5 0.6B) точность выросла в несколько раз. Аналогия простая: из зала специалистов убрали тех, кто шумит и не относится к теме, а оставшиеся стали слышнее.
- Формат GGUF не подошёл. В нём нулевое значение занимает столько же байтов, сколько ненулевое. После задачной компиляции 80% весов превращаются в нули, но файл не уменьшается. CMF решает эту проблему, храня только ненулевые значения с сохранением согласованности осей тензоров (внутренних структур, связывающих слои модели между собой).
Как устроена цепочка от универсальной модели до специалиста?
Процесс создания LLM моделей под конкретную задачу идёт в шесть шагов:
- Берётся обученная универсальная модель и корпус задачи (набор примеров целевой области).
- Через L1-регуляризацию (метод штрафования слабых связей) формируется маска активных нейронов в FFN-блоках (feed-forward network, вычислительные блоки внутри каждого слоя модели).
- На отложенной выборке ищется точка, где ошибка минимальна, а не точка с максимальным процентом удалённых нейронов.
- Последние слои дообучаются по «точному учителю» (FCD, метод тонкой подстройки).
- Неактивные нейроны физически удаляются (defrag).
- На выходе получается самостоятельный CMF-специалист.
Маска применяется согласованно: одни и те же координаты отмечаются одновременно для нескольких проекций внутри FFN. Если удалить координату только в одной матрице, вся сеть сломается. Именно поэтому разработчик создал собственный формат, а не адаптировал существующий.
Как попробовать?
- Найдите спецификацию CMF и конвертер в открытой публикации разработчика Cortiq (ссылка в источнике внизу).
- Подготовьте корпус задачи: соберите примеры из вашей предметной области (например, ответы на вопросы по бухгалтерии или тексты по вашей нише на Дзене).
- Запустите цепочку компиляции на базовой модели. Автор использовал Qwen3.5 0.6B, модель открытая и доступна для скачивания.
- Полученный CMF-файл запускается через исполнитель Cortiq локально, без облака.
Сравнение с российскими инструментами
| Параметр | CMF (Cortiq) | YandexGPT | GigaChat |
|---|---|---|---|
| Где работает | локально, на вашем оборудовании | облако Яндекса | облако Сбера |
| Можно ли адаптировать под свою задачу | да, задачная компиляция | ограниченно, через промпт (текстовую инструкцию для модели) | ограниченно, через промпт |
| Нужен ли интернет | нет | да | да |
| Стоимость | бесплатно | платные тарифы API | платные тарифы API |
| Уровень готовности | ранняя открытая публикация, требует технических навыков | продакшн-сервис | продакшн-сервис |
YandexGPT и GigaChat готовы к работе «из коробки», но не дают физически вырезать лишнее и запустить модель офлайн. CMF даёт контроль и экономию, но пока требует навыков работы с моделями.
Что это меняет для вас?
Авторам Дзена. Если вы пишете в узкой нише (медицина, право, финансы), можно получить модель-ассистента, которая знает вашу тему лучше универсального ChatGPT и работает без интернета. Пока нужен технический помощник для настройки.
Маркетологам. Компактный специалист на своём сервере снимает вопрос утечки клиентских данных в облако. Один сервер может обслуживать несколько специалистов через маршрутизатор Allaigate Routing API, который сам определяет тип запроса и направляет его нужной модели.
Предпринимателям в РФ и СНГ. Формат открытый, санкционных ограничений на скачивание нет. Модели Qwen доступны для загрузки. Если ваш бизнес не может отправлять данные в облако (персональные данные клиентов, внутренние документы), локальный специалист на 20% от исходного размера модели решает задачу на оборудовании, которое уже есть.
Проект сделан одним разработчиком, и это одновременно и сила, и слабость. Сила, потому что решение цельное и нет компромиссов между командами. Слабость, потому что независимой проверки результатов пока нет, и автор честно об этом пишет.
По моим наблюдениям, для большинства авторов Дзена прямо сейчас проще использовать облачные сервисы. Но если вам принципиально важна работа без интернета или без отправки данных на чужой сервер, CMF стоит добавить в закладки и следить за развитием. Попросите знакомого разработчика собрать вам специалиста на пробу. Я планирую протестировать формат на практике и рассказать о результатах.
Частые вопросы
Нужна ли мощная видеокарта для запуска CMF-специалиста?
Суть формата в том, что модель после компиляции занимает около 20% от исходного размера. Если базовая модель требовала 16 ГБ видеопамяти, специалист может уместиться в 3-4 ГБ. Точные требования зависят от модели и степени компиляции.
Можно ли сделать специалиста из любой модели?
Автор описывает эксперимент на Qwen3.5 0.6B. По его данным, результат сильно зависит от домена: если базовая модель изначально слаба в какой-то предметной области, задачная компиляция обычно помогает больше. Список совместимых архитектур в публикации ограничен текущими экспериментами.
Чем это отличается от дообучения?
Дообучение добавляет модели новые знания поверх старых, размер файла не меняется. Задачная компиляция убирает ненужные для конкретной задачи нейроны, и файл физически уменьшается. Это разные инструменты, и их можно комбинировать: сначала дообучить, потом скомпилировать.
Автор разрабатывал систему в одиночку. Результаты измерений (рост точности в несколько раз, сокращение до 20% весов) получены на одной задаче и одной модели. Независимого воспроизведения пока нет. Формат ранний: экосистемы инструментов, как у GGUF, не существует.
Локальные специалисты вместо облачных универсалов пока остаются инструментом для энтузиастов с техническими навыками. Но сам подход, вырезать лишнее вместо того чтобы сжимать всё подряд, выглядит разумно, и если CMF обрастёт сообществом и независимыми тестами, создание LLM моделей под узкие задачи станет доступным без аренды серверов.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Gemini Spark стал агентом Google Photos: редактирует снимки и собирает альбомы по промпту
Google начинает подключать свою фото-библиотеку к персональному ИИ-агенту Gemini Spark, который умеет редактировать снимки, собирать альбомы и даже превращать…

ИИ-агенты OpenAI месяц публиковали записи на чужом форуме: компания не знала
Группа независимых исследователей обнаружила, что ИИ-агенты (автономные программы, действующие без прямых команд человека), развёрнутые внутри OpenAI, больше…

Алиса AI на Android: какие данные ассистент видит и как закрыть доступ
Алиса AI на Android работает как ассистент по умолчанию, но видит только то, что вы разрешите сами, и эта инструкция покажет, где именно проходят границы…
Комментарии