Игорь Градов
Игорь Градов
7 мин
ai

Kimi K3: 2,8 трлн параметров в открытом доступе, активны лишь 104 млрд на токен

Moonshot AI выложила в открытый доступ веса Kimi K3, мультимодальной модели с 2,8 трлн параметров на архитектуре MoE (смесь экспертов, когда на каждый запрос работает только часть «мозга» модели), и в этом руководстве разберём, как устроена модель и что с ней делать на практике.

Почему это важно

Kimi K3 открыта для локального использования без лицензионных ограничений при выручке до 20 млн долларов, а её архитектура с линейным вниманием и разреженными экспертами позволяет запускать модель масштаба 2,8 трлн параметров, активируя только 104 млрд на каждый токен (минимальную единицу текста, которую обрабатывает модель), что критично для тех, кто считает стоимость инференса (вычислений при генерации ответа).

Moonshot AI, китайская компания-разработчик, опубликовала технический отчёт и выложила веса на Hugging Face. Модель обходит Claude Opus 4.8, GPT-5.5, GPT-5.6 Sol и Claude Fable 5 в отдельных тестах на программирование и работу с инструментами, но сама Moonshot признаёт: в среднем K3 уступает Fable 5 и GPT-5.6 Sol. Это честная позиция, которая встречается нечасто.

Что понадобится

  • Доступ к весам: страница Kimi K3 на Hugging Face (96 файлов safetensors, около 1,56 ТБ)
  • Железо для локального запуска: серверные GPU с суммарной видеопамятью, достаточной для размещения активной части модели (104 млрд параметров на токен); точные минимальные требования Moonshot не указала
  • Альтернатива без локального железа: API Moonshot (если компания откроет доступ через облако) или площадки, которые уже хостят K3
  • Лицензия: открытые веса (open weights), но не безусловно открытая лицензия. Если ваша выручка от предоставления доступа к модели как к услуге превышает 20 млн долларов за последовательные 12 месяцев, потребуется отдельное соглашение с Moonshot
  • Время на разбор архитектуры: 20 минут на чтение этого руководства, от нескольких часов до нескольких дней на развёртывание

Как устроена Kimi K3 по шагам?

Moonshot описывает K3 как систему, которая смешивает информацию по трём осям: последовательность (порядок слов), глубина (слои модели) и каналы (распределение между экспертами). Каждая ось масштабируется отдельным механизмом.

1. Последовательность: три KDA на один глобальный MLA

Модель чередует слои по схеме: три блока Kimi Delta Attention (KDA), затем один блок глобального Multi-head Latent Attention (MLA).

KDA работает как рекуррентный вариант линейного внимания. Вместо растущего KV-кеша (хранилища «памяти» о предыдущих токенах, которое у обычных моделей разбухает с длиной текста) KDA поддерживает состояние фиксированного размера. Поканальный коэффициент забывания определяет, какую часть старого состояния сохранить.

В K3 Moonshot ограничила минимальное значение коэффициента забывания (g_min = -5). Это изменение не косметическое: оно удерживает диапазон вычислений в пределах формата BF16 и убирает из GPU-ядра отдельную медленную ветку для диагональных блоков. Проще говоря, одна формула заменяет костыль в коде, и модель считается быстрее.

MLA на каждом четвёртом слое сжимает ключи и значения в компактный латентный вектор, но сохраняет глобальное взаимодействие между позициями. Явного позиционного кодирования (RoPE, YaRN) у этих слоёв нет: KDA передаёт информацию о порядке, а MLA отвечает за смысловое сопоставление. При расширении контекста не нужна перенастройка позиционных кодировок.

2. Глубина: Attention Residuals вместо фиксированного суммирования

Обычная остаточная связь (residual connection) складывает выход каждого слоя с накопленным состоянием с фиксированным весом. Чем глубже модель, тем сильнее «размазывается» информация ранних слоёв.

K3 использует Block AttnRes: слои объединяются в блоки по 12, внутри блока выходы суммируются, а между блоками работает внимание. Каждый слой выбирает, представление какой глубины ему нужно. Объём хранимых промежуточных данных снижается с O(Ld) до O(Nd), где N определяется числом блоков, а не слоёв.

Moonshot показала улучшения Block AttnRes на модели Kimi Linear (48 млрд параметров, 3 млрд активных). Для масштаба 2,8 трлн параметров описание опубликовано, но независимой проверки пока нет.

3. Каналы: Stable LatentMoE с 896 экспертами

При 896 экспертах и выборе 16 на каждый токен прямая отправка полного скрытого состояния шириной 7 168 съела бы все преимущества разреженности. LatentMoE сначала сжимает маршрутизируемую ветвь до ширины 3 584, выполняет вычисления экспертов в этом пространстве и проецирует обратно. Два общих эксперта работают в полной ширине.

Для стабильности Moonshot решила две проблемы:

  • Выбросы активаций: добавлены нормализация RMSNorm перед обратной проекцией и активация SiTU-GLU вместо SwiGLU. Обе ветви ограничены функцией tanh с коэффициентами 4 и 25, модуль произведения не превышает 100. Около нуля модель ведёт себя как SwiGLU, но на больших значениях не уходит в квадратичный рост
  • Неравномерная нагрузка между экспертами: метод квантильной балансировки (Quantile Balancing) корректирует смещение через квантиль зазора, привязанную к целевому числу токенов на эксперта. Смещение влияет на выбор Top-k, но не входит в веса смеси и не искажает градиент маршрутизатора

4. Зрение: MoonViT-V2 обучался с нуля вместе с языковой моделью

Moonshot отказалась от инициализации зрительного энкодера (encoder, модуля, который «видит» картинки) из предобученного SigLIP: во внутренних экспериментах это создавало всплески градиентов. MoonViT-V2 обучался с нуля совместно с языковой моделью с общей целью предсказания следующего токена.

Зрительный путь: 27-слойный ViT, раздельные пространственные и временные проходы внимания, агрегирование по времени. Pixel Shuffle 2x2 сокращает число зрительных токенов в четыре раза. Максимальное заявленное разрешение: 3584x3584 пикселей.

Как это применить

Допустим, вы разработчик и хотите проверить K3 на задаче код-ревью. Скачиваете веса с Hugging Face (96 файлов, 1,56 ТБ), загружаете активную часть модели на GPU-кластер, подаёте промпт:

Проверь этот Python-код на ошибки, предложи рефакторинг и объясни каждое изменение:
[вставьте код]

По результатам тестов Moonshot, именно в задачах программирования и работы с инструментами K3 показывает результаты на уровне или выше Claude Opus 4.8 и GPT-5.5. Для задач общего назначения Moonshot сама указывает, что модель в среднем уступает Fable 5 и GPT-5.6 Sol.

Что делать с этим прямо сейчас, по ролям?

Разработчику и ML-инженеру: K3 интересна как исследовательская база. Архитектура KDA с фиксированным состоянием и Block AttnRes документирована в техническом отчёте. Если ваша выручка от предоставления модели как сервиса ниже 20 млн долларов, веса можно использовать без отдельной лицензии.

Автору Дзена и копирайтеру: прямой доступ к K3 пока требует серьёзного железа, использование через API зависит от того, запустят ли хостинг-площадки модель. Следите за появлением K3 в интерфейсах, где не нужна установка. Из доступных в РФ аналогов для ежедневной текстовой работы по-прежнему проще использовать YandexGPT и GigaChat.

Предпринимателю и руководителю: ключевое из лицензии Kimi K3 состоит в том, что порог 20 млн долларов годовой выручки от услуг на базе модели считается за последовательные 12 месяцев. Если ваш бизнес ниже этой планки, можно развернуть модель локально без согласований.

Частые ошибки

Не путайте «открытые веса» с «открытой лицензией»: K3 можно скачать и запускать, но лицензия условная. При масштабировании до коммерческого сервиса с выручкой выше 20 млн долларов нужно отдельное соглашение с Moonshot.

Не ориентируйтесь только на тесты, где K3 лидирует: Moonshot сама указывает, что в среднем модель уступает Fable 5 и GPT-5.6 Sol. Выбирайте модель под конкретную задачу, а не по лучшей строчке в таблице.

Объём весов (1,56 ТБ, 96 файлов) требует не только GPU-памяти, но и быстрого хранилища и канала для скачивания. Считайте инфраструктуру заранее.

Мнение редакции dzen.guru

Kimi K3 подкупает тем, чего в индустрии обычно не хватает: Moonshot честно говорит, где модель проигрывает. Это позволяет использовать K3 осмысленно, а не по хайпу.

Архитектурные решения (фиксированное состояние вместо растущего кеша, сжатие перед экспертами, обучение визуального модуля с нуля совместно с языковым) проектировались для снижения стоимости инференса при больших контекстах. Для российских команд, которые считают каждый GPU-час, это практически ценно.

Но я бы подождал независимых тестов на масштабе 2,8 трлн параметров. Moonshot опубликовала отчёт и конфигурацию, однако многие заявления (Block AttnRes, квантильная балансировка на 896 экспертах) пока подтверждены только внутренними экспериментами компании. Доверяй, но проверяй.

Хотите разбираться в нейросетях без технического бэкграунда?

На dzen.guru мы разбираем ИИ-инструменты так, чтобы было понятно и применимо. Подписывайтесь на канал и получайте практические разборы первыми.

Подписаться на dzen.guru

Moonshot сделала ставку не на рекордные бенчмарки, а на архитектуру, которая дешевле в эксплуатации при длинных контекстах и агентных сценариях. Для тех, кто в РФ строит продукты на открытых моделях, K3 стоит взять в шорт-лист и протестировать на своих задачах, как только появится доступная инфраструктура для запуска.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Anthropic не против открытых моделей ИИ: Амодеи предложил глобальное тестирование вместо запретов
ai

Anthropic не против открытых моделей ИИ: Амодеи предложил глобальное тестирование вместо запретов

Anthropic не призывает запрещать открытые модели ИИ и предлагает глобальное тестирование безопасности вместо ограничений, потому что главная угроза, по мнению…

5 мин
Meta AI нейросеть вышла в личные сообщения Threads: бесплатный ИИ-ассистент доступен глобально
ai

Meta AI нейросеть вышла в личные сообщения Threads: бесплатный ИИ-ассистент доступен глобально

Meta в понедельник начала глобальное развёртывание своего ИИ-ассистента Meta AI в личных сообщениях Threads, и это первый случай, когда нейросеть компании…

4 мин
ai

Nvidia и Microsoft создали альянс по безопасности ИИ без OpenAI, Google и Anthropic

Microsoft и Nvidia создали альянс по безопасности ИИ с открытым кодом, куда вошли SpaceX, IBM, Palantir и ещё десяток компаний, но не вошли OpenAI, Google и…

5 мин