Игорь Градов
Игорь Градов
7 мин
ai

Xiaomi AI Cube запускает модели на 120 млрд параметров без Nvidia и облака

Xiaomi показала на закрытом показе в середине августа 2026 года инженерный прототип Xiaomi AI Cube, компактную рабочую станцию размером с кубик, которая запускает нейросети до 120 миллиардов параметров без облака и без видеокарт Nvidia.

Xiaomi AI Cube запускает модели на 120 млрд параметров без Nvidia и облака
Почему это важно

Xiaomi AI Cube собран на собственных чипах XRing и работает автономно: модели крутятся локально, данные не уходят на чужие серверы, а зависимость от Nvidia и облачных API равна нулю.

До сих пор запуск моделей такого масштаба на столе требовал либо Apple Mac Studio с максимальной памятью, либо сервера с видеокартами Nvidia. Xiaomi предложила альтернативу на полностью собственной кремниевой платформе. Подробности стали известны из утечек с закрытой демонстрации 18 августа 2026 года, о которой сообщили китайские отраслевые источники.

Что Когда Кто выпустил Цена
Xiaomi AI Cube, компактная ИИ-станция на чипах XRing Закрытый показ, середина августа 2026 Кремниевое подразделение Xiaomi Розничная цена не объявлена. Себестоимость сборки, по оценкам китайских отраслевых аналитиков, от 1 200 до 1 500 долларов

Что умеет Xiaomi AI Cube?

  • Три чипа вместо одного. Внутри не монолитный процессор, а чиплетная сборка XRing (чиплет — это когда несколько отдельных кристаллов объединены на одной подложке и общаются между собой через скоростную шину). Система состоит из трёх процессоров: XRing O3, XRing O100 и XRing D100.

  • XRing O3, системный контроллер. 10 ядер ARM v9.2, встроенная графика G2-Ultra NX на 16 ядер и базовый NPU (нейропроцессор, блок, заточенный на операции нейросетей) на 200 TOPS (триллионов операций в секунду) в формате INT8/FP8. На нём работают операционная система, драйверы, сеть и накопители.

  • XRing O100, матричный ускоритель. 6-нанометровый чип с 3D-компоновкой. Единственная задача: быстро считать матричные операции и декодировать слои трансформера (архитектура, на которой построены ChatGPT, Llama и другие большие модели). Встроенный буфер с пропускной способностью 1,22 ТБ/с снимает задержку до первого токена (токен — минимальный кусочек текста, который модель генерирует за один шаг).

  • XRing D100, вычислитель и банк памяти. 3-нанометровый кристалл с 20 ядрами, изначально создан для автопилота электромобилей Xiaomi. В него встроен четырёхканальный контроллер объединённой памяти до 160 ГБ (LPDDR5X/LPDDR6) с прямым доступом для процессора и нейропроцессора.

  • Корпус как радиатор. Куб с гранью 16 см, отфрезерованный из цельного куска авиационного алюминия. Более 33 тысяч микроотверстий на стенках, испарительная камера внутри, одна турбина. Пиковое потребление 150 Вт, в фоновом режиме 30-40 Вт. Питание через один кабель USB Type-C от внешнего GaN-блока на 200 Вт.

  • Порты для работы и кластера. Два USB4/Thunderbolt (40 Гбит/с, вывод видео DisplayPort 2.1), два Ethernet 10 Гбит/с (можно объединить несколько кубов в кластер), HDMI 2.1 (4K/120 Гц), Wi-Fi 7, Bluetooth 5.4.

Какие модели тянет и на какой скорости?

На закрытой демонстрации 18 августа инженеры показали реальные замеры:

  • Модели 3B-14B параметров (Llama 3.2, Qwen 2.5) в квантовании Q8/FP16 (квантование — сжатие весов модели для экономии памяти): 85-100 токенов в секунду при 35 Вт. Работают только на связке O3 и O100.

  • Модели 70B параметров (Llama 3.3 70B, DeepSeek V3 Lite) в 4-битном квантовании Q4_K_M (около 42 ГБ): 25-28 токенов в секунду. Для сравнения: комфортная скорость чтения человека составляет 5-8 токенов в секунду.

  • Модели 110B-120B параметров и архитектуры MoE (Mixture of Experts, смесь экспертов, когда модель активирует не все параметры сразу, а только нужную группу) помещаются в 160-гигабайтный пул D100 вместе с контекстом на 32-64 тысячи токенов: 10-14 токенов в секунду при полной нагрузке 150 Вт.

Демонстрация проходила на инженерном прототипе, и финальные цифры серийного устройства могут отличаться.

Софт и совместимость

Устройство работает на специализированном дистрибутиве Linux с прослойкой HyperOS AI Server. Для совместимости Xiaomi написала рантайм XRing Core, который транслирует операторы CUDA (набор инструкций Nvidia для вычислений на видеокартах) в команды для чипов O100 и D100.

Из коробки заявлена поддержка vLLM, llama.cpp, Ollama и PyTorch. Доступ к машине организован через веб-интерфейс, локальный API, совместимый с форматом OpenAI, или SSH-подключение (прямой терминальный доступ).

Это принципиальный момент: если трансляция CUDA действительно работает стабильно, пользователь сможет запускать большинство существующих открытых (опенсорс) моделей без переписывания кода.

Как попробовать?

  1. Дождитесь серийного релиза. Xiaomi AI Cube пока остаётся инженерным прототипом. Розничная цена и дата старта продаж не объявлены.
  2. Следите за китайскими площадками. Первые серийные партии с высокой вероятностью появятся на внутреннем рынке Китая. Для заказа в Россию понадобятся посредники или маркетплейсы с доставкой из КНР.
  3. Проверьте совместимость с вашими моделями. Если вы уже работаете с Ollama или llama.cpp, переход на Xiaomi AI Cube не потребует смены инструментов. Убедитесь, что нужные вам модели помещаются в 160 ГБ памяти.

Сравнение с тем, что доступно в России

Прямого российского аналога Xiaomi AI Cube на рынке нет. Ближайшая альтернатива для локального запуска больших моделей — Apple Mac Studio на чипе M2 Ultra (192 ГБ объединённой памяти) или M4-серия. Из облачных вариантов в России доступны YandexGPT и GigaChat от Сбера, но они работают через API на серверах компаний, а не локально.

Параметр Xiaomi AI Cube (прототип) Apple Mac Studio M2 Ultra YandexGPT / GigaChat
Где работает модель Локально, на устройстве Локально, на устройстве На серверах Яндекса / Сбера
Память под модели До 160 ГБ До 192 ГБ Не применимо
Зависимость от облака Нет Нет Полная
Потребление До 150 Вт До 370 Вт (розетка) Не применимо
Цена Не объявлена (себестоимость от $1 200) От $4 000 (в РФ дороже) Подписка / оплата за токены
Совместимость с Ollama, llama.cpp Заявлена Да Нет

Для тех, кому критична приватность данных или кто работает без стабильного интернета, локальное устройство остаётся единственным вариантом.

Что это значит для вас?

  • Автору Дзена и копирайтеру. Если вы используете ChatGPT или YandexGPT через браузер, Xiaomi AI Cube позволит запускать сопоставимые открытые модели у себя дома. Тексты, промпты (запросы к модели), черновики не уходят в облако и не становятся обучающими данными чужого сервиса.

  • Маркетологу. Локальный инференс (генерация ответов моделью на вашем устройстве) убирает плату за каждый запрос к API. При больших объёмах генерации контента разница в расходах ощутима: вы платите один раз за устройство, а не за каждый токен.

  • Предпринимателю в РФ и СНГ. Устройство снимает зависимость от зарубежных облачных API, которые могут ограничить доступ из России. Но пока это прототип: покупать нечего, планировать бюджет рано. Следите за анонсом серийной версии.

Мнение редакции dzen.guru

Xiaomi AI Cube — первая попытка крупного производителя электроники уместить серверную нагрузку в настольный куб на собственных чипах. На бумаге всё складывается: 150 Вт вместо серверной стойки, совместимость с привычным софтом, память под модели до 120B параметров.

Но я бы сдержал восторг до серийного образца. Трансляция CUDA через XRing Core — самое рискованное место: если она «ломает» совместимость хотя бы с частью популярных моделей, ценность устройства резко падает. Замеры скорости сделаны на инженерном прототипе при закрытом показе, а не в независимых тестах.

Что сделать сегодня: если вы ещё не пробовали запускать открытые модели локально, установите Ollama на свой компьютер и протестируйте Llama 3.2 или Qwen 2.5 в небольших размерах. Это бесплатно и даст понимание, нужен ли вам вообще локальный ИИ, до того как Xiaomi назовёт цену.

Частые вопросы

Можно ли купить Xiaomi AI Cube сейчас?

Нет. На август 2026 года это инженерный прототип. Xiaomi не объявила ни розничной цены, ни даты начала продаж. По оценкам китайских отраслевых аналитиков, себестоимость сборки составляет от 1 200 до 1 500 долларов, но финальная розничная цена может отличаться.

Заменит ли Xiaomi AI Cube подписку на ChatGPT или YandexGPT?

Зависит от задач. Устройство запускает открытые модели (Llama, Qwen, DeepSeek), а не проприетарные модели OpenAI или Яндекса. Для генерации текстов, работы с промптами и локальных экспериментов открытые модели на 70B-120B параметров дают сопоставимое качество по многим задачам. Но у облачных сервисов есть свои преимущества: постоянные обновления моделей, встроенные инструменты и техподдержка.

Будет ли Xiaomi AI Cube работать с русским языком?

Устройство запускает любые открытые модели, которые поддерживают русский язык. Qwen 2.5 и Llama 3.3 работают с русским текстом. Качество зависит от конкретной модели, а не от устройства: Xiaomi AI Cube — это железо, а язык определяется весами модели, которую вы на него загрузите.

Если Xiaomi удержит серийную цену ниже двух тысяч долларов, у Apple Mac Studio появится конкурент, который потребляет втрое меньше энергии и не требует экосистемы macOS, а у пользователей в России появится реальный способ запускать большие нейросети без оглядки на доступность зарубежных облаков.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Python библиотеки ML молча лезут в сеть: как найти скрытые загрузки до деплоя

Компания или проект, давшая исходник, не указана как отдельный источник: автор Павел описывает практический опыт разработки ИИ-приложений для крупных компаний.…

6 мин
AI native команды: 59% роста у лучших, 4% у остальных и четыре фактора разрыва
ai

AI native команды: 59% роста у лучших, 4% у остальных и четыре фактора разрыва

Пересекаю факты из оригинала и строю новость строго по ним. В 2026 году тезис о том, что два-три инженера с ИИ-агентами (программами, которые выполняют задачи…

7 мин
Что такое ИИ-агент на практике: эксперты назвали случаи, когда он замедляет работу
ai

Что такое ИИ-агент на практике: эксперты назвали случаи, когда он замедляет работу

Компании всё чаще передают ИИ-агентам (программам, которые сами выполняют цепочки задач без участия человека) не отдельные запросы, а целые рабочие процессы, и…

5 мин