Игорь Градов
Игорь Градов
7 мин
ai

NVIDIA DGX Spark 64GB для локальных ИИ агентов

Microsoft второго июня запустила DGX Spark 64GB, компактный настольный компьютер на суперчипе Grace Blackwell, который позволяет держать ИИ-агентов и открытые модели локально, без облачных подписок и платы за каждый запрос.

Почему это важно

NVIDIA впервые предлагает настольную систему с 64 ГБ единой памяти, где модели и агенты работают круглосуточно без оплаты токенов, а два таких устройства объединяются в кластер со 128 ГБ и удвоенной мощностью.

Компания NVIDIA анонсировала новую конфигурацию своей настольной ИИ-системы DGX Spark с 64 ГБ памяти. Устройство выпускают шесть производителей: Acer, ASUS, Dell, Gigabyte, HP и MSI. По данным NVIDIA, время выбрано неслучайно: с начала 2026 года потребление токенов (минимальных единиц текста, которые обрабатывает модель) выросло в 14 раз из-за того, что ИИ-агенты непрерывно обращаются к инструментам, перезапускают задачи и строят многоступенчатые планы. В облаке каждый такой токен оплачивается отдельно. На собственном устройстве поминутной платы нет.

Что Когда Кто выпустил Цена
DGX Spark 64GB, настольная ИИ-система на суперчипе GB10 Grace Blackwell Дату старта продаж NVIDIA не назвала NVIDIA; производят Acer, ASUS, Dell, Gigabyte, HP, MSI Цену NVIDIA не раскрыла

Что внутри и чем отличается от старшей версии?

  • Тот же суперчип GB10. Графический процессор Blackwell с тензорными ядрами пятого поколения и 20-ядерный процессор Grace на архитектуре Arm. По данным NVIDIA, GPU выдаёт до 1 петаFLOPS (квадриллион операций в секунду) вычислений формата FP4.
  • Единая память 64 ГБ LPDDR5x вместо 128 ГБ. Процессор и видеокарта делят один пул памяти через шину NVLink-C2C, которая, по спецификации NVIDIA, в пять раз быстрее PCIe Gen 5. Модели не копируются из оперативной памяти в видеопамять и обратно, а живут в одном пространстве. Для ИИ-агентов (программ, которые сами выполняют цепочки действий) это означает, что несколько моделей, их кеш и вспомогательные процессы помещаются вместе.
  • Программное обеспечение работает сразу из коробки. Операционная система DGX OS поставляется с PyTorch, Jupyter и Ollama. Модели семейства Nemotron оптимизированы под устройство.
  • Питание от обычной розетки. Серверная комната и специальное охлаждение не нужны, что важно для агента, который должен работать круглосуточно.
  • Встроенная сеть для кластеризации. Адаптер ConnectX-7 на 200 Гбит/с позволяет объединить два устройства по 64 ГБ в кластер со 128 ГБ памяти и удвоенной пропускной способностью. По данным NVIDIA, два объединённых блока по 64 ГБ дают до 1,7 раза больше производительности, чем один DGX Spark 128 ГБ.

Какие модели помещаются в 64 ГБ?

NVIDIA позиционирует 64 ГБ как достаточный объём для открытых моделей класса 30-35 миллиардов параметров. Ключевая модель, на которую делает ставку экосистема, называется Llama Glimmer: Meta выделила её из семейства Llama Spark, которое стоит за ассистентом Meta AI.

По данным Meta, Glimmer набирает 51,2 балла на бенчмарке SWE-Bench Pro и 75,5 на MCP Atlas. Контекстное окно (объём текста, который модель «видит» за раз) составляет 131 000 токенов. В полном формате BF16 модель занимает более 55 ГБ и почти не оставляет места для контекста. Поэтому на 64 ГБ практичный вариант это квантизированная (сжатая с потерей точности) сборка размером около 17 ГБ.

Для более крупных моделей, таких как DeepSeek V4 Flash, одного устройства недостаточно. По собственным тестам NVIDIA, эта модель запускалась на четырёх объединённых DGX Spark 64 ГБ.

Пять задач, которые решает одна коробка

  1. Круглосуточный персональный агент. Устанавливаете среду, указываете агенту на свои репозитории, тестовый бегунок или RSS-ленту. К утру он разобрал новые задачи, воспроизвёл падающий тест и подготовил черновик исправления. Код, заметки и почта не покидают машину.
  2. Дообучение (fine-tuning) модели на ваших данных. Метод QLoRA позволяет дообучить модель с 70 миллиардами параметров в 64 ГБ памяти. По замерам NVIDIA, при распределённом дообучении на одном узле скорость составляет около 18 400 токенов в секунду.
  3. Оценка новых моделей в день выхода. Появилась новая открытая модель на Hugging Face: скачали, прогнали собственный набор вопросов, замерили скорость и точность. Повторный прогон 50 раз не стоит ничего.
  4. Команда из нескольких моделей. Единая память позволяет держать маршрутизатор и основную рассуждающую модель в одном пуле. Когда задача превышает локальные возможности, агент может отправить обезличенный запрос в облако.
  5. Прототипирование для робототехники. Дообучаете модель распознавания изображений, проверяете на том же CUDA-стеке (программный слой NVIDIA для вычислений на GPU), затем разворачиваете на устройстве NVIDIA Jetson на производственной линии.

Как попробовать?

  1. Проверьте доступность DGX Spark 64 ГБ у одного из шести производителей: Acer, ASUS, Dell, Gigabyte, HP, MSI. Цену и дату старта продаж NVIDIA пока не объявила.
  2. Пошаговые инструкции по настройке кластера и запуску моделей, включая vLLM на нескольких узлах, NVIDIA публикует на странице build.nvidia.com/spark.
  3. Для первых экспериментов без покупки оборудования установите Ollama на обычный компьютер и загрузите квантизированную модель класса 7-8 миллиардов параметров: это даст представление о локальном инференсе (запуске модели на своём железе), хотя и без мощности DGX Spark.

Сравнение: локальное железо или облачные API в России?

Для аудитории в РФ и СНГ, где доступ к зарубежным облачным API (OpenAI, Anthropic, Google) ограничен или нестабилен, вопрос локального запуска стоит острее, чем в США.

Параметр DGX Spark 64 ГБ (локально) YandexGPT / GigaChat (облако)
Оплата Разовая покупка устройства Поминутная или потокенная
Приватность данных Данные не покидают машину Данные уходят на серверы провайдера
Модели Любые открытые модели до 35 млрд параметров Только модели провайдера
Доступность в РФ Поставки NVIDIA в Россию ограничены санкциями Доступны без ограничений

Главная оговорка: DGX Spark, как и другое оборудование NVIDIA для дата-центров NVIDIA и персональных рабочих станций, подпадает под экспортные ограничения. Официальные поставки в Россию на момент публикации затруднены. YandexGPT и GigaChat доступны без ограничений, но работают только через облако, не дают запускать произвольные открытые модели и берут плату за токены.

Мнение редакции dzen.guru

DGX Spark 64 ГБ, на мой взгляд, самая понятная попытка NVIDIA объяснить разработчикам и малому бизнесу, зачем держать ИИ у себя на столе, а не в облаке. Рост потребления токенов в 14 раз, число из отчёта самой NVIDIA, превращает облачных агентов в дорогую подписку: агент работает круглосуточно, и каждый «разговор с инструментом» стоит денег.

Для авторов Дзена и контент-маркетологов это пока история «на вырост»: цена неизвестна, поставки в Россию под вопросом, а квантизированная модель на 17 ГБ не заменит GPT-4o по качеству текста. Но сам принцип «локальный агент без подписки» через год-два может стать нормой, когда открытые модели подтянутся ещё ближе к закрытым.

Что сделать сегодня: установите Ollama, попробуйте запустить квантизированную Llama на своём компьютере. Это бесплатный способ понять, подходит ли вам локальный инференс, до того как тратить деньги на специализированное железо.

Частые вопросы

Можно ли купить DGX Spark 64 ГБ в России?

На момент публикации NVIDIA не объявила дату начала продаж и цену. Оборудование NVIDIA для дата-центров NVIDIA и рабочих станций подпадает под экспортные ограничения, поэтому официальная покупка в РФ затруднена. Следите за предложениями у авторизованных реселлеров в доступных юрисдикциях.

Чем 64 ГБ версия отличается от 128 ГБ?

Суперчип, сетевой адаптер и программный стек идентичны. Разница только в объёме единой памяти: 64 ГБ вместо 128 ГБ. NVIDIA позиционирует младшую версию для моделей класса 30-35 миллиардов параметров, а старшую для более крупных задач на одном устройстве. При этом два устройства по 64 ГБ объединяются в кластер со 128 ГБ и, по данным NVIDIA, дают до 1,7 раза больше производительности, чем одна 128 ГБ система.

Заменит ли DGX Spark облачный ChatGPT или YandexGPT?

Нет. Устройство запускает открытые модели, а не закрытые сервисы вроде ChatGPT или YandexGPT. Качество ответов зависит от конкретной модели: квантизированная Llama Glimmer на 17 ГБ решает задачи иначе и на другом уровне, чем полноразмерная облачная модель с сотнями миллиардов параметров. DGX Spark подходит тем, кому критичны приватность данных, отсутствие потокенной оплаты и возможность дообучать модель под свои задачи.

Настольная ИИ-станция без абонентской платы за токены, идея простая, но для российских пользователей пока упирается в доступность железа. Если санкционный барьер не для вас, DGX Spark 64 ГБ закрывает конкретную задачу: держать агентов включёнными, не глядя на счёт от облака.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Prime Intellect запустила serverless ИИ на Blackwell: триллион токенов в день и 100% аптайм

Компания Prime Intellect запустила Prime Inference, платформу для запуска открытых моделей в режиме serverless ИИ, которая до публичного релиза обрабатывала…

5 мин
ai

Microsoft выпустила нейросеть для распознавания речи: первое место среди 38 моделей при WER 2,5%

Microsoft первого октября выпустила MAI Transcribe 2 Streaming, свою первую нейросеть для распознавания речи в реальном времени, которая, по независимым…

5 мин
ai

Datalab открыла бенчмарки нейросетей для всех: 620 документов, 6 типов вердиктов, Apache 2.0

Microsoft второго июня запустила OmniExtractBench, и нет, подождите, это не Microsoft. Перечитаю источник внимательно. Компания Datalab выпустила…

5 мин