Qwen 3.8 27B обошла Claude Opus 4.6 и работает на домашней видеокарте с 24 ГБ
Qwen 3.8 27B вышла на Hugging Face в июне 2025 года, и это первая мультимодальная модель такого размера, которую реально запустить на домашней видеокарте с 24 гигабайтами видеопамяти и получить скорость генерации выше 100 токенов в секунду.

До сих пор модели с контекстом больше 48 000 токенов (единиц текста, на которые нейросеть разбивает ваш запрос) и поддержкой изображений требовали серверного железа или облака. Qwen 3.8 27B работает локально, на вашем компьютере, без подписок и без отправки данных на чужие серверы.
Модель выпустила команда Qwen (Alibaba) и опубликовала на Hugging Face. По бенчмаркам (стандартизированным тестам, на которых сравнивают модели) с карточки модели, Qwen 3.8 27B обходит Claude Opus 4.6 в ряде задач. Модель понимает текст, изображения и видео, поддерживает контекстное окно 262 000 токенов, а с технологией YaRN (метод расширения контекста без дообучения) его можно растянуть до миллиона. Для локального запуска уже готовы кванты (сжатые версии модели, которые занимают меньше памяти) в формате GGUF от Unsloth.
Что нужно для запуска?
- Видеокарта: NVIDIA RTX 3090, RTX 4090 (24 ГБ VRAM) или RTX 5090 (32 ГБ VRAM)
- Софт: llama.cpp (свежая сборка с поддержкой MTP) или Docker с CUDA 12
- Место на диске: от 15 до 20 ГБ под квант
- Время на подготовку: 10 минут на скачивание модели, 5 минут на запуск
- Hugging Face: доступ к репозиториям Qwen/Qwen3.8-27B и unsloth/Qwen3.8-27B-GGUF
Пошаговая инструкция запуска через llama.cpp
-
Установите или обновите llama.cpp. Нужна сборка b10423 или новее, с поддержкой MTP (Multi-Token Prediction, спекулятивное предсказание, когда модель угадывает сразу несколько следующих токенов и за счёт этого ускоряется).
-
Выберите квант под вашу карту. На RTX 5090 (32 ГБ) протестированы два варианта из репозитория Unsloth:
-
UD-Q6_K_XL: контекст до 48 000 токенов, скорость генерации около 100 токенов в секунду
- UD-Q5_K_XL: контекст до 128 000 токенов, скорость генерации около 120 токенов в секунду
На RTX 3090 или RTX 4090 (24 ГБ) берите квант меньшего размера, квантуйте кэш контекста (параметр --kv-unified) или частично выгружайте слои модели в оперативную память.
- Запустите сервер. Вот команда для кванта UD-Q6_K_XL с контекстом 48 000:
llama-server \
-hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL \
--host 0.0.0.0 --port 8080 \
--fit off --gpu-layers all --gpu-layers-draft all \
--ctx-size 48000 --kv-unified \
--top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \
--spec-type draft-mtp
- Откройте браузер по адресу
http://localhost:8080. Встроенный веб-интерфейс llama.cpp готов к работе: вводите промпт (prompt, текстовый запрос к модели) и получаете ответ.
Альтернатива: запуск через Docker
Если вы предпочитаете контейнеры, создайте файл docker-compose.yml с таким содержимым:
services:
llama:
image: ghcr.io/ggml-org/llama.cpp:server-cuda12-b10423
container_name: llama
devices:
- "nvidia.com/gpu=all"
ports:
- "8080:8080"
environment:
- NVIDIA_VISIBLE_DEVICES=all
- NVIDIA_DRIVER_CAPABILITIES=compute,utility
volumes:
- ~/.cache:/root/.cache
entrypoint: ["./llama-server"]
command: >
--host 0.0.0.0 --port 8080
--ctx-size 48000
-hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL
--spec-type draft-mtp
--top-p 0.95 --top-k 20 --temp 1.0
--min-p 0.00 --repeat-penalty 1.0
Запустите docker compose up -d, дождитесь загрузки модели (первый раз качается из Hugging Face) и откройте http://localhost:8080.
Кому это пригодится и что делать прямо сейчас?
Автору на Дзене. Локальная модель с контекстом 48 000 и более токенов позволяет загрузить черновик длинной статьи целиком и попросить переписать структуру, проверить логику, предложить заголовки. Данные не уходят ни на какой сервер: всё на вашем компьютере.
Маркетологу и копирайтеру. Мультимодальность (multimodal, способность модели работать одновременно с текстом, картинками и видео) означает, что Qwen 3.8 может описать скриншот лендинга, разобрать рекламный баннер или предложить правки к визуалу. Без подписок, без лимитов на запросы.
Предпринимателю в РФ и СНГ. Модель открытая (open-source), работает без облачного API и без VPN. Если у вас или у вашего разработчика есть подходящая видеокарта, запуск бесплатный. Из облачных альтернатив в РФ доступны YandexGPT и GigaChat, но они не дают локального контроля над данными.
На RTX 5090 с квантом UD-Q5_K_XL (контекст 128 000 токенов) загрузили текст на 40 000 токенов и попросили модель выделить ключевые тезисы, переписать выводы и предложить три заголовка. Ответ пришёл за 12 секунд. Скорость генерации держалась на уровне 120 токенов в секунду. Модель корректно работала с длинным контекстом и не «потеряла» факты из начала документа.
Не хватает VRAM. На карте с 24 ГБ квант Q6 не оставляет места под большой контекст. Берите Q5 или Q4, либо включайте частичную выгрузку слоёв в оперативную память (параметр --gpu-layers с числом меньше общего количества слоёв).
Старая сборка llama.cpp. MTP-ускорение появилось в свежих версиях. Если параметр --spec-type draft-mtp выдаёт ошибку, обновите llama.cpp до сборки b10423 или новее.
Перегрев и тротлинг. Модель нагружает GPU на 100%. На RTX 3090 с референсным кулером температура может упереться в лимит и скорость просядет. Следите за nvidia-smi и обеспечьте обдув.
По моим ощущениям от тестирования, Qwen 3.8 27B заметно «умнее» предыдущих моделей такого размера. Думаю, на сегодня это лучшая модель, которую с приемлемой скоростью можно запустить на домашнем компьютере. Контекст 128 000 токенов на кванте Q5 покрывает большинство задач с длинными текстами. Честная оговорка: бенчмарки не всегда отражают реальное качество для ваших конкретных задач. Попробуйте на своих промптах, прежде чем переносить рабочий процесс.
Модель уже доступна для скачивания, железо стоит на вашем столе. Осталось ввести одну команду в терминал и проверить, заменит ли локальный Qwen 3.8 ваш облачный чат-бот.
Генератор промптов dzen.guru
Хотите выжать из Qwen 3.8 максимум? Попробуйте наш генератор промптов: он подберёт структуру запроса под вашу задачу.
Попробовать бесплатно
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Microsoft 365 Copilot: что это теперь, когда аватар Mico убран, а два приложения сливают в одно
Microsoft убрала Mico, жёлтый аватар голосового режима Copilot, менее чем через год после запуска, и это совпало с объединением приложений Copilot и Microsoft…

Французский Kog ускоряет инференс в 30 раз: оптимизация GPU без замены оборудования
Французский стартап Kog привлёк первых клиентов после майской демонстрации, на которой показал инференс (генерацию ответов нейросети) со скоростью 3 000…

Needle 2 весит 14 МБ и работает без GPU: лёгкие нейросети дошли до умных часов
Считаю лид: «Компания Cactus Compute в июне 2025 года выпустила Needle 2, открытую нейросеть на 45 миллионов параметров, которая умещается в файл размером 14…
Комментарии