Игорь Градов
Игорь Градов
6 мин
ai

Qwen3.8 27B: лучшая из локальных LLM моделей, но ответа ждать 21 минуту

Alibaba 14 августа выложила в открытый доступ Qwen3.8-27B, мультимодальную модель с открытыми весами на лицензии Apache 2.0, которая помещается на обычном ноутбуке, но заставляет ждать ответа минутами.

Qwen3.8 27B: лучшая из локальных LLM моделей, но ответа ждать 21 минуту
Почему это важно

Модель с 27 миллиардами параметров впервые показывает результаты уровня закрытых API в задачах на код, при этом её можно скачать бесплатно и запустить без облака. Для тех, кто ищет локальные LLM модели, это практический шаг вперёд, но с жёсткими оговорками по скорости.

Контекст такой: Alibaba в этом месяце выпустила сразу две модели линейки Qwen3.8. Первая, Qwen3.8-Max, доступна только через API и содержит 2,4 триллиона параметров. Вторая, Qwen3.8-27B, вышла 14 августа с открытыми весами (open weights, когда разработчик публикует «начинку» модели и любой может скачать её) на платформе Hugging Face. Именно вторая модель вызвала основной интерес: она компактна настолько, что помещается в оперативную память потребительского компьютера, но работает медленно.

Автор обзора, на который мы опираемся, честно признаётся: полноценный тест он не провёл. На MacBook Air M4 модель выдавала около восьми токенов (фрагментов текста, из которых модель собирает ответ) в секунду, и автор потерял терпение уже на втором запросе.

Что Когда Кто выпустил Цена
Qwen3.8-27B, мультимодальная модель с открытыми весами 14 августа Alibaba (подразделение Qwen) Бесплатно, лицензия Apache 2.0

Что отличает эту модель от предшественников?

  • 27,78 миллиарда параметров и встроенный визуальный энкодер (компонент, который позволяет модели «видеть»). Модель принимает на вход текст, изображения и видео. О визуальных возможностях заранее не объявляли.

  • Гибридная архитектура вместо обычного трансформера. 64 слоя чередуют 48 слоёв Gated DeltaNet (линейное внимание, быстрое, но упрощённое) с 16 слоями полного внимания в соотношении 3:1. Только 16 слоёв хранят KV-кэш (память модели о предыдущих частях разговора). На каждый токен приходится около 64 КБ, это примерно четверть от того, что требуется обычной модели такого размера.

  • Контекст 262 144 токена. С помощью технологии YaRN (метод расширения контекстного окна) на сервере его можно увеличить примерно до миллиона, но для коротких промптов (промпт, текстовая инструкция для модели) статический YaRN снижает качество.

  • Режим «Размышление» включён по умолчанию на максимум. Параметр reasoning_effort стоит на высшем значении. Его можно и нужно снижать, иначе модель генерирует тысячи токенов рассуждений на простейший запрос.

  • Результаты бенчмарков выглядят сильно, но не подтверждены независимо. По собственным данным Qwen, скачок с 13,3 до 42,2 в тесте DeepSWE по сравнению с предыдущей Qwen3.6-27B выглядит реальным. Однако на момент публикации обзора Artificial Analysis не выпустила индекс интеллекта для модели, и ни одна лаборатория не воспроизвела результаты. Часть тестов проведена внутри компании, часть данных конкурентов импортирована, а не получена заново.

Автор обзора подчёркивает: заголовок «опережает Opus 4.6» не выдерживает проверки. По данным самой Qwen, Opus 4.6 Max лидирует в Terminal-Bench 2.1 (78,2 против 73,0), GPQA-Diamond (91,3 против 89,2) и Humanity's Last Exam (40,0 против 30,8). Модель 27B выигрывает в одних тестах и проигрывает в других.

21 минута на одного пеликана

Саймон Уиллисон, разработчик, который два года тестирует модели задачей «нарисуй пеликана в SVG», назвал Qwen3.8-27B лучшим результатом среди локальных LLM моделей, работающих на его ноутбуке. Но на эту задачу ушло почти 21 минута: 22 276 токенов рассуждений ради 3 223 выходных токенов. И это на процессоре M5 Max, не на бюджетной машине.

Самая частая жалоба за первую неделю: не качество, а многословность. На настройке по умолчанию модель генерирует 10 000 токенов там, где конкурент обходится одним. Кроме того, в шаблонах чата обнаружены ошибки, включая вылет при передаче enable_thinking=false. Сообщество уже выпустило исправленный шаблон.

Хватит ли вашего железа?

Для 4-битной квантованной версии (сжатие модели с потерей части точности) нужно от 17 до 18 ГБ памяти плюс KV-кэш:

  • 24 ГБ унифицированной памяти: практический минимум
  • 32 ГБ: комфортная работа
  • 48 ГБ: оптимум

Расход KV-кэша при 64 КБ на токен: контекст 8K занимает около 0,5 ГБ, 32K уже 2 ГБ, 128K забирает 8 ГБ, а полный контекст 262K требует 16 ГБ.

Для Apple Silicon есть нюанс: быстрый бэкенд MLX через Ollama требует более 32 ГБ памяти. MacBook Air с 24 ГБ его не потянет. Альтернатива: LM Studio (запуск в один клик) или llama.cpp (полный контроль), оба работают через формат GGUF.

Не стоит опускать квантование ниже Q4: пользователи жалуются на резкое падение качества, а агрессивное сжатие KV-кэша у некоторых полностью ломало работу модели.

Как попробовать?

  1. Убедитесь, что у вашего компьютера не менее 24 ГБ оперативной (или унифицированной) памяти.
  2. Скачайте GGUF-версию модели с Hugging Face (страница Qwen3.8-27B, раздел файлов Unsloth GGUF).
  3. Установите LM Studio или llama.cpp, загрузите скачанный файл и выставьте reasoning_effort на среднее или минимальное значение, иначе каждый ответ растянется на десятки минут.
  4. Начните с контекста 8K и увеличивайте постепенно, следя за расходом памяти.

Сравнение с российскими аналогами

Qwen3.8-27B YandexGPT / GigaChat
Доступ Скачиваете, запускаете локально Только через API или чат-интерфейс
Работа без интернета Да Нет
Стоимость Бесплатно Бесплатный тариф с лимитами, платные планы
Мультимодальность Текст, изображения, видео Текст, частично изображения
Скорость на ноутбуке Около 8 токенов/с (MacBook Air M4) Зависит от сервера, обычно быстрее
Конфиденциальность Данные не покидают ваш компьютер Данные уходят на сервер

Для тех, кому важна конфиденциальность или работа без интернета, Qwen3.8-27B даёт то, чего YandexGPT и GigaChat дать не могут. Но если нужна скорость и нет мощного железа, облачные сервисы пока практичнее.

Что делать с этим прямо сейчас, по ролям?

Автору Дзена. Если у вас MacBook или ПК с 32 ГБ памяти, можно попробовать генерировать черновики и описания без подписки на облачные сервисы. Но будьте готовы, что сложный запрос займёт 15 и более минут. Для ежедневного конвейера это пока слишком медленно.

Маркетологу. Модель интересна для обработки конфиденциальных данных клиентов, которые нельзя отправлять в облако. Стратегии, клиентские базы, внутренние документы остаются на вашей машине.

Предпринимателю в РФ. Модель доступна для скачивания без ограничений по региону. Никакие санкции не мешают: Apache 2.0 позволяет коммерческое использование. Но для продакшена на сервере понадобится железо минимум с 48 ГБ памяти.

Мнение редакции dzen.guru

Qwen3.8-27B подтверждает тренд: локальные LLM модели по качеству догоняют закрытые API. По моему впечатлению, это уже не демо-игрушка, а рабочий инструмент, но с важным «но»: 21 минута на один ответ делает модель непригодной для потоковой работы на обычном ноутбуке. Я бы рекомендовал попробовать её на одной реальной задаче: например, проанализировать длинный документ или разобрать код, где конфиденциальность важнее скорости. Именно там она оправдывает себя уже сегодня. А для быстрых задач пока честнее использовать облако.

Частые вопросы

Можно ли запустить Qwen3.8-27B на обычном ПК с Windows?

Да, если у вас 24 ГБ оперативной памяти или больше. Понадобится LM Studio или llama.cpp. Видеокарта с большим объёмом VRAM (например, 24 ГБ) ускорит работу, но модель может работать и на процессоре, просто медленнее.

Почему модель отвечает так долго?

По умолчанию включён режим «Размышление» на максимуме. Модель генерирует тысячи токенов внутренних рассуждений, прежде чем выдать ответ. Снизьте параметр reasoning_effort до среднего или минимального, это ускорит ответ в разы, хотя и с возможной потерей качества на сложных задачах.

Эта модель лучше ChatGPT?

Корректного ответа нет. По собственным бенчмаркам Qwen, модель конкурирует с лучшими закрытыми API в задачах на код, но проигрывает им в других тестах. Независимых подтверждений пока нет. Главное преимущество не в «лучше», а в «локально и бесплатно»: данные не покидают ваш компьютер.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Meta AI вышла на Mac бесплатно: бот видит экран и читает статистику Instagram
ai

Meta AI вышла на Mac бесплатно: бот видит экран и читает статистику Instagram

Meta AI второго июля вышел отдельным приложением для Mac, и теперь чат-бот умеет видеть содержимое открытого окна, диктовать текст в любом приложении и…

4 мин
Искусственный интеллект в борьбе с раком
ai

Искусственный интеллект в борьбе с раком

Биотех-стартап Vivodyne открыл под Сан-Франциско крупнейшую автономную лабораторию, где роботы выращивают человеческие ткани и тестируют на них лекарства…

6 мин
Amazon Alexa+ стала бесплатной на Fire TV: подписка за $19,99 больше не нужна
ai

Amazon Alexa+ стала бесплатной на Fire TV: подписка за $19,99 больше не нужна

Amazon Alexa+ (расширенная версия голосового помощника Alexa с элементами искусственного интеллекта) стала бесплатной на всех совместимых устройствах Fire TV в…

5 мин