Игорь Градов
Игорь Градов
5 мин
ai

Qwen модели обошли GPT в SQL-бенчмарке: в 17 раз дешевле и работают на ноутбуке

Qwen 3.8 27B, модель с открытыми весами (open weights) от Alibaba, в агентном SQL-бенчмарке DABstep обошла GPT 5.6 Luna Max от OpenAI при стоимости запуска менее 0,50 доллара против более 8 долларов у конкурента.

Qwen модели обошли GPT в SQL-бенчмарке: в 17 раз дешевле и работают на ноутбуке
Почему это важно

Модель, которая работает локально на ноутбуке с 16 ГБ памяти и тратит электричества как одна лампочка, показала точность выше, чем платная облачная модель с разницей в стоимости больше чем в 17 раз.

До сих пор для серьёзной аналитической работы с данными через SQL нужны были либо дорогие облачные модели, либо мощные серверы. Автор бенчмарка из MotherDuck протестировал Qwen 3.8 27B локально на двух MacBook и сравнил результаты с ведущими закрытыми моделями (closed-source, то есть моделями, код которых недоступен пользователю). Qwen модели этого семейства оказались на графике «точность и стоимость» в зоне, где раньше не было ни одного локального решения.

Что показал бенчмарк DABstep?

DABstep проверяет, как модель отвечает на аналитические вопросы по реальным данным: понимает бизнес-контекст, пишет SQL-запросы и возвращает правильный ответ.

  • Qwen 3.8 27B обошла GPT 5.6 Luna Max по точности при стоимости менее 0,50 доллара за прогон (у Luna Max более 8 долларов)
  • Gemini-3-Flash осталась самой точной моделью, но стоит в 2,3 раза дороже Luna Max
  • Sonnet 5 показал более высокую цену при заметно худшей точности
  • Kimi K3, ещё одна модель с открытыми весами, продемонстрировала высокую точность, но дорого обходится через API

Автор бенчмарка отметил, что небольшая доработка промптов (prompt, текстовая инструкция для модели) может ещё сильнее сократить разрыв в качестве между Qwen и лидером.

Что понадобится

  • MacBook с 16 ГБ унифицированной памяти (M1 Pro и старше) или 32 ГБ для более комфортной работы. Альтернатива: ПК с дискретной видеокартой на 16 ГБ видеопамяти
  • LM Studio для запуска модели локально с OpenAI-совместимым API-эндпоинтом (точкой подключения, через которую программы общаются с моделью)
  • Квантованная версия Qwen 3.8 27B (квантование, это сжатие модели с небольшой потерей точности, чтобы она поместилась в память ноутбука)
  • DuckDB, встраиваемая база данных для аналитических запросов (работает без сервера, прямо на вашей машине)
  • Агентная обвязка: OpenCode или аналогичный инструмент
  • Примерно 10 минут на настройку, если следовать инструкции ниже

Пошаговая инструкция

  1. Скачайте нужную версию модели. Для 32 ГБ памяти берите 4-битную квантованную версию:
Qwen3.8-27B-MLX-4bit

Для 16 ГБ памяти нужна 3-битная, например из семейства unsloth:

IQ3_XXS
  1. Установите LM Studio и загрузите в него скачанную модель.

  2. Настройте параметры сервера в LM Studio:

Контекст: 16384 токена
MTP (предсказание нескольких токенов): включить, если скачали
Режим рассуждений: low или off
  1. Запустите OpenAI-совместимый сервер в LM Studio. После запуска модель будет доступна по локальному адресу, к которому подключается агентная обвязка.

  2. Подключите агентную обвязку (OpenCode или вашу собственную) к локальному серверу.

  3. Подключите DuckDB к данным и задайте вопрос на естественном языке. Модель сама напишет SQL-запрос и вернёт ответ.

Как это выглядит на практике

Вы открываете агентную обвязку, подключённую к локальному серверу Qwen, и пишете: «Покажи топ-10 клиентов по выручке за последний квартал из таблицы orders». Модель генерирует SQL-запрос, выполняет его через DuckDB и возвращает таблицу с результатом. Всё происходит на вашем ноутбуке, без отправки данных в облако и без оплаты токенов (token, единица текста, по которой облачные провайдеры считают стоимость). По данным автора бенчмарка, MacBook Air с M5 при этом потребляет около 30 Вт, то есть примерно как одна лампочка.

Частые ошибки
  • Не хватает памяти. Если у вас ровно 16 ГБ, берите только 3-битную версию. 4-битная не поместится и вызовет зависание или аварийное завершение. Автор тестировал 3-битную IQ3_XXS именно на MacBook Pro с M1 Pro и 16 ГБ.
  • Режим рассуждений на high. Для SQL-задач в бенчмарке хорошо сработали режимы low или off. Высокий режим замедляет генерацию и не даёт прироста точности в этом типе задач.
  • Слишком большой контекст. 16 384 токена хватает для большинства аналитических вопросов. Увеличение контекста сверх необходимого замедляет инференс (inference, процесс генерации ответа моделью) и может привести к нехватке памяти.
  • Данные в облаке, модель локально. Если данные лежат на удалённом сервере, вы получите задержку сети. DuckDB работает с локальными файлами, для полной автономности держите данные рядом с моделью.

Что делать с этим прямо сейчас, по ролям

Авторам Дзена и копирайтерам. Qwen модели семейства 3.8 запускаются локально и бесплатно. Если вы работаете с таблицами, аналитикой для статей или собираете данные для материалов, можно задавать вопросы на русском языке и получать ответы без подписок. Из доступных в РФ облачных аналогов для SQL-задач можно попробовать YandexGPT, но он пока уступает Qwen 3.8 27B по результатам агентных бенчмарков (прямого сравнения в источнике нет, это мой вывод по открытым данным).

Маркетологам. Экономия становится ощутимой при регулярных задачах: по оценке автора бенчмарка, локальная модель может приносить более 100 долларов пользы в месяц при затратах на электричество в считаные центы. Когда исчезает страх получить огромный счёт за ночной прогон, можно ставить аналитические задачи в фоновом режиме.

Предпринимателям в РФ и СНГ. Qwen 3.8 27B, модель с открытыми весами. Скачать и запустить можно из России без VPN. Данные не покидают ваш ноутбук, что снимает вопросы о конфиденциальности. Дообучение (fine-tuning, обучение модели на ваших примерах под узкую задачу) тоже возможно, хотя для SQL-задач в бенчмарке модель справилась и без него.

Мнение редакции dzen.guru

Я проверил: Qwen модели 3.8 действительно запускаются на не самом новом железе. Разница в 17 раз по стоимости при сопоставимой точности, это не маркетинг, а результат конкретного бенчмарка DABstep. Честная оговорка: бенчмарк тестирует агентную работу с SQL, а не универсальные способности модели. Для сложных задач с длинным контекстом, мультимодальных запросов или генерации текстов на русском результаты могут отличаться. Gemini-3-Flash по-прежнему точнее, а облачные модели удобнее, когда нужен мгновенный ответ без настройки. Но если вы регулярно работаете с данными и готовы потратить 10 минут на установку, локальный запуск Qwen окупится за первую же неделю.

Попробуйте генератор промптов dzen.guru

Подготовьте точные промпты для работы с Qwen и другими моделями, чтобы получать качественные SQL-запросы с первого раза

Попробовать бесплатно

Главный вывод прост: держать ноутбук включённым без локальной модели теперь значит переплачивать за каждый аналитический запрос, который можно было бы получить бесплатно.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Что такое ИИ-агент в мессенджере: $1 млрд Instinct и ещё 7 стартапов, заменяющих приложения
ai

Что такое ИИ-агент в мессенджере: $1 млрд Instinct и ещё 7 стартапов, заменяющих приложения

Компания Instinct в сентябре 2026 года привлекла 1 млрд долларов при оценке в 10 млрд долларов, и этот раунд стал самым заметным вложением в категорию…

6 мин
ai

Что такое ИИ-агент и почему он опаснее чат-бота: утечки, слежка, доступ к картам

Почему это важно Каждый крупный разработчик ИИ-агентов обещает «новый стандарт приватности», но на практике ни один пока не доказал, что данные пользователей в…

6 мин
Студент МФТИ выиграл соревнование FLARE по медицинскому ИИ: опухоль на КТ за 11 секунд
ai

Студент МФТИ выиграл соревнование FLARE по медицинскому ИИ: опухоль на КТ за 11 секунд

Студенческая команда из России выиграла международное соревнование FLARE 2026 по медицинскому ИИ, обойдя конкурентов со всего мира моделью PANTHER, которая…

6 мин