Qwen нейросеть возглавила Code Arena WebDev, но при 7-кратном разрыве в голосах лидерство не доказано
Qwen нейросеть второго сентября заняла первую строку рейтинга Code Arena WebDev с результатом 1691 очко, опередив Claude Opus 5 Max на три пункта, но доверительные интервалы двух моделей перекрываются настолько, что говорить о доказанном лидерстве рано.

Первое место по точечной оценке ещё не означает статистически подтверждённого превосходства: у Qwen в несколько раз меньше голосов, а диапазон возможного места у обеих моделей одинаков, от первого до четвёртого.
Рейтинг Code Arena WebDev обновляется в реальном времени, и за минуты между двумя снимками таблицы отрыв успел измениться с трёх до четырёх очков. Qwen нейросеть получила статус предварительного участника, а значит каждый новый голос способен заметно сдвинуть результат. Ниже разберём, как устроен этот рейтинг, почему четыре очка пока ничего не решают и как использовать эту информацию перед тем, как менять рабочий инструмент.
Что понадобится
- Доступ к таблице Code Arena WebDev (открыта без регистрации)
- Базовое понимание, что такое доверительный интервал (объясню в шагах)
- Для практического теста: API-ключ DashScope от Alibaba Cloud и Python с библиотекой openai
- Время: 15 минут на разбор методики, 30 минут на пробный вызов модели
Как читать рейтинг Code Arena и не попасться на красивую цифру?
-
Откройте живую таблицу Code Arena WebDev. Найдите столбец с точечной оценкой (Score) и столбец с количеством голосов (Votes). На момент публикации у Qwen3.8-Max-0902 было 1691 очко при 1389 голосах, у Claude Opus 5 Max 1688 очков при 10 334 голосах. Разница в объёме выборки больше чем в семь раз.
-
Найдите доверительный интервал. Arena публикует его рядом с оценкой. Интервал показывает диапазон, в котором «настоящая» сила модели находится с высокой вероятностью. У Qwen: от 1672 до 1710. У Claude: от 1679 до 1695. Весь интервал Claude лежит внутри интервала Qwen, а это значит, что данных недостаточно для разделения моделей.
-
Посмотрите на диапазон возможного места. Arena честно указывает его отдельным столбцом. У обеих моделей он совпадает: от первого до четвёртого. Точечная оценка 1691 ставит Qwen выше только потому, что 1691 больше 1687. Статистической уверенности за этим пока нет.
-
Проверьте отметку «provisional» (предварительный). Если модель помечена как предварительная, её результат нестабилен. Один новый голос у модели с 1389 сравнениями весит гораздо больше, чем у модели с 10 334 сравнениями.
-
Сравните версии внутри линейки. Предыдущая Qwen3.8-Max занимает четвёртую строку с 1669 очками. Новый снимок (0902) прибавил 22 пункта. Это заметный рост внутри одной линейки, но и его стоит читать вместе с интервалами.
-
Поймите, что именно тестирует Code Arena. Пользователь описывает веб-приложение, две скрытые модели независимо собирают варианты, человек запускает результаты и выбирает лучший. Оцениваются три группы свойств:
- функциональность: выполняет ли приложение задачу
- удобство и понятность интерфейса
-
соответствие запросу, включая дизайн и поведение
-
Зафиксируйте границы теста. Первое место не подтверждает качество архитектуры большого проекта, отсутствие уязвимостей, удобство сопровождения через полгода. Для этих выводов нужны другие тесты. Зато Code Arena ближе к реальному прототипированию, чем изолированные алгоритмические задачи.
Как устроен рейтинг под капотом?
Arena считает оценки по модели Брэдли-Терри (Bradley-Terry). Она берёт результаты попарных сравнений и оценивает относительную силу каждого участника. Проще говоря, рейтинг отражает вероятность того, что один вариант предпочтут другому при слепом сравнении. Ничья считается как половина победы и половина поражения.
Модель Брэдли-Терри (метод оценки на основе попарных сравнений, где каждому участнику присваивается числовой «вес», отражающий его силу) хорошо работает при большом количестве сравнений. При малом числе голосов интервал становится широким, и модель с формально высшей оценкой может на деле оказаться слабее соседей.
Корректная формулировка на второе сентября: Qwen3.8-Max-0902 занимает первое место по текущей точечной оценке. Заявление о подтверждённом превосходстве над Claude потребует более узкого интервала и устойчивого разрыва.
Что изменилось в самой модели?
Alibaba называет qwen3.8-max-0902 снимком (snapshot) основной Qwen3.8-Max. По заявлению разработчика, дополнительное обучение (дообучение, обучение модели на специальных примерах под узкую задачу) сосредоточено на программировании, длинных автономных задачах, работе с несколькими инструментами, офисных сценариях и визуальном понимании.
Параметры из официальной карточки:
- Окно контекста: 1 млн токенов (токен, минимальная единица текста, которую обрабатывает модель; примерно 0,75 слова)
- Максимальный вход: 991 тыс. токенов, в режиме рассуждения 983 тыс.
- Максимальный выход: 131 тыс. токенов
- Цена на китайской площадке: 12 юаней за миллион входных и 36 юаней за миллион выходных токенов
- Цена в таблице Arena: $2 и $6 соответственно
Минимальный вызов через совместимый с OpenAI интерфейс выглядит так:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max-0902",
messages=[{"role": "user", "content": "Собери страницу отчёта на React"}],
extra_body={"enable_thinking": True},
)
print(response.choices[0].message.content)
Этот фрагмент подтверждает доступность модели и формат обращения. О качестве ответа он ничего не говорит без отдельного запуска и проверки результата.
Допустим, вы видите заголовок: «Qwen обошла Claude и стала лучшей моделью для кода». Открываете таблицу Code Arena. Видите: точечная оценка Qwen 1691, Claude 1687. Разница четыре пункта. Дальше смотрите на интервал: Qwen от 1672 до 1710, Claude от 1679 до 1695. Интервалы перекрываются полностью. Диапазон места у обеих: от первого до четвёртого. Голосов у Qwen 1389, у Claude 10 334. Вывод: Qwen показывает сильный результат, но утверждать, что она «обошла» Claude, по этим данным нельзя. Корректно: «делит верхние позиции с Claude в пределах статистической погрешности».
Путать точечную оценку с доказанным лидерством. 1691 больше 1687, но перекрытие интервалов делает эту разницу статистически незначимой. Менять рабочий инструмент на основании четырёх пунктов при семикратной разнице в голосах рискованно.
Игнорировать отметку «provisional». Предварительный статус означает, что результат нестабилен и может измениться за часы.
Переносить результат Code Arena на другие задачи. Тест измеряет одно: чей веб-прототип пользователи чаще выберут при слепом сравнении. Он не проверяет архитектуру, безопасность кода или способность работать с незнакомой кодовой базой.
Читать рейтинг один раз и фиксировать вывод. Таблица пересчитывается по мере поступления голосов. Результат на момент публикации может не совпадать с тем, что вы видите сейчас.
Что делать с этим прямо сейчас, по ролям?
Автору Дзена. Если пишете обзоры нейросетей, используйте этот кейс как шаблон: не пересказывайте заголовок, а откройте таблицу и покажите читателю интервалы. Такой разбор вызывает больше доверия, чем «модель Х победила модель Y».
Разработчику и маркетологу. Qwen3.8-Max-0902 уже доступна через API DashScope. Для фронтенд-прототипов и быстрых демо она заслуживает места в коротком списке рядом с Claude. Но переводить продакшен-проект на новую модель только из-за четырёх пунктов рейтинга преждевременно: дождитесь, пока интервал сузится или проведите собственное сравнение на ваших задачах.
Предпринимателю в РФ и СНГ. Qwen нейросеть от Alibaba доступна из России через DashScope без VPN. Из локальных аналогов для кодовых задач можно рассматривать YandexGPT и GigaChat, хотя они пока не участвуют в Code Arena и прямое сравнение затруднено.
Рейтинг Code Arena полезен именно тем, что публикует интервалы и голоса открыто. Проблема не в методике, а в том, как её результаты пересказывают. Четыре пункта разницы при семикратном разрыве в голосах и полном перекрытии интервалов, это не победа, это статистический шум. По моим наблюдениям, Qwen3.8-Max действительно заметно выросла за последние обновления, и версия 0902 выглядит как серьёзный кандидат для кодовых задач. Но я бы не менял рабочий инструмент, пока количество голосов у Qwen не сравняется хотя бы с половиной выборки Claude и интервалы не разойдутся. Самый надёжный тест, ваш собственный: возьмите три реальные задачи из текущего проекта, прогоните через обе модели и сравните результат руками.
Попробуйте генератор контента dzen.guru
Если тестируете нейросети для создания текстов и прототипов, посмотрите, как наш инструмент помогает авторам Дзена работать быстрее.
Попробовать бесплатноЛучший совет перед сменой модели: откройте таблицу, найдите столбец с интервалами и количеством голосов, а только потом читайте столбец с местом.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

5,75 млрд токенов за полгода: как сократить расход в Claude Code в разы
Claude Code за полгода съел 5,75 миллиарда токенов на одном проекте, и автор разобрал по байтам, куда именно они ушли и как сократить расход в разы без потери…

Беспилотный транспорт вышел на конвейер: 350 трамваев Петербурга уже на линии
Четвёртого июня 2025 года петербургская система Cognitive Tram Pilot перешла от экспериментов к серийной эксплуатации: ею оснащены уже более 350 трамваев, а…
Финансирование стартапов в агентном ИИ: Wonderful привлёк $550 млн и удвоил оценку до $5 млрд
Израильско-нидерландский стартап Wonderful привлёк 550 млн долларов в раунде Series C, удвоив свою оценку до 5 млрд долларов всего за полгода, и теперь…
Комментарии