Игорь Градов
Игорь Градов
6 мин
ai

Qwen нейросеть возглавила Code Arena WebDev, но при 7-кратном разрыве в голосах лидерство не доказано

Qwen нейросеть второго сентября заняла первую строку рейтинга Code Arena WebDev с результатом 1691 очко, опередив Claude Opus 5 Max на три пункта, но доверительные интервалы двух моделей перекрываются настолько, что говорить о доказанном лидерстве рано.

Qwen нейросеть возглавила Code Arena WebDev, но при 7-кратном разрыве в голосах лидерство не доказано
Почему это важно

Первое место по точечной оценке ещё не означает статистически подтверждённого превосходства: у Qwen в несколько раз меньше голосов, а диапазон возможного места у обеих моделей одинаков, от первого до четвёртого.

Рейтинг Code Arena WebDev обновляется в реальном времени, и за минуты между двумя снимками таблицы отрыв успел измениться с трёх до четырёх очков. Qwen нейросеть получила статус предварительного участника, а значит каждый новый голос способен заметно сдвинуть результат. Ниже разберём, как устроен этот рейтинг, почему четыре очка пока ничего не решают и как использовать эту информацию перед тем, как менять рабочий инструмент.

Что понадобится

  • Доступ к таблице Code Arena WebDev (открыта без регистрации)
  • Базовое понимание, что такое доверительный интервал (объясню в шагах)
  • Для практического теста: API-ключ DashScope от Alibaba Cloud и Python с библиотекой openai
  • Время: 15 минут на разбор методики, 30 минут на пробный вызов модели

Как читать рейтинг Code Arena и не попасться на красивую цифру?

  1. Откройте живую таблицу Code Arena WebDev. Найдите столбец с точечной оценкой (Score) и столбец с количеством голосов (Votes). На момент публикации у Qwen3.8-Max-0902 было 1691 очко при 1389 голосах, у Claude Opus 5 Max 1688 очков при 10 334 голосах. Разница в объёме выборки больше чем в семь раз.

  2. Найдите доверительный интервал. Arena публикует его рядом с оценкой. Интервал показывает диапазон, в котором «настоящая» сила модели находится с высокой вероятностью. У Qwen: от 1672 до 1710. У Claude: от 1679 до 1695. Весь интервал Claude лежит внутри интервала Qwen, а это значит, что данных недостаточно для разделения моделей.

  3. Посмотрите на диапазон возможного места. Arena честно указывает его отдельным столбцом. У обеих моделей он совпадает: от первого до четвёртого. Точечная оценка 1691 ставит Qwen выше только потому, что 1691 больше 1687. Статистической уверенности за этим пока нет.

  4. Проверьте отметку «provisional» (предварительный). Если модель помечена как предварительная, её результат нестабилен. Один новый голос у модели с 1389 сравнениями весит гораздо больше, чем у модели с 10 334 сравнениями.

  5. Сравните версии внутри линейки. Предыдущая Qwen3.8-Max занимает четвёртую строку с 1669 очками. Новый снимок (0902) прибавил 22 пункта. Это заметный рост внутри одной линейки, но и его стоит читать вместе с интервалами.

  6. Поймите, что именно тестирует Code Arena. Пользователь описывает веб-приложение, две скрытые модели независимо собирают варианты, человек запускает результаты и выбирает лучший. Оцениваются три группы свойств:

  7. функциональность: выполняет ли приложение задачу
  8. удобство и понятность интерфейса
  9. соответствие запросу, включая дизайн и поведение

  10. Зафиксируйте границы теста. Первое место не подтверждает качество архитектуры большого проекта, отсутствие уязвимостей, удобство сопровождения через полгода. Для этих выводов нужны другие тесты. Зато Code Arena ближе к реальному прототипированию, чем изолированные алгоритмические задачи.

Как устроен рейтинг под капотом?

Arena считает оценки по модели Брэдли-Терри (Bradley-Terry). Она берёт результаты попарных сравнений и оценивает относительную силу каждого участника. Проще говоря, рейтинг отражает вероятность того, что один вариант предпочтут другому при слепом сравнении. Ничья считается как половина победы и половина поражения.

Модель Брэдли-Терри (метод оценки на основе попарных сравнений, где каждому участнику присваивается числовой «вес», отражающий его силу) хорошо работает при большом количестве сравнений. При малом числе голосов интервал становится широким, и модель с формально высшей оценкой может на деле оказаться слабее соседей.

Корректная формулировка на второе сентября: Qwen3.8-Max-0902 занимает первое место по текущей точечной оценке. Заявление о подтверждённом превосходстве над Claude потребует более узкого интервала и устойчивого разрыва.

Что изменилось в самой модели?

Alibaba называет qwen3.8-max-0902 снимком (snapshot) основной Qwen3.8-Max. По заявлению разработчика, дополнительное обучение (дообучение, обучение модели на специальных примерах под узкую задачу) сосредоточено на программировании, длинных автономных задачах, работе с несколькими инструментами, офисных сценариях и визуальном понимании.

Параметры из официальной карточки:

  • Окно контекста: 1 млн токенов (токен, минимальная единица текста, которую обрабатывает модель; примерно 0,75 слова)
  • Максимальный вход: 991 тыс. токенов, в режиме рассуждения 983 тыс.
  • Максимальный выход: 131 тыс. токенов
  • Цена на китайской площадке: 12 юаней за миллион входных и 36 юаней за миллион выходных токенов
  • Цена в таблице Arena: $2 и $6 соответственно

Минимальный вызов через совместимый с OpenAI интерфейс выглядит так:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

response = client.chat.completions.create(
    model="qwen3.8-max-0902",
    messages=[{"role": "user", "content": "Собери страницу отчёта на React"}],
    extra_body={"enable_thinking": True},
)
print(response.choices[0].message.content)

Этот фрагмент подтверждает доступность модели и формат обращения. О качестве ответа он ничего не говорит без отдельного запуска и проверки результата.

Что ввели и что получили

Допустим, вы видите заголовок: «Qwen обошла Claude и стала лучшей моделью для кода». Открываете таблицу Code Arena. Видите: точечная оценка Qwen 1691, Claude 1687. Разница четыре пункта. Дальше смотрите на интервал: Qwen от 1672 до 1710, Claude от 1679 до 1695. Интервалы перекрываются полностью. Диапазон места у обеих: от первого до четвёртого. Голосов у Qwen 1389, у Claude 10 334. Вывод: Qwen показывает сильный результат, но утверждать, что она «обошла» Claude, по этим данным нельзя. Корректно: «делит верхние позиции с Claude в пределах статистической погрешности».

Частые ошибки

Путать точечную оценку с доказанным лидерством. 1691 больше 1687, но перекрытие интервалов делает эту разницу статистически незначимой. Менять рабочий инструмент на основании четырёх пунктов при семикратной разнице в голосах рискованно.

Игнорировать отметку «provisional». Предварительный статус означает, что результат нестабилен и может измениться за часы.

Переносить результат Code Arena на другие задачи. Тест измеряет одно: чей веб-прототип пользователи чаще выберут при слепом сравнении. Он не проверяет архитектуру, безопасность кода или способность работать с незнакомой кодовой базой.

Читать рейтинг один раз и фиксировать вывод. Таблица пересчитывается по мере поступления голосов. Результат на момент публикации может не совпадать с тем, что вы видите сейчас.

Что делать с этим прямо сейчас, по ролям?

Автору Дзена. Если пишете обзоры нейросетей, используйте этот кейс как шаблон: не пересказывайте заголовок, а откройте таблицу и покажите читателю интервалы. Такой разбор вызывает больше доверия, чем «модель Х победила модель Y».

Разработчику и маркетологу. Qwen3.8-Max-0902 уже доступна через API DashScope. Для фронтенд-прототипов и быстрых демо она заслуживает места в коротком списке рядом с Claude. Но переводить продакшен-проект на новую модель только из-за четырёх пунктов рейтинга преждевременно: дождитесь, пока интервал сузится или проведите собственное сравнение на ваших задачах.

Предпринимателю в РФ и СНГ. Qwen нейросеть от Alibaba доступна из России через DashScope без VPN. Из локальных аналогов для кодовых задач можно рассматривать YandexGPT и GigaChat, хотя они пока не участвуют в Code Arena и прямое сравнение затруднено.

Мнение редакции dzen.guru

Рейтинг Code Arena полезен именно тем, что публикует интервалы и голоса открыто. Проблема не в методике, а в том, как её результаты пересказывают. Четыре пункта разницы при семикратном разрыве в голосах и полном перекрытии интервалов, это не победа, это статистический шум. По моим наблюдениям, Qwen3.8-Max действительно заметно выросла за последние обновления, и версия 0902 выглядит как серьёзный кандидат для кодовых задач. Но я бы не менял рабочий инструмент, пока количество голосов у Qwen не сравняется хотя бы с половиной выборки Claude и интервалы не разойдутся. Самый надёжный тест, ваш собственный: возьмите три реальные задачи из текущего проекта, прогоните через обе модели и сравните результат руками.

Попробуйте генератор контента dzen.guru

Если тестируете нейросети для создания текстов и прототипов, посмотрите, как наш инструмент помогает авторам Дзена работать быстрее.

Попробовать бесплатно

Лучший совет перед сменой модели: откройте таблицу, найдите столбец с интервалами и количеством голосов, а только потом читайте столбец с местом.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

5,75 млрд токенов за полгода: как сократить расход в Claude Code в разы
ai

5,75 млрд токенов за полгода: как сократить расход в Claude Code в разы

Claude Code за полгода съел 5,75 миллиарда токенов на одном проекте, и автор разобрал по байтам, куда именно они ушли и как сократить расход в разы без потери…

8 мин
Беспилотный транспорт вышел на конвейер: 350 трамваев Петербурга уже на линии
ai

Беспилотный транспорт вышел на конвейер: 350 трамваев Петербурга уже на линии

Четвёртого июня 2025 года петербургская система Cognitive Tram Pilot перешла от экспериментов к серийной эксплуатации: ею оснащены уже более 350 трамваев, а…

5 мин
ai

Финансирование стартапов в агентном ИИ: Wonderful привлёк $550 млн и удвоил оценку до $5 млрд

Израильско-нидерландский стартап Wonderful привлёк 550 млн долларов в раунде Series C, удвоив свою оценку до 5 млрд долларов всего за полгода, и теперь…

5 мин