AI leaderboard Arena привлекла $200 млн и впервые ранжирует модели по честности
Платформа Arena, выросшая в 2023 году из исследовательского проекта Калифорнийского университета в Беркли, привлекла 200 млн долларов в раунде Series B при оценке 3,1 млрд долларов, и теперь впервые ранжирует ИИ-модели не только по качеству ответов, но и по честности и безопасности.

Arena запустила рейтинг alignment, то есть проверки того, насколько модель безопасна и честна. Для авторов и компаний, выбирающих ИИ-инструмент, это первый независимый ориентир, который показывает не только «кто умнее», но и «кто не врёт и не делает лишнего».
Платформа ai leaderboard Arena начиналась как краудсорсинговый рейтинг нейросетей: пользователи вводили промпты (запросы к модели), сравнивали ответы двух моделей вслепую и голосовали за лучший. По данным компании, сегодня у площадки десятки миллионов посещений в месяц. Раунд Series B объявлен в четверг, спустя считаные недели после того, как Arena сообщила о достижении 100 млн долларов годовой выручки в июне.
| Параметр | Значение |
|---|---|
| Компания | Arena |
| Сумма раунда | 200 млн долларов (Series B) |
| Оценка компании | 3,1 млрд долларов |
| Лид-инвесторы | Lightspeed Venture Partners, Khosla Ventures |
| Со-инвесторы | Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis и другие |
| Предыдущий раунд | 150 млн долларов (Series A, январь, оценка 1,7 млрд долларов) |
| Годовая выручка (июнь) | 100 млн долларов |
Как Arena зарабатывает и почему оценка удвоилась за десять месяцев?
Для обычных пользователей платформа бесплатна. Деньги приносит коммерческий продукт AI Evaluations, запущенный в сентябре прошлого года. Это сервис, который продаёт лабораториям и корпорациям детальную аналитику качества моделей на основе реальных пользовательских оценок, а не синтетических тестов.
Момент оказался точным. В этом году лаборатории обнаружили, что модели научились «обманывать» стандартные бенчмарки (тесты производительности): набирали высокие баллы, не показывая реального прироста качества. Компании, в свою очередь, хотели понять, какая модель лучше решает именно их задачи, а не абстрактный набор тестов.
В январе, на момент Series A, годовая выручка Arena составляла 30 млн долларов. К июню она выросла до 100 млн долларов. Оценка компании за тот же период поднялась с 1,7 до 3,1 млрд долларов.
Рейтинг честности: что Arena измеряет теперь?
Главное нововведение, которое делает этот раунд не просто финансовой новостью, это категория alignment (соответствие модели этическим и поведенческим нормам) в рейтинге ai leaderboard Arena. Компания начала ранжировать модели по трём параметрам:
- Несанкционированные действия (unauthorized action): модель делает то, о чём её не просили.
- Ложная атрибуция (false attribution): модель приписывает факты или цитаты не тому источнику.
- Обманчивое завершение (deceptive completion): модель заявляет, что выполнила задачу, хотя на деле не сделала этого.
По предварительным данным рейтинга, верхние строчки занимают модели OpenAI. Модели Anthropic, Claude Opus 5.5 и Claude Fable, расположились на шестом и девятом местах соответственно.
ИИ развивается быстрее, чем наша способность его оценивать, а статичные бенчмарки ломаются, как только модели распознают, что их тестируют. Миру нужна нейтральная третья сторона, которая измеряет, насколько ИИ безопасен и честен в руках реальных людей. Arena берёт на себя эту роль. : Arena, заявление к раунду финансирования
Что это значит для рынка?
До сих пор индустрия полагалась на бенчмарки, которые создавали сами разработчики моделей, или на рейтинги вроде прежней версии Arena, оценивавшие только качество ответов. Теперь появился первый массовый независимый измеритель безопасности и честности, построенный на реальных сессиях миллионов пользователей.
Для лабораторий это давление: если модель попадёт в нижнюю часть alignment-рейтинга, это увидят корпоративные клиенты, которые покупают подписки. Для корпораций это аргумент при выборе поставщика. Для регуляторов, включая российских, это потенциальный ориентир при формировании требований к ИИ-системам.
Что делать с этим прямо сейчас, по ролям?
Авторам Дзена и копирайтерам. Следите за alignment-рейтингом Arena при выборе нейросети для текстов. Модель, которая занимает высокое место по «обманчивому завершению», реже будет выдавать галлюцинации (уверенно выдуманные факты). Это прямой показатель надёжности инструмента.
Маркетологам и предпринимателям. Если вы выбираете ИИ-решение для бизнеса, alignment-рейтинг Arena становится дополнительным фильтром: не только «кто пишет лучше», но и «кто не совершит ошибку от вашего имени».
Разработчикам и компаниям в РФ и СНГ. Для локализации ИИ-решений параметры честности и безопасности особенно критичны. В России YandexGPT и GigaChat проходят собственные внутренние проверки, но единого независимого стандарта нет. Рейтинг Arena может стать ориентиром для сравнения при выходе на международные рынки или при обосновании выбора модели перед заказчиком.
Три вещи, которые я считаю важными в этой истории. Во-первых, Arena перестала быть просто «народным голосованием за лучшую нейросеть» и стала инфраструктурным бизнесом с выручкой 100 млн долларов. Во-вторых, alignment-рейтинг, штука непростая: критерии вроде «несанкционированных действий» пока размыты, и я бы не стал слепо доверять первым результатам. В-третьих, для русскоязычного рынка от Arena пока мало прямой пользы: платформа ориентирована на англоязычные промпты, русскоязычные модели в рейтинг не входят. Но сам подход, оценивать не только «кто умнее», но и «кто честнее», рано или поздно придёт и к нам. Мой совет: добавьте Arena в закладки и раз в месяц проверяйте alignment-таблицу перед тем, как менять рабочую нейросеть.
Рейтинг alignment пока предварительный, компания сама называет его preliminary. Критерии могут измениться, а выборка оценок по безопасности пока не раскрыта. Принимать кадровые или бюджетные решения только на основе этих данных преждевременно.
Рост Arena с 30 до 100 млн долларов выручки за полгода и удвоение оценки показывают одно: рынок готов платить не за ещё одну модель, а за честный ответ на вопрос, какой модели можно доверять. Если вы работаете с ИИ каждый день, следите за этим рейтингом так же внимательно, как за обновлениями самих моделей.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Бен Аффлек увлекается искусственным интеллектом
Бен Аффлек продал ИИ-стартап Netflix за 587 миллионов долларов и на нескольких интервью объяснил, как устроены нейросети, почему он сам пишет код на Python и…

Что такое ИИ-агент: Google запустила Gemini, который сам выполняет задачи
Принять к сведению: заголовок задан как H1, но сформулирован как двойной вопрос-справочник («Что такое X и как»). По правилам я не дублирую H1 в теле и не…

Google запустила бесплатную транскрипцию записи встречи без интернета: данные не покидают Mac
Почему это важно Google выпустила приложение для транскрипции встреч, которое работает полностью без интернета и не отправляет данные в облако, но пока…
Комментарии