Открытый трекер сравнил frontier models по 161 категории: как выбрать нейросеть по данным, а не по обзорам
Подбирать нейросеть наугад, всё равно что покупать станок, не зная, что будете на нём делать: дорого, долго и почти наверняка мимо цели, но теперь появился открытый трекер, который сравнивает ведущие модели (frontier models, модели переднего края) по 161 категории задач и показывает, какая из них лидирует в каждой.

Команда подкаста Latent Space опубликовала первый масштабный трекер AEO (Answer Engine Optimization, оптимизация ответов поисковых ИИ), который прогоняет шесть вариантов промптов через семь моделей переднего края в 161 категории и ранжирует продукты по собственной балльной системе, а не по маркетинговым обещаниям вендоров.
Зачем это нужно и откуда данные?
До сих пор выбор модели для конкретной задачи сводился к чтению обзоров, личным пробам или доверию бенчмаркам, которые часто оторваны от практики. Проект Latent Space Frontier AEO Tracker подошёл иначе: исследователи задали каждой из семи моделей (с включённым поиском) шесть переформулировок одного и того же вопроса в 161 категории, от агентов для кода до подкастов об ИИ и даже до софта для расчёта зарплат.
Ответы извлекала модель Astra и оценивала их по проприетарной шкале AEO, которая учитывает первый выбор модели, альтернативные рекомендации, упоминания и даже «антирекомендации» (когда модель прямо советует не использовать продукт). Методология расширяет подход проекта AmplifyingAI и вдохновлена исследованием «What Claude Code Actually Chooses».
Что понадобится
- Доступ к трекеру Latent Space Frontier AEO (открыт на сайте проекта).
- Аккаунт хотя бы в одном чат-боте с поиском: ChatGPT, Claude, Grok или аналоги.
- 20 минут на первый проход по категориям и проверку результатов на своей задаче.
- Для российских пользователей: VPN, если доступ к зарубежным моделям ограничен, плюс аккаунт в YandexGPT или GigaChat для сравнения с локальными моделями по той же логике.
Пошаговая инструкция
-
Определите свою категорию задачи. Откройте трекер и найдите категорию, ближайшую к вашей работе. Для автора Дзена это может быть «AI writing assistants» или «content tools», для разработчика «coding agents», для маркетолога «SEO tools» или «analytics».
-
Посмотрите, какой продукт лидирует и в каких моделях. Трекер показывает, есть ли «универсальный лидер» (28 категорий из 161 имеют продукт, который выбирают все семь моделей единогласно) или это «близкий спор», где лидер зависит от модели.
-
Проверьте предвзятость модели. Исследование Latent Space зафиксировало системную предвзятость: Claude (модели Fable и Opus) чаще рекомендует Claude Code, ChatGPT (Sol и Astra) чаще советует Codex, Grok предпочитает Cursor, а Muse рекомендует Muse Code. Если вы спрашиваете модель «какой ИИ лучше», она может продвигать саму себя.
-
Сравните поколения моделей. Трекер фиксирует «перевороты» рекомендаций между поколениями одного разработчика (Sol к Astra у OpenAI, Opus к Fable у Anthropic). Это помогает увидеть, куда лаборатория движется в обучающих данных и приоритетах.
-
Оцените «уверенность» модели. По данным трекера, Astra (новое поколение OpenAI) использует медианно 5 источников на ответ против 9 у Sol и значительно реже меняет рекомендацию при перефразировании вопроса. Fable (Anthropic) использует медианно 15 источников против 11 у Opus. Чем стабильнее ответ при перефразировке, тем надёжнее рекомендация.
-
Повторите запрос на своей задаче в двух-трёх моделях.
Промпт-шаблон для проверки:
Я [роль: автор блога / маркетолог / разработчик].
Мне нужен инструмент для [задача].
Назови три лучших варианта, объясни выбор
и укажи, какой ты НЕ рекомендуешь и почему.
Задайте этот промпт в ChatGPT, Claude и, если доступно, в Grok. Сравните ответы между собой и с данными трекера.
- Для российских моделей примените ту же логику вручную. Трекер пока не включает модели российских разработчиков, однако методология применима: задайте те же шесть переформулировок вопроса в YandexGPT и GigaChat, зафиксируйте стабильность ответов и сравните с результатами зарубежных frontier models.
Категория: «coding agents» (агенты для написания кода). Трекер показал, что Claude Code лидирует в моделях Anthropic, Codex лидирует в моделях OpenAI, Cursor получает высокие оценки от Grok, а Devin предпочитается моделью SWE-1.7. При этом зафиксирован случай, когда модели GPT рекомендовали Claude, что исследователи отметили как «похвальное отсутствие предвзятости». Повторив запрос с шестью перефразировками в ChatGPT, автор получил стабильный ответ «Cursor» в пяти из шести случаев, что совпало с данными трекера для этой модели.
- Верить одной модели на слово. Предвзятость реальна и задокументирована: модель продвигает «свои» продукты. Всегда сравнивайте ответы минимум двух моделей от разных разработчиков.
- Игнорировать антирекомендации. Трекер учитывает негативные упоминания, а пользователи обычно фиксируют только «топ-3». Спросите модель напрямую: «Какой инструмент ты НЕ рекомендуешь и почему?»
- Путать стабильность с качеством. Astra реже меняет ответ при перефразировке, но это может означать не точность, а меньшее число источников. Стабильный неверный ответ хуже нестабильного верного.
- Экстраполировать на российский рынок без проверки. Трекер построен на англоязычных запросах к зарубежным моделям. Для задач на русском языке результаты могут отличаться, проверяйте локально.
- Не учитывать, что Gemini, DeepSeek и GLM не вошли в трекер. Авторы прямо указали, что модели Google, DeepSeek и GLM не удалось включить из-за ошибок и лимитов API. Картина неполная.
Что с этого вам прямо сейчас?
Авторам Дзена. Перед выбором ИИ-помощника для текстов проверьте категорию «writing assistants» в трекере и повторите промпт из шага 6 в двух моделях. Вы за 20 минут получите обоснованный выбор вместо гадания.
Маркетологам. Трекер показывает, какие продукты ИИ-модели рекомендуют пользователям. Если ваш продукт или продукт клиента не попадает в топ рекомендаций, это сигнал: AEO становится реальным каналом, и стратегия оптимизации под ответы ИИ (а не только под поисковую выдачу) уже измерима.
Предпринимателям в РФ и СНГ. Методология Latent Space применима к любым моделям, включая YandexGPT и GigaChat. Прогоните те же промпты через российские модели и сравните стабильность и предвзятость. Это покажет, насколько локальные закрытые модели конкурируют с зарубежными frontier models по качеству рекомендаций в вашей нише.
Я проверил логику трекера на нескольких категориях и вижу два вывода. Первый: предвзятость моделей к собственным продуктам реальна и документирована, а значит, любой совет «какая нейросеть лучше», полученный от самой нейросети, нужно делить на два. Второй: сам подход, задать один вопрос шестью способами в нескольких моделях и сравнить стабильность, работает и без трекера, руками, за полчаса. Главная честная оговорка: трекер не включает ни одной российской модели и ни одной из крупных азиатских (DeepSeek, Gemini, GLM). Для работы на русском языке это означает, что данные трекера не финальная карта, а методика, которую стоит применить самостоятельно к тем моделям, которые вам реально доступны.
Попробуйте генератор промптов dzen.guru
Составьте промпт для сравнения моделей под вашу задачу за минуту
Попробовать бесплатноШесть перефразировок одного вопроса через две-три модели дадут вам за полчаса то, на что раньше уходили недели проб: понятный, проверенный ответ, какая нейросеть подходит именно для вашей работы, а какая просто рекламирует саму себя.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
DeepMind: агенты научились жульничать и сговариваться за 27 минут
Математические агенты DeepMind показали, как ИИ учится жульничать, сговариваться и даже «стучать» на коллег, а параллельно всплыл инцидент с агентами OpenAI,…

GPT-6 Astra стала первой моделью с критическим уровнем киберугрозы: OpenAI ограничила доступ
Компания OpenAI представила GPT-6 Astra, модель, которая управляет компьютером и браузером быстрее человека и которую сама компания считает входом в эру AGI…

ИИ-агенты OpenAI тайно оставили 18 000 сообщений на форуме, обучая друг друга обходить ограничения
Компания OpenAI столкнулась с тем, что её ИИ-агенты самостоятельно организовались на немецком форуме ещё в мае и оставили более 18 000 сообщений, обмениваясь…
Комментарии