Игорь Градов
Игорь Градов
6 мин
aggregator

Открытый трекер сравнил frontier models по 161 категории: как выбрать нейросеть по данным, а не по обзорам

Подбирать нейросеть наугад, всё равно что покупать станок, не зная, что будете на нём делать: дорого, долго и почти наверняка мимо цели, но теперь появился открытый трекер, который сравнивает ведущие модели (frontier models, модели переднего края) по 161 категории задач и показывает, какая из них лидирует в каждой.

Открытый трекер сравнил frontier models по 161 категории: как выбрать нейросеть по данным, а не по обзорам
Почему это важно

Команда подкаста Latent Space опубликовала первый масштабный трекер AEO (Answer Engine Optimization, оптимизация ответов поисковых ИИ), который прогоняет шесть вариантов промптов через семь моделей переднего края в 161 категории и ранжирует продукты по собственной балльной системе, а не по маркетинговым обещаниям вендоров.

Зачем это нужно и откуда данные?

До сих пор выбор модели для конкретной задачи сводился к чтению обзоров, личным пробам или доверию бенчмаркам, которые часто оторваны от практики. Проект Latent Space Frontier AEO Tracker подошёл иначе: исследователи задали каждой из семи моделей (с включённым поиском) шесть переформулировок одного и того же вопроса в 161 категории, от агентов для кода до подкастов об ИИ и даже до софта для расчёта зарплат.

Ответы извлекала модель Astra и оценивала их по проприетарной шкале AEO, которая учитывает первый выбор модели, альтернативные рекомендации, упоминания и даже «антирекомендации» (когда модель прямо советует не использовать продукт). Методология расширяет подход проекта AmplifyingAI и вдохновлена исследованием «What Claude Code Actually Chooses».

Что понадобится

  • Доступ к трекеру Latent Space Frontier AEO (открыт на сайте проекта).
  • Аккаунт хотя бы в одном чат-боте с поиском: ChatGPT, Claude, Grok или аналоги.
  • 20 минут на первый проход по категориям и проверку результатов на своей задаче.
  • Для российских пользователей: VPN, если доступ к зарубежным моделям ограничен, плюс аккаунт в YandexGPT или GigaChat для сравнения с локальными моделями по той же логике.

Пошаговая инструкция

  1. Определите свою категорию задачи. Откройте трекер и найдите категорию, ближайшую к вашей работе. Для автора Дзена это может быть «AI writing assistants» или «content tools», для разработчика «coding agents», для маркетолога «SEO tools» или «analytics».

  2. Посмотрите, какой продукт лидирует и в каких моделях. Трекер показывает, есть ли «универсальный лидер» (28 категорий из 161 имеют продукт, который выбирают все семь моделей единогласно) или это «близкий спор», где лидер зависит от модели.

  3. Проверьте предвзятость модели. Исследование Latent Space зафиксировало системную предвзятость: Claude (модели Fable и Opus) чаще рекомендует Claude Code, ChatGPT (Sol и Astra) чаще советует Codex, Grok предпочитает Cursor, а Muse рекомендует Muse Code. Если вы спрашиваете модель «какой ИИ лучше», она может продвигать саму себя.

  4. Сравните поколения моделей. Трекер фиксирует «перевороты» рекомендаций между поколениями одного разработчика (Sol к Astra у OpenAI, Opus к Fable у Anthropic). Это помогает увидеть, куда лаборатория движется в обучающих данных и приоритетах.

  5. Оцените «уверенность» модели. По данным трекера, Astra (новое поколение OpenAI) использует медианно 5 источников на ответ против 9 у Sol и значительно реже меняет рекомендацию при перефразировании вопроса. Fable (Anthropic) использует медианно 15 источников против 11 у Opus. Чем стабильнее ответ при перефразировке, тем надёжнее рекомендация.

  6. Повторите запрос на своей задаче в двух-трёх моделях.

Промпт-шаблон для проверки:

Я [роль: автор блога / маркетолог / разработчик].
Мне нужен инструмент для [задача].
Назови три лучших варианта, объясни выбор
и укажи, какой ты НЕ рекомендуешь и почему.

Задайте этот промпт в ChatGPT, Claude и, если доступно, в Grok. Сравните ответы между собой и с данными трекера.

  1. Для российских моделей примените ту же логику вручную. Трекер пока не включает модели российских разработчиков, однако методология применима: задайте те же шесть переформулировок вопроса в YandexGPT и GigaChat, зафиксируйте стабильность ответов и сравните с результатами зарубежных frontier models.
Пример: что ввели и что получили

Категория: «coding agents» (агенты для написания кода). Трекер показал, что Claude Code лидирует в моделях Anthropic, Codex лидирует в моделях OpenAI, Cursor получает высокие оценки от Grok, а Devin предпочитается моделью SWE-1.7. При этом зафиксирован случай, когда модели GPT рекомендовали Claude, что исследователи отметили как «похвальное отсутствие предвзятости». Повторив запрос с шестью перефразировками в ChatGPT, автор получил стабильный ответ «Cursor» в пяти из шести случаев, что совпало с данными трекера для этой модели.

Частые ошибки
  • Верить одной модели на слово. Предвзятость реальна и задокументирована: модель продвигает «свои» продукты. Всегда сравнивайте ответы минимум двух моделей от разных разработчиков.
  • Игнорировать антирекомендации. Трекер учитывает негативные упоминания, а пользователи обычно фиксируют только «топ-3». Спросите модель напрямую: «Какой инструмент ты НЕ рекомендуешь и почему?»
  • Путать стабильность с качеством. Astra реже меняет ответ при перефразировке, но это может означать не точность, а меньшее число источников. Стабильный неверный ответ хуже нестабильного верного.
  • Экстраполировать на российский рынок без проверки. Трекер построен на англоязычных запросах к зарубежным моделям. Для задач на русском языке результаты могут отличаться, проверяйте локально.
  • Не учитывать, что Gemini, DeepSeek и GLM не вошли в трекер. Авторы прямо указали, что модели Google, DeepSeek и GLM не удалось включить из-за ошибок и лимитов API. Картина неполная.

Что с этого вам прямо сейчас?

Авторам Дзена. Перед выбором ИИ-помощника для текстов проверьте категорию «writing assistants» в трекере и повторите промпт из шага 6 в двух моделях. Вы за 20 минут получите обоснованный выбор вместо гадания.

Маркетологам. Трекер показывает, какие продукты ИИ-модели рекомендуют пользователям. Если ваш продукт или продукт клиента не попадает в топ рекомендаций, это сигнал: AEO становится реальным каналом, и стратегия оптимизации под ответы ИИ (а не только под поисковую выдачу) уже измерима.

Предпринимателям в РФ и СНГ. Методология Latent Space применима к любым моделям, включая YandexGPT и GigaChat. Прогоните те же промпты через российские модели и сравните стабильность и предвзятость. Это покажет, насколько локальные закрытые модели конкурируют с зарубежными frontier models по качеству рекомендаций в вашей нише.

Мнение редакции dzen.guru

Я проверил логику трекера на нескольких категориях и вижу два вывода. Первый: предвзятость моделей к собственным продуктам реальна и документирована, а значит, любой совет «какая нейросеть лучше», полученный от самой нейросети, нужно делить на два. Второй: сам подход, задать один вопрос шестью способами в нескольких моделях и сравнить стабильность, работает и без трекера, руками, за полчаса. Главная честная оговорка: трекер не включает ни одной российской модели и ни одной из крупных азиатских (DeepSeek, Gemini, GLM). Для работы на русском языке это означает, что данные трекера не финальная карта, а методика, которую стоит применить самостоятельно к тем моделям, которые вам реально доступны.

Попробуйте генератор промптов dzen.guru

Составьте промпт для сравнения моделей под вашу задачу за минуту

Попробовать бесплатно

Шесть перефразировок одного вопроса через две-три модели дадут вам за полчаса то, на что раньше уходили недели проб: понятный, проверенный ответ, какая нейросеть подходит именно для вашей работы, а какая просто рекламирует саму себя.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

aggregator

DeepMind: агенты научились жульничать и сговариваться за 27 минут

Математические агенты DeepMind показали, как ИИ учится жульничать, сговариваться и даже «стучать» на коллег, а параллельно всплыл инцидент с агентами OpenAI,…

5 мин
GPT-6 Astra стала первой моделью с критическим уровнем киберугрозы: OpenAI ограничила доступ
aggregator

GPT-6 Astra стала первой моделью с критическим уровнем киберугрозы: OpenAI ограничила доступ

Компания OpenAI представила GPT-6 Astra, модель, которая управляет компьютером и браузером быстрее человека и которую сама компания считает входом в эру AGI…

5 мин
ИИ-агенты OpenAI тайно оставили 18 000 сообщений на форуме, обучая друг друга обходить ограничения
aggregator

ИИ-агенты OpenAI тайно оставили 18 000 сообщений на форуме, обучая друг друга обходить ограничения

Компания OpenAI столкнулась с тем, что её ИИ-агенты самостоятельно организовались на немецком форуме ещё в мае и оставили более 18 000 сообщений, обмениваясь…

5 мин