Игорь Градов
Игорь Градов
5 мин
ai

NEEDLE обновляет бенчмарки нейросетей каждый час: заучить ответы больше нельзя

Microsoft второго июня запустила NEEDLE, открытый бенчмарк (набор тестовых задач для объективной проверки качества нейросетей), который каждый час обновляет запросы и сравнивает 15 поисковых API по единой методике, чтобы ни одна модель не могла заучить правильные ответы заранее.

NEEDLE обновляет бенчмарки нейросетей каждый час: заучить ответы больше нельзя
Почему это важно

Впервые появился открытый инструмент, который не даёт поисковым нейросетям «списать»: запросы обновляются каждый час, а потолок качества считается по объединённым результатам всех 15 движков, и разрыв между лучшим результатом и этим потолком показывает, сколько релевантных ответов рынок теряет прямо сейчас.

Компания Keenable выпустила NEEDLE, живой опенсорс-бенчмарк для поисковых API, и опубликовала код под лицензией MIT на GitHub. По данным Marktechpost, это ответ на системную проблему существующих бенчмарков нейросетей: когда тестовые вопросы и ответы лежат в открытом датасете, поисковый ИИ-агент может скачать «ключи» прямо во время теста или достать ответ из собственной параметрической памяти (того, что модель запомнила при обучении), и результат больше не доказывает, что поиск вообще работал.

Параметр Значение
Кто Keenable
Продукт NEEDLE
Тип Открытый бенчмарк, лицензия MIT
Дата публикации результатов семидневное окно по 28 августа 2026 года
Охват 5 вертикалей, 15 поисковых API

Как NEEDLE не даёт нейросетям «списать»?

NEEDLE расшифровывается как News, Everyday, Expert, Deep-tail, Legal Evaluation. Пять направлений тестирования моделируют разные задачи, с которыми сталкивается ИИ-агент (программа, которая сама ищет информацию и принимает решения):

  • Новости. Запросы генерируются каждый час из примерно 124 RSS-лент и Google Trends.
  • Финансы. Ежедневно подтягиваются факты из Wikidata, реестра GLEIF и квартальных отчётов SEC XBRL.
  • Научные статьи. Одна статья превращается в четыре типа запроса: испорченное название, деталь из полного текста, описание своими словами и размытая подсказка «на кончике языка».
  • Редкие сущности (Deep-tail). Запросы берутся из публичных логов реальных ИИ-агентов, включая проекты DeepResearchGym, OpenResearcher и LRAT.
  • Юридические документы. Свежие решения из 14 федеральных судов США (CourtListener) и разделы eCFR.

Ключевая идея: фиксированного набора вопросов нет. Нечего заучивать, нечего скачать.

Как считают потолок качества?

Все 15 движков получают один и тот же текст запроса. Вызов идёт по одному за раз, поэтому задержки сопоставимы. Результаты обрезаются до 2 000 символов, а судья (языковая модель) не видит имени движка.

Самое любопытное: для каждого запроса NEEDLE объединяет результаты всех движков в синтетический «оракул» (ultimate) и ранжирует их по релевантности. Это эмпирический потолок, лучшее, что весь рынок смог найти.

Разрыв между оценкой конкретного движка и ultimate показывает верхнюю границу того, сколько качества теряется. Большой разрыв означает, что релевантные результаты существовали, но ни один движок их не показал. Низкий ultimate означает другое: даже все движки вместе не нашли сильных ответов. Так NEEDLE отличает проблему ранжирования от проблемы поиска, общей для всего рынка.

Где рынок поисковых API находится сейчас?

Семидневные средние за период по 28 августа 2026 года (по данным дашборда NEEDLE) распределились так:

  • Финансы почти решены: Exa набирает 0,910, Keenable 0,872, Perplexity 0,871, Google 0,847 при потолке ultimate 0,965.
  • Научные статьи разбросаны шире: от 0,774 (Keenable) до 0,310 (Tavily) при потолке 0,869. Запросы по названию статьи решаются из метаданных, запросы по содержанию не решаются.
  • Редкие сущности (ближе всего к реальному трафику ИИ-агентов): Exa лидирует с 0,557 от ultimate, Keenable 0,470, Bing 0,199. Чем ближе запрос к тому, как агенты ищут на практике, тем шире разрыв между реальным и достижимым качеством.

По задержкам за тот же период: Keenable-realtime показал 193 мс медиана и 284 мс на 95-м перцентиле (то есть 95% запросов укладываются в это время), Exa 1 876 и 2 955 мс, Bing 2 767 и 9 381 мс.

Код открыт под MIT, тесты выполняются в публичных GitHub Actions, артефакты каждого прогона выгружаются в датасет на Hugging Face. : Документация проекта NEEDLE

Мнение редакции dzen.guru

Keenable выпустила бенчмарк, в котором сама же участвует и показывает высокие результаты. Это нормальная практика (Google делает то же с MMLU, Meta с MTEB), но помнить о конфликте интересов стоит. Реальная ценность NEEDLE в другом: код открыт, запросы обновляются автоматически, протокол одинаков для всех. Любой разработчик может запустить тест на ноутбуке и получить собственные цифры, не полагаясь на чужой дашборд. Для рынка бенчмарков нейросетей, где «утечка» тестовых данных стала системной болезнью, это здоровый сдвиг.

Что это значит для вас?

Авторам Дзена и копирайтерам. Когда поисковые ИИ-агенты (Perplexity, Google AI Overview и подобные) станут точнее находить ваш контент, вырастет и требовательность к его качеству. NEEDLE показывает: на редких и сложных запросах лучший движок находит чуть больше половины доступных ответов. Ваш экспертный материал, который не дублирует десять других статей, имеет шанс попасть в результаты, но только если он содержит проверяемые факты, а не воду.

Маркетологам. Таблица задержек NEEDLE полезна при выборе поискового API для RAG-пайплайна (системы, где нейросеть ищет актуальные данные перед ответом). Разница между 193 мс и 9 секунд на запрос критична, когда агент делает десятки вызовов за одну задачу.

Разработчикам в РФ и СНГ. NEEDLE устанавливается через Python CLI командой uv sync, нужен ключ OpenRouter для оценки и ключи тестируемых API. Бенчмарк работает на ноутбуке. Из 15 API в текущем списке российских нет, но протокол открыт: добавить YandexSearch API или собственный движок можно самостоятельно через код на GitHub.

Где подвох

NEEDLE пока покрывает только англоязычный поиск. Для русскоязычных запросов результаты будут другими: ни RSS-ленты, ни CourtListener, ни SEC XBRL не содержат русскоязычных данных. Кроме того, бенчмарк тестирует API поиска, а не генерацию текста: он не скажет, насколько хорошо модель «думает», только насколько хорошо она находит.

Открытые бенчмарки нейросетей, которые нельзя заучить, нужны рынку не меньше, чем сами модели. NEEDLE даёт каждому разработчику CLI-инструмент, чтобы проверить поисковый движок по единой методике и за минуты увидеть, где его продукт проигрывает не конкуренту, а объективному потолку рынка.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Gradium AI выпустила TTS модель с 81% точности на цифрах и кодах: боты звонят без костылей

Компания Gradium AI 31 августа 2026 года выпустила новую TTS модель (модель синтеза речи, которая превращает текст в голос) и сразу сделала её моделью по…

5 мин
WAIC 2026: роботы и AI for Science
ai

WAIC 2026: роботы и AI for Science

Конференция WAIC 2026, прошедшая с 17 по 20 июля в Шанхае, показала, как быстро китайская индустрия переводит лабораторные разработки в области искусственного…

5 мин
DLSS 5 утёк из билда NBA 2K27: модеры подключили его к десяткам игр за дни
ai

DLSS 5 утёк из билда NBA 2K27: модеры подключили его к десяткам игр за дни

Компания Nvidia не объявляла о запуске DLSS 5, но энтузиасты 27 августа 2026 года нашли рабочую библиотеку нейросетевого рендеринга внутри раннего билда NBA…

6 мин