Игорь Градов
Игорь Градов
5 мин
ai

Anthropic добавила оценку Claude плагинов: метрика Δ покажет, нужен ли навык модели

Anthropic выпустила встроенный инструмент оценки плагинов для Claude Code, который впервые позволяет разработчикам измерить, действительно ли подключённый навык улучшает ответы модели или она справляется и без него.

Anthropic добавила оценку Claude плагинов: метрика Δ покажет, нужен ли навык модели
Почему это важно

Claude плагины до сих пор проверялись только на корректность синтаксиса и схемы. Теперь появился способ замерить реальный вклад плагина в качество ответа через метрику Δ, разницу между работой модели с плагином и без него.

Команда Anthropic опубликовала новый рабочий процесс claude plugin eval для Claude Code. Инструмент запускает плагин на реалистичных промптах, оценивает результат и сравнивает его с прогоном, где плагин не загружен. По сути, разработчик получает ответы на три вопроса, которые раньше нельзя было измерить: срабатывает ли навык, выдерживает ли он обновление модели и обгоняет ли «голую» модель без плагина. Функция работает начиная с версии Claude Code v2.1.269.

Параметр Значение
Кто Anthropic
Продукт Claude Code, команда claude plugin eval
Тип события Выпуск инструмента (бесплатный, расходы только на вызовы модели)
Минимальная версия Claude Code v2.1.269

Как устроена оценка плагинов?

Каждый набор тестов хранится в папке evals/ внутри плагина. Один тест-кейс содержит файл prompt.md с промптом и папку graders/ с оценщиками. Промпт отправляется модели без изменений.

Оценщиков (graders) шесть типов:

  • Четыре бесплатных: regex, tool_used, tool_order, file_exists. Они работают по транскрипту разговора и файлам на диске, без дополнительных вызовов модели.
  • Два платных: llm (оценивает ответ по критериям, которые вы описываете текстом) и baseline (сравнивает с эталонным ответом). Оба вызывают модель-судью и тарифицируются по вашему плану или API-аккаунту.

Команда claude plugin eval init читает плагин, спрашивает, как выглядит хороший результат, предлагает кейсы и оценщики, прогоняет их и записывает файлы. Для CI-окружения (автоматизированной сборки) есть флаг --bare, который создаёт пустой шаблон.

Метрика Δ: единственное число, которое считается

По умолчанию каждый кейс прогоняется дважды: с загруженным плагином и без него. Разница между оценками и есть Δ (дельта), реальный вклад плагина.

В документации Anthropic приведён пример: один кейс получил оценку 1.00 с плагином и 0.33 без него, итого Δ = +0.67 на шести прогонах. Стоимость прогона составила около $0.41, время выполнения 74 секунды.

Если оценка 1.0 в обоих вариантах, плагин ни при чём: модель справилась сама. Anthropic отдельно предупреждает о самой частой находке: Δ около нуля при провале оценщика tool_used: Skill. Это означает, что модель не выбирает навык при естественной формулировке промпта. Именно этот дефект невозможно обнаружить через claude plugin validate, который проверяет только синтаксис манифеста.

Результаты оценки сохраняются в HTML-отчёт с детализацией по каждому оценщику. Если аккаунт поддерживает публикацию, отчёт автоматически появляется на claude.ai (отключается флагом --no-publish).

Сколько стоит прогон и как встроить в CI?

Количество вызовов модели считается так: количество кейсов умножается на число прогонов и на количество вариантов (с плагином и без), плюс по три коротких вызова модели-судьи на каждый llm или baseline оценщик. Результаты между прогонами могут варьироваться.

Для CI-окружения предусмотрены ключевые флаги:

  • --threshold 0.8 задаёт минимальный порог оценки.
  • --max-cost-usd 20 ограничивает бюджет прогона.
  • --trust-plugin разрешает запуск непроверенного плагина (без этого флага CI-раннер отклонит сборку с кодом выхода 1).
  • --json подавляет вывод прогресса и пишет результат в файл.

Ошибки лимитов использования при этом могут имитировать регрессию, о чём Anthropic предупреждает в документации.

Мнение редакции dzen.guru

Я вижу здесь сдвиг, который касается не только разработчиков Claude плагинов. До сих пор экосистема плагинов для языковых моделей работала по принципу «установил и верь на слово». Нет инструмента проверки, нет и качества. Anthropic первой из крупных компаний встроила количественную оценку прямо в CLI. Если плагин не даёт прироста по дельте, он бесполезен, и теперь это видно в цифрах, а не в ощущениях. Для рынка это может означать, что слабые и «декоративные» плагины начнут отсеиваться быстрее.

Что это значит для вас?

Разработчикам на русском рынке. Если вы интегрируете Claude плагины в русскоязычные приложения, метрика Δ даёт объективный ответ: ваш навык реально улучшает результат или модель справляется сама. Прогоните claude plugin eval до релиза, особенно на промптах с естественной русской формулировкой. Частая проблема: навык не срабатывает, когда пользователь пишет не по шаблону.

Авторам Дзена и контент-маркетологам. Прямого влияния на создание текстов пока нет, но тренд важен: чем строже отбор плагинов, тем выше качество инструментов, которые вы в итоге получите. Следите за плагинами с высокой дельтой, когда Anthropic начнёт публиковать рейтинги.

Предпринимателям в РФ и СНГ. Claude Code доступен через API, но полноценная работа требует аккаунта Anthropic и оплаты в валюте. Из доступных в России инструментов с похожей логикой оценки навыков пока нет прямых аналогов. Если вы строите продукт на Claude, закладывайте в бюджет стоимость eval-прогонов: по примеру из документации, один кейс на шести прогонах обходится примерно в $0.41.

Где подвох?

Каждый прогон оценки, это реальные вызовы модели, которые списываются с вашего плана. Результаты между запусками могут различаться. А ошибки лимитов использования способны создать ложное впечатление регрессии плагина, хотя на самом деле просто закончился бюджет.

Anthropic сделала то, чего не хватало всей экосистеме: превратила «кажется, плагин работает» в измеримое число. Если вы разрабатываете Claude плагины, запустите claude plugin eval init на текущем наборе навыков прямо сейчас и посмотрите на свою дельту. Ноль в этой графе честнее любого демо.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

ChatGPT выдумал свидетелей в апелляции: судебные ошибки стоили адвокату 40 лет карьеры

Лид Верховный суд штата Нью-Мексико признал адвоката виновным в неуважении к суду за то, что тот подал апелляционную жалобу, сгенерированную ChatGPT и…

5 мин
DLP для LLM без потери смысла: как сессионный маппинг сохраняет связь сущностей
ai

DLP для LLM без потери смысла: как сессионный маппинг сохраняет связь сущностей

Компании, которые дают сотрудникам доступ к языковым моделям, сталкиваются с неприятной развилкой: если убрать из запроса все имена и телефоны, модель теряет…

7 мин
AI-агенты в CI/CD получают ключи от продакшена: безопасность требует реестра и изоляции
ai

AI-агенты в CI/CD получают ключи от продакшена: безопасность требует реестра и изоляции

Компании всё активнее встраивают ИИ-агентов в пайплайны разработки, но редко задумываются, что каждый такой агент получает доступ к секретам, коду и облачным…

6 мин