Anthropic добавила оценку Claude плагинов: метрика Δ покажет, нужен ли навык модели
Anthropic выпустила встроенный инструмент оценки плагинов для Claude Code, который впервые позволяет разработчикам измерить, действительно ли подключённый навык улучшает ответы модели или она справляется и без него.

Claude плагины до сих пор проверялись только на корректность синтаксиса и схемы. Теперь появился способ замерить реальный вклад плагина в качество ответа через метрику Δ, разницу между работой модели с плагином и без него.
Команда Anthropic опубликовала новый рабочий процесс claude plugin eval для Claude Code. Инструмент запускает плагин на реалистичных промптах, оценивает результат и сравнивает его с прогоном, где плагин не загружен. По сути, разработчик получает ответы на три вопроса, которые раньше нельзя было измерить: срабатывает ли навык, выдерживает ли он обновление модели и обгоняет ли «голую» модель без плагина. Функция работает начиная с версии Claude Code v2.1.269.
| Параметр | Значение |
|---|---|
| Кто | Anthropic |
| Продукт | Claude Code, команда claude plugin eval |
| Тип события | Выпуск инструмента (бесплатный, расходы только на вызовы модели) |
| Минимальная версия | Claude Code v2.1.269 |
Как устроена оценка плагинов?
Каждый набор тестов хранится в папке evals/ внутри плагина. Один тест-кейс содержит файл prompt.md с промптом и папку graders/ с оценщиками. Промпт отправляется модели без изменений.
Оценщиков (graders) шесть типов:
- Четыре бесплатных:
regex,tool_used,tool_order,file_exists. Они работают по транскрипту разговора и файлам на диске, без дополнительных вызовов модели. - Два платных:
llm(оценивает ответ по критериям, которые вы описываете текстом) иbaseline(сравнивает с эталонным ответом). Оба вызывают модель-судью и тарифицируются по вашему плану или API-аккаунту.
Команда claude plugin eval init читает плагин, спрашивает, как выглядит хороший результат, предлагает кейсы и оценщики, прогоняет их и записывает файлы. Для CI-окружения (автоматизированной сборки) есть флаг --bare, который создаёт пустой шаблон.
Метрика Δ: единственное число, которое считается
По умолчанию каждый кейс прогоняется дважды: с загруженным плагином и без него. Разница между оценками и есть Δ (дельта), реальный вклад плагина.
В документации Anthropic приведён пример: один кейс получил оценку 1.00 с плагином и 0.33 без него, итого Δ = +0.67 на шести прогонах. Стоимость прогона составила около $0.41, время выполнения 74 секунды.
Если оценка 1.0 в обоих вариантах, плагин ни при чём: модель справилась сама. Anthropic отдельно предупреждает о самой частой находке: Δ около нуля при провале оценщика tool_used: Skill. Это означает, что модель не выбирает навык при естественной формулировке промпта. Именно этот дефект невозможно обнаружить через claude plugin validate, который проверяет только синтаксис манифеста.
Результаты оценки сохраняются в HTML-отчёт с детализацией по каждому оценщику. Если аккаунт поддерживает публикацию, отчёт автоматически появляется на claude.ai (отключается флагом --no-publish).
Сколько стоит прогон и как встроить в CI?
Количество вызовов модели считается так: количество кейсов умножается на число прогонов и на количество вариантов (с плагином и без), плюс по три коротких вызова модели-судьи на каждый llm или baseline оценщик. Результаты между прогонами могут варьироваться.
Для CI-окружения предусмотрены ключевые флаги:
--threshold 0.8задаёт минимальный порог оценки.--max-cost-usd 20ограничивает бюджет прогона.--trust-pluginразрешает запуск непроверенного плагина (без этого флага CI-раннер отклонит сборку с кодом выхода 1).--jsonподавляет вывод прогресса и пишет результат в файл.
Ошибки лимитов использования при этом могут имитировать регрессию, о чём Anthropic предупреждает в документации.
Я вижу здесь сдвиг, который касается не только разработчиков Claude плагинов. До сих пор экосистема плагинов для языковых моделей работала по принципу «установил и верь на слово». Нет инструмента проверки, нет и качества. Anthropic первой из крупных компаний встроила количественную оценку прямо в CLI. Если плагин не даёт прироста по дельте, он бесполезен, и теперь это видно в цифрах, а не в ощущениях. Для рынка это может означать, что слабые и «декоративные» плагины начнут отсеиваться быстрее.
Что это значит для вас?
Разработчикам на русском рынке. Если вы интегрируете Claude плагины в русскоязычные приложения, метрика Δ даёт объективный ответ: ваш навык реально улучшает результат или модель справляется сама. Прогоните claude plugin eval до релиза, особенно на промптах с естественной русской формулировкой. Частая проблема: навык не срабатывает, когда пользователь пишет не по шаблону.
Авторам Дзена и контент-маркетологам. Прямого влияния на создание текстов пока нет, но тренд важен: чем строже отбор плагинов, тем выше качество инструментов, которые вы в итоге получите. Следите за плагинами с высокой дельтой, когда Anthropic начнёт публиковать рейтинги.
Предпринимателям в РФ и СНГ. Claude Code доступен через API, но полноценная работа требует аккаунта Anthropic и оплаты в валюте. Из доступных в России инструментов с похожей логикой оценки навыков пока нет прямых аналогов. Если вы строите продукт на Claude, закладывайте в бюджет стоимость eval-прогонов: по примеру из документации, один кейс на шести прогонах обходится примерно в $0.41.
Каждый прогон оценки, это реальные вызовы модели, которые списываются с вашего плана. Результаты между запусками могут различаться. А ошибки лимитов использования способны создать ложное впечатление регрессии плагина, хотя на самом деле просто закончился бюджет.
Anthropic сделала то, чего не хватало всей экосистеме: превратила «кажется, плагин работает» в измеримое число. Если вы разрабатываете Claude плагины, запустите claude plugin eval init на текущем наборе навыков прямо сейчас и посмотрите на свою дельту. Ноль в этой графе честнее любого демо.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
ChatGPT выдумал свидетелей в апелляции: судебные ошибки стоили адвокату 40 лет карьеры
Лид Верховный суд штата Нью-Мексико признал адвоката виновным в неуважении к суду за то, что тот подал апелляционную жалобу, сгенерированную ChatGPT и…

DLP для LLM без потери смысла: как сессионный маппинг сохраняет связь сущностей
Компании, которые дают сотрудникам доступ к языковым моделям, сталкиваются с неприятной развилкой: если убрать из запроса все имена и телефоны, модель теряет…

AI-агенты в CI/CD получают ключи от продакшена: безопасность требует реестра и изоляции
Компании всё активнее встраивают ИИ-агентов в пайплайны разработки, но редко задумываются, что каждый такой агент получает доступ к секретам, коду и облачным…
Комментарии