Игорь Градов
Игорь Градов
5 мин
ai

DeepSeek открыла harness нейросети: результат 87,9 на Terminal-Bench теперь можно проверить

Компания DeepSeek 13 августа выложила в открытый доступ DeepSeek Harness v0.1, агентную обвязку для моделей, которая превращает языковую модель из генератора текста в рабочий инструмент с доступом к файлам, терминалу и тестам.

DeepSeek открыла harness нейросети: результат 87,9 на Terminal-Bench теперь можно проверить
Почему это важно

Полтора месяца результаты DeepSeek на агентных бенчмарках нельзя было воспроизвести, потому что обвязка, на которой их измеряли, оставалась закрытой. Теперь прибор открыт, и любой разработчик может проверить заявленные цифры сам.

Харнесс (harness) в контексте нейросетей, это не сама модель, а всё, что вокруг неё: агентный цикл (последовательность шагов, которые модель проходит при решении задачи), набор инструментов, права доступа, песочница, логирование. Модель умеет только превращать текст в текст. Читать код, запускать тесты, откатываться после ошибки, это работа обвязки. По данным источника, на июль 2026 года активно поддерживались около 35 CLI-агентов (агентов, работающих через командную строку). За последний квартал собственными harness-решениями для нейросетей обзавелись xAI, Moonshot, Z.ai, Meta и теперь DeepSeek.

Что Когда Кто выпустил Цена
DeepSeek Harness v0.1 (Developer Preview) 13 августа 2026 DeepSeek Бесплатно, лицензия MIT (открытый код)

Зачем нужен harness, если есть нейросеть?

Ключевой момент, который источник подчёркивает прямым текстом: цифра на агентном бенчмарке, это результат связки «модель плюс harness», а не свойство модели. Без одинаковой обвязки сравнивать модели между собой некорректно.

Индустрия решает эту проблему так: берёт нарочно примитивную обвязку, одинаковую для всех, и измеряет в ней. Канонический пример, mini-SWE-agent от команды SWE-bench (набор задач для оценки агентов): один инструмент bash, никаких надстроек.

Результаты февральского прогона 2026 года на SWE-bench Verified (по данным источника):

  • Claude 4.5 Opus: 74,4%
  • Gemini 3 Pro Preview: 74,2%
  • GPT-5.2 (high): 71,8%
  • Claude 4.5 Sonnet: 70,6%

Для сравнения: в июле 2025 года mini-SWE-agent на том же бенчмарке выдавал 65%. Обвязка не менялась, вырос слой моделей.

Сколько добавляет полноценная обвязка?

По данным работы Live-SWE-agent, которая сравнивает минимальную и продвинутую обвязки на одних моделях, разница составляет от 3 до 5 процентных пунктов:

  • Gemini 3 Pro: 74,2 → 77,4
  • Claude 4.5 Sonnet: 70,6 → 75,4
  • GPT-5: 65,0 → 68,4

Выглядит скромно, но источник делает две оговорки. SWE-bench Verified, это короткие задачи внутри одного репозитория, где harness нейросети нужен меньше всего. Память между сессиями, восстановление после сбоя, работа подагентов туда не помещаются. Именно поэтому индустрия переезжает на Terminal-Bench 2.x с длинным горизонтом задач.

Почему DeepSeek открыл код именно сейчас?

Хронология говорит сама за себя. 31 июля в документации DeepSeek V4-Flash появилась сноска: результат 82,7 на Terminal-Bench 2.1 получен «на DeepSeek Harness minimal mode (to be released soon)». Полтора месяца цифру нельзя было воспроизвести: прибор был только у одной стороны.

12 августа вышла V4-Pro-0813 с результатом 87,9 на Terminal-Bench 2.1 (против 72,1 у апрельского превью). 13 августа открыли harness, включая тот самый минимальный режим. Сначала цифра, потом инструмент для проверки.

Как устроен DeepSeek Harness внутри?

Главный принцип: «всё есть плагин» (everything is a plugin). Модели, инструменты, навыки, сессии, песочницы, файловые системы, главный цикл агента, оркестрация (управление порядком действий) и даже интерфейс реализованы плагинами и меняются через конфигурацию, без правки исходного кода.

Ядро построено на Cordis, микроядре с инъекцией зависимостей (dependency injection, механизм, при котором компоненты получают нужные ресурсы автоматически, а не ищут их сами) и обратимыми побочными эффектами. Всё, что регистрирует плагин, отслеживается и откатывается при выгрузке. Код написан на Node.js/TypeScript.

Минимальный режим (minimal mode) содержит всего два инструмента: bash и текстовый редактор. Это не урезанная версия, а измерительный прибор, в котором лаборатория проверяет свою модель с минимальным вкладом обвязки.

Как попробовать?

  1. Убедитесь, что на компьютере установлен Node.js (среда для запуска JavaScript-кода).
  2. Откройте терминал и выполните одну команду: npx @deepseek-ai/dsh web.
  3. Веб-интерфейс поднимется по адресу 127.0.0.1:3080 в браузере.

Код доступен в npm как пакет @deepseek-ai/dsh, лицензия MIT, то есть можно использовать, изменять и распространять без ограничений.

Что делать с этим прямо сейчас, по ролям

Разработчику в РФ и СНГ. DeepSeek Harness показывает, как структурировать агентские системы через плагины без привязки к конкретной модели. Можно подключить любую модель, в том числе локальную, и сравнивать результаты. Архитектура «всё есть плагин» позволяет тестировать разные связки на своих задачах, включая задачи на русском языке.

Автору Дзена. Если вы пишете о технологиях или тестируете нейросети, harness даёт возможность проверять агентные сценарии (когда ИИ не просто отвечает, а выполняет цепочку действий) и писать о результатах с конкретными цифрами.

Предпринимателю. Из доступных в РФ аналогов для агентных задач можно рассматривать YandexGPT и GigaChat, но ни тот, ни другой пока не предлагают открытую агентную обвязку с плагинной архитектурой. DeepSeek Harness работает локально и не требует подписки, но для полноценной работы нужен разработчик.

Мнение редакции dzen.guru

По моим наблюдениям, harness для нейросетей, это та часть инфраструктуры, которая до сих пор оставалась невидимой за красивыми цифрами бенчмарков. DeepSeek сделал правильный ход: открыл не просто код, а инструмент проверки собственных заявлений. Оговорка: v0.1 в статусе Developer Preview означает, что API может меняться, а документация пока неполная. Если вы разработчик, попробуйте запустить minimal mode и прогнать свои задачи, это займёт десять минут и покажет, насколько заявленные результаты воспроизводимы на вашем железе.

Частые вопросы

Нужно ли платить за DeepSeek Harness?

Нет. Код открыт под лицензией MIT, пакет бесплатен. Оплата может потребоваться только за API-вызовы к облачным моделям, если вы подключите их вместо локальных.

Можно ли подключить другую модель, не от DeepSeek?

Да. Архитектура «всё есть плагин» означает, что модель, это тоже плагин, который заменяется через конфигурацию. По данным источника, это принципиальное решение: harness нейросети не привязан к конкретному провайдеру.

Будет ли это работать в России?

Harness запускается локально на вашем компьютере, блокировок нет. Для подключения облачных моделей DeepSeek потребуется доступ к их API, который на момент публикации работает из РФ.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ГЛМ 5.3 от Z.ai объединила агентный код и киберзащиту в одном открытом релизе
ai

ГЛМ 5.3 от Z.ai объединила агентный код и киберзащиту в одном открытом релизе

Компания Z.ai 14 августа 2026 года представила GLM 5.3, открытую языковую модель с фокусом на агентном программировании и киберзащите, и впервые дала практикам…

6 мин
ai

Искусственный интеллект Apple выходит в Китай: компания впервые обучила свою модель с Alibaba

Apple второго июня, по данным Reuters, обучила собственную языковую модель для Китая совместно с Alibaba, чтобы впервые вывести свой сервис искусственного…

4 мин
Google Sheets превращает таблицы в приложения: Gemini строит дашборды по промпту
ai

Google Sheets превращает таблицы в приложения: Gemini строит дашборды по промпту

Google Sheets научились превращать таблицы в мини-приложения: Gemini строит интерактивные дашборды по описанию на обычном языке, и это работает с кириллицей.…

4 мин