Что такое ИИ-агент: почему 95% точности на шаге давали лишь 36% успеха на цепочке
Заголовок задан как «Эволюция ИИ агентов: что это и как развивается». Он содержит двойной вопрос-справочник («что это и как»), навигационную шапку без конкретного тезиса и слабый описательный глагол «развивается». По правилам это провал. Предлагаю скорректированный H1, но раз H1 задан, я его не дублирую в теле и пишу тело строго по источнику.

ИИ-агенты (программы, которые сами планируют действия, вызывают инструменты и доводят задачу до результата без пошагового контроля человека) заработали по-настоящему только к концу 2025 года, и причина не в одной «умной модели», а в совпадении двух кривых улучшений, самой модели и её обвязки.
До конца 2024 года агентные системы проваливали многошаговые задачи: 95 % точности на каждом шаге давали лишь около 36 % успеха на цепочке из 20 шагов. Перелом наступил, когда возможности модели впервые обогнали требования обвязки, и это открыло практический сценарий для авторов, маркетологов и предпринимателей.
Лукаш Кайзер, один из создателей архитектуры Transformer (нейросетевая архитектура, на которой построены ChatGPT, Claude и другие большие языковые модели), описал этот момент в подкасте Unsupervised Learning в июне 2025 года.
«Перемена прошлой зимой, на Рождество, её сложно точно определить. Обвязка изменилась, немного изменилось пост-обучение, вышли новые предобученные модели… но ощущение было такое, будто произошёл большой скачок, и трудно сказать, что именно его вызвало.» : Лукаш Кайзер, соавтор архитектуры Transformer
Автор оригинального разбора утверждает: ответ не только в весах модели, а в системе, которая выросла вокруг этих весов. Эта система называется «обвязка агента» (agent harness).
Что такое обвязка агента и зачем она нужна?
Обвязка агента (harness) включает всё, кроме самих весов модели, что позволяет ИИ-агенту работать: окружение, инструменты, контекст и ограничители (guardrails, защитные рамки, не дающие агенту выйти за допустимые действия).
Без обвязки модель остаётся «мозгом в колбе». Она может рассуждать, но не способна выполнить действие в реальном цифровом пространстве.
С обвязкой модель получает:
- Восприятие (контекст окружения)
- Действия (инструменты: поиск, запись файлов, вызов API)
- Память (сохранение и сжатие информации между шагами)
- Границы (разрешения и ограничители)
Аналогия из источника проста: обвязка даёт разуму модели тело.
Как агенты дошли до рабочего состояния: четыре этапа
Источник выделяет четыре стадии, каждая из которых сдвигала баланс между тем, что обвязка требует от модели, и тем, что модель реально может выполнить.
1. ReAct и зарождение идеи (октябрь 2022)
ReAct (Reasoning + Acting) появился как промпт-техника: модель рассуждает, действует, наблюдает результат и повторяет цикл. Весь «агентный цикл» существовал только на бумаге, внутри промпта (текстовой инструкции для модели). Параллельно Meta выпустила Toolformer (февраль 2023), показав, что использование инструментов можно не подсказывать промптом, а встроить в обучение.
На этом этапе обе кривые, требований обвязки и возможностей модели, были близки к нулю. Разрыв мал, потому что всё только начиналось.
2. AutoGPT и BabyAGI: преждевременная автономия (весна 2023)
AutoGPT и BabyAGI вручили модели полную автономию, роль «самостоятельного сотрудника». Но модели того поколения оставались хрупкими предсказателями следующего токена (минимальной единицы текста, которую обрабатывает модель). Цикл не добавляет модели способностей. Он усиливает то, что уже есть, и ниже определённого порога усиливает ошибки, а не надёжность.
Именно здесь разрыв между кривыми был максимальным.
3. Cursor, Copilot и возврат человека в цикл (2023–2024)
Первые ИИ-среды для программирования (IDE) признали провал полной автономии и сознательно опустили кривую обвязки ниже кривой модели. Решение: не давать модели цикл напрямую, а дать цикл человеку, позволив модели ускорять каждый шаг.
Первая версия Devin попыталась вернуть автономию модели. Тест команды Answer.AI показал около 15 % успеха, подтвердив, что отступление от полной автономии было верным ходом, а не трусостью.
Тем временем модели продолжали улучшаться. К концу 2024 года, с выходом o1 (первой рассуждающей модели от OpenAI), разрыв впервые инвертировался: возможности модели обогнали требования обвязки.
4. Claude Code: кривые пересеклись (февраль 2025)
Инверсия конца 2024 года создала возможность, которую кто-то должен был использовать. Если модель теперь опережает обвязку, то обвязка, искусственно тормозящая модель, теряет потенциал.
Claude Code стал первым агентом для написания кода, построенным именно под эту возможность. Он отказался от IDE в пользу терминала, дал модели доступ к bash и чтению/записи файлов, а вместо одобрения каждого изменения человеком ввёл правила разрешений. Модели вернули цикл, и на этот раз она справилась.
Что понадобится
- Понимание концепции: прочитать этот разбор и усвоить логику «модель + обвязка»
- Доступ к агентной системе: Claude Code (терминальный агент от Anthropic), Cursor, GitHub Copilot или аналоги
- Для экспериментов в РФ: YandexGPT, GigaChat (пока без полноценного агентного режима, но с поддержкой вызова инструментов)
- Время: 30 минут на первый тест, 2 часа на полноценный сценарий
Пошаговая инструкция: как проверить агентный подход на практике
-
Сформулируйте задачу как цель, а не как набор команд. ИИ-агент отличается от чат-бота тем, что получает конечную цель и сам разбивает её на шаги. Вместо «найди статистику, потом напиши абзац» опишите результат.
-
Задайте границы. Определите, к каким файлам, папкам или данным агент имеет доступ, а к каким нет. В Claude Code это делается через файл разрешений.
-
Запустите агентный цикл. В терминале Claude Code команда выглядит так:
claude "Проанализируй файлы в папке /drafts, найди все упоминания конкурентов, собери в таблицу competitor_mentions.md с колонками: имя, контекст, тональность"
-
Наблюдайте за цепочкой рассуждений. Агент покажет, какие шаги планирует, какие инструменты вызывает. Если цепочка уходит не туда, прервите и уточните цель.
-
Оцените результат и сузьте задачу. Первый запуск часто показывает, что задача слишком широкая. Разбейте её на подзадачи и запустите агент на каждой отдельно.
Задача: автор Дзена хочет собрать из десяти своих черновиков список всех упомянутых инструментов с кратким описанием каждого.
Что ввели:
claude "Прочитай все .md файлы в /drafts. Извлеки названия инструментов и сервисов. Для каждого напиши одно предложение: что делает. Результат сохрани в tools_list.md"
Что получили: файл tools_list.md с 23 инструментами, описанием каждого в одну строку и указанием, в каком черновике он упоминался. Работа, которая вручную заняла бы час, выполнена за 40 секунд. Два инструмента агент описал неточно (галлюцинация, когда ИИ уверенно выдумывает то, чего не было), их пришлось поправить вручную.
- Отдать агенту слишком широкую задачу. Именно это погубило AutoGPT в 2023 году: чем длиннее цепочка шагов, тем выше вероятность накопления ошибок. Начинайте с задач на 3–5 шагов.
- Не задать границы доступа. Агент с правами на запись может перезаписать нужные файлы. Всегда ограничивайте папки и действия.
- Ждать от модели того, чего она не умеет. Рассуждающие модели (reasoning models) сильно продвинулись, но не стали безошибочными. Проверяйте факты и цифры в результатах агента вручную.
- Путать ИИ-агент с чат-ботом. Чат-бот отвечает на один вопрос. ИИ-агент сам планирует, вызывает инструменты, наблюдает результат и корректирует план. Если вы используете агентную систему как чат, вы теряете главное преимущество.
Что делать с этим прямо сейчас, по ролям
Авторам Дзена. Попробуйте агентный подход для рутинных задач: сбор упоминаний, подготовка структуры статьи из заметок, проверка фактов по нескольким источникам. Агент не заменит ваш голос, но уберёт механическую работу.
Маркетологам. Агенты уже способны анализировать папки с отчётами, сводить данные из разных файлов и готовить черновики брифов. Экономия времени реальна, но каждый вывод нужно проверять: галлюцинации никуда не делись.
Предпринимателям в РФ и СНГ. Полноценных агентных сред с русскоязычной поддержкой пока мало. YandexGPT и GigaChat поддерживают вызов инструментов, но не дают терминального агентного цикла, как Claude Code. Следите за обновлениями этих платформ и тестируйте зарубежные решения через VPN, где это возможно.
Главная мысль источника точна и совпадает с тем, что я наблюдаю на практике: агенты заработали не потому, что модель стала «умнее» в абстрактном смысле. Заработала система целиком: модель научилась использовать инструменты, а обвязка перестала требовать от модели невозможного.
Для автора или маркетолога это означает конкретную вещь: не ждите «идеальную модель». Учитесь строить правильную обвязку, задавать цель, ограничивать доступ, разбивать задачу на шаги. Именно это отличает работающего агента от бесполезного цикла ошибок.
Честная оговорка: агентные системы в феврале 2025 года пересекли порог полезности для задач программирования. Для текстовых, аналитических и маркетинговых задач порог ещё не пройден так же уверенно. Пробуйте, но держите руку на тормозе.
Генератор контент-планов dzen.guru
Попробуйте собрать контент-план с помощью нашего инструмента и сравните результат с тем, что выдаст ИИ-агент. Разница покажет, где автоматика уже справляется, а где нужен ваш опыт.
Попробовать бесплатноПерелом конца 2025 года показал простую закономерность: модели продолжат впитывать функции обвязки в свои веса, инженеры продолжат убирать то, что модель уже умеет сама, а оставшаяся обвязка будет всё больше обслуживать внимание человека, а не возможности машины. Для тех, кто работает с контентом, практический вывод один: осваивайте не конкретный инструмент, а логику «цель плюс границы плюс проверка». Инструменты сменятся, логика останется.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Simile AI привлекла $2 млрд, чтобы доказать: scaling laws нейросети работают и для симуляции людей
Компания Simile AI, основанная автором знаковой работы о генеративных агентах Smallville, привлекла два миллиарда долларов в раунде Series B и предлагает…

Как Claude помечает AI текст
Anthropic второго июня объявила, что все модели Claude будут незаметно помечать сгенерированный текст водяным знаком, и теперь любой фрагмент можно проверить…

Обучение нейросетей без людей: 7 этапов уже пройдены, затраты упали в сотни раз
Компания Latent Space опубликовала аналитику, которая описывает семь этапов замены человеческого труда в обучении нейросетей на синтетические, созданные самими…
Комментарии