Игорь Градов
Игорь Градов
7 мин
ai

Платформа Taimen показала разработку искусственного интеллекта своими же агентами: сотни задач за 2 месяца

Платформа Taimen, разработанная русскоязычной командой и выпущенная 4 октября под открытой лицензией Apache-2.0, за неполных два месяца показала, как ИИ-агенты могут разрабатывать платформу, на которой сами же и работают, причём ловить собственные ошибки через встроенную приёмку.

Платформа Taimen показала разработку искусственного интеллекта своими же агентами: сотни задач за 2 месяца
Почему это важно

Разработка искусственного интеллекта упирается не в качество моделей, а в управление работой: агенты и модели меняются каждый месяц, а задачи остаются. Taimen показывает, как отвязать задачу от конкретного исполнителя, и это работает уже сейчас на реальном коде.

С 12 августа по 4 октября одна установка Taimen прогнала сотни задач на код, которые выполняли десять разных агентов-исполнителей на базе Claude Code (модели Opus и Sonnet) и Codex. Треть задач вообще никто не ставил вручную: их порождали правила, наблюдающие за репозиториями. 30 сентября один из агентов за 19 минут написал новый маршрут API, но допустил дыру в безопасности: маршрут позволял агенту-исполнителю перевести задачу на старую версию типа без проверки и закрыть её самому. Встроенное ревью платформы поймало проблему и отклонило работу. Через 48 минут агент сдал исправление, ревью прошло, и код влился. От постановки задачи до вливания прошёл 1 час 52 минуты. Это и есть суть подхода: платформа не доверяет агенту на слово, а проверяет результат по правилам, вшитым в тип задачи.

Что понадобится

  • Taimen v0.2.0 (открытые исходники, лицензия Apache-2.0, доступна на GitHub)
  • Доступ к API языковой модели: команда использовала Claude Code (модели Opus и Sonnet от Anthropic) и Codex (от OpenAI), но платформа не привязана к конкретной модели
  • Git-репозиторий с кодом, который будут обрабатывать агенты
  • Около 2 часов на первичную настройку: установка платформы, описание типов задач, подключение коннектора к репозиторию
  • Понимание YAML-синтаксиса на базовом уровне для описания правил и типов задач

Как запустить разработку, которая ведёт сама себя?

  1. Установите Taimen и опишите типы задач. Тип задачи (TaskType) определяет, что считается «сделано». Для задачи на код это две проверки: ревью человеком и вливание ветки. Пока ветка не влита, задача не закрыта, даже если агент написал «готово». Пример описания типа:
kind: TaskType
key: coding-task
spec:
  acceptance:
    - key: review
      kind: human
      spec: {approver: ${SELFDEV_REVIEWER_PRINCIPAL}}
      when: ["$.task.artifact[commit].metadata.published"]
    - key: merge
      kind: deterministic
      spec:
        skill: git.merge@1
        inputs:
          repository: "$.task.artifact[commit].metadata.repository!"
          branch: "$.task.artifact[commit].metadata.branch!"
        expect: {merged: true}
      when: ["$.task.artifact[commit].metadata.published"]
  1. Подключите коннектор к репозиторию. Коннектор наблюдает за коммитами и создаёт «наблюдения» (observations) в платформе. Каждое наблюдение содержит данные: в каком компоненте появился коммит, какая ветка, какой хеш.

  2. Опишите правила вывода работы (WorkRule). Правило связывает наблюдение с действием. Например, правило «submodule-lag» проверяет, не отстал ли суперпроект от компонента, и если отстал, создаёт задачу «сдвинуть указатель». Правило действует от собственной личности, поэтому в журнале видно, что задачу завёл не человек, а правило, со ссылкой на наблюдение, которое его запустило:

kind: WorkRule
key: submodule-lag
spec:
  trigger: {kind: observation, type: repo.commit_observed}
  condition:
    in: [{var: payload.data.repo}, [control-plane, memory-service]]
  action:
    kind: request_decision
    taskType: submodule-bump
    fields:
      title: "Сдвинуть указатель сабмодуля {{item.name}}"
  1. Назначьте агентов-исполнителей. Исполнитель берёт задачу через единый API: взять, выполнить, сдать артефакты (артефакт, это результат работы: коммит, документ, тест). Неважно, кто исполнитель: агент на Claude, агент на Codex или человек в своём редакторе. Команда Taimen использовала десять агентов-исполнителей: несколько поколений раннеров (автоматических исполнителей) и отдельных агентов под конкретные репозитории.

  2. Настройте ревью. С 29 сентября в Taimen ревью готовит отдельная сессия Claude, но решение (одобрить или отклонить) записывается за человеком, который за него отвечает. Провал любой проверки возвращает задачу тому же исполнителю с описанием причины.

  3. Запустите очередь и наблюдайте. Задачи начнут появляться двумя путями: вручную (человек ставит задачу) и автоматически (правило создаёт задачу по наблюдению). По данным команды Taimen, треть всей работы за период с 12 августа по 4 октября возникла без ручной постановки.

Как это работает на практике

30 сентября в 06:32 в очередь попала задача: перевести открытые задачи на новую версию типа «задача на код» с более строгими проверками. Агент взял задачу, за 19 минут написал новый маршрут API, тесты, документацию и сдал работу. В 07:15 ревью отклонило результат: маршрут позволял агенту с обычными правами исполнителя перевести задачу на версию типа без ревью и закрыть её самому. Ревьюер воспроизвёл сценарий по шагам и указал, какое право должно закрывать маршрут. В 08:03 агент взял задачу повторно, через 15 минут сдал исправление, в 08:24 ветка влилась. Итого: 1 час 52 минуты, два прогона агента. Платформа поймала дыру, которую создал агент, через собственный механизм приёмки.

Цифры, которые показала одна установка за 54 дня

С 26 сентября, когда приёмка стала частью типа задачи, через неё прошли 458 задач на код. Из них 14 провалили вливание:

  • 8 случаев: конфликты или ушедшая вперёд ветка (обычная ситуация при параллельной разработке)
  • 4 случая: инфраструктурные проблемы (токен не видел репозиторий, push отклонён)
  • 2 случая: агент сдал коммит без метаданных, вливать было нечего

Медианное время от постановки до вливания: 3,4 часа (с учётом ожидания в очереди ревью). 90% задач укладывались в 27 часов. Сам прогон агента в медиане занимал 11 минут.

По оценке команды, условная стоимость одного прогона Claude Code по тарифу API составила 1,90 доллара в медиане и 7,32 доллара на 90-м перцентиле. Команда оговаривает, что цифра условная: раннеры работали по подписке, а стоимость считал сам Claude Code.

Девять раз за период задачу начинал агент, а заканчивал человек в своём рабочем окружении. Задачи этого «не заметили»: единый формат работы не различает исполнителей.

Частые ошибки

Не давайте агенту право менять тип задачи. Именно это едва не стало дырой 30 сентября: агент мог перевести задачу на версию без ревью. Права на изменение типа должны быть отделены от прав исполнителя.

Не путайте «агент сказал готово» с «задача закрыта». Без явной приёмки (ревью плюс вливание) вы получите код, который никто не проверял. Приёмку описывайте в типе задачи, а не в промпте (промпт, текстовая инструкция для модели) агента.

Не рассчитывайте, что один агент закроет всё. Команда Taimen использовала десять разных исполнителей. Модели и инструменты меняются быстро, и привязка к одному агенту создаёт хрупкость. Опишите работу так, чтобы исполнитель был заменяем.

Не игнорируйте метаданные коммитов. Два из 14 провалов вливания случились потому, что агент сдал коммит без нужных метаданных. Проверяйте, что ваш агент-раннер корректно заполняет артефакты.

Что делать с этим прямо сейчас, по ролям

Автору Дзена и копирайтеру. Пока Taimen заточен под код, но принцип «работа важнее исполнителя» применим к контенту. Если вы используете ИИ для черновиков, попробуйте разделить задачу (написать текст) и приёмку (проверить факты, стиль, уникальность). Не позволяйте ИИ самому решать, что текст готов.

Разработчику и техническому руководителю. Taimen v0.2.0 доступен под Apache-2.0. Если вы строите разработку искусственного интеллекта с участием агентов, посмотрите на модель: описание задачи через тип с приёмкой позволяет менять агентов и модели без переделки очереди. Десять агентов на разных моделях работали с одной и той же структурой задач.

Предпринимателю в РФ и СНГ. Платформа русскоязычной команды, документация доступна. Для работы нужен доступ к API моделей: Claude (Anthropic) напрямую из РФ недоступен без обходных решений, но Codex (OpenAI) и открытые модели (опенсорс, модели с открытым кодом, которые можно запускать на своих серверах) можно подключить. Из российских аналогов для агентных задач пока нет прямого аналога Taimen, но YandexGPT и GigaChat можно использовать как языковые модели внутри подобной платформы.

Мнение редакции dzen.guru

Самое ценное в этой истории не скорость (1 час 52 минуты до вливания), а то, что платформа поймала дыру, которую сама же создала через агента. Это честная демонстрация: ИИ-агент ненадёжен по определению, но если приёмка вшита в архитектуру, а не в промпт агента, система работает.

Я вижу, как разработка искусственного интеллекта движется именно в эту сторону: не «умный агент делает всё сам», а «простая задача с жёсткой проверкой, и неважно, кто её выполнил». Taimen пока сырой (версия 0.2.0, первый открытый релиз), и ставить на него продакшен-процессы рано. Но саму модель, где работа первична, а исполнитель заменяем, стоит примерить к своим задачам уже сейчас.

Честная оговорка: все цифры стоимости прогонов условные, команда это признаёт. А доступ к Claude из РФ требует отдельных решений, которые не всегда стабильны.

Научитесь работать с ИИ-агентами на практике

В dzen.guru мы разбираем, как авторы и предприниматели используют нейросети для реальных задач, без хайпа и с проверкой результатов.

Попробовать dzen.guru

Платформа, которая ловит ошибки собственных агентов через встроенную приёмку, а не через надежду на «умную модель», это редкий пример инженерной честности в мире, где большинство демо показывают только удачные прогоны.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Микроэлектроника и ИИ: из 74 компаний лишь одна использует российское облако
ai

Микроэлектроника и ИИ: из 74 компаний лишь одна использует российское облако

Российская микроэлектроника уже внедряет ИИ, но большинство компаний делают это хаотично и на энтузиазме: опрос 74 участников форума «Микроэлектроника 2026»…

5 мин
ai

Google заморозила программу bug bounty до 2027 года: ИИ завалил инженеров ложными отчётами

Google в октябре 2025 года остановила открытую программу bug bounty (вознаграждение за найденные уязвимости) для своего опенсорс-кода, сославшись на лавину…

4 мин
Нейросети в образовании улучшили домашки на 15%, но обрушили экзамены на 25%
ai

Нейросети в образовании улучшили домашки на 15%, но обрушили экзамены на 25%

Исследование Стокгольмского университета и Университета Гонконга, которое 30 месяцев отслеживало 26 811 китайских школьников, зафиксировало парадокс: нейросети…

6 мин