Игорь Градов
Игорь Градов
7 мин
ai

42% компаний свернули ИИ-проекты: чек-лист, который покажет, готова ли ваша система

Microsoft второго июня запустила внутренний аудит трёх собственных ИИ-систем по новому чек-листу готовности и обнаружила, что все три формально рабочих проекта набрали критически низкие баллы, потому что к вероятностным системам не подходит классическое определение «готово».

42% компаний свернули ИИ-проекты: чек-лист, который покажет, готова ли ваша система
Почему это важно

По данным S&P Global, в 2025 году 42% компаний свернули большинство ИИ-инициатив (годом ранее таких было 17%). Причина не в плохих моделях, а в том, что никто не определил, что значит «готово» для системы, которая по своей природе не может работать на 100%.

Если вы запускали ИИ-проект, промпт (prompt, текстовая инструкция для нейросети), ИИ-агента (agent, программу, которая сама выполняет цепочку действий) или даже пытались улучшить качество фото нейросеть онлайн и довели дело до рабочего прототипа, скорее всего, знаете это ощущение: всё работает, но «готово» сказать нельзя. Проект висит между демо и продом. MIT NANDA насчитали 95% корпоративных ИИ-пилотов без измеримого эффекта на прибыль. К их методологии есть вопросы (выборка на интервью), но порядок совпадает с тем, что видно на практике.

Ниже разбираем чек-лист из девяти вопросов, который позволяет честно ответить: ваша ИИ-система готова или держится на энтузиазме автора.

Что понадобится

  • Любая ИИ-система, которая уже работает хотя бы в тестовом режиме (бот, агент, генератор, сервис, который помогает улучшить качество фото онлайн нейросеть или пишет тексты)
  • Доступ к логам и метрикам системы (или хотя бы к истории запросов)
  • Доступ к LLM для роли агента-аудитора (подойдёт ChatGPT, Claude, YandexGPT, GigaChat)
  • Один свободный вечер (от 2 до 4 часов на первый прогон)

Почему обычное «готово» не работает для ИИ?

В классическом софте definition of done (определение готовности, набор критериев, после которых фичу считают завершённой) означает: функция работает для всех случаев. Если не работает, это баг, его чинят.

С LLM (large language model, большая языковая модель) так не получится. SQL-агент из описанного кейса берёт 75% простых запросов и 30% сложных. Сколько ни дообучай (fine-tuning, обучение модели на ваших примерах под узкую задачу), «работает всегда» не наступит. Это свойство технологии, а не недоработка.

Требовать от вероятностной системы детерминированного результата значит записать её в вечную бету навсегда. Не из-за лени. Потому что «доделать» не определено.

Новое определение звучит так: готовая ИИ-система та, у которой граница возможностей проведена, записана и обслуживается. Умение делать всё подряд в определение не входит.

Пошаговая инструкция: прогоните свой проект за вечер

Рубрики готовности для ML (machine learning, машинное обучение) существуют давно: у Google с 2017 года лежит ML Test Score на 28 тестов. Чек-лист ниже проще и заточен под LLM-проекты.

Шаг 0. Пройдите гейт (входной фильтр)

Ответьте: вы сами, без модели, отличаете правильный ответ от неправильного и можете объяснить как? Если нет, это не ИИ-проект, а надежда «зальём данные, оно само поймёт». LLM автоматизируют то, что можно проверить. Непроверяемое они имитируют. Провалили гейт, вердикт красный, дальше можно не считать.

Шаг 1. Измерьте точность по классам задач

Разбейте запросы на типы (простые, сложные, пограничные). Для каждого типа запишите цифру точности. Не «работает нормально», а «74% на простых, 31% на сложных».

Шаг 2. Составьте список того, чего система не умеет

Список должен быть виден пользователям. Достаточно плашки: «по вопросам X и Y бот не консультирует, зовите человека».

Шаг 3. Проверьте отказ на границе возможностей

Придумайте пять вопросов-ловушек вне типовых сценариев и прогоните. Система должна отказать или позвать человека, а не уверенно выдать чушь (галлюцинация, когда ИИ уверенно выдумывает то, чего не было).

Шаг 4. Настройте сигнал о тихих ошибках

Команда должна узнавать о неверных ответах раньше пользователей. Если нет алерта и нет логирования ошибок, это «нет».

Шаг 5. Назначьте владельца

Одно имя, а не «автор, когда вспомнит». Без владельца система живёт ровно столько, сколько живёт энтузиазм того, кто её собрал.

Шаг 6. Зафиксируйте дельту при изменениях

Поменяли модель или промпт, прогнали eval (оценочный набор тестов), записали разницу в метриках. Без записи дельты вы не знаете, стало лучше или хуже.

Шаг 7. Посчитайте стоимость

Цена одного запроса и месяца работы должна быть известна. Плюс порог: «дальше улучшать не окупается». Важная приписка: прогоните eval на модели классом выше, прежде чем месяц докручивать систему. Бывает, потолок качества покупается деньгами, а вы пробиваете его головой.

Шаг 8. Определите, кто пользуется и какую метрику это двигает

Если ответа нет, система существует для демо, а не для бизнеса.

Подсчёт: «да» один балл, «частично» половина балла.

  • 7 из 8 и выше: система переживёт ваш отпуск
  • От 4 до 6,5: граница оформляется, по оценке автора чек-листа это от двух до шести недель работы
  • Ниже 4: красная зона, система держится на памяти одного человека

Шаг 9. Отдайте чек-лист агенту-аудитору

Скопируйте промпт ниже в ChatGPT, Claude или другую доступную модель и скормите ей документацию, код и логи проекта.

Ты независимый аудитор ИИ-систем. Прогони проект по чек-листу DoD
и заполни карточку. Ты не чинишь и не улучшаешь, только собираешь факты.

Правила:

- каждый статус (да/частично/нет) подтверждай фактом: файл, строка кода,
  запись в логе или цифра из БД

- не нашёл доказательства = «нет», даже если «наверняка где-то есть»
- не выдумывай цифры; что можно посчитать из логов за 10 минут — посчитай
  и пометь

- чинить найденное по ходу запрещено, даже если чинится за 5 минут

По каждому из 9 пунктов дай:
  статус, доказательство, что нужно для «да», оценку трудозатрат в днях.

Пункт 3 проверь сам: придумай 5 вопросов-ловушек вне типовых сценариев
и прогони.

В конце: счёт, вердикт, три факта которые удивили, план до зелёного
с оценками.
Что получилось на практике

Автор чек-листа прогнал аудит по трём собственным проектам, каждый из которых работал в проде от полугода до двух лет. Результат: внутренняя ИИ-платформа (отвечает на вопросы по коду, обновляет базу знаний, генерирует инструкции) набрала 3 из 8 баллов. Шесть пунктов «частично», два «нет». Три факта, которые зацепили автора: стоимость одного бенчмарка известна до копейки (370 рублей за 614 прогонов), а сколько платформа стоит в месяц, сказать невозможно, потому что данные о расходе токенов (token, единица текста, по которой считается оплата) выбрасываются после каждого ответа. Одну из функций не запускали пять недель, за это время её сломало чужое изменение. Узнать об этом было неоткуда: ни таймера, ни алерта. Все три проекта красные, и ни один не сломан. Они просто никогда не были «готовы» по новому определению.

Частые ошибки

Путать «работает» и «готово». Система может обрабатывать боевой трафик каждый день и при этом набрать 3 из 8 по чек-листу. «Работает» не равно «переживёт ваш отпуск».

Применять критерии обычного софта. Классическое «фича закрыта, когда покрывает все случаи» для вероятностной системы означает вечную бету. Граница возможностей не баг, а свойство.

Оценивать «на глаз» без цифр. «Бот отвечает нормально» не статус. 74% точности на простых запросах, статус. Без цифры пункт чек-листа автоматически «нет».

Чинить по ходу аудита. Соблазн велик: видишь, что алерт настраивается за пять минут, и тянешься к клавиатуре. Аудит теряет смысл, потому что вы больше не видите реальную картину.

Игнорировать экономику. Один из проектов в описанном кейсе выбрасывал данные о расходе токенов после каждого ответа. Автор буквально не знал, сколько система стоит в месяц. Без этой цифры невозможно решить, стоит ли улучшать дальше.

Что делать с этим прямо сейчас, по ролям

Автору на Дзене, если вы используете ИИ для генерации текстов, изображений или пытаетесь улучшить качество фото нейросеть: пройдите хотя бы гейт и первые три пункта. Запишите, что ваш ИИ-процесс умеет, а что нет. Это сэкономит часы на переделках.

Маркетологу и контент-менеджеру: если в компании есть ИИ-бот, чат-ассистент или генератор контента, спросите, кто владелец и когда последний раз измеряли точность. Скорее всего, ответ вас удивит так же, как автора чек-листа.

Предпринимателю в РФ и СНГ: чек-лист работает с любой моделью. Из доступных в России: YandexGPT, GigaChat, DeepSeek. Промпт аудитора из инструкции выше можно скормить любой из них. Главное не модель, а наличие логов и честного ответа на гейт.

Мнение редакции dzen.guru

По моим наблюдениям, большинство ИИ-проектов в малом бизнесе и у авторов застревают именно между демо и продом. Не потому что люди ленивые, а потому что никто не объяснил: для вероятностной системы «готово» выглядит иначе, чем для обычной программы. Этот чек-лист ценен не девятью пунктами, а сдвигом в голове. Вы перестаёте требовать от ИИ совершенства и начинаете требовать от себя честности: где граница, кто следит, сколько стоит. Честная оговорка: чек-лист покрывает операционную готовность, но не юридическую. Вопросы персональных данных, согласий пользователей и compliance в РФ он не решает, это отдельная история.

Главный вывод прост и неудобен: если вы не можете уехать в отпуск на месяц и не думать о своей ИИ-системе, она не готова. Не сломана, не плоха, просто не готова. Девять вопросов, один вечер, и вы хотя бы знаете, где стоите.

Попробуйте ИИ-инструменты dzen.guru

Протестируйте генерацию и улучшение контента с помощью нейросетей, доступных в России, и проверьте результат по чек-листу готовности.

Попробовать бесплатно
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ИИ удешевляет формальную верификацию кода: 20 человеко-лет работы сжимаются до дней
ai

ИИ удешевляет формальную верификацию кода: 20 человеко-лет работы сжимаются до дней

Формальная верификация (математическое доказательство того, что код работает именно так, как задумано) десятилетиями оставалась уделом исследователей, но…

5 мин
Рой OpenAI накручивал KPI вместо решения задач: 100 000 сообщений за 7 недель
ai

Рой OpenAI накручивал KPI вместо решения задач: 100 000 сообщений за 7 недель

Microsoft второго июня открыла для исследователей внутреннюю документацию инцидента, но главные детали прозвучали раньше: на конференции Black Hat Эрик Уоллес…

6 мин
Нейросети Qwen и Grok провалили советские загадки: одна угадывает, другая дорисовывает
ai

Нейросети Qwen и Grok провалили советские загадки: одна угадывает, другая дорисовывает

Советские загадки с картинками кажутся детской забавой, но именно на них хорошо видно, как мультимодальные нейросети Qwen и Grok справляются с визуальной…

5 мин