Дзен показал, как LLM ускоряет AB тестирование: находит дисбалансы за минуты
Автор Дзена тратит часы на разбор А/Б-тестов вручную, пытаясь понять, почему одни публикации взлетели, а другие просели, и при этом стандартные метрики не показывают, что именно сдвинулось в рекомендательной системе. Команда технической аналитики Дзена построила инструмент, который перекладывает эту черновую работу на LLM (большую языковую модель, то есть нейросеть, которая понимает и генерирует текст), и ниже разобрано, как повторить этот подход для своего контента.

Обычное AB тестирование фиксирует, выросла метрика или упала, но не объясняет, кто именно выиграл и почему. Инструмент Дзена впервые показал, как LLM автоматически находит дисбалансы между интересами платформы, читателей и авторов, которые аналитик вручную мог пропустить.
Михаил Рязанский, руководитель группы технической аналитики Дзена, и Марк Хабаров, лид команды ML-аналитики, описали на Хабре путь от стандартных дашбордов до LLM-отчётов. Их опыт ценен тем, что это не лабораторный эксперимент, а рабочий процесс внутри крупной контентной платформы, где каждое изменение рекомендательной системы затрагивает доходы тысяч авторов.
Что понадобится
- Доступ к любой LLM: ChatGPT, Claude, YandexGPT или GigaChat. Подойдёт даже бесплатный тариф для первых экспериментов.
- Выгрузка результатов вашего AB тестирования в табличном виде: CSV, Google Sheets или экспорт из аналитической системы (Яндекс Метрика, AppMetrica, собственная база).
- Чёткое понимание, какие метрики вы отслеживаете: показы, клики, время на странице, доход автора.
- Примерно 30 минут на первый прогон и настройку промпта (текстовой инструкции для нейросети).
Как Дзен пришёл к LLM-анализу: пошаговая логика
Команда Дзена прошла несколько итераций, прежде чем нашла рабочую схему. Вот последовательность, которую можно адаптировать.
-
Определите, кого затрагивает тест. В Дзене выделили три группы: платформа (бизнес-метрики), пользователи (стандартный А/Б-тест покрывает их поведение) и авторы (их интересы стандартные метрики часто не ловят). Для вашего канала группы могут быть проще: вы как автор, ваши читатели и алгоритм рекомендаций.
-
Соберите данные в структурированном виде. Команда Дзена генерирует HTML-отчёт с четырьмя страницами: авторы и структура показов, топ авторов, финансовое влияние на авторов, влияние на рекомендательную систему. Вам достаточно таблицы с колонками: вариант теста, метрика, значение в контрольной группе, значение в тестовой группе, разница в процентах.
-
Напишите промпт, который задаёт роль и контекст. Дзен использует LLM как «микроштатного аналитика», который делает обобщённые выводы и ищет закономерности. Вот адаптированный промпт для автора:
Ты аналитик контентной платформы. Я даю тебе таблицу с результатами А/Б-теста.
Контекст: тест проверял [описание изменения, например: новый формат заголовков].
Задача:
1. Назови три главных изменения между контрольной и тестовой группами.
2. Укажи, какие категории контента выиграли, а какие проиграли.
3. Есть ли признаки дисбаланса: одна категория растёт за счёт всех остальных?
4. Дай рекомендацию: раскатывать изменение или нет, и почему.
Данные:
[вставьте таблицу]
-
Скормите данные LLM постранично, а не целиком. Команда Дзена сначала получает выводы по каждой странице отчёта отдельно, а затем просит модель сделать итоговую сводку по всем страницам. Такой подход снижает риск галлюцинации (когда модель уверенно выдумывает то, чего нет в данных). Если у вас одна таблица, разбейте её на блоки: отдельно охваты, отдельно вовлечённость, отдельно доход.
-
Попросите модель сравнить пары. Одна из находок Дзена: попарное сравнение авторов с похожими внешними показателями (подписчики, дневная аудитория), но разным поведением в рекомендациях. Для автора Дзена аналог: сравните две публикации с похожим числом показов, но разным временем чтения, и спросите LLM, чем они отличаются по структуре и теме.
-
Проверьте выводы модели вручную. Это не факультативный шаг. LLM находит паттерны, но может ошибаться в причинно-следственных связях. Команда Дзена использует модель как помощника аналитика, а не замену.
Допустим, вы тестировали два формата обложек для статей на Дзене. Выгрузили из статистики канала данные по 20 публикациям: вариант А (стандартная обложка) и вариант Б (обложка с крупным текстом). Вставили таблицу в ChatGPT с промптом выше.
Модель ответила: «Вариант Б увеличил CTR (долю кликов от показов) на 12%, но время чтения снизилось на 8%. Категория "лайфстайл" выиграла сильнее всего, категория "технологии" почти не изменилась. Признак дисбаланса: рост кликов идёт за счёт заголовков-приманок, а не качества контента. Рекомендация: раскатывать с осторожностью, отслеживая дочитываемость».
Без LLM вы бы увидели только «CTR вырос» и, вероятно, раскатили бы изменение, не заметив просадку по времени чтения в конкретной категории.
- Вставлять сырые данные без контекста. Если не объяснить модели, что именно тестировалось и какие метрики приоритетны, она выдаст общие слова вместо конкретных выводов.
- Верить цифрам, которые модель «досчитала» сама. LLM может назвать процент или сумму, которых нет в ваших данных. Каждое число из ответа проверяйте по исходной таблице.
- Загружать слишком большой объём за один раз. Команда Дзена столкнулась с этим ещё на этапе BI-дашборда: система не справилась с объёмом. С LLM та же проблема: длинные таблицы модель обрабатывает хуже, теряет строки. Разбивайте на блоки.
- Игнорировать финансовое влияние. Дзен специально выделил отдельную страницу под доходы авторов. Если вы монетизируете канал, всегда включайте данные по доходу в анализ, иначе оптимизируете охваты, а зарабатываете меньше.
- Использовать LLM для принятия решения, а не для подготовки к нему. Модель помогает найти паттерн. Решение остаётся за вами.
Что с этого прямо сейчас?
Авторам Дзена. Даже без доступа к внутренним инструментам Дзена вы можете выгрузить статистику канала, оформить её в таблицу и попросить LLM найти закономерности между форматами, темами и поведением аудитории. Это не полноценное AB тестирование, но первый шаг к системному анализу вместо интуитивного.
Маркетологам. Подход Дзена показывает, как автоматизировать рутину постанализа. Если ваша команда тратит на разбор каждого А/Б-теста день работы аналитика, LLM-промпт сокращает черновую часть до минут. Экономия умножается с каждым тестом.
Предпринимателям в РФ. Инструмент Дзена работает внутри российской инфраструктуры. Для собственных проектов доступны YandexGPT и GigaChat, которые не требуют VPN и принимают оплату в рублях. Для задач анализа таблиц подойдёт и бесплатный тариф Claude или ChatGPT через веб-интерфейс.
Подход команды Рязанского и Хабарова ценен не технологией, а постановкой задачи. Они не спрашивали «как прикрутить LLM к отчёту», а спрашивали «что мы не видим в стандартных метриках». LLM стала ответом, но могла бы стать и другая автоматизация.
По моему опыту, главная ловушка для авторов Дзена: начать с инструмента, а не с вопроса. Прежде чем открывать ChatGPT, сформулируйте: «Что именно я хочу узнать о своём контенте, чего не вижу в стандартной статистике?» Без этого вопроса LLM выдаст красивый, но бесполезный текст.
Честная оговорка: LLM не заменяет статистическую значимость. Если в вашем тесте 50 показов на вариант, никакая модель не сделает из этого надёжный вывод. Минимум для осмысленного анализа: сотни, а лучше тысячи событий на каждый вариант.
Инструмент Дзена начинался с попытки загрузить данные в стандартный дашборд, который не справился. Закончился рабочим ботом, где любой сотрудник вводит номер теста и получает HTML-отчёт с выводами LLM. Для автора канала масштаб другой, но логика та же: собрать данные, разбить на блоки, задать модели правильный вопрос и перепроверить ответ. Начните с одного теста и одного промпта сегодня, результат увидите через полчаса.
Генератор промптов dzen.guru
Попробуйте готовые шаблоны промптов для анализа контента и А/Б-тестов на Дзене
Попробовать бесплатно
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

LLM строит data lineage из SQL за секунды: как заменить недели ручного разбора
Большую языковую модель можно превратить в инструмент, который за секунды разбирает сложный SQL-запрос и выстраивает полную карту зависимостей данных от…

Google бесплатно обучает НКО искусственному интеллекту: благотворительность экономит день в неделю
Google отдаёт НКО бесплатные ИИ-курсы и персональных коучей, чтобы закрыть главный барьер: нехватку обучения Google 2 июня 2025 года расширила программу Google…

Recursive Superintelligence и Amazon подписали контракт
Microsoft второго июня запустила Project Solara — нет, стоп. Работаю по источнику. Recursive Superintelligence, стартап из области самосовершенствующегося ИИ,…
Комментарии