Игорь Градов
Игорь Градов
6 мин
ai

Авито раскрыла три модели машинного обучения для монетизации без ущерба поиску

Авито использует три типа моделей машинного обучения для монетизации поиска и рекомендаций, и Алина Бабенко, acting DS-менеджер компании, впервые описала механику баланса между ростом выручки и качеством выдачи для продавцов и покупателей.

Авито раскрыла три модели машинного обучения для монетизации без ущерба поиску
Почему это важно

Авито показывает, как крупнейший российский маркетплейс объявлений решает задачу, с которой столкнётся любой сервис с платным продвижением: повышать доход площадки, не ухудшая поиск для пользователей и не раздувая расходы продавцов.

Алина Бабенко из команды Data Science Авито опубликовала разбор моделей, которые рассчитывают ожидаемую выручку от действий пользователей и встраивают её в ранжирование. Материал адресован дата-сайентистам и тимлидам, работающим с монетизацией на маркетплейсах и в сервисах объявлений. Ниже, пошаговый разбор того, как это устроено и что из этого можно взять в работу.

Что понадобится

  • Понимание базовых метрик классификации: ROC-AUC (метрика, которая показывает, насколько хорошо модель отличает «да» от «нет»), log loss (функция потерь, штрафующая модель за неуверенные или ошибочные предсказания)
  • Представление о воронке маркетплейса: показ, клик, контакт, сделка
  • Доступ к данным о показах, кликах и целевых действиях (контакты, звонки, бронирования) на вашей площадке
  • Инструменты для обучения моделей: любой ML-фреймворк, поддерживающий кастомные функции потерь (Авито использует query cross-entropy loss)
  • Время на внедрение: от нескольких недель на первую модель до нескольких месяцев на полный цикл с калибровкой

Как Авито строит машинное обучение для монетизации: пошаговая инструкция

  1. Определите целевые действия по категориям. Продавцы на Авито платят за разные события: клики, контакты в чате, бронирования, сделки. Крупные дилеры и застройщики предпочитают оплачивать звонки. От выбора целевого действия зависит вся дальнейшая архитектура моделей.

  2. Разделите логику для поиска и рекомендаций. В поиске Авито считает несколько факторов для каждого объявления: ожидаемую выручку, конверсию, качество объявления. Все признаки взвешиваются, и объявления ранжируются по итоговому скору. В рекомендациях подход другой: фиксируются определённые места, где ранжирование идёт по ожидаемой выручке, а остальные сегменты её не учитывают.

  3. Обучите CTR-модель (Click-Through Rate, вероятность клика). Модель обучается на истории показов и кликов. Она оценивает, насколько конкретное объявление заинтересует пользователя после того, как он его увидел. Особенно важна для продавцов, которые платят за клик.

  4. Обучите CVR-модель (Conversion Rate, вероятность целевого действия после клика). В отличие от CTR-модели, CVR работает уже на данных о кликах и предсказывает, напишет ли пользователь в чат, позвонит или оформит бронирование. Помогает оценить качество привлечённого трафика.

  5. Добавьте модель корректировки ставок. Это ключевой элемент системы машинного обучения для монетизации в Авито. Идея: повышать ставку, если пользователь с высокой вероятностью совершит целевое действие, и понижать, если вероятность низкая. Более ценный трафик получает больший вес в аукционе, но средняя стоимость клика для продавца остаётся прежней.

  6. Используйте query cross-entropy loss вместо обычного log loss. Стандартный log loss не учитывает ограничение: среднюю ставку за клик нужно удерживать. Query cross-entropy loss состоит из двух компонентов: классического log loss и log loss для группы (группа означает все клики по одному объявлению). Модель учится сохранять среднее значение скоринга около единицы и одновременно корректировать ставку.

  7. Оценивайте качество через stratified ROC-AUC, а не глобальный. Обычный ROC-AUC считает метрику по всем объектам платформы. Проблема: в выдаче по запросу «кресло» не будет ноутбуков, а глобальная метрика учтёт такие заведомо простые сравнения и покажет завышенный результат. Stratified ROC-AUC считается отдельно для каждого поискового запроса, результаты агрегируются с весом, равным числу кликов.

  8. Проверяйте калибровку модели через метрику RIG. Формула: RIG = 1 − log loss / entropy. Для ранжирования по ожидаемой выручке важны не только относительные позиции объектов, но и абсолютные значения вероятностей: именно они умножаются на ставки. Если модель плохо откалибрована, ожидаемая выручка превращается из денежной оценки в относительную метрику, которую нельзя напрямую использовать в расчётах.

Как это работает на практике

Продавец кресел платит за клик. CTR-модель предсказывает, что пользователь А с вероятностью 0,12 кликнет по объявлению, а пользователь Б с вероятностью 0,03. CVR-модель добавляет: после клика пользователь А с вероятностью 0,4 напишет в чат, пользователь Б с вероятностью 0,05. Модель корректировки повышает ставку для показа пользователю А и снижает для Б. Продавец не переплачивает в среднем, но получает больше реальных покупателей. Площадка зарабатывает больше, потому что ценный трафик оценивается дороже в аукционе.

Частые ошибки
  • Глобальный ROC-AUC вместо stratified. Метрика покажет отличный результат, но реальное качество ранжирования внутри конкретного запроса не изменится. Авито столкнулись с этим и перешли на стратифицированную версию.
  • Игнорирование калибровки. Если скор модели не отражает реальную вероятность события, ожидаемая выручка теряет денежный смысл. Модель может хорошо ранжировать, но умножение некалиброванного скора на ставку даст бессмысленные числа.
  • Одна модель на все категории. Авито учитывает особенности каждого направления: товары, вакансии, недвижимость. Универсальная модель без доработки под категорию потеряет в точности.
  • Рост выручки ценой качества поиска. Авито прямо формулирует ограничение: модели не должны ухудшать поиск ради роста выручки. Покупатели должны получать качественную выдачу, продавцы должны продавать. Если оптимизировать только выручку, пользователи уйдут.

Что делать с этим прямо сейчас, по ролям

Дата-сайентисту или ML-инженеру. Разбор Авито даёт готовую архитектуру из трёх моделей (CTR, CVR, корректировка ставок) с конкретной функцией потерь query cross-entropy loss. Если вы строите машинное обучение для монетизации на маркетплейсе или классифайде, начните с CTR-модели на данных показов и кликов, затем добавляйте CVR и корректировку.

Тимлиду или продакт-менеджеру. Ключевой урок: метрика качества модели и метрика бизнеса могут расходиться. Stratified ROC-AUC вместо глобального и обязательная калибровка это не перфекционизм, а защита от ситуации, когда «модель улучшилась», а выручка не выросла.

Предпринимателю или владельцу площадки. Подход Авито показывает, что машинное обучение для монетизации не обязательно означает рост расходов продавца. Модель корректировки ставок перераспределяет бюджет между типами пользователей, сохраняя среднюю стоимость клика. Это аргумент для продавцов: платите столько же, но получаете более качественных покупателей.

Автору Дзена или маркетологу. Если вы продвигаете товары или услуги на Авито, полезно понимать: площадка оценивает не просто клики, а вероятность целевого действия после клика. Объявление, по которому кликают, но не пишут, может терять позиции. Работайте над конверсией внутри объявления: фото, описание, цена, скорость ответа.

Мнение редакции dzen.guru

Разбор Алины Бабенко ценен не столько алгоритмами (query cross-entropy loss воспроизведёт не каждая команда), сколько принципом. Авито явно ставит ограничение: выручка не должна расти за счёт качества поиска. На практике я вижу, что многие площадки и каналы монетизации в РФ этот баланс не держат: платное продвижение вытесняет органику, пользователь получает не лучший результат, а самый дорогой. Подход Авито с корректировкой ставок под качество трафика, редкий пример, когда машинное обучение для монетизации работает в интересах обеих сторон. Честная оговорка: материал описывает архитектуру, но не раскрывает конкретные признаки моделей и объёмы обучающих данных, поэтому воспроизвести результат один в один на другой площадке без экспериментов не получится.

Подход Авито можно свести к одной фразе: модель должна зарабатывать больше не потому, что берёт дороже, а потому, что точнее находит тех, кто готов купить. Если вы строите свою систему ранжирования, начните с этого принципа, а модели подтянутся.

Хотите разобраться, как ИИ меняет контент и продвижение?

В dzen.guru мы разбираем реальные кейсы применения нейросетей для авторов, маркетологов и предпринимателей. Без хайпа, с примерами.

Перейти в dzen.guru
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Google добавила вайб-кодинг в сертификат по ИИ: приложения без кода и бесплатно
ai

Google добавила вайб-кодинг в сертификат по ИИ: приложения без кода и бесплатно

Google предлагает бесплатно научиться создавать приложения без кода, и для этого достаточно описать идею обычным языком: компания добавила курс по вайб-кодингу…

5 мин
River AI привлёк $1,1 млрд на seed: финансирование стартапов ИИ ставит рекорд
ai

River AI привлёк $1,1 млрд на seed: финансирование стартапов ИИ ставит рекорд

River AI, стартап бывшего сооснователя xAI Игоря Бабушкина, привлёк 1,1 млрд долларов на раунде seed/Series A в июне 2025 года, чтобы с нуля переизобрести…

5 мин
ИИ-помощник по математике от OpenAI решил 10 задач, над которыми бились десятилетиями
ai

ИИ-помощник по математике от OpenAI решил 10 задач, над которыми бились десятилетиями

Компания OpenAI объявила, что её неопубликованная модель Astra решила десять давних математических задач из разных областей, от упаковки сфер в многомерных…

5 мин