Игорь Градов
Игорь Градов
6 мин
ai

Gemini Flash Lite обошла GPT-5 Nano в 14 раз по цене и точнее на живом потоке

Я вижу, что оригинал — это не новость о раунде финансирования (funding), а практический разбор классификации моделей на реальном финтех-продукте. В оригинале нет сделки, нет инвестора, нет суммы раунда. Архетип «funding» и план с таблицей «Сделка в цифрах» не соответствуют источнику. Следую правилу достоверности: не выдумываю сделку, не подставляю цифры. Перестраиваю архитектуру под реальное содержание источника, сохраняя максимум из плана, где он применим.

Gemini Flash Lite обошла GPT-5 Nano в 14 раз по цене и точнее на живом потоке

Разработчик финтех-продукта за неделю прогнал три задачи классификации через закрытую модель, открытую модель и Gemini Flash Lite на живом потоке русскоязычной поддержки и показал, что выбор определяет не точность из бенчмарка, а цена конкретной ошибки в конкретном бизнесе.

Почему это важно

Публичные бенчмарки сравнивают модели по средней точности, а в реальном продукте одна ошибка стоит 0,3 рубля, другая приводит к оттоку клиента. Разница в цене ошибки достигает ста раз, и именно она, а не строка рейтинга, решает, какую модель ставить в продакшен.

Автор ведёт финтех-сервис с потоком в несколько десятков обращений в день. За неделю пилотного замера он сравнил закрытую модель, открытую модель (опенсорс, то есть модель с открытым кодом, которую можно запустить на своём сервере) и Gemini Flash Lite от Google на трёх практических задачах: фильтрация мусора в анкетах, классификация обращений в поддержку и оценка качества черновиков ответов. Результаты опубликованы с оговорками, таблицами и ссылкой на полный набор данных.

Три задачи, а не одна: что именно тестировали?

Первая задача: отличить осмысленный ответ пользователя в анкете от мусора вроде «ааааааа» или текста не по теме. Здесь участвовали пять моделей через агрегатор (сервис, который даёт единый доступ к разным моделям) плюс самописный классификатор на правилах.

Вторая задача: разобрать обращение в поддержку по шести параметрам, от темы до решения «можно ли отправить черновик ответа как есть». Здесь сравнивали закрытую и открытую модели на 340 реальных обращениях.

Третья задача автор обозначил заранее нерешаемой для текущих инструментов и не стал тратить на неё замеры. Это честная граница: не каждую задачу имеет смысл отдавать классификатору.

Правила побеждают нейросети, когда ошибки дешевле

На задаче фильтрации мусора классификатор на правилах (проверка длины, плотности осмысленных слов, стоп-фраз) поймал 95% мусора, не отклонил ни одного живого ответа, работал меньше миллисекунды и стоил ноль рублей.

Gemini Flash Lite поймала 90% мусора, и автор остановился на двухступенчатой схеме: сначала правила, а то, что они пропустили, уходит в Gemini Flash Lite.

Самый дорогой кандидат, GPT-5 Nano, оказался в четырнадцать раз дороже Gemini Flash Lite и ловил только 70% мусора. Цена и качество здесь не связаны.

Почему лучшая модель по бенчмарку оказалась худшей для бизнеса?

Открытая модель Llama поймала весь мусор до единого, но отклонила 7,5% живых ответов. Формально она лидер по полноте (доле пойманного мусора). Но в этом продукте пропущенный мусор стоит 0,3 рубля на ручной разбор, а отклонённый живой ответ — это обиженный пользователь, потенциальный отток и негативный отзыв.

По оценке автора, разница в цене этих двух типов ошибок — порядка ста раз. Вот почему выбор пал на правила плюс Gemini Flash Lite: эта связка пропускает чуть больше мусора, зато не трогает живые ответы.

Это ключевой вывод замера: выбор модели определяется политикой ошибок, а не строкой в бенчмарке.

Закрытая модель справилась, открытая на русском — нет

На второй задаче (классификация обращений в поддержку) закрытая модель обработала все шесть вопросов за 563 миллисекунды одним вызовом. Стоимость — 0,027 доллара за 340 обращений, около пяти центов в день на реальном потоке.

Открытая модель работала локально, секунда на обращение, данные не покидали контур. Но на русскоязычных обращениях без дообучения (обучения модели на ваших примерах под узкую задачу) она не дала сигнала: показатель AUC (метрика, которая показывает, насколько модель отличает «да» от «нет», где 0,5 значит «угадывает монеткой») составил от 0,41 до 0,46.

Автор честно оговаривает: значения ниже 0,5 означают инвертированный порядок, и при развороте знака получается 0,54–0,59, но доверительный интервал (диапазон, в котором может лежать настоящее значение) накрывает 0,5. Формулировка: «сигнала не обнаружено».

Калибровка не спасает, и вот математический аргумент

Температурное шкалирование (способ сделать вероятности модели ближе к реальным) — это монотонное преобразование. AUC зависит только от порядка, поэтому калибровка температурой не меняет AUC никогда. Она делает вероятности честнее, но не улучшает способность модели различать классы.

Калибровка Платта с наклоном около нуля выдала почти константу, равную базовой доле класса, и точность стала равна мажоритарной (когда модель просто говорит «да» на всё, потому что «да» встречается чаще). Отсюда и 94% на вопросе про рабочую переписку — ровно столько же даёт стратегия «всегда отвечай "да"».

Для нетехнического читателя: калибровка — это попытка «подкрутить» ответы модели, чтобы она была увереннее в правильных. Но если модель изначально не различает категории, подкручивать нечего.

Выбор модели определяется политикой ошибок, а не строкой в бенчмарке. У нас лишняя строка в базе стоит примерно 0,3 рубля, а обиженный пользователь — это потенциальный отток. Разница в цене ошибки порядка ста раз. : Автор исследования

Что делать с этим прямо сейчас, по ролям

Автору Дзена. Если вы используете нейросети для модерации комментариев или фильтрации откликов, начните с правил: длина, стоп-слова, наличие знаков препинания. Это бесплатно, моментально и закрывает большую часть мусора. Нейросеть подключайте вторым слоем, только на то, что правила пропустили.

Маркетологу. Gemini Flash Lite стоит в разы дешевле GPT-5 Nano и на задаче фильтрации показала 90% против 70%. Перед выбором модели для классификации лидов или обращений посчитайте, сколько стоит каждый тип ошибки в вашем бизнесе: ложное «спам» на живую заявку может обойтись дороже, чем сотня пропущенных мусорных сообщений.

Предпринимателю в РФ. Gemini Flash Lite доступна через API Google. Из российских аналогов для задач классификации на русском языке стоит проверить YandexGPT и GigaChat, но автор исследования их в данном замере не тестировал, поэтому сравнивать напрямую нельзя. Открытые модели на русском без дообучения пока не дают сигнала на коротких текстах поддержки — учитывайте это, если планируете держать данные внутри контура.

Мнение редакции dzen.guru

Этот разбор ценен не моделями, а методом. Автор показал, как за неделю на живых данных построить рамку выбора, которая работает для конкретного продукта. Я вижу, что большинство авторов и маркетологов выбирают модель по чужому рейтингу, а потом удивляются результатам. Подход «сначала посчитай цену каждой ошибки» применим к любой задаче: от модерации комментариев до скоринга заявок. Оговорка: выборка в 80–340 обращений за неделю — это пилот, не статистически мощное исследование. Автор это признаёт. Но для принятия решения «ставить в прод или нет» такого пилота достаточно, и это тоже часть метода: не ждать идеальных данных, а действовать на том, что есть, с честными оговорками.

Где подвох

Все замеры времени ответа сделаны через агрегатор и отражают состояние очереди в конкретный день, а не свойство модели. Одна модель показала 5–7 секунд и 0,3 доллара за тысячу ответов, но это был час пиковой нагрузки у провайдера. Рассуждающие модели при лимите в 200 токенов (минимальных единиц текста, которые модель обрабатывает) возвращают пустой ответ: весь бюджет уходит на «размышления». Им нужно от 1200 токенов, и отсюда их медлительность и дороговизна на задачах классификации.

Главный практический шаг из этого разбора: прежде чем открывать документацию любой модели, возьмите лист бумаги и запишите два числа — сколько стоит пропустить плохое и сколько стоит отклонить хорошее. Эти два числа решат выбор за вас, а бенчмарк останется справочной таблицей, не руководством к действию.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Исследования искусственного интеллекта на стыке наук
ai

Исследования искусственного интеллекта на стыке наук

Текст новости строится строго по переданному оригиналу. Оригинал описывает авторскую методологию исследований на стыке наук с примером ERP-системы. Формат…

6 мин
Свой сервер ИИ-разработки за 15 минут: OpenCode, OpenAI API и никакой привязки к вендору
ai

Свой сервер ИИ-разработки за 15 минут: OpenCode, OpenAI API и никакой привязки к вендору

Статья показывает практическую сборку рабочего стека для разработки с ИИ без привязки к одному провайдеру: конкретные шаги установки OpenCode на Linux и…

6 мин
ai

AGI не существует: как внедрять искусственный интеллект без убытков и иллюзий

Если автор Дзена или маркетолог слышит «AGI изменит всё» и не понимает, где заканчивается реальная польза ИИ и начинается маркетинговый шум, эта инструкция…

6 мин