Альтернатива ChatGPT в 8 раз дешевле: как не сломать бота китайскими иероглифами
Платить за языковую модель в восемь раз меньше и не потерять качество можно, но китайская модель способна вставить иероглифы прямо в русский текст, и к этому нужно быть готовым заранее.

Расходы на вызовы языковых моделей растут линейно с числом запросов, а не с числом пользователей. Один Telegram-бот с новостной лентой делает почти тысячу вызовов в сутки, и разница между $0.098 и $0.010 за миллион токенов (единиц текста, на которые модель разбивает слова) превращается в ощутимую экономию за месяц.
Автор русскоязычного новостного бота @futur_e_news_bot опубликовал подробный разбор того, как он искал альтернативу ChatGPT и другим дорогим моделям для конвейера, обрабатывающего около 936 вызовов в сутки. Каждая новость проходит через LLM (большую языковую модель): категоризация, перевод, определение тональности, разбор по полям. Задача стояла конкретная: снизить счёт, не ломая продакшн. Результат оказался поучительнее, чем просто «нашёл дешевле».
Что понадобится
- Аккаунт на OpenRouter (агрегатор доступа к разным языковым моделям через единый API) с положительным балансом, даже 1 доллар для старта
- Рабочий промпт (промпт, текстовая инструкция для модели), который вы уже используете в продакшне, не тестовый «привет, как дела»
- Python 3.10+ для детектора иероглифов, если работаете с китайскими моделями
- 2 часа на тестирование и один вечер на мониторинг после переключения
Как искать дешёвую модель и не сломать проект?
-
Составьте список бесплатных моделей на OpenRouter. Автор нашёл 17 штук с ценой $0. Из них реально заработали только три: остальные возвращали ошибку
404: No endpoints available, то есть были закрыты политикой данных аккаунта. -
Проверяйте каждую модель на реальном промпте из продакшна. Из трёх работающих бесплатных одна была заточена под код, вторая (
gemma-4) отвечала по 11-21 секунд и через раз возвращала пустой ответ, третья (tencent/hy3) не поддерживалаresponse_formatдля JSON, и OpenRouter молча маршрутизировал мимо неё. -
Посчитайте, укладывается ли модель в таймаут вашего конвейера. Конвейер автора берёт пачку из 60 новостей, таймаут 600 секунд. При 20 секундах на вызов нужно 1200 секунд, конвейер падает. Бесплатные модели не прошли именно по скорости.
-
Найдите платную модель с нужным балансом цены и качества. Автор остановился на
inclusionai/ling-2.6-flash: $0.010 за миллион входных токенов против $0.098 уdeepseek-v4-flash. На реальных промптах обе выдали одинаковую точность (4 из 4 по категориям, 6 из 6 по разбору), но новая модель отвечала за 2.4 секунды вместо 10. -
Обязательно укажите
max_tokensв каждом запросе. Без этого параметра OpenRouter резервирует весь контекст модели. Автор получил ошибку:
402: This request requires more credits. You requested up to 65536 tokens,
but can only afford 1314.
Строчка "max_tokens": 2048 решила проблему полностью.
- Добавьте детектор языковых утечек, если модель не англоязычная. Китайская модель в 17% коротких ответов и в 57% длинных вставляла иероглифы в русский текст. Детектор на регулярном выражении:
import re
_CJK_RE = re.compile(r"[\u2E80-\u303F\u30A0-\u30FF\u4E00-\u9FFF\uFF00-\uFFEF]")
def _has_cjk(*values) -> bool:
return any(_CJK_RE.search(str(v or "")) for v in values)
-
Настройте переспрос на чистой модели. Если детектор находит иероглифы, тот же запрос уходит на
deepseek-v4-flash. Дешёвая модель обслуживает большинство запросов, дорогая подчищает за ней. -
Выстройте цепочку отказоустойчивости. Финальная конфигурация автора:
ling-2.6-flashкак основная,deepseek-v4-flashдля переспросов и страховки,gemma:freeпоследней на случай падения провайдера.
Автор переключил бота на дешёвую модель и в течение часа в ленте появился заголовок: «Как не,让智能手机 перегревать: советы в жару». Иероглифы и полноширинная китайская запятая оказались прямо внутри русского предложения. После добавления детектора и переспроса за первые 10 минут детектор сработал 25 раз, из них 23 на длинных разборах. После этого утечек стало ноль. Итоговый счёт: около $8.6 в месяц вместо $14.8 на чистом deepseek. Экономия скромнее восьмикратной, потому что за 57% длинных разборов приходится платить дважды: сначала дешёвой модели, потом дорогой на переспросе.
Не проверять язык ответа. Автор протестировал точность категорий и полноту JSON, но ему не пришло в голову проверить, что ответ на русский промпт будет на русском. Чем длиннее генерация, тем выше шанс утечки в родной язык модели.
Забыть про баланс. При отрицательном балансе OpenRouter (даже минус 20 центов) перестают работать все модели, включая бесплатные. Платформа резервирует кредит под ответ даже для моделей с ценой $0. Бот автора молча перешёл на локальную эвристику, и все новости полдня лежали в категории «other».
Считать экономию по прайсу, а не по факту. Цена за миллион токенов в 8 раз ниже не значит, что счёт станет в 8 раз меньше. Если больше половины длинных ответов требуют переспроса на дорогой модели, реальная экономия окажется скромнее.
Что делать с этим прямо сейчас?
Авторам Дзена и копирайтерам. Если вы используете ИИ для обработки текстов и платите за API, попробуйте OpenRouter как единую точку входа к разным моделям. Переключиться между моделями можно без переписывания кода, меняется только название модели в запросе. Но обязательно проверяйте ответы на языковые утечки, если модель не обучалась на русском как на основном языке.
Маркетологам. Расходы на LLM масштабируются не с числом клиентов, а с объёмом контента. По данным автора, 30 активных пользователей его бота дают 0.3% расходов, остальное съедает поток новостей. Это значит, что оптимизировать нужно конвейер обработки, а не бояться роста аудитории.
Предпринимателям в РФ и СНГ. OpenRouter доступен из России, оплата через карту. Из российских аналогов для задач категоризации и перевода можно рассмотреть YandexGPT и GigaChat, но у них другая модель ценообразования: не по токенам, а по тарифным планам, и агрегатора с мгновенным переключением между ними пока нет.
Этот кейс ценен не экономией в шесть долларов. Он показывает слепое пятно, которое есть у всех, кто ищет альтернативу ChatGPT или другим дорогим моделям. Мы привыкли тестировать точность, скорость, формат ответа, но язык ответа кажется само собой разумеющимся. Для русскоязычных проектов это не так: большинство открытых моделей (моделей с открытыми весами, доступных для свободного использования) обучены преимущественно на английском и китайском, и при длинной генерации они «забывают» язык промпта. Я бы рекомендовал добавлять проверку языка в тесты любого конвейера, даже если сегодня вы используете модель, которая не утекает. Завтра вы её поменяете, и сюрприз придёт тем же путём.
Честная оговорка: детектор иероглифов решает проблему «китайских» моделей, но аналогичные утечки возможны на арабском, корейском, тайском. Универсального решения пока нет, нужен детектор под каждый случай или проверка языка ответа через отдельный вызов, что съедает часть экономии.
Главный урок из этого кейса укладывается в одну строку: тестируйте не только то, что модель ответила правильно, но и то, что она ответила на правильном языке, и добавьте эту проверку в автотесты до того, как переключите продакшн.
Попробуйте нейросети для Дзена
Подберите модель под свои задачи и протестируйте на реальных текстах
Перейти к инструментам
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Промпты для создания персонажей: двухступенчатая система сохраняет характер после 30+ реплик
Авторы, которые работают с ИИ-персонажами в ролевых проектах или чат-ботах, знают главную боль: через двадцать-тридцать реплик характер «плывёт», и модель…

Машинное обучение (machine learning) это магистратура за год: МАИ сжал программу вдвое
Машинное обучение (machine learning) это область, где технологии устаревают быстрее, чем университеты успевают обновить программу, и МАИ попробовал решить эту…

Искусственный интеллект и светофоры: почему выбор целевой функции важнее алгоритма
Стоп. Заданный H1 и архетип (how-to с пошаговой инструкцией) не совпадают с содержанием оригинала. Оригинал — это аналитическая статья о том, почему…
Комментарии