Игорь Градов
Игорь Градов
5 мин
ai

Нейросеть для тестирования классификации: Jev в 5 раз дешевле GPT, но ошибается тише

Почему это важно Независимое тестирование 160 тысяч запросов к нейросети Jev показало: она классифицирует текст на уровне gpt-4.1-mini, но ошибается «тихо», с…

Нейросеть для тестирования классификации: Jev в 5 раз дешевле GPT, но ошибается тише
Почему это важно

Независимое тестирование 160 тысяч запросов к нейросети Jev показало: она классифицирует текст на уровне gpt-4.1-mini, но ошибается «тихо», с низкой уверенностью, тогда как GPT ошибается «громко», и это критично для любого, кто строит автоматическую обработку текстов.

Разработчик из российского сообщества с 19 по 30 сентября 2026 года провёл 22 эксперимента и отправил около 160 тысяч запросов к модели jev-1.13.0 и контрольным моделям OpenAI, чтобы найти практические границы нейросети Jev, специализированной модели для классификации текста. Результаты он опубликовал на Хабре, и они важны для всех, кто подбирает нейросеть для тестирования задач классификации в продакшене.

Jev не генерирует текст, как ChatGPT или YandexGPT. Она принимает текст и набор вопросов к нему, а возвращает ответ с распределением вероятностей. Три типа вопросов: выбор из списка, оценка по шкале и «да/нет». Вся «настройка» сводится к описанию классов на естественном языке, без дообучения (fine-tuning, обучения модели на ваших примерах под узкую задачу).

Всё тестирование обошлось автору примерно в 18 долларов через API (программный интерфейс) раннего доступа.

Что Когда Кто выпустил Цена
jev-1.13.0, модель классификации текста (не генеративная) Тестирование: 19–30 сентября 2026 Typesafe AI $0,042 за миллион входных токенов, выход бесплатен

Что показали 22 эксперимента?

  • Точность на уровне gpt-4.1-mini. Если обеим моделям дать только описания классов, результат сопоставим, но Jev в 2,4 раза быстрее и в 5 раз дешевле.
  • Калибровка уверенности принципиально другая. 83% ошибок gpt-4.1-mini сделаны с уверенностью (confidence, числовая оценка от 0 до 1, насколько модель «уверена» в ответе) выше 0,9. У Jev при том же пороге только 29% ошибок. Это значит, что автоматический фильтр «не пропускай ответы с низкой уверенностью» у Jev работает, а у GPT почти бесполезен.
  • Порог уверенности нельзя переносить между схемами. Добавили новых классов, тот же порог начинает пропускать больше ошибок. Каждую схему нужно калибровать заново.
  • 40 вопросов к одному тексту обрабатываются почти за время одного и обходятся до 86% дешевле, чем по одному.
  • Качество описаний классов важнее выбора модели. С хорошими описаниями название метки почти не влияет на точность. Без них название решает всё.
  • Русский текст втрое дороже английского по токенам. Токены (единицы текста, за которые платишь) у Jev считаются иначе, чем у LLM (больших языковых моделей): один и тот же запрос «весит» вдвое больше токенов, чем у GPT.
  • Посторонний текст вредит сразу, а не только у границы контекстного окна. Jev чувствительнее к «мусору» на входе, чем GPT.
  • Цитата письма в мусоре опаснее случайного шума: она тянет ответы в «почтовый» класс. Явный класс «other» (прочее) в разы надёжнее порога для фильтрации чужого входа.
  • С несколькими сотнями размеченных примеров (около 16 на класс) обычный обученный классификатор догоняет Jev по точности.

Как попробовать Jev самостоятельно?

  1. Зарегистрируйтесь на сайте Typesafe AI и получите API-ключ раннего доступа.
  2. Отправьте тестовый запрос через API: передайте текст в поле state, опишите классы на естественном языке в поле questions и укажите модель jev-1.13.0.
  3. Проанализируйте ответ: модель вернёт выбранный вариант, уверенность (confidence) и распределение вероятностей по всем вариантам.
  4. Перед интеграцией в продакшен откалибруйте порог уверенности именно на вашей схеме классов: автор тестирования подтвердил, что готовый порог между задачами не переносится.

Jev и российские аналоги: что учесть?

Jev решает узкую задачу: классификация текста, а не генерация. В России генеративные модели YandexGPT и GigaChat тоже умеют классифицировать, но они делают это «через генерацию»: вы просите модель назвать категорию, она формирует текстовый ответ.

Для нейросетей для тестирования программного обеспечения и автоматической маршрутизации обращений разница существенная: Jev возвращает числовую уверенность, по которой можно строить автоматический роутинг (направление запроса нужному специалисту или боту). GPT и российские аналоги такой встроенной калибровки не дают, порог приходится подбирать по доле трафика, а не по значению.

Главное ограничение для локальной интеграции: русский текст обходится в Jev втрое дороже английского по токенам. Если ваша задача целиком на русском языке, экономическое преимущество «в 5 раз дешевле GPT» может сократиться до полутора раз или исчезнуть.

Мнение редакции dzen.guru

Результаты этого тестирования, пожалуй, самое подробное независимое сравнение Jev с GPT-моделями, которое я видел на русском языке. Автор не рекламирует продукт: он честно показывает, что при 16 размеченных примерах на класс обычный классификатор догоняет Jev. Для меня главная находка в другом: разница в калибровке уверенности. Если вы строите автоматическую обработку обращений или сортировку контента и хотите, чтобы «сомнительные» ответы уходили на ручную проверку, у Jev это работает из коробки, а у GPT, по данным автора, 83% ошибок выглядят как уверенные ответы, и фильтр бесполезен.

Оговорка: все цифры привязаны к версии jev-1.13.0 и к конкретным датам замеров. Модель в раннем доступе, API может измениться. Русский язык втрое дороже по токенам, и это нужно считать до интеграции, а не после.

Что сделать сегодня: если вы автор Дзена и автоматически сортируете комментарии или входящие заявки, попробуйте отправить десяток тестовых запросов на русском и сравните стоимость с вашим текущим решением. Именно цена на русском тексте покажет, есть ли смысл переходить.

Частые вопросы

Jev заменяет ChatGPT или YandexGPT?

Нет. Jev не генерирует текст. Она классифицирует: определяет категорию, оценивает по шкале или отвечает «да/нет» с числовой уверенностью. Для написания статей, ответов клиентам или генерации контента она не подходит. Её задача, автоматическая сортировка и маршрутизация.

Почему русский текст дороже?

Токенизатор Jev (механизм разбиения текста на единицы оплаты) устроен иначе, чем у LLM. Один и тот же запрос на русском «весит» втрое больше токенов, чем на английском. Автор тестирования подтвердил это прямыми замерами. При интеграции в российские системы это главная статья расходов, которую нужно считать заранее.

Можно ли доверять уверенности модели для автоматических решений?

Да, но с оговоркой: порог уверенности нужно калибровать под каждую конкретную схему классов. Добавили новый класс, перекалибруйте. Перенесли порог из одной задачи в другую без проверки, получите больше пропущенных ошибок. Именно это тестирование показало как сильную сторону Jev (ошибки с низкой уверенностью легко отсеять), так и обязательное условие: ручная настройка порога под вашу задачу.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Google отправила свой ИИ-чип на орбиту: космические дата-центры потребуют 1800 запусков Starship
ai

Google отправила свой ИИ-чип на орбиту: космические дата-центры потребуют 1800 запусков Starship

Google впервые отправила свой серверный чип в космос на борту ракеты SpaceX, запущенной из Калифорнии 5 июня, и начала практическую проверку идеи космических…

5 мин
Нейросеть «Амазон» не пишет, а решает: модель на 2B параметров работает на ноутбуке бесплатно
ai

Нейросеть «Амазон» не пишет, а решает: модель на 2B параметров работает на ноутбуке бесплатно

Почему это важно Amazon выложила в открытый доступ компактную модель для принятия решений, которая работает локально и стоит в разы дешевле полноценных…

5 мин
ai

Суд отклонил иски к Google: антитраст не защитит издателей от ИИ-обзоров

Google платит издателям, но суд решил: ожидание трафика не равно договору, и антимонопольное право тут бессильно. Почему это важно Федеральный суд США впервые…

5 мин