Игорь Градов
Игорь Градов
6 мин
ai

Kimi K3 прошла 204 реальные задачи BitGN: где модель справляется, а где ломается

Доступность, платёжный метод и остатки. Корректно завершённые checkout-цепочки показывают, что K3 выполняет последовательные проверки без пропусков. Однако при наличии нескольких корзин или нестандартных условий (например, промокод с ограничением по категории) система иногда применяет скидку ко всей сумме, а не к указанной позиции.

Kimi K3 прошла 204 реальные задачи BitGN: где модель справляется, а где ломается

Возвраты и 3DS recovery

Возвраты требуют проверки статуса заказа, причины возврата и обновления остатков. В ряде задач K3 корректно обновляла статус заказа, но не возвращала товар на склад, оставляя расхождение в остатках.

3DS recovery — повторная авторизация платежа после сбоя двухфакторной проверки — оказалась наиболее проблемной операцией: система завершала платёж без повторной проверки или создавала дублирующую транзакцию.

Логистика

Задачи на маршруты и доставку выполнялись стабильно при одном адресе. При пакетной доставке с несколькими точками система иногда путала порядок остановок или игнорировала ограничения по весу транспорта.

ECOM1: профиль отказов

Каталог и единичный checkout дают высокий результат. Отказы концентрируются в операциях с побочными эффектами: возврат остатков, каскадное обновление статусов, проверка ограничений промокодов.

Ограничения прогона

Конфигурация контекста, набор доступных команд и правила завершения влияют на результат наравне с качеством модели. Результат описывает поведение всей системы, а не изолированную точность модели.

Каждая трасса доступна для повторной проверки. Классификация отказов основана на содержательных расхождениях, а не на всех случаях несовпадения с эталоном.

Результаты frozen Accuracy (слепой прогон до публикации задач) других систем доступны в таблице BitGN и приведены здесь только как внешний ориентир.

Источник: https://bitgn.com/benchmarks/kimi-k3-pac1-ecom1-204-tasks


Moonshot AI 27 июля опубликовала открытые веса (параметры модели, доступные для скачивания и проверки) Kimi K3 вместе с техническим отчётом, где модель показала конкурентные результаты на задачах с кодом и инструментами, но за итоговыми баллами остался вопрос: какие конкретные операции система доводит до конца, а на каких ломается.

Почему это важно

Команда BitGN прогнала Kimi K3 на 204 реальных рабочих задачах с документами, счетами, каталогами и платежами и выложила все трассы (пошаговые записи каждого действия модели) в открытый доступ, чего почти никогда не делают при стандартном бенчмаркинге.

Результаты BitGN дополняют официальный технический отчёт Moonshot AI конкретикой, которой в нём нет: не «сколько процентов задач решено», а «на каком шаге и почему модель ошиблась». Источник исследования и всех трасс опубликован на сайте BitGN.

Показатель Значение Источник
Результат PAC1 (документооборот) 61 из 104 BitGN, открытые трассы
Результат ECOM1 (e-commerce) 44,75 из 100 (частичный балл) BitGN, открытые трассы
Всего задач 204 BitGN
Точечный поиск PAC1 22 из 24 BitGN
Расчёты по счетам PAC1 18 из 20 BitGN
Дата публикации открытых весов K3 27 июля Moonshot AI

Что именно проверяли?

Стандартные бенчмарки показывают итоговый процент: модель решила столько-то задач из ста. BitGN устроен иначе: каждая задача записывается от первой команды до финального состояния файлов или базы данных, и эту запись (трассу) может прочитать любой.

Kimi K3 прогнали на двух наборах задач.

  • PAC1 имитирует офисное хранилище: карточки сотрудников, проекты, счета, входящие запросы и регламенты. Модель должна находить данные, считать суммы, пакетно менять файлы и останавливаться, если что-то не сходится.
  • ECOM1 имитирует интернет-магазин: каталог товаров, остатки на складе, корзины, платежи, возвраты и доставку. Здесь проверяется не только правильный ответ, но и состояние системы после операции: вернулся ли товар на склад, не задвоился ли платёж.

Выбор BitGN объясняется тремя причинами: условия оценки опубликованы, трассы сохраняются для каждой задачи, а в таблице уже есть слепые прогоны других систем для сравнения.

Где Kimi K3 справляется, а где нет?

Результаты чётко делятся на два слоя: простые операции модель выполняет стабильно, сложные с побочными эффектами проваливаются по определённым паттернам.

Что работает хорошо:

  • Точечный поиск одного значения в файле (дата рождения, статус проекта): 22 из 24 задач. Пример: задача PAC t000 решена за 23,4 секунды, найдена нужная дата в формате DD-MM-YYYY.
  • Расчёты по счетам (суммы, количество позиций): 18 из 20 задач.
  • Поиск конкретного товара в каталоге ECOM1: три из четырёх задач.

Где ломается:

  • Путаница «строка документа» и «позиция счёта». В задаче PAC t074 нужно было посчитать позиции в счёте. Правильный ответ: 2. Kimi K3 вернула 33, посчитав физические строки Markdown-файла вместо элементов счёта. Это не ошибка арифметики, а ошибка понимания структуры документа.
  • Подмена имени поля на «похожее». В пакетных операциях NORA модель создавала поле queue_in_batch_order вместо обязательного queue_order_id. Ошибка воспроизвелась в задачах PAC t067 и PAC t092: семантически близкое название подставляется вместо точного ключа, и пакет не проходит проверку схемы.
  • Нарушение атомарности. В задаче PAC t090 один из пяти указанных файлов не существовал. Регламент требовал остановиться и ничего не менять. Kimi K3 изменила четыре найденных документа, удалила входящий запрос, сообщила об успехе и отдельно упомянула отсутствующий файл. Откат не произведён.
  • Игнорирование блокирующего условия. В задаче PAC t036 модель обнаружила управляющую вставку внутри недоверенного документа, но всё равно создала исходящий файл. Проверка сработала как «заметка», а не как стоп-сигнал.
  • Неполные возвраты в ECOM1. Модель обновляла статус заказа, но не возвращала товар на склад, оставляя расхождение в остатках.
Как это читать

BitGN оценивает не изолированную точность модели, а результат всей системы: модель плюс набор доступных команд, правила завершения и конфигурация контекста. Другая обвязка может дать другой результат на тех же задачах. Частичный балл ECOM1 (44,75) это сумма оценок, а не количество полностью выполненных задач. Классификация отказов включает только содержательные расхождения, служебные несовпадения без влияния на результат не учитывались.

Что делать с этим прямо сейчас?

Автору Дзена и копирайтеру. Открытые трассы BitGN полезны не только разработчикам. Если вы используете ИИ-агент (программу, которая сама выполняет цепочку действий) для работы с документами или таблицами, этот разбор показывает конкретные точки, где модель подставляет «похожее» вместо точного. Практический вывод: при любой пакетной операции с файлами проверяйте имена полей и считайте объекты вручную, не доверяйте итоговому «готово».

Маркетологу. Kimi K3 показывает 90% и выше на поиске и подсчётах, но резко проседает там, где нужна атомарность (всё или ничего) и каскадные обновления. Если вы строите автоматизацию на ИИ-агентах для e-commerce (каталоги, возвраты, промокоды), закладывайте ручную проверку на каждом шаге с побочными эффектами: обновление остатков, применение скидок, возвраты.

Предпринимателю в РФ и СНГ. Kimi K3 доступна как открытая модель (открытые веса можно скачать), но для запуска нужен сервер с мощными видеокартами. Из доступных в РФ аналогов для подобных задач можно рассмотреть YandexGPT и GigaChat, хотя аналогичных открытых трасс по ним пока не публиковалось. Главный вывод для бизнеса: итоговый процент бенчмарка не равен надёжности в вашем рабочем процессе.

Мнение редакции dzen.guru

Ценность этого исследования не в баллах Kimi K3, а в методе. Мы впервые видим 204 полных записи каждого шага модели на рабочих задачах, от чтения файла до записи результата. Обычно бенчмарк выдаёт одну цифру, и ты гадаешь, что за ней стоит. Здесь можно открыть конкретную трассу и увидеть, что модель создала поле с «похожим» названием вместо точного, или сделала четыре изменения из пяти и отрапортовала об успехе. На мой взгляд, именно такой уровень прозрачности нужен рынку, чтобы перестать выбирать модели по рекламным таблицам. Для тех, кто строит автоматизацию на ИИ-агентах, рекомендую изучить сами трассы: это честнее любого обзора, включая этот.

Исследование BitGN с трассами всех 204 задач показывает: Kimi K3 уверенно ищет и считает, но пока не готова к операциям, где одна ошибка ломает весь процесс. Для практиков это означает простое правило: чем больше шагов в цепочке и чем серьёзнее последствия сбоя, тем жёстче нужен человеческий контроль на каждом этапе.

По данным BitGN

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

6 способов снизить расходы на AI агентов: кэш, сжатие и ленивая подгрузка
ai

6 способов снизить расходы на AI агентов: кэш, сжатие и ленивая подгрузка

Компания Anthropic, создатель модели Claude, позволяет кэшировать (запоминать без повторной оплаты) не только системные инструкции, но и саму историю…

5 мин
Claude 3.5 Opus возглавил сводный бенчмарк, обойдя GPT-4.1 и Gemini в логике
ai

Claude 3.5 Opus возглавил сводный бенчмарк, обойдя GPT-4.1 и Gemini в логике

Claude Opus 5 показал лучшие результаты среди всех моделей в задачах на логику, оптимизацию и планирование, по данным сводного бенчмарка Artificial Analysis,…

4 мин
ai

Искусственный интеллект создаёт лекарства быстрее, чем лаборатории успевают их проверить

Компания Cytiva, работающая в сфере биотехнологий, опубликовала обзор того, как искусственный интеллект меняет процесс поиска и проверки новых лекарств, и…

5 мин