Kimi K3 прошла 204 реальные задачи BitGN: где модель справляется, а где ломается
Доступность, платёжный метод и остатки. Корректно завершённые checkout-цепочки показывают, что K3 выполняет последовательные проверки без пропусков. Однако при наличии нескольких корзин или нестандартных условий (например, промокод с ограничением по категории) система иногда применяет скидку ко всей сумме, а не к указанной позиции.

Возвраты и 3DS recovery
Возвраты требуют проверки статуса заказа, причины возврата и обновления остатков. В ряде задач K3 корректно обновляла статус заказа, но не возвращала товар на склад, оставляя расхождение в остатках.
3DS recovery — повторная авторизация платежа после сбоя двухфакторной проверки — оказалась наиболее проблемной операцией: система завершала платёж без повторной проверки или создавала дублирующую транзакцию.
Логистика
Задачи на маршруты и доставку выполнялись стабильно при одном адресе. При пакетной доставке с несколькими точками система иногда путала порядок остановок или игнорировала ограничения по весу транспорта.
ECOM1: профиль отказов
Каталог и единичный checkout дают высокий результат. Отказы концентрируются в операциях с побочными эффектами: возврат остатков, каскадное обновление статусов, проверка ограничений промокодов.
Ограничения прогона
Конфигурация контекста, набор доступных команд и правила завершения влияют на результат наравне с качеством модели. Результат описывает поведение всей системы, а не изолированную точность модели.
Каждая трасса доступна для повторной проверки. Классификация отказов основана на содержательных расхождениях, а не на всех случаях несовпадения с эталоном.
Результаты frozen Accuracy (слепой прогон до публикации задач) других систем доступны в таблице BitGN и приведены здесь только как внешний ориентир.
Источник: https://bitgn.com/benchmarks/kimi-k3-pac1-ecom1-204-tasks
Moonshot AI 27 июля опубликовала открытые веса (параметры модели, доступные для скачивания и проверки) Kimi K3 вместе с техническим отчётом, где модель показала конкурентные результаты на задачах с кодом и инструментами, но за итоговыми баллами остался вопрос: какие конкретные операции система доводит до конца, а на каких ломается.
Команда BitGN прогнала Kimi K3 на 204 реальных рабочих задачах с документами, счетами, каталогами и платежами и выложила все трассы (пошаговые записи каждого действия модели) в открытый доступ, чего почти никогда не делают при стандартном бенчмаркинге.
Результаты BitGN дополняют официальный технический отчёт Moonshot AI конкретикой, которой в нём нет: не «сколько процентов задач решено», а «на каком шаге и почему модель ошиблась». Источник исследования и всех трасс опубликован на сайте BitGN.
| Показатель | Значение | Источник |
|---|---|---|
| Результат PAC1 (документооборот) | 61 из 104 | BitGN, открытые трассы |
| Результат ECOM1 (e-commerce) | 44,75 из 100 (частичный балл) | BitGN, открытые трассы |
| Всего задач | 204 | BitGN |
| Точечный поиск PAC1 | 22 из 24 | BitGN |
| Расчёты по счетам PAC1 | 18 из 20 | BitGN |
| Дата публикации открытых весов K3 | 27 июля | Moonshot AI |
Что именно проверяли?
Стандартные бенчмарки показывают итоговый процент: модель решила столько-то задач из ста. BitGN устроен иначе: каждая задача записывается от первой команды до финального состояния файлов или базы данных, и эту запись (трассу) может прочитать любой.
Kimi K3 прогнали на двух наборах задач.
- PAC1 имитирует офисное хранилище: карточки сотрудников, проекты, счета, входящие запросы и регламенты. Модель должна находить данные, считать суммы, пакетно менять файлы и останавливаться, если что-то не сходится.
- ECOM1 имитирует интернет-магазин: каталог товаров, остатки на складе, корзины, платежи, возвраты и доставку. Здесь проверяется не только правильный ответ, но и состояние системы после операции: вернулся ли товар на склад, не задвоился ли платёж.
Выбор BitGN объясняется тремя причинами: условия оценки опубликованы, трассы сохраняются для каждой задачи, а в таблице уже есть слепые прогоны других систем для сравнения.
Где Kimi K3 справляется, а где нет?
Результаты чётко делятся на два слоя: простые операции модель выполняет стабильно, сложные с побочными эффектами проваливаются по определённым паттернам.
Что работает хорошо:
- Точечный поиск одного значения в файле (дата рождения, статус проекта): 22 из 24 задач. Пример: задача PAC t000 решена за 23,4 секунды, найдена нужная дата в формате DD-MM-YYYY.
- Расчёты по счетам (суммы, количество позиций): 18 из 20 задач.
- Поиск конкретного товара в каталоге ECOM1: три из четырёх задач.
Где ломается:
- Путаница «строка документа» и «позиция счёта». В задаче PAC t074 нужно было посчитать позиции в счёте. Правильный ответ: 2. Kimi K3 вернула 33, посчитав физические строки Markdown-файла вместо элементов счёта. Это не ошибка арифметики, а ошибка понимания структуры документа.
- Подмена имени поля на «похожее». В пакетных операциях NORA модель создавала поле queue_in_batch_order вместо обязательного queue_order_id. Ошибка воспроизвелась в задачах PAC t067 и PAC t092: семантически близкое название подставляется вместо точного ключа, и пакет не проходит проверку схемы.
- Нарушение атомарности. В задаче PAC t090 один из пяти указанных файлов не существовал. Регламент требовал остановиться и ничего не менять. Kimi K3 изменила четыре найденных документа, удалила входящий запрос, сообщила об успехе и отдельно упомянула отсутствующий файл. Откат не произведён.
- Игнорирование блокирующего условия. В задаче PAC t036 модель обнаружила управляющую вставку внутри недоверенного документа, но всё равно создала исходящий файл. Проверка сработала как «заметка», а не как стоп-сигнал.
- Неполные возвраты в ECOM1. Модель обновляла статус заказа, но не возвращала товар на склад, оставляя расхождение в остатках.
BitGN оценивает не изолированную точность модели, а результат всей системы: модель плюс набор доступных команд, правила завершения и конфигурация контекста. Другая обвязка может дать другой результат на тех же задачах. Частичный балл ECOM1 (44,75) это сумма оценок, а не количество полностью выполненных задач. Классификация отказов включает только содержательные расхождения, служебные несовпадения без влияния на результат не учитывались.
Что делать с этим прямо сейчас?
Автору Дзена и копирайтеру. Открытые трассы BitGN полезны не только разработчикам. Если вы используете ИИ-агент (программу, которая сама выполняет цепочку действий) для работы с документами или таблицами, этот разбор показывает конкретные точки, где модель подставляет «похожее» вместо точного. Практический вывод: при любой пакетной операции с файлами проверяйте имена полей и считайте объекты вручную, не доверяйте итоговому «готово».
Маркетологу. Kimi K3 показывает 90% и выше на поиске и подсчётах, но резко проседает там, где нужна атомарность (всё или ничего) и каскадные обновления. Если вы строите автоматизацию на ИИ-агентах для e-commerce (каталоги, возвраты, промокоды), закладывайте ручную проверку на каждом шаге с побочными эффектами: обновление остатков, применение скидок, возвраты.
Предпринимателю в РФ и СНГ. Kimi K3 доступна как открытая модель (открытые веса можно скачать), но для запуска нужен сервер с мощными видеокартами. Из доступных в РФ аналогов для подобных задач можно рассмотреть YandexGPT и GigaChat, хотя аналогичных открытых трасс по ним пока не публиковалось. Главный вывод для бизнеса: итоговый процент бенчмарка не равен надёжности в вашем рабочем процессе.
Ценность этого исследования не в баллах Kimi K3, а в методе. Мы впервые видим 204 полных записи каждого шага модели на рабочих задачах, от чтения файла до записи результата. Обычно бенчмарк выдаёт одну цифру, и ты гадаешь, что за ней стоит. Здесь можно открыть конкретную трассу и увидеть, что модель создала поле с «похожим» названием вместо точного, или сделала четыре изменения из пяти и отрапортовала об успехе. На мой взгляд, именно такой уровень прозрачности нужен рынку, чтобы перестать выбирать модели по рекламным таблицам. Для тех, кто строит автоматизацию на ИИ-агентах, рекомендую изучить сами трассы: это честнее любого обзора, включая этот.
Исследование BitGN с трассами всех 204 задач показывает: Kimi K3 уверенно ищет и считает, но пока не готова к операциям, где одна ошибка ломает весь процесс. Для практиков это означает простое правило: чем больше шагов в цепочке и чем серьёзнее последствия сбоя, тем жёстче нужен человеческий контроль на каждом этапе.
По данным BitGN

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

6 способов снизить расходы на AI агентов: кэш, сжатие и ленивая подгрузка
Компания Anthropic, создатель модели Claude, позволяет кэшировать (запоминать без повторной оплаты) не только системные инструкции, но и саму историю…

Claude 3.5 Opus возглавил сводный бенчмарк, обойдя GPT-4.1 и Gemini в логике
Claude Opus 5 показал лучшие результаты среди всех моделей в задачах на логику, оптимизацию и планирование, по данным сводного бенчмарка Artificial Analysis,…
Искусственный интеллект создаёт лекарства быстрее, чем лаборатории успевают их проверить
Компания Cytiva, работающая в сфере биотехнологий, опубликовала обзор того, как искусственный интеллект меняет процесс поиска и проверки новых лекарств, и…
Комментарии