ByteDance открыла EdgeBench: 51 задача и 6 временных окон для оценки AI агентов
Я вижу, что оригинал — это технический туториал по работе с бенчмарком EdgeBench, а не новость о раунде финансирования. В источнике нет данных о сделке, инвестициях, суммах или инвесторах. Архетип «funding» не соответствует содержанию оригинала. Пишу новость строго по фактам из источника — как практический разбор бенчмарка EdgeBench для оценки ИИ-агентов.

ByteDance открыла бенчмарк EdgeBench для оценки ИИ-агентов: 51 задача, пять моделей и код на Python, который можно запустить прямо сейчас.
Впервые появился публичный набор данных с разбивкой по временным бюджетам от 2 до 12 минут, который позволяет сравнивать скорость и точность ИИ-агентов на одних и тех же задачах, включая китайские модели GLM-5.1 и DS-V4-Pro наравне с западными.
Компания ByteDance выложила на Hugging Face датасет EdgeBench — бенчмарк (набор стандартизированных тестов) для оценки продвинутых ИИ-агентов (AI agents), программ, которые сами выполняют задачи без пошагового управления человеком. До сих пор большинство бенчмарков измеряли только финальный результат, а EdgeBench добавляет к оценке время: сколько минут агенту дали на взаимодействие, и как это повлияло на качество ответа. Разбор опубликован как туториал с полным кодом на Python, что редкость для подобных исследований.
51 задача в шести временных окнах
EdgeBench содержит 51 задачу, распределённую по нескольким категориям. Каждая задача описана JSON-файлом, в котором зафиксированы:
- категория задачи (от программирования до работы с интерфейсами)
- среда выполнения (base_image — контейнер, в котором запускается агент)
- необходимость интернета (часть задач требует доступа к сети)
- логика оценки (parser, rescale — как «сырой» результат превращается в нормализованный балл)
- игровой режим (game_mode — отдельная группа интерактивных задач)
Пять моделей проходят каждую задачу при шести временных бюджетах: 2, 4, 6, 8, 10 и 12 минут. В списке участников — Claude Opus 4.8, GPT-5.5, GPT-5.4, а также две модели из Китая: GLM-5.1 и DS-V4-Pro. Результаты зашиты прямо в README репозитория в виде Markdown-таблиц.
Как устроен анализ: от скачивания до кривых масштабирования?
Туториал выстроен как пошаговый конвейер. Сначала датасет скачивается через библиотеку huggingface_hub одной командой. Затем каждый JSON-файл задачи разбирается в плоскую таблицу, где видны параметры оценки.
Лидерборд (таблица результатов) извлекается парсингом README-файла. Имена моделей стандартизируются функцией canon_model, чтобы «opus», «deepseek» и другие варианты написания приводились к единому виду.
Дальше данные перестраиваются в «длинный» формат: одна строка — одна модель, одна задача, один временной бюджет. Это позволяет сравнивать результаты напрямую.
Финальный этап — подгонка лог-сигмоидных кривых масштабирования (log-sigmoid scaling curves). Проще говоря, исследователи проверяют, как растёт качество ответов агента, когда ему дают больше времени, и где эта кривая выходит на плато: дополнительные минуты перестают помогать.
Функции SForge rescale: зачем нормализовать «сырые» баллы?
Разные задачи оцениваются по-разному: где-то судья проверяет файл, где-то — интерактивный результат. SForge rescale — набор функций, которые переводят «сырую» оценку в нормализованный балл от 0 до 1. Без этого нельзя корректно сравнивать задачу, где максимум — 100 очков, с задачей, где максимум — 3.
В спецификации каждой задачи указан тип rescale (вид нормализации) и направление оценки (score_direction): выше — лучше или наоборот. Туториал показывает, как извлечь эти параметры и применить к результатам.
Что с этого вам по ролям?
Разработчику и тестировщику моделей. Код из туториала запускается «как есть» в Google Colab или Jupyter. Если вы тестируете отечественные модели — GLM-5.1 и DS-V4-Pro уже включены в лидерборд, можно добавить свою модель по аналогии и получить сравнение на тех же 51 задаче. Это экономит недели на создание собственного бенчмарка.
Автору Дзена и контент-маркетологу. Когда пишете обзор «какой ИИ-агент лучше», EdgeBench даёт проверяемые цифры вместо субъективных впечатлений. Ссылка на конкретную задачу и временной бюджет убедительнее, чем «я попробовал и мне понравилось».
Предпринимателю в РФ и СНГ. Бенчмарк показывает, что агенту не всегда нужно 12 минут: на части задач результат выходит на плато уже при 4 минутах. Для бизнеса это прямая экономия на инференсе (вычислениях при генерации ответа), если вы платите за время работы API.
Чем больше времени мы даём агенту, тем выше качество, но рост замедляется: лог-сигмоидная кривая выходит на плато, и дополнительные минуты перестают окупаться. : Из описания методологии EdgeBench, репозиторий ByteDance-Seed
Я считаю, что главная ценность EdgeBench не в самих цифрах, а в идее мерить агентов по «бюджету времени». До сих пор сравнения моделей выглядели как: «на этом тесте модель A набрала 87, а модель B — 82». EdgeBench спрашивает иначе: «а если дать агенту вдвое меньше времени, кто деградирует сильнее?» Для практика это полезнее, потому что в реальных задачах время почти всегда ограничено. Оговорка: 51 задача — это пока немного, и категории покрывают не все сценарии, с которыми сталкивается бизнес. Однако код открыт, и добавить свои задачи технически несложно.
Бенчмарк пока не покрывает русскоязычные задачи и сценарии, специфичные для российского рынка. Результаты GLM-5.1 и DS-V4-Pro получены на англоязычных заданиях, и перенос выводов на русский язык некорректен без отдельной проверки.
Если вы тестируете ИИ-агентов для своего продукта, скачайте репозиторий ByteDance-Seed/EdgeBench, запустите первый блок кода и посмотрите, как ваша модель ведёт себя при бюджете в 2 минуты, именно там видна разница между агентом, который действительно думает, и тем, который просто тратит токены.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Обучение нейросети на своих данных: как превратить LLM из генератора текста в чат-бота
Автор серии статей на Хабре показал по шагам, как взять уже обученную языковую модель и научить её отвечать на вопросы вместо бессвязного продолжения текста,…

Использование ИИ в медицине за $300: российский разработчик собрал диагностику рентгена в одиночку
Компания Microsoft Research выложила в открытый доступ специализированный кодировщик RAD-DINO-MAIRA-2, обученный именно на медицинских рентгеновских снимках, а…

MCP-протокол вместо GUI: Selectel показал, как заменить меню одним вопросом
MCP протокол (Model Context Protocol, открытый стандарт связи между ИИ-моделями и внешними сервисами) уже сегодня позволяет заменить блуждание по меню и…
Комментарии