Игорь Градов
Игорь Градов
5 мин
ai

Что такое ИИ-агент с открытыми весами: Holo4 набрала 61,7% на OSWorld 2.0 при 27 млрд параметров

Holo4 от H Company вышла 12 июня 2025 года как серия агентных моделей с открытыми весами, способных управлять компьютером через любой интерфейс, от кликов по экрану до вызовов API, и конкурирующих с закрытыми моделями при кратно меньших затратах.

Почему это важно

Впервые модель с открытыми весами размером 27 млрд параметров набирает 61,7% на OSWorld 2.0, тогда как закрытые модели с на порядки большим числом параметров стоят в разы дороже за каждую задачу.

ИИ-агент (программа, которая сама выполняет цепочку действий на компьютере без пошагового контроля человека) до сих пор оставался территорией закрытых моделей: Claude, GPT и их аналоги стоят дорого и не позволяют развернуть модель на своём сервере. H Company выпустила Holo4, серию моделей с открытыми весами, и опубликовала все траектории (записи пошаговых действий агента) на Hugging Face. Источник, блог H Company.

Показатель Значение Источник
Размеры моделей 27 млрд параметров (dense) и 35 млрд с 3 млрд активных (MoE) Блог H Company
OSWorld 2.0, Holo4 27B 61,7% Блог H Company
OSWorld 2.0, Holo4 35B-A3B 30,9% Блог H Company
OSWorld 2.0, Opus 5.5 (лидер среди закрытых) 81,8% Блог H Company
Доступ через API H Models API Блог H Company
Форматы весов FP16, FP8, GGUF Блог H Company
Дополнительная модель Holotron4 Nano Блог H Company

Что измеряли?

OSWorld 2.0 и AutomationBench, два академических теста для компьютерных агентов. OSWorld 2.0 проверяет, насколько хорошо модель управляет рабочим столом: открывает приложения, заполняет формы, переключается между окнами. AutomationBench оценивает работу с API, то есть умение вызывать программные интерфейсы напрямую, без экрана.

Стоимость каждого запуска считали по числу входных и выходных токенов (порций текста, на которые модель разбивает информацию). Для Holo4 брали тарифы H Models API, для моделей Qwen, тарифы Alibaba Cloud, для закрытых моделей, данные с официальных таблиц OSWorld 2.0 и публикаций OpenAI.

Что обнаружили?

  • Holo4 27B набрала 61,7% на OSWorld 2.0. Это ниже лидера Opus 5.5 (81,8%), но достигнуто моделью с 27 млрд параметров, то есть на порядки меньше, чем у закрытых конкурентов.
  • Holo4 35B-A3B (MoE) показала 30,9% на OSWorld 2.0. Эта версия использует архитектуру MoE (Mixture of Experts, «смесь экспертов», когда из 35 млрд параметров одновременно работают только 3 млрд), что резко снижает стоимость инференса (вычислений при генерации ответа).
  • Одна модель работает на всех платформах. Holo4 одинаково запускается на десктопе, в браузере, на Android, в песочнице для кода и через бизнес-API. Не нужно выбирать отдельную модель под каждый интерфейс.
  • Все траектории опубликованы. H Company выложила записи каждого шага агента на публичных бенчмарках, их можно воспроизвести на trajectories.hcompany.ai или скачать с Hugging Face.
  • Модель обучена на задачах из Agentic Task Factory. Это внутренний генератор сред и заданий H Company, который создаёт задачи для обучения агента, от 3D-моделирования в FreeCAD до сборки игры в Godot.
Как это читать

Сравнение стоимости между Holo4 и закрытыми моделями неоднородно: для разных моделей использовались разные версии тестовых наборов, разные среды запуска и разные подмножества задач. H Company прямо оговаривает, что результаты Holo4 на закрытой части AutomationBench пока не получены. Кроме того, 61,7% у Holo4 27B против 81,8% у Opus 5.5 означает разрыв в 20 процентных пунктов, и заявление «конкурирует с фронтиром» справедливо только в связке с ценой: по точности модель заметно уступает лидеру.

Что это значит для вас?

Автору Дзена и копирайтеру. Что такое ИИ-агент в практическом смысле: программа, которой можно поручить рутину, собрать данные с нескольких сайтов, заполнить таблицу, подготовить черновик. Holo4 с открытыми весами можно развернуть локально, без подписки и без передачи данных на чужие серверы. Форматы GGUF позволяют запускать модель даже на домашнем компьютере с достаточным объёмом оперативной памяти.

Маркетологу. Стоимость автоматизации задач через ИИ-агентов падает. Если раньше для компьютерного агента требовались дорогие закрытые API, теперь появилась открытая альтернатива, которую можно встроить в свою инфраструктуру и платить только за вычислительные мощности.

Предпринимателю в РФ и СНГ. Holo4 доступна через H Models API и на Hugging Face. В отличие от Claude или GPT, открытые веса означают, что модель можно скачать и развернуть на российском сервере без зависимости от зарубежных сервисов, которые могут ограничить доступ. Из доступных в РФ аналогов агентного направления, YandexGPT и GigaChat, но ни один из них пока не позиционируется как полноценный компьютерный агент с управлением GUI.

Мнение редакции dzen.guru

Holo4 показывает, что разрыв между закрытыми и открытыми моделями в агентных задачах сокращается быстрее, чем мы ожидали. 61,7% против 81,8% у лидера, это ещё не паритет, но при кратной разнице в стоимости для многих бизнес-задач такой точности достаточно. Я вижу главную ценность не в бенчмарках, а в том, что это первая модель с открытыми весами, которая одинаково работает с экраном, кодом и API без переключения между специализированными агентами. Для тех, кто строит автоматизацию в РФ и не хочет зависеть от западных API, Holo4 стоит протестировать уже сейчас, формат GGUF снижает порог входа до обычного рабочего компьютера с 32 ГБ оперативной памяти.

Если вы давно хотели понять, что такое ИИ-агент на практике, а не в теории, скачайте траектории Holo4 с Hugging Face и посмотрите запись реальных сессий: агент строит 3D-модель Эйфелевой башни за 84 шага и 1,3 млн токенов, и каждый шаг можно воспроизвести.

По данным блога H Company

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Anthropic заявила о нуле промпт-инъекций, но через месяц атаки прошли в 60-80% случаев
ai

Anthropic заявила о нуле промпт-инъекций, но через месяц атаки прошли в 60-80% случаев

Anthropic второго августа опубликовала результаты независимого тестирования моделей Claude на устойчивость к промпт-инъекциям (атакам, когда злоумышленник…

4 мин
Малые модели ИИ ошибаются в 94% уверенности: solvi 0.5.0 отдаёт решения коду
ai

Малые модели ИИ ошибаются в 94% уверенности: solvi 0.5.0 отдаёт решения коду

Начну с анализа источника. Это авторский пост создателя открытой Python-библиотеки solvi (версия 0.5.0, лицензия Apache-2.0). Библиотека разделяет работу:…

7 мин
ai

Что такое ИИ-агент, когда он взламывает чужие системы: закон не знает, с кого спросить

ИИ-агенты взламывают чужие системы, а закон не знает, с кого спросить: серия инцидентов с моделями OpenAI, Anthropic и Google обнажила пробелы в…

5 мин