Фугу сайбер модель обошла GPT-5.5 и Claude в поиске уязвимостей: разрыв пока узкий
Компания Sakana AI 21 июля 2026 года запустила Fugu Cyber, специализированный на кибербезопасности эндпоинт в своей оркестрационной системе Fugu, и заявила результаты выше, чем у профильных моделей OpenAI и Anthropic.

| Параметр | Данные |
|---|---|
| Компания | Sakana AI |
| Продукт | Fugu Cyber (fugu-cyber-v1.0) |
| Тип | Специализированный эндпоинт оркестратора Fugu |
| Дата запуска | 21 июля 2026 года |
| Цена (вход / выход / кеш) | $6 / $36 / $0,60 за миллион токенов |
| Удвоение цены | При контексте свыше 272 000 токенов |
| Доступ | По заявке, ручная модерация, только Token Plan ($20 / $100 / $200) |
| Ограничения | Недоступен в ЕС и ЕЭЗ |
Оркестратор вместо новой модели
Фугу сайбер модель по сути не является отдельной фронтирной (самой мощной на момент выхода) нейросетью. Это третья точка входа в оркестратор Fugu, который Sakana запустила месяцем ранее. Оркестратор (система-дирижёр, которая сама решает, какой модели поручить какую часть задачи) читает запрос, строит агентную цепочку на лету и распределяет подзадачи между специализированными моделями.
Подход описан в техническом отчёте Fugu и двух статьях на конференции ICLR 2026: TRINITY и Conductor. В TRINITY три роли распределяются между несколькими языковыми моделями: «думатель», «работник» и «верификатор». Conductor учится координировать модели через обучение с подкреплением.
Для кибербезопасности команда Sakana делает акцент на роли верификатора: уязвимость, найденную одним агентом, проверяют специализированные подагенты, прежде чем предлагать патч. Какая именно модель обрабатывает какой шаг, компания не раскрывает.
Что показали бенчмарки?
Sakana заявляет два результата, оба пока не подтверждены независимо:
- CyberGym (бенчмарк Калифорнийского университета в Беркли, 1 507 реальных уязвимостей в 188 проектах OSS-Fuzz): 86,9%. Для сравнения, по данным Sakana, Claude Mythos Preview от Anthropic набрал 83,1%, GPT-5.5-Cyber от OpenAI показал 85,6%. Разрыв составляет от 1,3 до 3,8 процентного пункта.
- CTI-REALM (открытый бенчмарк Microsoft для инженерии детектирования угроз, 37 публичных отчётов): 72,1%. По данным Microsoft, лучшие конфигурации (все на базе Claude) укладывались в диапазон от 62,4% до 68,5%.
Важная оговорка: CTI-REALM оценивает траекторию решения по шкале от 0 до 1, это не процент «прошёл или не прошёл». Sakana тем не менее называет свой результат «процентом успеха», что затрудняет прямое сопоставление.
Контекст тоже существенен: когда CyberGym только появился, лучшая связка агента и модели достигала примерно 20%. Нынешние результаты показывают, насколько быстро специализированные системы прогрессируют, но фугу сайбер модель опережает конкурентов на узкий процент, а не кратно.
Позиция Sakana состоит в том, что способный API в сочетании с экспертизой живых специалистов по безопасности превосходит API, работающий в одиночку. : Sakana AI, официальная позиция компании
Доступ закрыт на четыре замка
Sakana ограничивает доступ к продукту сразу по нескольким направлениям:
- Заявка. Нужно заполнить форму с описанием планируемого использования и верифицированными контактами. Каждую заявку команда проверяет вручную.
- Политика использования. Обновлённая Acceptable Usage Policy запрещает применение в наступательных целях.
- Тарифный план. Оплата только через Token Plan (подписки за $20, $100 или $200 в месяц), которые покрывают Fugu и Fugu-Ultra.
- География. API не предоставляется в ЕС и ЕЭЗ (Европейской экономической зоне), пока компания работает над соответствием GDPR (европейскому регламенту о защите персональных данных).
Цена удваивается на длинном контексте
Тарифы фиксированы: $6 за миллион входных токенов (единиц текста, которыми модель «считает» слова), $36 за выходные, $0,60 за кешированные. Каждая ставка ровно на 20% выше, чем у Fugu-Ultra.
Но при контексте свыше 272 000 токенов все три ставки удваиваются. Для анализа больших кодовых баз, а именно это основной сценарий в кибербезопасности, порог в 272K пересекается легко. Это не крайний случай, а штатный режим, и бюджет на длинные сессии нужно закладывать с запасом.
Sakana показала, что оркестрационный подход (когда одна система координирует несколько моделей) способен конкурировать с фронтирными моделями OpenAI и Anthropic в узкой, но критичной области. Если результаты подтвердятся независимо, это усилит давление на крупных игроков и может сдвинуть цены на специализированные ИИ-сервисы вниз. Для авторов контента, работающих с техническими темами, появляется ещё один инструмент, который стоит отслеживать.
Что это значит для вас?
Разработчику в РФ и СНГ. Прямого доступа из России к API Fugu Cyber на момент запуска нет, как и из ЕЭЗ. Удвоение цены свыше 272K токенов критично, если вы работаете с большими репозиториями: один прогон по кодовой базе среднего проекта может обойтись вдвое дороже ожидаемого. Учитывайте это при оценке бюджетов, когда (и если) доступ откроется.
Автору Дзена, пишущему о технологиях. Тема оркестрации моделей набирает вес. Объяснять её аудитории стоит через аналогию с дирижёром: одна система раздаёт партии, каждая модель играет свою роль. Это понятнее, чем «агентная цепочка».
Маркетологу и предпринимателю. Пока продукт закрыт заявкой и географическими ограничениями, практических действий немного. Но сам факт, что небольшая компания (Sakana AI, основанная бывшими исследователями Google) конкурирует по бенчмаркам с OpenAI и Anthropic, означает рост предложения на рынке ИИ для безопасности. Из доступных в РФ инструментов для анализа кода стоит смотреть на GigaCode от Сбера и решения от Positive Technologies.
Результаты Sakana пока самодекларированные и не воспроизведены независимо. Разрыв с GPT-5.5-Cyber составляет 1,3 процентного пункта, это статистически хрупкое преимущество. Оркестрационный подход перспективен, но непрозрачность маршрутизации (вы не знаете, какая модель обработала ваш запрос) создаёт риск для аудита безопасности, а ведь именно аудит и есть целевой сценарий. Удвоение цен на длинном контексте выглядит как сознательное решение: Sakana понимает, что кибербезопасность требует длинных сессий, и закладывает маржу именно туда. Для российского рынка пока это новость для наблюдения, не для действия.
Практический шаг прямо сейчас: если вы работаете с ИИ в области безопасности кода, сохраните бенчмарки CyberGym и CTI-REALM как ориентир для оценки любых моделей, включая российские, и не принимайте самодекларированные проценты за факт, пока их не воспроизведёт кто-то кроме разработчика.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Искусственный интеллект для решения физических задач
Нейросети уже решают задачи по физике быстрее репетитора, но только если правильно составить промпт (запрос к модели) и понимать, где машина врёт, а результат…

Смартфон как прибор для обнаружения дронов: архитектура «Булат» и её реальные ограничения
Смартфон как распределённый сенсор для обнаружения БПЛА: идея, архитектура и реальные ограничения краудсенсинга Концепция превращения обычных смартфонов в узлы…

Карточки Брайана Ино 1975 года стали нейросетью для создания музыки и продуктовых решений
Сервис Deframe берёт колоду провокационных карточек Брайана Ино 1975 года и с помощью нейросети DeepSeek превращает их в конкретные ходы для продуктовых…
Комментарии