Open source языковые модели отстают от закрытых уже на 4 месяца: разрыв растёт
Компания Epoch AI, занимающаяся аналитикой прогресса в области искусственного интеллекта, опубликовала данные сводного индекса возможностей ECI (Epoch Capability Index) за период с января по конец мая 2026 года, и главный вывод оказался контринтуитивным: открытые модели не догоняют закрытые, а отстают всё больше.
Бенчмарки создают иллюзию паритета, но по агрегированному индексу разрыв между лучшими открытыми и закрытыми моделями вырос с трёх месяцев до четырёх, а при строгом пересчёте может достигать полугода, и для задач сложнее классификации это критично.
Тезис «открытые модели догнали закрытые» звучит в профессиональных чатах почти каждую неделю: с апреля по август 2026 года вышли DeepSeek V4, Kimi K3, GLM-5.3, а Meta вернулась к публикации весов с моделью Muse Glimmer. Сергей Прощаев, Tech Lead в финтехе и преподаватель в ОТУС, проверил этот тезис по четырём направлениям и пришёл к выводу, который стоит учитывать до принятия решения о миграции на опенсорс.
| Показатель | Значение | Источник |
|---|---|---|
| Средний разрыв open-weight и закрытого фронтира (январь — май 2026) | около 4 месяцев (~8 пунктов ECI) | Epoch AI, сводный индекс ECI |
| Разрыв за предыдущий период (2023 — октябрь 2025) | около 3 месяцев | Epoch AI |
| Разрыв при строгом критерии сравнения | до ~6 месяцев | Epoch AI (оговорка авторов) |
| Экспертная оценка после выхода Kimi K3 | ~3–5 месяцев | Натан Ламберт (интерпретация, не независимое измерение) |
| Доля китайских open-weight моделей в токенах OpenRouter (к маю 2026) | около 61 % | Анализ данных OpenRouter |
| DeepSeek V4 Pro: общее / активные параметры | 1,6 трлн / 49 млрд | DeepSeek (релиз 24 апреля 2026) |
| Kimi K3: общее / активные параметры | 2,8 трлн / 104 млрд | Moonshot AI (релиз 16 июля 2026) |
| Meta Muse Glimmer: параметры / лицензия | 30 млрд / Apache 2.0 | Meta (релиз 10 августа 2026) |
Что именно измеряли?
Epoch AI рассчитывает сводный индекс возможностей ECI (Epoch Capability Index). Это не один бенчмарк, а агрегат по множеству тестов, что-то вроде «среднего балла по всем экзаменам» вместо оценки по одному предмету.
Логика простая: берут лучшую открытую модель (модель с открытыми весами, то есть её можно скачать и запустить у себя) и лучшую закрытую модель (доступна только через платный API, то есть через интерфейс, куда отправляешь запрос и получаешь ответ), сравнивают их баллы по индексу и переводят разницу во время. Четыре месяца означает: лучшая открытая модель сегодня примерно на уровне лучшей закрытой модели четырёхмесячной давности.
Сергей Прощаев дополнил эти данные собственным производственным опытом, проверкой лицензий и анализом цен, чтобы понять, что стоит за абстрактными пунктами индекса.
Три вывода, которые ломают простую картину
-
Разрыв не сократился, а вырос. За период 2023 — октябрь 2025 он составлял около трёх месяцев по данным Epoch AI. К маю 2026 он увеличился до четырёх месяцев. Сами авторы предупреждают: открытые модели активно «натаскиваются» под публичные тесты, а закрытые лаборатории держат лучшие системы при себе, поэтому реальный разрыв может достигать полугода.
-
Средний разрыв ничего не говорит о конкретной задаче. По опыту автора, одна и та же открытая модель показала результат, неотличимый от закрытого флагмана на классификации обращений (около двадцати категорий, короткие тексты), и тут же провалилась на генерации объяснений: уверенно ссылалась на внутренние правила, которых не было в контексте. Это галлюцинация (когда модель уверенно выдумывает факты, которых нет), и на коротких задачах она почти не проявлялась, а на длинных агентных цепочках (многошаговых сценариях, где ИИ-агент сам принимает решения) становилась критичной.
-
Китайские модели доминируют в опенсорсе. По данным OpenRouter (маршрутизатор запросов к разным моделям), к маю 2026 года на китайские open-weight модели приходилось около 61 % потреблённых токенов (токен — единица текста, которую обрабатывает модель). Это статистика одной платформы, а не всего рынка, но она показывает: выбирая сильную открытую модель, вы почти наверняка выбираете китайское семейство, и к оценке качества добавляется проверка лицензии и требований вашей службы безопасности.
Индекс ECI агрегирует множество бенчмарков, но бенчмарки сами по себе не равны продакшену: модель может набирать высокий балл на тестах и проваливаться на реальных задачах. Обновлённого пересчёта с учётом летних релизов (DeepSeek V4, Kimi K3, GLM-5.3) у Epoch AI на момент публикации нет. Оценка Натана Ламберта (3–5 месяцев после Kimi K3) — экспертная интерпретация, а не независимое измерение по методике Epoch. Данные OpenRouter отражают трафик одного маршрутизатора, не всего рынка. Производственный опыт автора относится к финтех-сценариям и не переносится напрямую на другие отрасли.
Что делать с этим прямо сейчас?
Авторам Дзена и копирайтерам. Если вы используете открытую модель для генерации текстов, на коротких задачах (заголовки, описания, классификация тем) разница с закрытыми флагманами может быть незаметна. Но для длинных материалов, где важна фактическая точность, проверяйте каждый факт вручную: именно на длинных цепочках открытые модели чаще галлюцинируют.
Маркетологам. Аргумент «зачем платить в десятки раз больше за закрытую модель» звучит убедительно на совещании, но четыре-шесть месяцев отставания означают: ваш чат-бот на открытой модели сегодня работает на уровне закрытого флагмана весны. Для стандартных сценариев (FAQ, маршрутизация обращений) это допустимо. Для сложной аналитики и агентных сценариев — проверяйте на своих данных, а не на бенчмарках.
Предпринимателям в РФ и СНГ. Закрытые модели от OpenAI и Anthropic в России доступны с ограничениями. Из доступных аналогов — YandexGPT и GigaChat. Открытые модели (DeepSeek, Kimi, GLM) можно развернуть внутри своего контура, но учитывайте два фактора: китайские лицензии нужно проверять с юристами, а для запуска крупных моделей вроде Kimi K3 (2,8 трлн параметров) потребуется серьёзное железо. Meta Muse Glimmer на 30 млрд параметров под Apache 2.0 запускается на одной потребительской видеокарте, и это пока редкое исключение.
Я вижу, как каждый месяц в чатах появляются скриншоты «открытая модель почти догнала». По моим наблюдениям, «почти» — ключевое слово: на простых задачах разницы действительно нет, а вот на том, за что бизнес платит больше всего (длинные рассуждения, работа с контекстом, агентные сценарии), закрытые модели пока впереди, и этот разрыв по данным Epoch AI не сокращается. Перед миграцией на опенсорс проверяйте не бенчмарк, а свою конкретную задачу на своих данных. Бенчмарк — это экзамен, а продакшен — это работа, и между ними бывает пропасть.
Четыре месяца разрыва звучат как «почти ничего», пока не вспомнишь, что четыре месяца назад ваша закрытая модель тоже не справлялась с тем, что вы хотите от неё сегодня.
По данным Хабр (Сергей Прощаев)

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
YouTube 2026: ИИ-редактор Shorts и автодубляж стримов открывают авторам иноязычную аудиторию
YouTube второго июня провёл ежегодную конференцию Made On YouTube 2026 и показал набор ИИ-инструментов для авторов, зрителей и стримеров, среди которых…
Gemini TTS генерирует голос по промпту: 2 000+ голосов, 100+ языков, первое место в бенчмарках
Google выпустила две модели синтеза речи: Gemini 3.8 Flash TTS для озвучки персонажей и креативных проектов и Gemini 3.8 Flash-Lite TTS для массового…

Prompt injection это главная уязвимость LLM: как Gorget заменил заброшенный LLM Guard
Prompt injection (далее «инъекция промпта») это приём, при котором пользователь вставляет в текст скрытую команду, чтобы языковая модель проигнорировала…
Комментарии