DeepSeek R1 обучили за $6 млн и обрушили рынок на триллион: как дефицит чипов стал преимуществом
Двадцатого января 2025 года небольшая китайская компания DeepSeek выложила рассуждающую модель DeepSeek R1 под открытой лицензией MIT и за неделю обрушила капитализацию американского технологического сектора примерно на триллион долларов.

DeepSeek R1 показала, что ограничение в железе можно компенсировать инженерными решениями, а не бюджетом. Для российского рынка, где доступ к топовым чипам ограничен теми же санкциями, это прямой прецедент.
История выглядит как стартап-сенсация, но за ней стоит многолетняя работа дочернего подразделения китайского квантового хедж-фонда High-Flyer из Ханчжоу. Фонд годами строил вычислительные кластеры под собственные торговые модели, а в 2023 году выделил отдельную структуру для разработки ИИ. Финансирование шло целиком из средств фонда, без внешних инвесторов. По оценке аналитической компании SemiAnalysis, суммарные вложения группы составили порядка 1,6 млрд долларов.
| Показатель | Значение | Источник |
|---|---|---|
| Дата релиза DeepSeek R1 | 20 января 2025 | Оригинал статьи |
| Первое место в App Store США | 26 января 2025 | Оригинал статьи |
| Падение акций Nvidia за один день | 17%, минус 589 млрд долларов капитализации | Оригинал статьи |
| Суммарная просадка рынка | Примерно 1 трлн долларов | Оригинал статьи |
| Параметры модели (всего / активных на токен) | 671 млрд / 37 млрд | Оригинал статьи |
| GPU-часы на финальный прогон V3 | 2,788 млн часов H800 | Оригинал статьи |
| Стоимость финального прогона V3 | 5,576 млн долларов | Оригинал статьи |
| Стоимость RL-этапа R1 | 294 тыс. долларов | Статья в Nature, сентябрь 2025 |
| Оценка суммарных вложений группы | Примерно 1,6 млрд долларов | SemiAnalysis |
Что стоит за моделью и почему важен чип H800?
DeepSeek строила R1 на видеокартах Nvidia H800. Это те же H100, которые используют американские лаборатории, но с урезанной скоростью связи между картами: примерно 400 гигабайт в секунду вместо 900. Чип появился как специальная версия для китайского рынка после того, как США в октябре 2022 года ограничили экспорт топовых ускорителей в Китай.
High-Flyer закупила около 10 000 карт предыдущего поколения A100 ещё в 2021 году, за год до введения ограничений, потратив около миллиарда юаней. Знакомые основателя Лян Вэньфэна тогда считали эту покупку чудачеством. Потом чипы стали дефицитом.
Ситуация напоминает то, с чем сталкиваются российские команды: санкции закрывают прямой доступ к лучшему железу, и единственный выход заключается в том, чтобы выжать максимум из того, что есть.
Какие инженерные решения компенсировали слабое железо?
Практически каждая ключевая оптимизация DeepSeek стала прямым ответом на узкое место в канале связи между картами.
-
MLA (Multi-head Latent Attention), сжатие памяти на лету. Когда модель генерирует ответ, она хранит в памяти карты всё, что уже прочитала. Этот кэш (KV-кэш) растёт с длиной текста и забирает ресурсы. MLA сжимает кэш до единиц процентов от обычного размера, на одну карту помещается в разы больше параллельных запросов. Технология появилась ещё в модели V2 в мае 2024 года и запустила ценовую войну на китайском рынке: DeepSeek тогда поставила цену 1 юань за миллион входных токенов (токен, это единица текста, примерно три четверти слова).
-
DeepSeekMoE, модель «разделения труда». Из 671 млрд параметров над каждым токеном работают только 37 млрд. Специальный маршрутизатор (роутер) выбирает узких «экспертов» под конкретную задачу. Качество определяется полным объёмом знаний, а стоимость вычислений привязана только к активной части. Обычно при такой схеме роутер быстро «привыкает» к нескольким экспертам и перегружает их. DeepSeek решила проблему без стандартного штрафа в функции потерь (loss function, формула, по которой модель учится на ошибках): перегруженный эксперт просто становится для роутера чуть менее привлекательным.
-
FP8 с первого дня обучения. Обычно модель учат в 16-битной точности и сжимают до 8 бит уже готовую. DeepSeek училась в 8 битах с самого начала. Результат: вдвое меньше данных гоняется между узлами кластера, а именно канал передачи был слабым звеном H800.
-
DualPipe, маскировка задержек. На большом кластере карты регулярно простаивают, ожидая данные от соседей. DualPipe перестраивает очерёдность так, чтобы одна часть задачи считалась, пока другая передаётся. Простой почти исчезает.
-
PTX вместо стандартного CUDA. CUDA (стандартный программный слой для кода видеокарт Nvidia) сам решает, как распределять вычислительные блоки внутри чипа. DeepSeek спустилась на уровень ниже, фактически на «ассемблер» для карт Nvidia, и вручную развела блоки: одни считают, другие передают данные. Лаборатории с неограниченным доступом к H100 не переписывали ядра на таком уровне, потому что им это просто не требовалось.
Что добавилось для DeepSeek R1 поверх базовой модели?
R1 построена поверх V3, и для неё команда применила два дополнительных подхода.
GRPO вместо PPO. Из процесса обучения с подкреплением (RL, reinforcement learning, когда модель учится методом проб и вознаграждений) убрали отдельную «модель-критика». Это освободило примерно половину памяти. Преимущество ответа оценивается относительно группы вариантов на один промпт, а не через отдельную модель-судью.
R1-Zero, рассуждение без размеченных примеров. Модель обучали чистым RL вообще без этапа обучения на размеченных данных (supervised fine-tuning, дообучение на подготовленных человеком примерах). Рассуждение возникло само: модель научилась перепроверять решения и тратить больше токенов на сложные задачи, ни разу не увидев размеченной цепочки рассуждений. По данным статьи в Nature (сентябрь 2025), этап R1-Zero занял 648 карт H800 в течение 198 часов, R1 потребовал 648 карт H800 примерно за 80 часов, а сборка обучающего датасета заняла около 5 000 GPU-часов. Итого RL-этап обошёлся в 294 тысячи долларов.
Широко известная цифра «обучение за 6 миллионов долларов» относится только к финальному прогону базовой модели V3. В неё не входят исследования, неудачные эксперименты, сбор данных, зарплаты и амортизация кластера. По оценке SemiAnalysis, полная стоимость работы группы составляет порядка 1,6 млрд долларов. Сравнивать «6 миллионов» с бюджетами OpenAI или Google некорректно: это разные метрики.
Что делать с этим прямо сейчас?
Если вы автор на Дзене или копирайтер. DeepSeek R1 можно скачать и запустить локально, модель распространяется под открытой лицензией MIT. Для обычного ноутбука полная версия слишком велика, но существуют дистиллированные (сжатые) варианты, которые работают на потребительском железе. Это бесплатная рассуждающая модель: можно тестировать черновики, проверять логику текстов, генерировать структуры статей. Искать DeepSeek R1 для скачивания стоит на платформе Hugging Face, где размещены официальные веса.
Если вы маркетолог или предприниматель в РФ. Главный урок: доступ к самому дорогому железу больше не гарантирует монополию на качество. Китайская команда с урезанными чипами H800, теми же, что доступны на вторичном рынке в Азии, добилась результатов, сопоставимых с моделями компаний, тративших на порядки больше. Для российского рынка, где ограничения на чипы аналогичны китайским, это значит: строить собственные решения на открытых моделях (опенсорс) технически реально. Из доступных в РФ инструментов на базе российских моделей работают YandexGPT и GigaChat, но DeepSeek R1 как открытая модель также доступна для развёртывания на собственных серверах.
История DeepSeek R1 показала одну неудобную вещь: гонка бюджетов в ИИ может оказаться менее решающей, чем гонка инженерных идей. Буквально за неделю до релиза R1 проект Stargate анонсировал вложения до полутриллиона долларов в дата-центры, а OpenAI собирал раунд на 40 млрд долларов. Обе ставки строились на убеждении, что количество видеокарт создаёт непреодолимое преимущество. DeepSeek за семь дней поставила это убеждение под вопрос. Для тех из нас, кто работает в условиях ограниченного доступа к железу, я вижу в этом не утешение, а конкретный план: брать открытые модели, адаптировать под свои задачи с помощью дообучения и не ждать, пока кто-то продаст готовое решение.
Компания, которую год назад мало кто знал за пределами Китая, доказала, что дефицит ресурсов бывает двигателем, а не барьером. Для российских разработчиков, живущих в тех же условиях экспортных ограничений, это не просто история со стороны, а рабочий чертёж.
По данным оригинальной статьи

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Нейросети обучение на синтетике: 600 картинок хватило, чтобы находить подписи на сканах
Документы с персональными данными нужно обезличить, а подписи на сканах не поддаются ни словарям, ни регулярным выражениям, и автор потратил полтора месяца на…

Ansible и нейросети: генерация плейбуков от промпта до прода за 30 минут
Нейросети в 2026 году берут на себя рутинную часть написания Ansible-плейбуков, от генерации шаблонов ролей до отладки падающих задач, и инженеру остаётся…

71 видео в поисковую базу знаний видео за минуты: эксперимент с TeamStream MCP
Видеоархив редакции или компании растёт быстрее, чем кто-либо успевает его пересматривать, и превратить десятки записей в поисковую базу знаний видео можно за…
Комментарии