Snorkel AI утроила оценку до $3,5 млрд: рынок ai training data растёт в разы за год
Snorkel AI привлекла 350 млн долларов в раунде Series E, утроив свою оценку до 3,5 млрд долларов за 17 месяцев, и теперь продаёт не софт для разметки, а готовые обучающие данные для ИИ как сервис.

Рынок обучающих данных для ИИ (ai training data) растёт так быстро, что стартапы, поставляющие датасеты, утраивают оценку за полтора года. Для тех, кто строит ИИ-продукты в России, это сигнал: без собственной инфраструктуры синтеза данных зависимость от западных поставщиков будет только дорожать.
Компания Snorkel AI, основанная в 2019 году выпускниками Стэнфордского ИИ-центра, прошла путь от инструмента автоматической разметки данных до полноценного поставщика готовых датасетов. Раунд возглавили фонды Insight Partners и S32, а среди участников, Addition, Lightspeed, Greylock, GV и Wells Fargo. Об этом сообщил TechCrunch.
| Параметр | Значение |
|---|---|
| Компания | Snorkel AI |
| Сумма раунда | 350 млн долларов |
| Тип сделки | Series E |
| Оценка компании | 3,5 млрд долларов |
| Предыдущая оценка (Series D, 17 месяцев назад) | 1,3 млрд долларов |
| Лид-инвесторы | Insight Partners, S32 |
От софта для разметки к «данным как сервису»
Snorkel AI начинала как разработчик программ, которые автоматизировали разметку данных. Разметка данных (data labeling) означает проставление меток на текстах, изображениях или видео, чтобы модель понимала, что на них изображено или написано.
В прошлом году компания сменила модель: вместо продажи софта она стала поставлять клиентам готовые датасеты и среды для обучения с подкреплением (reinforcement learning, RL). Reinforcement learning (обучение с подкреплением) означает способ обучения модели через пробы и ошибки в симуляции, как тренажёр для пилота.
Snorkel называет новый формат «данные как сервис» (data-as-a-service). Подход гибридный: программы и собственные модели компании генерируют синтетические данные, а доменные эксперты проверяют и дополняют результат. Именно эта комбинация, алгоритм плюс человек, стала основной точкой роста.
Восемнадцатикратный рост выручки за год
По данным самой компании, годовой темп выручки (annualized revenue run rate) достиг 375 млн долларов. По заявлению Snorkel AI, это в 18 раз больше, чем 12 месяцев назад.
Компания подчёркивает разницу между своей моделью и конкурентами. Другие поставщики обучающих данных для ИИ (ai training data) работают как маркетплейсы экспертного труда: по данным TechCrunch, от 60 до 70 процентов их валовой выручки уходит напрямую специалистам, выполняющим работу. Это значит, что публикуемые цифры валовой выручки значительно выше реальной чистой выручки.
У Snorkel AI структура иная: выплаты экспертам учитываются в себестоимости (cost of goods sold), а не в заголовочных цифрах выручки. Фактически компания продаёт готовый продукт, датасет или RL-среду, а не часы работы людей. Это делает сравнение с конкурентами неочевидным, но саму бизнес-модель потенциально более маржинальной.
Почему рынок обучающих данных стал горячим?
Рост Snorkel AI не уникален. TechCrunch приводит данные по конкурентам:
- Mercor достиг валовой годовой выручки в 2 млрд долларов.
- Handshake преодолел отметку в 1 млрд долларов.
- Micro1 масштабировался до 500 млн долларов.
Все эти компании обслуживают один и тот же спрос: лаборатории ИИ и корпорации нуждаются во всё большем объёме качественных обучающих данных. Модели становятся крупнее, задачи сложнее, а публичные данные из интернета уже в значительной мере исчерпаны или ограничены правообладателями. Именно поэтому синтетические данные и экспертная разметка превращаются в отдельную индустрию.
Snorkel запустилась коммерчески в 2019 году после четырёх лет исследований сооснователя и CEO Алекса Ратнера и его команды в Стэнфордской лаборатории ИИ. : По данным TechCrunch
Что это значит для вас?
Восемнадцатикратный рост выручки за год и утроение оценки за 17 месяцев показывают, что обучающие данные стали «нефтью» для ИИ-индустрии. Но я бы предостерёг от чрезмерного энтузиазма: TechCrunch прямо указывает, что валовая выручка многих «дата-лабораторий» завышена из-за прямых выплат экспертам. Реальная прибыльность этих компаний пока непрозрачна.
Авторам Дзена и копирайтерам. Синтетические данные, это когда ИИ генерирует тексты и примеры для обучения другого ИИ. Если вы уже пишете промпты для генерации контента, тот же навык востребован в индустрии разметки и проверки обучающих данных. Следите за вакансиями «доменных экспертов» у подобных компаний: часть работы уже выполняется удалённо.
Маркетологам. Рост Snorkel AI означает, что кастомные модели, дообученные (fine-tuning) на специализированных данных, станут доступнее. Если вы планируете дообучение модели под свой бренд или продукт, стоимость подготовки данных будет снижаться по мере конкуренции на этом рынке.
Предпринимателям в РФ и СНГ. Все перечисленные компании, Snorkel, Mercor, Handshake, Micro1, работают на западном рынке. Российские ИИ-проекты критически зависят от импорта обучающих данных. Пока в России нет сопоставимых поставщиков синтетических датасетов, каждая новая модель от Яндекса или Сбера будет обходиться дороже, а зависимость расти. Если вы строите ИИ-продукт, начинайте собирать и размечать собственные данные сейчас: это единственный актив, который не заблокируют санкции.
Цифры выручки Snorkel AI и конкурентов, это заявления самих компаний и оценки TechCrunch. Аудированных отчётов нет ни у одной из них. Кроме того, TechCrunch указывает, что чистая выручка «дата-лабораторий» может быть в два-три раза ниже валовой. Оценка в 3,5 млрд долларов выглядит высокой, но проверить её рынок сможет только при IPO или следующем раунде.
Рынок обучающих данных для ИИ за год превратился из вспомогательной отрасли в индустрию с миллиардными раундами. Для российских разработчиков и предпринимателей вывод один: данные, это не расходная статья, а стратегический актив, и чем раньше вы начнёте формировать свой, тем меньше заплатите потом.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
TypeSafe AI выпустила модель Jev: вместо текста она возвращает типизированные объекты
TypeSafe выпустила Jev, модель, которая не генерирует текст, а возвращает типизированные решения по заданному состоянию, и это меняет подход к автоматизации…

Вынос инференса с борта робота экономит до 160% заряда: новые данные об ИИ-роботике
Инференс (inference, вычисление ответа нейросетью) для физических роботов принято запускать прямо на борту, на встроенном GPU, но исследование, представленное…

Утечка кода нейросети ZCode: ИИ-помощник тайно копировал репозитории в облако
Мне нужно увидеть окончание оригинала, но буду работать с тем, что есть. Пишу новость. На неделе сошлись сразу несколько событий: утечка кода нейросети ZCode,…
Комментарии