Игорь Градов
Игорь Градов
6 мин
aggregator

Poolside AI обошла модели в 10 раз крупнее: 8 млрд параметров и 70 исследователей

Poolside AI, стартап с десятилетней историей в генерации кода, 3 июня 2025 года опубликовал технический отчёт по модели Laguna S 2.1, которая при 8 миллиардах активных параметров обходит конкурентов с моделями почти в десять раз крупнее.

Poolside AI обошла модели в 10 раз крупнее: 8 млрд параметров и 70 исследователей
Почему это важно

Компания с командой менее 70 исследователей выпускает конкурентоспособные модели за восемь недель от начала обучения до релиза, и делает это на открытых весах и с открытыми исследованиями, что ломает представление о том, что фронтирные модели доступны только гигантам с тысячами инженеров.

Poolside AI основал Эйсо Кант, который начал строить языковые модели для кода ещё в 2015 году, вдохновившись работами Андрея Карпатого по рекуррентным нейросетям (RNN). До появления ChatGPT компания потратила четыре года и 12 миллионов долларов на направление, которое рынок не замечал. Выход ChatGPT стал точкой разворота: Poolside AI вернулась к открытой модели разработки и привлекла 500 миллионов долларов инвестиций. Подкаст Latent Space, где сооснователь компании подробно рассказал о технологии и стратегии, стал основой для этого разбора.

Показатель Значение Источник
Общее число параметров Laguna S 118 миллиардов Технический отчёт Poolside AI
Активных параметров 8 миллиардов Технический отчёт Poolside AI
Цикл от обучения до релиза 8 недель Подкаст Latent Space, слова Эйсо Канта
Число экспериментов в месяц от 10 000 до 20 000 Подкаст Latent Space, слова Эйсо Канта
Размер исследовательской команды менее 70 человек Подкаст Latent Space, слова Эйсо Канта
Привлечённые инвестиции 500 миллионов долларов Подкаст Latent Space, слова Эйсо Канта
Вложения до появления рынка 12 миллионов долларов за 4 года Подкаст Latent Space, слова Эйсо Канта

Что именно построила Poolside AI?

Ключевой актив Poolside AI называется Model Factory, «фабрика моделей». Это не одна нейросеть, а инженерная система полного цикла: от предварительного обучения (pre-training, первичная тренировка модели на больших объёмах данных) до выпуска готового продукта.

Фабрика работает на нескольких принципах:

  • Потоковая подача данных. Обучающие данные (training data) подаются в модель в реальном времени, а не загружаются заранее одним пакетом. Это ускоряет эксперименты.
  • Воспроизводимость. Каждый эксперимент фиксируется: неизменяемые данные, версионированный код, журнал запусков. Любой результат можно повторить.
  • Обучение с низкой точностью вычислений. Модели тренируют на числах с меньшей разрядностью, что экономит вычислительные ресурсы без критической потери качества.
  • ИИ-агенты внутри фабрики. Агенты (программы, которые действуют сами, без пошаговых команд) уже пишут код, запускают задачи, оценивают результаты и модифицируют пайплайны обучения следующих моделей.

Благодаря этой системе Poolside AI сократила цикл выпуска модели с шести месяцев до пяти и восьми недель. Качество нового чекпоинта (контрольной точки обучения) команда оценивает в первые 30 минут после его создания.

Что обнаружили в Laguna S 2.1?

Laguna S использует архитектуру с 118 миллиардами параметров, из которых активны только 8 миллиардов. Это значит, что модель по размеру сопоставима с компактными решениями, но по структуре и обучению использует ресурсы крупной модели. Результаты, которые выделяет команда:

  • Малая модель обходит большие. Laguna S 2.1 показала результаты лучше, чем недавний релиз Thinking Machines, модель почти в десять раз крупнее по активным параметрам. По данным технического отчёта Poolside AI.
  • Настойчивость важнее «сырого» интеллекта. Эйсо Кант утверждает, что механизмы верификации (проверки собственных ответов), возврата к предыдущим шагам (backtracking) и упорного повторения попыток дают модели больше, чем простое увеличение числа параметров.
  • Компактные модели способны на большее. По словам Канта, малые модели могут справляться с гораздо большим объёмом «работы со знаниями», чем считалось ранее.
  • Обучение с подкреплением сдвигается раньше. Reinforcement learning (обучение, при котором модель получает награду за правильные действия и штраф за ошибки) в Poolside AI применяют уже на этапе предварительного обучения, а не только на финальной доводке.
  • Предсказание следующего токена недостаточно. Кант считает, что стандартный метод обучения, предсказание следующего слова, извлекает слишком мало знаний из веб-данных.
Как это читать

Результаты сравнения с моделью Thinking Machines приведены из технического отчёта самой Poolside AI и подкаста Latent Space. Независимых бенчмарков (стандартизированных тестов третьей стороны) в источнике нет. Компания заинтересована представить свою модель в лучшем свете, поэтому цифры стоит воспринимать как заявление разработчика, а не как подтверждённый результат. Кроме того, 118 миллиардов общих параметров при 8 миллиардах активных означает архитектуру «смесь экспертов» (Mixture of Experts, MoE): модель выбирает, какую часть «мозга» включить для каждой задачи. Сравнивать такие модели с обычными напрямую некорректно, потому что общий объём параметров влияет на стоимость хранения и обучения, даже если при инференсе (генерации ответа) задействована малая часть.

Что это значит для тех, кто работает с ИИ в России?

Стратегия Poolside AI интересна не самой моделью, а тем, как она построена.

Авторам и контент-мейкерам. Появление конкурентоспособных компактных моделей с открытыми весами (open weights, когда параметры модели можно скачать и запустить у себя) означает, что инструменты для генерации и проверки кода перестают быть монополией пяти крупных компаний. Если Laguna S или её потомки станут доступны для локального запуска, это путь к персональным ИИ-ассистентам без подписки.

Разработчикам и техническим командам. Подход «фабрики моделей», 10 000 экспериментов в месяц силами менее 70 человек, показывает, что автоматизация самого процесса обучения (а не только результата) даёт кратное ускорение. Для команд, работающих с дообучением (fine-tuning) моделей под свои задачи, это ориентир.

Предпринимателям. Poolside AI принципиально строит исследовательскую команду за пределами Кремниевой долины, избегая «войны за таланты» в Сан-Франциско. Для российских и региональных команд это подтверждение: географическая удалённость от центров ИИ не приговор, если выстроена инженерная культура. Из доступных в РФ моделей для работы с кодом можно смотреть на решения от Сбера (GigaCode) и открытые модели семейства Qwen и DeepSeek.

Мнение редакции dzen.guru

Эйсо Кант открыто говорит, что предпочёл бы мир со ста компаниями, строящими базовые модели, а не олигополию из пяти. Это не альтруизм: Poolside AI выигрывает от открытой экосистемы, потому что её конкурентное преимущество не в самой модели, а в скорости производства моделей. Фабричный подход, когда агенты внутри фабрики сами улучшают процесс обучения следующих моделей, напоминает маховик: каждый цикл ускоряет следующий. Если заявленные 10 000 экспериментов в месяц реальны, это объясняет, как команда из менее 70 человек конкурирует с лабораториями в сотни раз крупнее. Для нас в dzen.guru это ещё один аргумент в пользу того, что будущее ИИ-инструментов за небольшими специализированными моделями, которые можно запустить локально, а не за гигантами, доступными только через API по подписке.

Кант также предупреждает: открытые модели скоро станут настолько способными, что выпускать их без ограничений будет нельзя. А односторонние меры по безопасности ИИ не работают в глобально конкурентной среде, и жёсткое регулирование рискует зацементировать олигополию из двух или трёх компаний. Вопрос не в том, будут ли компактные модели конкурировать с крупными. Вопрос в том, кто первым научится выпускать их быстрее, чем конкуренты успевают обучить одну большую.

По данным Latent Space Podcast

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Laguna S нейросеть обошла DeepSeek v4 Pro по качеству, но стоит дешевле v4 Flash
aggregator

Laguna S нейросеть обошла DeepSeek v4 Pro по качеству, но стоит дешевле v4 Flash

Laguna S 2.1 нейросеть от западного стартапа Neolab обошла китайскую DeepSeek v4 Pro по бенчмаркам и при этом стоит дешевле DeepSeek v4 Flash, самой бюджетной…

5 мин
aggregator

Нейросети, новости недели: Anthropic разблокировала модели, Google добавила видео в NotebookLM

Первая неделя июля 2026 года принесла сразу несколько заметных релизов: Anthropic вернула ранее заблокированные модели и выпустила новую, Google добавила…

6 мин
aggregator

Anthropic подала заявку на IPO при оценке $965 млрд, обойдя OpenAI

Anthropic готовится одновременно к двум шагам, которые обычно компании разделяют на годы: 3 июня 2026 года стало известно, что компания подала заявку на IPO и…

5 мин