Adaption Labs генерирует синтетические данные из описания задачи, убирая недели ручной разметки
Компания Adaption Labs на этой неделе выпустила функцию Invent a Dataset, которая создаёт готовый к обучению датасет (набор данных для тренировки модели) из текстового описания нужного поведения, без заготовленных примеров, схем или разметки.

Впервые генерация синтетических данных начинается не со схемы или шаблона, а с описания задачи на естественном языке, и это убирает самый дорогой этап: ручную разметку, которая занимает недели.
Обычный путь подготовки обучающих данных выглядит так: команда берёт корпус, который уже есть, и неделями фильтрует, размечает, переформатирует его под целевую задачу. Adaption Labs утверждает, что такой подход ограничивает качество модели тем, насколько исходные данные совпадают с нужным поведением. Для узкоспециализированных задач в медицине, праве или финтехе нужный сигнал обычно разбросан по внутренним системам, неструктурированным текстам и логам. Собрать из этого фокусированный датасет вручную дорого и долго.
Существующие инструменты для синтетических данных автоматизируют генерацию, но только после того, как человек уже задал схему, распределение задач и стратегию генерации. Invent a Dataset стартует на шаг раньше: с самого поведения, которое модель должна освоить.
Как это работает через API?
Механика задокументирована и конкретна. Один вызов datasets.invent создаёт датасет и запускает генерацию, сразу возвращая статус running. Далее вы опрашиваете datasets.get, пока статус не станет succeeded или failed, и скачиваете строки.
Основной инструмент управления: коды доменов. Актуальные коды запрашиваются через datasets.invent_domains. Затем вы передаёте значения вроде medical, при необходимости сужая поддоменом, например medical.symptoms_diagnosis. Обязателен хотя бы один домен или поддомен. Несколько доменов можно комбинировать в одном запуске.
Поддерживаются два формата выходных данных:
- instruction_dataset (по умолчанию): пары «промпт и ответ» для дообучения (fine-tuning, обучение модели на ваших примерах под узкую задачу) с учителем.
- preference_pairs: пары «хороший ответ и плохой ответ» для обучения предпочтениям, например методом DPO (Direct Preference Optimization, когда модель учится выбирать лучший из двух ответов).
Три параметра, которые нужны в продакшене
estimate=Trueрассчитывает стоимость запроса и показывает, хватит ли кредитов, ничего не создавая и не списывая.promptпринимает до 10 000 символов и задаёт содержание строк: чему именно модель должна научиться.idempotency_key(до 255 символов) делает безопасным повторный запрос при сбое сети: возвращает исходный датасет вместо запуска дублирующего.
Количество строк ограничено лимитом тарифного плана. Результат скачивается в форматах JSONL, JSON, CSV или Parquet. Файл принадлежит вам, и обучать на нём модель можно где угодно.
Локализация и языки: зачем это нужно русскоязычным командам
Параметр language_expansion работает в двух режимах:
- translate: создаёт вариант каждой строки на целевом языке.
- localize: создаёт вариант для конкретной пары «страна и язык», используя локальные формулировки, а не буквальный перевод.
Параметр sample_rate (от 0.01 до 1) задаёт, какая доля строк будет расширена. Кредиты списываются по количеству итоговых строк, а не исходных. Неподдерживаемые языковые коды возвращают ошибку 400 с примерами допустимых значений.
Для русскоязычных команд, работающих с медициной, правом или финтехом, режим localize особенно ценен: он позволяет получить синтетические данные, адаптированные под российские реалии, без ручного перевода и доработки каждой строки.
Связка с AutoScientist: от описания до обученной модели
Invent a Dataset, первая половина цикла. Идентификатор датасета передаётся напрямую в autoscientist.create, который совместно оптимизирует данные и рецепт обучения под вашу цель. AutoScientist запущен в мае 2026 года и является тренировочным компонентом платформы Adaption.
По данным Adaption Labs, AutoScientist превосходит конфигурации, подготовленные собственными исследователями компании, в среднем на 35 %. Показатель побед (win rate) вырос с 48 % до 64 %. Эти цифры получены на внутренних доменных оценках по восьми вертикалям. Размеры датасетов варьировались от 5 000 до 100 000 строк, архитектуры для дообучения предоставлены Together AI.
Допустим, вы хотите научить модель классифицировать симптомы по МКБ-кодам на русском языке. Вызов через Python SDK:
dataset = client.datasets.invent(
prompt="Classify patient symptom descriptions into ICD-10 codes, provide reasoning for each classification",
domains=["medical.symptoms_diagnosis"],
format="instruction_dataset",
language_expansion={"mode": "localize", "targets": [{"country": "RU", "language": "ru"}]},
sample_rate=1.0,
estimate=True
)
Система вернёт оценку стоимости без списания. Убрав estimate=True, вы запустите генерацию. На выходе получите JSONL-файл с парами «описание симптомов на русском, МКБ-код и обоснование», готовый для дообучения вашей модели.
- Слишком общий промпт. «Сделай медицинский датасет» даст размытый результат. Чем конкретнее описание поведения и поддомен, тем точнее данные.
- Игнорирование estimate. Без предварительной оценки легко списать все кредиты одним запуском, особенно при
sample_rate=1.0с локализацией. - Путаница translate и localize. Translate даёт буквальный перевод. Localize адаптирует формулировки: для юридических текстов или медицинской терминологии это критическая разница.
- Отсутствие idempotency_key. При нестабильном соединении повторный запрос без ключа запустит второй датасет и спишет кредиты дважды.
- Ожидание самостоятельного хостинга. Генерация работает только на платформе Adaption. Самостоятельный запуск на своих серверах не задокументирован.
Что делать с этим прямо сейчас, по ролям
Автору Дзена и копирайтеру. Если вы дообучаете модель для генерации контента в определённом стиле или нише, Invent a Dataset позволяет описать нужное поведение словами, а не собирать сотни примеров вручную. Режим localize даст данные, звучащие по-русски, а не как Google Translate.
Маркетологу. Для команд, строящих чат-ботов или классификаторы обращений, функция снижает стоимость входа: вместо недель разметки реальных диалогов вы получаете синтетические данные за часы. Но помните, что синтетика требует проверки на реальных кейсах.
Предпринимателю в РФ и СНГ. Инструмент доступен через API и Python SDK, генерация идёт на серверах Adaption Labs, поэтому прямых санкционных ограничений на использование API в документации не указано. Из российских альтернатив для генерации обучающих данных стоит смотреть на инструменты вокруг YandexGPT и GigaChat, но они пока не предлагают генерацию датасета из описания задачи как единый вызов API.
По моему опыту, главная ценность такого подхода не в самих синтетических данных, а в скорости итерации. Раньше цикл «описал задачу, собрал данные, обучил, проверил, исправил» занимал месяц. Здесь первая итерация укладывается в день.
Честная оговорка: синтетические данные не заменяют реальные. Модель, обученная только на сгенерированных парах, может воспроизводить паттерны генератора, а не реального мира. Используйте Invent a Dataset для быстрого прототипа, а затем дополняйте реальными примерами. Связка с AutoScientist выглядит удобно, но заявленные 35 % улучшения получены на внутренних тестах Adaption Labs, независимых подтверждений пока нет.
Что понадобится
- Аккаунт в Adaption Labs (регистрация на сайте платформы).
- Кредиты на генерацию (тариф зависит от плана).
- Python SDK (
adaption) или доступ к REST API. - Описание целевого поведения модели на английском языке (до 10 000 символов).
- Для локализации: языковые и страновые коды (например,
ruиRU). - Время: генерация асинхронна, от минут до часов в зависимости от объёма.
Пошаговая инструкция
- Установите SDK:
pip install adaption
- Получите список доступных доменов:
domains = client.datasets.invent_domains()
-
Опишите поведение в параметре
prompt. Будьте конкретны: не «медицинский бот», а «классификация жалоб пациентов по группам симптомов с объяснением логики на русском языке». -
Запустите генерацию с
estimate=True, чтобы увидеть стоимость:
dataset = client.datasets.invent(
prompt="ваше описание",
domains=["нужный_домен"],
format="instruction_dataset",
estimate=True
)
- Убедитесь, что кредитов хватает, и запустите без
estimate:
dataset = client.datasets.invent(
prompt="ваше описание",
domains=["нужный_домен"],
format="instruction_dataset",
idempotency_key="unique-key-123"
)
- Опрашивайте статус:
status = client.datasets.get(dataset.id)
-
Скачайте готовый файл в нужном формате (JSONL, JSON, CSV, Parquet).
-
При необходимости передайте ID датасета в AutoScientist для автоматической оптимизации обучения:
run = client.autoscientist.create(dataset_id=dataset.id)
Для команд, которым нужна быстрая итерация на узкоспециализированных задачах без бюджета на месяцы разметки, Invent a Dataset закрывает конкретную дыру: от «я знаю, чему хочу научить модель» до «у меня есть файл для дообучения» за один API-вызов.
Генерируйте контент для Дзена с помощью ИИ
Попробуйте инструменты dzen.guru для автоматизации рутины: от заголовков до планов публикаций
Попробовать бесплатно
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

7 багов в коде, 4 нейросети: ни одна не нашла всё, но вместе справились
Начну с анализа оригинала и построю how-to по фактам из него. Считаю лид: «Один сломанный bash-скрипт с семью багами, четыре нейросети, которые чинят его…
Искусственный интеллект и работа: как разделить задачи на рутину и творчество
Искусственный интеллект меняет не саму работу, а то, как мы понимаем разделение труда, и этот сдвиг позволяет вернуть труду его изначальный смысл: осознанную,…

Автоматизация с помощью ИИ за 20 минут: 10 скриптов вместо полдня разработки
Автоматизация с помощью ИИ перестала требовать полдня работы разработчика: команда Ви.Tech показала, как десять микроскриптов, написанных по промптам за 10-20…
Комментарии