Игорь Градов
Игорь Градов
6 мин
ai

Adaption Labs генерирует синтетические данные из описания задачи, убирая недели ручной разметки

Компания Adaption Labs на этой неделе выпустила функцию Invent a Dataset, которая создаёт готовый к обучению датасет (набор данных для тренировки модели) из текстового описания нужного поведения, без заготовленных примеров, схем или разметки.

Adaption Labs генерирует синтетические данные из описания задачи, убирая недели ручной разметки
Почему это важно

Впервые генерация синтетических данных начинается не со схемы или шаблона, а с описания задачи на естественном языке, и это убирает самый дорогой этап: ручную разметку, которая занимает недели.

Обычный путь подготовки обучающих данных выглядит так: команда берёт корпус, который уже есть, и неделями фильтрует, размечает, переформатирует его под целевую задачу. Adaption Labs утверждает, что такой подход ограничивает качество модели тем, насколько исходные данные совпадают с нужным поведением. Для узкоспециализированных задач в медицине, праве или финтехе нужный сигнал обычно разбросан по внутренним системам, неструктурированным текстам и логам. Собрать из этого фокусированный датасет вручную дорого и долго.

Существующие инструменты для синтетических данных автоматизируют генерацию, но только после того, как человек уже задал схему, распределение задач и стратегию генерации. Invent a Dataset стартует на шаг раньше: с самого поведения, которое модель должна освоить.

Как это работает через API?

Механика задокументирована и конкретна. Один вызов datasets.invent создаёт датасет и запускает генерацию, сразу возвращая статус running. Далее вы опрашиваете datasets.get, пока статус не станет succeeded или failed, и скачиваете строки.

Основной инструмент управления: коды доменов. Актуальные коды запрашиваются через datasets.invent_domains. Затем вы передаёте значения вроде medical, при необходимости сужая поддоменом, например medical.symptoms_diagnosis. Обязателен хотя бы один домен или поддомен. Несколько доменов можно комбинировать в одном запуске.

Поддерживаются два формата выходных данных:

  • instruction_dataset (по умолчанию): пары «промпт и ответ» для дообучения (fine-tuning, обучение модели на ваших примерах под узкую задачу) с учителем.
  • preference_pairs: пары «хороший ответ и плохой ответ» для обучения предпочтениям, например методом DPO (Direct Preference Optimization, когда модель учится выбирать лучший из двух ответов).

Три параметра, которые нужны в продакшене

  • estimate=True рассчитывает стоимость запроса и показывает, хватит ли кредитов, ничего не создавая и не списывая.
  • prompt принимает до 10 000 символов и задаёт содержание строк: чему именно модель должна научиться.
  • idempotency_key (до 255 символов) делает безопасным повторный запрос при сбое сети: возвращает исходный датасет вместо запуска дублирующего.

Количество строк ограничено лимитом тарифного плана. Результат скачивается в форматах JSONL, JSON, CSV или Parquet. Файл принадлежит вам, и обучать на нём модель можно где угодно.

Локализация и языки: зачем это нужно русскоязычным командам

Параметр language_expansion работает в двух режимах:

  • translate: создаёт вариант каждой строки на целевом языке.
  • localize: создаёт вариант для конкретной пары «страна и язык», используя локальные формулировки, а не буквальный перевод.

Параметр sample_rate (от 0.01 до 1) задаёт, какая доля строк будет расширена. Кредиты списываются по количеству итоговых строк, а не исходных. Неподдерживаемые языковые коды возвращают ошибку 400 с примерами допустимых значений.

Для русскоязычных команд, работающих с медициной, правом или финтехом, режим localize особенно ценен: он позволяет получить синтетические данные, адаптированные под российские реалии, без ручного перевода и доработки каждой строки.

Связка с AutoScientist: от описания до обученной модели

Invent a Dataset, первая половина цикла. Идентификатор датасета передаётся напрямую в autoscientist.create, который совместно оптимизирует данные и рецепт обучения под вашу цель. AutoScientist запущен в мае 2026 года и является тренировочным компонентом платформы Adaption.

По данным Adaption Labs, AutoScientist превосходит конфигурации, подготовленные собственными исследователями компании, в среднем на 35 %. Показатель побед (win rate) вырос с 48 % до 64 %. Эти цифры получены на внутренних доменных оценках по восьми вертикалям. Размеры датасетов варьировались от 5 000 до 100 000 строк, архитектуры для дообучения предоставлены Together AI.

Пример: что ввели и что получили

Допустим, вы хотите научить модель классифицировать симптомы по МКБ-кодам на русском языке. Вызов через Python SDK:

dataset = client.datasets.invent(
    prompt="Classify patient symptom descriptions into ICD-10 codes, provide reasoning for each classification",
    domains=["medical.symptoms_diagnosis"],
    format="instruction_dataset",
    language_expansion={"mode": "localize", "targets": [{"country": "RU", "language": "ru"}]},
    sample_rate=1.0,
    estimate=True
)

Система вернёт оценку стоимости без списания. Убрав estimate=True, вы запустите генерацию. На выходе получите JSONL-файл с парами «описание симптомов на русском, МКБ-код и обоснование», готовый для дообучения вашей модели.

Частые ошибки
  • Слишком общий промпт. «Сделай медицинский датасет» даст размытый результат. Чем конкретнее описание поведения и поддомен, тем точнее данные.
  • Игнорирование estimate. Без предварительной оценки легко списать все кредиты одним запуском, особенно при sample_rate=1.0 с локализацией.
  • Путаница translate и localize. Translate даёт буквальный перевод. Localize адаптирует формулировки: для юридических текстов или медицинской терминологии это критическая разница.
  • Отсутствие idempotency_key. При нестабильном соединении повторный запрос без ключа запустит второй датасет и спишет кредиты дважды.
  • Ожидание самостоятельного хостинга. Генерация работает только на платформе Adaption. Самостоятельный запуск на своих серверах не задокументирован.

Что делать с этим прямо сейчас, по ролям

Автору Дзена и копирайтеру. Если вы дообучаете модель для генерации контента в определённом стиле или нише, Invent a Dataset позволяет описать нужное поведение словами, а не собирать сотни примеров вручную. Режим localize даст данные, звучащие по-русски, а не как Google Translate.

Маркетологу. Для команд, строящих чат-ботов или классификаторы обращений, функция снижает стоимость входа: вместо недель разметки реальных диалогов вы получаете синтетические данные за часы. Но помните, что синтетика требует проверки на реальных кейсах.

Предпринимателю в РФ и СНГ. Инструмент доступен через API и Python SDK, генерация идёт на серверах Adaption Labs, поэтому прямых санкционных ограничений на использование API в документации не указано. Из российских альтернатив для генерации обучающих данных стоит смотреть на инструменты вокруг YandexGPT и GigaChat, но они пока не предлагают генерацию датасета из описания задачи как единый вызов API.

Совет редакции dzen.guru

По моему опыту, главная ценность такого подхода не в самих синтетических данных, а в скорости итерации. Раньше цикл «описал задачу, собрал данные, обучил, проверил, исправил» занимал месяц. Здесь первая итерация укладывается в день.

Честная оговорка: синтетические данные не заменяют реальные. Модель, обученная только на сгенерированных парах, может воспроизводить паттерны генератора, а не реального мира. Используйте Invent a Dataset для быстрого прототипа, а затем дополняйте реальными примерами. Связка с AutoScientist выглядит удобно, но заявленные 35 % улучшения получены на внутренних тестах Adaption Labs, независимых подтверждений пока нет.

Что понадобится

  • Аккаунт в Adaption Labs (регистрация на сайте платформы).
  • Кредиты на генерацию (тариф зависит от плана).
  • Python SDK (adaption) или доступ к REST API.
  • Описание целевого поведения модели на английском языке (до 10 000 символов).
  • Для локализации: языковые и страновые коды (например, ru и RU).
  • Время: генерация асинхронна, от минут до часов в зависимости от объёма.

Пошаговая инструкция

  1. Установите SDK:
pip install adaption
  1. Получите список доступных доменов:
domains = client.datasets.invent_domains()
  1. Опишите поведение в параметре prompt. Будьте конкретны: не «медицинский бот», а «классификация жалоб пациентов по группам симптомов с объяснением логики на русском языке».

  2. Запустите генерацию с estimate=True, чтобы увидеть стоимость:

dataset = client.datasets.invent(
    prompt="ваше описание",
    domains=["нужный_домен"],
    format="instruction_dataset",
    estimate=True
)
  1. Убедитесь, что кредитов хватает, и запустите без estimate:
dataset = client.datasets.invent(
    prompt="ваше описание",
    domains=["нужный_домен"],
    format="instruction_dataset",
    idempotency_key="unique-key-123"
)
  1. Опрашивайте статус:
status = client.datasets.get(dataset.id)
  1. Скачайте готовый файл в нужном формате (JSONL, JSON, CSV, Parquet).

  2. При необходимости передайте ID датасета в AutoScientist для автоматической оптимизации обучения:

run = client.autoscientist.create(dataset_id=dataset.id)

Для команд, которым нужна быстрая итерация на узкоспециализированных задачах без бюджета на месяцы разметки, Invent a Dataset закрывает конкретную дыру: от «я знаю, чему хочу научить модель» до «у меня есть файл для дообучения» за один API-вызов.

Генерируйте контент для Дзена с помощью ИИ

Попробуйте инструменты dzen.guru для автоматизации рутины: от заголовков до планов публикаций

Попробовать бесплатно
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

7 багов в коде, 4 нейросети: ни одна не нашла всё, но вместе справились
ai

7 багов в коде, 4 нейросети: ни одна не нашла всё, но вместе справились

Начну с анализа оригинала и построю how-to по фактам из него. Считаю лид: «Один сломанный bash-скрипт с семью багами, четыре нейросети, которые чинят его…

7 мин
ai

Искусственный интеллект и работа: как разделить задачи на рутину и творчество

Искусственный интеллект меняет не саму работу, а то, как мы понимаем разделение труда, и этот сдвиг позволяет вернуть труду его изначальный смысл: осознанную,…

6 мин
Автоматизация с помощью ИИ за 20 минут: 10 скриптов вместо полдня разработки
ai

Автоматизация с помощью ИИ за 20 минут: 10 скриптов вместо полдня разработки

Автоматизация с помощью ИИ перестала требовать полдня работы разработчика: команда Ви.Tech показала, как десять микроскриптов, написанных по промптам за 10-20…

6 мин