99% датасетов не содержат причинности: ключевые ограничения искусственного интеллекта
Современные нейросети отлично угадывают закономерности в данных, но не понимают, что из чего следует, и это объясняет, почему модели ломаются при малейшем сдвиге условий, а разработчикам приходится переучивать их заново.

Ограничения искусственного интеллекта в области причинности касаются каждого, кто собирает датасеты или строит модели: 99% обучающих данных (по оценке исследователя Элиаса Барейнбойма) содержат только наблюдения, но не причинно-следственные связи, и именно это становится главной причиной провалов при смене условий.
Источник проблемы сформулировали два исследователя. Илья Суцкевер, сооснователь Safe Superintelligence Inc, заявил: одного масштабирования недостаточно, нужны принципиально новые идеи. Элиас Барейнбойм, директор лаборатории Causal Artificial Intelligence, добавил: данные это лишь снимок реальности, а сама реальность сложна. Этот материал покажет, как учитывать причинность при подготовке данных и проверке моделей, чтобы результат не рассыпался при первом же сдвиге распределения.
Что понадобится
- Базовое понимание того, как обучается нейросеть (что такое обучающие данные и почему модель выдаёт ответ)
- Доступ к любой среде для работы с данными: Python, Jupyter Notebook или аналог
- Библиотека SHAP (инструмент из теории игр, оценивает вклад каждого признака в предсказание модели) для проверки, на что опирается модель
- Примерно 2 часа на первый эксперимент с цветным датасетом из инструкции ниже
Три слоя опыта: почему одних наблюдений мало?
Алан Тьюринг когда-то сказал: всё, что нам нужно, это машина, способная учиться на опыте. Элиас Барейнбойм раскладывает этот опыт на три способа получения:
- Пассивное наблюдение (что мы видим). Модель смотрит на готовые данные и ищет корреляции
- Физическое взаимодействие (что будет, если мы вмешаемся). Модель пробует действовать и видит последствия, как в A/B-тестах
- Симуляция (что было бы, если бы). Модель представляет альтернативные сценарии, контрфактический анализ (ответ на вопрос «а что случилось бы, если бы мы поступили иначе»)
Эти три слоя образуют иерархию причинности Перла, Pearl Causal Hierarchy (PCH). По оценке Барейнбойма, 99% существующих датасетов относятся к первому слою: чистое наблюдение. Отдельные случаи попадают во второй слой (A/B-тесты). Третий слой пока недоступен для массового применения.
Проблема в том, что большинство моделей обучаются на первом слое, на том, что мы «видим», а потом от них ждут предсказаний того, чего мы «не видим». Это ключевое ограничение искусственного интеллекта: корреляция в данных не равна причинности в реальности.
Пошаговая инструкция: как проверить, видит ли модель причину или цепляется за случайный признак
-
Подготовьте два варианта датасета. Возьмите набор рукописных цифр (например, MNIST). Покрасьте цифры в разные цвета так, чтобы насыщенность цвета росла вместе с числом: единица бледная, девятка яркая. Это создаёт ложную корреляцию между цветом и цифрой
-
Обучите «стандартный» классификатор. Подайте ему цветной датасет как есть. Модель научится опираться на цвет, потому что цвет коррелирует с ответом:
# Пример: обучение на цветном датасете
model_standard = train_classifier(colored_mnist_train)
- Обучите «устойчивый» классификатор. Перемешайте цвета случайным образом, разрушив связь между цветом и цифрой. Теперь модели остаётся только форма:
# Пример: обучение на датасете с разрушенной корреляцией цвета
model_robust = train_classifier(shuffled_color_mnist_train)
-
Сдвиньте распределение цветов на тестовых данных. Поменяйте палитру: пусть теперь единица яркая, а девятка бледная. Прогоните оба классификатора на этих данных
-
Сравните результаты двумя методами объяснимости. Используйте SHAP (классический метод, оценивает вклад каждого пикселя в ответ модели) и counterfactual Shapley values (контрфактические значения Шепли, отвечают на вопрос «какие пиксели нужно изменить, чтобы модель изменила решение»):
# SHAP — классический метод (слой L1 по иерархии)
shap_values = shap.DeepExplainer(model, background).shap_values(test_images)
# Counterfactual Shapley — причинный метод (слой L3 по иерархии)
cf_shap_values = counterfactual_shapley(model, test_images)
- Интерпретируйте карты объяснимости. Стандартный классификатор при сдвиге распределения цветов провалится. Устойчивый продолжит работать. Контрфактический метод покажет разницу между двумя моделями гораздо нагляднее, чем классический SHAP
Стандартный классификатор на цветных цифрах показывает высокую точность, пока цвета совпадают с обучением. Стоит сдвинуть палитру, точность падает. Устойчивый классификатор, обученный на данных с разрушенной корреляцией, сохраняет результат. Классический SHAP при этом не смог различить два классификатора: оба выглядели похоже. Контрфактический метод Shapley чётко показал, что стандартная модель цепляется за цвет, а устойчивая смотрит на форму. Именно третий слой иерархии причинности (контрфактический анализ) дал объяснение, которое первый слой (наблюдение) дать не способен.
Не путайте корреляцию с причинностью в своих данных. Если в датасете дорогие товары всегда красные, модель «решит», что красный цвет означает высокую цену. При смене дизайна сайта предсказания рассыпятся.
Не доверяйте объяснимости одного метода. Классический SHAP показывает, какие признаки важны, но не отвечает, почему именно они важны. Без контрфактической проверки вы не узнаете, видит ли модель реальную причину.
Не масштабируйте данные вместо их осмысления. Илья Суцкевер прямо говорит: масштабирования недостаточно. Добавить в десять раз больше данных первого слоя не заменит одну причинно-следственную связь из второго или третьего слоя.
Что делать с этим прямо сейчас, по ролям?
Автору на Дзене. Если вы пишете про ИИ, запомните формулу: ограничения искусственного интеллекта чаще всего связаны не с нехваткой данных, а с отсутствием причинных связей в этих данных. Это объяснение работает для любой аудитории и сразу отделяет грамотный текст от поверхностного.
Разработчику и дата-сайентисту в РФ. Проверьте свои датасеты: содержат ли они только наблюдения (первый слой) или включают результаты экспериментов (второй слой). Попробуйте контрфактический Shapley на своей модели: если объяснения не отличаются от классического SHAP, модель, скорее всего, цепляется за побочные признаки.
Предпринимателю. Когда подрядчик рапортует о 95% точности модели, спросите: на каких данных она обучалась и что произойдёт, если условия изменятся. Модель, которая не учитывает причинность, это хрупкий инструмент. В России для экспериментов доступны YandexGPT и GigaChat, но для работы с причинностью на уровне датасетов понадобятся открытые инструменты: SHAP, DoWhy, CausalML.
По моим наблюдениям, большинство практиков в РФ всё ещё мыслят категориями «больше данных, лучше результат». Позиция Барейнбойма и Суцкевера важна именно тем, что она разворачивает фокус: не количество, а качество связей в данных определяет устойчивость модели. Я бы рекомендовал каждому, кто работает с предсказательными моделями, потратить два часа на эксперимент из этой инструкции. Даже если вы не дата-сайентист, понимание трёх слоёв опыта меняет сам подход к оценке любых ИИ-результатов. Честная оговорка: контрфактический анализ пока требует ручной работы и не встроен в популярные фреймворки «из коробки», порог входа выше, чем для SHAP.
Попробуйте генератор промптов dzen.guru
Проверьте, как точная формулировка запроса влияет на результат, и убедитесь, что модель отвечает по существу, а не по случайной корреляции
ПопробоватьГлавный вывод прост: гонка за точностью предсказания без понимания причинности это гонка с завязанными глазами. Добавляйте в датасеты не только «сухие» цифры, но и связи между ними, тогда модель получит полную картину мира, а не его случайный снимок.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Разработчик на Rust нашёл баг в Neural Engine Apple, который пропустил Claude Opus
Компания Apple не выпускала Neural Engine как новый продукт: речь о глубоком техническом разборе уже существующего аппаратного блока, который провёл…

Markdown редактор MarkMello v0.4.0: папки, вкладки и поиск без потери скорости
Почему это важно Markdown-редактор MarkMello остался таким же быстрым при открытии одного файла, но теперь умеет работать с папками, вкладками и поиском, и всё…

Фреймворк ICO собирает пайплайн машинного обучения в единый граф без «швов»
Компания PyTorch и её экосистема давно стали стандартом для инженеров, занимающихся машинным обучением, но типичный пайплайн обучения модели по-прежнему…
Комментарии