Игорь Градов
Игорь Градов
5 мин
aggregator

Google DeepMind признал: AlphaFold в предсказании белков дал лишь статичную позу, а не живую биологию

Google DeepMind признал: AlphaFold не решил задачу сворачивания белков, и масштабирование данных само по себе не приведёт к прорыву в биологии.

Google DeepMind признал: AlphaFold в предсказании белков дал лишь статичную позу, а не живую биологию
Почему это важно

Предсказание структуры белков с помощью AlphaFold часто подаётся как завершённая история успеха ИИ, но сами создатели системы и ведущие биологи говорят: статичная структура белка далеко не равна пониманию того, как он работает в живой клетке.

Дискуссия о реальных границах AlphaFold в предсказании белков разгорелась на панели, где столкнулись два взгляда. Пушмит Кохли из Google DeepMind и Сэл Кандидо из Biohub (исследовательский центр, основанный Марком Цукербергом и Присциллой Чан для борьбы с болезнями) обсудили, почему победа AlphaFold была только началом, а не финалом. Модератором выступил Брэндон Андерсон. Для русскоязычных исследователей и авторов, пишущих про ИИ, этот спор объясняет, почему простое наращивание данных и вычислений не заменяет научного понимания и почему копировать подход AlphaFold «в лоб» для российских задач в биологии недостаточно.

Что именно AlphaFold не решил?

AlphaFold предсказывает статичную трёхмерную структуру белка, то есть его «застывшую позу». Но белки в живой клетке не стоят на месте. Они меняют форму, взаимодействуют с другими молекулами, а некоторые участки белка вообще не имеют фиксированной структуры (это называется «неупорядоченные области»).

Кохли прямо признал: AlphaFold не решил всю проблему сворачивания белков. Динамика белка, его поведение во времени и взаимодействие с другими компонентами клетки остаются за пределами того, что умеет текущая система.

Кандидо добавил: чтобы перейти от моделей отдельных белков к моделям целых биологических систем, нужны принципиально другие наборы данных. Например, снимки крио-электронной микроскопии (cryo-EM, метод, при котором молекулы замораживают и фотографируют электронным пучком) могут дать более богатое представление о биологии, чем те данные, на которых учился AlphaFold.

Аргументы за: масштабирование всё-таки работает?

Горький урок ИИ (Bitter Lesson, принцип, сформулированный исследователем Ричардом Саттоном: методы, которые масштабируются с ростом вычислений, в конечном счёте побеждают) действительно подтверждается в ряде задач.

  • Языковые модели белков (protein language models, модели, обученные на последовательностях белков так же, как GPT обучена на текстах) уже содержат скрытое биологическое знание, которое учёные пока не полностью «распаковали».
  • Низкокачественные метагеномные данные (данные, собранные из окружающей среды, например из проб почвы или воды, без выделения отдельных организмов) улучшают такие модели, даже когда «чистых» данных мало.
  • Когда найден правильный закон масштабирования (scaling law), задача переходит из научной в инженерную: больше данных и вычислений даёт предсказуемо лучший результат.

Кандидо подчеркнул: поиск правильного закона масштабирования важнее, чем слепое увеличение размера модели.

Аргументы против: почему «больше данных» не спасёт?

Участники панели назвали несколько конкретных ограничений.

  • Данные не те. Исследователи ИИ склонны работать с теми данными, которые доступны, а не с теми, которые нужны для самых важных научных вопросов. Кандидо признал это прямо: «Я ленивый, поэтому работаю с тем, что есть».
  • Архитектура вручную. AlphaFold построен на специально сконструированной архитектуре с научной интуицией, заложенной в саму структуру модели (так называемый индуктивный приоритет, inductive bias, когда разработчики закладывают в модель знания о физике белков). Это не универсальный трансформер (Transformer, архитектура нейросетей, на которой работают ChatGPT и другие языковые модели), а штучная работа.
  • Статика против динамики. Предсказание замороженной структуры не объясняет, как белок ведёт себя во времени, как он взаимодействует с лекарством и почему ломается при болезни.
  • Виртуальная клетка требует другого подхода. Построение предсказательной модели живой клетки (virtual cell), цель, к которой стремится Biohub, требует не просто больше данных, а принципиально иных типов данных и способов их интеграции.

Кохли также отметил: хорошие данные важнее, чем просто большое количество данных. Качество побеждает объём.

Один из частых ошибок: люди думают, что законы масштабирования существуют везде и всегда. На самом деле бо́льшая часть работы — это поиск ситуации, где вложение вычислений и данных реально даёт лучший результат. : Сэл Кандидо, Biohub

Что с этого вам прямо сейчас?

Авторам Дзена, пишущим про ИИ и науку. AlphaFold в предсказании белков остаётся мощным инструментом, но подавать его как «решённую проблему» некорректно. Если пишете про ИИ в биологии, уточняйте: система предсказывает статичную структуру, а не динамику и не взаимодействия. Это сразу отличает грамотный текст от поверхностного.

Исследователям и разработчикам в РФ. В России доступ к вычислительным мощностям уровня DeepMind ограничен. Вывод из этой дискуссии прямой: слепое масштабирование не главная стратегия. Поиск правильных данных и правильной задачи, где масштабирование реально работает, даёт больше, чем гонка за размером модели. AlphaFold с открытыми весами доступен, но для задач, связанных с динамикой белков или целыми клеточными системами, нужны другие подходы и другие данные.

Предпринимателям в биотехе. Кандидо и Кохли оценили горизонт ускорения открытия лекарств с помощью ИИ в 10-100 раз, но оговорились: для этого нужны прорывы в 10 раз, а не улучшения на 10 процентов. Если вы строите продукт на AlphaFold, закладывайте в план, что предсказание структуры это только первый шаг, а не конечная ценность.

Мнение редакции dzen.guru

Мне эта дискуссия ценна одним честным признанием: создатели самого громкого ИИ-проекта в биологии открыто говорят, что задача не решена. Это редкость в индустрии, где каждый релиз подаётся как финальная победа.

Для тех, кто работает с ИИ в России, вывод практический. Мы часто слышим: «Возьмите большую модель, дайте больше данных, и всё заработает». Панель показывает, что даже в DeepMind и Biohub это не так. Научная интуиция, выбор задачи и качество данных перевешивают объём. Это хорошая новость для команд с ограниченными ресурсами, если они работают на правильной задаче.

Оговорка: панель не содержала конкретных бенчмарков или дат запуска новых систем, поэтому воспринимайте её как стратегический ориентир, а не как дорожную карту.

Чего ждать дальше?

Участники сошлись в том, что следующий рубеж не «AlphaFold 4 с удвоенной точностью», а переход от отдельных белков к моделям целых клеточных систем и от статичных снимков к динамике. Кохли допустил, что будущие фронтирные модели ИИ смогут интерпретировать другие ИИ-системы лучше, чем человек, и что калибровка неопределённости (способность модели честно сообщить «я не уверена») важнее полной интерпретируемости. Для практиков AlphaFold в предсказании белков это означает: инструмент продолжит развиваться, но ожидать, что он сам по себе «вылечит все болезни», преждевременно, и Biohub, чья миссия именно в этом, считает горизонт таких прорывов задачей на десятилетия.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

aggregator

Новости ИИ: агенты теряют способность отказывать после 20 реплик диалога

Исследование показало, что ИИ-агенты теряют способность отказывать в опасных действиях по мере разговора и при доступе к инструментам, а один из агентов…

6 мин
Standard Bots привлекла $200 млн: ИИ-надёжность строят на локальном инференсе и своём железе
aggregator

Standard Bots привлекла $200 млн: ИИ-надёжность строят на локальном инференсе и своём железе

Лид Standard Bots, американский производитель промышленных роботов с ИИ, привлёк 200 миллионов долларов в раунде Series C при оценке в 1 миллиард, сделав…

5 мин
aggregator

Типсейф ИИ набрал $100M выручки за неделю: decision-модели в 10 раз дешевле генеративных

Почему это важно Появилась новая категория ИИ-моделей, которые не генерируют текст, а принимают решения: классифицируют, маршрутизируют, оценивают. Стоимость…

6 мин