Сложные модели глубокого обучения не превосходят простые базовые в предсказании генетических возмущений
Глубокое обучение показало большой потенциал в предсказании и конструировании функциональных ферментов и белков. Однако новое исследование, опубликованное в Nature, показывает, что в другой области — предсказании влияния генетических возмущений на транскриптом — сложные фундаментальные модели не превосходят простые базовые методы.
Ключевые выводы исследования:
- Фундаментальные модели (deep-learning-based foundation models), обученные на огромных массивах данных (миллионы клеток), включая scGPT и scFoundation, не показали последовательного превосходства над простыми базовыми моделями при предсказании эффекта одиночных или двойных генетических возмущений.
- В случае двойных возмущений (одновременное изменение двух генов) ошибка предсказания у моделей глубокого обучения была выше, чем у простых аддитивных базовых моделей, которые просто суммируют эффекты изменений отдельных генов.
- Большинство сложных моделей также плохо справлялись с точным предсказанием сложных генетических взаимодействий.
Контекст и значение:
- Исследование напрямую сравнивало пять ведущих фундаментальных моделей и две другие модели глубокого обучения с четырьмя намеренно простыми базовыми методами (например, "без изменений", усреднение или линейная модель), используя публичные наборы данных CRISPR-возмущений на уровне единичных клеток.
- Цель фундаментальных моделей — научиться обобщённому пониманию работы клеток, чтобы предсказывать исходы без проведения экспериментов, что могло бы ускорить разработку лекарств.
- Однако результаты показывают, что большая вычислительная стоимость и сложность таких моделей не гарантируют лучшей производительности по сравнению с простыми и менее ресурсоёмкими методами.
- Исследователи пришли к выводу, что амбициозная цель фундаментальных моделей — обобщаемое понимание клеточных состояний — пока остаётся недостижимой, и подчеркнули важность строгого тестирования новых моделей в сравнении с существующими.
