Evo 2: прогностический и генеративный геномный ИИ для всех доменов жизни
Исследователи из Arc Institute, Стэнфордского университета и NVIDIA создали Evo 2 — продвинутую модель ИИ, способную предсказывать генетические вариации и генерировать геномные последовательности для всех доменов жизни.
Тестирование показало, что Evo 2 точно предсказывает функциональные эффекты мутаций в прокариотических и эукариотических геномах. Модель также успешно аннотировала геном шерстистого мамонта из сырых геномных последовательностей без прямого обучающего референса, продемонстрировав способность обобщать функцию на основе одной лишь последовательности.
Современные геномные модели плохо справляются с предсказанием функционального воздействия мутаций в разнообразных биологических системах, особенно для эукариотических геномов. Подходы машинного обучения показали некоторый успех в моделировании белковых последовательностей и прокариотических геномов. Сложность эукариотической ДНК с её дальнодействующими взаимодействиями и регуляторными элементами представляет большую проблему.
Evo 2 была разработана для преодоления этих ограничений путём включения масштабного набора обучающих данных, охватывающего бактерии, археи, эукариоты и бактериофаги, с фокусом на широкие геномные паттерны у разных видов, а не на обучение для одной конкретной функции.
В исследовании "Genome Modeling and Design Across All Domains of Life with Evo 2", опубликованном как препринт на bioRxiv, команда детализирует, как модель, обученная на 9.3 триллионах пар оснований ДНК, позволяет делать предсказания и дизайн в масштабе генома.
- Масштаб обучения: Evo 2 обучалась на 9.3 триллионах нуклеотидов (A, T, C или G), что делает её одной из крупнейших биологических моделей. Модель может анализировать и генерировать до 1 миллиона нуклеотидов за раз, что позволяет улавливать дальнодействующие паттерны и взаимосвязи в последовательностях ДНК.
- Подход к обучению: Модель обучалась, предсказывая следующую пару оснований в последовательности, аналогично тому, как языковые модели предсказывают следующее слово в предложении. Этот подход позволяет Evo 2 идентифицировать сложные геномные структуры и точно моделировать функциональное воздействие генетических вариаций.
- Набор данных: Обучающий набор данных OpenGenome2 был тщательно отобран, чтобы исключить геномные последовательности вирусов, инфицирующих эукариотические клетки-хозяева, для снижения потенциальных рисков неправомерного использования.
- Архитектура: Evo 2 использует архитектуру StripedHyena 2, которая сочетает операторы свёртки, зависящие от входных данных, с механизмами внимания, оптимизированными для эффективной обработки длинных последовательностей ДНК. Модель обучалась с использованием 1024 графических процессоров на уровне 40 миллиардов параметров, достигнув более высокой эффективности по сравнению с традиционными трансформерными моделями.
Результаты и возможности
- Прогнозирование: Evo 2 точно предсказывает функциональные эффекты мутаций в прокариотических и эукариотических геномах без необходимости дообучения под конкретную задачу. Модель продемонстрировала чувствительность к мутациям в старт-кодонах, сайтах сплайсинга и консервативных областях генома.
- Сравнение: Специализированные модели, такие как AlphaMissense и GPN-MSA, показали немного лучшие результаты для кодирующих однонуклеотидных вариантов, тогда как Evo 2 продемонстрировала превосходную точность для инделов и некодирующих вариантов.
- Классификация: Классификаторы на основе эмбеддингов, обученные на представлениях Evo 2, достигли передовых результатов в классификации вариантов гена BRCA1, связанных с раком груди.
- Интерпретируемость: Анализ показал, что Evo 2 автономно изучает ключевые биологические структуры, включая сайты связывания транскрипционных факторов, границы экзон-интрон и мотивы белковой структуры. Методы разреженных автоэнкодеров выявили скрытые признаки, соответствующие мобильным генетическим элементам, профагам и CRISPR-ассоциированным последовательностям.
- Генерация последовательностей: Evo 2 успешно создавала полные митохондриальные геномы, бактериальные геномы и последовательности в масштабе хромосом дрожжей. Сгенерированные последовательности обладали реалистичными структурными и эволюционными свойствами, включая точные паттерны синтении, белок-кодирующие области и регуляторные элементы.
- Дизайн: В задаче контролируемого дизайна Evo 2 использовалась для инженерии последовательностей ДНК с программируемой доступностью хроматина. Интегрируя модели доступности хроматина Enformer и Borzoi, Evo 2 генерировала последовательности со специфическими регуляторными особенностями, включая возможность кодирования сообщений азбукой Морзе в эпигенетических структурах.
Evo 2 представляет собой значительный шаг вперёд в области геномного ИИ, сочетая прогностическую точность с генеративными возможностями в масштабе всего генома. Исследователи открыто предоставляют код обучения, параметры модели и набор данных OpenGenome2, чтобы ускорить геномные исследования. Будущие приложения Evo 2 могут включать масштабные популяционно-генетические исследования, синтетическую биологию и продвинутый эпигеномный дизайн.
