Расшифровка геномного языка: Новая ИИ-система открывает исходный код биологии

В новом исследовании, опубликованном в Nature Communications, междисциплинарная команда исследователей под руководством Юнхи Хван, докторанта Гарвардского университета, представила систему искусственного интеллекта (ИИ), способную расшифровывать сложный язык геномики.

Геномный язык — это исходный код биологии, описывающий биологические функции и регуляторную грамматику, закодированные в геномах. Команда задалась вопросом: можно ли создать ИИ-движок, который «прочитает» геномный язык, поймет значение (функции и регуляции) генов и станет в нем «бегло говорить»? Для этого они использовали крупнейший и наиболее разнообразный набор микробных метагеномных данных, чтобы обучить Модель Геномного Языка (Genomic Language Model, gLM).

«В биологии у нас есть словарь известных "слов", и исследователи работают в его рамках. Проблема в том, что эта доля известных слов составляет менее одного процента биологических последовательностей», — сказала Хван. «Количество и разнообразие геномных данных взрывообразно растет, но люди не способны обработать такой большой объем сложных данных».

gLM обучается на высокоразнообразных метагеномных данных от микробов, обитающих в различных средах (океан, почва, кишечник человека). Как и большие языковые модели (LLM, например GPT-4), она является самообучающейся (self-supervised) — она учится осмысленным представлениям генов непосредственно из данных, без человеческих меток. Модель учится понимать функциональную «семантику» и регуляторный «синтаксис» каждого гена, анализируя взаимосвязь между геном и его геномным контекстом.

Исследование показывает, что gLM изучает ферментативные функции и корегулируемые модули генов (опероны), а также предоставляет геномный контекст для предсказания функции генов. Модель также изучает таксономическую информацию и контекстную зависимость функций генов.

Примечательно, что gLM не знает, какой именно фермент или бактерию она «видит». Однако, поскольку она обработала множество последовательностей и поняла эволюционные взаимосвязи между ними во время обучения, она способна выводить функциональные и эволюционные отношения между последовательностями.

«Как и слова, гены могут иметь разные "значения" в зависимости от контекста. И наоборот, сильно различающиеся гены могут быть "синонимами" по функции. gLM предлагает гораздо более тонкую основу для понимания функции генов. Это контрастирует с существующим методом прямого однозначного сопоставления последовательности и аннотации, который не отражает динамичную и контекстно-зависимую природу геномного языка», — пояснила Хван.

gLM позволяет биологам анализировать контекст неизвестного гена и его роль, когда он часто встречается в схожих группах генов. Модель может указать, что эти группы генов работают вместе для достижения цели, и предоставить ответы, которых нет в «словаре».

«Традиционные методы функциональной аннотации обычно фокусируются на одном белке за раз, игнорируя взаимодействия между белками. gLM представляет собой значительный шаг вперед, интегрируя концепцию геномных соседств с языковыми моделями, тем самым обеспечивая более полное представление о взаимодействиях белков», — заявил Мартин Штайннеггер, эксперт в области биоинформатики и машинного обучения, не участвовавший в исследовании.

С помощью моделирования геномного языка биологи могут открывать новые геномные паттерны и обнаруживать неизвестные биологические механизмы.

«С помощью gLM мы можем получить новые представления о плохо аннотированных геномах. Модель также может направлять экспериментальную проверку функций и способствовать открытию новых функций и биологических механизмов. Мы надеемся, что gLM сможет ускорить поиск новых биотехнологических решений для борьбы с изменением климата и развития биоэкономики», — заключила Хван.

2024-04-03