ИИ помогает исследователям понять роль вирусов в океанах и кишечнике

Вирусы — загадочная и малоизученная сила в микробных экосистемах. Они могут инфицировать, убивать и манипулировать клетками человека и бактерий почти в любой среде, от океанов до кишечника. Однако полной картины их влияния на окружающую среду нет, во многом из-за их чрезвычайного разнообразия и способности быстро эволюционировать.

Изучать сообщества микробов в лаборатории сложно. Многие микроорганизмы трудно культивировать, а их естественная среда имеет гораздо больше факторов, влияющих на их успех, чем можно воссоздать в лаборатории.

Поэтому системные биологи часто секвенируют всю ДНК в образце (например, фекальном), выделяют вирусные последовательности ДНК, а затем аннотируют участки вирусного генома, кодирующие белки. Эти аннотации о расположении, структуре и других особенностях генов помогают понять функции вирусов в среде и идентифицировать их типы. Аннотация происходит путём сопоставления вирусных последовательностей из образца с ранее аннотированными последовательностями из публичных баз данных генетических последовательностей вирусов.

Однако учёные идентифицируют вирусные последовательности в ДНК из окружающей среды со скоростью, которая намного опережает нашу способность их аннотировать. Это означает, что публикуемые исследования о вирусах в микробных экосистемах используют неприемлемо малую долю доступных данных.

Аннотирование вирусов с помощью ИИ

Чтобы улучшить способность исследователей изучать вирусы, наша команда разработала новый подход к аннотированию вирусных последовательностей с использованием искусственного интеллекта. С помощью языковых моделей для белков, аналогичных большим языковым моделям вроде ChatGPT, но специфичных для белков, мы смогли классифицировать ранее невиданные вирусные последовательности. Это открывает дверь для изучения вирусов и решения биологических вопросов, на которые трудно ответить текущими методами.

Большие языковые модели используют связи между словами в огромных наборах текстовых данных, чтобы давать ответы на вопросы, которым их явно не «учили». Аналогично, белковые языковые модели — это алгоритмы ИИ, обученные распознавать связи между миллиардами белковых последовательностей из разных сред. Благодаря такому обучению они могут делать выводы о сущности и функциях вирусных белков.

В нашем доказательстве концепции мы обучили нейронные сети на ранее аннотированных вирусных белковых последовательностях в предварительно обученных белковых языковых моделях, а затем использовали их для предсказания аннотаций новых вирусных белковых последовательностей. Наш подход позволяет исследовать, что именно модель «видит» в конкретной вирусной последовательности, что приводит к определённой аннотации. Это помогает выявить белки-кандидаты, представляющие интерес, на основе их функций или организации генома, сужая область поиска в огромных наборах данных.

Определяя функции более отдалённо родственных вирусных генов, белковые языковые модели могут дополнять текущие методы, давая новые insights в микробиологии.

Примеры открытий

Например, с помощью нашей модели мы обнаружили ранее нераспознанную интегразу (белок, способный перемещать генетическую информацию в клетки и из них) у глобально распространённых морских пикоцианобактерий Prochlorococcus и Synechococcus. Эта интеграза может перемещать гены в популяциях этих бактерий в океанах и позволять им лучше адаптироваться к изменяющейся среде.

Наша языковая модель также идентифицировала новый вирусный капсидный белок, широко распространённый в мировом океане. Мы создали первую картину организации его генов, показав, что он может содержать разные наборы генов, что, как мы полагаем, указывает на разные функции этого вируса в среде.

Эти предварительные результаты представляют лишь два из тысяч аннотаций, предоставленных нашим подходом.

Анализ неизвестного

Большинство из сотен тысяч недавно открытых вирусов остаются неклассифицированными. Многие вирусные генетические последовательности соответствуют семействам белков с неизвестной функцией или никогда ранее не встречались. Наша работа показывает, что подобные белковые языковые модели могут помочь в изучении угрозы и потенциала множества неохарактеризованных вирусов нашей планеты.

Хотя наше исследование было сосредоточено на вирусах в мировом океане, улучшенная аннотация вирусных белков критически важна для лучшего понимания роли вирусов в здоровье и болезнях человеческого организма. Мы и другие исследователи выдвигаем гипотезу, что активность вирусов в микробиоме кишечника человека может изменяться во время болезни. Это означает, что вирусы могут помочь идентифицировать стресс в микробных сообществах.

Однако наш подход также ограничен, поскольку требует высококачественных аннотаций. Исследователи разрабатывают более новые белковые языковые модели, которые включают другие «задачи» в обучение, особенно предсказание структуры белков для обнаружения сходных белков, чтобы сделать их более мощными.

Предоставление всех инструментов ИИ в соответствии с FAIR-принципами (данные должны быть находимыми, доступными, совместимыми и повторно используемыми) может помочь исследователям в полной мере реализовать потенциал этих новых способов аннотирования белковых последовательностей, ведущих к открытиям на благо здоровья человека.

2024-05-16