Оценка моделей глубокого обучения для расшифровки функциональных свойств белков
Глубокие языковые модели, такие как BERT, T5, XLNet и GPT, перспективны не только для анализа речи и текстов, но и для применения в биомедицине и биотехнологии для изучения генетических кодов и белков.
Исследователи из университетов Турции (Hacettepe University, Middle East Technical University, Karadeniz Technical University) оценили потенциал таких моделей для изучения белков и предсказания их функциональных свойств. Их работа опубликована в Nature Machine Intelligence.
Концепция: Молекулярно-биологические данные можно смоделировать как язык. Последовательность гена или белка — это «предложение», а его «семантика» — конкретные биологические, физические и химические свойства этих биомолекул. Цель — создание моделей машинного обучения, которые на основе числовых представлений (эмбеддингов) белков, полученных языковыми моделями, с высокой точностью предсказывали бы их функциональные свойства.
Методология: В исследовании оценивали способность различных подходов к языковому моделированию белков (архитектуры BERT, T5, XLNet, ELMO и др.) извлекать скрытые закономерности, содержащие важные сведения о функциях белков. Поскольку самостоятельное предварительное обучение таких моделей требует огромных ресурсов, авторы сосредоточились на вторичном обучении с учителем для предсказания функциональных свойств.
Для сравнения производительности моделей команда создала четыре контрольных набора данных разного уровня сложности, исследующих:
- Семантическое сходство белков.
- Функциональные определения на основе онтологий.
- Семейства белков-мишеней для лекарств.
- Физические взаимодействия между белками.
Эти механизмы тесно связаны с возникновением и прогрессированием наследственных заболеваний, например, различных типов рака.
Ключевой вывод: Глубокие языковые модели успешно обучаются функциональным свойствам белков, используя в качестве единственного входного данных только аминокислотную последовательность, что является сложной задачей. Эти результаты согласуются с выводами недавних исследований по предсказанию структуры белков (AlphaFold2, RoseTTAFold), которые также используют последовательность для предсказания 3D-структуры.
Перспективы: В будущем такие модели могут способствовать развитию персонализированной медицины, например, анализируя молекулярные особенности пациентов для разработки индивидуального лечения. Однако перед интеграцией в реальные клинические системы существующие методы требуют значительного улучшения.
Дальнейшая работа: Учёные сейчас работают над новой системой представления белков, которая, помимо аминокислотных последовательностей, будет использовать сетевые данные (например, известные белок-белковые взаимодействия) и знания из неструктурированных биомедицинских текстов (научные статьи). Цель — создание универсального представления белка, пригодного для любых биомедицинских или биотехнологических задач.
