Машинное обучение даёт детальное представление о белках

Новый «инструментарий» машинного обучения, способный читать и анализировать последовательности белков, описан в открытом журнале eLife.

Исследование показывает, что искусственные нейронные сети, называемые ограниченными машинами Больцмана (RBM), при обучении на данных о последовательностях могут предоставить богатую информацию о структуре, функции и эволюционных особенностях белков. Считается, что это первый метод, способный извлечь такой уровень детализации только из данных о последовательностях.

Белки состоят из последовательностей молекул, называемых аминокислотами, которые определяют структурные и функциональные свойства конкретного белка. Однако понимание того, какие части последовательностей отвечают за какие свойства, является сложной задачей. «Ответ на этот вопрос может иметь серьёзные последствия для фармацевтической разработки, — объясняет соавтор Жером Тюбиана, бывший аспирант Физической лаборатории Высшей нормальной школы (ENS) в Париже. — Например, он может помочь в создании новых белков с желаемыми функциями или в предсказании будущей эволюции последовательностей белков в живых организмах, таких как патогены, и определении подходящих мишеней для лекарств».

Чтобы исследовать этот вопрос, Тюбиана и его коллеги применили RBM к 20 белковым «семействам» — группам белков, имеющих общее эволюционное происхождение. Исследователи представили подробные результаты для четырёх белковых семейств, включая два коротких белковых домена (Kunitz и WW), один длинный белок-шаперон Hsp70 и синтетические решётчатые белки для тестирования.

Они обнаружили, что после обучения связи между искусственными нейронами в RBM интерпретируемы и связаны со структурой белка, его функцией (например, активностью) или филогенией — эволюционными отношениями между белковыми последовательностями. Кроме того, команда обнаружила, что может использовать RBM для создания новых белковых последовательностей, комбинируя и произвольно усиливая или ослабляя различные искусственные нейронные единицы.

«Наша модель RBM показывает, как методы машинного обучения могут решать сложные задачи распознавания данных и делать выводы из данных интерпретируемым способом, — говорит соавтор Симона Кокко, директор по исследованиям CNRS в Физической лаборатории ENS. — Это противоречит более сложным моделям типа "чёрного ящика", традиционно используемым в науке о данных, поскольку статистические анализы, предоставляемые этими инструментами, в значительной степени неинтерпретируемы. Интерпретируемость нашего метода — большое преимущество для учёных; он обещает позволить им генерировать белки с желаемыми функциями контролируемым образом».

«Теперь интересно будет применить нашу модель к белкам патогенов, — добавляет старший автор Реми Монассон, также директор по исследованиям CNRS в Физической лаборатории ENS и заместитель директора Института Анри Пуанкаре (CNRS/Сорбонна). — Патогены, особенно вирусы, часто могут ускользать от действия лекарств с помощью мутаций, которые делают лечение неэффективным. Наш метод можно использовать для прогнозирования путей мутационного ускользания, доступных функциональному белку из его текущей последовательности, и помочь определить, на какую комбинацию сайтов белка следует нацелить лекарства, чтобы заблокировать все пути».

2019-03-12