Более надежные биоинформатические инструменты для изучения белков
Многие белки способны спонтанно реорганизовываться внутри клеток, образуя молекулярные конденсаты — безмембранные внутриклеточные структуры, формируемые одним или несколькими белками — в процессе, известном как жидкофазное разделение (LLPS). Этот биологический процесс ключевой, так как позволяет белкам организовываться, взаимодействовать и функционировать эффективно и регулируемо в клеточной среде. Сбои в этом механизме могут приводить к нейродегенеративным заболеваниям, раку или нарушениям развития.
Исследовательская группа из Института биотехнологии и биомедицины (IBB) Автономного университета Барселоны (UAB) создала наиболее полный и надежный набор данных о белках, участвующих в LLPS. Их работа предлагает протокол, преодолевающий ограничения существующих алгоритмов для получения прогностических моделей, в которых они выявили недостатки, мешающие совместному и точному анализу данных. Созданные ресурсы доступны на открытой онлайн-платформе.
Исследование, опубликованное в журнале Genome Biology, возглавляли Сальвадор Вентура, профессор кафедры биохимии и молекулярной биологии UAB и директор Института исследований и инноваций Парк Таули (I3PT-CERCA); Михал Бурдкевич, исследователь Марии Самбрано в IBB и руководитель биоинформатической группы в Медицинском университете Белостока (Польша); и Карлос Пинтадо Грима, исследователь IBB и первый автор исследования.
Команда точно классифицировала два основных типа белков, участвующих в LLPS: те, которые могут образовывать конденсаты самостоятельно (драйверы), и те, которые только входят в их состав (клиенты). Кроме того, они разработали первый стандартный набор белков, не участвующих в этом процессе, включающий как белки с определенной структурой, так и неупорядоченные белки — «ключевой элемент для справедливого и эффективного обучения систем искусственного интеллекта», — говорит Вентура, который также координирует исследовательскую группу по фолдингу белков и конформационным заболеваниям в IBB.
Для валидации своей работы ученые исследовали специфические физико-химические свойства, участвующие в LLPS, в различных подмножествах белковых последовательностей, выявив значительные различия между ними. Более того, они оценили прогнозирование LLPS с помощью шестнадцати существующих биоинформатических инструментов, что является наиболее полным сравнением на сегодняшний день.
Созданный в исследовании набор данных позволяет точно определять роль конкретного белка в LLPS. Всего исследователи классифицировали 2876 различных белков. «Наши данные созданы для гарантии надежности и совместимости между собой, основаны на стандартизированных критериях отбора и категоризации. До сих пор у нас не было достаточно надежных данных для строгих прогнозов. С этим новым ресурсом мы открываем дверь для разработки новых, более точных вычислительных инструментов», — говорит Вентура.
