Глубокое машинное обучение дополнило информацию о миллионе биологически активных молекул
Лаборатория структурной биоинформатики и сетевой биологии под руководством исследователя ICREA доктора Патрика Алоя дополнила информацию о биоактивности для миллиона молекул с помощью вычислительных моделей глубокого машинного обучения. Также был представлен инструмент для прогнозирования биологической активности любой молекулы, даже при отсутствии экспериментальных данных.
Эта новая методология основана на Chemical Checker — крупнейшей на сегодня базе данных профилей биоактивности для псевдофармацевтических соединений, разработанной той же лабораторией и опубликованной в 2020 году. Chemical Checker собирает информацию из 25 пространств биоактивности для каждой молекулы. Эти пространства связаны с химической структурой молекулы, мишенями, с которыми она взаимодействует, или изменениями, которые она вызывает на клиническом или клеточном уровне. Однако эта детальная информация о механизме действия неполна для большинства молекул.
С помощью нового подхода исследователи интегрировали всю доступную экспериментальную информацию с методами глубокого машинного обучения, что позволило дополнить все профили активности — от химического до клинического уровня — для всех молекул.
"Новый инструмент также позволяет прогнозировать пространства биоактивности новых молекул, и это крайне важно в процессе открытия лекарств, так как мы можем отбирать наиболее подходящих кандидатов и отбрасывать те, которые по тем или иным причинам не сработают", — объясняет доктор Алой.
Программная библиотека находится в свободном доступе для научного сообщества на сайте bioactivitysignatures.org и будет регулярно обновляться по мере появления новых данных о биологической активности. С каждым обновлением экспериментальных данных в Chemical Checker будут пересматриваться и искусственные нейронные сети для уточнения оценок.
Прогнозы и надежность
Данные о биоактивности, предсказанные моделью, имеют разную степень надежности в зависимости от различных факторов, включая объем доступных экспериментальных данных и характеристики молекулы.
Помимо прогнозирования аспектов активности на биологическом уровне, система, разработанная командой доктора Алоя, предоставляет меру степени надежности прогноза для каждой молекулы.
"Все модели ошибочны, но некоторые полезны! Мера уверенности позволяет нам лучше интерпретировать результаты и выделять, какие пространства биоактивности молекулы точны, а в каких можно допустить погрешность", — объясняет доктор Мартино Бертони, первый автор работы.
Тестирование системы на библиотеке соединений IRB Barcelona
Для валидации инструмента исследователи проанализировали библиотеку соединений IRB Barcelona в поисках кандидатов, способных модулировать активность связанного с раком транскрипционного фактора SNAIL1, чью активность почти невозможно модулировать из-за прямого связывания лекарств (он считается «неподдающейся воздействию» мишенью).
Из первоначального набора в 17 000 соединений модели глубокого машинного обучения предсказали характеристики (в их динамике, взаимодействии с клетками-мишенями и белками и т.д.) для 131 соединения, подходящего для мишени.
Способность этих соединений деградировать SNAIL1 была подтверждена экспериментально. Наблюдения показали, что для высокого процента соединений эта способность к деградации соответствует предсказаниям моделей, что подтвердило валидность системы.
