Глубокое обучение и биоинформатика позволили детально изучить молекулы гликанов для понимания инфекций

Поверхность каждой живой клетки и даже вирусов покрыта гликанами — длинными разветвлёнными цепями простых сахаров, соединённых ковалентными связями. Эти клеточные сахара регулируют межклеточные контакты, включая прикрепление бактерий к клеткам хозяина. Несмотря на повсеместность и важность, гликаны остаются малоизученными из-за своей сложности. В отличие от четырёх "букв" нуклеотидов в ДНК и РНК, "алфавит" гликанов состоит из сотен различных моносахаридов, которые могут соединяться в последовательности с почти бесконечным разнообразием длин и ветвлений.

Учёные из Wyss Institute for Biologically Inspired Engineering при Гарвардском университете и Массачусетского технологического института (MIT) разработали новые методы машинного обучения и биоинформатики, позволяющие систематически изучать гликаны и идентифицировать последовательности, участвующие во взаимодействиях микробов с клетками хозяина. Инструменты представлены в новой статье в Cell Host & Microbe и доступны онлайн как бесплатное Wyss WebApp.

"Созданные нами языковые модели могут предсказать, будет ли и как данный гликан обнаружен иммунной системой человека, что помогает определить, вероятно ли, что штамм бактерий, несущий этот гликан на поверхности, является патогенным", — сказал первый автор Даниэль Бойяр, Ph.D.

Правила грамматики гликанов

Поскольку гликаны — это самый внешний слой всех типов живых клеток, они вовлечены в процесс инфекции. Это создало эволюционную "гонку вооружений": бактериальные гликаны эволюционируют, чтобы имитировать гликаны клеток хозяина для уклонения от иммунного ответа. Чтобы проследить эту историю, команда обратилась к алгоритмам машинного обучения, в частности, к обработке естественного языка (NLP).

Сначала команда собрала большую базу данных последовательностей гликанов — SugarBase, содержащую 19 299 уникальных последовательностей. В ней они идентифицировали 1027 уникальных молекул или связей, названных "гликобуквами", составляющими алфавит гликанов. Комбинации из трёх гликобукв и двух связей были определены как "гликослова".

Для анализа последовательностей гликобукв и выделения гликослов команда использовала двунаправленную рекуррентную нейронную сеть (RNN). Их языковая модель на основе гликобукв, названная SweetTalk, была обучена на последовательностях из SugarBase.

SweetTalk показала, что из почти 1,2 триллиона теоретически возможных гликослов в базе данных существующих гликанов присутствовало только 19 866 (~0,0000016%). Наблюдаемые гликослова также имели тенденцию группироваться в кластеры с высоко схожими последовательностями, что частично указывает на таксономические группы, в которых они найдены. Эти результаты, вероятно, отражают высокую "стоимость" для организма эволюции специализированных ферментов для построения специфических субструктур гликанов.

Учитывая важную роль гликанов в иммунитете, исследователи дообучили SweetTalk на меньшем, курируемом списке гликанов, которые, как известно из литературы, вызывают иммунный ответ. При предсказании иммуногенности последовательностей гликанов из SugarBase модель SweetTalk достигла точности ~92% по сравнению с ~51% для модели, обученной на перемешанных последовательностях. Например, гликаны, богатые рамнозой (простым сахаром, который есть у бактерий, но не у млекопитающих), были однозначно помечены SweetTalk как иммуногенные.

Исследование происхождения и функций

На основе успеха первой модели команда предположила, что глубокое обучение может также прояснить "генеалогическое древо" последовательностей гликанов. Для этого они построили классификатор на основе языковой модели под названием SweetOrigins. Они дообучили новую модель на другой задаче: предсказании таксономической группы гликанов путём изучения видовоспецифичных особенностей, указывающих на их эволюционную историю.

Было создано восемь моделей SweetOrigins, способных классифицировать таксономическую группу гликана с высокой точностью. Например, модель точно предсказала гликаны из царств Animalia (91,1%) и Bacteria (97,2%), что позволяет быстро классифицировать гликан неизвестного происхождения.

Затем исследователи использовали SweetOrigins для изучения взаимодействий хозяин-патоген, рассудив, что различия в гликанах, ассоциированных с различными штаммами E. coli, могут предсказать их инфекционность. Они обучили классификатор на основе глубокого обучения с той же архитектурой языковой модели на специфичных для E. coli последовательностях гликанов и смогли предсказать патогенность штамма E. coli с точностью ~89%.

"Интересно, что гликаны, которые наша модель предсказывает как наиболее связанные с инфекцией, поразительно похожи на гликаны, обнаруженные на клетках, формирующих слизистые барьеры в телах животных, которые не пропускают патогены", — сказал Диого Камачо, Ph.D., соавтор статьи.

Для более глубокого изучения функций гликанов во взаимодействиях хозяин-микроб команда разработала метод выравнивания последовательностей гликанов, который сравнивает отдельные последовательности для определения консервативных областей. Они выбрали специфическую полисахаридную последовательность из патогена Staphylococcus aureus, которая, как известно, увеличивает вирулентность бактерии. При сравнении этого полисахарида с похожими последовательностями в наборе данных они нашли наилучшее соответствие с энтеробактериальным общим антигеном (ECA) — гликаном, обнаруженным в семействе Enterobacteriaceae.

Команда также обнаружила ECA-подобные последовательности, ассоциированные с бактериями родов Staphylococcus, Acinetobacter и Haemophilus, которые не входят в семейство Enterobacteriaceae. Это говорит о том, что, помимо имитации гликанов своих хозяев, бактериальные гликаны также могут эволюционировать, чтобы имитировать гликаны других бактерий, например, из нашего микробиома, и что патогенность может возникать через гликаны микробов, которые традиционно не считаются опасными.

"Ресурсы, которые мы разработали, — SugarBase, SweetTalk и SweetOrigins — позволяют быстро обнаруживать, понимать и использовать последовательности гликанов, а также предсказывать патогенный потенциал бактериальных штаммов на основе их гликанов", — сказал соавтор Джим Коллинз, Ph.D.

2020-10-28