Управление сложностью: Новый инструмент для изучения укладки белка упрощает понимание того, как последовательность кодирует структуру

Укладка белка — это процесс превращения полипептида из случайного клубка в трёхмерную конформацию, в которой он может выполнять свою биологическую функцию. База данных белковых структур (Protein Data Bank, PDB) чрезвычайно сложна, что затрудняет понимание того, как аминокислотная последовательность кодирует структуру.

Учёные из Дартмутского колледжа деконструировали вселенную известных белковых структур на повторно используемые строительные блоки, которые они назвали третичными структурными мотивами (TERMs). Они обнаружили, что 50% белковых конформаций в PDB с субангстремным разрешением описываются удивительно небольшой группой всего из примерно 600 TERMs. Более того, TERMs позволили им выявить взаимосвязи между последовательностью и структурой.

Ключевые вызовы и подход

Основной задачей было разложение набора известных структур на стандартные повторно используемые мотивы. Профессор Геворг Григорян отметил, что главной сложностью было понять, с чего начать, поскольку визуально определить границы структурных "букв" невозможно.

Учёные решили эту проблему, не определяя априори, какими должны быть "буквы" структурного алфавита, а задав цель, которую эти "буквы" должны выполнить: описать набор всех остатков и контактов между остатками, наблюдаемых в известных структурах. Затем они выбрали наименьший набор повторно используемых блоков (TERMs), который достигал бы этой цели.

Для обработки 13 миллионов кандидатов в TERMs и определения того, какие остатки и контакты они объясняют, исследователи использовали свой ранее разработанный эффективный алгоритм поиска структур MASTER и вычислительный кластер.

Основные результаты

  • Эффективное отображение последовательности на структуру: Поскольку универсальные TERMs многократно встречаются в неродственных белках, анализ их вхождений позволяет выявлять последовательностные правила, лежащие в основе каждого мотива. Эксперименты показали, что значительная часть возникающей статистики последовательностей, вероятно, отражает фундаментальные взаимосвязи "последовательность-структура", а не случайный шум или эволюционные предубеждения базы данных.
  • Высокая степень вырожденности: Тот факт, что всего ~600 TERMs описывают половину известного структурного пространства белков, указывает на то, что на локальном структурном уровне существует не так уж много естественно возникающих паттернов. Большинство белковых структур на локальном уровне довольно вырождено. Для полного покрытия структурной вселенной требуются десятки или сотни тысяч TERMs, но они описывают более редкие геометрии.

Значение для науки и приложений

Исследование имеет серьёзные последствия для предсказания структуры белка и дизайна белков, предлагая новый способ выявления взаимосвязей "последовательность-структура".

  • В отличие от традиционных статистических потенциалов, описывающих упрощённые структурные особенности (диэдрические углы, расстояния), TERMs позволяют описывать статистику последовательностей в контексте целостных структурных окружений. Это гораздо полезнее как для дизайна, так и для предсказания.
  • В дизайне это позволяет лучше понять, какие последовательности будут или не будут формировать целевую структуру.
  • В предсказании это помогает направлять структурный сэмплинг к конформациям, чьи TERMs наиболее согласуются с моделируемой структурой.

Потенциальным ограничением является объём доступных данных, так как не все TERMs имеют достаточно известных примеров для построения точных моделей последовательностей. Однако ранние результаты показывают, что статистика на основе TERMs уже даёт нетривиальные insights, которые другие методы не могут легко получить.

Будущие направления

Команда сосредоточена на расширении возможностей своих методов на основе TERMs для дизайна и предсказания структуры белков. Они также заинтересованы во внедрении подходов, основанных на ансамблях (ensemble-based modeling), и использовании расчётов на основе статистической механики для повышения точности и надёжности методов белкового дизайна.

Помимо прикладных задач, это исследование меняет фундаментальное понимание белковой структуры в целом и может помочь в обучении благодаря идеям модульности и представления стандартных мотивов.