Ваш генетический код имеет много «слов» для одного и того же — теория информации может объяснить эту избыточность
Почти вся жизнь, от бактерий до человека, использует один и тот же генетический код. Этот код действует как словарь, переводя гены в аминокислоты, используемые для построения белков. Универсальность кода указывает на общее происхождение всех живых организмов и его ключевую роль в структуре, функции и регуляции биологических клеток.
Понимание работы генетического кода — основа генной инженерии и синтетической биологии. Но остаётся много нерешённых загадок, например, почему код важен для таких процессов, как сворачивание белка.
Используя теорию информации — математику хранения и передачи данных — можно изучать эти вопросы. Подобно тому, как компьютерам нужны строки двоичного кода, биологические процессы также опираются на биты информации.
Новое исследование предполагает, что теория оптимизации может объяснить давнюю загадку об избыточности кодирования аминокислот.
Разные слова для одного и того же
«Словарь» генетического кода состоит из «слов», составленных из четырёх букв: A, C, G и U. Каждая буква обозначает нуклеотид: аденин, цитозин, гуанин и урацил. Молекулярная машина — рибосома — читает этот словарь, чтобы перевести гены в белки.
Рибосомы читают трёхбуквенные слова — кодоны. Существует 64 возможные комбинации из четырёх букв, образующих разные кодоны. Из них 61 кодирует аминокислоты, а 3 сигнализируют об остановке синтеза белка. Например, AUG кодирует аминокислоту метионин и указывает на начало белка.
Но, как и в любом языке, здесь есть синонимы — разные кодоны могут кодировать одну и ту же аминокислоту. Поскольку аминокислот всего 20, а кодонов для их кодирования — 61, возникает значительное перекрытие. У аминокислоты может быть от 1 до 6 различных кодирующих её кодонов. Только две аминокислоты (метионин и триптофан) имеют ровно один кодон. Эта избыточность помогает рибосомам работать правильно даже при наличии «опечатки» в коде.
Принципы инженерии природы
Почему у одних аминокислот больше синонимов, чем у других — загадка, десятилетиями озадачивающая учёных. Есть ли в этом закономерность или это случайность?
Если бы генетический код создавал инженер, он бы обеспечил каждой аминокислоте схожую степень избыточности для защиты от ошибок. Отображение 61 кодона на 20 аминокислот было бы примерно равным, по 3 кодона на каждую.
Но у природы другие приоритеты. Эволюционные модели показывают, что природа всегда стремится к оптимизации. Оптимальной должна быть не только конечная форма белка, но и промежуточные. Оптимизация позволяет естественным системам адаптироваться к разным средам.
Учёные понимают некоторые принципы, которым следует природа. Например, пространственное расположение атомов и молекул в коде и вокруг него влияет на его функцию, как и коэволюция других клеточных структур, участвующих в создании белков.
Теория информации и генетика
Исследование указывает на два других возможных значимых фактора, которые учитывают природные системы: информационно-теоретическую природу генетического кода и принцип максимальной энтропии.
Подобно тому, как компьютер обрабатывает данные из 0 и 1, жизнь обрабатывает генетический код на основе данных из четырёх букв A, C, G и U. Однако с математической точки зрения, самый энергоэффективный способ представления данных — не двоичный (основание 2), а с основанием e (число Эйлера). Это иррациональное число (приблизительно 2,718).
Склонность природы к оптимизации с использованием этого иррационального числа ответственна за бесконечно повторяющиеся фракталы, наблюдаемые в изрезанных береговых линиях, листьях папоротника, снежинках и деревьях. Помимо биологии, информационная оптимизация с использованием e также применяется в математике и космологии.
Другой принцип, действующий в природе, — принцип максимальной энтропии. Энтропия — мера беспорядка в системе, и этот принцип гласит, что системы эволюционируют к состояниям с большим беспорядком. Он позволяет исследователям делать выводы из ограниченных данных и объясняет, как аминокислоты взаимодействуют в белках.
В контексте группировки кодонов принцип максимальной энтропии подразумевает, что природа максимально «перемешивает» данные. Это означает, что функция, описывающая распределение групп кодонов, должна быть математически сложной для обращения. Изучение того, как максимизировать математическую сложность этой функции, выявляет потенциальные закономерности, лежащие в основе группировки кодонов.
Эти два принципа могут помочь описать распределение групп кодонов в генетическом коде и указывают на полезность математики для анализа природных систем. Хотя биологических загадок ещё много, теория информации может стать мощным инструментом для их решения.
