Анализ 89 моделей метаболических процессов выявил ошибки в 44 из них и предложил исправления
Метаболические сети — это математические модели всех возможных последовательностей химических реакций, доступных органу или организму. Их используют для создания микробов в производственных процессах или для изучения болезней. На их сборку, основанную на генетическом анализе и эмпирических исследованиях, могут уходить годы.
Новый аналитический инструмент, разработанный в MIT, показывает, что многие из этих моделей могут быть ошибочными. Однако этот же инструмент может упростить их исправление.
База моделей в [Калифорнийском университете в] Сан-Диего содержит множество моделей, вычисленных с использованием арифметики с плавающей запятой — приблизительного числового представления для повышения эффективности вычислений. Исследователи доказали, что для корректного анализа требуется точная арифметика. При её применении оказалось, что многие модели, считавшиеся реалистичными, не обеспечивают рост организма ни при каких обстоятельствах.
Новый инструмент и проведённый с его помощью анализ описан в Nature Communications. Ведущий автор — Леонид Чинделевич, бывший аспирант в группе Бонни Бергер, ныне постдок в Гарвардской школе общественного здравоохранения.
Арифметика с плавающей запятой похожа на научную нотацию для компьютеров. Она представляет числа как десятичную дробь, умноженную на основание (например, 2 или 10), возведённое в степень. Хотя она жертвует точностью по сравнению с точной арифметикой, это компенсируется выигрышем в вычислительной эффективности.
Для проведения анализа с точной арифметикой на структурах данных столь огромных и сложных, как метаболические сети, исследователям пришлось найти способ упростить задачу, не жертвуя точностью.
Упрощение сети
Метаболические сети описывают все реакции, доступные конкретному организму (например, дрожжам, E. coli или бактерии туберкулёза). Они показывают, как организм преобразует питательные вещества из окружающей среды в нужные продукты (этанол, клеточные компоненты и т.д.) через последовательности химических реакций, катализируемых ферментами, закодированными в ДНК. Каждый узел сети представляет промежуточную стадию в цепочке реакций.
Для упрощения сетей до уровня, позволяющего провести точный арифметический анализ, Чинделевич и Бергер разработали алгоритм, который:
- Идентифицирует все последовательности реакций, которые не могут произойти в рамках модели, и удаляет их.
- Находит кластеры реакций, которые всегда работают согласованно (фактически выполняя одну реакцию), и сворачивает их в единую реакцию.
Ключевым моментом является математическое доказательство того, что эти модификации не влияют на результат анализа.
Точный арифметический подход позволяет соблюсти ключевое предположение модели: в установившемся состоянии для каждого метаболита производство уравновешивает потребление (нет ни избыточного производства, ни истощения).
Применив анализ к 89 моделям метаболических сетей из базы данных Сан-Диего, исследователи обнаружили, что 44 из них содержат ошибки или упущения: если бы продукты всех реакций в сетях находились в равновесии, смоделированные организмы были бы неспособны к росту.
Исправление ошибок
Адаптировав алгоритмы из области сжатого зондирования (compressed sensing), Чинделевич и Бергер также могут определить вероятные места ошибок в сети.
Подобно тому, как сжатое зондирование может разложить аудиосигнал на составляющие частоты с наибольшим весом, их алгоритм может изолировать именно те связи в метаболической сети, которые вносят наибольший вклад в её химический дисбаланс.
Исследователи надеются, что эта работа станет стимулом для переанализа многих существующих реконструкций моделей метаболических сетей и позволит предложить исправления до публикации моделей.
Работа меняет отношение к проблеме, так как поднимает вопрос, который большинство считало несущественным, и заставляет быть более внимательными. Ошибки в моделях могли оставаться незамеченными, потому что их анализ часто хорошо согласовывался с эмпирическими данными. Однако ошибки с плавающей запятой различаются в зависимости от программного пакета, что вызывает обеспокоенность по поводу воспроизводимости результатов.
