Новый подход на основе машинного обучения может ускорить биоинженерию
Ученые из Национальной лаборатории им. Лоуренса в Беркли (Berkeley Lab) Министерства энергетики США разработали метод использования машинного обучения для значительного ускорения проектирования микробов, производящих биотопливо.
Их компьютерный алгоритм начинает работу с обширных данных о белках и метаболитах в микробном пути, производящем биотопливо, но без информации о том, как этот путь фактически работает. Затем он использует данные предыдущих экспериментов, чтобы научиться предсказывать поведение пути. Ученые применили этот метод для автоматического прогнозирования количества биотоплива, производимого путями, внедренными в клетки бактерий E. coli.
Новый подход значительно быстрее текущего способа прогнозирования поведения путей и обещает ускорить разработку биомолекул для многих приложений, помимо коммерчески жизнеспособных биотоплив, таких как лекарства для борьбы с устойчивыми к антибиотикам инфекциями и сельскохозяйственные культуры, устойчивые к засухе.
Исследование было опубликовано 29 мая в журнале Nature Systems Biology and Applications.
В биологии путь (pathway) — это серия химических реакций в клетке, производящих определенное соединение. Исследователи изучают способы перепроектирования путей и их переноса из одного микроорганизма в другой, чтобы использовать инструментарий природы для улучшения медицины, энергетики, производства и сельского хозяйства. Благодаря новым возможностям синтетической биологии, таким как инструмент редактирования генов CRISPR-Cas9, ученые могут проводить такие исследования с беспрецедентной точностью.
«Но в процессе разработки есть значительное узкое место», — заявил Эктор Гарсия Мартин, руководитель группы в Agile BioFoundry Министерства энергетики и директор по количественному метаболическому моделированию в Объединенном институте биоэнергетики (JBEI). Исследование было выполнено Заком Костелло под руководством Гарсии Мартина.
«Очень сложно предсказать, как будет вести себя путь после перепроектирования. Устранение неполадок занимает 99% нашего времени. Наш подход может значительно сократить этот этап и стать новым способом направления биоинженерных усилий», — добавил Гарсия Мартин.
Текущий способ прогнозирования динамики пути требует лабиринта дифференциальных уравнений, описывающих, как компоненты системы изменяются со временем. Эксперты в предметной области разрабатывают эти «кинетические модели» в течение нескольких месяцев, и полученные прогнозы не всегда совпадают с экспериментальными результатами.
Машинное обучение, однако, использует данные для обучения компьютерного алгоритма делать прогнозы. Алгоритм изучает поведение системы, анализируя данные родственных систем. Это позволяет ученым быстро предсказывать функцию пути, даже если его механизмы плохо изучены — при условии наличия достаточного объема данных.
Ученые протестировали свою методику на путях, внедренных в клетки E. coli. Один путь предназначен для производства биотоплива для реактивных двигателей на основе лимонена; другой производит заменитель бензина — изопентенол. Предыдущие эксперименты в JBEI дали множество данных о том, как разные версии путей функционируют в различных штаммах E. coli. Некоторые штаммы имеют путь, производящий небольшое количество лимонена или изопентенола, в то время как другие имеют версию, производящую большое количество биотоплив.
Исследователи загрузили эти данные в свой алгоритм. Затем машинное обучение взяло верх: алгоритм самостоятельно изучил, как концентрации метаболитов в этих путях изменяются со временем и сколько биотоплива производят пути. Он изучил эту динамику, анализируя данные двух экспериментально известных путей, производящих малое и большое количество биотоплива.
Алгоритм использовал эти знания, чтобы предсказать поведение третьего набора «загадочных» путей, которые алгоритм никогда раньше не видел. Он точно предсказал профили производства биотоплива для этих путей, включая тот факт, что пути производят среднее количество топлива. Кроме того, прогноз, полученный с помощью машинного обучения, превзошел кинетические модели.
«И чем больше данных мы добавляли, тем точнее становились прогнозы, — сказал Гарсия Мартин. — Этот подход может сократить время, необходимое для разработки новых биомолекул. Проект, который сегодня занимает десять лет и команду экспертов, когда-нибудь сможет быть выполнен студентом за лето».
