Устранение ошибок решает главную проблему в секвенировании геномов «третьего поколения»
Технология секвенирования нового поколения получила значительное развитие. Количественный биолог из Лаборатории в Колд-Спринг-Харбор (CSHL) и его коллеги опубликовали результаты экспериментов, демонстрирующих возможности одно-молекулярного секвенирования, использование которого до сих пор было ограничено техническими проблемами.
Команда под руководством доцента CSHL Майкла Шаца, Адама Филиппи и Сергея Корена разработала программный пакет, который исправляет серьёзную проблему новой технологии: примерно каждая пятая или шестая «буква» ДНК, которую она генерирует, является ошибочной. Высокий уровень ошибок — обратная сторона главного преимущества метода: он генерирует гораздо более длинные «прочтения» генома (до 100 раз длиннее), чем текущие технологии «второго поколения», обеспечивая более полную картину структуры генома.
Используя математические алгоритмы, команда сохранила преимущество метода «третьего поколения», практически устранив его главный недостаток. Они снизили уровень ошибок примерно с 15% и более до менее чем 0,1%. Это математическое «исправление», опубликованное в виде открытого исходного кода, значительно повышает практическую полезность секвенирования 3-го поколения для всего биомедицинского исследовательского сообщества.
Команда продемонстрировала широкий спектр потенциальных применений метода, применив своё исправление к задачам секвенирования — от крошечного бактериофага до большого и сложного генома попугая. Геном попугая составляет более трети размера человеческого генома и опубликован онлайн вместе со статьёй команды в Nature Biotechnology. Эта последовательность «намного превосходит любой ранее секвенированный геном птицы», отмечает Шац.
Сочетание лучшего из обоих поколений
Главное преимущество 3-го поколения связано со средней длиной каждого «прочтения». В технологии 2-го поколения собираемые непрерывные последовательности (контиги) очень малы, хотя и чрезвычайно точны благодаря множеству перекрывающихся прочтений. Однако их малый размер мешает точной сборке определённых участков генома, например, содержащих длинные повторяющиеся последовательности.
При одно-молекулярном секвенировании собираемые контиги намного длиннее, что даёт гораздо лучшее представление об относительно крупных сегментах генома, включая участки с длинными повторами. Команда хотела сохранить это преимущество, одновременно повысив точность. Они сделали это, эффективно объединив лучшее из технологий 2-го и 3-го поколений.
«Мы называем наш подход "гибридной коррекцией ошибок"», — объясняет Шац.
Ключевая идея команды заключалась в использовании длинных прочтений от машины 3-го поколения (Pacific Biosciences RS) в сочетании с высокоточными короткими прочтениями, полученными на отдельном секвенаторе 2-го поколения. Оба типа данных были обработаны с помощью открытой программы сборки генома Celera Assembler. В результате была получена финальная сборка с доказанной точностью 99,9%, состоящая из контигов, медианный размер которых как минимум вдвое превышает размер, достижимый с помощью секвенаторов 2-го поколения. Ожидается, что размер контигов будет значительно увеличиваться по мере совершенствования одно-молекулярного секвенирования длинных прочтений.
Высококачественные сборки геномов особенно важны для аннотации геномов и сравнительного геномного анализа. Многие исследования микробных геномов зависят от готовых геномов, стоимость получения которых с помощью старых технологий непомерно высока. Анализ геномов высших организмов зависит от непрерывных последовательностей, захватывающих длинные участки ДНК, которые кодируют гены.
С помощью гибридной коррекции ошибок Шац и его коллеги «продемонстрировали, что высокий уровень ошибок, связанный с длинными прочтениями, не должен быть препятствием для сборки генома. Высокоошибочные длинные прочтения могут быть эффективно собраны в комбинации с дополнительными короткими прочтениями для получения сборок, ранее невозможных».
