Использование машинного обучения для поиска мутаций в сходных участках генома раковых образцов

Исследователи из Института Фрэнсиса Крика разработали метод поиска мутаций в сходных участках генома раковых образцов. Они применили алгоритм машинного обучения для обнаружения раковых мутаций в неуникальных (повторяющихся) частях генома.

Из-за эволюционной истории человека некоторые участки генома подверглись перестройке и дупликации (удвоению). Эти дупликации создают проблему при поиске мутаций. Современные методы секвенирования отбрасывают короткие последовательности, идентифицируемые как неоднозначные, что исключает из анализа сходные участки генома и, как следствие, любые мутации в них.

Новый подход включал:

  1. Создание списка известных сходных участков генома.
  2. Использование этого списка для обучения алгоритма машинного обучения их распознаванию.

Применение и результаты:

Алгоритм протестировали на 2 658 образцах из набора данных Pan-Cancer Analysis of Whole Genome. Были обнаружены:

  • Мутации в 1 744 кодирующих последовательностях.
  • Тысячи мутаций в некодирующих последовательностях.
  • Алгоритм показал примерно 7% ложных открытий и более 80% подтверждаемости.

Значимые находки:

  • Мутации в кодирующих последовательностях влияют на белковые последовательности, и некоторые из них связаны с типами рака.
  • Обнаружены мутации, приводящие к изменениям белков, которые также ассоциированы с конкретными видами рака.
  • В качестве примера выявлена рекуррентная мутация в генах KMT2C и PIK3CA, а также мутации, связанные с раком молочной железы.
  • Найдены мутации в регуляторных областях, включая некоторые в семействе иммуноглобулинов.

Исследователи полагают, что их метод поможет научным группам решить проблему пропуска мутаций в почти идентичных участках генома.

2021-07-20