Использование машинного обучения для поиска мутаций в сходных участках генома раковых образцов
Исследователи из Института Фрэнсиса Крика разработали метод поиска мутаций в сходных участках генома раковых образцов. Они применили алгоритм машинного обучения для обнаружения раковых мутаций в неуникальных (повторяющихся) частях генома.
Из-за эволюционной истории человека некоторые участки генома подверглись перестройке и дупликации (удвоению). Эти дупликации создают проблему при поиске мутаций. Современные методы секвенирования отбрасывают короткие последовательности, идентифицируемые как неоднозначные, что исключает из анализа сходные участки генома и, как следствие, любые мутации в них.
Новый подход включал:
- Создание списка известных сходных участков генома.
- Использование этого списка для обучения алгоритма машинного обучения их распознаванию.
Применение и результаты:
Алгоритм протестировали на 2 658 образцах из набора данных Pan-Cancer Analysis of Whole Genome. Были обнаружены:
- Мутации в 1 744 кодирующих последовательностях.
- Тысячи мутаций в некодирующих последовательностях.
- Алгоритм показал примерно 7% ложных открытий и более 80% подтверждаемости.
Значимые находки:
- Мутации в кодирующих последовательностях влияют на белковые последовательности, и некоторые из них связаны с типами рака.
- Обнаружены мутации, приводящие к изменениям белков, которые также ассоциированы с конкретными видами рака.
- В качестве примера выявлена рекуррентная мутация в генах KMT2C и PIK3CA, а также мутации, связанные с раком молочной железы.
- Найдены мутации в регуляторных областях, включая некоторые в семействе иммуноглобулинов.
Исследователи полагают, что их метод поможет научным группам решить проблему пропуска мутаций в почти идентичных участках генома.
