Исследование выявило недостатки популярного генетического метода
Согласно новому исследованию Лундского университета (Швеция), самый распространенный аналитический метод в популяционной генетике имеет серьезные недостатки. Это могло привести к некорректным результатам и заблуждениям об этнической принадлежности и генетических связях. Метод использовался в сотнях тысяч исследований, влияя на результаты в медицинской генетике и даже в коммерческих тестах на происхождение. Исследование опубликовано в Scientific Reports.
В условиях "революции больших данных" и взрывного роста сложных наборов информации для их упрощения широко применяется статистический метод PCA (анализ главных компонент). Доктор Эран Эльхайк, доцент молекулярной клеточной биологии, отмечает: "Ожидается, что этот метод даст правильные результаты, потому что он так часто используется. Но это не гарантия надежности и не дает статистически устойчивых выводов".
По словам Эльхайка, метод способствовал формированию устаревших представлений о расе и этничности, влияя на исторические нарративы о происхождении людей как в научном сообществе, так и в коммерческих компаниях. Яркие примеры — использование тестов для поддержки заявлений о предках политиками или ошибочное восприятие ашкеназских евреев как изолированной группы на основе PCA. "Это исследование показывает, что те результаты были ненадежными", — заявляет ученый.
Исследование сосредоточено на использовании PCA в популяционной генетике, где объем данных особенно велик из-за удешевления секвенирования ДНК. Метод критически важен в палеогеномике для анализа древних народов, например, эпохи меди. PCA создает генетическую карту, размещая неизвестный образец рядом с известными референсными популяциями. До сих пор считалось, что неизвестный образец родственен той референсной популяции, с которой он пересекается или находится ближе всего на карте.
Однако Эльхайк обнаружил, что положение неизвестного образца можно сдвинуть ближе практически к любой референсной популяции, просто изменяя количество и типы референсных образцов. Это порождает бесчисленное множество исторических версий, математически "верных", но лишь одна из которых может быть биологически корректной.
В работе проанализированы двенадцать самых распространенных применений PCA в популяционной генетике. Используя как смоделированные, так и реальные генетические данные, Эльхайк показал, насколько гибкими могут быть результаты PCA. Эта гибкость означает, что выводы, основанные на PCA, не заслуживают доверия, поскольку любое изменение в референсных или тестовых образцах дает разные результаты.
От 32 000 до 216 000 научных статей по генетике использовали PCA для изучения сходств и различий между индивидами и популяциями, строя на этих результатах свои выводы. "Я считаю, что эти результаты необходимо переоценить", — говорит Эльхайк.
Он надеется, что исследование поспособствует разработке более надежных подходов. Сам ученый последнее десятилетие посвятил созданию таких методов, как географическая популяционная структура (GPS) для предсказания биогеографии по ДНК и Pairwise Matcher для улучшения подбора пар в генетических тестах и клинических испытаниях.
Профессор Уильям Амос (Кембриджский университет), не участвовавший в исследовании, добавляет: "Методы, предлагающие такую гибкость, поощряют недобросовестную науку и особенно опасны в мире с сильным давлением на публикации. Если исследователь запускает PCA несколько раз, всегда будет искушение выбрать результат, который дает лучшую историю".
