Мощный метод машинного обучения позволяет биологам анализировать огромные наборы данных

Исследователи из A*STAR сравнили шесть методов анализа данных и определили явного лидера по скорости, качеству анализа и надежности. Лучший метод обрабатывал большие, сложные биологические наборы данных и выявлял ключевые связи между параметрами (например, группируя клетки крови и костного мозга по типам) за доли времени, требуемого другими методами.

Измерения на отдельных клетках могут генерировать огромные наборы данных, содержащие от 20 до более 20 000 параметров. Ошеломляющий размер и сложность биологических наборов данных крайне затрудняют для ученых выявление значимых взаимосвязей между параметрами.

Математики разработали статистические методы, упрощающие сложные наборы данных путем группировки данных по схожим характеристикам. Наиболее известный метод — анализ главных компонент (PCA), разработанный в начале XX века. Недавно были созданы более мощные методы, использующие возможности машинного обучения.

Исследователи из Сингапурского института иммунологии (SIgN) Эван Ньюэлл, Флоран Жину и их коллеги использовали данные по отдельным клеткам, чтобы протестировать шесть таких методов машинного обучения, и обнаружили один, который превосходит остальные по скорости, качеству анализа и надежности. Этот метод называется uniform manifold approximation and projection, или «UMAP».

«Когда Эван и Этьен Бехт из его группы в SIgN начали тестировать UMAP, мы поняли, что он намного мощнее всего, что мы использовали раньше», — вспоминает Жину.

Анализ, который с другими методами может занимать дни, с помощью UMAP выполняется за несколько часов, что позволит ученым исследовать более крупные наборы данных. «С UMAP мы можем анализировать данные для двух или трех миллионов клеток, тогда как с другими методами мы обычно не выходим за пределы 100 000 клеток», — говорит Ньюэлл.

UMAP группировал схожие клетки наиболее интуитивно понятным способом, что облегчало интерпретацию результатов.

«Я думаю, это действительно прорыв», — говорит Жину. «Исследователи, которых я встречаю на конференциях, уже начинают его использовать».

В более раннем исследовании группа продемонстрировала мощь UMAP, используя его для открытия новой популяции клеток в крови. Ньюэлл отмечает, что UMAP очень универсален и может применяться к данным, полученным в таких разных областях, как астрономия и кристаллография. «По сути, любые данные, которые можно выразить в виде матриц, можно анализировать с помощью UMAP», — говорит он.

Помимо ежедневного использования UMAP для анализа данных, команда планирует продолжать работу с информатиками, чтобы адаптировать метод под свои нужды.

2019-03-18