Выявлено систематическое искажение данных в исследованиях экспрессии генов
Сложность данных, генерируемых геномными методами, усугубляет проблему воспроизводимости в экспериментальной биологии.
Исследователи из Тель-Авивского университета обнаружили частый технический сдвиг (bias) в данных, полученных с помощью широко используемой технологии RNA-seq, что часто приводит к ложным результатам. Этот метод позволяет в одном тесте одновременно измерить уровень экспрессии всех генов в образце.
Исследование провели учёные из Sackler Faculty of Medicine и George S. Wise Faculty of Life Sciences TAU. Оно опубликовано 12 ноября в PLOS Biology.
«В последние годы растёт тревога по поводу ложных результатов в биологических исследованиях, иногда называемой кризисом воспроизводимости», — говорит ведущий автор работы доктор Ран Элькон. — Наше исследование подчёркивает важность правильной статистической обработки данных».
Суть проблемы: длина гена как источник ошибки
- Основная цель экспериментов RNA-seq — выявить биологические процессы, которые активируются или подавляются в ответ на различные условия.
- Учёные проанализировали десятки общедоступных наборов данных RNA-seq, описывающих клеточный ответ на различные стрессы.
- Они заметили, что наборы особенно коротких или длинных генов постоянно показывали изменения в измеренном уровне экспрессии.
- Сравнение реплик (повторных образцов) из одного и того же биологического условия показало тот же паттерн. Это доказало, что наблюдаемый эффект связан не с биологическим ответом, а с техническим сдвигом, сопряжённым с длиной гена.
Последствия и решение
- Обнаруженный сдвиг по длине гена во многих наборах данных RNA-seq приводил к ложной идентификации конкретных биологических функций как клеточных ответов на тестируемые условия.
- «Такая интерпретация данных может привести к совершенно ошибочным выводам», — заключает доктор Элькон.
- Практический вывод исследования: этот систематический сдвиг можно удалить из данных, отфильтровав ложные результаты и сохранив биологически значимые.
