Wide-Open ускоряет публикацию научных данных, выявляя просроченные наборы данных
Развитие технологий, включая генетическое секвенирование, привело к взрывному росту биологических данных. Благодаря десятилетиям открытости ученые регулярно размещают данные в онлайн-репозиториях. Однако исследователи могут забыть дать команду на публикацию данных при выходе статьи.
Новый инструмент, разработанный исследователями из Университета Вашингтона и Microsoft (Максимом Гречкиным, Хойфунгом Пуном и Биллом Хау), описан в статье, опубликованной 8 июня в журнале PLOS Biology. Он призван решить эту проблему и продвигать открытую науку, автоматически обнаруживая наборы данных, публикация которых просрочена.
Открытые данные — ключевой элемент открытой науки, позволяющий воспроизводить результаты и совершать новые открытия. Хотя многие журналы требуют от авторов публиковать исходные данные, эти правила часто не соблюдаются. Масштаб проблемы огромен: только в репозитории NCBI Gene Expression Omnibus (GEO) содержится 80 985 публичных наборов данных по сотням типов тканей тысяч организмов. Быстрый рост данных затрудняет контроль за соблюдением правил публикации.
Система Wide-Open доступна по открытой лицензии на GitHub. Она использует текстовый анализ для выявления в научных статьях ссылок на наборы данных, которые должны быть общедоступны, а затем проверяет репозитории, чтобы определить, остаются ли эти данные закрытыми.
Команда протестировала инструмент на двух популярных репозиториях NCBI — GEO и Sequence Read Archive (SRA). Wide-Open выявил большое количество просроченных наборов данных, что побудило администраторов репозиториев опубликовать 400 наборов за одну неделю.
«Мы разработали простую, но эффективную систему, которая уже помогла опубликовать сотни наборов данных, — сказал ведущий автор Максим Гречкин. — Беспристрастная автоматизированная система, обеспечивающая соблюдение политик открытых данных, может помочь уровнять условия для ученых и создать новые возможности для открытий».
