Первое микробное супердерево, построенное на основе данных, извлечённых из тысяч изображений в научных статьях
Объём опубликованной научной литературы превышает 114 миллионов документов, что делает критически важным поиск способов улучшить доступ к этим знаниям и эффективно их синтезировать.
Учёные из Великобритании Росс Маунс и Питер Мюррей-Раст (Кембриджский университет) и Мэтью Уиллс (Батский университет) представили решение этой проблемы — рабочий процесс PLUTo. Они провели первую в мире попытку автоматизированного построения супердерева, используя данные, исключительно извлечённые машинами из опубликованных изображений филогенетических деревьев. Результаты опубликованы в журнале открытой науки Research Ideas and Outcomes (RIO).
Для исследования учёные выбрали International Journal of Systematics and Evolutionary Microbiology (IJSEM) — единственный репозиторий, в котором размещаются все новые валидно описанные таксоны прокариот. Это делает его отличным объектом для тестирования систем автоматизированного и полуавтоматизированного синтеза опубликованных филогений. По словам авторов, IJSEM публикует больше изображений филогенетических деревьев в год, чем любой другой журнал.
Были систематически загружены статьи за одиннадцатилетний период, начиная с января 2003 года, чтобы извлечь все файлы изображений филогенетических деревьев для анализа. Методы компьютерного зрения позволили автоматически конвертировать изображения обратно в пригодные для вычислений филогенетические данные, которые затем были использованы для формального синтеза супердерева на основе всех свидетельств.
В ходе работы учёным пришлось преодолеть проблемы, связанные с авторским правом, которое формально распространяется почти на все документы, необходимые для анализа. Они столкнулись с парадоксом: хотя лёгкий доступ и повторное использование данных из научной литературы в целом поддерживается и поощряется, стандартная практика авторского права затрудняет учёным уверенное включение ранее собранных данных в свою работу. Авторы обсуждают недавние изменения в законодательстве Великобритании об авторском праве, которые позволили осуществить их проект. В результате они предоставляют свои выводы как факты и помещают их в общественное достояние, используя отказ CC0 от Creative Commons, чтобы обеспечить беспрепятственное повторное использование кем угодно.
«Сейчас мы находимся на этапе, когда у отдельного человека нет времени прочитать даже все заголовки опубликованных статей, не говоря уже об аннотациях», — комментируют авторы.
«Мы считаем, что теперь машины необходимы, чтобы мы могли осмыслить поток публикуемой науки, и эта статья затрагивает несколько ключевых проблем, присущих этому процессу».
«Мы сознательно выбрали подраздел литературы (ограниченный одним журналом), чтобы уменьшить объём, скорость и разнообразие, сосредоточившись в первую очередь на валидности. Мы исследуем, возможен ли и ценен ли высокопроизводительный машинный сбор данных из полуструктурированной научной литературы».
