Обучение нейросети для семантической сегментации на синтетических данных для фенотипирования семян

В условиях беспрецедентных изменений климата и роста населения создание метода быстрого выведения элитных сортов сельскохозяйственных культур путем селекции — это вопрос срочной необходимости для поддержания продовольственного снабжения. Для отбора таких сортов необходимо эффективно определять и оценивать параметры, характеризующие «превосходный сорт». Например, форма семян считается признаком, тесно связанным с качеством и урожайностью культур, и поэтому является важным фактором при селекции.

Группа ученых под руководством Йосукэ Тоды, доцента Института трансформативных биомолекул (WPI-ITbM) Университета Нагои, и Фумио Окуры, доцента Института научных и промышленных исследований Университета Осаки, разработала систему, которая использует анализ изображений и искусственный интеллект (ИИ) для анализа формы большого количества семян на одном изображении. Форма семени — важный агрономический признак для урожайности и качества культур, а метод автоматического определения и оценки этого признака по изображению — незаменимый инструмент для селекции растений.

Исследовательская группа доктора Тоды создала обучающий набор данных для машинного обучения (глубокого обучения), синтезируя рандомизированные изображения семян ячменя на виртуальном холсте. Модель, обученная только на синтетических данных, смогла обнаруживать и сегментировать отдельные семена на изображениях различных сортов ячменя с точностью, сравнимой с ручной разметкой, а также анализировать семена других культур.

Для использования глубокого обучения требуются обучающие данные. Обычно такие данные готовятся вручную, например, путем маркировки каждого объекта на изображениях разными цветами. Однако для объектов вроде семян, количество которых огромно, создание обучающих данных очень трудоемко (например, необходимо вручную раскрасить сотни семян на десятках или сотнях изображений для каждого сорта). Поэтому считалось сложным создать модель машинного обучения, способную быстро и просто анализировать форму семян разных сортов или видов.

Группе доктора Тоды удалось создать большой объем обучающих данных всего из небольшого количества семян для эффективного обучения модели машинного (глубокого) обучения. Этот подход называется рандомизацией домена и избавляет от усилий по созданию обучающих данных, ускоряя разработку моделей машинного обучения. В предложенном методе образцы изображений небольшого количества семян ячменя, информация о форме которых уже была известна, случайным образом размещались в виртуальном пространстве, создавая большое количество и разнообразие синтезированных изображений. Модель, обученная на этом наборе данных, смогла обнаруживать семена и извлекать данные об их форме с той же степенью точности, что и при ручной обработке. Обучающий набор данных с ручной аннотацией не потребовался.

Эксперимент показал, что система может четко идентифицировать характерные различия в форме каждой культуры. Ожидается, что в будущем станет возможным измерять тонкие различия в условиях роста и сортах, что станет мощным инструментом для селекции растений.

Кроме того, исследование показало, что тот же метод можно легко применить для измерения семян различных культур, таких как рис, пшеница, овес и салат. Эти результаты убедительно свидетельствуют о том, что независимо от культуры можно сделать автоматическое измерение большого количества семян реальностью. Помимо оценки сортов, это исследование, как ожидается, внесет вклад в науку о растениях, выявив характеристики семян, ранее не наблюдавшиеся человеческим глазом.

Большинство исследований в области анализа изображений на основе семантической сегментации проводится с использованием существующих наборов данных, включающих такие объекты, как люди и автомобили. С другой стороны, анализ изображений растений имеет ряд своих особенностей. Поскольку существует большое разнообразие видов растений, их местоположения и внешнего вида отдельных особей, для различных приложений требуются разные обучающие данные. Хотя это относится и к другим областям с множеством применений, создание новых обучающих данных для растений особенно сложно. Метод генерации синтетических обучающих данных, использованный в этом исследовании, может применяться в различных областях. Ожидается, что на основе этой инициативы можно будет выйти за рамки анализа семян и ускорить разработку моделей машинного обучения для измерения различных фенотипов растений.

2020-04-24