ИИ-картографирование сельхозкультур помогает фермерам и политикам улучшать планирование
Исследование аспиранта Университета Иллинойса в Урбане-Шампейне (U. of I.) И-Цзя Чана, посвященное машинному обучению (ML) и дистанционному зондированию, было опубликовано на сервере препринтов arXiv и принято к презентации на конференции IEEE IGARSS 2025. Оно касается картографирования сельскохозяйственных культур.
Зачем нужно картографирование культур?
Картографирование культур использует спутниковые снимки для создания карты всех типов культур в конкретном регионе. Эти карты — важный инструмент для:
- Мониторинга культур и региональных продовольственных запасов.
- Помощи фермерам в планировании посевов на сезон.
- Приложений для «умного земледелия», которые могут отслеживать рост, условия осадков, прогнозировать урожай и болезни.
- Помощи политикам и организациям в определении объемов и типов производимой продукции.
Проблема геопространственной предвзятости
Хотя модели ML успешно обучаются распознаванию культур по спутниковым снимкам в хорошо изученных регионах (например, в США), мало исследований об их работе в новых географических областях, особенно с недостатком данных. Это создает проблему «геопространственной предвзятости»: модели, обученные на данных из развитых стран, могут плохо работать в менее развитых регионах.
Исследование и результаты
Исследование Чана, вдохновленное предыдущей работой его команды, опубликованной в NeurIPS 2023 proceedings, изучает, как популярные модели наблюдения за Землей работают в новых регионах. Команда:
- Выбрала четыре основные зерновые культуры: кукурузу, сою, рис и пшеницу.
- Протестировала три широко используемые предобученные модели, сравнив их производительность на знакомых данных (in-distribution) и данных из новых регионов (out-of-distribution).
Ключевые выводы:
- Модели, предобученные на спутниковых изображениях Sentinel-2 (SSL4EO-S12), показали лучшие результаты для картографирования культур, чем модели, обученные на общих наборах изображений, таких как ImageNet.
- «Гармонизируя наборы данных о типах культур на пяти континентах, мы обнаружили, что фундаментальные модели, предобученные на полных спектральных диапазонах Sentinel-2, работают лучше для картографирования типов культур», — сказал Чан.
- Обучение с данными out-of-distribution может повысить производительность, когда данных in-distribution мало. Однако в долгосрочной перспективе для лучших результатов необходимы более крупные и сбалансированные размеченные наборы данных.
Интеграция и будущие планы
Работа Чана полностью интегрирована с TorchGeo, библиотекой с открытым исходным кодом для геопространственного машинного обучения, что облегчит дальнейшие исследования. Будущие планы команды включают:
- Расширение наборов данных о типах культур.
- Разработку специализированных предобученных моделей для сельского хозяйства.
- Создание эталонных тестов для сельскохозяйственных приложений фундаментальных моделей (картографирование культур, прогнозирование урожайности).
Роль высокопроизводительных вычислений (HPC)
Для проекта потребовались значительные вычислительные мощности и объемы памяти (свыше 50 ТБ для спутниковых изображений). «Ресурсы HPC значительно ускоряют рабочие процессы машинного обучения с использованием GPU, сокращая время обучения модели с часов на CPU до минут на GPU. Кроме того, большое выделение хранилища данных позволяет нам эффективно управлять обучающими наборами данных, предобученными весами и выходами моделей в кластере», — отмечает Чан.
Значение работы
«Наше исследование позволит создать более информированные сельскохозяйственные системы для политиков и заинтересованных сторон в поддержку глобальной продовольственной безопасности», — говорит И-Цзя Чан. Он также выражает надежду, что фундаментальные модели и трансферное обучение смогут принести пользу продовольственной безопасности.
