ИИ-картографирование сельхозкультур помогает фермерам и политикам улучшать планирование

Исследование аспиранта Университета Иллинойса в Урбане-Шампейне (U. of I.) И-Цзя Чана, посвященное машинному обучению (ML) и дистанционному зондированию, было опубликовано на сервере препринтов arXiv и принято к презентации на конференции IEEE IGARSS 2025. Оно касается картографирования сельскохозяйственных культур.

Зачем нужно картографирование культур?

Картографирование культур использует спутниковые снимки для создания карты всех типов культур в конкретном регионе. Эти карты — важный инструмент для:

  • Мониторинга культур и региональных продовольственных запасов.
  • Помощи фермерам в планировании посевов на сезон.
  • Приложений для «умного земледелия», которые могут отслеживать рост, условия осадков, прогнозировать урожай и болезни.
  • Помощи политикам и организациям в определении объемов и типов производимой продукции.

Проблема геопространственной предвзятости

Хотя модели ML успешно обучаются распознаванию культур по спутниковым снимкам в хорошо изученных регионах (например, в США), мало исследований об их работе в новых географических областях, особенно с недостатком данных. Это создает проблему «геопространственной предвзятости»: модели, обученные на данных из развитых стран, могут плохо работать в менее развитых регионах.

Исследование и результаты

Исследование Чана, вдохновленное предыдущей работой его команды, опубликованной в NeurIPS 2023 proceedings, изучает, как популярные модели наблюдения за Землей работают в новых регионах. Команда:

  1. Выбрала четыре основные зерновые культуры: кукурузу, сою, рис и пшеницу.
  2. Протестировала три широко используемые предобученные модели, сравнив их производительность на знакомых данных (in-distribution) и данных из новых регионов (out-of-distribution).

Ключевые выводы:

  • Модели, предобученные на спутниковых изображениях Sentinel-2 (SSL4EO-S12), показали лучшие результаты для картографирования культур, чем модели, обученные на общих наборах изображений, таких как ImageNet.
  • «Гармонизируя наборы данных о типах культур на пяти континентах, мы обнаружили, что фундаментальные модели, предобученные на полных спектральных диапазонах Sentinel-2, работают лучше для картографирования типов культур», — сказал Чан.
  • Обучение с данными out-of-distribution может повысить производительность, когда данных in-distribution мало. Однако в долгосрочной перспективе для лучших результатов необходимы более крупные и сбалансированные размеченные наборы данных.

Интеграция и будущие планы

Работа Чана полностью интегрирована с TorchGeo, библиотекой с открытым исходным кодом для геопространственного машинного обучения, что облегчит дальнейшие исследования. Будущие планы команды включают:

  • Расширение наборов данных о типах культур.
  • Разработку специализированных предобученных моделей для сельского хозяйства.
  • Создание эталонных тестов для сельскохозяйственных приложений фундаментальных моделей (картографирование культур, прогнозирование урожайности).

Роль высокопроизводительных вычислений (HPC)

Для проекта потребовались значительные вычислительные мощности и объемы памяти (свыше 50 ТБ для спутниковых изображений). «Ресурсы HPC значительно ускоряют рабочие процессы машинного обучения с использованием GPU, сокращая время обучения модели с часов на CPU до минут на GPU. Кроме того, большое выделение хранилища данных позволяет нам эффективно управлять обучающими наборами данных, предобученными весами и выходами моделей в кластере», — отмечает Чан.

Значение работы

«Наше исследование позволит создать более информированные сельскохозяйственные системы для политиков и заинтересованных сторон в поддержку глобальной продовольственной безопасности», — говорит И-Цзя Чан. Он также выражает надежду, что фундаментальные модели и трансферное обучение смогут принести пользу продовольственной безопасности.

2025-03-27