Как ИИ помогает отслеживать и поддерживать уязвимые экосистемы
Исследование Университета штата Орегон показало, что более 3500 видов животных находятся под угрозой исчезновения из-за изменения среды обитания, чрезмерной эксплуатации ресурсов и изменения климата.
Для мониторинга этих изменений и защиты уязвимых видов, такие исследователи, как аспирант MIT и сотрудник Лаборатории компьютерных наук и искусственного интеллекта (CSAIL) Джастин Кей, разрабатывают алгоритмы компьютерного зрения для отслеживания популяций животных.
Кей, работающий в лаборатории доцента кафедры электротехники и компьютерных наук MIT и главного исследователя CSAIL Сары Бири, занимается отслеживанием лосося на северо-западе Тихого океана, где он является ключевым источником питательных веществ для хищников и регулирует популяции добычи.
Обработка больших объемов данных о дикой природе требует выбора среди множества моделей ИИ. Кей и его коллеги из CSAIL и Массачусетского университета в Амхерсте разрабатывают методы ИИ для повышения эффективности этого процесса, включая новый подход «активный выбор модели на основе консенсуса» (CODA), который помогает экологам выбирать модель ИИ.
Их работа была отмечена как Highlight Paper на Международной конференции по компьютерному зрению (ICCV 2025) в октябре и доступна на сервере препринтов arXiv.
Как CODA решает проблему выбора из миллионов предобученных моделей?
Раньше использование ИИ для анализа данных обычно означало обучение собственной модели, что требовало значительных усилий по сбору и разметке данных, а также технических навыков.
Сейчас существуют миллионы общедоступных предобученных моделей, что позволяет анализировать данные без создания собственной модели. Однако возникает новая проблема: какую модель из миллионов доступных выбрать?
Обычно для ответа на этот вопрос также требуется много времени на сбор и разметку большого тестового набора данных, особенно для реальных приложений с изменяющимися распределениями данных.
Цель CODA — существенно сократить эти усилия, сделав процесс разметки данных «активным». Вместо массовой разметки большого набора данных, система интерактивно направляет пользователя к разметке наиболее информативных точек данных в их исходных данных. Это позволяет зачастую определить лучшую модель, аннотировав всего 25 примеров.
CODA смещает фокус с обучения моделей на создание эффективных конвейеров оценки, что становится всё более важным с распространением ИИ.
Почему CODA эффективен для классификации дикой природы на изображениях и какую роль он может играть?
Ключевая идея: консенсус предсказаний всех моделей-кандидатов более информативен, чем предсказание любой отдельной модели — своего рода «мудрость толпы».
Подход CODA основан на оценке матрицы ошибок (confusion matrix) для каждой модели ИИ: учитывая истинный класс X, какова вероятность, что модель предскажет класс X, Y или Z? Это создает информативные зависимости между моделями, категориями и немаркированными данными.
Пример: Эколог собрал сотни тысяч изображений с камер в дикой природе и хочет автоматически классифицировать виды. Если одна модель хорошо справилась с 50 размеченными изображениями тигров, высока вероятность, что она будет хорошо работать и с остальными (пока не размеченными) изображениями тигров. Если эта модель предсказывает «тигр» для какого-то изображения, она, скорее всего, права, а модели, предсказывающие другой класс, вероятно, ошибаются.
Используя эти взаимозависимости, CODA строит вероятностные оценки матрицы ошибок для каждой модели и распределение вероятностей того, какая модель имеет наивысшую точность на всем наборе данных. Это позволяет информированно выбирать, какие точки данных размечать, что делает выбор модели гораздо эффективнее.
Перспективы: Возможны улучшения за счет учета экспертных знаний (например, если известно, что модель хорошо работает на определенных классах). Также можно расширить фреймворк для более сложных задач машинного обучения.
Какие ещё проекты по мониторингу природы ведутся в лаборатории Бири?
Лаборатория работает над множеством проектов, выявляя «узкие места» в анализе данных для мониторинга биоразнообразия и разрабатывая широко применимые подходы компьютерного зрения и машинного обучения.
Примеры проектов:
- Мониторинг коралловых рифов с помощью дронов.
- Повторная идентификация отдельных слонов с течением времени.
- Слияние мультимодальных данных дистанционного зондирования Земли со спутников и наземных камер.
Работа Кея по подсчёту мигрирующего лосося на видео с подводного сонара — пример решения общей проблемы машинного обучения: адаптации к домену (domain adaptation). При развертывании новой камеры всегда возникают новые условия, что ухудшает работу алгоритмов. Существующие методы адаптации к домену имели ограничения. Команда разработала новую структуру, опубликованную в Transactions on Machine Learning Research, которая привела к улучшениям в подсчёте рыбы, а также в анализе для беспилотных автомобилей и космических аппаратов.
Важное направление: Анализ производительности алгоритмов машинного обучения в контексте их реального применения. Выходные данные алгоритма (например, рамки вокруг животных) — не самоцель, а средство для ответа на более крупный вопрос (например, какие виды здесь обитают и как это меняется со временем?).
Команда работает над методами анализа предсказательной производительности в этом контексте и переосмыслением способов включения экспертных знаний в системы машинного обучения. CODA — один из примеров, где модели ИИ рассматриваются как фиксированные, а для понимания их работы строится статистический фреймворк. Ведутся работы по аналогичному интегрированному анализу, сочетающему предсказания ИИ с многоэтапными конвейерами и экологическими статистическими моделями.
Вывод: Мир природы меняется беспрецедентными темпами. Быстрый переход от научных гипотез к ответам, основанным на данных, критически важен для защиты экосистем. Достижения в области ИИ могут сыграть важную роль, но необходимо критически оценивать способы проектирования, обучения и оценки алгоритмов в контексте этих реальных проблем.
