请留言
слайд1

Global Vision Media Focus

Компания в общей сложности 15 раз появлялась в эфире CCTV, а ее охват через партийные СМИ, центральные СМИ и местные официальные СМИ составил 50 миллионов человек.

0101

Обсуждение применения глиняной модели в сегментации данных дистанционного зондирования.

2026-04-10

Введение

В условиях постоянного совершенствования возможностей получения изображений дистанционного зондирования, такие задачи, как классификация землепользования, идентификация водных объектов, выделение сельскохозяйственных угодий, мониторинг водно-болотных угодий и сегментация непроницаемых поверхностей в городах, предъявляют более высокие требования к обобщающей способности моделей. Традиционные методы семантической сегментации обычно основаны на больших объемах данных, размеченных вручную, и часто обучаются на одном источнике данных или одном регионе, что легко приводит к снижению производительности при применении к различным регионам, датчикам и временным этапам. В отличие от них, базовые модели, предварительно обученные на больших объемах данных дистанционного зондирования, могут изучать более общие представления поверхности, прежде чем их можно будет перенести на конкретные задачи, что демонстрирует значительное преимущество в области сегментации данных дистанционного зондирования. Clay — это базовая модель дистанционного зондирования Земли с открытым исходным кодом, предложенная в этом контексте. Официально позиционируемая как «базовая модель, ориентированная на Землю», она может получать изображения дистанционного зондирования вместе с информацией о местоположении и времени и выдавать представления признаков с пространственно-временной семантикой для последующих задач классификации, регрессии, обнаружения изменений и сегментации.

С точки зрения применения, Clay особенно подходит для сценариев сегментации данных дистанционного зондирования с ограниченным количеством размеченных образцов, но четкими бизнес-требованиями. Например, в картировании землепользования/землепокрытия его можно использовать в качестве основы кодировщика, используя предварительно обученные общие признаки для повышения производительности сегментации в условиях малого количества образцов; в задачах межрегиональной миграции он также может смягчить проблему «обучение в одном регионе и неудача в другом». В официальной документации также указывается, что Clay поддерживает входные данные с нескольких датчиков, включая Sentinel-2, Landsat, Sentinel-1, NAIP, LINZ и MODIS, что обеспечивает ему высокую адаптивность в приложениях дистанционного зондирования с использованием нескольких источников.

Модель структуры

Общая структура Clay v1.5 может быть кратко описана как «динамическое встраивание + пространственно-временное кодирование местоположения + основа MAE + ограничения учителя». Во-первых, модель генерирует представления фрагментов на основе количества полос и информации о длине волны входного изображения с помощью модуля динамического встраивания, поддерживая таким образом входные данные от разных датчиков и различные комбинации полос. Во-вторых, модель вводит кодирование местоположения, кодируя разрешение поверхности (GSD), широту и долготу, а также временную информацию в представление признаков, что позволяет модели не только «видеть» спектральное содержимое, но и понимать пространственное местоположение и временные атрибуты изображения.

В основе Clay лежит структура маскированного автокодировщика на основе Vision Transformer для восстановления скрытых входных блоков. Согласно официальной документации, потери при реконструкции составляют приблизительно 95% от общих потерь, в основном отвечая за изучение спектрально-пространственной структуры данных дистанционного зондирования; оставшиеся 5% приходятся на ограничения представления, предоставляемые обучающей сетью. В версии 1.5 в качестве обучающей сети используется DINOv2 для повышения семантической выразительности пространства встраивания. Что касается размера модели, Clay v1.5 имеет приблизительно 632 миллиона параметров, включая приблизительно 311 миллионов параметров для кодировщика, приблизительно 15 миллионов параметров для декодера и приблизительно 304 миллиона параметров для обучающей сети. В официальной документации также указано, что эта версия модели была обучена на приблизительно 70 миллионах глобально распределенных чипов дистанционного зондирования, что указывает на прочную основу для предварительного обучения.

Рисунок 1. Глиняная модель

В задачах сегментации Clay не выдает напрямую карты семантической сегментации, а больше подходит в качестве основы для извлечения признаков. Распространенный подход заключается в сохранении кодировщика и подключении к нему облегченного декодера сегментации, такого как декодер в стиле SegFormer, FPN или U-Net, для восстановления пространственных деталей путем многослойного слияния признаков, в конечном итоге выдавая результаты классификации на уровне пикселей. Такой подход «базовая модель + головная часть задачи» уравновешивает возможности предварительно обученного представления с адаптивностью к последующей задаче и лучше отвечает требованиям сегментации данных дистанционного зондирования для детализации границ и многомасштабных данных.

Результаты воспроизведения

В этом эксперименте после кодировщика Clay был добавлен декодер, подобный SegFormer, с использованием слияния признаков промежуточного слоя для прогнозирования результатов сегментации. В эксперименте использовалось приблизительно 2000 случайных выборок для обучения и валидации. После примерно 30 эпох обучения валидационный набор данных достиг...взвешенный IoU 0,869Результат.

Рисунок 2. Экспериментальные данные.

Модель Clay может использоваться в качестве единой базовой модели признаков для таких задач, как картирование землепользования, сегментация водных объектов, идентификация лесов и низкорослой растительности, а также выделение дорог и непроницаемых поверхностей. Однако следует отметить, что основной задачей предварительного обучения модели Clay по-прежнему остается обучение представлению и реконструкция. Поэтому для точной характеристики границ по-прежнему необходимы соответствующие декодеры сегментации, многомасштабное слияние признаков и стратегии постобработки для получения более качественных результатов в инженерных приложениях.