请留言
diapositive 1

Global Vision Media Focus

L'entreprise a été présentée sur les chaînes de vidéosurveillance à 15 reprises au total, et sa diffusion via les médias du Parti, les médias centraux et les médias officiels locaux a touché un total de 50 millions de personnes.

0101
Actualités Catégories

Discussion sur l'application du modèle Clay à la segmentation en télédétection

10 avril 2026

Introduction générale

Avec l'amélioration continue des capacités d'acquisition d'images de télédétection, des tâches telles que la classification de l'occupation des sols, l'identification des plans d'eau, l'extraction des terres agricoles, la surveillance des zones humides et la segmentation des surfaces imperméables urbaines exigent des modèles une capacité de généralisation accrue. Les méthodes de segmentation sémantique traditionnelles reposent généralement sur des données à grande échelle étiquetées manuellement et sont souvent entraînées sur une seule source de données ou une seule région, ce qui entraîne facilement une dégradation des performances lorsqu'elles sont appliquées à différentes régions, capteurs et périodes temporelles. En revanche, les modèles de base, pré-entraînés sur des données de télédétection à grande échelle, peuvent apprendre des représentations de surface plus générales avant d'être transférés à des tâches spécifiques en aval, ce qui présente un avantage significatif dans le domaine de la segmentation par télédétection. Clay est un modèle de base d'observation de la Terre open source proposé dans ce contexte. Officiellement positionné comme un « modèle de base orienté Terre », il peut recevoir des images de télédétection ainsi que des informations de localisation et de temps, et produire des représentations de caractéristiques avec une sémantique spatio-temporelle pour des tâches ultérieures de classification, de régression, de détection de changements et de segmentation.

Du point de vue des applications, Clay est particulièrement adapté aux scénarios de segmentation en télédétection avec un nombre limité d'échantillons étiquetés, mais des exigences métier claires. Par exemple, pour la cartographie de l'occupation et de l'utilisation des sols, il peut servir de base à un encodeur, exploitant des caractéristiques générales pré-entraînées pour améliorer les performances de segmentation malgré un faible nombre d'échantillons. Dans les tâches de migration interrégionale, il permet également de pallier le problème de l'inefficacité du modèle entraîné dans une région. La documentation officielle indique par ailleurs que Clay prend en charge de multiples sources d'entrée, notamment Sentinel-2, Landsat, Sentinel-1, NAIP, LINZ et MODIS, ce qui lui confère une grande adaptabilité aux applications de télédétection multi-sources.

Cadre de modélisation

L'architecture globale de Clay v1.5 peut se résumer ainsi : « intégration dynamique + encodage spatio-temporel + architecture MAE + contraintes d'apprentissage ». Premièrement, le modèle génère des représentations de patchs à partir du nombre de bandes et des informations de longueur d'onde de l'image d'entrée grâce au module d'intégration dynamique, prenant ainsi en charge les entrées provenant de différents capteurs et de différentes combinaisons de bandes. Deuxièmement, le modèle introduit un encodage de localisation, intégrant la résolution spatiale au sol (GSD), la latitude, la longitude et les informations temporelles dans la représentation des caractéristiques. Ceci lui permet non seulement de « voir » le contenu spectral, mais aussi de comprendre la position spatiale et les attributs temporels de l'image.

Au cœur de Clay se trouve une structure d'auto-encodeur masqué basée sur Vision Transformer pour reconstruire les blocs d'entrée occultés. Selon la documentation officielle, la perte de reconstruction représente environ 95 % de la perte totale, principalement due à l'apprentissage de la structure spectrale et spatiale des données de télédétection ; les 5 % restants proviennent des contraintes de représentation fournies par le réseau enseignant. La version 1.5 utilise DINOv2 comme réseau enseignant afin d'améliorer l'expressivité sémantique de l'espace d'intégration. En termes de taille de modèle, Clay v1.5 compte environ 632 millions de paramètres, dont environ 311 millions pour l'encodeur, environ 15 millions pour le décodeur et environ 304 millions pour le réseau enseignant. La documentation officielle indique également que cette version du modèle a été entraînée sur environ 70 millions de puces de télédétection réparties dans le monde entier, ce qui témoigne d'une base de pré-entraînement solide.

Figure 1. Modèle en argile

Pour les tâches de segmentation, Clay ne produit pas directement de cartes de segmentation sémantique, mais se révèle plus adapté comme base d'extraction de caractéristiques. L'approche courante consiste à conserver son encodeur et à lui associer un décodeur de segmentation léger, tel qu'un décodeur de type SegFormer, FPN ou U-Net, afin de récupérer les détails spatiaux par fusion de caractéristiques multicouches, pour finalement produire des résultats de classification au niveau du pixel. Cette approche « modèle de base + module de segmentation » équilibre les capacités de représentation pré-entraînées avec l'adaptabilité aux tâches en aval, et répond mieux aux exigences de la segmentation en télédétection pour les détails de contours et multi-échelles.

Résultats de reproduction

Cette expérience a ajouté un décodeur de type SegFormer après l'encodeur Clay, utilisant la fusion de caractéristiques de la couche intermédiaire pour prédire les résultats de segmentation. L'expérience a utilisé environ 2 000 échantillons aléatoires pour l'entraînement et la validation. Après environ 30 époques d'entraînement, l'ensemble de validation a atteint…IoU pondéré 0,869Le résultat.

Figure 2. Données expérimentales

Clay peut servir de base unifiée pour des tâches telles que la cartographie de l'occupation des sols, la segmentation des plans d'eau, l'identification des forêts et de la végétation basse, ainsi que l'extraction des routes et des surfaces imperméables. Cependant, il convient de noter que l'objectif du pré-entraînement de Clay reste essentiellement l'apprentissage et la reconstruction de représentations. Par conséquent, pour une caractérisation fine des contours, des décodeurs de segmentation appropriés, la fusion de caractéristiques multi-échelles et des stratégies de post-traitement sont toujours nécessaires pour obtenir des résultats de meilleure qualité dans les applications d'ingénierie.