请留言
diapositive 1

Global Vision Media Focus

L'entreprise a été présentée sur les chaînes de vidéosurveillance à 15 reprises au total, et sa diffusion via les médias du Parti, les médias centraux et les médias officiels locaux a touché un total de 50 millions de personnes.

0101
Actualités Catégories

De l'analyse MAE à la Terre spectrale : un modèle hyperspectral fondamental

27/02/2026

Introduction générale

Ces dernières années, grâce aux avancées réalisées dans le domaine des modèles visuels fondamentaux pour l'imagerie naturelle, une question s'est progressivement imposée : la télédétection hyperspectrale peut-elle elle aussi se doter de son propre « modèle fondamental » ? Contrairement aux images RVB, l'imagerie hyperspectrale contient généralement des centaines de bandes spectrales consécutives, offrant une signification physique plus riche, une redondance dimensionnelle plus importante et des données étiquetées plus rares. Les méthodes traditionnelles s'appuient souvent sur des jeux de données de petite taille pour l'apprentissage supervisé, ce qui limite la capacité de généralisation du modèle et rend difficile son transfert entre régions et capteurs. Par conséquent, le domaine hyperspectral a un besoin urgent d'un paradigme de modélisation unifié capable de pré-entraîner le modèle à partir de vastes quantités de données non étiquetées.

Cadre de modélisation

Dans ce contexte, l'autoencodeur masqué (MAE) est devenu un support technique essentiel pour les modèles hyperspectraux fondamentaux. Proposé initialement par Meta, le MAE repose sur l'occlusion aléatoire d'une grande partie de l'image d'entrée, l'encodage des seules portions visibles, puis la reconstruction du contenu occulté à l'aide d'un décodeur. Contrairement à l'apprentissage contrastif, le MAE ne s'appuie pas sur des contraintes de similarité entre les échantillons ; il contraint plutôt le modèle à comprendre la structure interne des données par le biais d'une « tâche de reconstruction ». Lorsque plus de 75 % de la zone est occultée, le modèle doit apprendre les relations spatiales globales et les règles d'organisation sémantique, au lieu de simplement mémoriser les caractéristiques de texture locales. Ce mécanisme confère au MAE une capacité remarquable d'apprentissage des représentations structurelles.

Image 1.png

Figure 1. Schéma de structure MAE

Spectral Earth, proposé dans ce cadre, représente une avancée majeure pour l'avènement d'une nouvelle ère de modèles fondamentaux en hyperspectral. Basé sur l'architecture Vision Transformer, ce travail apprend une représentation unifiée de données hyperspectrales à grande échelle grâce à un pré-entraînement auto-supervisé utilisant l'erreur absolue moyenne (MAE). Son objectif principal n'est pas l'optimisation pour une tâche unique, mais plutôt la construction de représentations de caractéristiques généralisables et transférables. Après le pré-entraînement, le modèle a été évalué sur plusieurs tâches de télédétection en aval, notamment la classification de l'occupation des sols, l'identification des types de cultures et la cartographie des types de forêts, validant ainsi la capacité de généralisation des représentations pré-entraînées dans différents contextes.

Image 2.png

Figure 2. Organigramme du pré-entraînement/réglage fin de Spectral Earth

Résultats de reproduction

Lors de l'évaluation en aval, Spectral Earth a validé le modèle sur plusieurs jeux de données publics, notamment CORINE, CDL, NLCD, EuroCrops, TreeMap, BDForêt et BNETD. Les résultats expérimentaux montrent que, grâce à la stratégie de réglage fin complet (c'est-à-dire le dégel de tous les paramètres du modèle pour un réglage fin global), le modèle ViT pré-entraîné avec l'erreur absolue moyenne (MAE) surpasse les modèles entraînés à partir de zéro sur la plupart des tâches. Ceci démontre que le pré-entraînement auto-supervisé confère effectivement aux modèles hyperspectraux des capacités de représentation structurelle plus stables et transférables.

adfbf504-96b1-4dc1-8f09-59648539196b.png

Tableau 1. Comparaison des résultats de reproduction

Lors de la reproduction concrète du MAE (version ViT-S) et de son évaluation sur des tâches en aval, les avantages du pré-entraînement sont manifestes. Premièrement, le modèle converge plus rapidement et offre une meilleure stabilité, même avec de petits échantillons. Deuxièmement, les fluctuations de performance sont moindres sur des jeux de données interrégionaux, ce qui indique qu'il apprend non pas des caractéristiques spécifiques de la distribution des données, mais des informations plus générales sur la structure spectrale. En particulier pour l'identification des cultures et la classification des forêts, la capacité de modélisation spectrale devient un facteur clé d'amélioration des performances.