请留言
slide1

Tiêu điểm truyền thông của Global Vision

Công ty đã được đài truyền hình CCTV đưa tin tổng cộng 15 lần, và phạm vi tiếp cận thông qua các phương tiện truyền thông của Đảng, truyền thông trung ương và truyền thông chính thức địa phương đã đạt tổng cộng 50 triệu người.

0101
Các chuyên mục tin tức

Thảo luận về ứng dụng mô hình đất sét trong phân đoạn ảnh viễn thám

2026-04-10

Giới thiệu bối cảnh

Với sự cải tiến liên tục về khả năng thu thập ảnh viễn thám, các nhiệm vụ như phân loại lớp phủ đất, nhận dạng vùng nước, trích xuất đất nông nghiệp, giám sát vùng đất ngập nước và phân đoạn bề mặt không thấm nước đô thị đặt ra yêu cầu cao hơn về khả năng khái quát hóa của các mô hình. Các phương pháp phân đoạn ngữ nghĩa truyền thống thường dựa vào dữ liệu được gắn nhãn thủ công quy mô lớn và thường được huấn luyện trên một nguồn dữ liệu hoặc một khu vực duy nhất, dễ dẫn đến suy giảm hiệu suất khi áp dụng trên nhiều khu vực, cảm biến và giai đoạn thời gian. Ngược lại, các mô hình cơ sở, được huấn luyện trước trên dữ liệu viễn thám quy mô lớn, có thể học được các biểu diễn bề mặt tổng quát hơn trước khi được chuyển giao cho các nhiệm vụ cụ thể tiếp theo, do đó thể hiện một lợi thế đáng kể trong lĩnh vực phân đoạn viễn thám. Clay là một mô hình cơ sở quan sát Trái đất mã nguồn mở được đề xuất trong bối cảnh này. Được định vị chính thức là một "mô hình cơ sở hướng về Trái đất", nó có thể nhận ảnh viễn thám cùng với thông tin vị trí và thời gian, và xuất ra các biểu diễn đặc trưng với ngữ nghĩa không gian-thời gian cho các nhiệm vụ phân loại, hồi quy, phát hiện thay đổi và phân đoạn tiếp theo.

Từ góc độ ứng dụng, Clay đặc biệt phù hợp với các kịch bản phân đoạn viễn thám với số lượng mẫu được gán nhãn hạn chế nhưng yêu cầu nghiệp vụ rõ ràng. Ví dụ, trong lập bản đồ sử dụng/che phủ đất, nó có thể được sử dụng như một bộ mã hóa xương sống, tận dụng các đặc trưng tổng quát được huấn luyện trước để cải thiện hiệu suất phân đoạn trong điều kiện mẫu nhỏ; trong các nhiệm vụ di cư xuyên vùng, nó cũng có thể giảm thiểu vấn đề "huấn luyện ở một vùng và thất bại ở vùng khác". Tài liệu chính thức cũng chỉ ra rằng Clay hỗ trợ nhiều đầu vào cảm biến, bao gồm Sentinel-2, Landsat, Sentinel-1, NAIP, LINZ và MODIS, mang lại khả năng thích ứng mạnh mẽ trong các ứng dụng viễn thám đa nguồn.

Khung mô hình

Cấu trúc tổng thể của Clay v1.5 có thể được tóm tắt như sau: "nhúng động + mã hóa vị trí không gian-thời gian + kiến ​​trúc MAE + ràng buộc từ mô hình". Đầu tiên, mô hình tạo ra các biểu diễn mảng dựa trên số lượng dải tần và thông tin bước sóng của ảnh đầu vào thông qua mô-đun nhúng động, do đó hỗ trợ đầu vào từ các cảm biến khác nhau và các tổ hợp dải tần khác nhau. Thứ hai, mô hình giới thiệu mã hóa vị trí, mã hóa độ phân giải mặt đất (GSD), vĩ độ và kinh độ, và thông tin thời gian vào biểu diễn đặc trưng, ​​cho phép mô hình không chỉ "nhìn thấy" nội dung quang phổ mà còn hiểu được vị trí không gian và các thuộc tính thời gian của ảnh.

Về cốt lõi, Clay sử dụng cấu trúc Masked Autoencoder dựa trên Vision Transformer để tái tạo các khối đầu vào bị che khuất. Theo tài liệu chính thức, tổn thất tái tạo chiếm khoảng 95% tổng tổn thất, chủ yếu chịu trách nhiệm học cấu trúc không gian-quang phổ của dữ liệu viễn thám; 5% còn lại đến từ các ràng buộc biểu diễn do mạng huấn luyện cung cấp. Phiên bản 1.5 sử dụng DINOv2 làm mạng huấn luyện để tăng cường khả năng biểu đạt ngữ nghĩa của không gian nhúng. Về kích thước mô hình, Clay v1.5 có khoảng 632 triệu tham số, bao gồm khoảng 311 triệu tham số cho bộ mã hóa, khoảng 15 triệu tham số cho bộ giải mã và khoảng 304 triệu tham số cho mạng huấn luyện. Tài liệu chính thức cũng tiết lộ rằng phiên bản này của mô hình đã được huấn luyện trên khoảng 70 triệu chip viễn thám phân bố toàn cầu, cho thấy nền tảng huấn luyện trước vững chắc.

Hình 1. Mô hình đất sét

Trong các tác vụ phân đoạn, Clay không trực tiếp xuất ra bản đồ phân đoạn ngữ nghĩa, mà phù hợp hơn với vai trò là xương sống trích xuất đặc trưng. Cách tiếp cận phổ biến là giữ lại bộ mã hóa của nó và gắn thêm một bộ giải mã phân đoạn nhẹ, chẳng hạn như bộ giải mã kiểu SegFormer, FPN hoặc U-Net, để khôi phục các chi tiết không gian thông qua việc kết hợp đặc trưng đa lớp, cuối cùng xuất ra kết quả phân loại ở cấp độ pixel. Cách tiếp cận "mô hình cơ sở + đầu tác vụ" này cân bằng khả năng biểu diễn được huấn luyện trước với khả năng thích ứng tác vụ tiếp theo, và đáp ứng tốt hơn các yêu cầu của phân đoạn viễn thám đối với các chi tiết ranh giới và đa tỷ lệ.

Kết quả sinh sản

Thí nghiệm này đã thêm một bộ giải mã kiểu SegFormer sau bộ mã hóa Clay, sử dụng phương pháp kết hợp đặc trưng lớp trung gian để dự đoán kết quả phân đoạn. Thí nghiệm đã sử dụng khoảng 2000 mẫu ngẫu nhiên cho quá trình huấn luyện và kiểm tra. Sau khoảng 30 epoch huấn luyện, tập dữ liệu kiểm tra đã đạt được...IoU có trọng số 0,869Kết quả.

Hình 2. Dữ liệu thực nghiệm

Clay có thể được sử dụng như một nền tảng đặc trưng thống nhất cho các nhiệm vụ như lập bản đồ lớp phủ đất, phân đoạn vùng nước, nhận dạng rừng và thảm thực vật thấp, cũng như trích xuất đường và bề mặt không thấm nước. Tuy nhiên, cần lưu ý rằng mục tiêu huấn luyện trước của Clay về cơ bản vẫn là học biểu diễn và tái tạo. Do đó, để mô tả ranh giới chi tiết, vẫn cần các bộ giải mã phân đoạn phù hợp, sự kết hợp đặc trưng đa tỷ lệ và các chiến lược xử lý hậu kỳ để thu được kết quả chất lượng cao hơn trong các ứng dụng kỹ thuật.