Чопо моделин алыстан зонддоодо колдонуу боюнча талкуу
Алдын ала маалымат
Алыстан зонддоо сүрөттөрүн алуу мүмкүнчүлүктөрүн үзгүлтүксүз жакшыртуу менен, жер катмарын классификациялоо, суу объектилерин аныктоо, айыл чарба жерлерин алуу, саздак жерлерди мониторингдөө жана шаардык өткөрбөгөн беттик сегменттөө сыяктуу тапшырмалар моделдердин жалпылоо жөндөмүнө жогорку талаптарды коёт. Салттуу семантикалык сегменттөө ыкмалары, адатта, кол менен белгиленген ири масштабдуу маалыматтарга таянат жана көбүнчө бир маалымат булагында же бир аймакта окутулат, бул аймактар, сенсорлор жана убакыт фазалары боюнча колдонулганда иштин начарлашына оңой алып келет. Ал эми, ири масштабдуу алыстан зонддоо маалыматтары боюнча алдын ала окутулган базалык моделдер, төмөнкү агымдагы конкреттүү тапшырмаларга өткөрүлүүдөн мурун жалпы беттик көрүнүштөрдү көбүрөөк үйрөнө алышат, ошентип, алыстан зонддоо сегменттөө жаатында олуттуу артыкчылыкты көрсөтөт. Клей - бул фонго карата сунушталган ачык булактуу Жерди байкоо базалык модели. Расмий түрдө "Жерге багытталган базалык модель" катары жайгаштырылган ал алыстан зонддоо сүрөттөрүн жайгашкан жер жана убакыт жөнүндө маалымат менен кошо ала алат жана кийинки классификациялоо, регрессия, өзгөрүүлөрдү аныктоо жана сегменттөө тапшырмалары үчүн мейкиндик-убакыт семантикасы менен өзгөчөлүктөрдүн көрүнүштөрүн чыгара алат.
Колдонмо көз карашынан алганда, Clay чектелген белгиленген үлгүлөрү бар, бирок так бизнес талаптары бар алыстан зонддоо сегментациялоо сценарийлери үчүн өзгөчө ылайыктуу. Мисалы, жерди пайдалануу/каптоо карталарын түзүүдө, аны коддогучтун негизги бөлүгү катары колдонсо болот, кичинекей үлгү шарттарында сегментациянын иштешин жакшыртуу үчүн алдын ала даярдалган жалпы функцияларды колдонот; региондор аралык миграция тапшырмаларында ал "бир аймакта окутуу жана башкасында ийгиликсиздик" көйгөйүн да жеңилдетет. Расмий документтерде ошондой эле Clay Sentinel-2, Landsat, Sentinel-1, NAIP, LINZ жана MODIS сыяктуу бир нече сенсордук киргизүүлөрдү колдой турганы, бул ага көп булактуу алыстан зонддоо колдонмолорунда күчтүү адаптациялоо мүмкүнчүлүгүн берери белгиленген.
Моделдик алкак
Clay v1.5тин жалпы алкагын "динамикалык киргизүү + мейкиндик-убакыттык жайгашкан жерди коддоо + MAE магистралдык + мугалимдин чектөөлөрү" деп кыскача айтууга болот. Биринчиден, модель динамикалык киргизүү модулу аркылуу киргизилген сүрөттүн тилкелеринин санына жана толкун узундугу маалыматына негизделген патчтардын көрсөтүлүшүн түзөт, ошентип ар кандай сенсорлордон жана тилкелердин ар кандай айкалыштарынан келген киргизүүлөрдү колдойт. Экинчиден, модель жайгашкан жерди коддоону киргизет, жердин чечилишин (GSD), кеңдикти жана узундукту жана убакыттык маалыматты өзгөчөлүктөрдүн көрсөтүлүшүнө коддойт, бул моделге спектрдик мазмунду "көрүүгө" гана эмес, ошондой эле сүрөттүн мейкиндик жайгашкан жерин жана убакыттык атрибуттарын түшүнүүгө мүмкүндүк берет.
Clay өзүнүн өзөгүндө жабык киргизүү блокторун кайра куруу үчүн Vision Transformer негизиндеги Masked Autoencoder түзүмүн колдонот. Расмий документтерге ылайык, кайра куруу жоготуулары жалпы жоготуунун болжол менен 95% түзөт, негизинен алыстан зонддоо маалыматтарынын спектрдик-мейкиндик түзүмүн үйрөнүүгө жооптуу; калган 5% мугалимдер тармагы тарабынан берилген өкүлчүлүк чектөөлөрүнөн келип чыгат. v1.5 киргизүү мейкиндигинин семантикалык экспрессивдүүлүгүн жогорулатуу үчүн мугалим катары DINOv2 колдонот. Моделдин өлчөмү боюнча, Clay v1.5 болжол менен 632 миллион параметрге ээ, анын ичинде коддогуч үчүн болжол менен 311 миллион параметр, декоддогуч үчүн болжол менен 15 миллион параметр жана мугалимдер тармагы үчүн болжол менен 304 миллион параметр. Расмий документтерде ошондой эле моделдин бул версиясы болжол менен 70 миллион глобалдык деңгээлде бөлүштүрүлгөн алыстан зонддоо чиптеринде окутулганы ачыкка чыгарылат, бул окутууга чейинки бекем негизди көрсөтөт.

1-сүрөт. Чопо модели
Сегментациялоо тапшырмаларында Clay семантикалык сегментация карталарын түз чыгарбайт, бирок өзгөчөлүктөрдү бөлүп алуунун негизги булагы катары ылайыктуураак. Жалпы ыкма - өзүнүн коддогучун сактап калуу жана SegFormer стилиндеги декодер, FPN же U-Net декодери сыяктуу жеңил сегментациялоо декодерин тиркөө, бул көп катмарлуу өзгөчөлүктөрдү бириктирүү аркылуу мейкиндиктин деталдарын калыбына келтирүү, акырында пиксель деңгээлиндеги классификациянын жыйынтыктарын чыгаруу. Бул "базалык модель + тапшырманын башы" ыкмасы алдын ала даярдалган көрсөтүү мүмкүнчүлүктөрүн кийинки тапшырмалардын адаптациясы менен тең салмактайт жана чек ара жана көп масштабдуу деталдарды алыстан зонддоо сегментациясынын талаптарына жакшы жооп берет.
Көбөйтүүнүн жыйынтыктары
Бул экспериментте Clay коддогучунан кийин SegFormer сыяктуу декодер кошулуп, сегментациянын жыйынтыктарын алдын ала айтуу үчүн ортоңку катмардын өзгөчөлүктөрүн бириктирүү колдонулган. Экспериментте окутуу жана валидациялоо үчүн болжол менен 2000 кокустук үлгү колдонулган. Болжол менен 30 окутуу доорунан кийин валидация топтому...салмакталган IoU 0,869Натыйжа.

2-сүрөт. Эксперименталдык маалыматтар
Чопо жер катмарын картага түшүрүү, суу объектилерин сегменттөө, токойлорду жана өсүмдүктөрдүн аз катмарын аныктоо, ошондой эле жолдорду жана суу өткөрбөгөн беттерди алуу сыяктуу тапшырмалар үчүн бирдиктүү өзгөчөлүктөрдүн негизи катары колдонулушу мүмкүн. Бирок, Клэйдин алдын ала окутуу максаты негизинен дагы эле өкүлчүлүктү үйрөнүү жана реконструкциялоо экенин белгилей кетүү керек. Ошондуктан, майда чек араларды мүнөздөө үчүн, инженердик колдонмолордо жогорку сапаттагы натыйжаларга жетүү үчүн тиешелүү сегменттөө декодерлери, көп масштабдуу өзгөчөлүктөрдү бириктирүү жана кийинки иштетүү стратегиялары дагы эле зарыл.

