OlmoEarth Studio의 임베딩 추출 및 COG 내보내기 기능
OlmoEarth Studio가 지구 관측 데이터를 수치적 표현인 임베딩 벡터로 계산하고 내보내는 기능을 공개했다. 사용자는 Studio UI 또는 API를 통해 관심 지역, 시간 범위, 인코더 변체, 해상도, 이미지 소스를 설정하여 클라우드 최적화 지오티프(COGs, Cloud-Optimized GeoTIFFs) 파일을 생성한다. COGs 포맷은 대용량 지리 데이터를 클라우드 환경에서 필요한 부분만 빠르게 읽어올 수 있도록 설계되어 데이터 공유와 전송 효율을 높인다.
임베딩 벡터는 지표면의 특성이 유사한 지역을 벡터 공간에서 가깝게 배치하고, 특성이 다른 지역은 멀리 떨어뜨리는 특성을 가진다. 이러한 벡터 표현은 유사도 검색, 세그멘테이션, 비지도 탐색 등 다양한 다운스트림 작업의 빠른 진입점으로 활용된다. OlmoEarth는 모델 가중치와 소스 코드를 공개하여 커뮤니티가 임베딩 생성 과정을 직접 검증할 수 있도록 지원한다. 사용자는 별도의 전역 아카이브에서 데이터를 가져오는 대신 온디맨드 방식으로 임베딩을 계산하므로, 연 단위 스냅샷뿐만 아니라 월 단위 임베딩을 생성해 계절적 역동성을 정확하게 포착할 수 있다.
60개 라벨로 달성한 F1 0.84의 퓨샷 세그멘테이션 성능
OlmoEarth-v1-Tiny 모델이 베트남 까마우(Ca Mau) 해안 망그로브 지역에서 클래스당 20개, 총 60개의 픽셀 라벨만으로 가중 F1 스코어 0.84의 토지 피복 지도를 생성했다. 분석팀은 ESA WorldCover 2021을 라벨 소스로 사용하여 망그로브, 수역, 기타 3개 클래스를 정의하고, 특성별 표준화를 거친 로지스틱 회귀(Logistic Regression) 분류기를 학습시켜 지역 전체의 픽셀을 예측했다. 이 과정에서 망그로브 숲, 조수 채널, 개활수역이 정밀하게 구분된 결과물이 도출되었다.
라벨링 데이터의 양과 성능의 상관관계를 분석한 결과, 라벨 수를 30개에서 300개로 늘려도 정확도 수치가 거의 변하지 않는 포화 상태에 도달했다. 이는 OlmoEarth 파운데이션 모델이 사전 학습 단계에서 이미 생태학적 구분 능력을 내재화했기 때문에, 단순한 선형 분류기(Linear Probe)만으로도 충분한 성능을 낼 수 있음을 의미한다. 192차원의 Tiny 인코더가 적은 라벨로도 경계를 회복했다는 사실은 모델의 표현력이 풍부함을 입증하며, 더 큰 규모의 Base 모델(768차원)은 이보다 더 풍부한 표현력을 제공한다. 사용자는 지상 실측 폴리곤이나 현장 조사 포인트, 혹은 저해상도 기존 지도를 보유하고 있다면 유사한 분류기를 학습시켜 특정 관심 지역의 전수 지도를 제작할 수 있다.
int8 양자화 저장 구조와 부동소수점 복구 메커니즘
OlmoEarth Studio는 임베딩 벡터를 부호 있는 8비트 정수(signed 8-bit integers, int8) 형식으로 저장하여 저장 공간과 전송 비용을 최적화한다. 벡터의 값 범위는 -127에서 +127 사이로 제한되며, -128 값은 데이터가 없는 영역을 나타내는 nodata로 예약하여 결측치를 명확히 구분한다. 이러한 양자화 구조는 고차원 벡터 데이터가 차지하는 메모리 점유율을 낮춰 대규모 지형 데이터를 효율적으로 관리하게 한다.
압축된 정수 벡터를 다시 정밀한 수치로 되돌리기 위해 `olmoearth_pretrain` 라이브러리의 `dequantize_embeddings` 함수를 사용한다. 이 함수는 int8로 저장된 정수 값을 다시 부동소수점으로 변환하여 모델 연산에 필요한 원래의 벡터 형태로 복구한다. 사용자는 이 복구 메커니즘을 통해 저장 단계의 효율성과 분석 단계의 정밀도를 동시에 확보할 수 있다.
분석에 사용되는 기본 데이터는 Sentinel-2 L2A 합성 데이터이며, 40미터 해상도를 지원한다. 사용자는 리소스 상황에 따라 192차원의 OlmoEarth-v1-Tiny 모델과 768차원의 Base 모델 중 하나를 선택할 수 있다. Tiny 모델은 경량 인코더임에도 높은 성능을 보이며, 더 높은 정밀도가 필요한 애플리케이션의 경우 더 많은 컴퓨팅 자원과 저장 공간을 투입하여 Base 모델로 교체해 사용할 수 있다.
코사인 유사도와 PCA를 활용한 4가지 실무 분석 시나리오
분석가가 캘리포니아 머세드(Merced) 도심지의 쿼리 픽셀을 추출해 다른 모든 픽셀과 코사인 유사도를 계산하면 라벨 없이도 지형 히트맵을 생성할 수 있다. 이 분석 결과에서 도심지의 건물 밀집 지역과 도로망은 밝게 표시되는 반면, 농경지는 어둡게 처리되어 모델이 학습 없이도 시가지와 농지를 구분함을 보여주었다. 쿼리 벡터를 특정 농경지 윈도우의 평균값으로 설정했을 때, 유사도가 0.89 이상인 지역은 모두 관개 시설을 갖춘 농경지로 나타났으며, 유사도가 0에 가까운 지역은 공항, 저수지, 건조한 목초지로 구분되었다.
서로 다른 시점의 임베딩 간 코사인 거리를 측정하면 지표면의 변화를 즉각적으로 탐지할 수 있다. 2023년 9월과 2024년 9월의 센티넬-2 임베딩을 비교한 결과, 캘리포니아 뷰트 카운티에서 발생한 파크 파이어(Park Fire) 화재 흔적이 즉시 식별되었다. 이는 별도의 라벨이나 학습 없이 두 개의 임베딩 COG 파일과 파이썬 코드만으로 변화 탐지가 가능함을 입증한다.
주성분 분석(PCA)을 통해 임베딩을 3차원으로 축소하고 이를 RGB 색상으로 매핑하면 비지도 방식으로 지형 구조를 탐색할 수 있다. 네덜란드 플레볼란트(Flevoland) 지역의 간척지 분석 결과, PCA 가색 이미지에서 농지 경계, 수역, 도시 지역이 서로 다른 색조로 뚜렷하게 구분되었다. 유사도 검색, 퓨샷 세그멘테이션, 변화 탐지, PCA 탐색은 표준 래스터 데이터 상에서 수 초 내에 실행되는 단순 연산으로 구현된다.
모델 선택 기준 및 실무 검증 가이드
실무자는 분석 목적과 가용 리소스에 따라 Frozen 임베딩 활용과 지도 미세 조정(SFT, Supervised Fine-Tuning) 중 하나를 선택한다. Frozen 임베딩 방식은 모델 가중치를 고정한 채 특징값만 추출하여 사용하므로 계산 비용이 낮고 OlmoEarth에 가장 빠르게 진입할 수 있는 방법이다. 반면, 더 높은 성능과 세밀한 분류가 필수적인 전문 애플리케이션에서는 SFT를 통해 모델 헤드를 직접 학습시켜 특정 도메인에 최적화된 가중치를 찾아내야 한다.
내보낸 임베딩 COG 파일은 QGIS, GDAL과 같은 표준 지리공간 도구와 즉시 연동되며, 파이썬 환경에서는 `rasterio` 라이브러리를 통해 벡터를 직접 제어할 수 있다. 특정 도메인에서의 임베딩 품질을 검증하려면 먼저 PCA 시각화를 통해 내부 구조를 파악하고, 특정 지점의 벡터를 쿼리로 설정한 코사인 유사도 검색을 수행하여 실제 위성 영상과 비교하는 과정을 권장한다.
구현 세부 사항과 코드는 아래의 공식 임베딩 튜토리얼 및 Colab 노트북 링크에서 확인할 수 있다.
- OlmoEarth Embedding Tutorial & Colab Notebook
SFT 없이 고정된 임베딩만 사용할 경우 특정 도메인에서 성능 한계가 발생할 수 있으므로, 전수 라벨링 전 소량의 데이터로 PCA 시각화와 코사인 유사도 분석을 수행해 파이프라인의 유효성을 먼저 검증하는 것이 중요하다.




