facts
샤오미가 10만 시간 규모의 로봇 비종속 UMI(Universal Manipulation Interface, 범용 조작 인터페이스) 궤적으로 사전 학습한 로봇 파운데이션 모델 'Xiaomi-Robotics-1(이하 XR-1)'을 공개했다. 이 모델은 대규모 데이터로 일반적인 행동 생성 능력을 먼저 익힌 뒤, 실제 로봇 데이터로 미세 조정하는 2단계 학습 구조를 가진다.
사전 학습에 사용된 데이터는 가정, 상업 시설, 산업 현장, 야외 공간을 포함한 1,700개 이상의 시나리오를 포괄한다. 후속 학습 단계에서는 자체 수집한 7,200시간 이상의 실제 가정 로봇 작업 데이터(소파 정리, 신발장 분류, 주방용품 수납 등)와 필터링된 오픈소스 데이터, 그리고 사람이 직접 주석을 처리한 고품질 UMI 데이터를 결합해 사용했다.
실제 로봇 작업 적용 시, 작업당 평균 시연 시간에 따른 종합 성공률은 다음과 같다.
- 평균 10시간 미만 시연: 종합 성공률 75% (기준 모델 Ï0.5는 40%)
- 평균 40시간 미만 시연: 종합 성공률 85% (기준 모델 Ï0.5는 53%)
세부 작업별 성공률(10시간 미만 시연 기준)은 전화기 포장 70%, 프린터 보충 70%, 세탁물 투입 80%, 상자 포장 80%로 나타났다. 또한, 4개 주요 시뮬레이션 벤치마크에서 모두 최고 성능을 기록했다.
- RoboCasa: 74.5% (2위 대비 2.6%p 향상)
- RoboCasa365: 57.4% (2위 대비 23.2%p 향상)
- VLABench: 59.1% (2위 대비 11.1%p 향상)
- RoboDojo: 13.93% (2위 대비 58.3%p 향상)
how-it-works
사전 학습 단계의 핵심은 VLM(Vision-Language Model, 비전-언어 모델)을 활용한 자동 주석 파이프라인이다. 10만 시간이라는 방대한 데이터 규모로 인해 수동 주석이 불가능하므로, 다음과 같은 처리 과정을 거친다. 우선 긴 영상을 고정 길이의 클립으로 분할한다. 이후 VLM이 각 클립 내에서 그리퍼(Gripper)와 상호작용 객체의 상태 변화를 언어로 기술한다. 모델은 이렇게 생성된 '언어적 상태 전환 설명'에 맞춰 장면을 변화시키는 행동을 생성하도록 학습하며, 이를 통해 로봇의 형태에 종속되지 않는 일반적인 행동 생성 표현을 익힌다.
후속 학습 단계에서는 사전 학습된 일반 능력을 실제 물리적 환경에 맞게 정렬(Alignment)하는 두 가지 축의 작업을 수행한다.
첫째는 '로봇 형태 정렬'이다. 다중 형태의 실제 로봇 데이터를 사용해, 사전 학습에서 얻은 추상적인 행동 생성 능력을 특정 물리적 로봇의 관절 제어 및 구동 방식으로 매핑한다. 둘째는 '명령 정렬'이다. 기존에 '상태 전환 설명'을 입력받아 동작하던 모델이, 사용자의 '자연어 명령'을 직접 이해하고 수행할 수 있도록 전환하는 과정이다. 이때 후속 학습용 UMI 데이터는 사전 학습 때의 자동 생성 방식과 달리, 사람이 직접 시간 구간과 명령 프롬프트를 주석 처리하여 정밀도를 높였다.
연구 결과, 사전 학습 데이터의 규모와 모델의 매개변수가 증가할수록 검증 행동 오차는 지속적으로 감소했다. 특히 사전 학습 모델의 성능 향상이 후속 학습 이후의 실제 로봇 성공률 상승으로 직접 이어졌으며, 현재까지 성능 포화 징후는 관찰되지 않았다.
implementation-impact
개발자와 로봇 실무자가 주목해야 할 지점은 신규 작업 적응에 필요한 데이터 비용의 급격한 감소다. 기존 로봇 정책 모델은 고품질의 실제 로봇 데이터 부족으로 인해 확장이 제한적이었으나, XR-1은 대규모 비종속 데이터를 통해 이 병목을 완화했다.
실제 적용 시, 작업당 10시간 미만의 시연만으로도 75%의 성공률을 확보할 수 있다는 점은 현장 도입 비용을 크게 낮춘다. 예를 들어 '세탁물 투입' 작업의 경우, 10시간 미만 시연 시 80%, 40시간 미만 시연 시 100%의 성공률을 보였다. 이는 특정 환경이나 객체에 특화된 데이터를 대량으로 수집하지 않고도, 파운데이션 모델의 일반화 능력을 통해 빠르게 적응(Adaptation)시킬 수 있음을 의미한다.
또한, 보지 못한 환경과 객체 인스턴스에서도 예측 가능한 성능 상승 곡선을 보였다는 점은 운영 단계에서의 신뢰성을 높인다. 실무자는 이제 개별 작업마다 모델을 처음부터 학습시키는 대신, 대규모 UMI 사전 학습 모델을 기반으로 최소한의 실제 시연 데이터만을 추가해 빠르게 배포하는 전략을 취할 수 있다.




