로봇 없는 데이터 수집, Grabette의 구성과 공개 범위
로봇에게 새로운 동작을 가르치기 위해 수천만 원대의 원격 제어 장비를 구축하거나, 수천 번의 반복 작업을 직접 수행하며 데이터를 모으는 과정이 과연 효율적일까. Grabette는 고가의 로봇 없이 인간의 손과 저가형 센서만으로 로봇 학습용 6-DoF 조작 데이터를 수집하는 오픈소스 시스템이다. 여기서 6-DoF는 3차원 공간에서의 위치와 회전을 포함한 6자유도를 뜻한다. 사용자는 로봇이나 실험실, 원격 제어 장비 없이 자신의 손으로 작업을 기록해 로봇이 즉시 학습할 수 있는 데이터셋을 얻는다. 이는 데이터 수집의 진입 장벽을 낮춰 누구나 조작 데이터를 생성할 수 있게 한다.
Grabette는 조작 시연을 재구성하는 데 필요한 모든 장치가 탑재된 핸드헬드 그리퍼 형태다. 누구나 온라인으로 주문 가능한 표준 부품인 Raspberry Pi와 표준 Pi 카메라, 기성품인 OAK-D 깊이 카메라, 그리고 회전각을 측정하는 자기 인코더(magnetic encoders)로 구성된다. 특정 벤더에 종속되어 제품을 강제로 사용해야 하는 포크 락인(fork lock-in) 문제를 제거했다. 누구나 작업대 위에서 부품을 조립해 시스템을 구축할 수 있도록 하드웨어 설계와 데이터 처리 소프트웨어 전체를 오픈소스로 공개했다. 구체적인 제작 방법은 GitHub 저장소를 통해 제공된다.
수집된 데이터는 LeRobot이라는 데이터셋 표준을 따르며 Hugging Face Hub라는 모델 공유 플랫폼을 통해 배포된다. 데이터 처리를 위해 사용자의 컴퓨터에 별도의 소프트웨어를 설치할 필요가 없다. 브라우저에서 실행되는 처리 파이프라인을 통해 수집한 에피소드를 선택하고 원클릭으로 후처리를 수행한다. 데이터 가공은 HF Space에서 이루어지며, 이를 통해 수집한 시연 데이터를 즉시 학습 가능한 형태로 변환한다. 이러한 구조는 단일 연구실이 아닌 커뮤니티가 함께 참여해 대규모 오픈 조작 데이터셋을 구축하는 씨앗이 된다.
이번 공개 범위는 하드웨어 설계부터 데이터 처리 소프트웨어 전체를 포함한다. 특히 특정 로봇 팔의 사양을 가정하지 않는 Robot-agnostic 설계를 적용했다. 모든 시연 데이터는 카메라 로컬 6-DoF 데카르트 포즈와 그리퍼 상태로 저장된다. 따라서 동일한 LeRobot 데이터셋을 사용해 서로 다른 로봇과 학습 방법을 적용할 수 있다. 사용자는 전문 지식 없이도 작업 시연부터 학습 준비 완료 데이터셋 확보까지의 과정을 빠르게 수행하며, 결과물을 HF Dataset 및 HF Model 형태로 검증할 수 있다.
듀얼 카메라와 6-DoF 궤적 복원 작동 방식
사용자가 보는 화면은 비슷해도 데이터를 처리하는 방식은 완전히 다르다. Grabette는 역할이 분리된 두 개의 카메라를 배치해 로봇 학습에 필수적인 시각 정보와 위치 정보를 동시에 확보한다. 먼저 광각 피쉬아이(어안 렌즈처럼 넓은 범위를 찍는 카메라) 카메라는 로봇의 손목 카메라 시점과 유사한 맥락 정보를 제공한다. 이는 로봇이 작업 대상물과 주변 환경의 관계를 파악하는 데 사용된다. 동시에 RGBD(색상 정보와 거리 정보를 동시에 측정하는 카메라) 카메라는 강건한 6-DoF 추적을 수행한다. 6-DoF는 3차원 공간에서의 위치인 X, Y, Z 좌표와 회전 상태인 Roll, Pitch, Yaw를 모두 포함한 6자유도 궤적을 의미한다. 맥락 파악용 카메라와 추적용 카메라를 분리함으로써 시야각 확보와 정밀한 좌표 복원이라는 두 가지 목표를 동시에 달성한다.
정밀한 궤적 복원을 위해서는 서로 다른 센서에서 들어오는 데이터의 시점이 정확히 일치해야 한다. Grabette는 단일 공유 클록(shared clock, 여러 장치가 하나의 기준 시간에 맞춰 작동하게 하는 장치)을 도입해 모든 데이터를 동기화한다. 사용자가 기록 버튼을 누르는 순간, 관측 카메라의 영상과 더불어 추적 카메라가 수집하는 컬러, 깊이, IMU(관성 측정 장치) 데이터, 그리고 그리퍼 인코더의 관절 값이 동일한 시간 표식과 함께 기록된다. 이렇게 수집된 모든 정보는 Raspberry Pi에 로컬 파일 형태로 저장된다. 버튼을 다시 눌러 에피소드를 종료하면 하나의 작업 단위가 완성된다. 각 센서의 값이 하나의 시간축으로 정렬되어야만 로봇이 인간의 손 움직임을 끊김 없는 연속적인 궤적으로 학습할 수 있다.
수집된 원시 데이터는 브라우저 기반의 대시보드를 통해 최종 학습 데이터로 변환된다. 사용자는 웹 브라우저에서 Grabette 대시보드에 접속해 Raspberry Pi에 저장된 여러 에피소드 중 데이터셋에 포함할 항목을 선택한다. 선택 후 클릭 한 번으로 후처리가 시작되며, 복잡한 좌표 계산과 필터링 과정이 자동으로 수행되어 로봇이 즉시 학습할 수 있는 형태로 변환된다. 이 파이프라인은 별도의 로컬 소프트웨어 설치 없이 브라우저 환경에서 작동하도록 설계되었다. 사용자는 버튼 클릭으로 기록을 시작하고, 대시보드에서 선택하여 전처리를 마치는 단순한 워크플로우를 통해 학습 준비가 완료된 데이터셋을 얻는다. 이러한 구조는 데이터 수집의 진입 장벽을 낮춰 더 많은 시연 데이터를 빠르게 확보하게 한다.
기존 방식과 달라진 지점
특정 기업의 전용 장비를 구매해 폐쇄적인 환경에서 데이터를 쌓는 팀이 있고, 누구나 구할 수 있는 부품으로 도구를 직접 만들어 데이터를 확장하는 팀이 있다. 후자의 효율은 단순히 비용 절감이 아니라, 장비 교체나 시스템 수정이 자유로운 유연성에서 결정된다. Grabette는 스탠퍼드 대학의 UMI(Universal Manipulation Interface, 범용 조작 인터페이스)에서 영감을 받아 설계되었다. UMI는 사람이 손에 쥐는 핸드헬드 그리퍼와 피쉬아이 카메라를 이용해 실제 환경에서 시연을 기록하고, SLAM(Simultaneous Localization and Mapping, 주변 환경의 지도를 그리며 동시에 자신의 위치를 추정하는 기술) 기반의 궤적 복원 방식을 통해 로봇이 학습할 수 있는 데이터를 추출한다.
현재 로봇 학습 분야에는 Agibot의 MEgo 그리퍼, Genrobot의 DAS 그리퍼, Sunday Robotics의 skill capture glove 같은 캡처 장비들이 활용되고 있다. 이 장비들은 정밀한 데이터 수집이 가능하지만 소스 코드가 공개되지 않은 폐쇄형 구조를 취한다. 사용자는 해당 제품을 구매한 뒤 제조사가 제공하는 전용 소프트웨어 내에서만 작동해야 하며, 이는 특정 벤더의 하드웨어와 소프트웨어에 종속되는 벤더 락인(Vendor Lock-in, 특정 업체 제품에 의존해 다른 제품으로 바꾸기 어려운 상태) 현상을 야기한다. Grabette는 이러한 종속성을 완전히 제거하여 누구나 시스템을 수정하고 개선할 수 있도록 모든 설계와 파이프라인을 오픈소스로 공개했다.
하드웨어 구현 단계에서는 특정 제조사의 독점 부품을 배제하고 누구나 온라인으로 주문 가능한 표준 센서만을 사용한다. 전용 칩셋이나 독자 규격의 커넥터를 사용하는 대신 시장에서 쉽게 구할 수 있는 범용 부품을 배치해 하드웨어 진입 장벽을 낮췄다. 소프트웨어 처리 과정 또한 로컬 PC에 복잡한 종속성 라이브러리를 설치하는 번거로움을 없앴다. 대신 브라우저 기반의 파이프라인을 제공하여 사용자가 웹 환경에서 즉시 데이터를 처리하고 가공할 수 있는 환경을 구축했다.
Grabette의 목표는 사용자가 과제를 정의하는 시점부터 학습된 모델을 얻는 시점까지의 진입 장벽을 최소화하는 것이다. 고가의 전용 장비 없이 벤치탑 수준에서 학습 데이터를 빠르게 생성하고, 이를 표준화된 형식으로 공유함으로써 데이터 수집에 들어가는 시간과 비용을 낮췄다. 결과적으로 폐쇄적인 상용 툴체인 대신 표준 부품과 오픈소스 파이프라인을 결합해 로봇 학습 데이터의 생산성을 높이는 구체적인 구현 경로를 확보했다.
200개의 시연 데이터로 증명한 학습 루프의 효율
아이디어를 실제 동작하는 로봇 모델로 구현하는 데 걸리는 시간이 급격히 줄어들고 있다. 과거에는 수만 번의 반복 작업이나 고가의 원격 제어 장비가 필요했지만, 이제는 소수의 데이터만으로도 유효한 정책(Policy, 로봇이 특정 상황에서 어떤 행동을 할지 결정하는 규칙)을 학습시키는 것이 가능하다. Grabette는 200개의 기록된 시연 데이터를 사용하여 엔드-투-엔드 학습 루프를 구현했다. 엔드-투-엔드란 데이터 수집부터 모델 학습, 실제 동작까지의 전 과정을 하나로 연결한 체계를 말한다. 이 과정에서 생성된 학습 결과물은 누구나 검증할 수 있도록 Hugging Face Hub에 Dataset과 Model 형태로 공개되었다.
데이터 수집의 병목 현상은 더 이상 특정 연구실의 자원 규모나 예산에 의존하지 않는다. Grabette는 고가의 장비 없이 벤치탑 수준에서 데이터를 생성하고 이를 즉시 학습에 활용하는 구조를 통해 데이터 확보 장벽을 낮췄다. 사용자가 버튼을 눌러 기록한 개별 에피소드가 모여 데이터셋의 다양성을 높이는 구조다. 이는 특정 벤더의 폐쇄적인 시스템에 종속되지 않고 누구나 표준 센서와 오픈소스 파이프라인을 통해 기여할 수 있음을 보여준다. 결과적으로 학습 데이터의 양적 팽창보다 수집의 용이성이 모델 배포 속도를 결정하는 핵심 변수가 되었다.
학습 루프의 효율성을 극대화하기 위한 하드웨어 확장 단계가 이어진다. 1인칭 시점 캡처를 위한 헤드 마운트 POV(Point of View, 사용자의 시선에서 바라보는 관점) 장치인 Casquette를 개발하고 있다. Casquette가 도입되면 Grabette의 손목 시점 데이터와 사용자의 시선 데이터가 결합되어 더욱 정교한 조작 학습이 가능해진다. 이는 로봇이 인간의 의도를 더 정확하게 파악하게 만드는 보완 장치가 된다. 최종 목표는 소수 연구실의 전유물이 아닌, 전 세계 커뮤니티가 공동으로 구축하는 대규모 오픈 조작 데이터셋을 만드는 것이다. 누구나 Grabette를 제작하고 관심 있는 작업을 기록해 Hub에 공유함으로써 로봇 학습의 진입 장벽을 낮추는 생태계를 지향한다.
로봇 불가지론적 설계가 한국 AI 실무자에게 주는 의미
로봇 팔 모델을 변경할 때마다 데이터 수집 환경과 좌표계 설정을 전부 새로 구축해야 하는 번거로움을 어떻게 해결할 수 있을까. Grabette는 특정 로봇 하드웨어에 종속되지 않는 로봇 불가지론적(Robot-agnostic) 설계를 채택했다. 이는 데이터 저장 단계에서 특정 로봇 팔의 관절 각도나 제조사 고유의 좌표계를 전혀 가정하지 않는 방식이다. 대신 카메라를 기준으로 한 로컬 6-DoF(3차원 공간의 위치 X, Y, Z와 회전 Roll, Pitch, Yaw를 포함한 6자유도) 데카르트 포즈와 그리퍼의 개폐 상태만을 기록한다. 하드웨어의 물리적 특성과 데이터 포맷을 완전히 분리함으로써 수집된 데이터가 특정 기기에 묶이지 않고 범용적으로 활용되도록 설계했다.
수집한 데이터를 실제 로봇에서 실행하기 위해 Grabette와 하드웨어 DNA를 공유하는 Gripette를 함께 운용한다. Gripette는 로봇 팔 끝단에 장착하여 실제 물체 조작을 수행하는 엔드 이펙터(end-effector)로, Grabette의 로봇 버전 쌍둥이에 해당한다. 사용자가 Grabette를 손에 쥐고 기록한 인간의 조작 궤적을 Gripette가 장착된 로봇 팔이 그대로 추종하여 재현하는 구조다. 기록 장치와 실행 장치의 물리적 규격과 센서 특성을 동일하게 맞췄기에, 인간의 시연 데이터가 로봇의 실제 동작으로 변환되는 과정에서 발생하는 기하학적 오차를 최소화했다.
생성된 모든 데이터는 Hugging Face Hub의 표준 LeRobot 데이터셋 포맷으로 출력되어 저장된다. 실무자는 동일한 데이터셋 하나를 활용해 서로 다른 제조사의 로봇 팔에 적용하거나, 다양한 학습 방법론을 교차 검증하며 최적의 모델을 찾을 수 있다. 로봇마다 제각각이었던 데이터 파이프라인를 표준 규격으로 통합하여 하드웨어 교체 시 발생하는 소프트웨어 수정 비용을 낮춘 결과다. 결과적으로 작업 시연이라는 단순 행동에서 학습 준비가 완료된 데이터셋을 확보하기까지 요구되는 전문 지식의 진입 장벽이 대폭 낮아졌다. 고가의 텔레오퍼레이션 장비 없이 벤치탑 수준의 환경에서 빠르게 데이터를 생성하고, 이를 LeRobot 생태계를 통해 즉시 모델 학습에 투입할 수 있는 실무적 판단 기준을 제공한다.
수천만 원대의 원격 제어 장비나 반복적인 수동 작업 없이도 6-DoF 조작 데이터를 확보하는 경로가 열렸다. 맥락을 잡는 광각 카메라와 정밀한 궤적을 추적하는 RGBD 카메라를 분리한 듀얼 구조는 데이터 수집의 물리적 비용을 낮추면서도 데이터의 정확도를 유지한다.
이제 로봇 학습의 성패는 장비의 가격이 아니라 얼마나 빠르게 양질의 시연 데이터를 생성해 LeRobot 생태계에 투입하느냐에 달려 있다. 고가 장비 없이 벤치탑 수준의 환경에서 Grabette를 구축해 즉시 모델 학습에 활용하는 실무적 판단이 데이터 생산성을 결정한다.




