실제 환경에서 작동하는 로봇 정책을 구축하는 것은 더 이상 컴퓨터 문제가 아니라 데이터 문제입니다. 인공지능(AI) 개발팀은 모델 학습에 활용할 수 있는 세 가지 데이터 소스, 즉 원격 조작, 시뮬레이션, 그리고 인간 행동 영상 데이터를 선택할 수 있습니다. 각 소스는 비용 곡선, 데이터 정확도, 그리고 로봇의 학습 한계가 서로 다릅니다. 잘못된 데이터 소스를 선택하면 6개월이라는 시간과 수백만 달러의 예산이 허비될 수 있습니다. 이 가이드에서는 인공지능 개발에 필요한 각 데이터 소스를 분석하고, 각각의 장점과 한계를 살펴보고, 이러한 소스들을 조합하여 실제 운영 환경에 적합한 로봇 학습 데이터 전략을 수립하는 방법을 제시합니다.
주요 요점
- 원격 조작은 가장 높은 정확도의 데이터를 생성하지만, 조작자 1인당 시간당 5~50건의 에피소드 처리량에서 병목 현상이 발생합니다.
- 시뮬레이션은 수백만 개의 에피소드를 저렴하게 생성하지만, 시뮬레이션과 실제 사이의 격차를 초래하여 접촉이 많은 작업에서는 제대로 작동하지 않습니다.
- 인간 영상은 손쉽게 확대/축소되지만 로봇 동작에 대한 레이블이 부족하고, 구현상의 공백이 존재합니다.
- 최근 연구에 따르면 실제 작업에서 원격 조작 샘플 1개와 동일한 가치를 제공하는 데 시뮬레이션 샘플 8개가 필요한 것으로 나타났습니다.
- 대부분의 실제 운영 환경에서 사용되는 AI 파이프라인은 세 가지 소스 중 하나를 선택하기보다는 모두를 결합합니다.
왜 데이터는 인공지능 구현의 병목 현상일까요?
실체화된 AI의 병목 현상은 데이터 부족에서 비롯됩니다. 동작과 연관된 감각운동 데이터가 인터넷 규모로 존재하지 않기 때문입니다. 언어 모델은 웹에서 수집한 수조 개의 텍스트 토큰을 처리할 수 있지만, 로봇 정책에는 동기화된 관절 각도, 그리퍼 힘, 카메라 프레임, 작업 맥락 등 물리적 조작 중에 기록되는 모든 데이터가 필요합니다. 하지만 이러한 데이터는 무료로 제공되지 않습니다.

규모 격차는 극명합니다. 전 세계적으로 3.9만 대 이상의 산업용 로봇이 가동 중이지만(IFR World Robotics, 2024), 가장 큰 규모의 공개 로봇 조작 데이터셋조차 약 1만 개의 에피소드(Open X-Embodiment, Padalkar et al., 2023)만을 포함하고 있습니다. 하드웨어는 도처에 있지만, 데이터는 그렇지 않습니다. 단일 팔 매니퓰레이터, 양손 휴머노이드, 팔이 달린 모바일 베이스 등 새로운 형태의 로봇이 등장할 때마다 데이터 요구 사항이 사실상 재설정됩니다. 왜냐하면 한 형태에 맞춰 학습된 정책이 다른 형태에 깔끔하게 적용되는 경우는 드물기 때문입니다.
구현의 간극: 한 로봇의 물리적 구성에 맞춰 학습된 정책을 다른 로봇에 적용할 때 발생하는 성능 저하.
이러한 이유로 로봇 학습 팀은 이제 단순히 데이터 수집이 아닌 데이터 전략을 고려해야 합니다. 원격 조작, 시뮬레이션, 그리고 사람의 비디오 데이터를 적절히 조합하는 것이 모델의 기능, 출시 속도, 그리고 투자 비용을 결정합니다.
원격 조작 데이터란 무엇이며, 언제 유용하게 활용될 수 있을까요?
원격 조작 데이터는 인간 조작자가 리더 암, VR 헤드셋, 외골격 또는 손목 장착 인터페이스를 통해 로봇을 실시간으로 제어할 때 기록되며, 시스템은 모든 관절 각도, 힘 측정값 및 카메라 프레임을 동기화하여 기록합니다.

원격조작: 조작 중 기록된 감각운동 데이터를 동기화하여 로봇을 실시간으로 인간이 제어합니다.
원격 조작은 정확성 면에서 우위를 점합니다. 숙련된 사람이 동일한 로봇에서 동일한 작업을 수행하여 데이터를 생성하기 때문에 동작과 상태 간의 대응 관계가 완벽하고 구현상의 차이가 없습니다. 모방 학습, 행동 복제, 정책 미세 조정 모두 깔끔한 원격 조작 시뮬레이션을 통해 이점을 얻습니다.
비용은 규모가 커질수록 증가합니다. 숙련된 원격 조작자는 작업 복잡성에 따라 시간당 5~50개의 에피소드를 제작할 수 있으며, 조작자의 피로도가 높아질수록 품질이 저하됩니다. 로봇 한 대와 조작자 한 명으로는 한계가 있으며, 이것이 바로 ALOHA, UMI, 그리고 외골격 기반 휴머노이드 로봇(AgiBot, Fourier GR-1)과 같은 개방형 플랫폼들이 급격한 규모 확장에 집중하기보다는 비용 절감과 처리량 증대에 초점을 맞춘 이유입니다.
샤입의 물리적 AI 데이터 서비스 원격 조작 셀을 다중 모드 수집 워크플로와 함께 운영하여 로봇 팀이 운영자 파이프라인을 처음부터 구축할 필요가 없도록 합니다.
시뮬레이션 데이터란 무엇이며, 어디까지 확장해서 사용할 수 있나요?
시뮬레이션 데이터는 MuJoCo, NVIDIA Isaac Sim, Isaac Lab, PyBullet과 같은 물리 엔진을 통해 생성되며, 이러한 엔진들은 수천 개의 병렬 인스턴스에서 작업을 수행하는 가상 로봇을 렌더링합니다. 단일 GPU 클러스터는 거의 추가 비용 없이 하룻밤 사이에 수백만 개의 에피소드를 생성할 수 있습니다.

시뮬레이션은 확장성과 안전성 측면에서 우위를 점합니다. 하드웨어를 손상시키지 않고도 경계 상황, 충돌 오류, 위험한 구성 등을 모두 탐색할 수 있습니다. 도메인 무작위화(훈련 중 조명, 텍스처, 마찰, 관절 강성을 무작위로 변화시키는 것)는 단일 시각적 구성에 과적합되는 대신 실제 환경의 다양한 변화에도 견딜 수 있는 정책을 생성합니다.
시뮬레이션과 실제 간의 격차: 시뮬레이션에서 학습된 정책을 실제 하드웨어에 배포할 때 성능 저하가 발생하는 것은 일반적으로 접촉 역학, 센서 노이즈 및 시각적 충실도 차이 때문입니다.
비용은 실제 배포 단계에서 나타납니다. 시뮬레이터는 젖은 비누의 마찰력, 스티로폼 포장재의 탄성, 형광등 아래에서 반사되는 금속 표면의 시각적 변화 등을 모델링하지 못합니다. 접촉이 잦은 작업에서 시뮬레이션과 실제 구현 간의 격차가 가장 자주 발생합니다. 2025년에 발표된 연구에서는 이러한 상충 관계를 정량화했는데, 실제 조작 작업에서 원격 조작 샘플 1개와 동일한 효과를 얻으려면 대략 8개의 시뮬레이션 샘플이 필요하다는 결과가 나왔습니다(로봇 조작을 위한 데이터 활용 법칙, 2025).
NVIDIA Cosmos 및 3D Gaussian Splatting과 같은 사실적인 렌더링 플랫폼은 시각적 격차를 좁히고 있지만, 마찰, 변형, 순응도와 같은 동적 격차는 여전히 해결하기 어려운 과제입니다.
인간 영상 데이터란 무엇이며, 어떤 정보를 제공할까요?
인간 비디오 데이터는 개인 중심 카메라, 감시 카메라 앵글 또는 엄선된 시연 세트를 통해 캡처된, 빨래 개기, 접시 쌓기, 부품 조립과 같은 조작 작업을 수행하는 사람들의 영상입니다.

사람이 촬영한 영상은 비용과 다양성 측면에서 유리합니다. 스마트폰 하나만 있으면 한 사람이 부엌, 차고, 공장, 사무실 등 다양한 장소에서 수백 건의 시연 영상을 촬영할 수 있습니다. 로봇도, 실험실도, 운영자 교육도 필요 없습니다. 사람 영상으로 사전 학습된 대규모 영상-언어 모델은 일반적인 장면 이해 능력을 습득하여 미세 조정 전에 로봇 정책에 유용하게 적용할 수 있습니다.
한계점은 동작에 대한 레이블이 없다는 것입니다. 비디오는 손이 머그컵을 잡는 모습을 보여주지만, 가해진 힘이나 로봇 팔이 해당 동작을 재현하는 데 필요한 관절 각도는 기록하지 않습니다. 역동학 모델과 손-말단 효과기 재타겟팅을 통해 이러한 레이블을 부분적으로 추론할 수 있지만, 결과적으로 생성되는 가상 동작에는 노이즈가 포함됩니다.
주방 로봇을 개발하는 스타트업을 상상해 보세요. 그들에게는 8만 달러의 예산이 있습니다. 숙련된 원격 조종으로 20시간을 투자하면 로봇 팔의 작동 모습을 담은 깔끔한 영상 200개를 얻을 수 있을지도 모릅니다. 하지만 다양한 가정집 주방에서 촬영한 영상을 20시간 동안 수집하면 수천 개의 1인칭 시점 영상을 얻을 수 있습니다. 전화 통화로 얻은 영상은 훨씬 선명하고, 영상 자료는 훨씬 풍부합니다. 로봇은 훈련 단계에 따라 다양한 비율로 두 가지 모두를 필요로 합니다.
원격 조작, 시뮬레이션, 그리고 실제 사람의 영상 촬영: 비교 분석
| 외형 치수 | 원격 운영 | 시뮬레이션 | 인간 비디오 |
|---|---|---|---|
| 에피소드당 비용 | 높음 (작업자 + 로봇 시간) | 매우 낮음 (계산 전용) | 매우 낮음 (기여자 시간) |
| 맞춤형 설비 | 시간당 5~50개 에피소드 | GPU당 시간당 수천 건 | 기여자 한 명당 시간당 수백 달러 |
| 충실도 | 최고 (체현 간극 제로) | 중간 (시뮬레이션과 실제 간의 차이) | 중간 (작업 레이블 없음) |
| 과업 다양성 | 운영 시간으로 제한됨 | 환경적 제약에 따른 디자인 | 최고 수준 (실제 다양성) |
| 베스트 | 미세 조정, 접촉이 많은 작업 | 사전 교육, 예외 상황, 안전 | 사전 훈련, 장면 이해 |
| 주요 약점 | 확장성이 떨어짐 | 시뮬레이션에서 실제로의 전송 | 구현체 리타겟팅 |
| 일반적인 생산 구성 | 전체의 5~20% | 전체의 60~80% | 전체의 10~30% |
실체화된 AI에 적합한 데이터 전략을 어떻게 선택해야 할까요?
로봇 훈련 데이터 전략을 선택할 때 가장 중요한 것은 데이터 소스가 아니라 배포 대상입니다. 공장 작업용 로봇, 가정용 휴머노이드 로봇, 수술 보조 로봇은 정확도, 안전성, 외형 구현에 대한 요구 사항이 근본적으로 다르므로 이상적인 데이터 조합 또한 완전히 다릅니다. 특히 휴머노이드 로봇은 배포 전 특별한 요구 사항이 있는데, 이 가이드에서 자세히 살펴보겠습니다. 휴머노이드 로봇 훈련 데이터.
실용적인 3단계 프레임워크:

- 시뮬레이션 및 실제 사람 영상으로 사전 학습을 진행하세요. 시뮬레이션을 활용하여 장면, 객체 및 안전 경계 상황을 광범위하게 포괄하십시오. 자연스러운 조작에 대한 사전 정보와 실제 시각적 다양성을 위해 1인칭 시점의 인간 비디오를 추가하십시오. 이 단계는 비용이 저렴하고 광범위하게 적용할 수 있습니다.
- 대상 구현체에 원격 조작으로 앵커를 설치합니다. 실제로 배치할 로봇에 대해 500~2,000개의 고품질 원격 조종 에피소드를 수집하십시오. 이 단계는 비용이 많이 들지만 대체 불가능합니다. 실제 상황에 기반하여 정책을 수립할 수 있기 때문입니다.
- 데이터 선순환 구조를 따라 반복합니다. 배포 후에는 자율 주행 과정과 실패 사례를 기록하십시오. 이러한 기록들을 새로운 원격 조작 및 사람의 영상과 함께 다음 훈련 주기에 반영하십시오.
요리사를 훈련시키는 것에 비유해 보세요. 시뮬레이션은 요리 학교와 같습니다. 범위가 넓고, 비용이 저렴하며, 실수를 용인합니다. 사람 시점의 비디오 분석은 수천 개의 요리 영상을 시청하는 것과 같습니다. 광범위한 맥락을 제공하지만, 실제 주방 환경이 없습니다. 원격 조작은 실제 주방에서 이루어지는 실습과 같습니다. 시간이 오래 걸리고 비용이 많이 들지만, 대체 불가능합니다. 진정한 요리사라면 이 세 가지 중 어느 하나라도 건너뛸 수 없습니다.
샤입의 다중 모드 데이터 수집 주석 워크플로 이 시스템은 원격 조작 셀 운영, 시뮬레이션 라벨링, 50만 명 이상의 글로벌 참여자 네트워크를 통한 1인칭 시점 비디오 수집 등 세 가지 계층을 모두 지원하도록 구축되어 로봇 공학 팀이 5개 공급업체의 제품을 조합하지 않고도 하이브리드 전략을 실행할 수 있도록 합니다.
맺음말
원격 조작, 시뮬레이션, 인간 영상 중 어느 것이 더 나은지에 대한 논쟁은 2026년에는 명확한 해답을 갖게 될 것입니다. 바로 선택이 아니라, 이 세 가지를 조합하는 것입니다. 원격 조작은 높은 정확도를, 시뮬레이션은 확장성을, 인간 영상은 다양성을 제공합니다. 실제 운영 환경에 적용되는 AI 파이프라인은 배포 대상, 구현 방식, 예산을 고려하여 이 세 가지 기술을 모두 결합합니다. 향후 10년간 로봇 학습 분야에서 승자는 가장 저렴한 솔루션을 선택하는 팀이 아니라, 가장 스마트한 조합을 만들어내는 팀이 될 것입니다.
로봇 훈련에서 원격 조작 데이터와 시뮬레이션 데이터의 차이점은 무엇인가요?
원격 조작 데이터는 실제 로봇을 실시간으로 사람이 제어하는 동안 기록되어, 구현상의 차이가 전혀 없는 고충실도 동작-상태 쌍을 생성합니다. 시뮬레이션 데이터는 MuJoCo 또는 NVIDIA Isaac Sim과 같은 물리 엔진에서 생성되며, 저렴한 비용으로 대규모 처리가 가능하지만 시뮬레이션과 실제 간의 격차가 발생합니다. 원격 조작은 정책을 미세 조정하는 데 가장 적합하고, 시뮬레이션은 사전 학습 및 예외 상황에 가장 적합합니다.
로봇 정책을 학습시키려면 얼마나 많은 원격 조작 데이터가 필요합니까?
원격 조작 요구 사항은 모델이 사전 학습되었는지 또는 처음부터 학습되었는지에 따라 달라집니다. 시뮬레이션 및 인체 영상으로 사전 학습된 정책은 일반적으로 목표 작업당 500~2,000회의 원격 조작 에피소드로 수렴합니다. 사전 학습이 없는 경우, 필요한 에피소드 수는 10,000회 이상으로 급격히 증가합니다. Open X-Embodiment와 같은 교차 체현 사전 학습 데이터셋은 미세 조정 단계에서 필요한 원격 조작 예산을 크게 줄여줍니다.
인간의 영상이 인공지능 실체 훈련에서 원격 조작을 대체할 수 있을까요?
인간의 동작 영상은 로봇의 동작에 대한 명확한 정보(힘 값, 관절 각도, 그리퍼 상태 등)가 부족하기 때문에 원격 조종을 완전히 대체할 수 없습니다. 이러한 정보는 모방 학습에 필수적입니다. 역동학 모델을 통해 부분적인 동작 정보를 추론할 수는 있지만, 이를 기반으로 구축된 정책은 실제 원격 조종 데이터를 활용하여 미세 조정된 정책보다 성능이 떨어집니다. 인간의 동작 영상은 원격 조종 미세 조정 단계 이전에 사전 학습 자료 및 장면 이해 자료로 활용될 때 가장 효과적입니다.
시뮬레이션과 실제 시뮬레이션 간의 격차는 무엇이며, 어떻게 줄일 수 있을까요?
시뮬레이션과 실제 환경 간의 성능 차이는 시뮬레이션에서 학습된 정책을 실제 하드웨어에 적용할 때 발생하는 성능 저하를 의미합니다. 이러한 차이를 줄이기 위한 방법으로는 도메인 무작위화(학습 중 조명, 텍스처, 마찰력 변화), NVIDIA Cosmos와 같은 사실적인 렌더링 플랫폼, 장면 재구성을 위한 3D 가우시안 스플래팅, 그리고 실제 로봇의 물리적 매개변수와 일치하는 시스템 식별 등이 있습니다. 대부분의 실제 운영 환경에서는 이러한 여러 방법을 조합하고 원격 조작을 통한 미세 조정 단계를 거칩니다.
2026년 휴머노이드 로봇 훈련에 가장 적합한 데이터 소스는 무엇일까요?
휴머노이드 로봇 훈련은 계층화된 전략을 통해 가장 큰 효과를 얻습니다. 즉, 이동 및 전신 제어를 위한 시뮬레이션, 정교한 조작을 위한 외골격 기반 원격 조작, 그리고 자연스러운 장면 정보를 얻기 위한 대규모 1인칭 시점 비디오 데이터셋을 활용합니다. AgiBot World 및 Open X-Embodiment와 같은 공개 데이터셋은 다양한 형태에 대한 사전 훈련을 제공하며, 맞춤형 원격 조작 셀은 목표 휴머노이드의 특정 운동학적 특성에 맞춰 정책을 수립합니다.