로봇 공학 연구의 숨겨진 핵심은 바로 배포입니다

@deepakpathak
영어2026년 9월 10일
359K
862
150
42
722

TL;DR

Deepak Pathak은 Skild AI가 1억 달러의 ARR을 달성하기까지의 여정을 설명하며, 배포가 모델의 정확도, 속도 및 재귀적 개선을 이끄는 근본적인 연구의 핵심임을 강조합니다.

Skild AI 가 최초 상용 배포 10 개월 만에 연간 반복 매출(ARR) 1 억 달러를 돌파했습니다.

Deepak Pathak - inline image

먼저, 이를 가능하게 해준 모든 팀원과 모든 파트너분께 감사드립니다.

이는 수많은 훌륭한 사람들의 엄청난 노력 덕분에 이루어졌습니다. 10 개월 만에 우리는 물품 운송, 배달, 현장 검사, 보안, 식품 준비는 물론 창고, 공장, 데이터 센터 내 운영에 이르기까지 60 개 이상의 유료 고객을 확보했습니다. 모빌리티 솔루션은 전체 매출의 10%를, Fetch 솔루션은 4%를 차지합니다.

NVIDIA 및 Foxconn 과 협력하여, 우리는 Skild Brain 을 이중 암 조작 장치에 탑재하여 NVIDIA Blackwell 시스템의 고정밀 조립 작업을 수행하고 있습니다. 이 작업은 제품 주기마다 변경되며, 기존에는 라인의 모든 로봇을 재프로그래밍해야 했습니다.

Sumitomo Wiring Systems 에서는 와이어 하네스 제조 공정 중 "자동화가 불가능"하다고 여겨졌던 작업을 자동화하기 위해 S1 을 배포하는 방안을 추진 중입니다.

일본 전역의 공급망을 통해 하루 140 만 끼의 식사를 제공하는 Mitsui & Co. 와 함께, 우리는 상업용 주방에서 S1 으로 구동되는 범용 로봇을 시범 운영하고 있습니다.

처음부터 우리는 배포를 기술 자체의 핵심 구성 요소로, 기술의 결과물이 아닌 것으로 간주해 왔습니다.

숨겨진 기둥

로봇 공학에는 대략 다음과 같은 사고 방식이 있습니다. 즉, 초지능 모델을 훈련시키고, 초인간적인 하드웨어를 구축한 다음, 어느 날 '펑' 하고 로봇이 도처에 널려 있을 것이라는 생각입니다.

언어 모델에 비유하면 이치에 맞는 이야기입니다. 수년간의 연구 끝에 ChatGPT 가 등장했습니다. 출시 두 달 만에 월간 사용자 1 억 명을 추산했습니다. 외부에서 보면, 어려운 부분이 끝난 후 배포가 한꺼번에 이루어진 것처럼 보였습니다.

로봇 공학에서는 배포를 마지막으로 미룰 수 없습니다.

공급망은 어떻게 작동할까요? 누가 설치하나요? 통합은 누가 담당하나요? 고장 나면 누가 수리하나요? 프로세스가 변경되면 누가 업데이트하나요? 현장에 직접 가보기 전까지는 이러한 질문들을 완전히 이해할 수 없습니다.

배포는 로봇 공학 연구의 숨겨진 기둥입니다. 바로 그곳에서 로봇 공학이 실제로 이루어지기 때문입니다. 이에 대한 대안은 없습니다.

배포 경험은 Skild 의 최첨단 연구 방향을 결정합니다. 몇 가지 예를 들어 보겠습니다.

데모 vs 배포

데모 비디오를 보는 것은 물리적 AI 의 발전을 측정하는 일반적인 방법이 되었습니다. 비디오를 보고 "작동하는 것 같아!"라고 생각하게 됩니다.

문제는 정확도가 5%, 10%, 또는 99%인 로봇의 성공적인 클립이 똑같이 보일 수 있다는 점입니다. 정확도가 10%에 불과하더라도, 성공할 때까지 계속 촬영하면 됩니다.

우리는 작년에 모델에게 계란 요리하는 법을 가르쳤습니다. 첫 번째 계란을 요리하는 데 일주일이 걸렸고, 다른 계란과 다른 환경에서 안정적으로 작동하도록 만드는 데 두 달이 더 걸렸습니다.

이것이 바로 로봇 공학에서 보는 것이 믿는 것이 아님을 의미합니다. 중요한 것은 배포입니다. 마지막 5%의 성능을 끌어내기 위해 필요한 노력의 양은 처음 95%의 노력보다 훨씬 큽니다.

속도 vs 정확도

연구 관점에서 정확도는 주요 지표처럼 보일 수 있습니다. 배포 관점에서는 즉시 질문해야 합니다. "이 정확도에서 로봇이 얼마나 빠르게 작업할 수 있는가?"

로봇 5 대와 사람 5 명이 작업하는 10 개의 스테이션이 있는 공장 라인을 상상해 보세요. 모든 스테이션은 대략 동일한 사이클 타임 내에 작업을 완료해야 합니다. 하나의 스테이션이 느리면 전체 라인의 처리량이 제한됩니다.

정확도가 99.9%이지만 속도가 10 배 느린 로봇은 거의 배포 가능한 것이 아닙니다. 전혀 배포가 불가능한 것입니다.

배포를 최우선으로 하는 회사는 처음부터 시간 제약 하에서의 성공을 위해 최적화합니다.

변화에 대한 적응

배포 초기에 우리가 힘들게 배운 교훈: 변화만이 유일한 불변입니다.

공급업체가 부품을 변경합니다. 공장이 작업장을 재배치합니다. 고객이 조립 순서를 변경합니다. 배포한 시스템은 이에 적응해야 합니다.

모든 변경 사항마다 새로운 데이터 세트를 수집하고 추가 훈련을 반복해야 한다면, 로봇이 배포되어 있는 한 그 작업을 계속 반복해야 합니다. 이는 확장 가능하지 않습니다.

배포를 통해 힘들게 얻은 이러한 발견들은 우리의 연구 노력을 2 주 전에 출시된 최신 모델인 S1 에 집중하게 만들었습니다.

우리는 S1 이 단일 비디오 예제로부터 맥락 내 학습(in-context learning)을 통해 학습하도록 구축했습니다. 운영자는 새로운 시연을 녹화하여 모델의 가중치를 업데이트하지 않고 로봇에 프롬프트로 제공할 수 있습니다. S1 은 NVIDIA AI 인프라를 기반으로 구축되어, 다양한 로봇 데이터를 대규모로 훈련하는 데 필요한 가속 컴퓨팅 기반을 제공합니다.

https://x.com/SkildAI/status/2092300842900865389

만약 우리가 연구 영역에만 머물렀다면 이것이 이렇게 중요한 우선순위가 되었을까요? 그렇지 않을 것입니다. 배포는 우리 스스로에게 이 질문을 던지도록 가르쳐 주었고, S1 이 우리의 답변입니다.

문화

데모는 또한 해로울 수 있습니다. 단일 회사 내에서 데모 문화와 배포 문화를 동시에 유지하는 것은 매우 어렵습니다.

정확도가 50%인 로봇에서 좋은 데모를 선별할 수 있습니다. 배포하려면 나머지 50%를 작업해야 하는데, 이것은 훨씬 더 어렵습니다.

이러한 "고급" 데모를 공개적으로 축하하면, 그 데모를 작업하는 사람들은 격려를 받습니다. 과소평가된 50%를 작업하는 사람들은, 그들의 작업이 로봇을 유용하게 만드는 것임에도 불구하고, 주목을 덜 받습니다.

두 가지 모두를 수행할 자원이 있다고 해서 이러한 인센티브가 사라지는 것은 아닙니다.

실제 배포 작업에 보상함으로써 내부적으로 이에 맞서 싸울 수 있습니다. 하지만 똑똑한 사람들은 이렇게 묻습니다. "진짜 일은 배포인데, 왜 데모에 시간을 쓰고 있지?"라고요. 그러면 데모 문화는 어차피 사라집니다.

데모가 회사가 보상하는 것이라면, 사람들은 데모에 집중할 것입니다. 우리는 배포에 보상하기로 선택했습니다.

물리적 RSI

배포는 연구의 기둥입니다. 평가의 기둥이기도 합니다. 그리고 회사를 유용한 작업에서 멀어지게 할 수 있는 문화적 인센티브에 직면하도록 강제합니다.

이것이 바로 우리가 물리적 RSI, 즉 재귀적 자기 개선(recursive self-improvement)을 생각하는 방식이기도 합니다.

배포 데이터에 대한 두 가지 일반적인 관점이 있습니다. 하나는 배포가 로봇 공학을 위한 궁극적인 훈련 데이터 소스가 될 것이라는 관점입니다. 다른 하나는 배포된 로봇이 동일한 작업을 반복하기 때문에 배포 데이터가 일반 모델을 개선하기에는 너무 편협하다는 관점입니다. 두 관점 모두 부분적으로 옳습니다.

특수 로봇이 이미 특정 병뚜껑을 안정적으로 여는 방법을 알고 있다면, 동일한 성공적인 동작에 대한 수천 개의 추가 예제를 수집하는 것은 거의 도움이 되지 않을 수 있습니다. 특수 시스템은 이미 자신의 작업을 알고 있습니다. 가치는 많은 특수 시스템으로부터 학습한 내용을 일반 기반 모델로 다시 가져올 때 나타납니다.

  1. 다양한 로봇, 작업, 구현체에 걸쳐 훈련된 기반 모델로 시작합니다. 광범위하게는 유능하지만, 어떤 것에도 완벽하지 않습니다.
  2. 이를 다양한 애플리케이션에 배포합니다. 맥락 내 학습은 모든 변경 사항에 대해 새로운 훈련 실행을 요구하지 않고 적응할 수 있게 해줍니다. 생산 수준의 속도와 신뢰성을 위해 추가 훈련이 필요한 경우, 배포 데이터는 시스템을 특화하는 데 도움이 될 수 있습니다. 각 배포는 자신의 작업에 더 능숙해집니다.
  3. 이러한 배포 전반의 데이터를 다시 일반 모델로 가져옵니다. 하나의 작업을 마스터한 전문가에게 거의 도움이 되지 않는 경험도, 다양한 작업을 학습하는 일반주의자에게는 여전히 가치가 있을 수 있습니다. 다음 배포는 더 강력한 모델에서 시작됩니다.
Deepak Pathak - inline image

우리가 사용하는 비유는 저 자신의 교육 경험입니다.

고등학교 때 우리는 물리학, 화학, 수학을 꽤 괜찮은 수준으로 알고 있었습니다. 그런 다음 AI 를 전공했습니다. 오늘날 우리는 고등학교 시절의 나보다 AI 에 대해 훨씬 더 많이 알고 있지만, 한때 알았던 화학은 대부분 잊어버렸습니다.

이제 평행 우주에서 고등학교 시절의 내가 화학 박사 학위를 받았다고 상상해 보세요. 또 다른 우주에서는 물리학 박사. 또 다른 우주에서는 수학 박사. 그런 다음 이 모든 특화된 지식을 우리가 시작했던 그 학생에게 다시 주입한다고 상상해 보세요.

이것이 우리의 전략입니다. 배포를 통해 우리는 "고등학생 자아", 즉 S1 을 점점 더 발전시키고 있습니다. 일반주의자가 더 많이 배울수록, 다음 배포에 필요한 특화의 정도는 줄어들 것입니다. 이것이 배포 데이터 플라이휠입니다.

데모의 시대는 끝났습니다. 배포의 시대가 시작되었습니다.

Deepak Pathak 및 Abhinav Gupta

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기