Skild AI は、最初の商用展開から 10 ヶ月で、ARR 1 億ドルを突破しました。

まず初めに、これを可能にしてくれたチームの全メンバーと、すべてのパートナーに感謝します。
これは、多くの優秀な人々による並々ならぬ努力の結晶です。10 ヶ月の間に、私たちは 60 以上の有料顧客を獲得し、その業務は、物品の移動、配送、現場点検、警備、調理、そして倉庫、工場、データセンター内での運用にまで及びます。モビリティ関連が収益の 10%、Fetch ソリューションが 4% を占めています。
NVIDIA および Foxconn と協力して、私たちはデュアルアームマニピュレーターに Skild Brain を導入し、NVIDIA Blackwell システムの高精度組み立てを行っています。この作業は製品サイクルごとに変化し、これまではライン上のすべてのロボットを再プログラムする必要がありました。
住友電装では、S1 を導入して、ワイヤーハーネス製造における「自動化は不可能」と考えられていたプロセスの自動化を目指して取り組んでいます。
三井物産とは、同社のサプライチェーンが日本全国で 1 日 140 万食の食事を提供していることから、S1 を搭載した汎用ロボットを業務用厨房で試験導入しています。
当初から、私たちは展開をテクノロジーそのものの中核的な一部として捉えており、その成果として捉えてはいません。
隠された柱
ロボット工学には、次のような考え方があります。超知能モデルを訓練し、超人的なハードウェアを構築すれば、ある日突然、どこにでもロボットが溢れるようになる、と。
言語モデルに例えると、これは正しく聞こえます。長年の研究を経て、ChatGPT が登場しました。2 ヶ月以内に推定 1 億人の月間アクティブユーザーを獲得しました。外から見ると、展開は困難な部分が終わった後、一気に訪れたように見えました。
ロボット工学では、展開を最後まで先延ばしにすることはできません。
サプライチェーンはどのように機能するのか?誰が設置するのか?統合は誰が担当するのか?故障した場合、誰が修理するのか?プロセスが変更された場合、誰が更新するのか?実際に現場に立たなければ、これらの疑問を完全に理解することはできません。
展開はロボット工学の研究における隠された柱です。なぜなら、そこでこそロボット工学が実際に行われるからです。それに代わるものはありません。
展開こそが、Skild の最先端研究の方向性を決定づけます。いくつか例を挙げましょう。
デモ vs 展開
デモ動画を見ることは、物理 AI の進歩を測る一般的な方法となっています。動画を見て、「うまくいっているように見える!」と思うのです。
問題は、成功率 5%、10%、あるいは 99% のロボットの成功クリップが、まったく同じに見える可能性があることです。たとえ成功率が 10% でも、成功するまで撮影を続ければいいのです。
私たちは昨年、モデルに卵を調理することを教えました。最初の卵を調理するのに 1 週間かかり、その後、異なる卵や異なる環境で確実に動作させるのに 2 ヶ月かかりました。
このため、ロボット工学においては 「見ることが信じることではない」 のです。重要なのは展開です。最後の 5% のパフォーマンスを絞り出すための労力は、最初の 95% のそれをはるかに上回ります。
速度 vs 精度
研究の観点からは、精度が主要な指標のように見えるかもしれません。しかし、展開の観点からは、すぐに問わなければなりません。その精度で、ロボットはどれだけ速く作業できるのか?
10 のステーションがあり、5 つはロボット、5 つは人間が担当する工場のラインを想像してください。すべてのステーションは、ほぼ同じサイクルタイム内で作業を完了しなければなりません。1 つのステーションが遅ければ、ライン全体のスループットが制約されます。
精度が 99.9% でも、速度が 10 倍遅いロボットは、ほぼ展開可能とは言えません。展開不可能なのです。
展開を最優先する企業は、最初から時間的制約の下での成功を最適化します。
変化への適応
展開の初期に学んだ厳しい教訓:変化こそが唯一の不変であるということです。
サプライヤーが部品を変更する。工場が作業台を再配置する。顧客が組み立て手順を変更する。導入したシステムは適応しなければなりません。
変更のたびに新しいデータセットを収集し、追加のトレーニングを実行する必要があるなら、ロボットが展開されている限り、その作業を繰り返すことになります。これはスケーラブルではありません。
展開から苦労して得たこれらの知見により、私たちは研究努力を、2 週間前にリリースした最新モデル S1 に集中させました。
私たちは S1 を、単一の動画例からインコンテキスト学習を通じて学習できるように構築しました。オペレーターは新しいデモンストレーションを録画し、モデルの重みを更新することなく、それをプロンプトとしてロボットに与えることができます。S1 は NVIDIA AI インフラストラクチャ上に構築されており、多様なロボットデータの混合セットを大規模にトレーニングするために必要な、高速コンピューティング基盤を提供します。
https://x.com/SkildAI/status/2092300842900865389
もし私たちが研究の領域に留まっていたら、これがこれほど優先事項になっていたでしょうか?そうは思いません。展開によって、私たちは自らにこの問いを投げかけることを学び、S1 がその答えです。
文化
デモは有害でもあり得ます。一つの会社の中で、デモ文化と展開文化を同時に維持することは非常に困難です。
成功率 50% のロボットから、良いデモを選り好みすることはできます。展開するためには、残りの 50% に取り組まなければなりません。それははるかに困難です。
もしこれらの「先進的な」デモを公に称賛すれば、それに取り組む人々は励まされます。過小評価されがちな 50% に取り組む人々は、たとえ彼らの仕事こそがロボットを有用にしているとしても、注目を集めにくくなります。
両方を行うためのリソースがあっても、そうしたインセンティブが消えるわけではありません。
実際の展開作業に報いることで、社内でそれらと戦うことはできます。しかし、そうすると賢い人々はこう問います。「本当の仕事は展開にあるのに、なぜデモに時間を費やしているのか?」——そして、デモ文化は結局消え去ります。
もし会社がデモに報いるなら、人々はデモに取り組むでしょう。私たちは展開に報いることを選びました。
物理的 RSI
展開は研究の柱です。評価の柱でもあります。そして、会社を有用な仕事から遠ざける可能性のある文化的インセンティブと向き合うことを私たちに強います。
これは、私たちが物理的 RSI、すなわち再帰的自己改善を考える方法でもあります。
展開データについては、2 つの一般的な見方があります。1 つは、展開がロボット工学の究極のトレーニングデータ源になるというものです。もう 1 つは、展開されたロボットは同じタスクを繰り返し行うため、展開データは汎用モデルを改善するには狭すぎるというものです。どちらの見方も部分的に正しいです。
特殊なロボットが特定のボトルキャップを確実に開けられるようになったとしても、同じ成功動作の例をさらに何千件も収集しても、ほとんど意味がないかもしれません。特殊化されたシステムは、すでに自身のタスクを習得しています。価値が現れるのは、多くの特殊化されたシステムからの学習を、汎用的なベースモデルにフィードバックするときです。
- 異なるロボット、タスク、身体性でトレーニングされた基盤モデルから始めます。広く能力はあるが、何も完璧ではない状態です。
- それをさまざまなアプリケーションに展開します。インコンテキスト学習により、変更のたびに新しいトレーニング実行を必要とせずに適応できます。本番レベルの速度と信頼性のためにさらなるトレーニングが必要な場合、展開データはシステムを特殊化するのに役立ちます。各展開は、自身のタスクに習熟していきます。
- それらの展開全体からのデータを、汎用モデルにフィードバックします。1 つのタスクを習得したスペシャリストにとってはほとんど価値のない経験でも、多くの異なるタスクを学習するジェネラリストにとっては依然として価値があります。次の展開は、より強力なモデルから始まります。

私たちが使う例えは、私自身の教育です。
高校では、物理学、化学、数学をそれなりのレベルで学びました。その後、AI を専門にしました。今日の私たちは、高校時代の自分よりも AI についてはるかに多くのことを知っていますが、かつて知っていた化学の多くは忘れてしまいました。
さて、もし私たちが高校時代の自分を連れて行き、パラレルワールドで化学の博士号を取得し、別の世界で物理学の博士号を、さらに別の世界で数学の博士号を取得すると想像してみてください。そして、その特殊化された知識のすべてを、元の学生に凝縮して戻すことを想像してみてください。
それが私たちの戦略です。展開を通じて、私たちは「高校時代の自分」、すなわち S1 を、より良く、より優れたものにしています。ジェネラリストが学べば学ぶほど、次の展開に必要な特殊化は少なくなるはずです。これが展開データのフライホイールです。
デモの時代は終わりました。展開の時代が始まりました。
Deepak Pathak および Abhinav Gupta





