옐로우 브릭 로드에서 살아남기: AI 스타트업의 생존 전략

@joeschmidtiv
영어2개월 전 · 2026년 5월 27일
1.2M
1.6K
195
85
4.7K

TL;DR

AI 연구소들이 수평적 도구 시장을 장악하고 있는 가운데, 스타트업은 복잡한 다단계 산업 과제와 독점적인 데이터 플라이휠을 처리하는 버티컬 '업무 시스템'을 구축함으로써 성공할 수 있습니다.

앱 레이어가 죽지 않은 이유

창업자들과 예비 직원들로부터 계속 받는 질문이 있습니다. 구축할 수 있는 AI 애플리케이션 레이어가 아직 남아 있는 건지, 아니면 OpenAI와 Anthropic이 모든 것을 없애버릴 것인지에 대한 질문입니다.

이 질문 뒤에는 특정한 종류의 AI 정신증이 있습니다. 어떤 사람들은 영구적인 하위 계층을 피할 수 있는 유일한 지속 가능한 장소는 대형 연구소 내부이거나 로봇공학, 하드테크 등 "연구소가 건드릴 수 없는" 개척지에서 구축하는 것이라고 결론지었습니다. 모든 소프트웨어가 Codex나 Claude에 의해 직접 흡수되거나, 미래의 모델이 당신이 구축한 모든 것을 불필요하게 만들 것이라면, 도망쳐야 합니다!

저는 거의 누구 못지않게 AI 최대주의자이며, 그들이 절반은 맞다고 생각합니다. 연구소들은 정말로 애플리케이션 표면의 엄청난 부분을 차지하려 하고 있습니다. 하지만 "애플리케이션 레이어"는 단일한 동질적인 기회가 아닙니다. 올바른 프레임은 당신이 옐로 브릭 로드(Yellow Brick Road) 위에 있는지, 아니면 오즈(Oz)의 다른 곳에 있는지입니다.

옐로 브릭 로드는 연구소들이 막대한 자원을 투입하고 있는 길을 가리키는 우리의 약칭입니다. 코드 생성, 글쓰기, 이미지 생성과 같은 문제에 연구소들이 가장 적합한 이유는 이러한 문제들이 원시 모델 성능과 함께 개선되기 때문입니다. 즉, 사전 훈련과 사후 훈련에 지출된 모든 1달러가 제품 품질을 향상시킵니다. 한편, 오즈의 나머지 부분은 더 복잡하고 종종 수직적인 문제들로 채워져 있으며, 이는 비즈니스 사용자에게 표준 도구와 컴퓨터 사용에 접근할 수 있는 수평적 도구를 제공하는 것만큼 간단하지 않습니다. 가치는 기본 모델의 원시 성능(물론 여전히 중요하지만!)보다는 특정 산업 내에서 출력물을 신뢰할 수 있고, 규정을 준수하며, 운영 가능하게 만드는 주변 인프라에서 비롯됩니다.

OpenAI와 Anthropic이 일반적인 AI 동료로 모든 문제를 해결할 수 없다는 사실을 시장에 효과적으로 알리면서, 우리는 이것이 실시간으로 펼쳐지는 것을 목격하고 있습니다. 그들은 기업을 위한 모델을 구성하고 맞춤화하는 전체 회사를 구축하기 위해 대규모 전방 배치 합작 투자를 발표했습니다. 다음 모델 출시가 이 문제를 해결해 줄 것이라고 생각한다면, 수십억 달러를 그러한 프로그램에 쏟아붓지 않을 것입니다.

따라서 AI 앱을 구축하여 부자가 되고 싶다면, 옐로 브릭 로드를 피하고 오즈의 다른 곳에서 구축하세요. 다음은 우리가 배운 것과 포트폴리오 창업자들이 배운, 효과가 있는 것들입니다.

옐로 브릭 로드

회사를 시작한다면, 옐로 브릭 로드는 가장 명확한 길이지만 가장 위험합니다. 고성능 모델을 가져와서 기성 커넥터(G Drive, Slack, Salesforce, Notion, GitHub 등)를 연결하고, 그 위에 일종의 에이전트 오케스트레이션 레이어를 배포하는 것입니다. 마법 같죠!

이 접근법의 문제는 이것이 바로 연구소들이 Cowork와 Codex로 하고 있는 일이라는 점입니다. 당연히 그들은 모델을 소유하고 있어 더 나은 마진, 통제력, 그리고 다운스트림에 있는 모든 사람에게 가격 결정력을 행사할 수 있는 능력을 가지고 있습니다. 하지만 아마도 가장 중요한 것은 그들의 제품이 잘 해결하도록 설계된 것을 정의하는 아키텍처 선택권을 소유한다는 점입니다. 그들은 지금까지 모델과 도구 호출 패턴에 대해 신중하게 접근해 왔으며, 이것이 바로 이 길에서 요구되는 수평적이고 단계 수가 적은 작업에 정확히 필요한 것입니다. 스타트업이 어떻게든 Codex나 Claude Code를 능가할 수 있다 하더라도, 연구소들은 막대한 유통 채널과 AI 분야에서 가장 큰 브랜드 후광을 가지고 있습니다.

동일한 커넥터, 그 아래에 하위 에이전트나 구성 없이, 그리고 유통 채널도 없이 그 플레이북을 실행하는 AI 앱 회사라면, 아마도 아무데도 이르지 못하는 길을 걷고 있는 것입니다.

오즈의 나머지 부분

스타트업에게 모든 것이 암울한 것만은 아닙니다. 옐로 브릭 로드 밖에는 스타트업이 고객을 소유하고 복잡한 문제를 해결할 명확한 길이 있는 엄청난 기회가 있습니다.

이러한 비즈니스들은 모델이 복잡한 도구, 자동화, 통합(즉, 소프트웨어)의 웹을 통해 엮인 에이전트 경험을 구축하고 있으며, 대부분의 스타트업은 기본적으로 수직적이 됩니다. 그들은 Anthropic과 OpenAI가 수평적 플랫폼으로 도달할 수 없는 다단계 및 다중 참여자 작업에 집중할 수 있습니다. 즉, 시스템 전반에서 컨텍스트를 수집한 다음, 여러 단계에서 승인해야 하는 여러 사람을 통해 라우팅하는 것입니다. 여기에는 종종 하나 이상의 레거시 시스템이 포함되며, 모호함이 용납되지 않는 결정론적 결과가 필요한 경향이 있고, 때로는 가치 있는 비즈니스 결과와 연결됩니다. 연구소들은 이러한 문제가 얼마나 가치 있는지 이해하고 있습니다. 그래서 그들은 자체 아웃소싱 구성 샵을 구축하고 있으며, 강화 학습 비즈니스의 전체 업마켓 클래스가 존재하는 이유입니다.

오즈의 나머지 부분이 마법사에게 소유되지 않을 이유

위에 대한 반응은 지금까지 모델/연구소의 개선에 반대하는 베팅은 꽤 나쁜 거래였다는 것입니다. 그들은 계속해서 더 나아질 것이고 결국 이러한 애플리케이션 레이어 비즈니스가 서비스하는 시장을 잠식할 가능성이 높습니다.

연구소들은 확실히 개선될 것이지만, 오즈의 나머지 부분이 시간이 지남에 따라 스스로를 방어할 수 있는 몇 가지 방법이 있다고 주장합니다.

데이터 및 학습 플라이휠:

당신이 내면화하는 많은 것들은 어떤 훈련 데이터셋에도 없습니다. 즉, 문서화되지 않은 업계 규범, 표준화되지 않은 표준, 실무자들의 머릿속에 있는 부족 지식입니다. 그 어떤 것도 공개 웹에 있지 않습니다. 아무리 많은 훈련 컴퓨팅도 이 지식이 실제로 존재하는 워크플로 내부에 있는 것을 대체할 수 없습니다. 여기에는 두 개의 플라이휠이 서로 겹쳐 있습니다. 고객 간 플라이휠(동일한 문제의 더 많은 변형을 볼수록 복리 효과가 발생하는 패턴)과 고객 내 플라이휠(특정 결정 뒤에 있는 이유, 말하지 않은 예외, 시스템과의 실제 상호 작용을 통해서만 표면화되는 회사 자체의 경험 법칙)입니다.

고객 데이터를 고객 간에 사용할 수 없더라도, 애플리케이션 회사는 고객 문제 유형 전반에 걸친 패턴 인식을 활용하고, 이를 미래 문제에 대한 올바른 아키텍처를 알리는 데 사용할 수 있을 것입니다. 수백 건의 법률 검토, 수천 건의 보험 인수 주기, 또는 수만 건의 SDR 캠페인을 통해 에이전트를 실행한 회사는 다음 진입자가 처음으로 새로운 에이전트를 가동하여 복제할 수 없는 방식으로 문제의 형태를 내면화했습니다.

수평적 에이전트는 원칙적으로 동일한 학습 인프라를 구축할 수 있습니다. 순수한 집중 외에 그렇게 하지 않는 이유는 UX 때문입니다. 이러한 종류의 지식을 포착하는 것은 전적으로 사용자에게 제공하는 워크플로 표면에 달려 있으며, 수직적 플레이어는 해당 표면을 워크플로가 표면화해야 하는 것에 정확히 맞게 조정할 수 있습니다. 수평적 도구는 그렇게 할 수 없습니다. 평가 세트, 레이블이 지정된 출력, 에지 케이스 분류는 수직 특화 데이터 플라이휠로 복합되어, 비교할 만한 프로덕션 노출 없이는 다음 진입자가 생성할 수 없는 파인튜닝을 촉진할 수 있습니다. 이것이 가능한지 여부는 데이터 권리, 축적된 프로덕션 노출의 양, 고객 계약의 구조에 달려 있지만, 패턴 인식은 그와 관계없이 축적됩니다.

모델 변동성 및 복잡성 관리: 연구소들은 이미 내부적으로 라우팅하고 있습니다. 즉, 다양한 요청에 대해 다른 모델 클래스, 후드 아래의 앙상블을 사용합니다. 그들이 할 수 없는 것은 벤더 간 라우팅, 특정 하위 작업에 대한 경쟁사 모델 평가, 또는 실제로 가장 좋은 좁은 부분에 오픈소스 파인튠을 사용하는 것입니다. 오즈의 나머지 부분 회사는 자사 연구소가 출시하는 것뿐만 아니라 전체 모델 시장에서 각 하위 작업에 적합한 모델을 선택합니다. 또한 아무도 하고 싶어하지 않는 작업, 즉 새 모델이 출시될 때마다 업그레이드에 대한 평가 재실행, 고객의 에지 케이스에 대한 프롬프트 재조정, 프로덕션을 중단시키지 않고 롤아웃하는 작업을 수행합니다. 연구소들은 고객을 대신하여 이 작업을 수행하지 않습니다. 그들은 다음 모델을 판매하고 마이그레이션하라고 말합니다. 오즈의 나머지 부분 회사는 마이그레이션을 흡수합니다. 고객이 얻는 것은 전체 시장에서 사용 가능한 최고의 인텔리전스와 모든 업그레이드를 통한 연속성입니다.

비용 최적화: 모든 쿼리를 Opus 4.7을 통해 실행하는 것은 마이너스 총마진으로 가는 가장 빠른 길입니다. 최고의 오즈의 나머지 부분 회사는 모델 계층 간에 라우팅합니다. 가장 어려운 작업에는 프론티어 모델, 대부분의 작업에는 중간 계층, 사용할 자격을 얻은 곳에서는 더 작은 맞춤형 또는 파인튠된 모델을 사용합니다. 일부는 이제 그 위에 자체 모델을 사후 훈련하여 고객이 관심을 갖는 좁은 작업 조각에 최적화하고 프론티어 API 호출 비용의 일부로 서비스하고 있습니다. 연구소들은 바닥 가격을 책정합니다. 즉, $X에 사용 가능한 최소 인텔리전스입니다. 오즈의 나머지 부분 회사는 그 반대를 판매합니다. 즉, 워크플로가 실제로 요구하는 특정 수준의 인텔리전스에 대한 최저 달러 비용입니다. 이는 각 하위 작업이 필요로 하는 수준을 정확히 알고 있는 경우에만 가능하며, 연구소들은 구조적으로 모든 수직 분야에서 이를 알 수 없습니다. 이는 결과에 대한 더 낮고 통제된 가격으로 직접 이어집니다.

거버넌스: 고객이 해당 수직 분야에서 AI를 실행하는 방법에 대한 컨트롤 플레인이 되는 데는 상당한 가치가 있습니다. 즉, 권한, 감사, 에이전트가 수행할 수 있는 작업, 에이전트가 실제로 수행한 작업이 모두 수렴되는 곳입니다. 그 컨트롤 플레인은 산업과 직무 유형에 따라 완전히 다르게 보이는 사용 사례별 가드레일로 구축됩니다. 에이전트가 종단 간에 접촉하는 도구, 워크플로, 데이터를 소유하고 있기 때문에 수평적 도구가 어려움을 겪을 방식으로 결정론적 결과를 제공할 수 있습니다. 또한 최종 구매자를 위한 규제 복잡성을 흡수하는 주체입니다. 법률 분야의 FRCP 및 변호사 윤리 규칙, 의료 분야의 HIPAA, 금융 분야의 SEC 및 FINRA, 주 보험 규정 등이 있습니다. 수평적 플레이어는 한 번에 백 개의 다른 수직 분야가 되지 않고서는 이를 신뢰성 있게 수행할 수 없습니다. CIO는 자신이 제공하는 에이전트에 대한 규정 준수를 처리하고 있음을 계약상 명시하는 파트너를 원합니다.

이 모든 것은 동일한 것으로 귀결됩니다. 바로 집중입니다. 이는 수직 분야(보험, 법률, 회계)이거나 깊이 수행되는 기능(영업, 고객 지원, 재무)일 수 있습니다. 어느 쪽이든, 작업에는 하나의 고객 세트(워크플로, 에지 케이스, 규정)에 집중하는 팀이 필요합니다. 연구소들은 이를 위해 설계되지 않았습니다. 그들은 모든 곳에, 모든 사람을 위해 존재해야 하며, 이것이 바로 그들이 처음에 옐로 브릭 로드를 구축한 방법입니다. 동일한 트레이드오프가 그들을 오즈의 나머지 부분에서 멀어지게 합니다. 한 번에 모든 곳에 있을 수 있거나, 한 가지에 뛰어날 수 있습니다. 둘 다는 불가능합니다.

영업 사례 – 11x의 기술 CEO로부터 얻은 실용적인 팁

실제로 이것을 어떻게 생각해야 할까요? 다음은 Prabhav Jain, 11x의 CEO로부터 얻은 몇 가지 실용적인 팁입니다.

결과에 집중하세요

연구소에 탄력적인 회사를 구축하는 전술적 경로는 고객이 정말로 관심을 갖는 특정 결과에서 시작하는 것입니다. 우리의 경우, 그것은 회사가 더 많은 파이프라인을 생성하도록 돕는 것이었습니다. 거기서부터 질문은 전술적이 됩니다. 실제로 파이프라인을 구동하는 어떤 활동을 종단 간에 소유하고 싶은가? 각 활동을 작업으로 분해합니다. 어떤 작업이 에이전트 기반이고 어떤 것이 아닌가? 어떤 작업이 복잡한 도메인 통찰력을 필요로 하고 어떤 것이 필요하지 않은가? 연구소들도 워크플로를 출시할 것이지만, 워크플로에 많은 단계, 지저분한 입력, 해석하기 어려운 상태, 또는 실제 세계의 제약이 있을 때, 더 나은 모델만으로는 해결되지 않습니다. 그 작업은 구식의 좋은 소프트웨어 엔지니어링에 달려 있으며, 연구소들은 그 표면에서 집중된 애플리케이션 회사보다 우위를 점하지 못합니다. 예를 들어, 다음은 우리가 처리하는 작업 중 일부이며, 일부는 에이전트 기반이고 일부는 그렇지 않습니다. 맞춤 신호 기반 리드 발굴, 리드 인리치먼트, 심층 계정 조사, CRM에서 컨텍스트 가져오기, 채널별 메시지 작성기, 리드 자격 평가 에이전트, 이메일 전달성 시스템입니다. 이러한 작업은 한 번에 해결할 수 있는 작업이 아니며 깊은 엔지니어링이 필요합니다.

오즈 비유의 중요한 통찰은 실제 워크플로의 대략 절반이 에이전트 기반이 아니며 연구소의 이점이 없다는 것입니다. 그들은 모델 레이어 아래에 있는 결정론적 소프트웨어를 작성하는 데 있어 당신보다 나을 것이 없습니다. 그리고 에이전트 기반인 절반조차도 원하는 결과에 대해 모델을 조정, 훈련, 제한해야 합니다. 도메인 지식은 종종 일반 훈련 데이터에 포함되지 않습니다. 이러한 기술은 수직 분야나 기능을 위해 처음부터 구축되어 워크플로의 적절한 순간에 모델에 공급됩니다. 우리의 에이전트가 전화로 인바운드 리드를 자격 평가할 때, 나는 특정 산업과 해당 페르소나에 대해 좋은 영업 대화가 무엇인지 훈련받아야 합니다. 이것이 애플리케이션 회사의 작업이며, 복리 효과가 있습니다.

더 중요한 것은, 비즈니스가 진화함에 따라 이러한 기술은 항상 구식이 되므로, 워크플로와 컨텍스트를 진화시키는 능력이 경쟁 우위가 됩니다. 예를 들어, 우리가 대규모 이메일 아웃리치 제품을 시작했을 때, "AI"가 작성한 이메일이 막 등장하기 시작했습니다. 오늘날, 사람들은 AI가 작성한 이메일과 인간이 작성한 이메일에 대한 미세한 감각을 가지고 있으며, 결정적으로 이것은 몇 달마다 변합니다. 우리의 에이전트는 시장 역학에 따라 지속적으로 적응해야 하지만, 이것이 바로 해자가 구축되는 곳입니다. 실제로, 이러한 역동성에도 불구하고, 우리의 긍정적 답장률은 지난 몇 달 동안 4배 증가했으며 고객을 위해 수억 달러의 파이프라인을 생성했습니다.

복잡성이 높은 문제에 집중하세요

복잡한 문제는 실제 비즈니스 가치가 잠금 해제되는 곳입니다. 그렇지 않으면 얇은 래퍼를 구축하게 될 것입니다.

충분히 복잡한 비즈니스 문제를 분해하면 지저분함이 빠르게 나타납니다. 다음은 GTM 세계의 예로, 사소하게 들립니다. 해당 회사가 이미 고객이라면 회사의 연락처에 연락해서는 안 됩니다. 하지만 전혀 그렇지 않습니다. CRM에 회사와 연결된 도메인이 있을 수 있습니다. 수십 개의 자회사가 있는 회사는 어떨까요? CRM 레코드에 모회사의 도메인이 있다면? Salesforce의 오래된 매칭 필드가 현재 고객의 CRO에게 콜드 피치를 보낸다면? 실제 세계의 데이터는 지저분합니다. 인간도 어려움을 겪습니다. 모델이 마법처럼 그 기준을 넘지 못합니다. 그 지저분함에서 질서를 이끌어내려면 문제의 특정 형태를 위해 설계된 목적 기반 에이전트가 필요하며, CRM을 겨냥한 범용 코파일럿이 아닙니다. 실제로, 우리가 가진 데이터에 기반하여, 우리 데이터의 품질과 신선도가 고객보다 훨씬 높다는 것을 깨달았고, 따라서 기본적으로 우리 자신의 데이터에 기준을 둡니다.

가드레일은 나쁜 일을 방지하기 위한 것만이 아닙니다. 그것이 바로 고객이 당신에게 지불하는 것입니다.

가드레일은 심각하게 과소평가됩니다. 동일한 제품 내에서도 모든 사용 사례에는 자체 가드레일이 필요합니다. 우리의 경우, 규제된 금융 서비스 잠재 고객은 중간 시장 SaaS 고객과 다른 보장을 요구하며, 이러한 보장은 에이전트가 어떻게 작성할 수 있는지, 누구에게 연락할 수 있는지, 어떤 데이터를 다룰 수 있는지, 통화에서 무엇을 말할 수 있는지, 모든 결정이 어떻게 기록되는지에 영향을 미칩니다.

모든 것에 맞는 단일 시스템은 그러한 변동성 아래에서 붕괴됩니다. 가드레일은 사용 사례별로 구축되고, 고객별로 구성되며, 지속적으로 감사되어야 하며, 그 작업은 전적으로 애플리케이션 회사에 달려 있습니다. 이것이 우리가 각 고객의 요구 사항에 맞게 조정해야 하는 FDE와 기술 배포 전략가를 두는 이유입니다. 예를 들어, 우리는 F1000 기관과 협력하여 대규모 SMB 고객 기반에 음성을 통한 동의된 아웃바운드를 수행했습니다. 초기 몇 번의 반복에서는 응답률이 낮았습니다. 우리는 빠르게 반복하고 이 특정 유형의 청중이 통화의 처음 10초 내에 참여하도록 하는 방법을 배워야 했습니다. SMB 비즈니스 소유자는 대규모 B2B 구매자나 소비자와 매우 다르게 행동합니다. 이제 우리는 그들의 전체 영업 팀이 해당 세그먼트에서 한 달에 생성하는 것보다 더 많은 영업 기회를 하루에 생성하고 있습니다.

보험 사례 – FurtherAI의 CEO로부터 얻은 실용적인 팁

영업은 하나의 예입니다. 보험은 또 다른 예이며, 다른 각도에서 동일한 요점을 제시합니다. 다음은 Aman Gour, FurtherAI의 CEO가 길 밖에서 구축하는 것에 대해 생각하는 방식입니다.

실제 보험 운영 내에서 AI를 배포하기 시작했을 때, 우리는 계속해서 특정 가정을 들었습니다. 모델이 지능이고 워크플로는 단지 그 주변의 비계일 뿐이라는 것입니다.

더 많은 보험사와 협력할수록, 이것이 반대라고 더 확신하게 되었습니다.

보험에서 많은 지능은 워크플로 자체 내에 있습니다. 두 보험사가 동일해 보이는 경로로 제출을 실행할 수 있습니다. 제출, 검토, 견적, 바인드입니다. 하지만 경로는 쉬운 부분입니다. 두 보험사를 구분하는 것은 그 안에 있는 모든 것입니다. 어떤 위험이 에스컬레이션되는지, 어떤 손실 신호가 중요한지, 두 가지가 충돌할 때 어떤 수용 규칙이 우선하는지, 언제 인간이 승인해야 하는지, 어떤 외부 데이터가 가져와지는지, 최종 결정이 어떻게 문서화되는지입니다.

그 논리는 하나의 깔끔한 규칙 엔진에 있지 않습니다. SOP, 관리자 검토, 인수 철학, 보험사별 수용 기준, 수년간의 운영 경험에 분산되어 있습니다. 그 중 많은 부분이 모델이 단순히 읽을 수 있는 형태로 기록되어 있지 않습니다.

이것이 우리가 매번 처음부터 추론하는 순수 에이전트를 믿지 않고, 현실이 지저분해지는 순간 깨지는 경직된 워크플로를 믿지 않는 이유입니다. 대신 에이전트 워크플로를 구축해 왔습니다. 워크플로는 반복성, 감사 가능성, 비용 통제를 제공합니다. 에이전트는 변동성을 처리하고 행복한 경로가 깨질 때 복구합니다. 인간은 책임이 중요한 판단 호출을 위해 루프에 남아 있습니다.

첫날, 이것은 수동 작업을 자동화합니다. 그러나 시간이 지남에 따라 모든 에스컬레이션은 신호가 되고, 모든 예외는 피드백이 되며, 모든 인간의 수정은 런북이 불완전했던 곳을 보여줍니다. 시간이 지남에 따라 워크플로는 스크립트가 아니라 보험사의 운영 메모리가 되기 시작합니다. 이것이 연구소들이 도달하기 어려워할 부분입니다. 그들은 계속해서 더 나은 모델과 더 나은 일반 에이전트를 출시할 것이며, 그래야 합니다. 그러나 그들은 보험사의 프로덕션 워크플로 내부에 충분히 오래 머물러 하나의 계정이 왜 에스컬레이션되었는지, 하나의 위험이 왜 거절되었는지, 또는 언더라이터가 수용 가이드를 무시하고 그렇게 한 것이 옳았던 이유를 배우지 못합니다.

그 이해는 프로덕션에서 수천 번 워크플로를 실행함으로써만 얻을 수 있습니다. 첫날 출시하는 워크플로는 해자가 아닙니다. 시간이 지남에 따라 프로덕션 사용이 창출하는 루프가 해자입니다.

우리에게, 그것이 길 밖에서 구축한다는 의미입니다.

당신이 오즈의 나머지 부분에 있는지 어떻게 결정할까요?

도구 및 단계 테스트: 작업에 몇 단계가 필요하며, 이를 지원하기 위해 구축해야 하는 도구는 얼마나 복잡한가? Google Drive에서 수평적 AI 검색(허용적인 결과를 가진 하나의 도구에 대한 한 단계, 사용자가 요약을 읽고 틀리면 다시 질문)을 3년간의 회사 선례에 대한 다단계 법률 검토(많은 도구에 걸친 수십 단계, 파트너 검토를 통과해야 하고 법정에서 주장될 수 있는 출력)와 비교해 보세요. 둘 다 "작업을 수행하는 에이전트"처럼 보이지만, 오직 하나만이 집중된 팀이 구축하는 데 수년이 걸리는 종류의 심층 소프트웨어를 필요로 합니다.

시스템 테스트: 당신은 고객이 작업을 실행하는 시스템을 구축하고 있습니까, 아니면 그들이 이미 가지고 있는 시스템 위에 앉는 도구를 구축하고 있습니까? 시스템은 워크플로를 종단 간 소유합니다. 데이터 캡처, 거버넌스, 수행된 작업의 기록을 포함하며, 고객이 실제 작업이 어떻게 수행되는지 설명할 때 가리키는 것입니다. 반면 도구는 고객이 이미 실행하는 워크플로에 지능을 추가할 뿐입니다. 도구 사례는 실제 수익을 창출하지만 연구소가 이를 가져갈 수 있습니다. 고객이 오케스트레이션 레이어로서 당신에게 의존하지 않기 때문입니다. 높은 ACV는 일반적으로 시스템의 신호입니다. 시스템이 실제 인력을 대체하고 그에 따라 대가를 받기 때문이지만, 보장되지는 않습니다. 연구소가 당신과 직접 경쟁한다고 가정되는 무언가를 출시한다면 고객이 여전히 당신의 도구를 필요로 할지 스스로에게 물어보세요. 그렇다면 당신은 시스템을 구축하고 있는 것입니다. 아니라면, ACV가 높더라도 당신은 도구입니다.

헤지 펀드 / P&L 테스트: 연구소의 성과가 벤치마크로 판단되는 반면, 오즈의 나머지 부분의 성과는 고객의 P&L로 판단됩니다. 고객은 당신의 모델이 SWE-Bench나 MMLU에서 좋은 점수를 받았는지 신경 쓰지 않습니다. 그들은 당신의 에이전트가 거래를 성사시켰는지, 계약을 올바르게 검토했는지, 올바른 정책을 바인드했는지 신경 씁니다. 그들이 일반적인 능력 점수가 아닌 워크플로별 결과에 집착한다면, 당신은 오즈의 나머지 부분에 있는 것입니다. 그들이 일반적인 능력에 대해 지불하고 있다면, 당신은 Claude나 Codex 시트로 얻을 수 있는 것을 판매하고 있는 것입니다. 최고의 에이전트 비즈니스는 헤지 펀드처럼 실행되어야 합니다. 벤치마크 점수가 아닌 고객 P&L로 측정된 알파에서 승리해야 합니다.

둘 다 승리할 수 있습니다 (그리고 승리할 것입니다)

우리는 옐로 브릭 로드 위와 밖에서 모두 거대한 승리자를 보게 될 것입니다. 모델은 계속 승리할 것입니다. 그들이 모델을 소유하고 설계한 수평적 도구에 대한 유통 채널을 소유하기 때문입니다.

오즈의 나머지 부분은 작업 시스템을 소유한다면 승리할 수 있습니다. 즉, 회사의 작업이 실제로 실행되고 그로부터 흐르는 데이터가 캡처되는 표면입니다. 이러한 회사는 데이터 캡처, 워크플로 실행 시스템, 거버넌스를 소유합니다. 수직 분야에서 더 복잡한 워크플로가 성숙해짐에 따라, 이는 고객이 의존하게 되는 하나의 핵심 경험으로 복합됩니다. 기존 업체와 신규 진입자로부터 새로운 모델 세대가 출시됨에 따라, 회사는 이를 통합하고 고객에게 전달하는 레이어가 됩니다. 그 아래에서 모델은 대체 가능하지만, 작업 시스템은 그렇지 않습니다.

차세대 엔터프라이즈 소프트웨어는 길 밖에서 구축될 것입니다.

구축 중이라면 연락 주세요: jschmidt@a16z.com.

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기