Tránh khỏi thất bại trên con đường gạch vàng

@joeschmidtiv
TIẾNG ANH2 tháng trước · 27 thg 5, 2026
1.2M
1.6K
195
85
4.7K

TL;DR

Trong khi các phòng thí nghiệm AI thống trị các công cụ theo chiều ngang, các startup có thể phát triển mạnh mẽ bằng cách xây dựng các 'hệ thống làm việc' theo chiều dọc, xử lý các tác vụ công nghiệp phức tạp, đa bước và các vòng lặp dữ liệu độc quyền.

Tại Sao Tầng Ứng Dụng Chưa Chết

Câu hỏi mà tôi liên tục nhận được từ các nhà sáng lập và ứng viên tiềm năng: liệu còn tầng ứng dụng AI nào để xây dựng không, hay OpenAI và Anthropic sẽ nuốt chửng tất cả?

Đằng sau câu hỏi này là một dạng tâm lý hoang mang đặc thù về AI. Một số người đã kết luận rằng những nơi bền vững duy nhất để tránh bị xếp vào hạng vĩnh viễn là ở trong một phòng thí nghiệm lớn hoặc ngoài tiền tiêu xây dựng trong lĩnh vực robot, công nghệ cứng, hoặc những thứ tương tự – về mặt lý thuyết là bất cứ thứ gì "các phòng thí nghiệm không thể đụng tới". Nếu mọi phần mềm sắp bị ăn thịt, hoặc là bởi Codex hay Claude đảm nhận trực tiếp công việc, hoặc bởi một mô hình tương lai sẽ khiến bất cứ thứ gì bạn đã xây dựng trở nên không cần thiết, vậy thì hãy chạy đi!

Nghe này, tôi cũng là một người theo chủ nghĩa tối đa về AI gần như bất kỳ ai, và tôi nghĩ họ đúng một nửa. Các phòng thí nghiệm thực sự đang nhắm đến một phần rất lớn của bề mặt ứng dụng. Nhưng "tầng ứng dụng" không chỉ là một cơ hội đồng nhất. Cách hiểu đúng là liệu bạn đang ở trên Con Đường Gạch Vàng hay ở một nơi nào đó khác trong Xứ Oz.

Con Đường Gạch Vàng là cách nói ngắn gọn của chúng tôi về con đường mà các phòng thí nghiệm đang đi, nơi họ đang đầu tư những nguồn lực phi thường. Lý do các phòng thí nghiệm phù hợp nhất cho các vấn đề như sinh mã, viết lách, hay tạo hình ảnh là vì những vấn đề này được cải thiện nhờ năng lực mô hình thô: mỗi đô la chi cho tiền huấn luyện và hậu huấn luyện đều cải thiện chất lượng sản phẩm. Trong khi đó, phần còn lại của Xứ Oz tồn tại nhiều vấn đề phức tạp hơn, thường theo chiều dọc, không đơn giản như việc đưa cho người dùng doanh nghiệp một công cụ nằm ngang với quyền truy cập vào các công cụ tiêu chuẩn và sử dụng máy tính. Giá trị đến ít hơn từ năng lực thô của mô hình nền tảng (dù điều đó vẫn quan trọng!) mà nhiều hơn từ giàn giáo xung quanh nó, giúp đầu ra trở nên đáng tin cậy, tuân thủ và có thể vận hành trong một ngành cụ thể.

Chúng ta đang thấy điều này diễn ra trong thời gian thực khi OpenAI và Anthropic đang nói với thị trường rằng họ không thể giải quyết mọi vấn đề bằng một đồng nghiệp AI chung chung. Họ đã công bố các liên doanh triển khai trước quy mô lớn để xây dựng toàn bộ công ty xoay quanh việc cấu hình và tùy chỉnh mô hình của họ cho doanh nghiệp. Bạn không đổ hàng tỷ đô la vào các chương trình đó nếu bạn nghĩ bản phát hành mô hình tiếp theo sẽ xử lý được việc đó.

Vì vậy, nếu bạn muốn làm giàu bằng cách xây dựng ứng dụng AI – hãy tránh con đường gạch vàng và xây dựng ở một nơi khác trong Xứ Oz. Đây là những gì chúng tôi đã học được, và những gì một số nhà sáng lập trong danh mục đầu tư của chúng tôi đã học được, về những gì hiệu quả.

Con Đường Gạch Vàng

Nếu bạn đang bắt đầu một công ty, Con Đường Gạch Vàng là con đường hiển nhiên nhất để đi, nhưng nó cũng là con đường nguy hiểm nhất. Lấy một mô hình hiệu suất cao, kết nối một số bộ kết nối có sẵn (như G Drive, Slack, Salesforce, Notion, GitHub), và triển khai một lớp điều phối tác nhân nào đó lên trên đó. Thật kỳ diệu!

Vấn đề với điều này là đây chính xác là những gì các phòng thí nghiệm đang làm với Cowork và Codex. Rõ ràng, họ sở hữu mô hình, điều này mang lại cho họ biên lợi nhuận tốt hơn, quyền kiểm soát và khả năng tạo áp lực về giá lên bất kỳ ai ở hạ nguồn. Nhưng có lẽ quan trọng nhất, họ cũng sở hữu các lựa chọn kiến trúc xác định sản phẩm của họ được xây dựng để giải quyết tốt những vấn đề gì. Cho đến nay, họ đã có chủ ý về mô hình cộng với mẫu gọi công cụ, và đây chính xác là những gì công việc nằm ngang với số bước thấp trên con đường này yêu cầu. Ngay cả khi một startup bằng cách nào đó có thể vượt trội hơn Codex hay Claude Code, các phòng thí nghiệm có các kênh phân phối khổng lồ và vầng hào quang thương hiệu lớn nhất trong AI.

Nếu bạn là một công ty ứng dụng AI chạy theo kịch bản đó với cùng các bộ kết nối, không có tác nhân phụ hay cấu hình bên dưới nó, và không có phân phối, rất có thể bạn đang đi trên con đường không có lối thoát.

Phần Còn Lại Của Xứ Oz

Không phải tất cả đều là ảm đạm và bi quan cho các startup. Có một cơ hội rất lớn bên ngoài Con Đường Gạch Vàng, nơi các startup có một con đường rõ ràng để sở hữu khách hàng của mình và giải quyết các vấn đề phức tạp.

Các doanh nghiệp này đang xây dựng các trải nghiệm tác nhân, nơi mô hình được đan xuyên qua một mạng lưới phức tạp các công cụ, tự động hóa và tích hợp (đọc là: phần mềm), khiến hầu hết các startup này trở thành theo chiều dọc theo mặc định. Họ có thể tập trung vào công việc nhiều bước và nhiều bên liên quan, với các tác nhân phụ cho các tác vụ cụ thể theo vai trò và ngành dọc, mà Anthropic và OpenAI không thể với tới bằng các nền tảng nằm ngang: thu thập ngữ cảnh qua các hệ thống, sau đó điều hướng qua nhiều người phải phê duyệt ở các giai đoạn khác nhau. Nó thường liên quan đến một hoặc nhiều hệ thống kế thừa, có xu hướng yêu cầu kết quả xác định khi sự mơ hồ không được chấp nhận, và đôi khi gắn liền với một số kết quả kinh doanh có giá trị. Các phòng thí nghiệm hiểu những vấn đề này có giá trị như thế nào: đó là lý do tại sao họ đang xây dựng các cửa hàng cấu hình gia công bên ngoài của riêng mình, và tại sao tồn tại cả một tầng lớp doanh nghiệp học tăng cường cao cấp.

Tại sao phần còn lại của Xứ Oz sẽ không bị Pháp Sư chiếm hữu

Phản ứng với những điều trên sẽ là cho đến nay, việc đặt cược chống lại sự cải tiến của các mô hình/phòng thí nghiệm là một ván cược khá tệ. Chúng rất có thể sẽ tiếp tục trở nên tốt hơn và cuối cùng xâm chiếm thị trường mà các doanh nghiệp tầng ứng dụng này phục vụ.

Các phòng thí nghiệm chắc chắn sẽ cải thiện, nhưng tôi cho rằng có một vài cách mà phần còn lại của Xứ Oz có thể tự bảo vệ theo thời gian:

Vòng quay dữ liệu và học hỏi:

Rất nhiều thứ bạn tiếp thu nội bộ không có trong bất kỳ tập huấn luyện nào — các chuẩn mực ngành bất thành văn, các tiêu chuẩn không được ghi chép, kiến thức bộ lạc nằm trong đầu những người hành nghề. Không có gì trong số đó trên web công cộng. Không có lượng tính toán huấn luyện nào có thể thay thế cho việc ở bên trong các quy trình làm việc nơi kiến thức này thực sự tồn tại. Có hai vòng quay chồng lên nhau ở đây: một vòng xuyên khách hàng — các mẫu hình tích lũy khi bạn thấy nhiều biến thể hơn của cùng một vấn đề — và một vòng trong khách hàng — lý do đằng sau các quyết định cụ thể, các ngoại lệ không được nói ra, các quy tắc ngón tay cái của riêng công ty chỉ xuất hiện thông qua tương tác thực tế với hệ thống.

Ngay cả khi dữ liệu khách hàng không thể được sử dụng xuyên suốt các khách hàng, các công ty ứng dụng sẽ có thể tận dụng khả năng nhận diện mẫu hình trên các loại vấn đề của khách hàng, và sử dụng điều đó để định hình kiến trúc phù hợp cho các vấn đề trong tương lai. Một công ty đã chạy các tác nhân của mình qua hàng trăm bản soát pháp lý, hàng ngàn chu kỳ bảo lãnh phát hành bảo hiểm, hoặc hàng chục ngàn chiến dịch SDR đã nội hóa hình dạng của vấn đề theo cách mà một người mới tham gia không thể sao chép bằng cách khởi tạo một tác nhân mới lần đầu tiên.

Về nguyên tắc, một tác nhân nằm ngang có thể xây dựng cùng một cơ sở hạ tầng học hỏi. Lý do nó không làm vậy, ngoài vấn đề tập trung thuần túy, là UX: việc nắm bắt loại kiến thức này phụ thuộc hoàn toàn vào các bề mặt quy trình làm việc mà bạn cung cấp cho người dùng, và các người chơi theo chiều dọc có thể định hình các bề mặt đó xoay quanh chính xác những gì quy trình làm việc của họ cần để hiển thị. Các công cụ nằm ngang không thể làm được điều đó. Các bộ đánh giá, đầu ra được gắn nhãn và phân loại các trường hợp ngoại lệ có thể kết hợp thành một vòng quay dữ liệu theo ngành dọc, có thể thúc đẩy việc tinh chỉnh mà người mới tham gia không thể tạo ra nếu không có mức độ tiếp xúc sản xuất tương đương. Liệu điều này có khả thi hay không phụ thuộc vào quyền dữ liệu, khối lượng tiếp xúc sản xuất tích lũy được và cấu trúc hợp đồng khách hàng, nhưng khả năng nhận diện mẫu hình vẫn tích lũy bất kể.

Quản lý tính biến thiên và độ phức tạp của mô hình: Các phòng thí nghiệm đã có định tuyến nội bộ — các lớp mô hình khác nhau cho các yêu cầu khác nhau, các tổ hợp bên dưới. Điều họ không thể làm là định tuyến qua các nhà cung cấp, hoặc đánh giá mô hình của đối thủ cạnh tranh cho một tác vụ phụ cụ thể, hoặc sử dụng một mô hình tinh chỉnh mã nguồn mở cho phần hẹp mà nó thực sự tốt nhất. Công ty ở Phần Còn Lại Của Xứ Oz chọn mô hình phù hợp cho mỗi tác vụ phụ trên toàn bộ thị trường mô hình, không chỉ những gì phòng thí nghiệm mẹ của nó phát hành. Nó cũng làm công việc mà không ai muốn làm — chạy lại các bộ đánh giá trên các bản nâng cấp, hiệu chỉnh lại lời nhắc cho các trường hợp ngoại lệ của khách hàng, triển khai mà không làm hỏng sản xuất — mỗi lần một mô hình mới ra mắt. Các phòng thí nghiệm không làm điều này thay cho khách hàng; họ bán cho bạn mô hình tiếp theo của họ và bảo bạn di chuyển. Công ty ở Phần Còn Lại Của Xứ Oz chịu trách nhiệm di chuyển. Những gì khách hàng nhận được là trí thông minh tốt nhất hiện có trên toàn bộ thị trường, cộng với tính liên tục qua mọi bản nâng cấp.

Tối ưu hóa chi phí: Chạy mọi truy vấn qua Opus 4.7 là con đường nhanh nhất dẫn đến biên lợi nhuận gộp âm. Các công ty tốt nhất ở Phần Còn Lại Của Xứ Oz định tuyến qua các tầng mô hình — mô hình tiên tiến cho các tác vụ khó nhất, tầng trung cho phần lớn, các mô hình nhỏ hơn tùy chỉnh hoặc tinh chỉnh ở những nơi họ đã giành được quyền sử dụng chúng. Một số hiện đang hậu huấn luyện các mô hình của riêng họ trên cơ sở đó, tối ưu hóa chúng cho phần hẹp của công việc mà khách hàng của họ quan tâm và phục vụ chúng với chi phí chỉ bằng một phần nhỏ so với một lần gọi API tiên tiến. Các phòng thí nghiệm định giá mức sàn: trí thông minh ít nhất có sẵn ở mức $X. Công ty ở Phần Còn Lại Của Xứ Oz bán thứ ngược lại — chi phí đô la thấp nhất cho mức độ thông minh cụ thể mà quy trình làm việc thực sự yêu cầu. Điều đó chỉ khả thi nếu bạn biết chính xác mỗi tác vụ phụ cần mức độ nào, điều mà các phòng thí nghiệm về mặt cấu trúc không thể biết trên mọi ngành dọc. Nó chuyển trực tiếp thành mức giá thấp hơn, có kiểm soát cho kết quả đầu ra.

Quản trị: Có một giá trị đáng kể trong việc trở thành mặt phẳng kiểm soát về cách khách hàng của họ chạy AI trong ngành dọc đó – nơi mà quyền, kiểm toán, những gì tác nhân được phép làm và những gì tác nhân thực sự đã làm, tất cả hội tụ. Mặt phẳng kiểm soát đó được xây dựng từ các rào chắn cụ thể cho trường hợp sử dụng, trông hoàn toàn khác nhau giữa các ngành và loại công việc. Bởi vì họ sở hữu các công cụ, quy trình làm việc và dữ liệu mà tác nhân chạm tới từ đầu đến cuối, họ có thể cung cấp các kết quả xác định theo những cách mà các công cụ nằm ngang sẽ gặp khó khăn. Họ cũng là thực thể hấp thụ sự phức tạp về quy định cho người mua cuối cùng — quy tắc FRCP và quy tắc hành nghề luật sư trong lĩnh vực pháp lý, HIPAA trong chăm sóc sức khỏe, SEC và FINRA trong tài chính, quy định bảo hiểm tiểu bang, v.v. Một người chơi nằm ngang không thể làm điều đó một cách đáng tin cậy mà không trở thành hàng trăm ngành dọc khác nhau cùng một lúc. Các CIO muốn có một đối tác tuyên bố theo hợp đồng rằng họ đang xử lý việc tuân thủ cho các tác nhân mà họ đang cung cấp.

Tất cả những điều này đều quay trở lại một vấn đề duy nhất: sự tập trung. Đó có thể là một ngành dọc (bảo hiểm, pháp lý, kế toán) hoặc một chức năng được thực hiện sâu sắc (bán hàng, hỗ trợ khách hàng, tài chính). Dù bằng cách nào, công việc cần một đội ngũ tập trung cao độ vào một nhóm khách hàng — quy trình làm việc của họ, các trường hợp ngoại lệ của họ, các quy định của họ. Các phòng thí nghiệm không được xây dựng cho điều đó. Họ phải ở khắp mọi nơi, cho mọi người, đó là cách họ xây dựng Con Đường Gạch Vàng ngay từ đầu. Sự đánh đổi tương tự giữ họ ở lại phần còn lại của Xứ Oz — bạn có thể ở khắp mọi nơi cùng một lúc, hoặc bạn có thể xuất sắc ở một thứ. Không thể cả hai.

Bán hàng như một ví dụ – Lời khuyên thực tế từ CEO kỹ thuật của 11x

Bạn nên nghĩ về điều này trong thực tế như thế nào? Dưới đây là một số lời khuyên thực tế từ Prabhav Jain, CEO của 11x.

Tập trung vào kết quả đầu ra

Một con đường chiến thuật để xây dựng một công ty có khả năng chống chịu trước các phòng thí nghiệm là chỉ cần bắt đầu từ một kết quả cụ thể mà khách hàng của bạn thực sự quan tâm. Đối với chúng tôi, đó là giúp các công ty tạo ra nhiều pipeline hơn. Từ đó, các câu hỏi trở nên chiến thuật. Những hoạt động nào chúng tôi muốn sở hữu từ đầu đến cuối thực sự thúc đẩy pipeline? Phân rã từng hoạt động thành các nhiệm vụ. Nhiệm vụ nào mang tính tác nhân và nhiệm vụ nào không. Nhiệm vụ nào yêu cầu hiểu biết sâu sắc về lĩnh vực và nhiệm vụ nào không. Các phòng thí nghiệm cũng sẽ triển khai các quy trình làm việc, nhưng khi quy trình làm việc có nhiều bước, đầu vào lộn xộn, trạng thái khó diễn giải, hoặc các ràng buộc trong thế giới thực, một mô hình tốt hơn một mình sẽ không đưa bạn đến đó. Công việc rơi vào tay kỹ thuật phần mềm cổ điển tốt, và các phòng thí nghiệm không có lợi thế nào so với một công ty ứng dụng tập trung trên bề mặt đó. Ví dụ, đây là một số nhiệm vụ mà chúng tôi xử lý, một số mang tính tác nhân và một số không: tìm kiếm khách hàng tiềm năng dựa trên tín hiệu tùy chỉnh, làm giàu khách hàng tiềm năng, nghiên cứu tài khoản chuyên sâu, trình lấy ngữ cảnh từ CRM, người viết tin nhắh theo kênh cụ thể, tác nhân đánh giá chất lượng khách hàng tiềm năng và hệ thống khả năng gửi email. Đây không phải là những nhiệm vụ bạn có thể thực hiện chỉ trong một lần và chúng yêu cầu kỹ thuật sâu.

Hiểu biết quan trọng trong phép loại suy Xứ Oz là khoảng một nửa của bất kỳ quy trình làm việc thực tế nào không mang tính tác nhân thì không có lợi thế nào từ phòng thí nghiệm. Họ không giỏi hơn bạn trong việc viết phần mềm xác định bên dưới lớp mô hình. Và nửa mang tính tác nhân vẫn yêu cầu bạn tinh chỉnh, huấn luyện và ràng buộc các mô hình với kết quả mà bạn thực sự muốn. Kiến thức lĩnh vực thường không nằm trong dữ liệu huấn luyện chung. Những kỹ năng đó được xây dựng từ đầu cho ngành dọc hoặc chức năng, và được đưa vào mô hình vào đúng thời điểm trong quy trình làm việc. Khi các tác nhân của chúng tôi đánh giá chất lượng khách hàng tiềm năng đến qua điện thoại, tôi phải được huấn luyện về những gì tạo nên một cuộc trò chuyện bán hàng tốt cho ngành cụ thể đó và cho tính cách cụ thể đó. Đó là công việc của công ty ứng dụng, và nó tích lũy.

Quan trọng hơn, những kỹ năng đó trở nên lỗi thời mọi lúc vì các doanh nghiệp phát triển, vì vậy khả năng phát triển các quy trình làm việc và ngữ cảnh đó của bạn trở thành một lợi thế cạnh tranh. Ví dụ, khi chúng tôi bắt đầu sản phẩm tiếp cận email mở rộng của mình, các email do "AI" viết mới chỉ bắt đầu xuất hiện. Nhanh chóng đến hôm nay, mọi người có một cảm nhận tinh tế về email do AI viết so với con người và quan trọng là, điều này thay đổi sau mỗi vài tháng. Các tác nhân của chúng tôi phải liên tục thích ứng với động lực thị trường, nhưng đây là nơi xây dựng hào. Trên thực tế, bất chấp sự năng động này, tỷ lệ trả lời tích cực của chúng tôi đã tăng 4 lần trong vài tháng qua và chúng tôi đã tạo ra hàng trăm triệu trong pipeline cho khách hàng của mình.

Làm việc trên các vấn đề có độ phức tạp cao

Các vấn đề phức tạp là nơi giá trị kinh doanh thực sự được giải phóng. Nếu không, bạn sẽ thấy mình đang xây dựng một lớp bọc mỏng.

Phân rã bất kỳ vấn đề kinh doanh đủ phức tạp nào và sự lộn xộn sẽ xuất hiện nhanh chóng. Đây là một ví dụ từ thế giới GTM nghe có vẻ tầm thường: bạn không nên liên hệ với một đầu mối tại một công ty nếu công ty đó đã là khách hàng. Nhưng nó không hề tầm thường. Có thể bạn có tên miền liên kết với công ty trong CRM của mình. Thế còn các công ty có hàng chục công ty con thì sao? Nếu bản ghi CRM có tên miền của công ty mẹ thì sao? Nếu một trường đối sánh cũ trong Salesforce gửi một lời chào hàng lạnh đến CRO của một khách hàng hiện tại thì sao? Dữ liệu thực tế rất lộn xộn. Con người cũng gặp khó khăn với nó. Các mô hình không tự động vượt qua rào cản đó. Việc tạo ra trật tự từ sự lộn xộn đó đòi hỏi các tác nhân được xây dựng có mục đích cho hình dạng cụ thể của vấn đề, không phải là một copilot đa năng nhắm vào CRM. Trên thực tế, dựa trên dữ liệu chúng tôi có, chúng tôi đã nhận ra rằng chất lượng và độ mới của dữ liệu của chúng tôi cao hơn nhiều so với khách hàng của chúng tôi, vì vậy theo mặc định, chúng tôi neo vào dữ liệu của chính mình.

Các rào chắn không chỉ để ngăn điều tồi tệ xảy ra. Đó là những gì khách hàng của bạn trả tiền cho bạn.

Các rào chắn đang bị đánh giá thấp nghiêm trọng. Ngay cả trong cùng một sản phẩm, mọi trường hợp sử dụng đều cần có rào chắn riêng. Đối với chúng tôi, một khách hàng tiềm năng trong lĩnh vực dịch vụ tài chính được quản lý đòi hỏi những đảm bảo khác với một khách hàng SaaS thị trường trung bình, và những đảm bảo đó lan truyền xuống cách tác nhân được phép viết, nó có thể liên hệ với ai, nó có thể chạm vào dữ liệu nào, nó có thể nói gì trong cuộc gọi và mọi quyết định được ghi lại như thế nào.

Một hệ thống một kích cỡ phù hợp tất cả sẽ sụp đổ dưới sự khác biệt đó. Các rào chắn phải được xây dựng cho từng trường hợp sử dụng, cấu hình cho từng khách hàng và được kiểm toán liên tục, và công việc đó nằm chắc chắn trong tay công ty ứng dụng. Đây là lý do tại sao chúng tôi có các FDE và nhà chiến lược triển khai kỹ thuật cần tinh chỉnh cho từng yêu cầu của khách hàng. Ví dụ, chúng tôi đã làm việc với một tổ chức F1000 để thực hiện cuộc gọi ra ngoài có sự đồng ý bằng giọng nói đến cơ sở khách hàng SMB lớn của họ. Một vài lần lặp đầu tiên có tỷ lệ bắt máy thấp - chúng tôi đã phải nhanh chóng lặp lại và học cách khiến nhóm đối tượng cụ thể này tương tác trong 10 giây đầu tiên của cuộc gọi. Chủ doanh nghiệp SMB hành xử rất khác so với những người mua B2B lớn hơn hoặc người tiêu dùng. Chúng tôi hiện tạo ra nhiều cơ hội bán hàng hơn cho họ trong một ngày so với toàn bộ đội ngũ bán hàng của họ cho phân khúc đó trong một tháng.

Bảo hiểm như một ví dụ – Lời khuyên thực tế từ CEO của FurtherAI

Bán hàng là một ví dụ. Bảo hiểm là một ví dụ khác, và nó đưa ra cùng một luận điểm từ một góc độ khác. Đây là cách Aman Gour, CEO của FurtherAI, nghĩ về việc xây dựng ngoài con đường:

Khi chúng tôi bắt đầu triển khai AI bên trong các hoạt động bảo hiểm thực tế, chúng tôi liên tục nghe một giả định cụ thể: mô hình là trí thông minh, và quy trình làm việc chỉ là giàn giáo xung quanh nó.


Càng làm việc với nhiều hãng bảo hiểm, chúng tôi càng tin chắc rằng điều này là sai lầm.


Trong bảo hiểm, rất nhiều trí thông minh tồn tại bên trong chính quy trình làm việc. Hai hãng bảo hiểm có thể chạy một hồ sơ đệ trình qua những gì có vẻ như cùng một con đường: đệ trình, xem xét, báo giá, ràng buộc. Nhưng con đường là phần dễ dàng. Điều phân biệt hai hãng bảo hiểm là mọi thứ bên trong nó: rủi ro nào được leo thang, tín hiệu tổn thất nào quan trọng, quy tắc khẩu vị nào thắng khi hai quy tắc xung đột, khi nào con người phải ký xác nhận, dữ liệu bên ngoài nào được kéo vào và quyết định cuối cùng được ghi lại như thế nào.


Logic đó không tồn tại trong một công cụ quy tắc sạch sẽ duy nhất. Nó được trải rộng trên các SOP, đánh giá của quản lý, triết lý bảo lãnh phát hành, khẩu vị cụ thể của hãng bảo hiểm và nhiều năm kinh nghiệm vận hành. Phần lớn trong số đó không được ghi lại dưới dạng mà mô hình có thể đọc được một cách đơn giản.


Đây là lý do tại sao chúng tôi không tin vào một tác nhân thuần túy lý giải từ đầu mỗi lần, và chúng tôi không tin vào một quy trình làm việc cứng nhắc sẽ phá vỡ ngay khi thực tế trở nên lộn xộn. Thay vào đó, chúng tôi đã xây dựng các quy trình làm việc tác nhân. Quy trình làm việc mang lại cho bạn khả năng lặp lại, khả năng kiểm toán và kiểm soát chi phí. Tác nhân xử lý tính biến thiên và phục hồi khi con đường thuận lợi bị phá vỡ. Con người vẫn ở trong vòng lặp cho những đánh giá mang tính phán đoán mà trách nhiệm giải trình là quan trọng.


Vào ngày đầu tiên, điều này tự động hóa công việc thủ công. Nhưng theo thời gian, mọi sự leo thang trở thành một tín hiệu, mọi ngoại lệ là một phản hồi và mọi sự hiệu chỉnh của con người cho thấy nơi mà sổ tay hướng dẫn chưa đầy đủ. Theo thời gian, quy trình làm việc không còn là một kịch bản và bắt đầu trở thành bộ nhớ hoạt động của hãng bảo hiểm. Đây là phần mà các phòng thí nghiệm sẽ thấy khó tiếp cận. Họ sẽ tiếp tục phát hành các mô hình tốt hơn và các tác nhân tổng quát tốt hơn, và họ nên làm vậy. Nhưng họ không ngồi bên trong quy trình làm việc sản xuất của một hãng bảo hiểm đủ lâu để học lý do tại sao một tài khoản được leo thang, tại sao một rủi ro bị từ chối, hoặc tại sao một nhà bảo lãnh phát hành đã ghi đè hướng dẫn khẩu vị và đã đúng khi làm vậy.


Sự hiểu biết đó chỉ đến từ việc chạy quy trình làm việc, trong sản xuất, nhiều nghìn lần. Quy trình làm việc bạn phát hành vào ngày đầu tiên không phải là hào. Vòng lặp mà việc sử dụng sản xuất tạo ra theo thời gian mới là hào.


Đối với chúng tôi, đó là ý nghĩa của việc xây dựng ngoài con đường.

Làm thế nào để bạn quyết định liệu bạn có đang ở phần còn lại của Xứ Oz hay không?

Kiểm tra công cụ và bước: Công việc cần bao nhiêu bước, và các công cụ bạn phải xây dựng để hỗ trợ nó phức tạp như thế nào? So sánh một tìm kiếm AI nằm ngang qua Google Drive — một bước với một công cụ có kết quả đầu ra có thể tha thứ, người dùng đọc bản tóm tắt và hỏi lại nếu nó sai — với một bản soát pháp lý nhiều bước dựa trên tiền lệ của công ty trong ba năm: hàng chục bước qua nhiều công cụ, đầu ra phải vượt qua đánh giá của đối tác và có thể cần được tranh luận tại tòa. Cả hai đều trông giống như "một tác nhân đang làm việc", nhưng chỉ một trong số chúng yêu cầu loại phần mềm sâu sắc mà một đội ngũ tập trung phải mất nhiều năm để xây dựng.

Kiểm tra hệ thống: Bạn đang xây dựng một hệ thống mà khách hàng chạy công việc của họ thông qua nó, hay một công cụ nằm trên một hệ thống mà họ đã có? Hệ thống sở hữu quy trình làm việc từ đầu đến cuối — việc thu thập dữ liệu, quản trị, hồ sơ về những gì đã được thực hiện — và chúng là thứ mà khách hàng chỉ vào khi mô tả cách công việc thực tế diễn ra. Mặt khác, các công cụ chỉ thêm trí thông minh vào một quy trình làm việc mà khách hàng đã chạy. Trường hợp công cụ tạo ra doanh thu thực tế và các phòng thí nghiệm có thể lấy nó vì khách hàng không phụ thuộc vào bạn như một lớp điều phối. ACV cao thường là một tín hiệu của một hệ thống, vì các hệ thống thay thế nhân sự thực tế và được trả tiền tương ứng, nhưng nó không phải là một sự đảm bảo. Hãy tự hỏi liệu khách hàng có còn cần công cụ của bạn nếu một phòng thí nghiệm phát hành thứ gì đó được cho là cạnh tranh trực tiếp với bạn hay không. Nếu có, bạn đang xây dựng một hệ thống. Nếu không, bạn là một công cụ — ngay cả khi ACV của bạn cao.

Kiểm tra quỹ phòng hộ / P&L: Trong khi hiệu suất của phòng thí nghiệm được đánh giá dựa trên các điểm chuẩn, hiệu suất của phần còn lại của Xứ Oz được đánh giá dựa trên P&L của khách hàng. Khách hàng của bạn không quan tâm rằng mô hình của bạn đạt điểm cao trên SWE-Bench hay MMLU — họ quan tâm liệu tác nhân của bạn đã chốt được giao dịch, soát xét hợp đồng một cách chính xác, hay ràng buộc đúng chính sách. Nếu họ bị ám ảnh bởi kết quả đầu ra cụ thể theo quy trình làm việc, không phải bởi một điểm số năng lực chung chung, bạn đang ở phần còn lại của Xứ Oz. Nếu họ đang trả tiền cho năng lực chung chung, bạn đang bán cho họ thứ họ có thể nhận được với một ghế Claude hoặc Codex. Các doanh nghiệp tác nhân tốt nhất sẽ cần phải thực thi như các quỹ phòng hộ — giành chiến thắng dựa trên alpha được đo bằng P&L của khách hàng, không phải bằng điểm số điểm chuẩn.

Cả hai đều có thể (và sẽ) giành chiến thắng

Chúng ta sẽ thấy những người chiến thắng lớn cả trên và ngoài Con Đường Gạch Vàng. Các mô hình sẽ tiếp tục giành chiến thắng vì chúng sở hữu mô hình và chúng sở hữu sự phân phối cho các công cụ nằm ngang mà chúng đã thiết kế.

Phần còn lại của Xứ Oz có thể giành chiến thắng nếu chúng sở hữu hệ thống công việc — bề mặt nơi công việc của công ty thực sự thực thi và dữ liệu chảy từ nó được thu thập. Các công ty này sở hữu việc thu thập dữ liệu, hệ thống hành động trong quy trình làm việc và quản trị. Khi các quy trình làm việc phức tạp hơn trưởng thành trong một ngành dọc, chúng kết hợp thành một trải nghiệm cốt lõi mà khách hàng phụ thuộc vào. Khi các thế hệ mô hình mới được phát hành từ các công ty hiện tại và những người mới tham gia, công ty trở thành lớp tích hợp và cung cấp chúng cho khách hàng. Mô hình có thể thay thế bên dưới; hệ thống công việc thì không.

Thế hệ tiếp theo của phần mềm doanh nghiệp sẽ được xây dựng ngoài con đường.

Nếu bạn đang xây dựng nó, hãy liên hệ: jschmidt@a16z.com.

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral