Trò chuyện cùng Dương Trác Lân (Yang Zhilin) của Kimi: Tiến bước về phía những đỉnh núi tuyết vô tận và chưa được khám phá

@zhang_benita
TIẾNG TRUNG2 ngày trước · 19 thg 7, 2026
159K
249
25
13
248

TL;DR

Nhà sáng lập Moonshot AI, Dương Trác Lân, thảo luận về triết lý kỹ thuật đằng sau Kimi, nhấn mạnh ngữ cảnh dài là con đường dẫn đến AGI và tương lai của các mô hình thế giới thống nhất.

Đây là cuộc phỏng vấn đầu tiên của tôi với Dương Chí Lâm, được thực hiện vào đầu năm 2024 và xuất bản vào ngày 1 tháng 3 năm 2024 — đúng vào ngày kỷ niệm đầu tiên thành lập Kimi. Vào thời điểm đó, Kimi chỉ có 80 người, làm việc tại văn phòng đầu tiên khá ọp ẹp của họ. Không có logo ở lối vào. Chỉ có một cây đàn piano trắng đứng gác bên cửa.

Bài báo này đã tạo ra một làn sóng tranh luận đáng kể trong cộng đồng công nghệ Trung Quốc vào thời điểm đó.

Hồi đó, tôi vẫn còn là một nhà báo báo in, vì vậy cuộc phỏng vấn này chỉ tồn tại dưới dạng văn bản và một tập podcast âm thanh.

Như chúng ta có thể thấy, nhiều quan điểm được trình bày trong bài báo này đã trở thành sự thật.

Chỉ cần đọc lại những dòng chữ từ hai năm trước, bạn thực sự không thể không ngạc nhiên về việc thế giới đã thay đổi một cách chóng mặt!

(Bản dịch này được tạo bởi Kimi K3.)

Dương Chí Lâm: "Nếu ai cũng nghĩ bạn bình thường — nếu ước mơ của bạn là ước mơ mà bất kỳ ai cũng có thể có — thì nó chẳng thêm gì vào tổng thể những giấc mơ của nhân loại."

Tác giả: Trương Hiểu Quân

Chỉ một năm trước, nhà khoa học AI Dương Chí Lâm đã thực hiện một phép tính chính xác tại Thung lũng Silicon. Anh nhận ra rằng nếu quyết định khởi nghiệp với một công ty mô hình nền tảng hướng tới AGI, anh sẽ cần huy động hơn 100 triệu đô la trong vòng vài tháng tới.

Tuy nhiên, đó mới chỉ là tấm vé vào cuộc chơi. Một năm sau, con số đó đã tăng gấp mười ba lần.

Đối với các công ty mô hình nền tảng, cạnh tranh không chỉ là cuộc đua khoa học mà trước hết là cuộc chiến khốc liệt về tiền bạc. Khi các nhà đầu tư thắt chặt hầu bao, bạn phải đi trước đối thủ trong việc huy động thêm tiền, mua thêm GPU và giành giật nhân tài.

"Nó đòi hỏi sự tập trung nhân tài và tập trung vốn," Dương Chí Lâm, người sáng lập kiêm CEO của Moonshot AI, công ty mô hình nền tảng được thành lập vào ngày 1 tháng 3 năm 2023, cho biết.

Trong năm qua, các công ty mô hình nền tảng Trung Quốc dường như sống trong một lằn ranh sinh tồn căng thẳng và chật hẹp. Bề ngoài, mỗi công ty đều nắm giữ một khoản tiền mặt kếch xù. Nhưng một mặt, họ phải ngay lập tức đổ số tiền vừa huy động được vào các nghiên cứu cực kỳ tốn kém để đuổi theo OpenAI — trước tiên là bắt kịp GPT-3.5, và ngay cả khi chưa đạt tới GPT-4, thì Sora đã xuất hiện. Mặt khác, họ phải không ngừng chạy đua để tìm ra các trường hợp sử dụng thực tế khả thi, nhằm tự chứng minh rằng họ là các công ty, không phải viện nghiên cứu chỉ ngốn vốn. Và điều đó vẫn chưa đủ: đối với mỗi công ty khởi nghiệp này, dù lối thoát là IPO hay bị mua lại, con đường phía trước vẫn còn rất mờ mịt.

Trong số những người sáng lập các công ty mô hình nền tảng Trung Quốc, Dương Chí Lâm là người trẻ nhất, sinh năm 1992. Ngành công nghiệp mô tả anh là một tín đồ AGI kiên định và là một nhà sáng lập có sức hút kỹ thuật hiếm có. Phần lớn thành tích học thuật và sự nghiệp của anh gắn liền với AI đa năng, và các bài báo của anh đã được trích dẫn hơn 22.000 lần.

Vào giữa năm 2023, cộng đồng công nghệ Trung Quốc đột ngột chuyển từ hưng phấn sang lạnh nhạt với các mô hình nền tảng, và việc đẩy nhanh ứng dụng thực tế đã trở thành giai điệu chủ đạo thực dụng. Điều này chắc chắn khiến các CEO mô hình nền tảng bị giằng xé dữ dội giữa lý tưởng và thực tế. Trong một hệ sinh thái AI Trung Quốc nơi ai cũng tụng ca PMF (sự phù hợp giữa sản phẩm và thị trường) và ai cũng tụng ca thương mại hóa, vị CEO này — vốn là một nhà nghiên cứu AI — lại không hề tỏ ra vội vã.

Với 80 người, Moonshot AI có số lượng nhân viên ít nhất trong số các công ty mô hình nền tảng hàng đầu Trung Quốc. Không giống như các đối thủ, Dương Chí Lâm không chọn hướng kinh doanh B2B an toàn hơn hay tìm kiếm ứng dụng trong các lĩnh vực dọc như chăm sóc sức khỏe hay trò chơi. Anh xây dựng một — và chỉ một — sản phẩm tiêu dùng: trợ lý AI Kimi, có thể chấp nhận đầu vào lên tới 200.000 ký tự tiếng Trung. Kimi cũng là tên tiếng Anh của Dương Chí Lâm.

Dương Chí Lâm thích xem công ty của mình như một hệ thống kết hợp khoa học, kỹ thuật và kinh doanh. Bạn có thể hình dung thế này: phía trên thế giới con người, anh đang dựng lên một bệ thí nghiệm AI — một tay anh chạy thí nghiệm, và tay kia anh đưa công nghệ tiên tiến xuống thế giới thực, khám phá các ứng dụng thông qua tương tác với con người và trao những ứng dụng đó vào tay người tiêu dùng. Lý tưởng nhất là, việc trước đốt hàng tỷ, chục tỷ đô la vốn; việc sau kiếm lại số tiền đó gấp hàng trăm, hàng nghìn lần. Dù nghe thế nào, nó cũng thật ly kỳ — và cũng đầy rủi ro — như đi trên dây.

"AI không phải là về PMF nào tôi có thể tìm thấy trong một hai năm tới; mà là về cách thay đổi thế giới trong mười đến hai mươi năm tới," anh nói.

Lối suy nghĩ trừu tượng, đầy lý tưởng như vậy khiến người ta phải đổ mồ hôi hột lo lắng cho anh: liệu một nhà khoa học AI trẻ tuổi có thể tạo ra không gian sống sót trong một nước Trung Quốc hiện thực?

Vào tháng 2 năm 2024, Moonshot AI đã hoàn tất một vòng gọi vốn lớn, đi ngược lại xu hướng thị trường. Được biết, công ty đã huy động được Series B hơn 1 tỷ đô la với mức định giá trước vòng là 1,5 tỷ đô la, do Alibaba dẫn đầu với sự tham gia của Monolith Management, Xiaohongshu và các bên khác. Sau khi thương vụ hoàn tất, định giá sau vòng của Moonshot AI vào khoảng 2,5 tỷ đô la — biến nó, ở giai đoạn này, trở thành kỳ lân được định giá cao nhất trong cuộc đua mô hình nền tảng Trung Quốc. (Công ty từ chối trả lời hoặc bình luận về vấn đề này.)

Giữa vòng gọi vốn thứ ba này, chúng tôi đã ngồi lại với Dương Chí Lâm để nói về năm đầu tiên khởi nghiệp của anh — một lát cắt thu nhỏ của một năm mà các công ty mô hình nền tảng Trung Quốc đã bứt tốc từ vạch xuất phát.

Công ty của anh không đặt trụ sở tại Sohu Network Plaza ở Bắc Kinh, trung tâm nơi các công ty mô hình nền tảng tập trung. Đối với một công ty có tổng số vốn huy động khoảng 9 tỷ NDT, văn phòng tại tòa nhà Liangzi Xinzuo này trông thô sơ và ọp ẹp. Thậm chí không có logo công ty ở lối vào — chỉ có một cây đàn piano trắng đứng gác bên cửa.

Phòng họp nằm trong một góc nhỏ; với những ô cửa sổ nhỏ, bên trong tối om, và tiếng máy sưởi ù ù thổi hơi ấm chống lại cái lạnh mùa đông. Trong ánh sáng lờ mờ, Dương Chí Lâm mô tả cảm nhận của anh về năm vừa qua: "Nó hơi giống như lái xe trên một con đường với những dãy núi tuyết trải dài phía trước. Bạn không biết bên trong chúng có gì. Bạn cứ tiếp tục bước về phía trước, từng bước một."

Dưới đây là toàn bộ cuộc phỏng vấn với Dương Chí Lâm. (Để dễ đọc, tác giả đã thực hiện một số chỉnh sửa văn bản.)

张小珺 Xiaojun Zhang - inline image

Bức ảnh này được chụp vào đầu năm 2024 tại văn phòng đầu tiên của Kimi ở Bắc Kinh. Hiện họ đã chuyển khỏi địa điểm này. Không có logo nào xếp dọc lối vào — chỉ có một cây đàn piano trắng lặng lẽ đứng bên cửa.

**

Phần 1

Đứng ở Điểm Khởi Đầu

"Bạn Phải Cưỡi Làn Sóng"

**

Trương Hiểu Quân: Dạo này anh thế nào?

Dương Chí Lâm: Bận — có nhiều việc. Nhưng tôi vẫn rất hào hứng. Chúng ta đang đứng ở điểm khởi đầu của một ngành công nghiệp, và có một không gian rất lớn cho trí tưởng tượng.

Trương Hiểu Quân: Lúc nãy tôi bước vào, tôi thấy một cây đàn piano trắng tinh ở lối vào công ty anh.

Dương Chí Lâm: Có một album của Pink Floyd để trên đó nữa. Tôi không biết ai đã đặt chúng ở đó — vài ngày trước tôi chợt nhận ra và chưa có dịp hỏi. (Pink Floyd là ban nhạc rock người Anh đã phát hành album The Dark Side of the Moon.)

Trương Hiểu Quân: Vào ngày ChatGPT được phát hành vào tháng 11 năm 2022, anh đang làm gì?

Dương Chí Lâm: Tôi đã chuẩn bị cho việc này — tuyển người, xây dựng đội ngũ, trao đổi những ý tưởng mới. Nhìn thấy ChatGPT thật phấn khích. Ba đến năm năm trước — thậm chí cả năm 2021 — điều đó là không thể tưởng tượng nổi. Kiểu lý luận bậc cao đó rất khó đạt được.

Tôi cảm nhận rằng nhiều biến số sắp thay đổi trên thị trường: một bên là vốn, một bên là nhân tài — các yếu tố sản xuất cốt lõi cho AI. Nếu những biến số đó rơi vào đúng vị trí, sẽ có thể xây dựng một công ty thực thụ để làm điều này — một tổ chức được xây dựng cho AGI có thể đi từ 0 đến 1. Đó là một nhận thức lớn. Một công ty độc lập có ý nghĩa hơn, nhưng không phải điều bạn có thể làm ngay khi muốn; ChatGPT đã làm rung chuyển các biến số và tập hợp các yếu tố sản xuất lại với nhau. Bạn phải cưỡi làn sóng.

Trương Hiểu Quân: Sau khi quyết định thành lập một công ty AGI, anh đã chuẩn bị những gì? Làm thế nào anh tập hợp hai yếu tố sản xuất — vốn và nhân tài?

Dương Chí Lâm: Đó là một quá trình quanh co. ChatGPT cần thời gian để lan tỏa. Một số người biết đến nó sớm, một số muộn; một số lúc đầu nghi ngờ, sau đó bị sốc, rồi trở thành tín đồ. Tìm người và tìm tiền gắn chặt với thời điểm.

Chúng tôi bắt đầu tập trung vào vòng gọi vốn đầu tiên vào tháng 2 năm 2023. Nếu trì hoãn đến tháng 4, về cơ bản chúng tôi sẽ không còn cơ hội. Nhưng làm điều đó vào tháng 12 năm 2022 hay tháng 1 năm 2023 cũng không hiệu quả — đại dịch vẫn còn, và mọi người chưa kịp xử lý nó. Vậy nên, cửa sổ thực sự chỉ là một tháng.

Một đêm ở Mỹ, tôi đã thực hiện một phép tính chính xác. Khi hoàn tất, tôi kết luận rằng chúng tôi cần huy động ít nhất 100 triệu đô la trong vòng vài tháng. Nhiều người trên thị trường chưa bắt đầu gọi vốn, và nhiều người không tin rằng bạn có thể huy động được số tiền đó. Nhưng hóa ra điều đó là khả thi — thậm chí còn hơn thế.

Thị trường nhân tài cũng bắt đầu chuyển động. Lấy cảm hứng từ ChatGPT, nhiều người đã có nhận thức này vào tháng 3 hoặc tháng 4 năm 2023: đây là điều duy nhất đáng làm trong thập kỷ tới. Bạn phải tiếp cận đúng người vào đúng thời điểm. Một hai năm trước đó, nhân tài sẽ không tập trung ở mức độ này. Hồi đó, nhiều người đang làm AI truyền thống hoặc các mảng kinh doanh liên quan đến AI — không có cái nào là AI đa năng cả.

Trương Hiểu Quân: Tóm lại: tháng 2 là cửa sổ gọi vốn, và tháng 3, tháng 4 là cửa sổ tuyển dụng?

Dương Chí Lâm: Đại khái là vậy.

Trương Hiểu Quân: Đêm hôm đó ở Mỹ — anh đã ở đâu khi thực hiện phép tính này? Anh đã tính toán chính xác như thế nào?

Dương Chí Lâm: Từ cuối năm 2022 đến đầu năm 2023, tôi đã dành một hai tháng ở Mỹ, nói chuyện với mọi người. Tôi đã làm điều đó tại nơi tôi ở. Bạn tính toán xem mình cần bao nhiêu FLOPs, chi phí đào tạo, suy luận và số lượng người dùng.

Trương Hiểu Quân: Vào thời điểm đó, tâm trạng chung ở Thung lũng Silicon là gì?

Dương Chí Lâm: Sản phẩm bắt đầu thu hút nhiều người dùng đầu tiên, tập trung trong giới công nghệ. Bản thân chúng tôi ở trong giới đó, vì vậy chúng tôi cảm nhận rõ hơn. Tại các công ty lớn ở Thung lũng Silicon, mọi người phải viết đánh giá hiệu suất sáu tháng một lần, và nhiều người bắt đầu viết chúng bằng ChatGPT. Một số người có văn viết thường không chuyên nghiệp lắm đã nộp các bản đánh giá được viết bằng ChatGPT, và ai cũng nghe rất nghiêm túc.

Những luồng dư chấn đang nổi lên. Nhiều người đang nghĩ về công việc tiếp theo của họ hoặc về việc thành lập công ty. Khá nhiều người bạn đã nói chuyện với chúng tôi sau đó đã bắt đầu khởi nghiệp. Và có một nỗi sợ hãi bị bỏ lỡ (FOMO) mãnh liệt. Không ai có thể ngủ được. Dù là nửa đêm, 1 giờ sáng, hay 2 giờ sáng, nếu bạn liên lạc, mọi người luôn ở đó. Hơi lo lắng, hơi sợ bỏ lỡ, và rất hào hứng.

Trương Hiểu Quân: Đêm anh tính toán cần huy động 100 triệu đô la — anh đã thức khuya đến mấy giờ?

Dương Chí Lâm: Cũng ổn — bản thân việc tính toán không mất nhiều thời gian. Nhưng sau đó, tôi không thể nói với quá nhiều người. Nếu tôi nói, sẽ không ai tin rằng điều đó có thể làm được.

Phần 2

Dòng Dõi Kỹ Thuật

"Giải Phóng Bản Thân Khỏi Sự Chạm Khắc Vô Tận"

Trương Hiểu Quân: Khi giới đầu tư mạo hiểm nói về anh, họ nói: "Người sáng lập rất xuất sắc, có sức hút kỹ thuật, và đội ngũ toàn những ngôi sao kỹ thuật." Vì vậy, trước khi thảo luận về dự án mô hình nền tảng của anh, tôi muốn bắt đầu với nền tảng học thuật của anh. Anh học khoa học máy tính tại Đại học Thanh Hoa khi còn là sinh viên đại học và lấy bằng Tiến sĩ tại Trường Khoa học Máy tính của Đại học Carnegie Mellon. AI có phải luôn là trọng tâm của anh không?

Dương Chí Lâm: Tôi sinh năm 1992 và bắt đầu chương trình đại học vào năm 2011. Từ năm thứ hai đến nay — hơn một thập kỷ — tôi đã ở trong lĩnh vực này. Lúc đầu tôi khám phá một cách phân kỳ hơn, nhìn quanh khắp nơi; tôi đã làm một số công việc liên quan đến đồ thị và đa phương thức. Năm 2017, tôi tập trung vào các mô hình ngôn ngữ. Vào thời điểm đó, tôi cảm thấy mô hình ngôn ngữ là một vấn đề tương đối quan trọng; sau này tôi cảm thấy đó là vấn đề duy nhất quan trọng.

Trương Hiểu Quân: Năm 2017, ngành công nghiệp AI nói chung hiểu về mô hình ngôn ngữ như thế nào, và sự hiểu biết đó đã phát triển ra sao?

Dương Chí Lâm: Hồi đó nó là một mô hình được sử dụng để xếp hạng kết quả nhận dạng giọng nói. (Cười.) Sau khi một đoạn giọng nói được nhận dạng, bạn sẽ nhận được nhiều kết quả ứng viên, và bạn sử dụng mô hình ngôn ngữ để xem cái nào có xác suất cao nhất và đưa ra cái có khả năng nhất. Các ứng dụng của nó rất hạn chế.

Nhưng bạn nhận ra đó là một vấn đề cơ bản, bởi vì bạn đang mô hình hóa xác suất của thế giới. Ngôn ngữ là có hạn, nhưng nó là một hình chiếu của thế giới; về mặt lý thuyết, nếu bạn làm cho không gian token — không gian của tất cả các token khả thi — đủ lớn, bạn có thể xây dựng một mô hình thế giới tổng quát. Mọi thứ trên thế giới phát sinh và phát triển như thế nào đều có thể được gán một xác suất. Mọi vấn đề đều có thể được quy về cách ước tính xác suất.

Trương Hiểu Quân: Các cố vấn học thuật của anh rất nổi tiếng: cố vấn tiến sĩ của anh là Ruslan Salakhutdinov, người đứng đầu AI tại Apple, và William W. Cohen, nhà khoa học trưởng của Google AI. Cả hai đều hoạt động trong cả ngành công nghiệp và học thuật.

Dương Chí Lâm: Trong những năm trước, ngành công nghiệp và học thuật gắn kết với nhau nhiều hơn, nhưng xu hướng hiện đang thay đổi: những đột phá có giá trị hơn sẽ xảy ra trong ngành công nghiệp. Đó là một quy luật phát triển tất yếu. Nó bắt đầu với nghiên cứu khám phá và dần dần chuyển sang một quá trình công nghiệp hóa trưởng thành hơn. Điều đó không có nghĩa là nghiên cứu là không cần thiết trong quá trình công nghiệp hóa — chỉ là nghiên cứu thuần túy sẽ khó tạo ra những đột phá có giá trị.

Trương Hiểu Quân: Anh đã học được gì từ những cố vấn nổi tiếng này?

Dương Chí Lâm: Tôi học được nhiều nhất tại Google, nơi tôi thực tập trong một thời gian dài. Tôi bắt đầu làm việc trên các mô hình ngôn ngữ dựa trên Transformer vào cuối năm 2018. Bài học lớn nhất của tôi là giải phóng bản thân khỏi sự "chạm khắc" vô tận — sự cải tiến ám ảnh các chi tiết bề mặt. Điều đó rất quan trọng.

Bạn nên nhìn vào hướng đi lớn là gì, gradient lớn là gì. Khi mười con đường ở trước mặt bạn, người bình thường lo lắng về cách phanh cho một người đi bộ phía trước trên một con đường cụ thể — các chi tiết ngắn hạn. Nhưng chọn con đường nào trong mười con đường mới là điều quan trọng nhất.

Lĩnh vực này trước đây đã có chính xác vấn đề đó. Ví dụ, trên một tập dữ liệu chỉ có một hoặc hai triệu token, bạn sẽ xem xét cách đẩy perplexity xuống thấp hơn, cách đẩy loss xuống thấp hơn, cách cải thiện độ chính xác — và bạn rơi vào sự chạm khắc vô tận. Mọi người đã phát minh ra nhiều kiến trúc kỳ lạ; đó là những thủ thuật chạm khắc. Sau khi chạm khắc, bạn có thể làm tốt hơn trên loại tập dữ liệu đó, nhưng bạn bỏ lỡ bản chất của vấn đề.

Bản chất là phân tích xem lĩnh vực này đang thiếu gì. Nguyên lý đầu tiên là gì? Tại sao quy luật mở rộng (scaling law) có thể đóng vai trò là nguyên lý đầu tiên? Bạn chỉ cần tìm một cấu trúc thỏa mãn hai điều kiện: thứ nhất, nó đủ tổng quát; thứ hai, nó có thể mở rộng. Tổng quát có nghĩa là bạn có thể mô hình hóa tất cả các vấn đề trong khuôn khổ này; có thể mở rộng có nghĩa là chỉ cần bạn đổ vào đủ năng lực tính toán, nó sẽ ngày càng tốt hơn.

Đây là tư duy tôi học được tại Google: nếu một thứ gì đó có thể được giải thích bằng một thứ cơ bản hơn, bạn không nên chạm khắc quá mức ở các tầng trên. Có một câu nói quan trọng mà tôi hoàn toàn đồng ý: nếu bạn có thể giải quyết một vấn đề bằng quy mô, đừng giải quyết nó bằng một thuật toán mới. Giá trị lớn nhất của một thuật toán mới là ở chỗ nó cho phép bạn mở rộng tốt hơn. Khi bạn thoát khỏi sự chạm khắc, bạn có thể nhìn thấy nhiều hơn.

Trương Hiểu Quân: Google có phải cũng là một tín đồ của quy luật mở rộng hồi đó không? Làm thế nào họ thực hiện tư duy nguyên lý đầu tiên?

Dương Chí Lâm: Nhiều ý tưởng như vậy đã tồn tại ở đó, nhưng Google đã không thực hiện chúng đặc biệt tốt. Họ có cách suy nghĩ này, nhưng họ không thể tổ chức bản thân thành một cú moonshot thực sự. Nó giống như: ở đây có năm người theo đuổi nguyên lý đầu tiên của tôi, và ở kia năm người theo đuổi nguyên lý của họ. Không có gì từ trên xuống cả.

Trương Hiểu Quân: Trong thời gian làm tiến sĩ, anh đã xuất bản các bài báo hợp tác với những người đoạt giải Turing Yann LeCun và Yoshua Bengio — và anh là tác giả chính của những bài báo đó. Làm thế nào mà sự hợp tác đó đến được? Ý tôi là: họ là những người đoạt giải Turing và họ không phải là cố vấn của anh — anh đã dựa vào điều gì để thu hút họ?

Dương Chí Lâm: Giới học thuật rất cởi mở. Miễn là bạn có một ý tưởng tốt và một vấn đề có ý nghĩa, thì không sao cả. Những gì hai bộ não — hay n bộ não — tạo ra nhiều hơn một bộ não. Điều này cũng áp dụng khi phát triển AGI. Một chiến lược quan trọng trong AI được gọi là "ensembling" — sử dụng nhiều mô hình hoặc phương pháp khác nhau và kết hợp các dự đoán của chúng để có hiệu suất tốt hơn. Về cơ bản, nó cũng làm điều tương tự: khi bạn có những quan điểm đa dạng, bạn có thể khơi dậy nhiều điều mới mẻ. Hợp tác mang lại lợi ích to lớn.

Trương Hiểu Quân: Liệu anh có nghĩ ra một ý tưởng trước rồi sau đó hỏi họ xem họ có quan tâm không?

Dương Chí Lâm: Đại khái là vậy.

Trương Hiểu Quân: Điều nào khó hơn: thuyết phục những người nặng ký trong học thuật trong nghiên cứu, hay thuyết phục những người nặng ký về vốn trong gọi vốn? Điểm tương đồng là gì?

Dương Chí Lâm: "Thuyết phục" không phải là một từ hay — bản chất đằng sau nó là hợp tác. Hợp tác có nghĩa là cả hai bên đều thắng, bởi vì lợi ích chung là điều kiện tiên quyết cho sự hợp tác. Vậy nên thực sự không có sự khác biệt: bạn cần mang lại giá trị độc đáo cho người khác.

Trương Hiểu Quân: Làm thế nào anh có được sự tin tưởng của họ? Anh nghĩ năng khiếu của mình là gì?

Dương Chí Lâm: Không có năng khiếu đặc biệt nào cả — chỉ là làm việc chăm chỉ.

Phần 3

Hệ Thống Cũ Không Còn Hiệu Quả Nữa

"AGI Cần Một Loại Hình Tổ Chức Mới"

**

Trương Hiểu Quân: Anh vừa nói "những đột phá có giá trị hơn sẽ xảy ra trong ngành công nghiệp" — điều đó có bao gồm các công ty khởi nghiệp và các phòng thí nghiệm AI của gã khổng lồ không?

Dương Chí Lâm: Các phòng thí nghiệm là dĩ vãng. Google Brain từng là phòng thí nghiệm AI lớn nhất trong ngành công nghiệp, nhưng nó là một tổ chức nghiên cứu được nhúng bên trong một công ty lớn. Loại tổ chức đó có thể khám phá những ý tưởng mới, nhưng rất khó để nó tạo ra một hệ thống vĩ đại — nó có thể tạo ra Transformer, nhưng nó không thể tạo ra ChatGPT.

Cách mà sự phát triển ngày nay tiến hóa là bạn đang xây dựng một hệ thống khổng lồ, đòi hỏi các thuật toán mới, kỹ thuật vững chắc, và thậm chí nhiều công việc về sản phẩm và thương mại hóa. Nó giống như đầu những năm 2000: bạn không thể nghiên cứu truy xuất thông tin trong phòng thí nghiệm; nó phải sống trong thế giới thực, như một hệ thống khổng lồ, một sản phẩm có người dùng — như Google. Vì vậy, các hệ thống nghiên cứu và giáo dục sẽ chuyển đổi chức năng của chúng sang việc chủ yếu đào tạo nhân tài.

Trương Hiểu Quân: Làm thế nào anh mô tả hình thức mới của hệ thống này? OpenAI có phải là nguyên mẫu của nó không?

Dương Chí Lâm: Đó là tổ chức trưởng thành nhất của loại hình này hiện nay, và nó vẫn đang dần tiến hóa.

Trương Hiểu Quân: Vậy có thể hiểu nó là một tổ chức được thành lập vì các mục tiêu khoa học vĩ đại của nhân loại?

Dương Chí Lâm: Tôi muốn nhấn mạnh: nó không phải là khoa học thuần túy — nó là sự kết hợp của khoa học, kỹ thuật và kinh doanh. Nó phải là một tổ chức thương mại, một công ty, không phải một viện nghiên cứu. Nhưng công ty này được xây dựng từ số không lên số một, bởi vì AGI cần một loại hình tổ chức mới. Thứ nhất, phương thức sản xuất khác với thời đại internet; thứ hai, nó chuyển từ nghiên cứu thuần túy sang sự kết hợp của nghiên cứu, kỹ thuật, sản phẩm và kinh doanh.

Về cốt lõi, nó nên là một chương trình moonshot, với rất nhiều kế hoạch từ trên xuống — nhưng trong kế hoạch đó vẫn có chỗ cho sự đổi mới, bởi vì không phải tất cả công nghệ đều được định trước. Các yếu tố từ dưới lên tồn tại trong một khuôn khổ từ trên xuống. Một tổ chức như vậy chưa từng tồn tại trước đây, nhưng tổ chức phải thích ứng với công nghệ, bởi vì công nghệ quyết định phương thức sản xuất; nếu chúng không phù hợp, bạn không thể sản xuất hiệu quả. Chúng tôi tin rằng rất có thể nó sẽ cần được thiết kế lại từ đầu.

Trương Hiểu Quân: Trong cuộc đảo chính trong hội đồng quản trị của OpenAI năm ngoái, một lựa chọn cho Sam Altman là gia nhập Microsoft và lãnh đạo một đội ngũ AI mới của Microsoft. Sự khác biệt cốt yếu giữa điều đó và làm CEO của OpenAI là gì?

Dương Chí Lâm: Bạn sẽ phải phát triển một tổ chức mới bên trong một nền văn hóa cũ — và điều đó cực kỳ khó khăn.

Trương Hiểu Quân: Anh muốn xây dựng "OpenAI của Trung Quốc" — chúng ta có thể nói như vậy không?

Dương Chí Lâm: Không hoàn toàn chính xác. Chúng tôi không muốn là bất cứ thứ gì của Trung Quốc, và chúng tôi cũng không nhất thiết muốn trở thành OpenAI.

Thứ nhất, AGI thực sự chắc chắn sẽ mang tính toàn cầu. Không có thứ gì — ít nhất là về lâu dài — gọi là một công ty AGI bị giam hãm trong một thị trường khu vực nào đó vì các cơ chế bảo vệ thị trường. Toàn cầu hóa, AGI, và có một sản phẩm với cơ sở người dùng rất lớn: ba điều này cuối cùng là những điều kiện cần thiết.

Thứ hai, có nên là OpenAI không? Nếu bạn nhìn vào năm 2017–2018, OpenAI có một danh tiếng rất tệ. Khi những người trong giới của chúng tôi tìm việc, họ thường cân nhắc những nơi như Google. Nhiều người đã nói chuyện với Ilya Sutskever, nhà khoa học trưởng của OpenAI, đều nghĩ rằng người đàn ông này thật điên rồ và quá tự phụ — OpenAI hoặc là những kẻ mất trí hoặc là những kẻ lừa đảo. Nhưng họ đã cam kết rất sớm, tìm ra điều không đồng thuận, và tìm ra thứ mà bây giờ là nguyên lý đầu tiên duy nhất hiệu quả trong AI: mở rộng thông qua dự đoán token tiếp theo.

Tôi tin rằng sẽ có một công ty vĩ đại hơn OpenAI. Một công ty thực sự vĩ đại có thể kết hợp chủ nghĩa lý tưởng công nghệ với một sản phẩm tuyệt vời, cùng sáng tạo với người dùng của mình — AGI cuối cùng sẽ là thứ được tạo ra bằng cách làm việc chung với tất cả người dùng của nó. Vì vậy, nó không chỉ là về công nghệ; nó cũng đòi hỏi chủ nghĩa thực dụng và theo đuổi thế giới thực — cuối cùng, là sự kết hợp hoàn hảo của cả hai.

Tuy nhiên, chúng ta nên học hỏi từ chủ nghĩa lý tưởng công nghệ của OpenAI. Nếu ai cũng nghĩ bạn bình thường — nếu ước mơ của bạn là ước mơ mà bất kỳ ai cũng có thể có — thì nó chẳng thêm gì vào tổng thể những giấc mơ của nhân loại.

Phần 4

Bước Đi Đầu Tiên Của Moonshot Là "Ngữ Cảnh Dài" — Bước Thứ Hai Là Gì?

"Hai Cột Mốc Lớn Sắp Tới"

**

Trương Hiểu Quân: Trở lại thời điểm anh quyết định thành lập công ty — anh có bắt đầu vòng gọi vốn đầu tiên ngay sau khi trở về Trung Quốc không?

Dương Chí Lâm: Nó bắt đầu ở Mỹ vào tháng 2 (năm ngoái), một phần thực hiện từ xa. Cuối cùng, các nhà đầu tư trong nước chiếm đa số.

Trương Hiểu Quân: Vòng đầu tiên có huy động được 100 triệu đô la không?

Dương Chí Lâm: Vòng đầu tiên không nhiều như vậy; các vòng sau đã vượt quá con số đó. Chúng tôi đã hoàn tất hai vòng trong năm 2023, tổng cộng gần 2 tỷ NDT.

Đây là vòng thứ ba. Chúng tôi chưa chính thức công bố khoản tài trợ, vì vậy tôi không thể bình luận vào thời điểm này.

Trương Hiểu Quân: Một số người nói rằng kể từ nửa cuối năm 2023, không ai muốn đầu tư vào các công ty mô hình nền tảng nữa. Họ có sai không?

Dương Chí Lâm: Vẫn còn. Bạn có thể thấy sự thay đổi trong tâm lý, nhưng không phải là không ai đầu tư — ít nhất là hiện tại, có khá nhiều sự quan tâm đầu tư trên thị trường.

Trương Hiểu Quân: Ngoài vốn và con người, những quyết định quan trọng nào khác anh đã đưa ra trong năm 2023?

Dương Chí Lâm: Quyết định phải làm gì. Đó là lợi thế của các công ty như chúng tôi — có một tầm nhìn kỹ thuật cho các quyết định ở cấp cao nhất.

Chúng tôi làm ngữ cảnh dài (long context). Điều đó đòi hỏi sự phán đoán về tương lai: bạn cần biết điều gì là cơ bản và mọi thứ đang hướng tới đâu tiếp theo. Một lần nữa, đó là nguyên lý đầu tiên — quá trình "giải chạm khắc". Nếu bạn tập trung vào chạm khắc, bạn chỉ có thể nhìn vào những gì OpenAI đã làm và tìm cách tái tạo nó.

Bạn sẽ thấy rằng việc nén văn bản dài không mất mát trong Kimi mang lại cho sản phẩm một trải nghiệm độc đáo. Khi bạn đọc các bài báo tiếng Anh, nó giúp bạn hiểu chúng một cách đáng kinh ngạc. Sử dụng Claude hoặc GPT-4 ngày nay, bạn chưa chắc đã làm tốt như vậy; điều này đòi hỏi phải chuẩn bị nền tảng từ trước. Chúng tôi đã làm việc trên nó hơn nửa năm. Điều đó rất khác so với việc phát hiện ra xu hướng ngữ cảnh dài hôm nay, vội vàng tập hợp hai đội nhóm và phát triển nó với tốc độ tối đa.

Tất nhiên, cuộc đua marathon chỉ mới bắt đầu; sẽ còn nhiều sự khác biệt hóa nữa, và điều đó đòi hỏi bạn phải dự đoán trước điều gì được coi là "một điều không đồng thuận nhưng lại đúng đắn".

Trương Hiểu Quân: Quyết định này được đưa ra vào tháng mấy?

Dương Chí Lâm: Tháng Hai hoặc tháng Ba - quyết định được đưa ra ngay khi công ty được thành lập.

Trương Hiểu Quân: Tại sao ngữ cảnh dài (long context) lại là bước đầu tiên của cú đặt cược lớn (moonshot)?

Dương Chí Lâm: Bởi vì nó là nền tảng cơ bản. Nó chính là bộ nhớ của máy tính mới.

Bộ nhớ của máy tính cũ đã tăng trưởng vài bậc độ lớn trong vài thập kỷ qua, và điều tương tự sẽ xảy ra với máy tính mới. Nó có thể giải quyết nhiều vấn đề ngày nay. Ví dụ, các kiến trúc đa phương thức hiện tại vẫn cần một bộ token hóa (tokenizer), nhưng với một ngữ cảnh dài được nén không mất dữ liệu (losslessly compressed), bạn không cần nó nữa - bạn có thể đưa trực tiếp dữ liệu đầu vào thô vào. Xa hơn nữa, nó là nền tảng để làm cho mô hình tính toán mới trở nên tổng quát hơn.

Máy tính cũ có thể biểu diễn mọi thứ bằng các số 0 và 1; mọi thứ đều có thể được số hóa. Nhưng máy tính mới ngày nay chưa thể làm được điều đó - chưa có đủ ngữ cảnh, vì vậy nó chưa đủ tổng quát. Để trở thành một mô hình thế giới tổng quát (general world model), bạn cần ngữ cảnh dài.

Thứ hai, nó cho phép cá nhân hóa (personalization). Giá trị cốt lõi của AI là tương tác cá nhân hóa; giá trị cuối cùng nằm ở sự cá nhân hóa, và AGI sẽ được cá nhân hóa nhiều hơn thế hệ công cụ đề xuất (recommendation engines) trước đây.

Tuy nhiên, cá nhân hóa không đạt được thông qua tinh chỉnh (fine-tuning) - nó đạt được bằng cách hỗ trợ ngữ cảnh rất dài. Toàn bộ lịch sử tương tác của bạn với máy là một ngữ cảnh, và ngữ cảnh đó định nghĩa quá trình cá nhân hóa. Nó không thể sao chép được, và nó tạo ra những cuộc đối thoại trực tiếp hơn - những cuộc đối thoại tạo ra thông tin.

Trương Hiểu Quân: Còn bao nhiêu dư địa để mở rộng quy mô điều này?

Dương Chí Lâm: Rất lớn. Một mặt, việc mở rộng bản thân cửa sổ (window) vẫn còn một chặng đường dài phía trước - vài bậc độ lớn.

Mặt khác, bạn không thể chỉ mở rộng cửa sổ, và bạn không thể chỉ nhìn vào con số; việc cửa sổ là vài triệu token hay vài tỷ token ngày hôm nay tự nó không có ý nghĩa gì. Bạn phải nhìn vào khả năng suy luận (reasoning) mà nó cho phép trong cửa sổ đó, độ trung thực (faithfulness - fidelity to the original information), và khả năng tuân theo hướng dẫn (instruction-following ability). Bạn không nên chạy theo một chỉ số duy nhất; bạn phải kết hợp các chỉ số với năng lực.

Nếu hai khía cạnh này tiếp tục được cải thiện, bạn có thể làm được rất nhiều điều. Nó có thể tuân theo một hướng dẫn dài hàng vạn từ, và bản thân hướng dẫn đó có thể định nghĩa nhiều tác nhân AI (agents) - có tính cá nhân hóa cao.

Trương Hiểu Quân: Các công nghệ đằng sau ngữ cảnh dài và việc bắt kịp GPT-4 có thể tái sử dụng cho nhau không? Chúng có phải là một thứ không?

Dương Chí Lâm: Tôi không nghĩ vậy. Nó giống như việc thêm một chiều mới (new dimension) - một chiều mà GPT-4 không có.

Trương Hiểu Quân: Nhiều người nói rằng các công ty mô hình nền tảng (foundation-model) hàng đầu của Trung Quốc đều đang làm những điều gần như giống nhau - đuổi theo GPT-3.5 vào năm 2023, đuổi theo GPT-4 vào năm 2024. Bạn có đồng ý không?

Dương Chí Lâm: Cải thiện năng lực tổng quát chắc chắn có những cột mốc quan trọng, vì vậy nhận định đó đúng ở một mức độ nào đó - với tư cách là người đến sau, bạn chắc chắn trải qua quá trình bắt kịp. Nhưng nó cũng phiến diện. Ngoài năng lực tổng quát, còn rất nhiều không gian để phát triển các năng lực khác biệt (distinctive capabilities) và đạt đến trình độ tiên tiến nhất (state-of-the-art) trong một số hướng đi nhất định. Ngữ cảnh dài là một ví dụ. Khả năng tạo hình ảnh của DALL-E 3 hoàn toàn bị Midjourney V6 vượt mặt. Vì vậy, bạn phải làm việc trên cả hai mặt trận.

Trương Hiểu Quân: Tỷ lệ thời gian và nguồn lực dành cho năng lực tổng quát so với các chiều mới là bao nhiêu?

Dương Chí Lâm: Chúng phải được kết hợp với nhau. Một chiều mới không thể tồn tại tách rời khỏi năng lực tổng quát, vì vậy thật khó để đưa ra một tỷ lệ trực tiếp. Nhưng cần có sự đầu tư đủ lớn để làm tốt chiều mới đó.

Trương Hiểu Quân: Tất cả những chiều mới này sẽ được thực hiện trên Kimi (Kimi) phải không?

Dương Chí Lâm: Kimi chắc chắn là một sản phẩm rất quan trọng đối với chúng tôi, và chúng tôi cũng sẽ có một số thử nghiệm khác.

Trương Hiểu Quân: Bạn nghĩ gì về nhận xét của Li Guangmi, người sáng lập Shixiang, rằng sự khác biệt về công nghệ của các công ty mô hình nền tảng Trung Quốc ngày nay vẫn chưa cao?

Dương Chí Lâm: Tôi nghĩ điều đó ổn thôi - chúng tôi đã tạo ra khá nhiều sự khác biệt hóa ngày hôm nay. Vấn đề là thời gian; năm nay bạn sẽ thấy nhiều chiều hướng hơn. Năm ngoái, mọi người chỉ đang dựng giàn giáo và làm cho mọi thứ hoạt động trước.

Trương Hiểu Quân: Nếu bước đầu tiên của cú đặt cược lớn (moonshot) là ngữ cảnh dài, thì bước thứ hai là gì?

Dương Chí Lâm: Sẽ có hai cột mốc lớn phía trước. Thứ nhất, một mô hình thế giới thực sự thống nhất (truly unified world model) - một mô hình thống nhất tất cả các phương thức (modalities) khác nhau, một kiến trúc thực sự có thể mở rộng và tổng quát.

Thứ hai, cho phép AI tiếp tục tiến hóa mà không cần dữ liệu đầu vào từ con người.

Trương Hiểu Quân: Sẽ mất bao lâu để đạt được hai cột mốc này?

Dương Chí Lâm: Hai đến ba năm - có thể nhanh hơn.

Trương Hiểu Quân: Vậy ba năm nữa, chúng ta sẽ nhìn thấy một thế giới hoàn toàn khác so với ngày nay.

Dương Chí Lâm: Với tốc độ phát triển hiện tại, đúng vậy. Công nghệ hiện đang ở giai đoạn chớm nở, phát triển nhanh chóng.

Trương Hiểu Quân: Bạn có thể tưởng tượng điều gì sẽ tồn tại trong ba năm nữa không?

Dương Chí Lâm: Sẽ có một mức độ AGI nhất định. Nhiều việc chúng ta làm ngày nay, AI cũng sẽ có thể làm được - thậm chí còn tốt hơn chúng ta. Nhưng điều quan trọng là cách chúng ta sử dụng nó.

Trương Hiểu Quân: Và đối với bạn - đối với Moonshot AI với tư cách là một công ty - bước thứ hai là gì?

Dương Chí Lâm: Chúng tôi sẽ làm hai điều đó. Tất cả các vấn đề còn lại đều bắt nguồn từ hai yếu tố này. Suy luận (reasoning) và tác nhân AI (agents) mà mọi người nói đến ngày nay là sản phẩm phụ của việc giải quyết hai vấn đề này. Cần phải chạm khắc thêm một chút, nhưng không có rào cản cơ bản nào.

Trương Hiểu Quân: Liệu bạn có dồn toàn lực để bắt kịp GPT-4 không?

Dương Chí Lâm: GPT-4 là một điểm dừng chân cần thiết trên con đường đến AGI. Điều quan trọng là không được thỏa mãn với việc chỉ đơn thuần bắt kịp GPT-4. Đầu tiên, bạn phải tự hỏi đâu là sự không đồng thuận thực sự (real non-consensus) lúc này: ngoài GPT-4, điều gì tiếp theo? GPT-5 và GPT-6 nên trông như thế nào? Thứ hai, bạn phải thấy được những năng lực khác biệt nào bạn có trong đó - và điều đó quan trọng hơn.

Trương Hiểu Quân: Các công ty mô hình nền tảng khác công bố

Viết lại trong YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral