Trợ lý AI sống hay chết là nhờ tốc độ. Một trợ lý phải giải quyết được việc cho bạn, nhưng trên iMessage, nó có rất ít cách để cho bạn thấy rằng nó đang xử lý yêu cầu: một tapback, bong bóng "đang nhập", hoặc một tin nhắn ngắn.
Partyline là một kiểu trợ lý AI đặc biệt ngay trong iMessage của bạn. Chúng tôi không tập trung vào việc phân loại email: quan điểm của chúng tôi là con người vốn dĩ không nên dính dáng đến email ngay từ đầu. Mục tiêu của chúng tôi là đưa bạn ra ngoài, hòa mình cùng mọi người và tận hưởng niềm vui. Thước đo sản phẩm của chúng tôi chính là lượng thời gian sống thực sự đáng sống mà người dùng có được.
Tuy nhiên, với một trợ lý, điều đó đồng nghĩa với việc phải cạnh tranh trong một thế giới vô cùng bận rộn – nơi luôn tìm mọi cách vắt kiệt sức lực người dùng. Khiến họ chán nản và bất hạnh. Nhưng trên hết, đó là cuộc chiến giành lấy sự chú ý của họ.
Bởi vì mọi người thường nhắn tin trong những môi trường hỗn tạp, chúng tôi buộc phải nhanh. Chúng tôi chỉ có một khoảnh khắc ngắn ngủi với người dùng trước khi họ cất điện thoại đi (và họ nên làm vậy!), nên chúng tôi không muốn họ phải nhìn màn hình lâu hơn mức cần thiết dù chỉ một giây.
Khi mới xây dựng Partyline, phản hồi của chúng tôi quá chậm. Việc tìm một địa điểm hay sự kiện mất từ 29 đến 46 giây. Đó là một khoảng thời gian dài khi bạn đang đi chơi cùng bạn bè. Nếu bạn là người rút điện thoại ra để tìm chỗ tiếp theo, bạn đang đặt uy tín xã hội của mình lên bàn cân: bạn là người biết có gì đó thú vị đang diễn ra. Nhưng ở giây thứ 46, người khác đã kịp gợi ý một địa điểm và chiếm quyền dẫn dắt câu chuyện.
Vì vậy, một trợ lý iMessage bắt buộc phải cực kỳ nhanh. Một ứng dụng thông thường cho bạn toàn quyền kiểm soát màn hình khi ai đó sử dụng nó. Còn iMessage thì không: mọi người dùng nó trong những khoảnh khắc bận rộn, phức tạp, và trợ lý phải cạnh tranh với mọi thứ xung quanh họ.
So sánh hiệu năng
Chúng tôi đã so sánh Partyline với hai trợ lý cá nhân khác trên iMessage là Tomo và Instinct. Instinct chậm nhất: các kết quả tìm kiếm mất từ 42 đến 82 giây, quá chậm để dùng khi bạn đang đi chơi cùng bạn bè. Tomo lại trò chuyện cực kỳ mượt mà. Tin nhắn chat của nó đến chỉ trong vài giây, còn kết quả tìm kiếm mất từ 28 đến 37 giây, kèm theo một tapback sau khoảng 2 giây và tin nhắn đầu tiên sau khoảng 5 giây.

Từ 46 giây xuống còn 3 giây
Tomo đã đặt ra cho chúng tôi một bài toán nền tảng: làm sao để Partyline phản hồi nhanh như Tomo khi trò chuyện, nhưng áp dụng được cho cả những tác vụ lớn hơn như tìm địa điểm và sự kiện? Chúng tôi khởi đầu ở mức 29 đến 46 giây. Hôm nay, một lượt tìm kiếm chỉ mất từ 2 đến 3 giây tính từ lúc gửi đến lúc nhận phản hồi.

Hai thay đổi đã tạo nên phần lớn sự khác biệt này.
Thứ nhất, chúng tôi lập chỉ mục (index) trước các sự kiện cho những địa điểm mà mọi người hỏi nhiều nhất. Trong tuần lễ Tech Week của a16z tại San Francisco, kho dữ liệu của chúng tôi chứa khoảng 1.700 sự kiện trong tuần, và một lượt tìm kiếm sẽ thu gọn chúng thành một danh sách ngắn chỉ trong chưa đầy một phần mười giây. Ở những khu vực chưa được lập chỉ mục, hệ thống sẽ chạy tìm kiếm web song song và trả về kết quả sau vài giây.
Thứ hai, chúng tôi đưa các bộ phân loại Jev vào nhiều bước trong pipeline xử lý tin nhắn. Jev là mô hình phân loại của TypeSafe. Chỉ với một lần gọi mất khoảng 0,2 giây, nó trả lời được hàng loạt câu hỏi về một tin nhắn: đó là loại yêu cầu gì, có phải là phần tiếp nối của lượt tìm kiếm trước không, có nhạy cảm không. Jev cũng xếp hạng các sự kiện và địa điểm tiềm năng, đồng thời đối chiếu từng dòng phản hồi với dữ liệu mà nó mô tả. Trước đây, khi một mô hình lớn đảm nhiệm những quyết định này, mỗi tác vụ tốn khoảng 4 giây.

Bước tiếp theo là gì
Hiện tại, Partyline hoàn tất một câu trả lời tìm kiếm trước cả khi Tomo kịp gửi tin nhắn đầu tiên, và có thể duy trì nhiều vòng trò chuyện thoải mái trước khi Instinct kịp phản hồi một lần. Điểm trừ là một số câu trả lời đọc lên nghe giống phản hồi nhanh hơn là một cuộc trò chuyện tự nhiên. Chúng tôi đang khắc phục điều này. Nhiệm vụ tiếp theo là tinh chỉnh hệ thống hướng tới điểm cân bằng: vẫn mang lại cảm giác gần như tức thì nhưng đọc lên phải tự nhiên như đang trò chuyện.
Chúng tôi cũng đang xây dựng bộ công cụ để giữ chi phí inference ở mức hợp lý khi mở rộng quy mô, nhờ đó không phải đánh đổi tốc độ hay chất lượng để tiết kiệm chi phí.
Hôm nay, Partyline là trợ lý AI iMessage nhanh nhất thế giới, đặc biệt là trong mảng tìm kiếm sự kiện. Nếu bạn đang tham gia Tech Week của a16z tại San Francisco tuần này, hãy nhắn tin cho Partyline để trải nghiệm tốc độ tìm kiếm sự kiện nhanh nhất mà bạn từng thấy.





