YouMind
Đăng nhập

Jev không được xây dựng để tạo ra Agents

@kylejeong
TIẾNG ANH21 thg 9, 2026
126K
173
21
5
324

TL;DR

Jev là một mô hình AI chuyên dụng cho các quyết định nhanh chóng, có cấu trúc, khác biệt với các agent đa năng. Bài viết này giải thích kiến trúc, lợi thế về chi phí và khả năng tích hợp thực tế của Jev vào các quy trình làm việc phần mềm như Stagehand.

Trừ khi bạn sống trong hang động suốt tuần qua, chắc hẳn bạn đã thấy Jev từ @typesafeai.

https://x.com/CompleteSkeptic/status/2099925682726002904

Họ mô tả các mô hình của mình như sau:

Một lớp mô hình AI được xây dựng để đưa ra những quyết định nhanh chóng, có cấu trúc mà phần mềm có thể sử dụng trực tiếp. Một mô hình System One sẽ đánh giá một

trạng thái (state) và trả về câu trả lời có kiểu dữ liệu xác định cùng với xác suất.

Theo các bài kiểm tra chuẩn hóa (benchmark) của TypeSafe, Jev nhanh hơn 20-200 lần và rẻ hơn 40-400 lần so với LLM.

Nhưng tại sao điều này lại quan trọng? Chúng ta đã từng huấn luyện các bộ phân loại trước đây (tính năng tự động sửa lỗi trên điện thoại, bộ lọc Gmail, v.v.), nhưng theo Twitter thì Jev là một thứ gì đó đặc biệt.

Trong bài viết này, tôi sẽ hướng dẫn bạn hiểu Jev là gì, lý do nó tồn tại, và cách bạn có thể tích hợp nó vào các hệ thống production của mình.

Vậy chính xác thì Jev là gì?

“Hãy nghĩ về Jev như một hàm gọi trí tuệ tiên phong: đầu vào là trạng thái không cấu trúc, đầu ra là các quyết định xác suất có kiểu dữ liệu.” - TypeSafe

Jev cung cấp 3 nguyên tố cơ bản (primitives): Choice, Score, và Noul.

  • Choice là một loại câu hỏi chọn một phương án từ một tập hợp xác định (tối đa 255 phương án), trong đó câu trả lời bao gồm phương án được chọn, xác suất cho mỗi phương án và độ tin cậy.
  • Score đánh giá nội dung dựa trên các mức độ mô tả có thứ tự, trong đó câu trả lời bao gồm điểm số, xác suất cho mỗi mức độ và độ tin cậy.
  • Noul yêu cầu mô hình đánh giá một câu hỏi dạng Có/Không và trả về xác suất rằng câu trả lời là "Có".

Dưới đây là ví dụ về đầu vào và đầu ra cho một trường hợp sử dụng hỗ trợ khách hàng:

json
1// Input
2{
3 "model": "jev-latest",
4 "state": "Hi, I was charged twice for my monthly subscription. Could you refund the extra charge? My account is working fine.",
5 "questions": {
6 "department": {
7 "type": "choice",
8 "instructions": "Which team should handle this message?",
9 "criteria": {
10 "billing": "Charges, payments, subscriptions, and refunds",
11 "technical": "Bugs, errors, and broken features",
12 "account": "Login, passwords, and account access"
13 }
14 },
15 "requests_refund": {
16 "type": "noul",
17 "instructions": "Is the customer explicitly requesting a refund?"
18 },
19 "frustration": {
20 "type": "score",
21 "instructions": "How frustrated does the customer sound?",
22 "criteria": [
23 "Calm: politely describes the issue without expressing frustration",
24 "Frustrated: expresses annoyance or dissatisfaction",
25 "Very frustrated: expresses strong anger or threatens to leave"
26 ]
27 }
28 }
29}
30// Output
31{
32 "model": "jev-1.13.0",
33 "answers": {
34 "department": {
35 "type": "choice",
36 "choice": "billing",
37 "confidence": 1,
38 "probabilities": {
39 "technical": 0,
40 "account": 0,
41 "billing": 1
42 }
43 },
44 "requests_refund": {
45 "type": "noul",
46 "noul": 0.99
47 },
48 "frustration": {
49 "type": "score",
50 "score": 0,
51 "legend": {
52 "0": "Calm: politely describes the issue without expressing frustration",
53 "1": "Frustrated: expresses annoyance or dissatisfaction",
54 "2": "Very frustrated: expresses strong anger or threatens to leave"
55 },
56 "confidence": 1,
57 "probabilities": {
58 "0": 1,
59 "1": 0,
60 "2": 0
61 }
62 }
63 },
64 "usage": {
65 "input_tokens": 442,
66 "output_tokens": 72
67 },
68 "request_id": "playground_12bbfa4198be5ca4de9818a45c0906a2055",
69 "evaluation_time_ms": 163.01120699790772
70}

Tôi khuyên bạn nên trải nghiệm quá trình làm quen với dashboard onboarding của họ để hiểu rõ hơn về cách trạng thái (state) và các câu hỏi phối hợp với nhau để tạo ra kết quả đầu ra.

Chẳng phải đây chỉ là một bộ phân loại sao?

Vừa đúng vừa sai. Nó giống như nếu một LLM và một bộ phân loại sinh ra một đứa con vậy.

Các bộ phân loại truyền thống rất tốt cho các tác vụ khối lượng lớn với hệ thống phân loại cố định. Hãy nghĩ đến LeNet-5 có khả năng nhận diện chữ số nào được biểu diễn trong một hình ảnh. Tuy nhiên, các bộ phân loại thường cực kỳ chuyên biệt và phụ thuộc vào lĩnh vực cụ thể. LLM giỏi trong việc tạo ra chuỗi văn bản. Chúng linh hoạt và tuyệt vời cho các tác vụ mở được xác định lúc chạy (runtime), nhưng chúng cũng chậm hơn (so với bộ phân loại), đắt đỏ hơn và kém dự đoán được hơn.

Jev là một “mô hình nền tảng cho việc phân loại”, kết hợp tính linh hoạt ngôn ngữ tự nhiên của một LLM với đầu ra xác suất, có ràng buộc của một bộ phân loại. Bạn có thể hoàn thành nhiều loại tác vụ khác nhau mà không cần phải huấn luyện một mô hình mới, đồng thời vẫn duy trì sự chuyên môn hóa trên nhiều lĩnh vực khác nhau (code, văn bản, log, trạng thái UI, sự kiện, v.v.). Jev cũng có thể tạo ra đầu ra song song, điều này khiến nó nhanh hơn nhiều so với LLM vốn bị giới hạn bởi việc tạo chuỗi tuần tự.

TL;DR: Đây thực sự là một bộ phân loại tổng quát thông minh.

Tại sao Jev tồn tại?

CEO và đồng sáng lập của TypeSafe, Diogo Almeida, đã dành thời gian tại OpenAI để giúp tạo ra RLHF (học tăng cường từ phản hồi của con người) và sản phẩm ChatGPT. RLHF cho phép chúng ta huấn luyện LLM để trở nên rất giỏi trong việc tuân theo các chỉ dẫn và prompt, phù hợp với bản chất tự hồi quy (autoregressive) của chúng.

Sau đó, anh ấy rời OpenAI để thành lập TypeSafe và huấn luyện một lớp mô hình khác nhằm kích hoạt phần mềm ứng dụng AI, thay vì các agent. Jev được huấn luyện bằng RLCD (học tăng cường từ các quyết định được hiệu chỉnh), thuật ngữ nghiên cứu này có nghĩa là họ huấn luyện mô hình để trở nên rất giỏi trong việc xuất ra độ tin cậy và xác suất thay vì chỉ là câu trả lời.

TypeSafe tin rằng phần mềm nên có trí tuệ. Các agent không dễ dàng hòa nhập vào cách phần mềm vận hành trong lịch sử, và cơ chế human-in-the-loop (con người giám sát vòng lặp) khiến việc tạo ra phần mềm vừa thông minh VỪA tự chủ trở nên khó khăn. Jev là một bước tiến towards trí tuệ như một nguyên tố cơ bản có thể ghép nối và đáng tin cậy bên trong các hệ thống phần mềm.

Đây không phải là một ý tưởng hoàn toàn mới, các nhà nghiên cứu năm 2017 đã phát hiện ra rằng độ chính xác dự đoán cao không có nghĩa là ước lượng độ tin cậy đáng tin cậy (vì vậy LLM không phải là giải pháp hoàn hảo ở đây).

Tại sao chọn RLCD thay vì RLHF?

Vấn đề với RLHF là những gì con người muốn không phải lúc nào cũng đúng đắn một cách khách quan. Chỉ vì chúng ta thích một câu trả lời nhất định dưới một định dạng nhất định không có nghĩa là các mô hình trở nên thông minh hơn, mà chỉ là dễ chịu hơn khi làm việc cùng.

Nó cũng gây ra hiện tượng sụp đổ chế độ (mode collapse), RLHF khiến LLM hội tụ về một câu trả lời duy nhất trong khi đôi khi nhiều quỹ đạo đều có thể coi là “đúng”.

“Một đầu ra có thể hấp dẫn đối với con người mà không đủ đáng tin cậy cho tự động hóa không giám sát. Sở thích của con người và độ tin cậy của máy móc là các mục tiêu tối ưu hóa khác nhau.”

Kyle Jeong - inline image

Hiện tượng sụp đổ chế độ qua Tài liệu của Jev

Jev KHÔNG được thiết kế để xây dựng agents

Trái ngược với những gì bạn thấy khắp nơi trên dòng thời gian của mình, Jev không hề giỏi khi hoạt động như một agent độc lập. Chúng tôi đã thử xây dựng các phiên bản của nó, cả chỉ dùng Jev lẫn kết hợp LLM + Jev.

https://x.com/kylejeong/status/2100622054945095934

Thật lòng mà nói, các agent Jev tạo ra những demo rất ấn tượng. Đã có vô số người dùng Jev để thực hiện các tác vụ của agent với tốc độ chớp nhoáng. Nhưng ngay cả những demo tốt nhất cũng chưa sẵn sàng để triển khai vào production.

Một mô hình như Jev được dành cho phần mềm ứng dụng AI, nó có thể giúp bạn đưa ra các quyết định được ghép nối trong code xác định (deterministic code). Nếu không có khả năng suy luận hoặc tạo sinh, việc sử dụng nó như một agent độc lập chỉ là sự thiếu hiểu biết.

Kyle Jeong - inline image

Phần mềm ứng dụng AI

Thay vì để Jev trở thành một agent sử dụng máy tính độc lập, nó nên được sử dụng trong định tuyến hỗ trợ khách hàng, xử lý hóa đơn, cảnh báo bảo mật và phân loại sự cố, hoặc như một công cụ giám sát agent.

Những con số

Mô hình đầu tiên của họ, Jev 1.13.0, có chi phí $42/btok (hoặc $0.042/mtok) cho input và $0 cho output tokens. Để tham khảo, Fable 5.1 có giá $10/mtok cho input, tương đương $10,000 / Btok. Các khối lượng công việc doanh nghiệp điển hình có tỷ lệ input-output tokens là 3:1 hoặc 4:1, vì vậy Fable lên tới khoảng ~ $20,000/Btok (với output $50/mtok).

Cửa sổ ngữ cảnh (context window) là 64k tokens mỗi yêu cầu, trong đó trạng thái (state) + câu hỏi dài nhất phải vừa vặn trong 32k tokens.

Tuy nhiên, trong các bài kiểm tra chuẩn hóa nội bộ, họ vượt trội hơn tất cả các mô hình về độ chính xác/chi phí & độ chính xác/tốc độ so với OpenAI, Anthropic và Deepseek (thông qua Fireworks để suy luận).

Kyle Jeong - inline image

Độ chính xác/chi phí

Nói đủ rồi, làm thế nào để sử dụng nó?

Bạn giờ đây đã có đủ hiểu biết về Jev để nghĩ ra một vài trường hợp sử dụng bất kể bạn đang làm việc trên cái gì. (Nếu chưa, đây là danh sách các trường hợp sử dụng được TypeSafe khuyến nghị).

Thay vì giới hạn sự sáng tạo của bạn về cách nên sử dụng nó, tôi sẽ cho bạn thấy cách chúng tôi đã tích hợp Jev vào framework Stagehand của mình.

Trong 2 năm qua, Stagehand đã phát triển như một framework để AI và Agents điều khiển một trình duyệt từ xa. Trước khi các agent đủ tốt, chúng tôi đã tạo ra các nguyên tố AI Act (hoàn thành một hành động), Extract (trích xuất dữ liệu có cấu trúc), và Observe (khám phá các hành động tiềm năng trên trang) để giúp các nhà phát triển viết các script tự chữa lành (self-healing) để tự động hóa web.

Thay vì sử dụng Playwright (hoặc các framework cũ khác) và phải phân tích thủ công DOM để cung cấp các selector trong các hành động, Stagehand A/E/O cho phép bạn sử dụng ngôn ngữ tự nhiên để xây dựng các quy trình tự động.

typescript
1// Playwright
2await page.click('button[type="submit"]');
3
4// Stagehand
5stagehand.act("click the submit button")

Điều này hữu ích khi viết script lần đầu (tốc độ phát triển nhanh hơn nhiều), nhưng đặc biệt hữu ích cho việc bảo trì script. Nếu một trang web thay đổi và các selector DOM cập nhật, thì các script Playwright phải được viết lại để khớp với trang mới. Stagehand chọn các selector và hành động lúc chạy (at runtime), và chúng “tự chữa lành”.

Bạn có thể thấy chúng tôi đang đi đến đâu. Jev phù hợp cực kỳ tốt với các nguyên tố cơ bản này. Ban đầu, chúng tôi sử dụng một LLM (được cung cấp ngữ cảnh về giao diện trang và mục tiêu) để quyết định phải làm gì. Với Jev, chúng tôi có thể sử dụng Choice để quyết định tương tác với selector nào.

Hãy dùng cụ thể Act để thảo luận về luồng hoạt động. Thông thường, chúng tôi sẽ cung cấp cho LLM một biểu diễn cô đọng của trang bằng cách sử dụng cây truy cập (a11y-tree) lai. Với Jev, trước tiên chúng tôi đánh dấu các nút trong cây a11y là có thể tương tác (kể cả các trình soạn thảo rich-text) hoặc không.

Khi stagehand.act được gọi:

  • Jev phân loại chỉ dẫn thành một hành động (như click, fill, hoặc scroll)
  • Stagehand phân tích các tham số và xây dựng danh sách ứng viên cho hành động đó (bao gồm cả ngữ cảnh trang lân cận)
  • Jev trả lời “ứng viên nào là tốt nhất” và “có ứng viên nào khớp không” với ngưỡng chấp nhận là 0.7
  • Nếu hành động ứng viên được chấp nhận, Stagehand sẽ xử lý việc thực thi
  • Nếu hành động không được chấp nhận, Stagehand sẽ quay lại sử dụng LLM
Kyle Jeong - inline image

Luồng Act

Trong các thử nghiệm ban đầu, độ trễ trung vị của Act giảm từ 1.97 giây xuống còn 0.46 giây, tức là nhanh hơn khoảng 4.3 lần (hoặc giảm 77% thời gian). Xem toàn bộ stack PR.

Với việc sử dụng máy tính, Jev là một mảnh ghép nhưng không phải là giải pháp độc lập. Giờ đây chúng tôi có thể xây dựng các công cụ phần mềm xác định hơn mà các agent có thể sử dụng.

Kyle Jeong - inline image

Khi nào nên sử dụng Jev

Phổ biến AI trong thế giới thực

Liệu Jev có xây dựng được các agent sử dụng máy tính đạt chuẩn production không? Không. Nó có phải là một mảnh ghép hữu ích không? Tôi nghĩ là có.

Có cảm giác như có vô số ý tưởng mà trước đây không khả thi thì nay đã trở nên hợp lý nhờ Jev. Tôi đã thấy mọi người xây dựng tìm kiếm tức thì, sao chép dán thông minh, và nhiều công cụ đơn giản nhưng cực kỳ hữu ích khác.

AI không nên bị giới hạn trong một phiên bản nào đó của giao diện chat, dù là đồng bộ hay bất đồng bộ. Với các mô hình như Jev, chúng ta có thể xây dựng phần mềm tích hợp các mô hình dự đoán mà không cần hộp nhập chat. Mặc dù các bộ phân loại đã có mặt từ lâu, nhưng chưa bao giờ chúng cảm thấy hữu ích như vậy. Có lẽ tất cả những gì chúng ta cần để xây dựng chỉ là nguồn cảm hứng.

-> Kyle

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral