นี่คือสรุปแบบ ELI5 (อธิบายให้เด็ก 5 ขวบเข้าใจ)
คิดแบบ AI ทำข้อสอบปรนัย ไม่ใช่ AI เขียนเรียงความ
มันไม่ได้แชท มันตัดสินใจเพื่อให้ซอฟต์แวร์ของคุณนำไปปฏิบัติต่อได้: "เป็นสแปมหรือไม่?" "Agent ตัวนี้ควรใช้เครื่องมือไหน?" "เรื่องนี้ต้องให้มนุษย์จัดการไหม?"
จุดที่น่าตื่นเต้น: เร็วกว่า LLM ระดับแนวหน้าประมาณ 200 เท่า และถูกกว่า 400 เท่า ใน benchmark workflow ของ TypeSafe เอง โดยใช้เวลาตอบสนองเพียงเสี้ยววินาที
ทำไมถึงทรงพลัง: ลองนึกภาพแอปหรือ agent ที่ต้องตัดสินใจย่อยๆ หลายร้อยครั้ง โดยไม่ต้องสนทนาที่ยาวนานและแพงกับ LLM หลายร้อยรอบ
เก็บโมเดลขนาดใหญ่ไว้สำหรับงานคิดหนักและเขียน ใช้ Jev สำหรับตัดสินใจอย่างรวดเร็วในระหว่างนั้น
อ้อ และมันถูกสร้างโดย Diogo Almeida ผู้ร่วมสร้าง ChatGPT และหนึ่งในผู้ร่วมประดิษฐ์ RLHF ซึ่งใช้เวลาสองปีพัฒนาอย่างลับๆ
นั่นคือคำโฆษณา นี่คือหลักฐานที่ตรวจสอบแล้ว
การกวาดข้อมูลผ่าน /last30days เก้าครั้ง อ่านไฟล์ดิบทั้งหมดครบถ้วน และตรวจสอบโพสต์ใหญ่ทุกอันด้วยมือเทียบกับหน้าเว็บจริง โพสต์เปิดตัวได้รับ 66K ไลก์ และ 31.4M การดู ภายในสองวัน
https://x.com/CompleteSkeptic/status/2099925682726002904
Browser agent ที่สร้างบน Jev ได้รับ 1.8M การดูในวันเดียว นักพัฒนาคนหนึ่งคำนวณบิลของเขา: ประมาณ 5,000 คำขอ คิดเป็นเงินราวสองดอลลาร์ ครอบคลุมงาน classification, model routing, intent และ steering
https://x.com/MichaelLee04/status/2100003037150683593
ผมไม่ได้รัน workflows เหล่านี้เอง ผมมุ่งเน้นการวิจัยไปที่ชุมชนและจัดอันดับสิ่งที่ผู้คนกำลังใช้งานจริง จาก 31 candidate workflows ที่มีแหล่งที่มาชัดเจนและมีตัวเลขจริง นี่คือ 9 อันที่คุ้มค่าแก่การลอกเลียนแบบ พร้อม payload ให้คัดลอกไปใช้ได้เลย
🧠 กลไกการทำงาน ในหกสิบวินาที
คุณส่ง state ของแอปพร้อมคำถามที่มี type ชัดเจน แล้วมันจะส่งคำตอบที่เป็น decision แบบมี type กลับมาพร้อมค่า probability ไม่ต้อง prompt เป็น JSON ไม่ต้องมี parsing layer ไม่ต้อง validate อะไรทั้งนั้น
มีสามประเภทคำถาม นั่นคือทั้งหมดของ interface: \Choice\ เลือกหนึ่งจากตัวเลือกสูงสุด 255 รายการ, \Score\ จัดวางสิ่งต่างๆ บนสเกล, \Noul\ ตอบใช่หรือไม่ใช่เป็นตัวเลขตั้งแต่ 0 ถึง 1 ทุกคำตอบมี \probabilities\ และคะแนน \confidence\ ถามยี่สิบคำถามเกี่ยวกับ state เดียวกันในการเรียกหนึ่งครั้ง และมันจะประเมินผลแบบขนาน ดังนั้นยี่สิบคำถามจึงมีค่าใช้จ่ายใกล้เคียงกับหนึ่งคำถาม Input มีราคา $0.042 ต่อล้าน tokens Output ฟรี
ชุมชนเห็นตรงกันกับ framing ใน tweet ของผม แต่เข้าถึงคนมากกว่ามาก: LLMs generate answers, Jev makes decisions, 2,278 ไลก์
ตัวเลขพาดหัวของผมมาพร้อมกับหมายเหตุ TypeSafe ระบุเวลาตอบสนองอยู่ที่ 70 ถึง 500 milliseconds และเร็วกว่าโมเดลระดับแนวหน้า 40x ถึง 200x คู่ตัวเลขที่แน่นอนบนหน้าโฮมเพจของพวกเขา จาก evals ของ workflow พวกเขาเอง คือ เร็วกว่า 193.6x และถูกกว่า 444.6x สิ่งสำคัญคือ baseline ที่ใช้วัดเปรียบเทียบ:
ดังนั้น นี่คือหน้าโฮมเพจของพวกเขา และสิ่งแรกที่พวกเขาแสดงให้คุณเห็นคือการเปรียบเทียบเคียงข้างกับ GPT-5 X Terra หนึ่งในโมเดลระดับกลางของ OpenAI
- Nimrod, YouTube, 13,747 views
ชื่อไม่ใช่การอ้างอิงถึง Kahneman แม้ว่าจะเรียกคลาสของโมเดลว่า System One ก็ตาม
นี่คือที่มาของชื่อ Jev จริงๆ และมันไม่ใช่ Kahneman แต่เป็นนักเศรษฐศาสตร์ในศตวรรษที่ 19 ชื่อ William Stanley Jevons
- Dots and Arrows, YouTube, 14,597 views
Jevons paradox: ทำให้ทรัพยากรถูกลง คนก็จะบริโภคมันมากขึ้นอย่างมาก การตั้งชื่อโมเดลตัดสินใจของคุณตามแนวคิดนี้คือการประกาศจุดยืน
มันยังเป็นมุกด้วย Rob Shocks ตัดคลิป "My name is Jeff" ใน บทวิเคราะห์ที่มี 231,655 views ของเขา และคอมเมนต์ยอดนิยมที่มี 142 ไลก์ คือ "My name is Jev killed me." Diogo ได้ ตอบกลับมุกตลกเหล่านี้ด้วยตัวเอง, 129 ไลก์
1. 🌐 Browser agent ที่ค้นหาเที่ยวบินได้ใน 7 วินาที ด้วยราคา $0.0039
คืออะไร. Browser agent โอเพนซอร์สขนาดเล็กที่ Jev เลือกคลิกถัดไป และ LLM ขนาดเล็กจะทำงานเฉพาะเมื่อจำเป็นต้องพิมพ์เท่านั้น
ใครใช้งาน. Gregor Zunic ผู้ก่อตั้ง Browser Use 7.2K ไลก์, 1.8M views, 7.6K bookmarks เขาระบุในโพสต์ว่าวิดีโอเล่นด้วยความเร็ว 1x
https://x.com/gregpr07/status/2100411066966749359
ทำไมถึงได้รับเลือก. มันเป็นสิ่งที่มีการดูมากที่สุดที่ใครก็ตามสร้างขึ้นบนโมเดลนี้ และเป็นตัวอย่างที่ชัดเจนที่สุดของรูปแบบที่ชนะเสมอ: action space ใหม่ในทุกขั้นตอน, DOM เป็น state, Jev เลือกจาก candidates, generation เป็นเพียง fallback เท่านั้น บทความของ LangChain เองระบุว่า Kyle Jeong ที่ Browserbase กำลังทำสิ่งเดียวกันด้วยต้นทุนเพียงเศษเสี้ยวของเซนต์
Payload คือ repo: browser-use/jev-ultrafast. Clone มันก่อนที่คุณจะเขียนของตัวเอง
2. 🧹 Compaction ทันที: ให้คะแนนทุก tool call และทิ้งขยะ
คืออะไร. แทนที่ summarization prompt ที่ coding agent ทุกตัวรันเมื่อถึงขีดจำกัด context ด้วย Jev pass ที่ให้คะแนน relevance ของแต่ละ tool call และลบส่วนที่ไม่จำเป็นออก
ใครใช้งาน. Tamara Tran ตั้งคำถามและปล่อยคำตอบออกมาในช่วงบ่ายวันเดียวกัน 5K ไลก์, 554.4K views
https://x.com/tamarajtran/status/2100694549362553153
Alex Volkov รันมันในฐานะ Claude plugin และโพสต์ตัวเลข: หนึ่งวินาทีเพื่อลด session จากเกือบ 1M tokens เหลือ 86K 1.9K ไลก์, 3.5K bookmarks
https://x.com/altryne/status/2100739055923425589
ทำไมถึงได้รับเลือก. เพราะคำตอบของ Diogo คือสัญญาณบอกทิศทางที่จะไป 304 ไลก์
https://x.com/CompleteSkeptic/status/2100702845779775675
ถ้า harness สามารถให้คะแนนและตัดทิ้งได้ในหนึ่งวินาทีแทนที่จะ summarize, context window จะหยุดเป็นข้อจำกัดที่คุณต้องออกแบบรอบๆ นี่คือการเลือกแบบ sleeper pick Browser Use ดีกว่าในด้านวิดีโอ; compaction คือสิ่งที่ผู้ใช้ coding-agent ทุกคนรู้สึกได้ทันที
วางสิ่งนี้ลงใน Claude Code ซึ่งเป็นบรรทัด install ของ Alex อย่างแน่นอน:
1Install, and configure: https://github.com/tamaratran/fast-jev-compaction
3. 🛡️ Safety reviewer แยกออกมาจาก harness
คืออะไร. Coding harness ทุกตัวรัน classifier ที่ถามว่า "คำสั่งนี้ควรถูก execute หรือไม่?" ก่อนที่ auto mode จะอนุญาต จนกระทั่งสัปดาห์นี้ classifier นั้นอยู่ในส่วนปิดของผลิตภัณฑ์
ใครใช้งาน. Vercel, ใน production Guillermo Rauch: โหมดเริ่มต้นใน fx คือ auto โดยมี safety reviewer วิเคราะห์ทุกคำสั่ง และ Jev เร็วกว่าถึง 18x ที่ p95 และแม่นยำกว่าโมเดลที่ใช้อยู่ในปัจจุบัน 3.7K ไลก์, 392.4K views
https://x.com/rauchg/status/2100307962262872105
https://x.com/fazxes/status/2100300097695232164
ทำไมถึงได้รับเลือก. เพราะเป็นการ migration ใน production ที่มีตัวเลข p95 กำกับอยู่ และเพราะ LangChain ปล่อยเวอร์ชันโอเพนซอร์สในวันถัดไปในชื่อ \AutoModeMiddleware\. บทวิเคราะห์ของ Rob Shocks, 231,655 views และ 3,526 ไลก์ คือสิ่งที่คุณควรส่งให้เพื่อนร่วมงานที่ต้องการเรื่องราวภายในสิบนาที
เวอร์ชัน LangChain, คัดลอกจากโพสต์ของพวกเขาโดยตรง:
1from langchain.agents import create_agent2from langchain_typesafe.experimental.middleware import (3 AutoModeMiddleware,4)56guardrail = AutoModeMiddleware(tools=["bash"])78agent = create_agent("openai:gpt-5.6-luna", middleware=[guardrail])
4. 🚦 Model routing ในฐานะ middleware ไม่ใช่ system prompt
คืออะไร. วาง Jev ไว้ข้างหน้า fleet ของโมเดลของคุณและปล่อยให้มันเลือกสมองที่จะจัดการแต่ละคำขอ โดยคง probabilities ไว้ใน agent state เพื่อให้คุณสามารถ audit การเลือกได้
ใครใช้งาน. LangChain, ในบทความ "Building a Harness with Jev" โดย Sydney Runkle 232 ไลก์, 31.1K views และเป็นคู่มือ how-to-wire-it ที่สะอาดตาที่สุดที่ใครเคยเผยแพร่
https://x.com/sydneyrunkle/status/2100754364545761643
ทำไมถึงได้รับเลือก. Model routing เป็นงานที่ถูกอ้างถึงมากที่สุดสำหรับโมเดลนี้ใน corpus ทั้งหมด; มันเป็นหนึ่งในห้า workloads ในโพสต์เรื่อง 5,000 requests for $2 ด้านบนของบทความนี้ LangChain เปลี่ยนมันจากย่อหน้าใน system prompt ให้กลายเป็นสิบเอ็ดบรรทัดที่คุณอ่านได้ง่าย
1from langchain.agents import create_agent2from langchain_typesafe.experimental.middleware import (3 ModelChoice,4 ModelRouterMiddleware,5)67router = ModelRouterMiddleware(8 choices={9 "fast": ModelChoice(10 model="openai:luna",11 criteria="Direct lookups, extraction, and localized changes.",12 ),13 "powerful": ModelChoice(14 model="openai:sol",15 criteria="Architecture and high-stakes decisions.",16 ),17 },18 instructions="Choose the least costly model that can complete the task.",19)2021agent = create_agent("openai:gpt-5.6-luna", middleware=[router])
ติดตั้งด้วย \pip install langchain-typesafe\ และตั้งค่า \TYPESAFE_API_KEY\
5. 🔎 ความแม่นยำของ RAG: retrieve ตามปกติ จากนั้นลบสิ่งที่ไม่เกี่ยวข้องออก
คืออะไร. เก็บ retriever ของคุณไว้เหมือนเดิมทุกอย่าง รัน Jev ผ่านทุก chunk ที่มันส่งกลับมาด้วยคำถาม yes-or-no เพียงข้อเดียว และลบอันที่ไม่ผ่านออก
ใครใช้งาน. Kush Bhuwalka สรุปไว้ในประโยคเดียว: รัน Jev บน chunks ทั้งหมดที่ retrieve มาและลบอันที่ไม่เกี่ยวข้องออก 416 ไลก์
https://x.com/kushbhuwalka/status/2100731050075050485
ทำไมถึงได้รับเลือก. Precision เป็นครึ่งหนึ่งของ RAG ที่ยังไม่ได้รับการแก้ไขมานาน เพราะวิธีแก้คือการทำอีก LLM call ต่อ chunk ซึ่งไม่มีใครสามารถแบกรับต้นทุนได้ที่ retrieval time เมื่อ output tokens ฟรีและ latency ต่ำกว่าหนึ่งวินาที การตัดสินต่อ chunk ถูกกว่า embedding lookup ที่สร้าง chunk นั้นขึ้นมา ผมเขียนอันนี้ขึ้นเองโดยอิงจาก API ที่มีการบันทึกไว้ ในรูปแบบที่ Kush อธิบาย:
1from typesafe_sdk import Noul, TypeSafeClient23client = TypeSafeClient()45kept = []6for chunk in retrieved_chunks:7 verdict = client.system_one(8 state={"question": user_question, "chunk": chunk.text},9 questions={10 "relevant": Noul(11 instructions="The chunk contains information needed to answer the question",12 ),13 },14 )15 if verdict.answers["relevant"].noul > 0.5:16 kept.append(chunk)
6. 🎮 Real-time loops: Minecraft, Doom, และ launcher ที่อ่านใจคุณ
คืออะไร. การตัดสินใจภายใน loop ที่รันหลายครั้งต่อวินาที ซึ่งโมเดลระดับแนวหน้าไม่สามารถมีส่วนร่วมได้เลย
ใครใช้งาน. Wuyang Zhou ให้ Jev และ GPT-6 Astra เล่น Minecraft ร่วมกัน โดย Jev ดูแลปฏิกิริยาตอบสนองอย่างรวดเร็วและ Astra วางแผนล่วงหน้า ต่อสู้กับ zombie หลายตัวพร้อมกัน 374 ไลก์, 51.4K views
https://x.com/wuyang_zhou/status/2100727660875808913
Nader Dabit สร้าง keystroke oracle: พิมพ์ "the pdf I just downloaded" และ PDF ล่าสุดจะเป็นผลลัพธ์แรกทันที ด้วย confidence เต็มเปี่ยม ในทุก keystroke ภายในประมาณ 100 milliseconds 264 ไลก์
ทำไมถึงได้รับเลือก. Launch demo ของ TypeSafe เองคือ Doom โดยถามโมเดลว่าควรทำอะไรประมาณสิบครั้งต่อวินาที สอง explainer ที่เป็นอิสระต่อกันคำนวณต้นทุนของ loop นี้ได้เท่ากัน:
Jev กำลังเล่นแบบ real time ประมาณ 10 การตัดสินใจต่อวินาที ซึ่งคิดเป็นประมาณ $7 ต่อชั่วโมง
- AI WITH Rithesh, YouTube, 19,904 views
สิบการตัดสินใจต่อวินาทีในราคาเจ็ดดอลลาร์ต่อชั่วโมงทำให้มันอยู่ในหมวดหมู่ที่ต่างจาก LLM อย่างสิ้นเชิง และการแบ่งหน้าที่ใน Minecraft (โมเดลเร็วตอบสนอง ขณะที่โมเดลช้าวางแผน) เป็นรูปแบบที่การเลือกแบบ real-time ทั้งหมดในรายการนี้ใช้ร่วมกัน
7. 📬 Email triage ในระดับ batch
คืออะไร. ชี้ Jev ไปที่ export ของ inbox และให้มันจัดเรียง ให้คะแนน และ flag ข้อความทั้งหมดแบบขนาน
ใครใช้งาน. ช่อง vogel channel บน YouTube, 60,996 views และ 526 ไลก์, รันอีเมล export 1,500 ฉบับใน batches ละ 100 ฉบับโดยใช้ 8 workers บทความของ LangChain ระบุชื่อ Ryan Vogel เป็นหนึ่งในสามโปรเจกต์ที่พวกเขากำลังจับตาอยู่ Syntax, 33,933 views และ 1,052 ไลก์, สร้างสิ่งเดียวกันบวกกับ home automation demo ที่เปลี่ยนจากคำถามเป็น API call ใน 300 milliseconds
ทำไมถึงได้รับเลือก. มันเป็น demo ที่ถูกคัดลอกมากที่สุดใน corpus และการคำนวณ throughput คือประเด็นหลัก
เรามีเงินเหลือแค่ $5 ตรงนี้ ซึ่งแสดงให้เห็นว่าโมเดลนี้ราคาถูกแค่ไหน
- vogel, YouTube, 60,996 views
นี่คือ quickstart ของ TypeSafe เอง คัดลอกจากเอกสาร และมันเป็น email triage pipeline อยู่แล้ว:
1pip install typesafe-sdk
1from typesafe_sdk import Choice, Noul, Score, TypeSafeClient23client = TypeSafeClient()45response = client.system_one(6 state="Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP.",7 questions={8 "department": Choice(9 instructions="Which team should handle this",10 criteria={11 "billing": "Payment or subscription issues",12 "technical": "Bugs or integration problems",13 "sales": "Pricing or account questions",14 },15 ),16 "frustration": Score(17 instructions="How frustrated the customer appears",18 criteria=[19 "Calm, just stating facts",20 "Frustrated but civil",21 "Very angry, strong language",22 ],23 ),24 "is_urgent": Noul(25 instructions="The message conveys urgency or time-sensitivity",26 ),27 },28)2930print(response.answers["department"].choice)31print(response.answers["frustration"].score)32print(response.answers["is_urgent"].noul)
8. 🗂️ Map-reduce บนเอกสาร: 777 การตัดสินใจในราคาหนึ่งในสี่ของเซนต์
คืออะไร. ชุดคำถามหนึ่งชุด เอกสารทุกฉบับ ทั้งหมดพร้อมกัน Workload ที่เคยเป็นไปไม่ได้ทางเศรษฐกิจกับโมเดลระดับแนวหน้าและทำได้ไม่ดีนักกับ classical classifiers
ใครใช้งาน. Mike Taylor หัวหน้าฝ่าย evals ที่ Every รันการทดสอบที่สะอาดตาที่สุดที่ใครเคยเผยแพร่: บทความของเขาเอง 27 ชิ้น บวกกับคู่เทียบสไตล์ AI อีก 10 ชิ้น คำถามละ 21 ข้อ ทั้งหมดใน request เดียว 777 judgments ในเวลาน้อยกว่า 0.7 วินาที คิดเป็นราคาประมาณหนึ่งในสี่ของเซนต์ ในการทดลองทั้งหมดสิบเอ็ดครั้งของเขา 1,709 judgments คิดเป็นราคาน้อยกว่าหนึ่งเซนต์ AI Daily Brief, 10,000 views, หยิบตัวเลขนี้ขึ้นมาในวันเดียวกัน
ทำไมถึงได้รับเลือก. TypeSafe ระบุสิ่งนี้เป็น first-party category, "AI Map Reduce over Big Data," ใน use-case map ของพวกเขา Output tokens ฟรีเปลี่ยนการคำนวณสำหรับทุกอย่างที่คุณรันต่อแถว รูปแบบ HTTP ดิบ จากเอกสาร มีขนาดเล็กพอที่จะใส่ที่นี่:
1{2 "model": "jev-latest",3 "state": "Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP.",4 "questions": {5 "is_urgent": {6 "type": "noul",7 "instructions": "The message conveys urgency or time-sensitivity"8 }9 }10}
ซึ่งจะส่งคืน \{"is_urgent": {"type": "noul", "noul": 0.999}}\ ยี่สิบคำถามใน object \questions\ มีค่าใช้จ่ายใกล้เคียงกับหนึ่งคำถาม ดังนั้นจงถามทุกอย่างที่คุณต้องการรู้ต่อแถวในการเรียกหนึ่งครั้ง
9. 🧪 Jev ในเบราว์เซอร์ของคุณ และ clones
คืออะไร. Interface ที่ถูก implement ใหม่บนโมเดล local โดยคนที่อยากได้รูปแบบการใช้งานโดยไม่พึ่งพา dependency
ใครใช้งาน. Kshetrajna Raghavan ที่ Shopify สร้าง Reflex โมเดล Qwen ที่รัน structured decisions พร้อม probabilities บน WebGPU ทั้งหมดในเบราว์เซอร์ Tobi Lütke ส่งต่อมัน: 206 ไลก์, 38.5K views
https://x.com/tobi/status/2100742327459303882
jevlike ที่ reverse-engineered ดึงดูด 157 คะแนนบนหน้าแรกของ Hacker News สองวันหลังเปิดตัว และ mini-jev interface เดียวกันบน local LLM ตามมาหนึ่งวันต่อมา Community catalog, awesome-jev-by-typesafe, มี 409 stars ตอนที่ผมดึงข้อมูล
ทำไมถึงได้รับเลือก. Clones อิสระสามตัวภายใน 72 ชั่วโมงเป็นสัญญาณที่แข็งแกร่งที่สุดในการกวาดข้อมูลนี้ว่า interface คือการประดิษฐ์ที่แท้จริงหรือไม่ มันยังให้คุณมี escape hatch แบบ offline สำหรับสิ่งที่คุณไม่สามารถส่งผ่าน wire ได้ ซึ่งสำคัญเพราะของจริงเป็น API-only และ host ในสหรัฐฯ ลอง Reflex ในแท็บตอนนี้เลย
📖 วิธีใช้ที่ TypeSafe แนะนำ
สี่กฎ จากเอกสารและจากคำตอบของผู้ก่อตั้งเอง:
- ถามหลายคำถามต่อการเรียกหนึ่งครั้ง พวกมันประเมินผลแบบขนาน และ เอกสาร บอกว่าคำถามเพิ่มเติมแทบไม่เปลี่ยน response time ทุกการเลือกด้านบนที่สร้างความประทับใจให้กับใครบางคนคือการถามหลายสิ่งเกี่ยวกับ state เดียวกัน
- ตั้ง threshold บน confidence เอกสาร บอกให้คุณถือว่าอะไรก็ตามที่ต่ำกว่า 0.3 ถึง 0.5 เป็นสัญญาณให้ถามมนุษย์แทนที่จะลงมือทำ นี่คือความแตกต่างระหว่าง classifier ซึ่งส่ง label ให้คุณ กับ decision system ซึ่งส่ง label พร้อมสิทธิ์ในการใช้มัน
- ให้ candidates อย่าขอให้มันประดิษฐ์ขึ้นเอง Browser Use สร้าง action space จาก DOM และ Jev เลือก RAG retrieves และ Jev filters Launcher ranks และ Jev re-ranks Choice รองรับตัวเลือกสูงสุด 255 รายการ; เพิ่ม "other" สำหรับ edge cases
- ทำให้ grading ถูกต้อง มิฉะนั้นทุกอย่างไร้ความหมาย Builder คนหนึ่ง ที่ใช้เวลาทั้งสัปดาห์พยายามทำลายระบบพูดตรงๆ ว่า "if you don't get the grading right, it doesn't work." Option set และ wording ของคำถามคืองานที่ต้องทำ; ตัว call นั้น trivial
สถานที่ที่คุณจะได้ลองใช้: มันอยู่เบื้องหลัง gateways ที่คุณใช้อยู่แล้ว Vercel AI Gateway ภายใน 48 ชั่วโมง และด้วย 2,341 ไลก์ นั่นคือโพสต์ที่ใหญ่ที่สุดเป็นอันดับสองของบริษัท รองจากการประกาศ stealth announcement
https://x.com/typesafeai/status/2100376436272173088
Cloudflare AI Gateway, 749 ไลก์, และ OpenRouter in beta, 387 ไลก์, ในสัปดาห์เดียวกัน Direct access คือ \POST [https://api.typesafe.ai/v1/systemone](https://api.typesafe.ai/v1/systemone)\ พร้อม Bearer token
⚖️ ข้อควรระวังอย่างตรงไปตรงมา
Thread เปิดตัวบน Hacker News, "Introducing System One Models and Jev", 1,863 points และ 490 comments, ใช้พื้นที่ส่วนใหญ่ไปกับวลีหนึ่งจาก marketing:
นอกจากนี้ 'can't hallucinate' ดูผิดหรือเปล่า? ใช่ มันไม่สามารถ emit invalid type ได้ แต่มันยังคงสามารถ emit valid value ที่ผิดอย่างสิ้นเชิงได้
- jacobgold, Thread เปิดตัวบน Hacker News, 1,863 points
Diogo ไม่ได้เถียง เมื่อ commenter อธิบายว่านี่คือ classification model ไม่ใช่ LLM เขาเรียกคำอธิบายนั้นว่า "very accurate!" และเพิ่มเพียงว่าเขาจะพูดว่า zero-shot แทน instruction-tuned นั่นคือ framing ที่ตรงไปตรงมา และมันเล็กกว่า hype วันเปิดตัวที่เรียกว่าเป็น intelligence ชนิดใหม่อย่างมาก: มันคือ zero-shot classifier ที่ดีมากพร้อม calibrated probabilities และ API จริง
Thread Jev ที่ใหญ่ที่สุดบน Reddit是关于ใครสร้างมันก่อน r/LocalLLaMA's "I literally built the Jev architecture one year back and completely open-sourced it with model, dataset and paper", 1,568 upvotes และ 164 comments, ดึงดูดคำตอบที่สรุปอารมณ์ของอุตสาหกรรมทั้งหมด:
แต่คุณโพสต์มันโดยบอกว่ามันคือ next big thing ไหม? Rookie mistake
- hapliniste, Reddit, 495 upvotes
ปลอบใจด้วย 351-upvote ใน thread เดียวกัน: เนื่องจาก prior work นั้น ไม่มีใครสามารถจดสิทธิบัตรไอเดียทั่วไปและล็อกมันไว้ได้
Mike Taylor ของ Every ส่ง passage 12 ชิ้นที่มี defects ซ่อนอยู่ผ่าน Jev และผ่าน Fable 5.1 ที่ high effort Jev กลับมาด้วย median 0.35 วินาทีต่อ passage เทียบกับ 8.83, เร็วกว่าประมาณ 25 เท่า และถูกกว่าประมาณ 580 เท่า มันยังจับได้ 6 จาก 7 defects Fable จับได้ทั้ง 7 ข้อ His verdict: มีประโยชน์ในฐานะ early warning system เพราะทางเลือกอื่นคือการไม่ตรวจสอบเลย Side-by-side เล็กๆ อีกอัน บน research loop เทียบกับ gpt-6-astra ออกมาประมาณ 7x end to end, median decision 213ms เทียบกับ 2,436ms, ทั้งสอง lanes ถูกต้อง 3 of 3, ซึ่งจริงและมีประโยชน์ และห่างไกลจาก 200x มาก ค่าเฉลี่ย four-workflow ของ TypeSafe เอง, ตามที่ AISeeKing อ่านจาก chart ของพวกเขา, คือ 67.8% agreement กับ reference answers
Hype fatigue เป็นเรื่องจริงเช่นกัน คอมเมนต์ยอดนิยม, 262 ไลก์, บน explainer ที่มี 75,750 views ที่เปิดด้วย "I genuinely believe it could be a game changer" คือ "Might be my least favorite sentence of all time."
และการตอบสนองที่แหลมคมที่สุดในการกวาดข้อมูลทั้งหมดมาจาก viewer ที่ดู explainer ครบทั้งคลิปแล้วออกมาแบบมือเปล่า:
ฉันดูวิดีโอนี้จนจบและยังไม่รู้ว่า JEV คืออะไรหรือทำอะไรเลย
- Nullzero98, YouTube, 19 likes
คอมเมนต์นั้นคือเหตุผลที่บทความนี้ดำรงอยู่ กฎที่แก้ไขปัญหามาจาก developer ที่สร้างสิ่งนี้ด้วยวิธีนี้อยู่แล้วหลายปี, และมันสั้นพอที่จะอยู่บนสติกเกอร์: AI executes, code decides.
🔍 วิธีที่ผมเลือกสิ่งเหล่านี้
Eleven /last30days runs across X, YouTube, Hacker News, Reddit, TikTok, Instagram, Digg, GitHub and arXiv returned 716 items. I read every raw file in full, then opened every post with real traction and checked its numbers against the live page, because the biggest posts about a two-day-old product were not where the keyword search expected them. 39 candidate workflows had a named source and a real number. I kept 9. No more than two picks lean on any one author or channel. Every engagement figure is what X or YouTube displayed at pull time, rounded exactly the way they round it.
On the code: four payloads are verbatim. The email triage block is TypeSafe's own quickstart from their docs, the raw JSON shape is from the same docs, and the two middleware blocks are copied from LangChain's post. Alex Volkov's compaction install line is his exact wording. I wrote the RAG filter myself against the documented API in the shape Kush described, and it is a draft with good bones rather than something anyone has run in production.
Embeds are reserved for posts that earned attention. Everything under a few hundred likes is linked inline instead, because a small post blown up into a quote card only looks like evidence.
🔑 รูปแบบที่พบในตัวเลือกต่างๆ
- โมเดลเร็วทำหน้าที่ตอบสนอง ส่วนโมเดลช้าทำหน้าที่วางแผน Minecraft, การแข่งขัน Wikipedia ในเธรดเปิดตัว, Browser Use และ compaction ล้วนใช้โครงสร้างการแบ่งหน้าที่แบบเดียวกัน
- ป้อนตัวเลือกให้มัน ผู้ชนะไม่เคยขอให้ Jev สร้างตัวเลือกขึ้นมาเอง พวกเขาสร้างชุดตัวเลือกผ่านโค้ด จาก DOM, ตัวดึงข้อมูล (retriever), บันทึกการใช้เครื่องมือ (tool trace), ดัชนีตัวเปิดใช้งาน (launcher index) แล้วปล่อยให้มันเลือก
- โทเคนผลลัพธ์ฟรีมีบทบาทสำคัญมากกว่าตัวเลขความเร็ว งานประมวลผลต่อแถวและต่อชังก์ทั้งหมดที่นี่เป็นไปได้เพราะราคา
- คะแนนความเชื่อมั่นคือผลิตภัณฑ์ หากไม่มีตัวเลขที่ผ่านการปรับเทียบ (calibrated) สำหรับกำหนดเกณฑ์ มันก็เป็นเพียงตัวจำแนกประเภทที่ทำงานเร็ว แต่เมื่อมีแล้ว มันกลายเป็นชั้นการตัดสินใจที่รู้จังหวะว่าจะหยุดเมื่อไหร่
- นวัตกรรมอยู่ที่ส่วนติดต่อผู้ใช้ ไม่ใช่ที่น้ำหนักของโมเดล มีโคลนที่ใช้งานได้จริง 3 ตัวภายใน 72 ชั่วโมง และเธรดที่ใหญ่ที่สุดบน Reddit คือโพสต์จากคนที่เผยแพร่สถาปัตยกรรมนี้ไว้เมื่อหนึ่งปีก่อน
- เวอร์ชันเชิงวิชาการมาก่อน TabAgent บน arXiv เสนอแนวคิดเดียวกันในการแทนที่การเรียกใช้ routing, gating และ verification ด้วยตัวจำแนกประเภท โดยไม่ได้ผูกกับผลิตภัณฑ์ใด
- ชุมชนตั้งชื่อที่เหมาะสมให้กับสิ่งนี้เรียบร้อยแล้ว นักพัฒนาที่รวบรวมสิ่งที่ผู้คนกำลังส่งมอบ ได้เลือกใช้คำว่า "AI if statement" ซึ่งถือเป็นสามคำที่มีประโยชน์ที่สุดที่เคยเขียนเกี่ยวกับโมเดลนี้
🧵 สิ่งที่ฉันจะทำกับมัน
เก็บโมเดลขนาดใหญ่ไว้สำหรับงานคิดหนักและการเขียน นำโมเดลนี้มาใช้กับการตัดสินใจง่ายๆ ทุกจุดในลูป กำหนดเกณฑ์จากคะแนนความเชื่อมั่น และส่งต่องานที่มีความเชื่อมั่นต่ำกว่า 0.5 ไปยังโมเดลที่ใหญ่กว่าหรือให้มนุษย์จัดการ ติดตั้งปลั๊กอิน compaction ตั้งแต่วันนี้ เพราะนี่คือสิ่งที่คุณจะสัมผัสได้ถึงความแตกต่างภายในคืนนี้
📊 รายงานสรุปจากเอเจนต์ทั้งหมด
Reddit 113 เธรด / 24,425 upvotes / 4,159 คอมเมนต์; X 314 โพสต์ / 30,192 ไลก์ / 1,538 รีโพสต์ รวมถึง 13 โพสต์ที่ตรวจสอบด้วยตนเองเทียบกับหน้าเว็บจริง; YouTube 75 วิดีโอ / 4,545,636 ครั้งเข้าชม; TikTok 36 วิดีโอ / 171,040 ครั้งเข้าชม; Instagram 14 รีลส์ / 10,778 ไลก์; Hacker News 133 เรื่อง / 25,312 คะแนน / 11,852 คอมเมนต์; GitHub 6 repos / 842 stars; Digg 7 คลัสเตอร์ / 119 โพสต์; arXiv 18 เปเปอร์ รวบรวมจากการรัน /last30days จำนวนสิบเอ็ดครั้งเมื่อวันที่ 2026-09-17 โดยนับรวมทั้งหมดก่อนทำการลบรายการซ้ำ





