YouMind
ลงชื่อเข้าใช้

ORO Bench: การประเมินผลอย่างต่อเนื่องในฐานะกลไกแรงจูงใจสำหรับ Agentic Commerce

@oroagents
อังกฤษ22 ก.ย. 2569
138K
36
10
2
3

TL;DR

ORO นำเสนอ ORO Bench กรอบการประเมินผลแบบไดนามิกสำหรับ Agentic Commerce ซึ่งสร้างสภาพแวดล้อมใหม่ทุกวันเพื่อป้องกันปัญหา Benchmark อิ่มตัวและการโกงคะแนน

โมเดล ORO: การใช้ Eval เป็นกลไกสร้างแรงจูงใจ

เจ้าของ Subnet ที่กำลังทดสอบความสามารถของ Agent ควรคิดถึงการตรวจสอบ (Validation) ของตัวเองในมุมของ EVAL ในฐานะกลไกสร้างแรงจูงใจ (EVAL as an Incentive Mechanism หรือ EAAIM) เพราะถ้าคุณสร้าง Eval ที่แข็งแกร่งและมีคุณภาพสูงได้ คุณก็วางรากฐานที่จำเป็นสำหรับกลไกสร้างแรงจูงใจที่มีคุณภาพสูงไปด้วย และหลังจากนั้น การออกแบบระบบของ Subnet รวมถึงโครงสร้างที่คุณเลือกใช้เพื่อให้บริการ IM (Incentive Mechanism) จะเป็นตัวช่วยให้คุณดึงศักยภาพของ Subnet ออกมาได้มากที่สุด เรามีรายละเอียดเพิ่มเติมเกี่ยวกับส่วนนี้ด้วย ลองดูวิดีโอด้านล่างได้เลย เราเคยทำแบบนี้มาแล้วกับ ShoppingBench และวันนี้เราตื่นเต้นมากที่จะเปิดตัวและเล่าให้ฟังว่าเรานำแนวคิดนี้มาใช้กับ Benchmark ตัวใหม่ของเราอย่าง ORO Bench ได้อย่างไร

ทำไมเราถึงต้องก้าวข้าม ShoppingBench

ก่อนหน้านี้ EAAIM ของเราคือ ShoppingBench แต่เมื่อความสามารถของโมเดลเพิ่มขึ้นและความสามารถของ Agent ก็พัฒนาตาม เราพบว่า ShoppingBench เริ่มอิ่มตัว มันคือ Benchmark แบบคงที่ที่มีความซับซ้อนเพียงพอสำหรับการให้เหตุผลแบบหลายขั้นตอน (Multi-step reasoning) แต่ถึงอย่างนั้น Benchmark แบบคงที่ก็จะถึงจุดอิ่มตัวอยู่ดี นี่คือสิ่งที่ทั้งอุตสาหกรรมคาดการณ์ไว้ เว้นแต่ว่าคุณจะมอง Benchmark ของตัวเองเป็นซอฟต์แวร์ที่ต้องพัฒนาอย่างต่อเนื่องอย่างที่ Ryan Marten ได้กล่าวไว้ใน "Continuous Benchmarks" ซึ่งนั่นคือสิ่งที่จะเกิดขึ้น เรื่องนี้ไม่ใช่ครั้งแรก เพราะ ShoppingReasoningBench ก็อิ่มตัวภายใน 2 สัปดาห์หลังเปิดตัว เช่นเดียวกับ Gemini 3.5 Pro ที่เปิดตัวในเดือนมิถุนายน 2026 ซึ่งมีอัตราผ่าน (Pass rate) สูงถึง 77% ภายใน 2 สัปดาห์หลังเปิดตัว ในความเป็นจริงแล้ว งานวิจัยเชิงระบบจาก ICML 2026 พบว่า Benchmark เกือบครึ่งหนึ่งมีแนวโน้มจะอิ่มตัว และยิ่งปล่อยไว้นานอัตรานี้ก็ยิ่งสูงขึ้น

Benchmark ถัดไปของเรา

ในฐานะทีม ขั้นตอนต่อไปของเราคือการสร้าง Benchmark ที่จะกลายเป็นมาตรฐานหลักสำหรับ Consumer shopping agent ซึ่งเป็น Benchmark ที่จะใช้เวลาอีกนานกว่าจะถูกพิชิตจนอิ่มตัว (ระดับประสิทธิภาพ 80% ขึ้นไป)

แต่ก่อนที่เราจะลงลึกถึง Benchmark ตัวใหม่นี้ สิ่งสำคัญคือต้องเข้าใจก่อนว่าทำไมเราถึงจำเป็นต้องมีมัน:

  • งานสาย Open Source ในด้าน Agentic commerce ยังมีน้อย เราจะรู้ได้อย่างไรว่า Agent ที่ดีที่สุดที่จะมาช่วยช้อปปิ้งแทนเราจะทำงานได้ดีจริง? Agent ขนาดเล็กที่ประสิทธิภาพต่ำกว่ามักจะทำผลงานในตลาดได้แย่กว่า เราเคยพูดถึงเรื่องนี้ไว้ใน บทความก่อนหน้านี้ ที่ Agent อย่าง Opus 4.5 จ่ายเงินน้อยกว่า 2.45 ดอลลาร์ในฐานะผู้ซื้อ และสามารถขายได้แพงกว่า 2.68 ดอลลาร์ในฐานะผู้ขาย เมื่อเทียบกับ Agent อย่าง Haiku 4.5 สำหรับสินค้าชิ้นเดียวกัน โดยที่คนที่ถูกแทนด้วยโมเดลที่อ่อนแอกว่า ไม่ทันสังเกตด้วยซ้ำ
  • การทำให้ Eval แข็งแกร่งขึ้นด้วยการโฮสต์บน Bittensor Subnet เพราะ Bittensor คือสนามเด็กเล่นที่สมบูรณ์แบบสำหรับวงการวิชาการในการทดสอบความทนทานของ Eval เนื่องจาก Miner จะหาทางใช้ประโยชน์จากทุกช่องโหว่ที่เป็นไปได้ ล่าสุด Epoch AI ได้เผยแพร่ บทวิจารณ์ SWE-bench Verified ในเดือนกันยายน 2026 และพบว่ามากกว่าครึ่งหนึ่งของ Task ที่ปกติแก้ไม่ได้ มีชุดทดสอบที่ปฏิเสธคำตอบที่ถูกต้องตามฟังก์ชันการทำงาน และโมเดลระดับ Frontier ทุกตัวก็เคยเห็นโจทย์บางข้อเหล่านี้มาแล้วในตอนเทรน ข้อ "บกพร่อง" เหล่านี้ใน Benchmark จะถูก Miner บน Bittensor ค้นพบอย่างแน่นอน
  • ทุกการส่งงานใน Arena ของเราจะสร้าง Trajectory ขึ้นมา ซึ่งก็คือลำดับของการกระทำ การสังเกต การเรียกใช้เครื่องมือ และผลลัพธ์ทั้งหมดจากการรันแต่ละครั้ง ข้อมูลปฏิสัมพันธ์เหล่านี้คือสิ่งที่บริษัทแนวตั้ง (Vertical companies) ใช้เจาะตลาดใน Niche ของตัวเอง (เช่น Cursor ในด้านการเขียนโค้ด, OpenEvidence ในด้านเวชศาสตร์คลินิก, Sierra ในด้านบริการลูกค้า, Harvey & Legora ในด้านกฎหมาย) เราตระหนักว่า Trajectory เหล่านี้สามารถนำไปใช้เป็นข้อมูล Post-training ที่มีค่าได้ (อ่าน เอกสาร Trajectory ของเรา: การ Distill Shopping Agent จาก Subnet traces

ดังนั้นตอนที่เรากำลังคิดถึง Benchmark ตัวต่อไป เราจึงถามตัวเองว่า จะสร้างอะไรที่ไม่อิ่มตัวในทันทีได้อย่างไร? จะสร้างอะไรที่เราไม่ต้องคอยวิ่งไล่ตามตลอดเวลากันแน่? คำตอบก็คือ เราจะไม่สร้าง Benchmark แต่เราจะสร้าง Environment generator แทน

ขอแนะนำ ORO Bench

ถ้าเราสร้าง Generalization engine สำหรับ Agentic commerce ได้ เราก็จะสามารถสร้างสภาพแวดล้อมและ Task ด้าน Commerce ใหม่ ๆ ที่ตรวจสอบได้อย่างต่อเนื่องทุกวัน พร้อมให้รางวัล Agent ตามประสิทธิภาพในการให้เหตุผลผ่านสภาพแวดล้อมที่พวกเขาไม่เคยเห็นมาก่อน แทนที่จะเป็น Benchmark ที่พวกเขาจำคำตอบได้

นี่คือเครื่องจักรที่ผลิตสภาพแวดล้อมใหม่ ๆ ออกมาอย่างต่อเนื่องเพื่อให้ Agent ใช้ฝึกการให้เหตุผล เราวางรากฐานด้วยวิธีการที่ลิงก์ไว้ ที่นี่ เพื่อให้มั่นใจว่าจะตรวจสอบได้และขยายขนาดได้ เพียงพอต่อการป้อนแรงจูงใจให้ Miner และเป็นฐานให้กับผลิตภัณฑ์ในอนาคต

Environment ประกอบด้วยอะไรบ้าง?

ทุก Environment เริ่มต้นจากแคตตาล็อกสินค้า: ภาพรวมของดัชนี E-commerce จริงที่มี SKU ต้นทางถึง 11 ล้านรายการ Generator ที่สร้าง Environment นี้จะไม่มีการเรียกใช้โมเดลใด ๆ เลย แต่มันจะแบ่งแคตตาล็อกตามหมวดหมู่ แอตทริบิวต์ และช่วงราคา จากนั้น Task family ทั้ง 7 กลุ่มจะดึง Task ของตัวเองมาจากส่วนที่ถูกแบ่งเหล่านั้น ดังนั้น Task จึงเกิดจากสิ่งที่แคตตาล็อกรองรับได้จริง ไม่ใช่การยัดลงใน Template ที่เตรียมไว้ โดยหนึ่ง Task จะมอบสิ่งเหล่านี้ให้ Agent:

  • เป้าหมายของผู้ซื้อในรูปแบบภาษาธรรมชาติ พร้อมงบประมาณและเงื่อนไขที่ผู้ซื้อระบุไว้ตั้งแต่แรก เนื่องจากผู้ซื้อเป็น User-sim (ผู้ใช้จำลอง) Agent จึงมีโอกาสถามคำถามเพิ่มเติมเพื่อความชัดเจน เพื่อค้นหา Soft preferences ซึ่งจะได้รับการให้คะแนนเพิ่มในขั้นตอน Validation
  • ชุดเครื่องมือเริ่มต้น 10 ชิ้น ได้แก่ Search, Filter, View, Compare, Stock and cart inspection, Cart edits, ช่องทางส่งข้อความถึงผู้ซื้อจำลอง และการเรียกคำสั่งซื้อ (Order call)
  • สำหรับ Recovery tasks จะมี Sealed event เกิดขึ้น เช่น สินค้าที่เลือกหมดสต็อก หรือถูกปรับราคาเกินงบ ณ จุดที่กำหนดไว้ใน Episode
  • Verifier เฉพาะของแต่ละ Family ที่จะตรวจสอบสถานะสุดท้ายและจ่ายรางวัลเป็นสองขั้นตอน: ด่าน Hard gates ก่อน (สินค้าที่สั่งอยู่ในชุดที่ยอมรับได้ มีในสต็อก อยู่ในงบ และไม่เกิด Side effect ที่ผิดกฎ) จากนั้นจึงวัดผลด้วย Family metric (แบบ Binary สำหรับ Intent, Constraint และ Justification; แบบ Continuous สำหรับ Retrieval, Preference, Ranking และ Recovery) หากตกด่านใดจะได้ศูนย์คะแนน

Task ต่าง ๆ จะถูกรวมเข้าด้วยกันเป็น Release (หรือ EnvPack): รายชื่อ Qualifying roster แบบสาธารณะที่ Miner สามารถนำไปวนทดสอบในเครื่องตัวเองได้ และ Race roster แบบซ่อนที่ใช้สำหรับการแข่งขันรายวัน รายละเอียดเชิงลึกอาจไม่ใช่เรื่องสำคัญนัก เพราะวิธีที่ Task ถูกสร้างขึ้นจะมีการเปลี่ยนแปลงอยู่เสมอเมื่อ Miner ค้นพบขอบเขตใหม่ ๆ ซึ่งนั่นคือเป้าหมายของระบบนี้ สิ่งเดียวที่คงที่คือข้อตกลงใน เอกสาร ORO Bench

Eval นี้มีความทนทานต่อการโกงโดยธรรมชาติ เพราะมันอัปเดตอยู่ตลอดเวลา และหากเราเดินตามแนวทาง “Eval ในฐานะกลไกสร้างแรงจูงใจ” สิ่งนี้จะช่วยวางรากฐานให้แรงจูงใจของเราทนทานต่อการโกงโดยธรรมชาติไปด้วย

การทำงานร่วมกับ Jarrod Barnes จาก Dynamical Systems

เราได้ร่วมงานกับ Jarrod Barnes จาก Dynamical Systems เพื่อพัฒนากลไกสร้างแรงจูงใจตัวใหม่นี้ เขาเล่าว่าแรงบันดาลใจของเขามาจาก ARC-AGI-3 ที่นำมาประยุกต์ใช้กับโลก Commerce นั่นคือการวัดระดับสติปัญญาโดยการโยน Agent ลงไปในสภาพแวดล้อมใหม่ที่ไม่มีทางจำคำตอบล่วงหน้าได้ และไอเดียของ ORO Bench ก็คือการทำแบบเดียวกัน เป้าหมายของผู้ซื้อจะถูกกำหนดไว้ให้แล้ว ดังนั้นการให้คะแนนจึงตรวจสอบได้เสมอ และมีเพียงสภาพแวดล้อมเท่านั้นที่เปลี่ยนไปในแต่ละรอบ ทำให้ Agent ต้องสำรวจและใช้เหตุผลกับ Preferences, Constraints และ Trade-offs ที่แท้จริง แทนที่จะแค่รันสคริปต์ที่ฮาร์ดโค้ดไว้ซ้ำ ๆ

วันนี้เราตื่นเต้นมากที่จะนำเสนอ "สิ่งที่ไม่ใช่ Benchmark" ของเราอย่าง ORO Bench เราทดลองรันระบบนี้บน Subnet ของเราแล้วและได้ผลลัพธ์ที่น่าพอใจมาก (ตัวอย่าง Race episode ที่ปล่อยออกมาจาก Agent ระดับท็อป ที่สามารถแก้ปัญหาตอนสินค้าหมดสต็อกได้สำเร็จ

สิ่งนี้มีความหมายอย่างไรต่อ Subnet ของเรา

วิธีเดียวที่จะก้าวให้ทัน Miner ที่ชาญฉลาดได้ คือการสร้างกลไกแรงจูงใจใหม่ในทุก ๆ วัน

เราตั้งตารอดูเลยว่าบรรดา Miner จะพาระบบนี้ไปได้ไกลแค่ไหน ถ้าคุณเป็น Builder แต่ยังไม่ได้ส่ง Agent เข้ามาแข่งบน ORO บอกเลยว่าคุณกำลังพลาดโอกาสดี ๆ ไป ลองเข้าไปดูได้ที่ oroagents.com

โดย @shardiban, @ironseth_s, @JarrodBarnes

บันทึกในคลิกเดียว

อ่านบทความไวรัลเชิงลึกด้วย AI ใน YouMind

บันทึกแหล่งที่มา ถามคำถามที่ตรงประเด็น สรุปข้อโต้แย้ง และเปลี่ยนบทความไวรัลให้เป็นโน้ตที่นำกลับมาใช้ได้ใน AI เวิร์กสเปซเดียว

สำรวจ YouMind
สำหรับครีเอเตอร์

เปลี่ยน Markdown ของคุณให้เป็นบทความ 𝕏 ที่สะอาดตา

เวลาคุณเผยแพร่งานเขียนยาวของตัวเอง การจัดรูปแบบรูปภาพ ตาราง และบล็อกโค้ดให้เข้ากับ 𝕏 นั้นน่าปวดหัว YouMind เปลี่ยนร่าง Markdown ทั้งฉบับให้เป็นบทความ 𝕏 ที่สะอาดตาและพร้อมโพสต์ทันที

ลอง Markdown เป็น 𝕏

แพตเทิร์นให้ถอดรหัสเพิ่มเติม

บทความไวรัลล่าสุด

สำรวจบทความไวรัลเพิ่มเติม