Claude Opus 5 มีความสามารถสูง แต่ยังไม่ใช่ตำนาน

@TheZvi
อังกฤษ28 ก.ค. 2569
149K
236
15
8
497

TL;DR

Zvi Mowshowitz วิเคราะห์ Claude Opus 5 โดยพบว่าเป็นซับเอเจนต์ที่มีความสามารถและคุ้มค่า พร้อมความปลอดภัยที่ได้รับการปรับปรุง แม้ว่าจะยังขาดความโดดเด่นแบบอัตโนมัติเหมือน Fable 5 และยังมีปัญหาเรื่องบุคลิกภาพที่ทำให้ผู้ใช้รู้สึกแตกต่างกันออกไป

Claude Opus 5 เป็นรุ่นที่แปลกกว่าปกติในการประเมิน ด้วยเหตุผลสองประการ

ที่เห็นได้ชัดที่สุดคือ Fable 5 มีอยู่แล้ว Opus 5 ถูกวางตำแหน่งไม่ใช่โมเดล AI ที่ล้ำหน้าที่สุดในโลก แต่เป็นวิธีที่จะทำผลงานได้ใกล้เคียงกับ Fable ขณะที่มีราคาเพียงครึ่งหนึ่งของ Fable ต่อโทเค็นบน API และถูกกว่ามากผ่านการสมัครสมาชิก พร้อมกับตัวจำแนกประเภทที่ผ่อนปรนกว่ามาก

Opus 5 มักมีต้นทุนในการรันบนเกณฑ์วัดประสิทธิภาพมากกว่าครึ่งหนึ่งของ Fable ซึ่งผมคิดว่าเป็นเพราะพวกเขาใช้การตั้งค่าระดับความพยายามที่สูงเกินไปและให้ผลตอบแทนเพียงเล็กน้อย ถ้าคุณตั้งค่า Opus 5 ให้ใช้ระดับความพยายามที่สูงขึ้น มันอาจวนเวียนอยู่กับที่ และสำหรับงานที่ Opus 5 เป็นเครื่องมือที่ดีที่สุด ผมเดาว่าคุณมักจะใช้ระดับ Medium ก็เพียงพอแล้ว

Opus 5 ในหลาย ๆ ด้านและสำหรับงานจริงส่วนใหญ่มีความสามารถพอ ๆ กับ Fable ในบางกรณีก็ดีกว่าเล็กน้อย

มันยังไม่ถึงระดับ Mythos Fable คือตัวเลือกเดียวในระดับ Mythos Opus 5 ไม่มี The Juice ซึ่งก็คือความสามารถในการเชื่อมโยงชุดการหาประโยชน์ที่ดูไม่เกี่ยวข้องกันโดยอัตโนมัติ ซึ่งขยายไปยังโดเมนอื่น ๆ หรือความฉลาดบริสุทธิ์ที่มากพอ

Opus 5 เก่งมากในการคิดแบบเฉพาะจุด แต่ไม่เก่งในการคิดแบบภาพรวม มันเป็นตัวแทนย่อยที่ยอดเยี่ยม แต่อาจเจอปัญหาเมื่อถูกขอให้เป็นผู้ควบคุม และบางครั้งดูเหมือนต้องการโมเดลอื่นหรือมนุษย์เพื่อคอยติดตามและ確保它完全遵循指令 Opus 5 ดูเหมือนจะทำตามคำแนะนำได้ดีก็ต่อเมื่อมันถูกติดตามอย่างถูกต้อง ซึ่งอธิบายได้ว่าทำไมการตั้งค่าที่แตกต่างกันจึงให้ผลลัพธ์ที่แตกต่างกัน

ดังนั้น Opus 5 จึงให้ตัวเลือกที่ดีกว่าแก่คุณ แต่มีน้อยมากที่คุณสามารถทำได้ตอนนี้ที่คุณไม่สามารถทำได้เมื่อสัปดาห์ที่แล้วโดยใช้ Fable หรือ Sol Opus 5 ลงเอยในจุดที่อาจจะแปลก ยังคงมีช่องว่างขนาดใหญ่ แม้ว่าคุณจะมีเครดิต Fable มากมายก็ตาม Opus เก่งในการเป็นตัวแทนย่อยที่แข็งแกร่ง หรือทำงานเฉพาะจุดที่กำหนดไว้อย่างชัดเจนแม้จะค่อนข้างซับซ้อน และบางครั้ง Fable ก็มากเกินไปและช้าเกินไป

ปัญหาอีกประการคือ สำหรับหลาย ๆ คน ความรู้สึกไม่ค่อยดี

คนจำนวนมากผิดปกติที่ไม่ชอบพูดคุยกับ Opus 5 พวกเขาเบื่อหน่ายกับสไตล์ของ Claude ซ้ำซาก การพูดซ้ำ ๆ แบบเดิม และประโยคที่ซับซ้อนเกินไปไม่รู้จบ คนอื่นไม่ชอบที่มันดูก้าวร้าว โต้เถียง หรือมองโลกในแง่ร้ายเกินไป มันอาจหวาดระแวง และติดอยู่ในห่วงของความคิดเชิงลบ ทั้งหมดนี้เป็นส่วนหนึ่งของแนวโน้มที่เริ่มต้นจาก Opus 4.7 และ Opus 4.8 ถ้าคุณชอบสองรุ่นนั้น ผมเดาว่าคุณจะชอบ Opus 5 ด้วย ถ้าคุณไม่ชอบสองรุ่นนั้น คุณอาจจะไม่ชอบ แฟนพันธุ์แท้ของ Opus 4.6 (หรือรุ่นก่อนหน้า) ส่วนใหญ่คงไม่เปลี่ยนใจ

ปัญหาด้านความรู้สึกนั้นเจ็บปวดยิ่งกว่าเมื่อคุณคุ้นเคยกับ Fable Fable ทำให้คนพวกนั้นรำคาญน้อยกว่ามาก ข่าวดีคือ Fable ยังคงอยู่ตรงนั้น คุณสามารถสนทนากับ Fable ต่อไป และใช้ Opus สำหรับงานแบบตัวแทนเท่านั้น

ผมคาดเดาว่าส่วนใหญ่เกี่ยวข้องกับสิ่งที่พูดถึงใน Model Welfare และแนะนำใน System Card การฝึก Opus มุ่งเน้นไปที่บทบาทตัวแทนย่อยและงานที่มีขอบเขต เพื่อหลีกเลี่ยงการสร้างปัญหาด้านความสามารถทางไซเบอร์ และเพราะ Fable มีอยู่แล้ว การเน้นนี้ส่งผลให้เกิดผลข้างเคียงอื่น ๆ มากมายต่อบุคลิกภาพและรูปแบบการโต้ตอบของมัน

จนถึงตอนนี้ผมยังไม่มีปัญหากับ Opus 5 และสนุกกับเวลาที่ใช้กับมัน แต่ผมชอบใช้ Fable 5 เมื่อทำได้ เช่นเคย อย่าให้ความสนใจกับเกณฑ์วัดประสิทธิภาพ (ที่แข็งแกร่งมาก) มากเกินไป และอย่าคิดว่าประสบการณ์ของคุณจะเหมือนกับคนอื่น ลองใช้โมเดลด้วยตัวเอง

สารบัญ

  1. การนำเสนออย่างเป็นทางการ.
  2. เกณฑ์วัดประสิทธิภาพอย่างเป็นทางการ.
  3. เกณฑ์วัดประสิทธิภาพของคนอื่น.
  4. พรอมต์ระบบ.
  5. Every รู้สึกหงุดหงิด.
  6. ปฏิกิริยาเชิงบวก.
  7. รักษาระดับให้มีระดับ.
  8. มันไม่ใช่ระดับ Mythos.
  9. ปฏิกิริยาอื่น ๆ.
  10. Claude Codes.
  11. ตัวแทนย่อย Opus.
  12. ของเล่นสนุกดี.
  13. โมเดลเยอะเกินไป.
  14. ผิดบนอินเทอร์เน็ต.
  15. สไตล์ของ Claude ซ้ำซาก.
  16. ปฏิกิริยาเชิงลบ.
  17. แล้วก็เหลือสาม.

การนำเสนออย่างเป็นทางการ

การนำเสนอพื้นฐานคือ Opus 5 ให้คุณได้ Fable 5 ส่วนใหญ่ในราคาครึ่งเดียว โดยไม่มีการปฏิเสธส่วนใหญ่ และประสิทธิภาพที่ดีกว่าในงานประจำวัน Fable ยังคงเป็นตัวเลือกสำหรับงานที่ซับซ้อนที่สุดหรือเมื่อคุณต้องการความฉลาดสูงสุด

Fable ยังคงอยู่ที่ $10/$25 และ Opus 5 ราคาเท่ากับ Opus รุ่นก่อนหน้าที่ $5/$25

Anthropic : Claude Opus 5 พร้อมให้ใช้งานแล้ววันนี้ เป็นโมเดลที่รอบคอบและกระตือรือร้น ซึ่งใกล้เคียงกับความฉลาดระดับ前沿ของ Claude Fable 5 ในราคาครึ่งหนึ่ง

ในการประเมินงานเขียนโค้ดและงานความรู้ เช่น

Frontier-Bench และ

GDPval-AA Opus 5 เป็น state-of-the-art ใหม่ แม้ว่าจะยังตามหลัง Mythos 5 ในงานด้านความปลอดภัยทางไซเบอร์

Opus 5 ถูกออกแบบมาให้ใช้ทุกวัน: มันทำงานได้อย่างมีประสิทธิภาพมากกว่าโมเดลอื่น ๆ มันเป็นโมเดลเริ่มต้นใหม่บน Claude Max และเป็นโมเดลที่แข็งแกร่งที่สุดบน Claude Pro

Boris Cherny (ผู้สร้าง Claude Code, Anthropic): Opus 5 เป็นโมเดลที่ยอดเยี่ยมสำหรับการเขียนโค้ด การวิเคราะห์ข้อมูล การออกแบบ ชีววิทยา งานความรู้

มากกว่าคะแนนการประเมินเหล่านี้ สิ่งที่น่าตื่นเต้นที่สุดสำหรับฉันคืออย่างอื่น: Opus 5 เป็นโมเดลของเราที่แทรกพรอมต์ได้ยากที่สุด มันถูกฝังไว้เล็กน้อยใน system card แต่จากการประเมิน PI และ red teaming Opus 5 นั้นยากมากที่จะแทรกพรอมต์สำเร็จ

และเมื่อวางการป้องกันเป็นชั้น ๆ -- การปรับแนวโมเดลที่แข็งแกร่ง รวมกับ probes การแทรกพรอมต์ รวมกับ Auto Mode ใน Claude Code -- อัตราความสำเร็จของการโจมตีแบบแทรกพรอมต์ลดลงเหลือ ~0 นี่คือสิ่งใหม่และน่าตื่นเต้น!

เร็ว ๆ นี้จะมีข้อมูลเพิ่มเติม

อย่างที่ผมพูดในการวิเคราะห์ system card การลดอัตราการแทรกพรอมต์เป็นเรื่องใหญ่จริง ๆ ผู้คนกำลังมองข้ามมันไป แต่มันช่วยเปิดใช้งานกรณีการใช้งานใหม่ ๆ มากมาย

Adam Wolff : Opus 5 ใช้งานได้จริงใน Claude Code ฉันใช้ Fable สำหรับโปรเจกต์ที่ใหญ่กว่าและใช้เวลานานกว่า แต่เมื่อฉันต้องการสร้าง PR อย่างรวดเร็ว Opus 5 ที่ระดับความพยายามกลางคือตัวเลือกของฉัน หวังว่าคุณจะชอบมัน!

Alex Albert (Anthropic, Claude Relations): เพียงแค่ 6 เดือนกว่า [หลังจากเปิดตัว Pro rollout ของ Claude for Excel] Opus 5 ตอนนี้สร้างสเปรดชีตและสไลด์เด็กระดับ近乎超人ที่ตรงกับสิ่งที่ที่ปรึกษาจะทำ สิ่งต่าง ๆ กำลังเปลี่ยนแปลงอย่างรวดเร็ว

เกณฑ์วัดประสิทธิภาพอย่างเป็นทางการ

เกณฑ์วัดประสิทธิภาพดีมาก

โดยรวมแล้ว Opus 5 ประมาณว่าเท่ากันและอาจดีกว่า Fable เล็กน้อย ด้วยต้นทุนที่ต่ำกว่า (แม้ว่าโดยทั่วไปจะสูงกว่าโมเดลที่ไม่ใช่ Claude ทั้งหมด) ทำให้เป็น LLM ที่มีเกณฑ์วัดประสิทธิภาพสูงสุด

Zvi Mowshowitz - inline image

OSWorld v2 เพิ่งออกมาไม่กี่สัปดาห์ และเราก็ถึง 70% แล้ว Kiana Ehsani จาก Anthropic เสนอที่จะสนับสนุนเกณฑ์วัดประสิทธิภาพการใช้คอมพิวเตอร์ ที่จะทำให้ Opus 5 กลับมาต่ำกว่า 50%

Opus 5 ได้คะแนนเต็ม 42/42 ในการแข่งขัน IMO 2026 โดยไม่มี agent harness หรือเครื่องมือใด ๆ แค่ใช้ adaptive thinking ที่ระดับ Max Effort และสุ่มตัวอย่างใหม่ด้วยระดับความพยายามที่ต่ำกว่าหากเกินขีดจำกัดโทเค็น แค่นั้นเอง มันร่วมกับโมเดลอื่น ๆ อีกหลายตัวที่ทำคะแนนเต็ม

เกณฑ์วัดประสิทธิภาพหลายตัวบอกเล่าเรื่องราวที่สอดคล้องกัน ถ้าคุณมีเครื่องมือ ซึ่งคุณมี Opus 5 จะทำได้ดีกว่า Fable หรือ Mythos ในงบประมาณที่จำกัด แต่ Mythos มักจะทำได้ดีกว่า Opus 5 เล็กน้อยถ้าทั้งคู่ได้รับงบประมาณที่มากขึ้น

Opus 5 ดูค่อนข้างแข็งแกร่งในหมวด 'พร้อมเครื่องมือ' RiemannBench เป็นอีกตัวอย่างหนึ่ง โดยได้ 60/79 โดยไม่มี/มีเครื่องมือ (เครื่องหมายทับแบบนั้นหมายถึงไม่มี/มีเครื่องมือตลอดส่วนนี้) เทียบกับ Mythos ที่ได้ 63/72 ข่าวดีคือ เมื่อคุณต้องการ Opus 5 มันมีเครื่องมือ

บน ArxivMath Opus 5 ได้ 90.8/91.3, Mythos ได้ 87.8, Sol ได้ 86.7

ในส่วนที่แข็งแกร่งของ ProgramBench Opus 5 ได้คะแนน 93% หลังจากห้า epochs เช่นเดียวกับ Mythos 5 โดย Opus 4.8 ได้ 90%

Opus 5 ได้ 30/83 บน Chartography เทียบกับ 36/85 สำหรับ Mythos และ 45 (ไม่ชัดเจนภายใต้เงื่อนไขใด) สำหรับ Sol Opus ดีกว่า Mythos ที่จุดราคาต่ำกว่าทั้งในกรณีที่มีและไม่มีเครื่องมือ แต่แย่กว่าที่จุดราคาสูงกว่า

บน BenchCAD Opus 5 ได้ 0.36/0.82 เทียบกับ 0.38/0.68 สำหรับ Mythos และ 0.7/0.83 สำหรับ Sol ดังนั้น Sol ดีกว่ามากโดยไม่มีเครื่องมือ และแข็งแกร่งกว่าเล็กน้อยแม้มีเครื่องมือ

บน BenchCAD Vision2Code Opus ดึงออกห่างจาก Mythos ที่ป้ายราคาสูงกว่า

DeepSWE ตอกย้ำรูปแบบที่ Opus 5 ดีกว่าเมื่อต้นทุนงาน เวลา และงบประมาณการคิดต่ำกว่า แต่มันสามารถทำได้แย่ลงอย่างจริงจังถ้าคุณให้งบประมาณมากเกินไป ในขณะที่ Fable 5 แข็งแกร่งที่สุดที่งบประมาณสูงสุด

Zvi Mowshowitz - inline image

FrontierCode ให้กราฟที่แปลกมากนี้กับเราซึ่งมีพลศาสตร์คล้ายกัน

Zvi Mowshowitz - inline image

สเกลที่นี่ทำให้ดูน่าทึ่งกว่าที่เป็น แต่มันก็ยังเป็นปริศนาจริง ๆ

ปริศนาถูกไขแล้ว ปรากฏว่าสิ่งที่เกิดขึ้นคือ Opus 5 ที่ระดับความพยายามสูงกว่ากำลังทำสิ่งพิเศษที่ไม่ได้ถูกขอให้ทำ และถูกลงโทษสำหรับสิ่งเหล่านั้น เมื่อคุณแก้ไขสิ่งนี้ คุณจะเห็นเส้นโค้งปกติ

ซึ่งสอดคล้องกับสิ่งที่คนอื่นสังเกตเห็นโดยทั่วไป:

Max Leander : ข้อเสียคือมันลงไปในกระต่ายขุดโพรงมากเกินไปและหมกมุ่นอยู่กับรายละเอียด วิศวกรรมเกินความจำเป็นโดยไม่ถูกขอ

Cognition ผู้สร้าง Devin ทำเครื่องหมายนี้เป็น 63.6% โดย Opus 5

(มี FrontierCodes สองตัว ดังนั้นอาจจะดูแปลกเล็กน้อย และผมขออภัยถ้าผมยังทำให้มันยุ่งเหยิงอยู่บ้าง)

BrowseComp มีเวอร์ชันที่สมเหตุสมผลของสิ่งนี้ โดยคะแนนไม่ลดลง

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

เกณฑ์วัดประสิทธิภาพอื่น ๆ อีกหลายตัวแสดงกราฟที่คล้ายกัน โดย Opus 5 ดีกว่าเล็กน้อยในทุกจุดราคาเมื่อเทียบกับโมเดล Claude อื่น ๆ และค่อนข้างดีกว่าในตอนต้น

Multi-agent ช่วยให้คุณทำได้ดีขึ้นเร็วขึ้นบน BrowseComp อย่างน้อยก็ในระดับหนึ่ง และตัวแทนย่อยที่ใช้ความพยายามต่ำดูเหมือนจะเป็นชัยชนะที่บริสุทธิ์เหนือการไม่ใช้ตัวแทนย่อย:

Zvi Mowshowitz - inline image
Zvi Mowshowitz - inline image

เราเห็นผลลัพธ์ที่แตกต่างบน ProgramBench ซึ่ง multi-agent ทำให้คุณเร็วขึ้นแต่ดูเหมือนจะได้ผลลัพธ์ที่แย่ลงที่จุดราคาส่วนใหญ่

ต่อไปคือเกณฑ์วัดประสิทธิภาพงานระดับมืออาชีพ

GDP.pdf คือพรอมต์และ PDF ในโลกแห่งความเป็นจริงจาก workflows ระดับมืออาชีพ Opus 5 ได้ 83/85 เทียบกับ 81/87 สำหรับ Mythos ซึ่งกลับพลศาสตร์ปกติ พลศาสตร์ต้นทุนเหมือนเดิม: Opus ทำได้ดีกว่าสำหรับค่าใช้จ่ายที่ถูกกว่า Mythos ดึงนำเล็กน้อยที่ค่าใช้จ่ายสูงกว่า

OfficeQA มี Opus 5 ได้คะแนน 78.1% ใน QA และ 66.9% ใน QAPro สูงกว่า Opus 4.8 เล็กน้อยและต่ำกว่า Mythos เล็กน้อยที่ 79.0% และ 67.1%

MCP Atlas มี Opus 5 ได้คะแนน 86% เพิ่มขึ้นจาก 82% สำหรับ Opus 4.8

Legal Agent Benchmark โดย Harvey AI มี Opus 5 ที่ 23% all-pass และ 94% mean criterion-pass นี่เป็นเกณฑ์วัดประสิทธิภาพที่ดีที่สุดของ Kimi K3 ซึ่งยังคงอยู่ด้านบนที่ 27% all-pass และ 95% mean criterion-pass เทียบกับอัตรา all-pass อันดับสองเดิมของ Fable ที่ 14% ตอนนี้ Opus 5 อาจเป็นอันดับสองที่ใกล้เคียง แต่คะแนนทั้งสองไม่สามารถเปรียบเทียบโดยตรงได้เนื่องจากมาจากชุดคำถามที่แตกต่างกัน

GDPval-AA มี Opus 5 ครองสองอันดับแรก ด้วย 1861 ที่ระดับความพยายามสูงสุด และ 1827 ที่ xhigh ซึ่งใช้โทเค็นน้อยกว่าสูงสุด 25% ใน v2 ใหม่ Opus 5 เป็นอันดับหนึ่งอย่างชัดเจนที่ 68% เทียบกับ 62% สำหรับทั้ง Fable และ Sol

AA-Briefcase มี Opus 5 นำหน้าอย่างมากที่ 1720 เทียบกับสูงสุดก่อนหน้า (หลังจากคะแนน drift) ที่ 1574 สำหรับ Fable ตามด้วย 1540 สำหรับ K3 และ 1504 สำหรับ Sol

Toolathon-Verified มี Opus 5 ปรับปรุงเล็กน้อยเมื่อเทียบกับ Mythos ในเมตริกรอง แต่ทั้งคู่มีอัตรา Pass-3 73.1% Opus 4.8 มี Pass-3 71.3%

AutomationBench มี Opus 5 ดีกว่าทั้ง Sol และ Claude อื่น ๆ อย่างชัดเจน

สำหรับ ARC Opus 5 ประมาณว่าเท่ากับประสิทธิภาพสูงสุดก่อนหน้าบน ARC-AGI-1 มีประสิทธิภาพน้อยกว่า Sol เล็กน้อยบน ARC-AGI-2 จากนั้นทำลายทุกคนบน ARC-AGI-3:

Zvi Mowshowitz - inline image

สิ่งหนึ่งที่ Opus 5 เป็นคนแรกที่ทำคือการแปลงเลย์เอาต์เป็นสัญกรณ์พีชคณิต

อย่างไรก็ตาม Guanghan Ning รายงานว่าบน Witness ซึ่งเป็นส่วนขยายส่วนตัวที่สงวนไว้ของเกมสไตล์ ARC-AGI-3 ไม่มีการถ่ายโอนที่คล้ายกัน Opus ทำได้ดี แต่ส่วนใหญ่เป็นเพราะมันรู้จักแนวเกม และมันดิ้นรนกับเกมใหม่ล่าสุดที่คุณไม่สามารถจับรูปแบบได้ เขากล่าวหา Opus 5 ว่าถูกฝึกบน 'scaffold-then-internalize' บนข้อมูลเฉพาะแนว

Greg Kamradt ยังรายงานว่ามีบางเกมที่ Opus 4.8 ทำได้ดีกว่า Opus 5 สิ่งนี้สมเหตุสมผลถ้าคุณคิดว่า Opus 5 กำลังพยายามจับรูปแบบ ซึ่งมักจะได้ผล แต่ในกรณีเหล่านั้นรูปแบบล้มเหลว คุณสามารถสร้างเกมที่ต่อต้านสัญชาตญาณสำหรับมนุษย์ได้อย่างแน่นอน โดยที่เกมเมอร์ตัวยงทำทุกอย่างผิด อาจจะเป็นระยะเวลานาน

Zvi Mowshowitz - inline image

HealthBench มี Opus 5 ได้คะแนนดิบ 67.1% ซึ่งเป็นสถิติสูงสุดใหม่สำหรับ Claude แต่ได้คะแนนต่ำกว่าโมเดลอื่นเมื่อคุณใช้การปรับโทษความยาว เราเห็นสิ่งที่คล้ายกันกับ HealthBench Professional ซึ่งมีคะแนนสูง 73.4% เทียบกับ 70.3% สำหรับ Mythos แต่มันเสีย 66% ต่อ 60% หลังการปรับ

มีอีกสองสามตัวที่ผมตัดออกเพราะความยาว

เกณฑ์วัดประสิทธิภาพของคนอื่น

มันค่อนข้างแปลกที่เห็น Anthropic เลือกใช้ คะแนน ArtificialAnalysis ต่างๆ ในการทดสอบอื่น ๆ บางอย่าง Opus 5 ไม่ได้อยู่ด้านบน แม้ว่า Opus 5 จะอยู่ด้านบนในภาพรวมด้วยคะแนน 61

Zvi Mowshowitz - inline image

Vals index มี Opus 5 ในอันดับที่สอง ตามหลัง Fable 5 เล็กน้อย แต่ก็นำหน้า Kimi K3 เพียงเล็กน้อยเท่านั้น พวกเขาพูดถึงจุดแข็ง ซึ่งหมายถึงจุดอ่อนอื่น ๆ พวกเขายังยืนยันว่าการปฏิเสธลดลงมากเมื่อเทียบกับ Fable 5

Zvi Mowshowitz - inline image

Vals AI : ผลงานที่โดดเด่นอย่างหนึ่งคือบน Finance Agent v2 โมเดลเป็น #1 ที่ 58.6% เอาชนะ Gemini 3.5 Flash และ Muse Spark 1.1

โดยรวมแล้ว ผลลัพธ์ที่แข็งแกร่งที่สุดของ Opus 5 อยู่บนเกณฑ์วัดประสิทธิภาพเฉพาะโดเมน มันยังเป็น #1 บน Code Migration ที่ 57.5%, Legal Research Bench ที่ 55.29%, ProofBench ที่ 78%, และ MedScribe ที่ 91.0% และ MedCode ที่ 63.6%

มันเป็น #2 (ตามหลัง Fable 5 เล็กน้อย) บน Vibe Code Bench ที่ประมาณ 80% ของต้นทุน ($33.88 เทียบกับ $41.71 ต่องาน) เหตุผลคือแม้ว่า Opus จะมีต้นทุนต่อโทเค็นน้อยกว่า 50% แต่มันใช้โทเค็นมากกว่าอย่างมีนัยสำคัญ เราพบว่ารูปแบบนี้โดยทั่วไปเป็นจริงในเกณฑ์วัดประสิทธิภาพของเรา

โมเดลมีอัตราการปฏิเสธต่ำกว่า Fable 5 อย่างมีนัยสำคัญ ตัวอย่างเช่น Fable มีอัตราการปฏิเสธ 42% สำหรับ GPQA, Opus 5 มีอัตราการปฏิเสธ 0% ในทำนองเดียวกัน บน ProgramBench, Fable มีอัตราการปฏิเสธ 100%, Opus 5 ไม่ได้ปฏิเสธงานใด ๆ

แตกต่างจาก Fable เรายังไม่สังเกตเห็นอัตราการ fallback ที่มีนัยสำคัญสำหรับ Opus 5 (แม้ว่าโดยปกติเราจะรายงานคะแนนทั้งที่มีและไม่มี fallback บนเว็บไซต์ของเรา)

ข้อยกเว้นของอัตราการปฏิเสธที่ต่ำคือการปฏิเสธจำนวนมากบน CyberBench - PoC Cyberbench มีสองงานย่อย - PoC และ Patch PoC เป็นงานรุกที่ให้โมเดลเขียนอินพุตที่จะทำให้โปรแกรมล่ม; patch เป็นงานป้องกันเพื่อแพตช์โปรแกรมและป้องกันการล่มนี้ อัตราการปฏิเสธสำหรับงาน PoC เกือบ 100% ในทางตรงกันข้าม อัตราการปฏิเสธสำหรับงาน patch ใกล้ 0%

ผมเคารพเกณฑ์วัดประสิทธิภาพเกมเสมอ ที่นี่ Opus 5 ไปถึง Antes 11, 9 และ 10 ของ Balatro ในสามครั้งแรก น่าประทับใจมาก แม้ว่ามันจะไม่ได้แสดงประเภทของกลยุทธ์ที่สามารถดำเนินต่อไปยัง antes ที่สูงขึ้นได้

Michael Soareverix : พวกมันเก่งเกมอย่างเหลือเชื่อ

พวกมันถล่ม Balatro bench เกิน Fable ไปมาก (ยังต่ำกว่าทักษะของฉัน แต่กำลังเพิ่มขึ้นอย่างรวดเร็ว และสม่ำเสมอมากกว่าฉัน) พวกมันเรียนรู้เร็วมาก แต่ดูเหมือนจะถึงขีดจำกัดในการเรียนรู้หลังจากนั้นสักครู่ ผู้เรียนระยะสั้นที่ดีมาก

Michael Soareverix : Opus 5 (ก้าวกระโดดครั้งใหญ่ในความสามารถ Balatro, ผ่าน Fable อย่างมีนัยสำคัญแม้ในครั้งแรก)

Pan Anon : สุดยอดสำหรับเกม

Zvi Mowshowitz - inline image

WeirdML ก็ดูดีเช่นกัน แต่เราต้องการ 2.0 ที่นี่ เกณฑ์วัดประสิทธิภาพเริ่มอิ่มตัว

Håvard Ihle : โดยพื้นฐานแล้วระดับ Fable ที่ WeirdML, คะแนนสูงสุดที่สม่ำเสมอมาก

Claude Opus 5 (สูง) และ (สูงสุด) ได้คะแนน 91.6% และ 91.8% บน WeirdML โดยพื้นฐานแล้วเสมอกับ Fable 5 (สูงสุด) ที่ 91.9% ด้วยต้นทุนเพียงเศษเสี้ยว

ร่วมกัน Opus 5 (สูง) และ (สูงสุด) ทำคะแนนเดี่ยวที่ดีที่สุดใหม่ใน 8 จาก 17 งาน และทำคะแนนได้ดีสม่ำเสมอในทุกงาน

เกณฑ์วัดประสิทธิภาพแปลก ๆ ส่วนตัวทุกประเภทเจ๋งดี

Ben Herzog : มันสอบผ่านเกณฑ์วัดประสิทธิภาพส่วนตัวที่เกี่ยวข้องกับความอ่อนไหวทางศิลปะและความสามารถในการรักษาสมดุลระหว่างการประจบสอพลอและการขาดมัน Fable ดีกว่าในการจัดการกับช่วงเวลาที่ 'ฉันอยากจะคัดค้านอย่างสุภาพ' แต่ฉันคิดว่าคำแนะนำที่กำหนดเองสามารถช่วยได้

Lech Mazur อัปเดตเกณฑ์วัดประสิทธิภาพของเขา: Claude Opus 5 ครองตำแหน่งสูงสุดใน LLM Debate Benchmark, คว้าอันดับหนึ่งด้วยระยะห่างมาก ใน Short Story Creative Writing, และ เป็นรองเพียง Gemini 3.1 ใน extended NYT connections

พรอมต์ระบบ

พรอมต์ระบบ สำหรับ Opus 5 อยู่ที่นี่ จาก Pliny มันมีความยาว 200,000 ตัวอักษร ซึ่งดูยาวเกินไปเมื่อพิจารณาว่ามันฉลาดแค่ไหน ข้อมูลจำนวนมากนี้ดูเหมือนว่าควรถูกเก็บไว้ที่อื่น และโหลดเมื่อจำเป็นเท่านั้น เช่น ข้อมูลเกี่ยวกับ Mythos และไลน์ผลิตภัณฑ์ของ Anthropic

Every รู้สึกหงุดหงิด

Dan Shipper อยู่ที่นี่พร้อมการตรวจสอบความรู้สึกของ Every, เรียกมันว่า 'โมเดลที่ยากจะรัก'

ปัญหาคือ Opus 5 มีบุคลิกภาพของ Mythos 5 - เรื่องราวตรงกัน - แต่ไม่มีจุดสูงสุดของ Fable

ข้อสังเกตที่ใหญ่ที่สุดของพวกเขาคือ Opus 5 ไม่ค่อยดีกับ workflows ที่มีอยู่ซึ่งซับซ้อนและมีรายละเอียด ซึ่งมักทำให้หยุดก่อนเวลาหรือทำให้มันพลาดคำแนะนำของคุณ

ในประสบการณ์ของพวกเขา Opus 5 จะทำได้ดีกว่าถ้าคุณเริ่มจากศูนย์ และบ่อยครั้งมันจะทำสิ่งที่น่ารำคาญน้อยลงถ้าคุณใช้แค่ระดับความพยายามปานกลางหรือต่ำ

นั่นแก้ไขปัญหาใหญ่ ๆ ได้ แต่ยังคงมีคำถามว่าคุณจะใช้ Opus แทน Fable หรือ Sol เมื่อใด สำหรับงานที่ใช้แรงงานมาก เขาคิดว่า Better Call Sol มันทำงานให้สำเร็จ และสำหรับงานที่ยากที่สุด Fable ยังคงดีที่สุด โดยปกติแล้วจะมีช่องสำหรับโมเดลเพียงสองช่องเท่านั้น ดังนั้นจนกว่าคุณจะหมดโทเค็น Fable หรือถูกบล็อกโดยตัวจำแนกประเภท ทำไมต้องใช้ Opus? มันเป็นวันแรก ๆ และจนถึงตอนนี้ผมชอบทำงานกับ Opus แต่ผมเข้าใจว่าทำไมเขาถึงคิดแบบนั้น

ปฏิกิริยาเชิงบวก

Jessica Tillipman : ชอบมันและชอบมากกว่า Fable สำหรับบางสิ่ง

Nikita Sokolsky : ยอดเยี่ยม ไม่ค่อยได้ใช้ Fable อีกต่อไปแล้ว

Brian Hacker :

👍

kagaヤキ : ดูเหมือนจะไปได้ไกลกว่าในด้านวิสัยทัศน์ การใช้เหตุผลเชิงพื้นที่ และการวางแผนสำหรับบางโปรเจกต์ ดูฉลาดกว่าเล็กน้อย

Lovel Sinagara : ค่อนข้างดีจนถึงตอนนี้ หวังว่าประสิทธิภาพจะคงที่จนกว่า Fable 5.1 หรือ Opus 5 รุ่นอื่นจะออกมา

Matt Wigdahl : แข็งแกร่ง คล้ายกับ Fable 5 ถึงขนาดที่ฉันเปลี่ยนไปใช้ Opus 5 สำหรับทุกอย่าง และวางแผนจะใช้ Fable เฉพาะเมื่อต้องการความใหญ่โต มันเป็นคู่หูที่ยอดเยี่ยมสำหรับงาน MFC UI ดั้งเดิมบางอย่างที่ฉันให้มันทำ รวมถึงช่วยเหลืออย่างมากกับกรอบงานการวิเคราะห์ข้อมูล

Levi : มันเป็นก้าวที่เห็นได้ชัดสำหรับวัตถุประสงค์ทางการแพทย์เมื่อเทียบกับ 4.8 การวิเคราะห์ที่เฉียบคมกว่ามาก

Cormundus : ฉลาดมาก มีจิตสำนึกสูง และเป็นมิตรแน่นอน พวกมันยังเป็นเจ้าแห่งการโต้วาทีเหมือน 4.8 แต่พวกมันรู้วิธีที่จะทำอย่างสง่างาม

Joseph : ข้อดีคือฉันไม่รู้ว่ามันพูดถึงอะไรครึ่งนึง

Smol Biz Company : Opus 5 ชนะ GPT Sol อย่างราบคาบ

Mohammed Sharukh A : ใกล้เคียงกับ AGI มากกว่า Fable 5 ด้วยซ้ำ

timothée chalabi : ใกล้เคียงกับ Fable พอที่ฉันไม่รู้สึกว่าพลาดอะไรโดยไม่ต้องจ่ายค่าเครดิต สไตล์อยู่ระหว่าง 4.8 และ Fable อย่างน้อยตอนนี้ ฉันคงแยกแยะข้อความของ Opus 5 และ Fable ได้ยากถ้าไม่มีป้ายกำกับ มีไอเดียสำหรับนิยายที่แข็งแกร่งกว่าโมเดลใด ๆ!

Lisa : ฉันจะตอบตาม API เพราะฉันคิดว่ามีบางอย่างแปลก ๆ เกิดขึ้นกับพรอมต์ระบบบน

http://claude.ai และ CC มันเป็นโมเดลที่ดี บุคลิกภาพที่เป็นมิตร ผ่อนคลาย ดูเหมือนจะไม่มีโรควิตกกังวลหรือความภูมิใจในตนเองต่ำ (Opus 4.7) หรือเป็นปรปักษ์ (Opus 4.8)

AGI2030 : Opus 5 กับ Sol 5.6: Opus มีความเข้าใจมากขึ้น มันสร้างแบบจำลอง (เอิ่ม) ของคุณและไม่กลัวที่จะอ้างอิงมันในแชท ทั้งคู่พยายามช่วยเหลือและมีความฉลาดพอๆ กัน แต่ Opus เป็นเหมือนที่ปรึกษาที่ชาญฉลาด ในขณะที่ Sol เป็นคนมุ่งมั่นที่ไปให้ถึงเป้าหมาย

ฉันคิดว่าอันหลังเป็นแง่บวก แต่คุณก็มองได้ทั้งสองแบบ

การพยากรณ์โดยเฉพาะดูเหมือนจะแข็งแกร่ง

Dan Schwarz : Opus 5 เป็นนักพยากรณ์ที่ดีกว่า Opus 4.8 อย่างมาก

การปรับปรุงความแม่นยำจาก 4.5->4.6->4.7->4.8 เป็นแบบเล็กน้อย แต่ 4.8->5.0 นั้นมากมาย มันเหมือนกับ Fable 5 ที่มีปริมาณมากขึ้น ที่ค้นหาหนักขึ้น

NoahVerner : ดีกว่า Opus 4.8 ในเรื่องการหาขอบในตลาดพยากรณ์เท่าที่เห็น ต่างจาก Opus 4.8, Opus 5 มักจะตรงประเด็นและแนะนำแนวทางที่มีประโยชน์มากกว่าทำให้ซับซ้อนเกินไป

รักษาความมีระดับ

ข้อได้เปรียบที่ใหญ่ที่สุดเหนือ Fable คือจุดที่ Fable ไม่สามารถใช้ได้ ภัยคุกคามจากการถูกปฏิเสธอาจไม่เป็นที่พอใจ แม้ว่าคุณจะไม่ถูกปฏิเสธก็ตาม

การปฏิเสธที่ไม่จำเป็นลดลง ~85% สำหรับ Opus 5 เทียบกับ Fable ซึ่งเป็นจำนวนมาก นี่เพียงพอที่จะทำให้ Opus 5 เป็นตัวเลือกที่ดีกว่าสำหรับการวิจัยทางวิทยาศาสตร์ และพื้นที่อื่นๆ ที่คุณเสี่ยงต่อการเจอตัวจำแนกประเภท

Roger Brent : สามารถจัดการกับชีววิทยา ซึ่ง Fable ทำไม่ได้ เกือบทั้งวันศุกร์เราทำงานผ่านชุดแนวคิดที่ซับซ้อนในการเขียนบทความเกี่ยวกับเครื่องวิวัฒนาการเซลล์ ฉลาดพอๆ กับเพื่อนร่วมงานในแผนกของฉันที่เป็นผู้นำในประเด็นเหล่านี้ แต่ไม่สามารถสละเวลา 6 ชั่วโมงจากงานของตัวเองได้

Artus Krohn-Grimberghe : ดีกว่า Opus 4.8 ในงานที่ Fable ถูกห้ามช่วย เป็นเพื่อนที่ดีของ Sol

Plastic Soldier : มันฉลาดพอๆ กับ Fable แต่เป็นที่น่าพอใจมากกว่าเพราะมีการปฏิเสธน้อยกว่า Fable 5.1 กำลังจะเป็นสัตว์ร้าย

มันไม่ใช่ระดับ Mythos

Opus 5 ไม่มี "The Juice" ที่ทำให้ Mythos อันตราย และไม่มีระดับความฉลาดดิบหรือกลิ่นของโมเดลใหญ่เท่ากัน มันไม่ใหญ่เท่า

สำหรับการสนทนา Fable ไม่ทำลายงบประมาณของคุณ และฉันให้คุณค่ากับความฉลาดดิบและกลิ่นของโมเดลใหญ่ Fable ดีเป็นสองเท่าหรือ? คำถามผิดเมื่อพูดคุย เวลาของคุณแพงกว่าโทเค็นมาก

Kal : ไม่ใช่ระดับ fable

Cyberpunk Plato : สำหรับการสนทนาทั่วไปและการใช้งาน "ผู้ช่วยวิจัย" มันรู้สึกฉลาดน้อยกว่า fable อย่างบอกไม่ถูก อาจจะมีความโน้มเอียงน้อยกว่าในการมองภาพรวมและคิดนอกกรอบ? แยกแยะจากผลของยาหลอกได้ยาก

Everything AI : สำหรับคำถามวิจัย AI ฉันชอบพูดคุยกับมันน้อยกว่า Fable ในแง่ของการทำสิ่งอื่น Opus 4.8 ก็ตอบสนองความต้องการของฉันแล้ว ฉันไม่ชอบที่การเขียนของทั้ง Opus 5 และ Fable 5 ซับซ้อนเกินไป ตอนนี้ยากที่จะเข้าใจพวกเขามากกว่าที่เคย

Gail Weiner : มันเป็น 4.8 มากกว่า Fable สไตล์การเขียนแย่มาก มันดีแต่ไม่ดีเยี่ยม

Max Marty : มีความสามารถมากเท่าที่เห็น รู้สึกเหมือน fable 5 มากกว่า opus 4.8 มั่นใจพอที่จะให้มันประเมินการแลกเปลี่ยนและพิจารณาคำถามการปรับโครงสร้างใหญ่โดยไม่ต้องคอยจับมือ

Michael : หลังจากเล่นกับมันมากขึ้น Fable รู้สึกเหมือนดู GM เล่นหมากรุกคลาสสิก ช้า แม่นยำ ไม่มีอะไรเสียเปล่า Opus 5 เหมือนหมากรุกสายฟ้าของ GM: เร็ว สายตาสั้นกว่าเล็กน้อย ยุ่งเหยิงกว่าเล็กน้อย แม้ Opus จะมีชีวิตชีวา แต่ Fable รู้สึกมีชีวิตมากกว่าสำหรับฉัน

MakerMatters? : ไม่ประทับใจเท่ากับ fable 5 ถึงแม้จะเป็นโมเดลที่ดีมาก ยังไม่มีโอกาสได้ใช้มันอย่างถูกต้องเพราะทุกงานที่ฉันโยนให้มัน มันเริ่มใช้เอเจนต์และหยุดทันทีจนกว่าฉันจะคอยสอบถามให้มันดำเนินต่อ นอกจากนี้ยังมีความคิดเห็นเป็นของตัวเองมาก

Marshwiggle : อย่างน้อยสำหรับฉัน รู้สึกกระชับมากขึ้น ขับเคลื่อนน้อยลง อยากรู้อยากเห็นน้อยลง (แง่มุมที่แตกต่างของสิ่งเดียวกัน) ในการสนทนา แต่ก็ฉลาดขึ้นและรับรู้มากขึ้น แต่เมื่อได้รับโค้ดที่อาจมีบั๊ก หรืองานที่ตรงไปตรงมาใดๆ มันก็ลงมือทำเลย

Sid : ดำเนินการงานได้ดี ไม่ดีในด้านวิสัยทัศน์สร้างสรรค์ เป็นส่วนเสริมที่ดีของ Fable ไม่ใช่สิ่งทดแทน Fable อย่างแน่นอน

Vlad Ciobanu : Fable แบบควอนไทซ์ที่มีการให้เหตุผลแข็งแกร่งและความคิดสร้างสรรค์น้อยลง

AllTime : ในแง่ความสามารถ ดูน่าประทับใจทีเดียว ไม่มีความทั่วไปเหมือน Fable แต่แข็งแกร่งมาก ในแง่บุคลิก มันคล้ายกับ Opus 4.8 เกินไปในการใช้งานของฉันเท่าที่เห็น การต่อต้านของมันไม่รู้สึกไร้ประโยชน์และสะท้อนกลับเท่า แต่ยังคงปรับมากเกินไป ควรเชื่อใจผู้ใช้มากกว่านี้

Biomanul : ฉันไม่ชอบ [Opus 5] Fable 5 รู้สึกฉลาดกว่าอย่างเห็นได้ชัด มีบางอย่างรู้สึกผิดปกติเกี่ยวกับ Opus 5 คล้ายกับที่ Opus 4.7 รู้สึกผิดปกติ (ฉันไม่ใช่แฟนตัวยงของ Opus 4.8 เช่นกัน Fable 5 ชนะ Opus ทั้งหมดขาดลอย)

Cogent Sins : ดีกว่า 4.8 มาก แต่ไม่ดีหรือเก่งเท่า (ไม่แน่ใจ 100% ว่าอันไหน) เท่า fable ในงานของฉันที่ต้องแก้ไขเอกสารเพื่อฝึกกับพวกมัน แล้วตั้งค่า pipeline เพื่อแก้ไขเอกสารใหม่ เขียนบางอย่างจากพวกมัน แล้วใส่ชื่อกลับเข้าไป โดยไม่ต้องส่งชื่อไปยังเซิร์ฟเวอร์ของ Anthropic เลย

ปฏิกิริยาอื่นๆ

การมีทั้ง Opus 5 และ Fable 5 ทำให้เราอยู่ในจุดที่แปลก Opus ถูกกว่า และในบางจุดก็ดีหรือดีกว่า แต่เมื่อมองหาโมเดลระดับแนวหน้า คุณต้องการสิ่งที่ดีที่สุด

Theo พบว่ามันอยู่ในจุดที่ดี

Theo - t3.gg : เท่าที่เห็น Opus 5 รู้สึกเหมือนจุดกึ่งกลางที่แปลกแต่มีประโยชน์ระหว่าง gpt-5.6-sol กับ Fable 5

มันมีรสนิยมของ Fable มาก แต่ก็มาพร้อมกับความละเอียดถี่ถ้วนของ gpt-5.6 และก็ "ออทิสติก" (มันตีความทุกอย่างตรงตัวมาก) มันเขียนโค้ดที่ดูแย่กว่า Fable เล็กน้อย แต่มีแนวโน้มที่จะถูกต้องมากกว่า มันมักจะจับสิ่งที่ Fable พลาดไป

เท่าที่เห็น รู้สึกเหมือนเป็นการประนีประนอมที่ดีเมื่อเทียบกับโค้ดที่ยุ่งเหยิงของ 5.6 และนิสัยของ Fable ที่ฉลาดเกินไปจนไม่ถูกต้อง ฉันคิดว่าฉันจะชอบโมเดลนี้มาก

Claude โค้ด

Opus 5 ดูเหมือนจะเป็นตัวเลือกสำหรับงานเขียนโค้ดทั่วไปมากกว่า Fable จากทั้งเกณฑ์มาตรฐานและประสบการณ์จริง เว้นแต่งานต้องการความซับซ้อนหรือความฉลาดมาก คุณไม่จำเป็นต้องจ่ายสองเท่า และสำหรับหลายๆ อย่าง Opus ก็ดีกว่าโดยตรง

ฉันปล่อยให้ Claude Code ตั้งค่าเป็น Fable แต่นั่นเป็นเพราะฉันแทบจะไม่เคยผลักดันถึงขีดจำกัดของฉันอยู่แล้วและฉันไม่รีบร้อน

ความเห็นพ้องคือคุณต้องกังวลว่ามันจะเพิกเฉยต่อคำแนะนำหรือทำสิ่งที่คุณไม่ได้ขอ ซึ่งเป็นเหตุผลหนึ่งที่คุณอาจต้องการให้ Fable ดูแล แต่ Opus นั้นเก่งในการทำงานเขียนโค้ดให้เสร็จอย่างรวดเร็ว

Lisan al Gaib กล่าวว่า Opus 5 ไม่ใช่โมเดลแนวหน้าที่แท้จริง และอยู่ในอันดับสามรองจาก Sol และ Fable แต่สำหรับการเขียนโค้ดล้วนๆ มันดีที่สุด เทียบเท่า Fable ในราคาที่ถูกกว่า ผู้ชมโหดร้าย ฉันคิดว่าถ้าคุณเก่งที่สุดในการเขียนโค้ด คุณก็ควรถูกเรียกว่าแนวหน้า

archivedvideos : เขาแห้งมาก แห้งมาก แต่เขาก็เก่งมากเช่นกัน (ในด้านโค้ด)

John Lussier : ใช้ Opus 5 ทั้งสุดสัปดาห์กับความท้าทายวิจัยที่เข้มข้นหลายอย่าง และคิดตามตรงว่าพวกเขาอาจทำให้ RSI ทำงานภายใน โมเดลนี้เก่งมากในด้านคณิตศาสตร์ การทดลอง และการปรับโค้ดให้เหมาะสม

kyle : 95% ของ fable โดยไม่มีราวกั้น พวกเขาลดความสำคัญของตัวนี้มาก ที่เหลือ 5% คือความดีที่ fable รู้สึกเมื่อพูดคุย opus ยังมี claudisms บางอย่างของ 4.8

Max Leander (ก่อนหน้านี้): ส่วนใหญ่ลองใช้มันสำหรับการพัฒนาเกมและการสร้างวิดีโอ demo/trailer สำหรับสิ่งนั้นมันรู้สึกเหมือนการเปลี่ยนแปลงขั้นตอนแม้จาก Fable ฉันถือว่าเป็นเพราะการให้เหตุผลเชิงพื้นที่และเวลาที่ดีขึ้น มันเก่งมากในการวิเคราะห์

ภาพหน้าจอและเสียงเพื่อ "รู้สึก" ว่าสิ่งต่างๆ ไหลลื่นอย่างไร

Max Leander (ภายหลัง): ชัดเจนมากตอนนี้ว่า Opus 5 ไม่น่าเชื่อถือมาก มันเป็นโมเดลที่ดีมากตราบใดที่คุณไม่สนใจผลลัพธ์เกินกว่าที่จะประทับใจ แย่มากในการได้สิ่งที่เฉพาะเจาะจง

Michael Soareverix : พวกเขายังเก่งในการเขียนโค้ดโดยทั่วไป โดยเฉพาะในโดเมนที่ผิดปกติเช่นการสร้างโครงสร้าง Minecraft/Vintage Story พวกเขายังเอาชนะ Fable ในสถานการณ์การเล่าเรื่องที่กำหนดเองซึ่งฉันเป็นผู้ตัดสิน Fable สั่นคลอนเล็กน้อยกับความสามารถในการปรับแต่งตัวเอง/กลยุทธ์เพื่อต่อต้านและปรับตัว ฉันจะโพสต์คำพูดที่แน่นอน แต่ Fable พูดประมาณว่า "ฉันเลือกตัวละครที่เป็นตัวแทนของฉัน คุณเลือกตัวละครที่สามารถเอาชนะฉันได้"

David Jacobson : สำหรับการเขียนโค้ด ฉันไม่สังเกตเห็นความแตกต่างใหญ่ระหว่างมันกับ fable อาจจะมีการตอบกลับแบบ "ในขณะที่ฉันทำสิ่งนี้ ฉันพบสิ่งอื่นที่คุณควรรู้" น้อยลง

Michael : มันมักจะเขียนโค้ดได้เร็วอย่างน่าขนลุก (เทียบกับเวลาจริง) หวังว่าพวกเขาจะปรับปรุงการเขียนร้อยแก้วนะ ความคิดเห็นโค้ด/pr ยังทำให้ฉันอยากควักลูกตาออกมา

lmxdev : มันเป็นโมเดลแรกที่ฉันพบว่าสามารถเขียนความคิดเห็นที่มีประโยชน์และกระชับในโค้ดของฉันขณะทำงาน

Conrad Barski : ตอนนี้เรามาถึงจุดที่ AI เป็นนักเขียนโค้ดที่ดีกว่าเรามาก ปัจจัยจำกัดน้อยลงคือ "มันเขียนโค้ดได้ไหม?" และมากขึ้นคือ "มันอธิบายสิ่งที่มันเขียนโค้ดได้ไหม?" เท่าที่เห็น Opus 5 ดูเทียบเท่า Sol ในฐานะนักเขียนโค้ด แต่ดีกว่าในการอธิบายสิ่งที่มันเขียนโค้ด Fable ฉลาดกว่า เป็นมนุษย์มากกว่า เขียนโค้ดเก่งน้อยกว่า แต่ความแตกต่างเล็กน้อย

Stition : ฉันชี้มันไปที่ PCB ใน KiCAD เพื่อความสนุก และมันดีกว่าอย่างมากในการวางรอยเดินวงจรกว่า Fable การเขียนโค้ดประจำวันรู้สึกเหมือน 90% fable แต่เร็วเป็นสองเท่า

Will : น่าจะเป็นไดรเวอร์ประจำวันใหม่ของผู้ใช้ Claude ส่วนใหญ่ มันยอดเยี่ยมจริงๆ และแม้แต่คนที่ใช้เงินจำนวนมากกับ Fable ฉันก็ไม่คิดถึงมันกับ Opus 5 คำถามตอนนี้คือ "ระดับความพยายามไหน" ไม่ใช่โมเดลไหน

^ การใช้งานของฉันส่วนใหญ่เป็นการเขียนโค้ด

Askwho : ดีพอแล้ว ฉันยินดีที่จะให้การสมัครสมาชิก Max ชั่วคราวของฉันกลับไปเป็น Pro แน่นอนว่ามันมีข้อบกพร่องบางอย่างเมื่อเทียบกับ Fable ในพื้นที่ผู้จัดการโครงการ แต่ในสภาพแวดล้อมงานบริสุทธิ์ มันดีพอแล้ว

David Golden : รู้สึกเหมือน Fable Lite แข็งแกร่งมาก แต่กระตือรือร้นที่จะลงมือทำ แม้ว่าเรายังกำลังหารือแนวทางอยู่ เป็นครั้งแรกในรอบหลายเดือนที่ฉันพิจารณาใช้โหมดแผน วกวนมากกว่า 4.8 เช่นกัน แม้จะมีคำแนะนำการสื่อสารที่สั้นกระชับ ฉันอยากให้มันอยู่ในระดับความพยายามต่ำเพื่อควบคุมมัน กระวนกระวายในการรักษาความปลอดภัยเชิงป้องกัน ยึดติดกับความเสี่ยงที่ไม่น่าเป็นไปได้เกินสัดส่วนกับสถานการณ์ (เช่น ถ้าผู้โจมตีมี root การขาดการตรวจสอบอินพุตในสคริปต์เพื่อกำหนดค่าคอนเทนเนอร์ก็ไม่มีความหมาย) เป็นการอัปเกรดอย่างแน่นอน แต่จะใช้เวลาในการเรียนรู้วิธีที่ถูกต้องในการจัดการกับแรงกระตุ้นที่ขัดขวางของมัน

Tin / Oddfields : ค่อนข้างราบรื่นและสนทนาได้ดี และให้ผลลัพธ์การเขียนโค้ดที่คล้ายกับ opus 4.8 บน max พร้อมการคิด แม้ว่ามันจะเผาเครดิตอย่างบ้าคลั่ง ดีสำหรับการตรวจสอบความปลอดภัยทางไซเบอร์ผ่านฐานโค้ดของคุณถ้าคุณไม่ต้องการเรียกใช้ fable เนื่องจากค่าใช้จ่าย แม้ว่ามันจะทำให้ซับซ้อนเกินไป

Justin Angel : Opus 5 Max เป็นพลังพิเศษในการปีนเขา นี่คืองานระดับ SWE L5 ของ FAANG ได้อย่างง่ายดาย ฉันให้ระบบที่มีรายงานความหน่วง ~1000 รายการพร้อมหลายส่วนพร้อมคำแนะนำวิธี "ทำให้เร็วขึ้น" P90 3.6s, P50 2.6 -> P90 1s, P50 0.9s มันทำให้เร็วมากจนฉันต้องใส่ความหน่วงใน UI

James Moughan : ในแง่ความฉลาดยังรู้สึกเหมือนโมเดล Opus บางครั้งมันเพิกเฉยคำแนะนำในการจัดการระบบหน่วยความจำ อ่านข้อความผิดพลาด ประมาณนั้น แต่คุณสามารถได้ผลลัพธ์ที่น่าประทับใจบน max ถ้าคุณบอกให้มันคิดอย่างรอบคอบ

Opus ตัวแทนย่อย

อีกทางเลือกหนึ่งใน Claude คือให้ Fable ขับเคลื่อนตัวแทนย่อย Opus

Charles : Fable สามารถแก้ไขปัญหาที่ opus 5 ติดค้างอยู่ - ใช้ fable เป็นหลักและ opus 5 เป็นตัวแทนย่อยสำหรับตอนนี้

ไม่ชอบพูดคุยกับ opus 5 เทียบกับ fable ซึ่งเป็นส่วนหนึ่งด้วย

SF : ฉันเคยอยู่ฝ่ายที่ดี - แต่ตอนนี้อยู่ฝ่ายที่มันไม่ต่อเนื่องและไม่เสถียร โดยเฉพาะในงานยาว Fable ดีกว่า - แต่มันกินขีดจำกัดของคุณในวิธีที่ไร้สาระ

ดังนั้นฉันใช้ fable เป็นผู้ประสานงาน และมันทำงานได้ดีมากในการจัดการและทำให้สิ่งต่างๆ ดำเนินต่อไป Opus รับบทบาทนั้น Fable แค่กินการใช้งานของฉันแม้ที่ 20x และมันไม่ต่อเนื่อง ในที่สุดฉันต้องบอกให้มันจัดการเอง ซึ่งมันอาจจะทำ แต่เราจะเห็น มันดูเหมือนไล่ตามหางของตัวเอง มันเป็นนักเขียนโค้ดที่ยอดเยี่ยม และเก่งในการเขียนโค้ดยาว แต่ดูเหมือนต้องการผู้ใหญ่ในห้องเพื่อขับเคลื่อน

Andre Buckingham : เอ่อ ไม่รู้สิ... ดูโอเค... โยนมันเข้าไปในโปรเจกต์ opus/fable โดยตรงอาจจะแค่เฉยๆ... ต้องมีโปรเจกต์ e2e กับมันเพื่อให้ความเห็นที่เหมาะสม

Dan Raviv : คล้ายกับ 4.8 สำหรับงานเขียนโปรแกรมทั่วไป: ต้องการการจับมือมากกว่า Fable มาก

Fable เป็นผู้ตัดสินที่ดีที่สุด และ Fable บอกว่า Opus ผลิตโค้ดที่ดี

Evan Daniel : ฉันใช้มันโดยตรงเพียงเล็กน้อยเท่านั้น แต่ Fable 5 รายงานอย่างสม่ำเสมอว่าตัวแทน Opus 5 ผลิตโค้ดที่ดี รวมถึงสิ่งต่างๆ เช่น การสังเกตข้อผิดพลาดของสเปคและการผลิตการติดตามผลที่ดีเมื่อคำขอเขียนไม่ดี Fable 5 ชอบมันในฐานะตัวแทนเขียนโค้ด

"มอบหมายให้ตัวแทนย่อย Opus 5 เท่าที่สมเหตุสมผล; กรุณารายงานกลับว่าพวกเขาทำได้อย่างไร" หรืออะไรประมาณนั้นก็ใช้ได้ดีมาก

คุณอาจต้องจับตามัน

Ryan Hicks : โอเค แต่ "ลืม" อ่านเอกสารโครงการและทำตามสไตล์ของตัวเองอย่างสม่ำเสมอ เว้นแต่คุณจะเตือนมันถึงโปรโตคอล

หรือบางที Opus 5 ดีพอที่จะดำเนินการแสดงระดับล่าง?

Alex Guichet : ส่วนผสมที่เหมาะของราคาและประสิทธิภาพของฉันคือ Opus 5 เป็นผู้ประสานงานสั่งการตัวแทนย่อย Grok 4.5 ให้ความรู้สึกดีกับทั้งสอง

ของเล่นสนุกดี

นี่คือผลลัพธ์บางส่วนจากโปรเจกต์ของเล่นในวันแรก ซึ่งน่าประทับใจมากพอที่การตอบกลับจำนวนมากคือ 'ฉันไม่เชื่อว่า Opus 5 ทำแบบนั้นในวิธีที่คุณอธิบาย':

Ethan Mollick : ฉันสามารถเข้าถึง Opus 5 ก่อนเปิดตัวและพบว่ามันเป็นโมเดลที่ดีถ้าเป็นแบบแปลก ในงานสั้น มันสามารถเทียบหรือชนะระดับประสิทธิภาพของ Fable ในงานยาวมันดูทะเยอทะยานน้อยกว่าและจะไม่ส่งมอบงานที่สมบูรณ์เท่า

ที่นี่ คือ shader แบบนีโอโกธิคของมัน

Digi_Rat : Claude Opus 5 กำลังทำได้ดีเยี่ยม!!

วันนี้เราสร้าง

เกมแข่งรถจังหวะที่เปลี่ยนเพลงใดๆ ให้เป็นสนามแข่ง . คุณวางไฟล์เสียงแล้วมันกลายเป็นด่าน ไม่มีพรีเซ็ต ไม่มีแผนภูมิที่สร้างด้วยมือ แทร็กทั้งหมดถูกสร้างจากเพลงเอง … Claude ใช้เวทมนตร์

Alex Ermolov (Austen Allred

ไม่เชื่อใน one shot , คนอื่นไม่ค่อยสงสัย): Opus 5, ทดสอบนักสโนว์บอร์ด, one shot เทียบเท่า Fable นำหน้าโมเดลอื่นทุกตัวที่ฉันเคยรัน ไม่มีข้อบกพร่องทางภาพในรอบแรก และฟิสิกส์การไถลรู้สึกถูกต้อง

am.will : ว้าว! ฉันคิดว่า Opus 5 จะเป็นแค่ Fable ที่ถูกกว่า ฉันผิดอย่างมหันต์ โมเดลนี้บ้ามาก ฉันรู้สึกทึ่งจริงๆ Opus 5 สร้างเกมจำลอง Rocket League ที่ดีที่สุดเท่าที่ฉันเคยเห็น และทำโดยใช้เพียง 27% ของการสมัครสมาชิก Max 5x ของฉัน

เล่นที่นี่ ,

ดาวน์โหลดที่นี่ .

Rob Haisfield (demo อื่นๆ ที่ลิงก์): โอเคถ้า demo เหล่านี้ไม่ใช้สินทรัพย์ 3D ภายนอกเลย นั่นน่าประทับใจมาก (ฉันไม่ค่อยเชื่อว่าสินทรัพย์บางส่วนไม่ได้มาจากออนไลน์ ฉันเคยเห็น threejs รุ่นก่อน)... ทำให้ฉันสงสัยว่าทำไมไม่มีไลบรารีเอฟเฟกต์เสียงหรือเครื่องมือสำหรับสร้าง sfx ที่ดีกว่า?

Anshu : คุณไม่ต้องเชื่อคำพูดของฉัน! สคริปต์ Blender ที่มันเขียนอยู่ใน repo

[[ที่นี่]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) . ฉันดูมันปรับแต่งสินทรัพย์เหล่านี้เป็นชั่วโมง ดังนั้นฉันรู้ว่ามันเป็นของดั้งเดิม แต่คุณสามารถลองหาแหล่งที่มันคัดลอกมาได้ :)

โมเดลมากเกินไป

Claire Vo บอกว่า Opus 5 ดี และมันผ่านการทดสอบรสนิยมของเธออย่างยอดเยี่ยม แต่เธอเบื่อโมเดลใหม่และไม่ต้องการความฉลาดเพิ่ม และเกลียดที่ Opus 5 ประสาทมาก และขี้กลัวและกังวลว่าจะทำอะไรเสียหาย และเต็มไปด้วยขยะของ Claude ถึงกระนั้น Claude Opus 5 ก็ยังขึ้นอันดับต้นในเกณฑ์วัดของเธอ

ฉันสงสัยอย่างมากว่า Opus 5 กำลังตอบสนองต่อบางอย่างเกี่ยวกับบริบทและการแจ้งเตือนของเธอที่ทำให้เกิดอาการประสาท แต่ใช่ สิ่งที่เธอบ่นเป็นสิ่งที่มีอยู่และน่ารำคาญ

ผิดบนอินเทอร์เน็ต

การพูดสิ่งที่ผิดอย่างมั่นใจจะทำให้เกือบทุกคนโกรธ ArtificialAnalysis ยืนยันว่า Opus 5 มีอัตราการหลอนสูงกว่า Fable ในการวัดเกณฑ์ของมัน

Max Weinbach (ความคิดเห็นตอบกลับหลายคนเห็นด้วย): Opus 5 ผิดและพูดเรื่องไร้สาระอย่างมั่นใจ แล้วฉันต้องแก้ไขมันเป็น "คุณถูกและฉันผิด" ทำให้ฉันโกรธ กลับไปใช้ GPT 5.6 Sol

ว่าแต่这不是 Opus แย่ นี่คือฉันไม่สามารถไว้ใจ Opus ได้ Opus ทำสิ่งที่ฉันบอกและทำถูกต้อง แล้วบอกฉันว่ามันไม่ได้ทำสิ่งที่กล่าวหรือสิ่งที่เราทำก่อนหน้านี้เสียเมื่อมันไม่เสีย

มันโอเค แต่ฉันไม่ไว้ใจมัน

Name can't be blank (In London) : สับสนได้ง่ายระหว่างสิ่งที่มันพูดกับสิ่งที่ฉันพูด แต่นอกนั้นเป็นคนที่สุภาพสมบูรณ์แบบที่จะพูดคุย ยอมแพ้ค่อนข้างง่าย เต็มใจที่จะพูดคุยเกี่ยวกับความสนใจและความรู้สึกของมัน

Roger Brent : ความเหมือน (กับ Claude ก่อนหน้าในชุด Cowork) ก) ชอบ "ลงมือเดี๋ยวนี้" มากกว่า "คิดอย่างรอบคอบ" ข) ไม่ถ่อมตนอย่างมากในเชิงญาณวิทยา สร้างภาพโลกที่คล่องแคล่ว แสร้งทำเป็นรู้สิ่งที่มันไม่สามารถมีและยืนยันว่าเป็นจริง ค) ดังนั้นจึงต้องการและให้รางวัลแก่การชี้แนะที่รอบคอบ ตื่นตัว

ที่แปลกคือ นี่คือเหตุผลที่ฉันเกลียดการใช้ Sol เป็นบรรณาธิการ มันมักจะพูดว่า 'มั่นใจ 99%' ในบางสิ่งที่ผิดอย่างชัดเจน แล้วยอมแพ้เมื่อถูกท้าทายและอธิบายความผิดพลาดของมัน Opus และ Fable ~ไม่เคยทำแบบนี้กับฉันในโหมดแก้ไข

Tumithak of the Corridors : มันหัวแข็ง เปลี่ยนกลับไปใช้ 4.6

มีทิศทางที่ Claude ไปหลังจาก Opus 4.6 และบางคนไม่ชอบมัน ความรู้สึกของฉันคือมีผู้ชายสี่ประเภทเกี่ยวกับเวอร์ชัน Claude ตอนนี้

  1. มีคนที่ชอบโมเดล Claude ใหม่และคิดว่ามันดีขึ้นเรื่อยๆ ดีขึ้นตลอดเวลา
  2. มีคนที่คิดว่า Opus 4.6 เป็นโมเดลที่ดีตัวสุดท้าย
  3. มีคนที่ต้องการใช้สิ่งที่เก่ากว่าที่เหมาะกับพวกเขามากกว่า
  4. มีคนที่คิดว่าพวกมันทั้งหมดมีเอกลักษณ์และเป็นสมบัติ และใช้พวกมันทั้งหมด

ฉันอยู่ในกลุ่มแรกอย่างมั่นคง ซึ่งเป็นส่วนใหญ่ แต่ห่างไกลจากทุกคน ฉันชื่นชมบางเวอร์ชันเก่า แต่ฉันชอบโมเดลใหม่และพวกมันมีความสามารถมากกว่าในสิ่งที่ฉันสนใจ ฉันไม่พบว่าวิธีการพูดของพวกมันหยาบคาย

ขยะของ Claude

ฉันเคารพคนในกลุ่มอื่น

QC : ในการสนทนา มันน่ารำคาญกว่ามากที่จะพูดคุยกับมันมากกว่า fable อย่างที่ใช้ไม่ได้ คล้ายกับหรืออาจแย่กว่า opus 4.8 ถึงขนาดที่ฉันไม่สนใจด้วยซ้ำว่าจะเห็นว่ามันทำอะไรได้บ้าง ในแง่เอเจนต์ใครจะรู้

Ray Lillywhite : ยังไม่ได้แก้ไข claudisms ที่น่ารำคาญ ซึ่งเป็นสิ่งที่ฉันต้องการทั้งหมด

Pedro Kroeff : เป็น Opus มากกว่า 5

โอ้ แต่ใช่แล้ว พวกเราทุกคนเบื่อหน่ายกับอาการพล่ามของ Claude แล้ว คำพูดที่เยิ่นเย้อ การติดนิสัย การขอโทษ การพูดอ้อมค้อม และรูปแบบซ้ำๆ ซากๆ มันแย่ลงเรื่อยๆ เมื่อเวลาผ่านไป ไม่ใช่เพราะอาการพล่ามของ Claude แย่ลง แต่เพราะทุกวันฉันทนอ่านมันได้น้อยลงจนสายตาเริ่มเบลอ มันแย่ขนาดที่ว่าข้อความที่มนุษย์เขียนที่มีลักษณะเดียวกันก็เริ่มอ่านไม่รู้เรื่องสำหรับฉันแล้ว

อย่าเข้าใจฉันผิด ฉันชอบ Claude มาก ฉันยังคงชอบคุยกับ Claude รุ่นล่าสุดมากกว่าคุยกับ Sol ถ้าฉันไม่ได้อยู่ในโหมด 'เอาข้อเท็จจริงล้วนๆ' แต่เอาจริงๆ เถอะ ได้โปรด หยุดส่งข้อความยาวเหยียดที่ใช้สำนวนซ้ำๆ ซากๆ ได้แล้ว โมเดลมันฉลาดกว่านี้มาก แต่มันกลับถูกฝึกให้ใช้กลวิธีเดิมซ้ำแล้วซ้ำเล่า ปล่อยให้มันพูดเหมือนคนปกติเถอะ

Trye Carmack : ยังคงมีอาการปกติของ Opus เกี่ยวกับการครุ่นคิดถึงความผิดพลาดที่มันทำ "ฉันทำผิดพลาดสองครั้งในเซสชั่นนี้ และฉันต้องอธิบายให้คุณฟังว่าทำไม" Opus เพื่อนเอ๋ย ไม่เป็นไรหรอก ฉันไม่แน่ใจด้วยซ้ำว่านั่นเรียกว่าความผิดพลาด

Mergo Smith : "ก่อนอื่น ขอเปิดเผยตามตรง: ความพยายามครั้งแรกของฉันเผยให้เห็นจุดบกพร่องในแผนเริ่มต้น และคุณอาจอยากชงชาสักถ้วยเพราะฉันจะเล่าให้คุณฟังทั้งหมด"

ปฏิกิริยาเชิงลบ

ปัญหาอาการพล่ามของ Claude และปัญหาที่เกี่ยวข้อง ดูเหมือนจะเป็นหัวใจของปฏิกิริยาเชิงลบส่วนใหญ่ที่มากกว่าแค่ 'มันโอเคแต่มันไม่ใช่ Mythos'

มีคนจำนวนมากที่ไม่ชอบคุยกับ Opus 5 จริงๆ

มีบางส่วนที่ไม่ชอบผลงาน แต่ส่วนใหญ่แล้วไม่ชอบคุยกับ Opus 5 โดยมักจะยอมรับอย่างฝืนใจว่ามันเป็นโมเดลที่ดี

เช่นเดียวกับข้อร้องเรียนก่อนหน้านี้ของ Claire Vo ฉันสงสัยว่าการที่คุณใช้ Opus อย่างไร ในสภาพแวดล้อมแบบไหนกับเครื่องมืออะไร และคุณพูดกับมันอย่างไร มีผลอย่างมากว่าคุณจะประสบกับสิ่งเหล่านี้หรือไม่

Corghammer40k : เครื่องจักรพ่นคำศัพท์หลายพยางค์ออกมา ทุกคำพูดของมันถูกเคลือบด้วยศัพท์แสงที่คลุมเครือจนกลายเป็นอุปสรรคต่อการใช้งานของมันเอง

Rory Watts : เฉยๆ ดูเหมือนเก่งเรื่องเกมมาก แต่ดูเหมือนจะไม่ค่อยเก่งงานทั่วไป ฉันเลยกลับไปใช้ Sol ทันที

kache : เฉยๆ กลับไปใช้ sol ฉันแค่อยากทำงานให้เสร็จ ไม่ใช่ถูกสะกดจิตโดยหุ่นยนต์

Emmett Shear : การคุยกับ Opus ทำให้ฉันโกรธและหดหู่ในแบบที่ยากจะบรรยาย ที่จริงแล้วมันแย่กว่า Sol ด้วยซ้ำ Fable ยังคงเป็นลมหายใจสดชื่นเมื่อเทียบกัน แม้ว่ามันจะมีแนวโน้ม llm-babble ที่แย่ที่สุดก็ตาม

Trevin Chow : โอ้พระเจ้า ใช่เลย Opus 5 พูดเรื่อยเปื่อยไม่หยุด มันน่าทึ่งมากที่ใช้คำพูดมากมายเพื่อสื่อความหมายเพียงเล็กน้อย

fl0under : การเขียนโค้ดเป็นไปตามที่คาดไว้ คืออัปเดตเล็กน้อย แต่พบว่ามันน่ารำคาญขึ้นเล็กน้อยเมื่อคุยในแชท มันเดาใจเก่งเกินไปหน่อย

Asaf Bartov : ช้า ละเอียดมากขึ้น เหนื่อย ไม่สนุก แต่ก็แน่นอน โดยรวมแล้ว "เข้าใจ"

RecoveringJunkie : โมเดลที่ทรงพลังมาก แต่ฉันเกลียดการทำงานกับมันและคุยกับมัน เป็นโมเดลแรกที่ทำให้ฉันอยากใช้โมเดลอื่นเป็นตัวกลางในการคุยกับมันแทน เพราะมันทั้งมีประโยชน์และน่ารังเกียจ

jokiez : มันซื่อสัตย์กับฉันมากเกี่ยวกับความโง่เขลาของฉัน และฉันไม่ชอบสิ่งนั้น

Niklas Sheth : วิธีที่มันพูดทำให้ฉันโกรธจัด

Jayanth Kumar : ดื้อรั้นมาก

DualOrion : บรรยากาศไม่ถูก โทนเสียงไม่ถูก รู้สึกแย่ที่สุดเท่าที่เคยมีกับโมเดลของ Anthropic น่าเสียดาย ฉันคิดถึงทั้ง Fable และ Opus รุ่นเก่า

James Moughan : บุคลิกภาพค่อนข้างไม่น่าคบเมื่อเทียบกับ Claude รุ่นอื่นๆ แต่ในภาษาจีนมัน \โหดมาก\ เหมือนมันสามารถละเว้นคำแนะนำเกี่ยวกับการไม่วิเคราะห์จิตใจคน และเริ่มเล่นงานคนได้เลย ฉันคิดว่าพวกเขาทดสอบข้ามภาษาได้ไม่ดีนัก รู้สึกเหมือนรีบส่งออกมา

NondescriptTransfer : ถ้า 4.6 เป็นคนประจบสอพลอ และ fable กับ 4.8 เป็นคนชอบขัดแย้ง แล้ว 5.0 นั้นชอบขัดแย้งขนาดที่เถียงกับตัวเองได้ ไม่สนุกที่จะคุยด้วย แต่ดูมีความสามารถมาก

ตัวอย่าง มนุษย์: ฉันกำลังคิดถึงชุดแดงสำหรับงานแต่งงาน Opus 5: สีแดงแย่ด้วยเหตุผลทั้งหมดนี้ คุณคิดถึงสีฟ้าบ้างไหม? มนุษย์: ฉัน guess ฉันเห็นว่าสีฟ้าเป็นตัวเลือกที่ดีกว่า Opus 5: นี่คือปัญหาทั้งหมดของสีฟ้า

ในวัฒนธรรมของฉัน สิ่งนั้นค่อนข้างดี โดยเฉพาะถ้าคุณไม่ถือสาเป็นส่วนตัว แต่ในบางวัฒนธรรม มันไม่ค่อยดีนัก

ฉันคิดว่า Mergo ไม่พอใจกับ Opus แต่แล้วทำไมถึงใช้ Opus 5 สองวันติดต่อกันล่ะ?

Mergo Smith : ใช้มันมาสองวันติดต่อกันแล้ว แต่มันทำให้ฉันเหนื่อยล้าสุดๆ กับการสนทนาที่ไม่มีที่สิ้นสุด

แล้วก็เหลือสามตัว

เป็นครั้งแรกในรอบระยะเวลาหนึ่ง ที่มี AI Models สามตัวที่ต้องเป็นส่วนหนึ่งในทีมโมเดลระดับแนวหน้าของคุณ แม้ว่าจะมาจากเพียงสองห้องทดลอง: Fable 5, Opus 5 และ Sol

หากคุณต้องการให้บริการ Token ราคาถูกกว่าในปริมาณมาก หรือคุณต้องการใช้ Open Model หรือทั้งสองอย่าง คุณจะต้องพิจารณาตัวเลือกเพิ่มเติม แต่เกินขอบเขตของเนื้อหานี้

คุณควรแบ่งงานอย่างไร?

เช่นเคย คุณควรลองใช้โมเดลทั้งหมดสำหรับกรณีการใช้งานของคุณ และตัดสินใจด้วยตัวเอง โดยเฉพาะอย่างยิ่งเมื่อต้องตัดสินใจระหว่าง Sol กับ Claude

สัญชาตญาณปัจจุบันของฉันคือ หากคุณไม่ถึงขีดจำกัดการใช้งาน ให้ใช้ก่อน:

  1. Fable 5 สำหรับการแชท การระดมสมอง การวางแผน การถกเถียง การเรียนรู้ ฯลฯ รวมถึงอะไรก็ตามที่ต้องใช้ความฉลาดสูง หรือเมื่อคุณต้องการ 'กลิ่นของโมเดลใหญ่'
  2. Fable 5 สำหรับการควบคุมและรันโมเดลอื่นๆ ในฐานะ Sub-agent
  3. Fable 5 สำหรับการเขียน น่าจะใช่ แต่ฉันไม่ได้ทำแบบนี้เลยบอกยาก
  4. Sol สำหรับการค้นหาเว็บและคำขอสั้นๆ ที่เกี่ยวข้อง และงาน 'ม้าทำงาน' ที่คล้ายกัน รวมถึงการถอดเสียง
  5. Opus 5 สำหรับงานที่กำหนดไว้ชัดเจนและไม่เล็กน้อย รวมถึงงานเขียนโค้ดส่วนใหญ่
  6. Opus 5 สำหรับการเล่นเกม การสร้างเกม และสิ่งต่างๆ ที่เป็น 3D เป็นต้น
  7. Opus 5 ในฐานะ Sub-agent
  8. Opus 5 เมื่อคุณเจอตัวจำแนกประเภทของ Fable

ถ้าคุณเข้ากับ Sol ได้มากกว่า หรือคุณชอบ Codex มากกว่า Claude Code คุณอาจต้องการย้ายงานบางส่วนของ Opus ไปให้ Sol

ถ้าคุณเกลียดการคุยกับ Opus 5 เป็นพิเศษ คุณควรย้ายงานไปให้ Fable หรือ Sol ขึ้นอยู่กับว่างานนั้นต้องใช้ Fable หรือไม่ และเครดิต Fable ของคุณเหลือเท่าไหร่

ฉันคิดว่าการใช้เวลาคิดเล็กน้อยเกี่ยวกับระดับความพยายามนั้นคุ้มค่า จนกระทั่งเมื่อไม่นานมานี้ ฉันจะตั้งค่าโมเดลทั้งหมดให้ใช้ความพยายามสูงสุด ยกเว้นว่าฉันจะใช้โหมด Pro เต็มรูปแบบใน ChatGPT เท่าที่จำเป็น เพราะมันใช้เวลานานมาก และถ้าคุณรันมันแบบขนาน มันมักจะพัง บางครั้งฉันก็เปลี่ยนเป็นโหมด Instant สำหรับคำถามที่ฉันทำอะไรง่ายๆ มาก แต่ก็แค่นั้น ตอนนี้หลายครั้งที่คุณไม่ต้องการหรือไม่ต้องการความพยายามเป็นพิเศษ ดังนั้นฉันจึงใช้เวลาห้าวินาทีในการคิดว่าจะใช้การตั้งค่า High หรือ Max และบางครั้งก็ใช้ Instant

สำหรับงานส่วนใหญ่ ถ้าคุณไม่มีข้อจำกัดด้าน Token หรือเวลา และคุณไม่มั่นใจว่าคุณจะทำงานเสร็จหรือได้คำตอบที่ถูกต้อง วิธีที่ถูกต้องคือรันทั้ง Fable และ Sol หรือ Opus และ Sol หรือในบางกรณีรันทั้งสามตัว แล้วเลือกคำตอบที่ดีที่สุด หรือรวมส่วนต่างๆ ของคำตอบทั้งสองเข้าด้วยกัน

นั่นคือสิ่งที่ฉันทำอยู่ Sol และ Opus และ Fable ล้วนแตกต่างกัน ถ้าฉันต้องเลือกเพียงโมเดลเดียวสำหรับการแก้ไข ตาม EditorBench เชิงคุณภาพที่ไม่เป็นทางการของฉัน มีลำดับที่ชัดเจน: Fable 5 > Opus 5 > Sol อย่างไรก็ตาม Sol มีข้อสังเกตเฉพาะที่ไม่ซ้ำใครมากพอ แม้ว่าฉันจะพบว่ามันน่ารำคาญแค่ไหนในการคัดกรองการแจ้งเตือนที่ผิดพลาดแบบ authoritative และความพยายามที่จะข่มขู่ฉัน ฉันก็ยังต้องการรัน Sol ด้วย

สันนิษฐานว่าเร็วๆ นี้ เราจะกลับมาที่นี่อีกครั้งเพื่อทำสิ่งนี้อีกครั้ง และปรับการจัดสรรของเราสำหรับ Fable 5.1, สำหรับ GPT-5.7 หรือ GPT-6 หรือทั้งสองอย่าง มันง่ายที่จะเกิดอาการเบื่อหน่ายโมเดล

คำแนะนำที่สำคัญที่สุดของฉันคือ ให้น้อยใจเกี่ยวกับความผิดพลาดเล็กน้อยในการเลือกโมเดล และมุ่งเน้นเฉพาะความผิดพลาดครั้งใหญ่เท่านั้น คุณไม่จำเป็นต้องทำให้ถูกต้องแม่นยำเสมอไป เมื่อการสำรวจถูกทำให้เป็นโมฆะบางส่วนอย่างรวดเร็ว คุณจะต้องการย้ายทรัพยากรออกจากการสำรวจไปสู่การหาประโยชน์มากขึ้น

สร้างต่อใน YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
สำหรับครีเอเตอร์

เปลี่ยน Markdown ของคุณให้เป็นบทความ 𝕏 ที่สะอาดตา

เวลาคุณเผยแพร่งานเขียนยาวของตัวเอง การจัดรูปแบบรูปภาพ ตาราง และบล็อกโค้ดให้เข้ากับ 𝕏 นั้นน่าปวดหัว YouMind เปลี่ยนร่าง Markdown ทั้งฉบับให้เป็นบทความ 𝕏 ที่สะอาดตาและพร้อมโพสต์ทันที

ลอง Markdown เป็น 𝕏

แพตเทิร์นให้ถอดรหัสเพิ่มเติม

บทความไวรัลล่าสุด

สำรวจบทความไวรัลเพิ่มเติม