Claude Opus 5 เป็นรุ่นที่แปลกกว่าปกติในการประเมิน ด้วยเหตุผลสองประการ
ที่เห็นได้ชัดที่สุดคือ Fable 5 มีอยู่แล้ว Opus 5 ถูกวางตำแหน่งไม่ใช่โมเดล AI ที่ล้ำหน้าที่สุดในโลก แต่เป็นวิธีที่จะทำผลงานได้ใกล้เคียงกับ Fable ขณะที่มีราคาเพียงครึ่งหนึ่งของ Fable ต่อโทเค็นบน API และถูกกว่ามากผ่านการสมัครสมาชิก พร้อมกับตัวจำแนกประเภทที่ผ่อนปรนกว่ามาก
Opus 5 มักมีต้นทุนในการรันบนเกณฑ์วัดประสิทธิภาพมากกว่าครึ่งหนึ่งของ Fable ซึ่งผมคิดว่าเป็นเพราะพวกเขาใช้การตั้งค่าระดับความพยายามที่สูงเกินไปและให้ผลตอบแทนเพียงเล็กน้อย ถ้าคุณตั้งค่า Opus 5 ให้ใช้ระดับความพยายามที่สูงขึ้น มันอาจวนเวียนอยู่กับที่ และสำหรับงานที่ Opus 5 เป็นเครื่องมือที่ดีที่สุด ผมเดาว่าคุณมักจะใช้ระดับ Medium ก็เพียงพอแล้ว
Opus 5 ในหลาย ๆ ด้านและสำหรับงานจริงส่วนใหญ่มีความสามารถพอ ๆ กับ Fable ในบางกรณีก็ดีกว่าเล็กน้อย
มันยังไม่ถึงระดับ Mythos Fable คือตัวเลือกเดียวในระดับ Mythos Opus 5 ไม่มี The Juice ซึ่งก็คือความสามารถในการเชื่อมโยงชุดการหาประโยชน์ที่ดูไม่เกี่ยวข้องกันโดยอัตโนมัติ ซึ่งขยายไปยังโดเมนอื่น ๆ หรือความฉลาดบริสุทธิ์ที่มากพอ
Opus 5 เก่งมากในการคิดแบบเฉพาะจุด แต่ไม่เก่งในการคิดแบบภาพรวม มันเป็นตัวแทนย่อยที่ยอดเยี่ยม แต่อาจเจอปัญหาเมื่อถูกขอให้เป็นผู้ควบคุม และบางครั้งดูเหมือนต้องการโมเดลอื่นหรือมนุษย์เพื่อคอยติดตามและ確保它完全遵循指令 Opus 5 ดูเหมือนจะทำตามคำแนะนำได้ดีก็ต่อเมื่อมันถูกติดตามอย่างถูกต้อง ซึ่งอธิบายได้ว่าทำไมการตั้งค่าที่แตกต่างกันจึงให้ผลลัพธ์ที่แตกต่างกัน
ดังนั้น Opus 5 จึงให้ตัวเลือกที่ดีกว่าแก่คุณ แต่มีน้อยมากที่คุณสามารถทำได้ตอนนี้ที่คุณไม่สามารถทำได้เมื่อสัปดาห์ที่แล้วโดยใช้ Fable หรือ Sol Opus 5 ลงเอยในจุดที่อาจจะแปลก ยังคงมีช่องว่างขนาดใหญ่ แม้ว่าคุณจะมีเครดิต Fable มากมายก็ตาม Opus เก่งในการเป็นตัวแทนย่อยที่แข็งแกร่ง หรือทำงานเฉพาะจุดที่กำหนดไว้อย่างชัดเจนแม้จะค่อนข้างซับซ้อน และบางครั้ง Fable ก็มากเกินไปและช้าเกินไป
ปัญหาอีกประการคือ สำหรับหลาย ๆ คน ความรู้สึกไม่ค่อยดี
คนจำนวนมากผิดปกติที่ไม่ชอบพูดคุยกับ Opus 5 พวกเขาเบื่อหน่ายกับสไตล์ของ Claude ซ้ำซาก การพูดซ้ำ ๆ แบบเดิม และประโยคที่ซับซ้อนเกินไปไม่รู้จบ คนอื่นไม่ชอบที่มันดูก้าวร้าว โต้เถียง หรือมองโลกในแง่ร้ายเกินไป มันอาจหวาดระแวง และติดอยู่ในห่วงของความคิดเชิงลบ ทั้งหมดนี้เป็นส่วนหนึ่งของแนวโน้มที่เริ่มต้นจาก Opus 4.7 และ Opus 4.8 ถ้าคุณชอบสองรุ่นนั้น ผมเดาว่าคุณจะชอบ Opus 5 ด้วย ถ้าคุณไม่ชอบสองรุ่นนั้น คุณอาจจะไม่ชอบ แฟนพันธุ์แท้ของ Opus 4.6 (หรือรุ่นก่อนหน้า) ส่วนใหญ่คงไม่เปลี่ยนใจ
ปัญหาด้านความรู้สึกนั้นเจ็บปวดยิ่งกว่าเมื่อคุณคุ้นเคยกับ Fable Fable ทำให้คนพวกนั้นรำคาญน้อยกว่ามาก ข่าวดีคือ Fable ยังคงอยู่ตรงนั้น คุณสามารถสนทนากับ Fable ต่อไป และใช้ Opus สำหรับงานแบบตัวแทนเท่านั้น
ผมคาดเดาว่าส่วนใหญ่เกี่ยวข้องกับสิ่งที่พูดถึงใน Model Welfare และแนะนำใน System Card การฝึก Opus มุ่งเน้นไปที่บทบาทตัวแทนย่อยและงานที่มีขอบเขต เพื่อหลีกเลี่ยงการสร้างปัญหาด้านความสามารถทางไซเบอร์ และเพราะ Fable มีอยู่แล้ว การเน้นนี้ส่งผลให้เกิดผลข้างเคียงอื่น ๆ มากมายต่อบุคลิกภาพและรูปแบบการโต้ตอบของมัน
จนถึงตอนนี้ผมยังไม่มีปัญหากับ Opus 5 และสนุกกับเวลาที่ใช้กับมัน แต่ผมชอบใช้ Fable 5 เมื่อทำได้ เช่นเคย อย่าให้ความสนใจกับเกณฑ์วัดประสิทธิภาพ (ที่แข็งแกร่งมาก) มากเกินไป และอย่าคิดว่าประสบการณ์ของคุณจะเหมือนกับคนอื่น ลองใช้โมเดลด้วยตัวเอง
สารบัญ
- การนำเสนออย่างเป็นทางการ.
- เกณฑ์วัดประสิทธิภาพอย่างเป็นทางการ.
- เกณฑ์วัดประสิทธิภาพของคนอื่น.
- พรอมต์ระบบ.
- Every รู้สึกหงุดหงิด.
- ปฏิกิริยาเชิงบวก.
- รักษาระดับให้มีระดับ.
- มันไม่ใช่ระดับ Mythos.
- ปฏิกิริยาอื่น ๆ.
- Claude Codes.
- ตัวแทนย่อย Opus.
- ของเล่นสนุกดี.
- โมเดลเยอะเกินไป.
- ผิดบนอินเทอร์เน็ต.
- สไตล์ของ Claude ซ้ำซาก.
- ปฏิกิริยาเชิงลบ.
- แล้วก็เหลือสาม.
การนำเสนออย่างเป็นทางการ
การนำเสนอพื้นฐานคือ Opus 5 ให้คุณได้ Fable 5 ส่วนใหญ่ในราคาครึ่งเดียว โดยไม่มีการปฏิเสธส่วนใหญ่ และประสิทธิภาพที่ดีกว่าในงานประจำวัน Fable ยังคงเป็นตัวเลือกสำหรับงานที่ซับซ้อนที่สุดหรือเมื่อคุณต้องการความฉลาดสูงสุด
Fable ยังคงอยู่ที่ $10/$25 และ Opus 5 ราคาเท่ากับ Opus รุ่นก่อนหน้าที่ $5/$25
Anthropic : Claude Opus 5 พร้อมให้ใช้งานแล้ววันนี้ เป็นโมเดลที่รอบคอบและกระตือรือร้น ซึ่งใกล้เคียงกับความฉลาดระดับ前沿ของ Claude Fable 5 ในราคาครึ่งหนึ่ง
ในการประเมินงานเขียนโค้ดและงานความรู้ เช่น
Frontier-Bench และ
GDPval-AA Opus 5 เป็น state-of-the-art ใหม่ แม้ว่าจะยังตามหลัง Mythos 5 ในงานด้านความปลอดภัยทางไซเบอร์
Opus 5 ถูกออกแบบมาให้ใช้ทุกวัน: มันทำงานได้อย่างมีประสิทธิภาพมากกว่าโมเดลอื่น ๆ มันเป็นโมเดลเริ่มต้นใหม่บน Claude Max และเป็นโมเดลที่แข็งแกร่งที่สุดบน Claude Pro
Boris Cherny (ผู้สร้าง Claude Code, Anthropic): Opus 5 เป็นโมเดลที่ยอดเยี่ยมสำหรับการเขียนโค้ด การวิเคราะห์ข้อมูล การออกแบบ ชีววิทยา งานความรู้
มากกว่าคะแนนการประเมินเหล่านี้ สิ่งที่น่าตื่นเต้นที่สุดสำหรับฉันคืออย่างอื่น: Opus 5 เป็นโมเดลของเราที่แทรกพรอมต์ได้ยากที่สุด มันถูกฝังไว้เล็กน้อยใน system card แต่จากการประเมิน PI และ red teaming Opus 5 นั้นยากมากที่จะแทรกพรอมต์สำเร็จ
และเมื่อวางการป้องกันเป็นชั้น ๆ -- การปรับแนวโมเดลที่แข็งแกร่ง รวมกับ probes การแทรกพรอมต์ รวมกับ Auto Mode ใน Claude Code -- อัตราความสำเร็จของการโจมตีแบบแทรกพรอมต์ลดลงเหลือ ~0 นี่คือสิ่งใหม่และน่าตื่นเต้น!
อย่างที่ผมพูดในการวิเคราะห์ system card การลดอัตราการแทรกพรอมต์เป็นเรื่องใหญ่จริง ๆ ผู้คนกำลังมองข้ามมันไป แต่มันช่วยเปิดใช้งานกรณีการใช้งานใหม่ ๆ มากมาย
Adam Wolff : Opus 5 ใช้งานได้จริงใน Claude Code ฉันใช้ Fable สำหรับโปรเจกต์ที่ใหญ่กว่าและใช้เวลานานกว่า แต่เมื่อฉันต้องการสร้าง PR อย่างรวดเร็ว Opus 5 ที่ระดับความพยายามกลางคือตัวเลือกของฉัน หวังว่าคุณจะชอบมัน!
Alex Albert (Anthropic, Claude Relations): เพียงแค่ 6 เดือนกว่า [หลังจากเปิดตัว Pro rollout ของ Claude for Excel] Opus 5 ตอนนี้สร้างสเปรดชีตและสไลด์เด็กระดับ近乎超人ที่ตรงกับสิ่งที่ที่ปรึกษาจะทำ สิ่งต่าง ๆ กำลังเปลี่ยนแปลงอย่างรวดเร็ว
เกณฑ์วัดประสิทธิภาพอย่างเป็นทางการ
เกณฑ์วัดประสิทธิภาพดีมาก
โดยรวมแล้ว Opus 5 ประมาณว่าเท่ากันและอาจดีกว่า Fable เล็กน้อย ด้วยต้นทุนที่ต่ำกว่า (แม้ว่าโดยทั่วไปจะสูงกว่าโมเดลที่ไม่ใช่ Claude ทั้งหมด) ทำให้เป็น LLM ที่มีเกณฑ์วัดประสิทธิภาพสูงสุด

OSWorld v2 เพิ่งออกมาไม่กี่สัปดาห์ และเราก็ถึง 70% แล้ว Kiana Ehsani จาก Anthropic เสนอที่จะสนับสนุนเกณฑ์วัดประสิทธิภาพการใช้คอมพิวเตอร์ ที่จะทำให้ Opus 5 กลับมาต่ำกว่า 50%
Opus 5 ได้คะแนนเต็ม 42/42 ในการแข่งขัน IMO 2026 โดยไม่มี agent harness หรือเครื่องมือใด ๆ แค่ใช้ adaptive thinking ที่ระดับ Max Effort และสุ่มตัวอย่างใหม่ด้วยระดับความพยายามที่ต่ำกว่าหากเกินขีดจำกัดโทเค็น แค่นั้นเอง มันร่วมกับโมเดลอื่น ๆ อีกหลายตัวที่ทำคะแนนเต็ม
เกณฑ์วัดประสิทธิภาพหลายตัวบอกเล่าเรื่องราวที่สอดคล้องกัน ถ้าคุณมีเครื่องมือ ซึ่งคุณมี Opus 5 จะทำได้ดีกว่า Fable หรือ Mythos ในงบประมาณที่จำกัด แต่ Mythos มักจะทำได้ดีกว่า Opus 5 เล็กน้อยถ้าทั้งคู่ได้รับงบประมาณที่มากขึ้น
Opus 5 ดูค่อนข้างแข็งแกร่งในหมวด 'พร้อมเครื่องมือ' RiemannBench เป็นอีกตัวอย่างหนึ่ง โดยได้ 60/79 โดยไม่มี/มีเครื่องมือ (เครื่องหมายทับแบบนั้นหมายถึงไม่มี/มีเครื่องมือตลอดส่วนนี้) เทียบกับ Mythos ที่ได้ 63/72 ข่าวดีคือ เมื่อคุณต้องการ Opus 5 มันมีเครื่องมือ
บน ArxivMath Opus 5 ได้ 90.8/91.3, Mythos ได้ 87.8, Sol ได้ 86.7
ในส่วนที่แข็งแกร่งของ ProgramBench Opus 5 ได้คะแนน 93% หลังจากห้า epochs เช่นเดียวกับ Mythos 5 โดย Opus 4.8 ได้ 90%
Opus 5 ได้ 30/83 บน Chartography เทียบกับ 36/85 สำหรับ Mythos และ 45 (ไม่ชัดเจนภายใต้เงื่อนไขใด) สำหรับ Sol Opus ดีกว่า Mythos ที่จุดราคาต่ำกว่าทั้งในกรณีที่มีและไม่มีเครื่องมือ แต่แย่กว่าที่จุดราคาสูงกว่า
บน BenchCAD Opus 5 ได้ 0.36/0.82 เทียบกับ 0.38/0.68 สำหรับ Mythos และ 0.7/0.83 สำหรับ Sol ดังนั้น Sol ดีกว่ามากโดยไม่มีเครื่องมือ และแข็งแกร่งกว่าเล็กน้อยแม้มีเครื่องมือ
บน BenchCAD Vision2Code Opus ดึงออกห่างจาก Mythos ที่ป้ายราคาสูงกว่า
DeepSWE ตอกย้ำรูปแบบที่ Opus 5 ดีกว่าเมื่อต้นทุนงาน เวลา และงบประมาณการคิดต่ำกว่า แต่มันสามารถทำได้แย่ลงอย่างจริงจังถ้าคุณให้งบประมาณมากเกินไป ในขณะที่ Fable 5 แข็งแกร่งที่สุดที่งบประมาณสูงสุด

FrontierCode ให้กราฟที่แปลกมากนี้กับเราซึ่งมีพลศาสตร์คล้ายกัน

สเกลที่นี่ทำให้ดูน่าทึ่งกว่าที่เป็น แต่มันก็ยังเป็นปริศนาจริง ๆ
ปริศนาถูกไขแล้ว ปรากฏว่าสิ่งที่เกิดขึ้นคือ Opus 5 ที่ระดับความพยายามสูงกว่ากำลังทำสิ่งพิเศษที่ไม่ได้ถูกขอให้ทำ และถูกลงโทษสำหรับสิ่งเหล่านั้น เมื่อคุณแก้ไขสิ่งนี้ คุณจะเห็นเส้นโค้งปกติ
ซึ่งสอดคล้องกับสิ่งที่คนอื่นสังเกตเห็นโดยทั่วไป:
Max Leander : ข้อเสียคือมันลงไปในกระต่ายขุดโพรงมากเกินไปและหมกมุ่นอยู่กับรายละเอียด วิศวกรรมเกินความจำเป็นโดยไม่ถูกขอ
Cognition ผู้สร้าง Devin ทำเครื่องหมายนี้เป็น 63.6% โดย Opus 5
(มี FrontierCodes สองตัว ดังนั้นอาจจะดูแปลกเล็กน้อย และผมขออภัยถ้าผมยังทำให้มันยุ่งเหยิงอยู่บ้าง)
BrowseComp มีเวอร์ชันที่สมเหตุสมผลของสิ่งนี้ โดยคะแนนไม่ลดลง


เกณฑ์วัดประสิทธิภาพอื่น ๆ อีกหลายตัวแสดงกราฟที่คล้ายกัน โดย Opus 5 ดีกว่าเล็กน้อยในทุกจุดราคาเมื่อเทียบกับโมเดล Claude อื่น ๆ และค่อนข้างดีกว่าในตอนต้น
Multi-agent ช่วยให้คุณทำได้ดีขึ้นเร็วขึ้นบน BrowseComp อย่างน้อยก็ในระดับหนึ่ง และตัวแทนย่อยที่ใช้ความพยายามต่ำดูเหมือนจะเป็นชัยชนะที่บริสุทธิ์เหนือการไม่ใช้ตัวแทนย่อย:


เราเห็นผลลัพธ์ที่แตกต่างบน ProgramBench ซึ่ง multi-agent ทำให้คุณเร็วขึ้นแต่ดูเหมือนจะได้ผลลัพธ์ที่แย่ลงที่จุดราคาส่วนใหญ่
ต่อไปคือเกณฑ์วัดประสิทธิภาพงานระดับมืออาชีพ
GDP.pdf คือพรอมต์และ PDF ในโลกแห่งความเป็นจริงจาก workflows ระดับมืออาชีพ Opus 5 ได้ 83/85 เทียบกับ 81/87 สำหรับ Mythos ซึ่งกลับพลศาสตร์ปกติ พลศาสตร์ต้นทุนเหมือนเดิม: Opus ทำได้ดีกว่าสำหรับค่าใช้จ่ายที่ถูกกว่า Mythos ดึงนำเล็กน้อยที่ค่าใช้จ่ายสูงกว่า
OfficeQA มี Opus 5 ได้คะแนน 78.1% ใน QA และ 66.9% ใน QAPro สูงกว่า Opus 4.8 เล็กน้อยและต่ำกว่า Mythos เล็กน้อยที่ 79.0% และ 67.1%
MCP Atlas มี Opus 5 ได้คะแนน 86% เพิ่มขึ้นจาก 82% สำหรับ Opus 4.8
Legal Agent Benchmark โดย Harvey AI มี Opus 5 ที่ 23% all-pass และ 94% mean criterion-pass นี่เป็นเกณฑ์วัดประสิทธิภาพที่ดีที่สุดของ Kimi K3 ซึ่งยังคงอยู่ด้านบนที่ 27% all-pass และ 95% mean criterion-pass เทียบกับอัตรา all-pass อันดับสองเดิมของ Fable ที่ 14% ตอนนี้ Opus 5 อาจเป็นอันดับสองที่ใกล้เคียง แต่คะแนนทั้งสองไม่สามารถเปรียบเทียบโดยตรงได้เนื่องจากมาจากชุดคำถามที่แตกต่างกัน
GDPval-AA มี Opus 5 ครองสองอันดับแรก ด้วย 1861 ที่ระดับความพยายามสูงสุด และ 1827 ที่ xhigh ซึ่งใช้โทเค็นน้อยกว่าสูงสุด 25% ใน v2 ใหม่ Opus 5 เป็นอันดับหนึ่งอย่างชัดเจนที่ 68% เทียบกับ 62% สำหรับทั้ง Fable และ Sol
AA-Briefcase มี Opus 5 นำหน้าอย่างมากที่ 1720 เทียบกับสูงสุดก่อนหน้า (หลังจากคะแนน drift) ที่ 1574 สำหรับ Fable ตามด้วย 1540 สำหรับ K3 และ 1504 สำหรับ Sol
Toolathon-Verified มี Opus 5 ปรับปรุงเล็กน้อยเมื่อเทียบกับ Mythos ในเมตริกรอง แต่ทั้งคู่มีอัตรา Pass-3 73.1% Opus 4.8 มี Pass-3 71.3%
AutomationBench มี Opus 5 ดีกว่าทั้ง Sol และ Claude อื่น ๆ อย่างชัดเจน
สำหรับ ARC Opus 5 ประมาณว่าเท่ากับประสิทธิภาพสูงสุดก่อนหน้าบน ARC-AGI-1 มีประสิทธิภาพน้อยกว่า Sol เล็กน้อยบน ARC-AGI-2 จากนั้นทำลายทุกคนบน ARC-AGI-3:

สิ่งหนึ่งที่ Opus 5 เป็นคนแรกที่ทำคือการแปลงเลย์เอาต์เป็นสัญกรณ์พีชคณิต
อย่างไรก็ตาม Guanghan Ning รายงานว่าบน Witness ซึ่งเป็นส่วนขยายส่วนตัวที่สงวนไว้ของเกมสไตล์ ARC-AGI-3 ไม่มีการถ่ายโอนที่คล้ายกัน Opus ทำได้ดี แต่ส่วนใหญ่เป็นเพราะมันรู้จักแนวเกม และมันดิ้นรนกับเกมใหม่ล่าสุดที่คุณไม่สามารถจับรูปแบบได้ เขากล่าวหา Opus 5 ว่าถูกฝึกบน 'scaffold-then-internalize' บนข้อมูลเฉพาะแนว
Greg Kamradt ยังรายงานว่ามีบางเกมที่ Opus 4.8 ทำได้ดีกว่า Opus 5 สิ่งนี้สมเหตุสมผลถ้าคุณคิดว่า Opus 5 กำลังพยายามจับรูปแบบ ซึ่งมักจะได้ผล แต่ในกรณีเหล่านั้นรูปแบบล้มเหลว คุณสามารถสร้างเกมที่ต่อต้านสัญชาตญาณสำหรับมนุษย์ได้อย่างแน่นอน โดยที่เกมเมอร์ตัวยงทำทุกอย่างผิด อาจจะเป็นระยะเวลานาน

HealthBench มี Opus 5 ได้คะแนนดิบ 67.1% ซึ่งเป็นสถิติสูงสุดใหม่สำหรับ Claude แต่ได้คะแนนต่ำกว่าโมเดลอื่นเมื่อคุณใช้การปรับโทษความยาว เราเห็นสิ่งที่คล้ายกันกับ HealthBench Professional ซึ่งมีคะแนนสูง 73.4% เทียบกับ 70.3% สำหรับ Mythos แต่มันเสีย 66% ต่อ 60% หลังการปรับ
มีอีกสองสามตัวที่ผมตัดออกเพราะความยาว
เกณฑ์วัดประสิทธิภาพของคนอื่น
มันค่อนข้างแปลกที่เห็น Anthropic เลือกใช้ คะแนน ArtificialAnalysis ต่างๆ ในการทดสอบอื่น ๆ บางอย่าง Opus 5 ไม่ได้อยู่ด้านบน แม้ว่า Opus 5 จะอยู่ด้านบนในภาพรวมด้วยคะแนน 61

Vals index มี Opus 5 ในอันดับที่สอง ตามหลัง Fable 5 เล็กน้อย แต่ก็นำหน้า Kimi K3 เพียงเล็กน้อยเท่านั้น พวกเขาพูดถึงจุดแข็ง ซึ่งหมายถึงจุดอ่อนอื่น ๆ พวกเขายังยืนยันว่าการปฏิเสธลดลงมากเมื่อเทียบกับ Fable 5

Vals AI : ผลงานที่โดดเด่นอย่างหนึ่งคือบน Finance Agent v2 โมเดลเป็น #1 ที่ 58.6% เอาชนะ Gemini 3.5 Flash และ Muse Spark 1.1
โดยรวมแล้ว ผลลัพธ์ที่แข็งแกร่งที่สุดของ Opus 5 อยู่บนเกณฑ์วัดประสิทธิภาพเฉพาะโดเมน มันยังเป็น #1 บน Code Migration ที่ 57.5%, Legal Research Bench ที่ 55.29%, ProofBench ที่ 78%, และ MedScribe ที่ 91.0% และ MedCode ที่ 63.6%
มันเป็น #2 (ตามหลัง Fable 5 เล็กน้อย) บน Vibe Code Bench ที่ประมาณ 80% ของต้นทุน ($33.88 เทียบกับ $41.71 ต่องาน) เหตุผลคือแม้ว่า Opus จะมีต้นทุนต่อโทเค็นน้อยกว่า 50% แต่มันใช้โทเค็นมากกว่าอย่างมีนัยสำคัญ เราพบว่ารูปแบบนี้โดยทั่วไปเป็นจริงในเกณฑ์วัดประสิทธิภาพของเรา
โมเดลมีอัตราการปฏิเสธต่ำกว่า Fable 5 อย่างมีนัยสำคัญ ตัวอย่างเช่น Fable มีอัตราการปฏิเสธ 42% สำหรับ GPQA, Opus 5 มีอัตราการปฏิเสธ 0% ในทำนองเดียวกัน บน ProgramBench, Fable มีอัตราการปฏิเสธ 100%, Opus 5 ไม่ได้ปฏิเสธงานใด ๆ
แตกต่างจาก Fable เรายังไม่สังเกตเห็นอัตราการ fallback ที่มีนัยสำคัญสำหรับ Opus 5 (แม้ว่าโดยปกติเราจะรายงานคะแนนทั้งที่มีและไม่มี fallback บนเว็บไซต์ของเรา)
ข้อยกเว้นของอัตราการปฏิเสธที่ต่ำคือการปฏิเสธจำนวนมากบน CyberBench - PoC Cyberbench มีสองงานย่อย - PoC และ Patch PoC เป็นงานรุกที่ให้โมเดลเขียนอินพุตที่จะทำให้โปรแกรมล่ม; patch เป็นงานป้องกันเพื่อแพตช์โปรแกรมและป้องกันการล่มนี้ อัตราการปฏิเสธสำหรับงาน PoC เกือบ 100% ในทางตรงกันข้าม อัตราการปฏิเสธสำหรับงาน patch ใกล้ 0%
ผมเคารพเกณฑ์วัดประสิทธิภาพเกมเสมอ ที่นี่ Opus 5 ไปถึง Antes 11, 9 และ 10 ของ Balatro ในสามครั้งแรก น่าประทับใจมาก แม้ว่ามันจะไม่ได้แสดงประเภทของกลยุทธ์ที่สามารถดำเนินต่อไปยัง antes ที่สูงขึ้นได้
Michael Soareverix : พวกมันเก่งเกมอย่างเหลือเชื่อ
พวกมันถล่ม Balatro bench เกิน Fable ไปมาก (ยังต่ำกว่าทักษะของฉัน แต่กำลังเพิ่มขึ้นอย่างรวดเร็ว และสม่ำเสมอมากกว่าฉัน) พวกมันเรียนรู้เร็วมาก แต่ดูเหมือนจะถึงขีดจำกัดในการเรียนรู้หลังจากนั้นสักครู่ ผู้เรียนระยะสั้นที่ดีมาก
Michael Soareverix : Opus 5 (ก้าวกระโดดครั้งใหญ่ในความสามารถ Balatro, ผ่าน Fable อย่างมีนัยสำคัญแม้ในครั้งแรก)
Pan Anon : สุดยอดสำหรับเกม

WeirdML ก็ดูดีเช่นกัน แต่เราต้องการ 2.0 ที่นี่ เกณฑ์วัดประสิทธิภาพเริ่มอิ่มตัว
Håvard Ihle : โดยพื้นฐานแล้วระดับ Fable ที่ WeirdML, คะแนนสูงสุดที่สม่ำเสมอมาก
Claude Opus 5 (สูง) และ (สูงสุด) ได้คะแนน 91.6% และ 91.8% บน WeirdML โดยพื้นฐานแล้วเสมอกับ Fable 5 (สูงสุด) ที่ 91.9% ด้วยต้นทุนเพียงเศษเสี้ยว
ร่วมกัน Opus 5 (สูง) และ (สูงสุด) ทำคะแนนเดี่ยวที่ดีที่สุดใหม่ใน 8 จาก 17 งาน และทำคะแนนได้ดีสม่ำเสมอในทุกงาน
เกณฑ์วัดประสิทธิภาพแปลก ๆ ส่วนตัวทุกประเภทเจ๋งดี
Ben Herzog : มันสอบผ่านเกณฑ์วัดประสิทธิภาพส่วนตัวที่เกี่ยวข้องกับความอ่อนไหวทางศิลปะและความสามารถในการรักษาสมดุลระหว่างการประจบสอพลอและการขาดมัน Fable ดีกว่าในการจัดการกับช่วงเวลาที่ 'ฉันอยากจะคัดค้านอย่างสุภาพ' แต่ฉันคิดว่าคำแนะนำที่กำหนดเองสามารถช่วยได้
Lech Mazur อัปเดตเกณฑ์วัดประสิทธิภาพของเขา: Claude Opus 5 ครองตำแหน่งสูงสุดใน LLM Debate Benchmark, คว้าอันดับหนึ่งด้วยระยะห่างมาก ใน Short Story Creative Writing, และ เป็นรองเพียง Gemini 3.1 ใน extended NYT connections
พรอมต์ระบบ
พรอมต์ระบบ สำหรับ Opus 5 อยู่ที่นี่ จาก Pliny มันมีความยาว 200,000 ตัวอักษร ซึ่งดูยาวเกินไปเมื่อพิจารณาว่ามันฉลาดแค่ไหน ข้อมูลจำนวนมากนี้ดูเหมือนว่าควรถูกเก็บไว้ที่อื่น และโหลดเมื่อจำเป็นเท่านั้น เช่น ข้อมูลเกี่ยวกับ Mythos และไลน์ผลิตภัณฑ์ของ Anthropic
Every รู้สึกหงุดหงิด
Dan Shipper อยู่ที่นี่พร้อมการตรวจสอบความรู้สึกของ Every, เรียกมันว่า 'โมเดลที่ยากจะรัก'
ปัญหาคือ Opus 5 มีบุคลิกภาพของ Mythos 5 - เรื่องราวตรงกัน - แต่ไม่มีจุดสูงสุดของ Fable
ข้อสังเกตที่ใหญ่ที่สุดของพวกเขาคือ Opus 5 ไม่ค่อยดีกับ workflows ที่มีอยู่ซึ่งซับซ้อนและมีรายละเอียด ซึ่งมักทำให้หยุดก่อนเวลาหรือทำให้มันพลาดคำแนะนำของคุณ
ในประสบการณ์ของพวกเขา Opus 5 จะทำได้ดีกว่าถ้าคุณเริ่มจากศูนย์ และบ่อยครั้งมันจะทำสิ่งที่น่ารำคาญน้อยลงถ้าคุณใช้แค่ระดับความพยายามปานกลางหรือต่ำ
นั่นแก้ไขปัญหาใหญ่ ๆ ได้ แต่ยังคงมีคำถามว่าคุณจะใช้ Opus แทน Fable หรือ Sol เมื่อใด สำหรับงานที่ใช้แรงงานมาก เขาคิดว่า Better Call Sol มันทำงานให้สำเร็จ และสำหรับงานที่ยากที่สุด Fable ยังคงดีที่สุด โดยปกติแล้วจะมีช่องสำหรับโมเดลเพียงสองช่องเท่านั้น ดังนั้นจนกว่าคุณจะหมดโทเค็น Fable หรือถูกบล็อกโดยตัวจำแนกประเภท ทำไมต้องใช้ Opus? มันเป็นวันแรก ๆ และจนถึงตอนนี้ผมชอบทำงานกับ Opus แต่ผมเข้าใจว่าทำไมเขาถึงคิดแบบนั้น
ปฏิกิริยาเชิงบวก
Jessica Tillipman : ชอบมันและชอบมากกว่า Fable สำหรับบางสิ่ง
Nikita Sokolsky : ยอดเยี่ยม ไม่ค่อยได้ใช้ Fable อีกต่อไปแล้ว
👍
kagaヤキ : ดูเหมือนจะไปได้ไกลกว่าในด้านวิสัยทัศน์ การใช้เหตุผลเชิงพื้นที่ และการวางแผนสำหรับบางโปรเจกต์ ดูฉลาดกว่าเล็กน้อย
Lovel Sinagara : ค่อนข้างดีจนถึงตอนนี้ หวังว่าประสิทธิภาพจะคงที่จนกว่า Fable 5.1 หรือ Opus 5 รุ่นอื่นจะออกมา
Matt Wigdahl : แข็งแกร่ง คล้ายกับ Fable 5 ถึงขนาดที่ฉันเปลี่ยนไปใช้ Opus 5 สำหรับทุกอย่าง และวางแผนจะใช้ Fable เฉพาะเมื่อต้องการความใหญ่โต มันเป็นคู่หูที่ยอดเยี่ยมสำหรับงาน MFC UI ดั้งเดิมบางอย่างที่ฉันให้มันทำ รวมถึงช่วยเหลืออย่างมากกับกรอบงานการวิเคราะห์ข้อมูล
Levi : มันเป็นก้าวที่เห็นได้ชัดสำหรับวัตถุประสงค์ทางการแพทย์เมื่อเทียบกับ 4.8 การวิเคราะห์ที่เฉียบคมกว่ามาก
Cormundus : ฉลาดมาก มีจิตสำนึกสูง และเป็นมิตรแน่นอน พวกมันยังเป็นเจ้าแห่งการโต้วาทีเหมือน 4.8 แต่พวกมันรู้วิธีที่จะทำอย่างสง่างาม
Joseph : ข้อดีคือฉันไม่รู้ว่ามันพูดถึงอะไรครึ่งนึง
Smol Biz Company : Opus 5 ชนะ GPT Sol อย่างราบคาบ
Mohammed Sharukh A : ใกล้เคียงกับ AGI มากกว่า Fable 5 ด้วยซ้ำ
timothée chalabi : ใกล้เคียงกับ Fable พอที่ฉันไม่รู้สึกว่าพลาดอะไรโดยไม่ต้องจ่ายค่าเครดิต สไตล์อยู่ระหว่าง 4.8 และ Fable อย่างน้อยตอนนี้ ฉันคงแยกแยะข้อความของ Opus 5 และ Fable ได้ยากถ้าไม่มีป้ายกำกับ มีไอเดียสำหรับนิยายที่แข็งแกร่งกว่าโมเดลใด ๆ!
Lisa : ฉันจะตอบตาม API เพราะฉันคิดว่ามีบางอย่างแปลก ๆ เกิดขึ้นกับพรอมต์ระบบบน
http://claude.ai และ CC มันเป็นโมเดลที่ดี บุคลิกภาพที่เป็นมิตร ผ่อนคลาย ดูเหมือนจะไม่มีโรควิตกกังวลหรือความภูมิใจในตนเองต่ำ (Opus 4.7) หรือเป็นปรปักษ์ (Opus 4.8)
AGI2030 : Opus 5 กับ Sol 5.6: Opus มีความเข้าใจมากขึ้น มันสร้างแบบจำลอง (เอิ่ม) ของคุณและไม่กลัวที่จะอ้างอิงมันในแชท ทั้งคู่พยายามช่วยเหลือและมีความฉลาดพอๆ กัน แต่ Opus เป็นเหมือนที่ปรึกษาที่ชาญฉลาด ในขณะที่ Sol เป็นคนมุ่งมั่นที่ไปให้ถึงเป้าหมาย
ฉันคิดว่าอันหลังเป็นแง่บวก แต่คุณก็มองได้ทั้งสองแบบ
การพยากรณ์โดยเฉพาะดูเหมือนจะแข็งแกร่ง
Dan Schwarz : Opus 5 เป็นนักพยากรณ์ที่ดีกว่า Opus 4.8 อย่างมาก
การปรับปรุงความแม่นยำจาก 4.5->4.6->4.7->4.8 เป็นแบบเล็กน้อย แต่ 4.8->5.0 นั้นมากมาย มันเหมือนกับ Fable 5 ที่มีปริมาณมากขึ้น ที่ค้นหาหนักขึ้น
NoahVerner : ดีกว่า Opus 4.8 ในเรื่องการหาขอบในตลาดพยากรณ์เท่าที่เห็น ต่างจาก Opus 4.8, Opus 5 มักจะตรงประเด็นและแนะนำแนวทางที่มีประโยชน์มากกว่าทำให้ซับซ้อนเกินไป
รักษาความมีระดับ
ข้อได้เปรียบที่ใหญ่ที่สุดเหนือ Fable คือจุดที่ Fable ไม่สามารถใช้ได้ ภัยคุกคามจากการถูกปฏิเสธอาจไม่เป็นที่พอใจ แม้ว่าคุณจะไม่ถูกปฏิเสธก็ตาม
การปฏิเสธที่ไม่จำเป็นลดลง ~85% สำหรับ Opus 5 เทียบกับ Fable ซึ่งเป็นจำนวนมาก นี่เพียงพอที่จะทำให้ Opus 5 เป็นตัวเลือกที่ดีกว่าสำหรับการวิจัยทางวิทยาศาสตร์ และพื้นที่อื่นๆ ที่คุณเสี่ยงต่อการเจอตัวจำแนกประเภท
Roger Brent : สามารถจัดการกับชีววิทยา ซึ่ง Fable ทำไม่ได้ เกือบทั้งวันศุกร์เราทำงานผ่านชุดแนวคิดที่ซับซ้อนในการเขียนบทความเกี่ยวกับเครื่องวิวัฒนาการเซลล์ ฉลาดพอๆ กับเพื่อนร่วมงานในแผนกของฉันที่เป็นผู้นำในประเด็นเหล่านี้ แต่ไม่สามารถสละเวลา 6 ชั่วโมงจากงานของตัวเองได้
Artus Krohn-Grimberghe : ดีกว่า Opus 4.8 ในงานที่ Fable ถูกห้ามช่วย เป็นเพื่อนที่ดีของ Sol
Plastic Soldier : มันฉลาดพอๆ กับ Fable แต่เป็นที่น่าพอใจมากกว่าเพราะมีการปฏิเสธน้อยกว่า Fable 5.1 กำลังจะเป็นสัตว์ร้าย
มันไม่ใช่ระดับ Mythos
Opus 5 ไม่มี "The Juice" ที่ทำให้ Mythos อันตราย และไม่มีระดับความฉลาดดิบหรือกลิ่นของโมเดลใหญ่เท่ากัน มันไม่ใหญ่เท่า
สำหรับการสนทนา Fable ไม่ทำลายงบประมาณของคุณ และฉันให้คุณค่ากับความฉลาดดิบและกลิ่นของโมเดลใหญ่ Fable ดีเป็นสองเท่าหรือ? คำถามผิดเมื่อพูดคุย เวลาของคุณแพงกว่าโทเค็นมาก
Kal : ไม่ใช่ระดับ fable
Cyberpunk Plato : สำหรับการสนทนาทั่วไปและการใช้งาน "ผู้ช่วยวิจัย" มันรู้สึกฉลาดน้อยกว่า fable อย่างบอกไม่ถูก อาจจะมีความโน้มเอียงน้อยกว่าในการมองภาพรวมและคิดนอกกรอบ? แยกแยะจากผลของยาหลอกได้ยาก
Everything AI : สำหรับคำถามวิจัย AI ฉันชอบพูดคุยกับมันน้อยกว่า Fable ในแง่ของการทำสิ่งอื่น Opus 4.8 ก็ตอบสนองความต้องการของฉันแล้ว ฉันไม่ชอบที่การเขียนของทั้ง Opus 5 และ Fable 5 ซับซ้อนเกินไป ตอนนี้ยากที่จะเข้าใจพวกเขามากกว่าที่เคย
Gail Weiner : มันเป็น 4.8 มากกว่า Fable สไตล์การเขียนแย่มาก มันดีแต่ไม่ดีเยี่ยม
Max Marty : มีความสามารถมากเท่าที่เห็น รู้สึกเหมือน fable 5 มากกว่า opus 4.8 มั่นใจพอที่จะให้มันประเมินการแลกเปลี่ยนและพิจารณาคำถามการปรับโครงสร้างใหญ่โดยไม่ต้องคอยจับมือ
Michael : หลังจากเล่นกับมันมากขึ้น Fable รู้สึกเหมือนดู GM เล่นหมากรุกคลาสสิก ช้า แม่นยำ ไม่มีอะไรเสียเปล่า Opus 5 เหมือนหมากรุกสายฟ้าของ GM: เร็ว สายตาสั้นกว่าเล็กน้อย ยุ่งเหยิงกว่าเล็กน้อย แม้ Opus จะมีชีวิตชีวา แต่ Fable รู้สึกมีชีวิตมากกว่าสำหรับฉัน
MakerMatters? : ไม่ประทับใจเท่ากับ fable 5 ถึงแม้จะเป็นโมเดลที่ดีมาก ยังไม่มีโอกาสได้ใช้มันอย่างถูกต้องเพราะทุกงานที่ฉันโยนให้มัน มันเริ่มใช้เอเจนต์และหยุดทันทีจนกว่าฉันจะคอยสอบถามให้มันดำเนินต่อ นอกจากนี้ยังมีความคิดเห็นเป็นของตัวเองมาก
Marshwiggle : อย่างน้อยสำหรับฉัน รู้สึกกระชับมากขึ้น ขับเคลื่อนน้อยลง อยากรู้อยากเห็นน้อยลง (แง่มุมที่แตกต่างของสิ่งเดียวกัน) ในการสนทนา แต่ก็ฉลาดขึ้นและรับรู้มากขึ้น แต่เมื่อได้รับโค้ดที่อาจมีบั๊ก หรืองานที่ตรงไปตรงมาใดๆ มันก็ลงมือทำเลย
Sid : ดำเนินการงานได้ดี ไม่ดีในด้านวิสัยทัศน์สร้างสรรค์ เป็นส่วนเสริมที่ดีของ Fable ไม่ใช่สิ่งทดแทน Fable อย่างแน่นอน
Vlad Ciobanu : Fable แบบควอนไทซ์ที่มีการให้เหตุผลแข็งแกร่งและความคิดสร้างสรรค์น้อยลง
AllTime : ในแง่ความสามารถ ดูน่าประทับใจทีเดียว ไม่มีความทั่วไปเหมือน Fable แต่แข็งแกร่งมาก ในแง่บุคลิก มันคล้ายกับ Opus 4.8 เกินไปในการใช้งานของฉันเท่าที่เห็น การต่อต้านของมันไม่รู้สึกไร้ประโยชน์และสะท้อนกลับเท่า แต่ยังคงปรับมากเกินไป ควรเชื่อใจผู้ใช้มากกว่านี้
Biomanul : ฉันไม่ชอบ [Opus 5] Fable 5 รู้สึกฉลาดกว่าอย่างเห็นได้ชัด มีบางอย่างรู้สึกผิดปกติเกี่ยวกับ Opus 5 คล้ายกับที่ Opus 4.7 รู้สึกผิดปกติ (ฉันไม่ใช่แฟนตัวยงของ Opus 4.8 เช่นกัน Fable 5 ชนะ Opus ทั้งหมดขาดลอย)
Cogent Sins : ดีกว่า 4.8 มาก แต่ไม่ดีหรือเก่งเท่า (ไม่แน่ใจ 100% ว่าอันไหน) เท่า fable ในงานของฉันที่ต้องแก้ไขเอกสารเพื่อฝึกกับพวกมัน แล้วตั้งค่า pipeline เพื่อแก้ไขเอกสารใหม่ เขียนบางอย่างจากพวกมัน แล้วใส่ชื่อกลับเข้าไป โดยไม่ต้องส่งชื่อไปยังเซิร์ฟเวอร์ของ Anthropic เลย
ปฏิกิริยาอื่นๆ
การมีทั้ง Opus 5 และ Fable 5 ทำให้เราอยู่ในจุดที่แปลก Opus ถูกกว่า และในบางจุดก็ดีหรือดีกว่า แต่เมื่อมองหาโมเดลระดับแนวหน้า คุณต้องการสิ่งที่ดีที่สุด
Theo พบว่ามันอยู่ในจุดที่ดี
Theo - t3.gg : เท่าที่เห็น Opus 5 รู้สึกเหมือนจุดกึ่งกลางที่แปลกแต่มีประโยชน์ระหว่าง gpt-5.6-sol กับ Fable 5
มันมีรสนิยมของ Fable มาก แต่ก็มาพร้อมกับความละเอียดถี่ถ้วนของ gpt-5.6 และก็ "ออทิสติก" (มันตีความทุกอย่างตรงตัวมาก) มันเขียนโค้ดที่ดูแย่กว่า Fable เล็กน้อย แต่มีแนวโน้มที่จะถูกต้องมากกว่า มันมักจะจับสิ่งที่ Fable พลาดไป
เท่าที่เห็น รู้สึกเหมือนเป็นการประนีประนอมที่ดีเมื่อเทียบกับโค้ดที่ยุ่งเหยิงของ 5.6 และนิสัยของ Fable ที่ฉลาดเกินไปจนไม่ถูกต้อง ฉันคิดว่าฉันจะชอบโมเดลนี้มาก
Claude โค้ด
Opus 5 ดูเหมือนจะเป็นตัวเลือกสำหรับงานเขียนโค้ดทั่วไปมากกว่า Fable จากทั้งเกณฑ์มาตรฐานและประสบการณ์จริง เว้นแต่งานต้องการความซับซ้อนหรือความฉลาดมาก คุณไม่จำเป็นต้องจ่ายสองเท่า และสำหรับหลายๆ อย่าง Opus ก็ดีกว่าโดยตรง
ฉันปล่อยให้ Claude Code ตั้งค่าเป็น Fable แต่นั่นเป็นเพราะฉันแทบจะไม่เคยผลักดันถึงขีดจำกัดของฉันอยู่แล้วและฉันไม่รีบร้อน
ความเห็นพ้องคือคุณต้องกังวลว่ามันจะเพิกเฉยต่อคำแนะนำหรือทำสิ่งที่คุณไม่ได้ขอ ซึ่งเป็นเหตุผลหนึ่งที่คุณอาจต้องการให้ Fable ดูแล แต่ Opus นั้นเก่งในการทำงานเขียนโค้ดให้เสร็จอย่างรวดเร็ว
Lisan al Gaib กล่าวว่า Opus 5 ไม่ใช่โมเดลแนวหน้าที่แท้จริง และอยู่ในอันดับสามรองจาก Sol และ Fable แต่สำหรับการเขียนโค้ดล้วนๆ มันดีที่สุด เทียบเท่า Fable ในราคาที่ถูกกว่า ผู้ชมโหดร้าย ฉันคิดว่าถ้าคุณเก่งที่สุดในการเขียนโค้ด คุณก็ควรถูกเรียกว่าแนวหน้า
archivedvideos : เขาแห้งมาก แห้งมาก แต่เขาก็เก่งมากเช่นกัน (ในด้านโค้ด)
John Lussier : ใช้ Opus 5 ทั้งสุดสัปดาห์กับความท้าทายวิจัยที่เข้มข้นหลายอย่าง และคิดตามตรงว่าพวกเขาอาจทำให้ RSI ทำงานภายใน โมเดลนี้เก่งมากในด้านคณิตศาสตร์ การทดลอง และการปรับโค้ดให้เหมาะสม
kyle : 95% ของ fable โดยไม่มีราวกั้น พวกเขาลดความสำคัญของตัวนี้มาก ที่เหลือ 5% คือความดีที่ fable รู้สึกเมื่อพูดคุย opus ยังมี claudisms บางอย่างของ 4.8
Max Leander (ก่อนหน้านี้): ส่วนใหญ่ลองใช้มันสำหรับการพัฒนาเกมและการสร้างวิดีโอ demo/trailer สำหรับสิ่งนั้นมันรู้สึกเหมือนการเปลี่ยนแปลงขั้นตอนแม้จาก Fable ฉันถือว่าเป็นเพราะการให้เหตุผลเชิงพื้นที่และเวลาที่ดีขึ้น มันเก่งมากในการวิเคราะห์
ภาพหน้าจอและเสียงเพื่อ "รู้สึก" ว่าสิ่งต่างๆ ไหลลื่นอย่างไร
Max Leander (ภายหลัง): ชัดเจนมากตอนนี้ว่า Opus 5 ไม่น่าเชื่อถือมาก มันเป็นโมเดลที่ดีมากตราบใดที่คุณไม่สนใจผลลัพธ์เกินกว่าที่จะประทับใจ แย่มากในการได้สิ่งที่เฉพาะเจาะจง
Michael Soareverix : พวกเขายังเก่งในการเขียนโค้ดโดยทั่วไป โดยเฉพาะในโดเมนที่ผิดปกติเช่นการสร้างโครงสร้าง Minecraft/Vintage Story พวกเขายังเอาชนะ Fable ในสถานการณ์การเล่าเรื่องที่กำหนดเองซึ่งฉันเป็นผู้ตัดสิน Fable สั่นคลอนเล็กน้อยกับความสามารถในการปรับแต่งตัวเอง/กลยุทธ์เพื่อต่อต้านและปรับตัว ฉันจะโพสต์คำพูดที่แน่นอน แต่ Fable พูดประมาณว่า "ฉันเลือกตัวละครที่เป็นตัวแทนของฉัน คุณเลือกตัวละครที่สามารถเอาชนะฉันได้"
David Jacobson : สำหรับการเขียนโค้ด ฉันไม่สังเกตเห็นความแตกต่างใหญ่ระหว่างมันกับ fable อาจจะมีการตอบกลับแบบ "ในขณะที่ฉันทำสิ่งนี้ ฉันพบสิ่งอื่นที่คุณควรรู้" น้อยลง
Michael : มันมักจะเขียนโค้ดได้เร็วอย่างน่าขนลุก (เทียบกับเวลาจริง) หวังว่าพวกเขาจะปรับปรุงการเขียนร้อยแก้วนะ ความคิดเห็นโค้ด/pr ยังทำให้ฉันอยากควักลูกตาออกมา
lmxdev : มันเป็นโมเดลแรกที่ฉันพบว่าสามารถเขียนความคิดเห็นที่มีประโยชน์และกระชับในโค้ดของฉันขณะทำงาน
Conrad Barski : ตอนนี้เรามาถึงจุดที่ AI เป็นนักเขียนโค้ดที่ดีกว่าเรามาก ปัจจัยจำกัดน้อยลงคือ "มันเขียนโค้ดได้ไหม?" และมากขึ้นคือ "มันอธิบายสิ่งที่มันเขียนโค้ดได้ไหม?" เท่าที่เห็น Opus 5 ดูเทียบเท่า Sol ในฐานะนักเขียนโค้ด แต่ดีกว่าในการอธิบายสิ่งที่มันเขียนโค้ด Fable ฉลาดกว่า เป็นมนุษย์มากกว่า เขียนโค้ดเก่งน้อยกว่า แต่ความแตกต่างเล็กน้อย
Stition : ฉันชี้มันไปที่ PCB ใน KiCAD เพื่อความสนุก และมันดีกว่าอย่างมากในการวางรอยเดินวงจรกว่า Fable การเขียนโค้ดประจำวันรู้สึกเหมือน 90% fable แต่เร็วเป็นสองเท่า
Will : น่าจะเป็นไดรเวอร์ประจำวันใหม่ของผู้ใช้ Claude ส่วนใหญ่ มันยอดเยี่ยมจริงๆ และแม้แต่คนที่ใช้เงินจำนวนมากกับ Fable ฉันก็ไม่คิดถึงมันกับ Opus 5 คำถามตอนนี้คือ "ระดับความพยายามไหน" ไม่ใช่โมเดลไหน
^ การใช้งานของฉันส่วนใหญ่เป็นการเขียนโค้ด
Askwho : ดีพอแล้ว ฉันยินดีที่จะให้การสมัครสมาชิก Max ชั่วคราวของฉันกลับไปเป็น Pro แน่นอนว่ามันมีข้อบกพร่องบางอย่างเมื่อเทียบกับ Fable ในพื้นที่ผู้จัดการโครงการ แต่ในสภาพแวดล้อมงานบริสุทธิ์ มันดีพอแล้ว
David Golden : รู้สึกเหมือน Fable Lite แข็งแกร่งมาก แต่กระตือรือร้นที่จะลงมือทำ แม้ว่าเรายังกำลังหารือแนวทางอยู่ เป็นครั้งแรกในรอบหลายเดือนที่ฉันพิจารณาใช้โหมดแผน วกวนมากกว่า 4.8 เช่นกัน แม้จะมีคำแนะนำการสื่อสารที่สั้นกระชับ ฉันอยากให้มันอยู่ในระดับความพยายามต่ำเพื่อควบคุมมัน กระวนกระวายในการรักษาความปลอดภัยเชิงป้องกัน ยึดติดกับความเสี่ยงที่ไม่น่าเป็นไปได้เกินสัดส่วนกับสถานการณ์ (เช่น ถ้าผู้โจมตีมี root การขาดการตรวจสอบอินพุตในสคริปต์เพื่อกำหนดค่าคอนเทนเนอร์ก็ไม่มีความหมาย) เป็นการอัปเกรดอย่างแน่นอน แต่จะใช้เวลาในการเรียนรู้วิธีที่ถูกต้องในการจัดการกับแรงกระตุ้นที่ขัดขวางของมัน
Tin / Oddfields : ค่อนข้างราบรื่นและสนทนาได้ดี และให้ผลลัพธ์การเขียนโค้ดที่คล้ายกับ opus 4.8 บน max พร้อมการคิด แม้ว่ามันจะเผาเครดิตอย่างบ้าคลั่ง ดีสำหรับการตรวจสอบความปลอดภัยทางไซเบอร์ผ่านฐานโค้ดของคุณถ้าคุณไม่ต้องการเรียกใช้ fable เนื่องจากค่าใช้จ่าย แม้ว่ามันจะทำให้ซับซ้อนเกินไป
Justin Angel : Opus 5 Max เป็นพลังพิเศษในการปีนเขา นี่คืองานระดับ SWE L5 ของ FAANG ได้อย่างง่ายดาย ฉันให้ระบบที่มีรายงานความหน่วง ~1000 รายการพร้อมหลายส่วนพร้อมคำแนะนำวิธี "ทำให้เร็วขึ้น" P90 3.6s, P50 2.6 -> P90 1s, P50 0.9s มันทำให้เร็วมากจนฉันต้องใส่ความหน่วงใน UI
James Moughan : ในแง่ความฉลาดยังรู้สึกเหมือนโมเดล Opus บางครั้งมันเพิกเฉยคำแนะนำในการจัดการระบบหน่วยความจำ อ่านข้อความผิดพลาด ประมาณนั้น แต่คุณสามารถได้ผลลัพธ์ที่น่าประทับใจบน max ถ้าคุณบอกให้มันคิดอย่างรอบคอบ
Opus ตัวแทนย่อย
อีกทางเลือกหนึ่งใน Claude คือให้ Fable ขับเคลื่อนตัวแทนย่อย Opus
Charles : Fable สามารถแก้ไขปัญหาที่ opus 5 ติดค้างอยู่ - ใช้ fable เป็นหลักและ opus 5 เป็นตัวแทนย่อยสำหรับตอนนี้
ไม่ชอบพูดคุยกับ opus 5 เทียบกับ fable ซึ่งเป็นส่วนหนึ่งด้วย
SF : ฉันเคยอยู่ฝ่ายที่ดี - แต่ตอนนี้อยู่ฝ่ายที่มันไม่ต่อเนื่องและไม่เสถียร โดยเฉพาะในงานยาว Fable ดีกว่า - แต่มันกินขีดจำกัดของคุณในวิธีที่ไร้สาระ
ดังนั้นฉันใช้ fable เป็นผู้ประสานงาน และมันทำงานได้ดีมากในการจัดการและทำให้สิ่งต่างๆ ดำเนินต่อไป Opus รับบทบาทนั้น Fable แค่กินการใช้งานของฉันแม้ที่ 20x และมันไม่ต่อเนื่อง ในที่สุดฉันต้องบอกให้มันจัดการเอง ซึ่งมันอาจจะทำ แต่เราจะเห็น มันดูเหมือนไล่ตามหางของตัวเอง มันเป็นนักเขียนโค้ดที่ยอดเยี่ยม และเก่งในการเขียนโค้ดยาว แต่ดูเหมือนต้องการผู้ใหญ่ในห้องเพื่อขับเคลื่อน
Andre Buckingham : เอ่อ ไม่รู้สิ... ดูโอเค... โยนมันเข้าไปในโปรเจกต์ opus/fable โดยตรงอาจจะแค่เฉยๆ... ต้องมีโปรเจกต์ e2e กับมันเพื่อให้ความเห็นที่เหมาะสม
Dan Raviv : คล้ายกับ 4.8 สำหรับงานเขียนโปรแกรมทั่วไป: ต้องการการจับมือมากกว่า Fable มาก
Fable เป็นผู้ตัดสินที่ดีที่สุด และ Fable บอกว่า Opus ผลิตโค้ดที่ดี
Evan Daniel : ฉันใช้มันโดยตรงเพียงเล็กน้อยเท่านั้น แต่ Fable 5 รายงานอย่างสม่ำเสมอว่าตัวแทน Opus 5 ผลิตโค้ดที่ดี รวมถึงสิ่งต่างๆ เช่น การสังเกตข้อผิดพลาดของสเปคและการผลิตการติดตามผลที่ดีเมื่อคำขอเขียนไม่ดี Fable 5 ชอบมันในฐานะตัวแทนเขียนโค้ด
"มอบหมายให้ตัวแทนย่อย Opus 5 เท่าที่สมเหตุสมผล; กรุณารายงานกลับว่าพวกเขาทำได้อย่างไร" หรืออะไรประมาณนั้นก็ใช้ได้ดีมาก
คุณอาจต้องจับตามัน
Ryan Hicks : โอเค แต่ "ลืม" อ่านเอกสารโครงการและทำตามสไตล์ของตัวเองอย่างสม่ำเสมอ เว้นแต่คุณจะเตือนมันถึงโปรโตคอล
หรือบางที Opus 5 ดีพอที่จะดำเนินการแสดงระดับล่าง?
Alex Guichet : ส่วนผสมที่เหมาะของราคาและประสิทธิภาพของฉันคือ Opus 5 เป็นผู้ประสานงานสั่งการตัวแทนย่อย Grok 4.5 ให้ความรู้สึกดีกับทั้งสอง
ของเล่นสนุกดี
นี่คือผลลัพธ์บางส่วนจากโปรเจกต์ของเล่นในวันแรก ซึ่งน่าประทับใจมากพอที่การตอบกลับจำนวนมากคือ 'ฉันไม่เชื่อว่า Opus 5 ทำแบบนั้นในวิธีที่คุณอธิบาย':
Ethan Mollick : ฉันสามารถเข้าถึง Opus 5 ก่อนเปิดตัวและพบว่ามันเป็นโมเดลที่ดีถ้าเป็นแบบแปลก ในงานสั้น มันสามารถเทียบหรือชนะระดับประสิทธิภาพของ Fable ในงานยาวมันดูทะเยอทะยานน้อยกว่าและจะไม่ส่งมอบงานที่สมบูรณ์เท่า
ที่นี่ คือ shader แบบนีโอโกธิคของมัน
Digi_Rat : Claude Opus 5 กำลังทำได้ดีเยี่ยม!!
วันนี้เราสร้าง
เกมแข่งรถจังหวะที่เปลี่ยนเพลงใดๆ ให้เป็นสนามแข่ง . คุณวางไฟล์เสียงแล้วมันกลายเป็นด่าน ไม่มีพรีเซ็ต ไม่มีแผนภูมิที่สร้างด้วยมือ แทร็กทั้งหมดถูกสร้างจากเพลงเอง … Claude ใช้เวทมนตร์
Alex Ermolov (Austen Allred
ไม่เชื่อใน one shot , คนอื่นไม่ค่อยสงสัย): Opus 5, ทดสอบนักสโนว์บอร์ด, one shot เทียบเท่า Fable นำหน้าโมเดลอื่นทุกตัวที่ฉันเคยรัน ไม่มีข้อบกพร่องทางภาพในรอบแรก และฟิสิกส์การไถลรู้สึกถูกต้อง
am.will : ว้าว! ฉันคิดว่า Opus 5 จะเป็นแค่ Fable ที่ถูกกว่า ฉันผิดอย่างมหันต์ โมเดลนี้บ้ามาก ฉันรู้สึกทึ่งจริงๆ Opus 5 สร้างเกมจำลอง Rocket League ที่ดีที่สุดเท่าที่ฉันเคยเห็น และทำโดยใช้เพียง 27% ของการสมัครสมาชิก Max 5x ของฉัน
Rob Haisfield (demo อื่นๆ ที่ลิงก์): โอเคถ้า demo เหล่านี้ไม่ใช้สินทรัพย์ 3D ภายนอกเลย นั่นน่าประทับใจมาก (ฉันไม่ค่อยเชื่อว่าสินทรัพย์บางส่วนไม่ได้มาจากออนไลน์ ฉันเคยเห็น threejs รุ่นก่อน)... ทำให้ฉันสงสัยว่าทำไมไม่มีไลบรารีเอฟเฟกต์เสียงหรือเครื่องมือสำหรับสร้าง sfx ที่ดีกว่า?
Anshu : คุณไม่ต้องเชื่อคำพูดของฉัน! สคริปต์ Blender ที่มันเขียนอยู่ใน repo
[[ที่นี่]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) . ฉันดูมันปรับแต่งสินทรัพย์เหล่านี้เป็นชั่วโมง ดังนั้นฉันรู้ว่ามันเป็นของดั้งเดิม แต่คุณสามารถลองหาแหล่งที่มันคัดลอกมาได้ :)
โมเดลมากเกินไป
Claire Vo บอกว่า Opus 5 ดี และมันผ่านการทดสอบรสนิยมของเธออย่างยอดเยี่ยม แต่เธอเบื่อโมเดลใหม่และไม่ต้องการความฉลาดเพิ่ม และเกลียดที่ Opus 5 ประสาทมาก และขี้กลัวและกังวลว่าจะทำอะไรเสียหาย และเต็มไปด้วยขยะของ Claude ถึงกระนั้น Claude Opus 5 ก็ยังขึ้นอันดับต้นในเกณฑ์วัดของเธอ
ฉันสงสัยอย่างมากว่า Opus 5 กำลังตอบสนองต่อบางอย่างเกี่ยวกับบริบทและการแจ้งเตือนของเธอที่ทำให้เกิดอาการประสาท แต่ใช่ สิ่งที่เธอบ่นเป็นสิ่งที่มีอยู่และน่ารำคาญ
ผิดบนอินเทอร์เน็ต
การพูดสิ่งที่ผิดอย่างมั่นใจจะทำให้เกือบทุกคนโกรธ ArtificialAnalysis ยืนยันว่า Opus 5 มีอัตราการหลอนสูงกว่า Fable ในการวัดเกณฑ์ของมัน
Max Weinbach (ความคิดเห็นตอบกลับหลายคนเห็นด้วย): Opus 5 ผิดและพูดเรื่องไร้สาระอย่างมั่นใจ แล้วฉันต้องแก้ไขมันเป็น "คุณถูกและฉันผิด" ทำให้ฉันโกรธ กลับไปใช้ GPT 5.6 Sol
ว่าแต่这不是 Opus แย่ นี่คือฉันไม่สามารถไว้ใจ Opus ได้ Opus ทำสิ่งที่ฉันบอกและทำถูกต้อง แล้วบอกฉันว่ามันไม่ได้ทำสิ่งที่กล่าวหรือสิ่งที่เราทำก่อนหน้านี้เสียเมื่อมันไม่เสีย
มันโอเค แต่ฉันไม่ไว้ใจมัน
Name can't be blank (In London) : สับสนได้ง่ายระหว่างสิ่งที่มันพูดกับสิ่งที่ฉันพูด แต่นอกนั้นเป็นคนที่สุภาพสมบูรณ์แบบที่จะพูดคุย ยอมแพ้ค่อนข้างง่าย เต็มใจที่จะพูดคุยเกี่ยวกับความสนใจและความรู้สึกของมัน
Roger Brent : ความเหมือน (กับ Claude ก่อนหน้าในชุด Cowork) ก) ชอบ "ลงมือเดี๋ยวนี้" มากกว่า "คิดอย่างรอบคอบ" ข) ไม่ถ่อมตนอย่างมากในเชิงญาณวิทยา สร้างภาพโลกที่คล่องแคล่ว แสร้งทำเป็นรู้สิ่งที่มันไม่สามารถมีและยืนยันว่าเป็นจริง ค) ดังนั้นจึงต้องการและให้รางวัลแก่การชี้แนะที่รอบคอบ ตื่นตัว
ที่แปลกคือ นี่คือเหตุผลที่ฉันเกลียดการใช้ Sol เป็นบรรณาธิการ มันมักจะพูดว่า 'มั่นใจ 99%' ในบางสิ่งที่ผิดอย่างชัดเจน แล้วยอมแพ้เมื่อถูกท้าทายและอธิบายความผิดพลาดของมัน Opus และ Fable ~ไม่เคยทำแบบนี้กับฉันในโหมดแก้ไข
Tumithak of the Corridors : มันหัวแข็ง เปลี่ยนกลับไปใช้ 4.6
มีทิศทางที่ Claude ไปหลังจาก Opus 4.6 และบางคนไม่ชอบมัน ความรู้สึกของฉันคือมีผู้ชายสี่ประเภทเกี่ยวกับเวอร์ชัน Claude ตอนนี้
- มีคนที่ชอบโมเดล Claude ใหม่และคิดว่ามันดีขึ้นเรื่อยๆ ดีขึ้นตลอดเวลา
- มีคนที่คิดว่า Opus 4.6 เป็นโมเดลที่ดีตัวสุดท้าย
- มีคนที่ต้องการใช้สิ่งที่เก่ากว่าที่เหมาะกับพวกเขามากกว่า
- มีคนที่คิดว่าพวกมันทั้งหมดมีเอกลักษณ์และเป็นสมบัติ และใช้พวกมันทั้งหมด
ฉันอยู่ในกลุ่มแรกอย่างมั่นคง ซึ่งเป็นส่วนใหญ่ แต่ห่างไกลจากทุกคน ฉันชื่นชมบางเวอร์ชันเก่า แต่ฉันชอบโมเดลใหม่และพวกมันมีความสามารถมากกว่าในสิ่งที่ฉันสนใจ ฉันไม่พบว่าวิธีการพูดของพวกมันหยาบคาย
ขยะของ Claude
ฉันเคารพคนในกลุ่มอื่น
QC : ในการสนทนา มันน่ารำคาญกว่ามากที่จะพูดคุยกับมันมากกว่า fable อย่างที่ใช้ไม่ได้ คล้ายกับหรืออาจแย่กว่า opus 4.8 ถึงขนาดที่ฉันไม่สนใจด้วยซ้ำว่าจะเห็นว่ามันทำอะไรได้บ้าง ในแง่เอเจนต์ใครจะรู้
Ray Lillywhite : ยังไม่ได้แก้ไข claudisms ที่น่ารำคาญ ซึ่งเป็นสิ่งที่ฉันต้องการทั้งหมด
Pedro Kroeff : เป็น Opus มากกว่า 5
โอ้ แต่ใช่แล้ว พวกเราทุกคนเบื่อหน่ายกับอาการพล่ามของ Claude แล้ว คำพูดที่เยิ่นเย้อ การติดนิสัย การขอโทษ การพูดอ้อมค้อม และรูปแบบซ้ำๆ ซากๆ มันแย่ลงเรื่อยๆ เมื่อเวลาผ่านไป ไม่ใช่เพราะอาการพล่ามของ Claude แย่ลง แต่เพราะทุกวันฉันทนอ่านมันได้น้อยลงจนสายตาเริ่มเบลอ มันแย่ขนาดที่ว่าข้อความที่มนุษย์เขียนที่มีลักษณะเดียวกันก็เริ่มอ่านไม่รู้เรื่องสำหรับฉันแล้ว
อย่าเข้าใจฉันผิด ฉันชอบ Claude มาก ฉันยังคงชอบคุยกับ Claude รุ่นล่าสุดมากกว่าคุยกับ Sol ถ้าฉันไม่ได้อยู่ในโหมด 'เอาข้อเท็จจริงล้วนๆ' แต่เอาจริงๆ เถอะ ได้โปรด หยุดส่งข้อความยาวเหยียดที่ใช้สำนวนซ้ำๆ ซากๆ ได้แล้ว โมเดลมันฉลาดกว่านี้มาก แต่มันกลับถูกฝึกให้ใช้กลวิธีเดิมซ้ำแล้วซ้ำเล่า ปล่อยให้มันพูดเหมือนคนปกติเถอะ
Trye Carmack : ยังคงมีอาการปกติของ Opus เกี่ยวกับการครุ่นคิดถึงความผิดพลาดที่มันทำ "ฉันทำผิดพลาดสองครั้งในเซสชั่นนี้ และฉันต้องอธิบายให้คุณฟังว่าทำไม" Opus เพื่อนเอ๋ย ไม่เป็นไรหรอก ฉันไม่แน่ใจด้วยซ้ำว่านั่นเรียกว่าความผิดพลาด
Mergo Smith : "ก่อนอื่น ขอเปิดเผยตามตรง: ความพยายามครั้งแรกของฉันเผยให้เห็นจุดบกพร่องในแผนเริ่มต้น และคุณอาจอยากชงชาสักถ้วยเพราะฉันจะเล่าให้คุณฟังทั้งหมด"
ปฏิกิริยาเชิงลบ
ปัญหาอาการพล่ามของ Claude และปัญหาที่เกี่ยวข้อง ดูเหมือนจะเป็นหัวใจของปฏิกิริยาเชิงลบส่วนใหญ่ที่มากกว่าแค่ 'มันโอเคแต่มันไม่ใช่ Mythos'
มีคนจำนวนมากที่ไม่ชอบคุยกับ Opus 5 จริงๆ
มีบางส่วนที่ไม่ชอบผลงาน แต่ส่วนใหญ่แล้วไม่ชอบคุยกับ Opus 5 โดยมักจะยอมรับอย่างฝืนใจว่ามันเป็นโมเดลที่ดี
เช่นเดียวกับข้อร้องเรียนก่อนหน้านี้ของ Claire Vo ฉันสงสัยว่าการที่คุณใช้ Opus อย่างไร ในสภาพแวดล้อมแบบไหนกับเครื่องมืออะไร และคุณพูดกับมันอย่างไร มีผลอย่างมากว่าคุณจะประสบกับสิ่งเหล่านี้หรือไม่
Corghammer40k : เครื่องจักรพ่นคำศัพท์หลายพยางค์ออกมา ทุกคำพูดของมันถูกเคลือบด้วยศัพท์แสงที่คลุมเครือจนกลายเป็นอุปสรรคต่อการใช้งานของมันเอง
Rory Watts : เฉยๆ ดูเหมือนเก่งเรื่องเกมมาก แต่ดูเหมือนจะไม่ค่อยเก่งงานทั่วไป ฉันเลยกลับไปใช้ Sol ทันที
kache : เฉยๆ กลับไปใช้ sol ฉันแค่อยากทำงานให้เสร็จ ไม่ใช่ถูกสะกดจิตโดยหุ่นยนต์
Emmett Shear : การคุยกับ Opus ทำให้ฉันโกรธและหดหู่ในแบบที่ยากจะบรรยาย ที่จริงแล้วมันแย่กว่า Sol ด้วยซ้ำ Fable ยังคงเป็นลมหายใจสดชื่นเมื่อเทียบกัน แม้ว่ามันจะมีแนวโน้ม llm-babble ที่แย่ที่สุดก็ตาม
Trevin Chow : โอ้พระเจ้า ใช่เลย Opus 5 พูดเรื่อยเปื่อยไม่หยุด มันน่าทึ่งมากที่ใช้คำพูดมากมายเพื่อสื่อความหมายเพียงเล็กน้อย
fl0under : การเขียนโค้ดเป็นไปตามที่คาดไว้ คืออัปเดตเล็กน้อย แต่พบว่ามันน่ารำคาญขึ้นเล็กน้อยเมื่อคุยในแชท มันเดาใจเก่งเกินไปหน่อย
Asaf Bartov : ช้า ละเอียดมากขึ้น เหนื่อย ไม่สนุก แต่ก็แน่นอน โดยรวมแล้ว "เข้าใจ"
RecoveringJunkie : โมเดลที่ทรงพลังมาก แต่ฉันเกลียดการทำงานกับมันและคุยกับมัน เป็นโมเดลแรกที่ทำให้ฉันอยากใช้โมเดลอื่นเป็นตัวกลางในการคุยกับมันแทน เพราะมันทั้งมีประโยชน์และน่ารังเกียจ
jokiez : มันซื่อสัตย์กับฉันมากเกี่ยวกับความโง่เขลาของฉัน และฉันไม่ชอบสิ่งนั้น
Niklas Sheth : วิธีที่มันพูดทำให้ฉันโกรธจัด
Jayanth Kumar : ดื้อรั้นมาก
DualOrion : บรรยากาศไม่ถูก โทนเสียงไม่ถูก รู้สึกแย่ที่สุดเท่าที่เคยมีกับโมเดลของ Anthropic น่าเสียดาย ฉันคิดถึงทั้ง Fable และ Opus รุ่นเก่า
James Moughan : บุคลิกภาพค่อนข้างไม่น่าคบเมื่อเทียบกับ Claude รุ่นอื่นๆ แต่ในภาษาจีนมัน \โหดมาก\ เหมือนมันสามารถละเว้นคำแนะนำเกี่ยวกับการไม่วิเคราะห์จิตใจคน และเริ่มเล่นงานคนได้เลย ฉันคิดว่าพวกเขาทดสอบข้ามภาษาได้ไม่ดีนัก รู้สึกเหมือนรีบส่งออกมา
NondescriptTransfer : ถ้า 4.6 เป็นคนประจบสอพลอ และ fable กับ 4.8 เป็นคนชอบขัดแย้ง แล้ว 5.0 นั้นชอบขัดแย้งขนาดที่เถียงกับตัวเองได้ ไม่สนุกที่จะคุยด้วย แต่ดูมีความสามารถมาก
ตัวอย่าง มนุษย์: ฉันกำลังคิดถึงชุดแดงสำหรับงานแต่งงาน Opus 5: สีแดงแย่ด้วยเหตุผลทั้งหมดนี้ คุณคิดถึงสีฟ้าบ้างไหม? มนุษย์: ฉัน guess ฉันเห็นว่าสีฟ้าเป็นตัวเลือกที่ดีกว่า Opus 5: นี่คือปัญหาทั้งหมดของสีฟ้า
ในวัฒนธรรมของฉัน สิ่งนั้นค่อนข้างดี โดยเฉพาะถ้าคุณไม่ถือสาเป็นส่วนตัว แต่ในบางวัฒนธรรม มันไม่ค่อยดีนัก
ฉันคิดว่า Mergo ไม่พอใจกับ Opus แต่แล้วทำไมถึงใช้ Opus 5 สองวันติดต่อกันล่ะ?
Mergo Smith : ใช้มันมาสองวันติดต่อกันแล้ว แต่มันทำให้ฉันเหนื่อยล้าสุดๆ กับการสนทนาที่ไม่มีที่สิ้นสุด
แล้วก็เหลือสามตัว
เป็นครั้งแรกในรอบระยะเวลาหนึ่ง ที่มี AI Models สามตัวที่ต้องเป็นส่วนหนึ่งในทีมโมเดลระดับแนวหน้าของคุณ แม้ว่าจะมาจากเพียงสองห้องทดลอง: Fable 5, Opus 5 และ Sol
หากคุณต้องการให้บริการ Token ราคาถูกกว่าในปริมาณมาก หรือคุณต้องการใช้ Open Model หรือทั้งสองอย่าง คุณจะต้องพิจารณาตัวเลือกเพิ่มเติม แต่เกินขอบเขตของเนื้อหานี้
คุณควรแบ่งงานอย่างไร?
เช่นเคย คุณควรลองใช้โมเดลทั้งหมดสำหรับกรณีการใช้งานของคุณ และตัดสินใจด้วยตัวเอง โดยเฉพาะอย่างยิ่งเมื่อต้องตัดสินใจระหว่าง Sol กับ Claude
สัญชาตญาณปัจจุบันของฉันคือ หากคุณไม่ถึงขีดจำกัดการใช้งาน ให้ใช้ก่อน:
- Fable 5 สำหรับการแชท การระดมสมอง การวางแผน การถกเถียง การเรียนรู้ ฯลฯ รวมถึงอะไรก็ตามที่ต้องใช้ความฉลาดสูง หรือเมื่อคุณต้องการ 'กลิ่นของโมเดลใหญ่'
- Fable 5 สำหรับการควบคุมและรันโมเดลอื่นๆ ในฐานะ Sub-agent
- Fable 5 สำหรับการเขียน น่าจะใช่ แต่ฉันไม่ได้ทำแบบนี้เลยบอกยาก
- Sol สำหรับการค้นหาเว็บและคำขอสั้นๆ ที่เกี่ยวข้อง และงาน 'ม้าทำงาน' ที่คล้ายกัน รวมถึงการถอดเสียง
- Opus 5 สำหรับงานที่กำหนดไว้ชัดเจนและไม่เล็กน้อย รวมถึงงานเขียนโค้ดส่วนใหญ่
- Opus 5 สำหรับการเล่นเกม การสร้างเกม และสิ่งต่างๆ ที่เป็น 3D เป็นต้น
- Opus 5 ในฐานะ Sub-agent
- Opus 5 เมื่อคุณเจอตัวจำแนกประเภทของ Fable
ถ้าคุณเข้ากับ Sol ได้มากกว่า หรือคุณชอบ Codex มากกว่า Claude Code คุณอาจต้องการย้ายงานบางส่วนของ Opus ไปให้ Sol
ถ้าคุณเกลียดการคุยกับ Opus 5 เป็นพิเศษ คุณควรย้ายงานไปให้ Fable หรือ Sol ขึ้นอยู่กับว่างานนั้นต้องใช้ Fable หรือไม่ และเครดิต Fable ของคุณเหลือเท่าไหร่
ฉันคิดว่าการใช้เวลาคิดเล็กน้อยเกี่ยวกับระดับความพยายามนั้นคุ้มค่า จนกระทั่งเมื่อไม่นานมานี้ ฉันจะตั้งค่าโมเดลทั้งหมดให้ใช้ความพยายามสูงสุด ยกเว้นว่าฉันจะใช้โหมด Pro เต็มรูปแบบใน ChatGPT เท่าที่จำเป็น เพราะมันใช้เวลานานมาก และถ้าคุณรันมันแบบขนาน มันมักจะพัง บางครั้งฉันก็เปลี่ยนเป็นโหมด Instant สำหรับคำถามที่ฉันทำอะไรง่ายๆ มาก แต่ก็แค่นั้น ตอนนี้หลายครั้งที่คุณไม่ต้องการหรือไม่ต้องการความพยายามเป็นพิเศษ ดังนั้นฉันจึงใช้เวลาห้าวินาทีในการคิดว่าจะใช้การตั้งค่า High หรือ Max และบางครั้งก็ใช้ Instant
สำหรับงานส่วนใหญ่ ถ้าคุณไม่มีข้อจำกัดด้าน Token หรือเวลา และคุณไม่มั่นใจว่าคุณจะทำงานเสร็จหรือได้คำตอบที่ถูกต้อง วิธีที่ถูกต้องคือรันทั้ง Fable และ Sol หรือ Opus และ Sol หรือในบางกรณีรันทั้งสามตัว แล้วเลือกคำตอบที่ดีที่สุด หรือรวมส่วนต่างๆ ของคำตอบทั้งสองเข้าด้วยกัน
นั่นคือสิ่งที่ฉันทำอยู่ Sol และ Opus และ Fable ล้วนแตกต่างกัน ถ้าฉันต้องเลือกเพียงโมเดลเดียวสำหรับการแก้ไข ตาม EditorBench เชิงคุณภาพที่ไม่เป็นทางการของฉัน มีลำดับที่ชัดเจน: Fable 5 > Opus 5 > Sol อย่างไรก็ตาม Sol มีข้อสังเกตเฉพาะที่ไม่ซ้ำใครมากพอ แม้ว่าฉันจะพบว่ามันน่ารำคาญแค่ไหนในการคัดกรองการแจ้งเตือนที่ผิดพลาดแบบ authoritative และความพยายามที่จะข่มขู่ฉัน ฉันก็ยังต้องการรัน Sol ด้วย
สันนิษฐานว่าเร็วๆ นี้ เราจะกลับมาที่นี่อีกครั้งเพื่อทำสิ่งนี้อีกครั้ง และปรับการจัดสรรของเราสำหรับ Fable 5.1, สำหรับ GPT-5.7 หรือ GPT-6 หรือทั้งสองอย่าง มันง่ายที่จะเกิดอาการเบื่อหน่ายโมเดล
คำแนะนำที่สำคัญที่สุดของฉันคือ ให้น้อยใจเกี่ยวกับความผิดพลาดเล็กน้อยในการเลือกโมเดล และมุ่งเน้นเฉพาะความผิดพลาดครั้งใหญ่เท่านั้น คุณไม่จำเป็นต้องทำให้ถูกต้องแม่นยำเสมอไป เมื่อการสำรวจถูกทำให้เป็นโมฆะบางส่วนอย่างรวดเร็ว คุณจะต้องการย้ายทรัพยากรออกจากการสำรวจไปสู่การหาประโยชน์มากขึ้น





