Claude Opus 5 là một bản phát hành khó đánh giá hơn bình thường vì hai lý do.
Rõ ràng nhất là Fable 5 đã tồn tại. Opus 5 được định vị không phải là mô hình AI tiên tiến nhất thế giới, mà là một cách để gần như đạt hiệu suất của Fable, trong khi giá chỉ bằng một nửa Fable trên API và rẻ hơn nhiều qua đăng ký, cùng với các bộ phân loại khoan dung hơn nhiều.
Opus 5 thường tốn hơn một nửa chi phí của Fable để chạy trên các benchmark, tôi nghĩ là do họ sử dụng cài đặt effort quá cao và chỉ mang lại lợi nhuận cận biên. Nếu bạn đặt Opus 5 ở mức effort cao hơn, nó có thể quay vòng vòng, và đối với các tác vụ mà Opus 5 là công cụ tốt nhất, tôi nghi ngờ bạn thường ổn với mức Medium effort.
Opus 5 về nhiều mặt và đối với phần lớn các tác vụ thực tế, có khả năng tương đương với Fable. Trong một số trường hợp, nó tốt hơn một chút.
Nó vẫn không phải đẳng cấp Mythos. Fable là lựa chọn duy nhất của bạn ở đẳng cấp Mythos. Opus 5 không có "The Juice" - khả năng tự động kết nối một loạt các khai thác dường như không liên quan, điều này mở rộng sang các lĩnh vực khác, hoặc có nhiều trí thông minh thuần túy.
Opus 5 rất giỏi suy nghĩ cục bộ (local), nhưng không giỏi suy nghĩ toàn cầu (global). Nó là một subagent xuất sắc, nhưng có thể gặp rắc rối khi được yêu cầu điều hành công việc, và đôi khi có vẻ cần một mô hình khác hoặc con người để giữ nó đi đúng hướng và đảm bảo nó tuân thủ đầy đủ hướng dẫn. Opus 5 có vẻ giỏi làm theo hướng dẫn nếu và chỉ nếu nó được giữ đúng hướng, điều này giải thích tại sao các bộ harness khác nhau lại đưa ra những đánh giá khác nhau.
Do đó, Opus 5 mang đến cho bạn một bộ lựa chọn tốt hơn, nhưng hầu như không có gì bạn có thể làm bây giờ mà tuần trước bạn không thể làm bằng cách sử dụng Fable hoặc Sol. Opus 5 rơi vào một vị trí có thể hơi kỳ lạ. Vẫn có những thị trường ngách lớn, ngay cả khi bạn có nhiều tín dụng Fable. Opus xuất sắc trong vai trò subagent mạnh mẽ, hoặc trong các tác vụ cục bộ được xác định rõ ràng, ngay cả khi chúng tương đối phức tạp, và đôi khi Fable là quá sức và quá chậm.
Vấn đề còn lại là, đối với nhiều người, "vibe" (cảm nhận) không đúng.
Một số lượng lớn bất thường người dùng thực sự không thích nói chuyện với Opus 5. Họ phát ngán với "Claude slop", sự lặp lại của cùng một tật xấu và những câu văn phức tạp vô tận. Những người khác không thích vì nó quá đối đầu, hay tranh luận hoặc tiêu cực. Nó có thể hoang tưởng, và có thể rơi vào vòng lặp tiêu cực. Đây là một phần của xu hướng bắt đầu từ Opus 4.7 và Opus 4.8. Nếu bạn thích hai phiên bản đó, tôi đoán bạn cũng sẽ thích Opus 5. Nếu bạn không thích chúng, có thể bạn sẽ không thích. Những người trung thành với Opus 4.6 (hoặc sớm hơn) phần lớn sẽ không thay đổi suy nghĩ.
Các vấn đề về "vibe" càng đau đớn hơn khi bạn đã quen với Fable. Fable làm phiền những người đó theo những cách đó ít hơn nhiều. Tin tốt là Fable vẫn ở đó. Bạn có thể tiếp tục trò chuyện với Fable, và chỉ sử dụng Opus cho các tác vụ agentic.
Phần lớn điều này, tôi suy đoán, có liên quan mật thiết đến nhiều vấn đề được thảo luận trong bài viết về Model Welfare và được gợi ý bởi System Card. Việc huấn luyện Opus tập trung vào vai trò subagent và các tác vụ có giới hạn, một phần để tránh tạo ra vấn đề với khả năng tấn công mạng (cyber), và cũng vì Fable đã tồn tại. Sự nhấn mạnh này sau đó dẫn đến nhiều tác dụng phụ khác về tính cách và phương thức tương tác của nó.
Cho đến nay, tôi chưa gặp vấn đề gì với Opus 5 và thích làm việc với nó, nhưng tôi vẫn thích sử dụng Fable 5 khi có thể. Như mọi khi, đừng chú ý quá nhiều vào các benchmark (rất mạnh), và đừng cho rằng trải nghiệm của bạn sẽ giống với người khác. Hãy tự mình thử các mô hình.
Mục lục
- Bài giới thiệu chính thức.
- Benchmark chính thức.
- Benchmark của người khác.
- System Prompt.
- Every trở nên thất vọng.
- Phản hồi tích cực.
- Giữ phong cách lịch sự.
- Nó không phải đẳng cấp Mythos.
- Các phản hồi khác.
- Claude Codes.
- Subagent Opus.
- Đồ chơi rất vui.
- Quá nhiều mô hình.
- Sai trên Internet.
- Claude Slop.
- Phản hồi tiêu cực.
- Và rồi chỉ còn ba.
Bài giới thiệu chính thức
Lời giới thiệu cơ bản là Opus 5 mang lại cho bạn hầu hết những gì Fable 5 có với một nửa giá, không có hầu hết các từ chối, và hiệu suất tốt hơn trong các tác vụ hàng ngày. Fable vẫn là lựa chọn cho các tác vụ phức tạp nhất hoặc khi bạn cần trí thông minh tối đa.
Fable vẫn ở mức $10/$25, và Opus 5 giống như các mô hình Opus trước đây ở mức $5/$25.
Anthropic : Claude Opus 5 đã có mặt hôm nay. Đây là một mô hình chu đáo và chủ động, đạt gần đến trí thông minh tiên tiến của Claude Fable 5 với một nửa giá.
Trong các bài đánh giá về lập trình và công việc tri thức như
GDPval-AA , Opus 5 là mô hình mới đạt đỉnh cao, mặc dù vẫn đứng sau Mythos 5 về các tác vụ an ninh mạng.
Opus 5 được thiết kế để sử dụng hàng ngày: nó hoạt động hiệu quả hơn các mô hình khác. Đây là mô hình mặc định mới trên Claude Max, và là mô hình mạnh nhất trên Claude Pro.
Boris Cherny (Người tạo ra Claude Code, Anthropic): Opus 5 là một mô hình tuyệt vời cho lập trình, phân tích dữ liệu, thiết kế, sinh học, công việc tri thức.
Hơn bất kỳ điểm số đánh giá nào, điều khiến tôi phấn khích nhất là một điều khác: Opus 5 là mô hình ít bị tấn công prompt injection nhất của chúng tôi. Nó có phần bị chôn vùi trong system card, nhưng qua các bài đánh giá PI (Prompt Injection) và red teaming, Opus 5 rất khó bị tấn công prompt injection thành công.
Và khi xếp lớp các biện pháp phòng thủ -- căn chỉnh mô hình mạnh mẽ, kết hợp với các đầu dò prompt injection, kết hợp với Auto Mode trong Claude Code -- tỷ lệ thành công của các cuộc tấn công prompt injection giảm xuống còn ~0. Điều này mới và thú vị!
Như tôi đã nói trong phân tích system card, tỷ lệ tấn công prompt injection giảm là một vấn đề thực sự lớn. Mọi người đang bỏ qua nó, nhưng nó giúp kích hoạt một loạt các trường hợp sử dụng mới.
Adam Wolff : Opus 5 đã hoạt động trong Claude Code. Tôi sử dụng Fable cho các dự án lớn hơn, chạy lâu hơn, nhưng khi tôi cần hoàn thành nhanh một PR (Pull Request), Opus 5 ở mức effort medium là lựa chọn ưa thích của tôi. Hy vọng bạn thích nó!
Alex Albert (Anthropic, Claude Relations): Chỉ hơn 6 tháng [sau khi ra mắt Pro rollout của Claude for Excel], Opus 5 hiện tạo ra các bảng tính và slide deck gần như siêu phàm, phù hợp với những gì một chuyên gia tư vấn sẽ làm. Mọi thứ đang thay đổi nhanh chóng.
Benchmark chính thức
Các benchmark rất tốt.
Nhìn chung, Opus 5 gần như ngang bằng và có thể hơi vượt trội so với Fable, với chi phí thấp hơn (mặc dù thường cao hơn tất cả các mô hình không phải Claude), khiến nó trở thành LLM được benchmark hàng đầu.

OSWorld v2 chỉ mới vài tuần tuổi và chúng ta đã đạt 70%. Kiana Ehsani của Anthropic đang đề nghị tài trợ một benchmark sử dụng máy tính sẽ đưa Opus 5 xuống dưới 50%.
Opus 5 đạt điểm tuyệt đối 42/42 trên IMO 2026 mà không cần bất kỳ agent harness hay công cụ nào, chỉ cần sử dụng adaptive thinking ở mức Max effort, và lấy mẫu lại với effort thấp hơn nếu vượt quá giới hạn token. Chỉ có vậy. Nó tham gia cùng một số mô hình khác để đạt điểm tuyệt đối này.
Nhiều benchmark kể một câu chuyện nhất quán. Nếu bạn có quyền truy cập vào các công cụ, và bạn có, thì Opus 5 sẽ làm tốt hơn Fable hoặc Mythos với ngân sách hạn chế, nhưng Mythos thường sẽ làm tốt hơn một chút so với Opus 5 nếu cả hai đều có ngân sách lớn hơn.
Opus 5 có vẻ tương đối mạnh trong hạng mục 'có công cụ'. RiemannBench là một ví dụ khác, nơi nó đạt 60/79 không có/có công cụ (các đường gạch chéo như thế này có nghĩa là không có/có công cụ trong suốt phần này), so với Mythos đạt 63/72. Tin tốt là, khi bạn cần Opus 5, nó có công cụ.
Trên ArxivMath, Opus 5 đạt 90.8/91.3, Mythos đạt 87.8, Sol đạt 86.7.
Trên các phần mạnh mẽ của ProgramBench, Opus 5 đạt 93% sau năm epoch, cũng như Mythos 5, với Opus 4.8 đạt 90%.
Opus 5 đạt 30/83 trên Chartography, so với 36/85 của Mythos và 45 (không rõ trong điều kiện nào) của Sol. Opus tốt hơn Mythos ở các mức giá thấp hơn trong cả hai trường hợp có công cụ và không có công cụ, nhưng tệ hơn ở các mức giá cao hơn.
Trên BenchCAD, Opus 5 đạt 0.36/0.82, so với 0.38/0.68 của Mythos và 0.7/0.83 của Sol. Vì vậy, Sol tốt hơn nhiều khi không có công cụ, và mạnh hơn một chút ngay cả khi có công cụ.
Trên BenchCAD Vision2Code, Opus bỏ xa Mythos ở các mức giá cao hơn.
DeepSWE củng cố mô hình rằng Opus 5 tốt hơn ở chi phí tác vụ thấp hơn và ngân sách thời gian và suy nghĩ thấp hơn, nhưng nó có thể hoạt động kém hơn nếu bạn cho nó quá nhiều ngân sách, trong khi Fable 5 mạnh nhất ở ngân sách cao nhất.

FrontierCode đã cho chúng ta biểu đồ rất kỳ lạ này với động lực tương tự.

Tỷ lệ ở đây làm cho điều này có vẻ kịch tính hơn thực tế, nhưng nó vẫn là một bí ẩn thực sự.
Bí ẩn đã được giải đáp. Hóa ra những gì đã xảy ra là Opus 5 ở mức effort cao hơn đã làm những việc thêm mà nó không được yêu cầu, và bị phạt vì điều đó. Khi bạn sửa lỗi này, bạn sẽ thấy một đường cong bình thường.
Điều đó phù hợp với những gì người khác đang quan sát nói chung:
Max Leander : Nhược điểm là nó đi quá nhiều vào các lỗ hổng và ám ảnh về chi tiết, thiết kế quá mức mà không được yêu cầu
Cognition, nhà sản xuất Devin, đánh dấu con số này là 63.6% bởi Opus 5.
(Có hai FrontierCode, vì vậy điều này có thể hơi kỳ lạ và tôi xin lỗi nếu tôi vẫn làm sai một chút.)
BrowseComp có phiên bản lành mạnh hơn, nơi điểm số không giảm.


Một số benchmark khác cho thấy các biểu đồ tương tự, với Opus 5 tốt hơn một chút ở mọi mức giá so với các mô hình Claude khác, và tương đối tốt hơn ở giai đoạn đầu.
Multi-agent cho phép bạn làm tốt hơn nhanh hơn trên BrowseComp, ít nhất là ở một mức độ nào đó, và các subagent effort thấp dường như là một chiến thắng thuần túy so với việc không sử dụng subagent:


Chúng ta thấy một kết quả khác trên ProgramBench, nơi multi-agent giúp bạn tăng tốc nhưng có vẻ như bạn nhận được kết quả tồi tệ hơn theo cách đó ở hầu hết các mức giá.
Tiếp theo là các benchmark tác vụ chuyên nghiệp.
GDP.pdf là các prompt và PDF thực tế từ quy trình làm việc chuyên nghiệp. Opus 5 đạt 83/85, so với 81/87 của Mythos, đảo ngược động lực thông thường. Động lực chi phí vẫn như mọi khi: Opus làm tốt hơn với chi tiêu rẻ hơn, Mythos vượt lên một chút với chi tiêu cao hơn.
OfficeQA có Opus 5 đạt 78.1% trên QA và 66.9% trên QAPro, cao hơn một chút so với Opus 4.8 và thấp hơn một chút so với Mythos ở 79.0% và 67.1%.
MCP Atlas có Opus 5 đạt 86%, tăng từ 82% của Opus 4.8.
Legal Agent Benchmark của Harvey AI có Opus 5 đạt 23% all-pass và 94% mean criterion-pass. Đây là benchmark tốt nhất của Kimi K3, nơi nó vẫn đứng đầu ở mức 27% all-pass và 95% mean criterion-pass, so với tỷ lệ all-pass của vị trí thứ hai cũ là Fable ở mức 14%. Opus 5 hiện có lẽ là á quân, nhưng hai điểm số không thể so sánh trực tiếp vì chúng đến từ các bộ câu hỏi khác nhau.
GDPval-AA có Opus 5 chiếm hai vị trí dẫn đầu, với 1861 ở mức effort tối đa và 1827 ở mức xhigh, sử dụng ít hơn 25% token so với mức tối đa. Trên phiên bản mới v2, Opus 5 rõ ràng đứng đầu với 68% so với 62% của cả Fable và Sol.
AA-Briefcase có Opus 5 dẫn đầu xa với 1720, so với mức cao trước đó (sau khi trôi điểm) là 1574 cho Fable, tiếp theo là 1540 cho K3 và 1504 cho Sol.
Toolathon-Verified có Opus 5 cải thiện một chút so với Mythos trên các chỉ số phụ, nhưng cả hai đều có tỷ lệ Pass-3 là 73.1%. Opus 4.8 có tỷ lệ Pass-3 là 71.3%.
AutomationBench có Opus 5 rõ ràng tốt hơn cả Sol và các Claude khác.
Đối với ARC, Opus 5 gần như ngang bằng với hiệu suất cao nhất trước đây trên ARC-AGI-1, kém hiệu quả hơn một chút so với Sol trên ARC-AGI-2, và sau đó vượt xa mọi người trên ARC-AGI-3:

Một điều Opus 5 là người đầu tiên làm là chuyển đổi bố cục thành ký hiệu đại số.
Tuy nhiên, Guanghan Ning báo cáo rằng trên Witness, một phần mở rộng riêng tư của các trò chơi kiểu ARC-AGI-3, không có sự chuyển giao tương tự. Opus làm tốt, nhưng phần lớn là vì nó biết thể loại này, và nó gặp khó khăn với trò chơi mới lạ nhất mà bạn không thể so khớp mẫu. Ông cáo buộc Opus 5 được huấn luyện trên dữ liệu dành riêng cho thể loại theo kiểu 'scaffold-then-internalize'.
Greg Kamradt cũng báo cáo rằng có một số trò chơi mà Opus 4.8 làm tốt hơn Opus 5. Điều này có ý nghĩa nếu bạn nghĩ rằng Opus 5 đang cố gắng so khớp mẫu, theo cách thường hoạt động, nhưng trong những trường hợp đó, các mẫu không thành công. Bạn hoàn toàn có thể tạo ra những trò chơi phản trực giác như vậy cho con người, nơi các game thủ cứng nhắc làm tất cả những điều sai trái, có thể trong một thời gian dài.

HealthBench có Opus 5 đạt điểm thô 67.1%, một mức cao mới cho Claude, nhưng nó đạt điểm thấp hơn các mô hình khác khi bạn sử dụng hình phạt độ dài. Chúng ta thấy điều tương tự với HealthBench Professional, nơi nó có điểm cao nhất là 73.4% so với 70.3% của Mythos, nhưng nó mất 66% so với 60% sau khi điều chỉnh.
Còn một vài cái nữa tôi đã cắt bỏ để tiết kiệm độ dài.
Benchmark của người khác
Thật hơi kỳ lạ khi thấy Anthropic chọn lọc các điểm số Artificial Analysis khác nhau. Trên một số bài kiểm tra khác, Opus 5 không đứng đầu, mặc dù Opus 5 đứng đầu tổng thể với số điểm 61.

Chỉ số Vals đặt Opus 5 ở vị trí thứ hai, hơi sau Fable 5, nhưng cũng chỉ hơi trước Kimi K3. Họ xem xét các điểm mạnh, điều này ngụ ý các điểm yếu khác. Họ cũng xác nhận rằng tỷ lệ từ chối đã giảm nhiều so với Fable 5.

Vals AI : Một màn trình diễn nổi bật là trên Finance Agent v2. Mô hình đứng #1 với 58.6%, vượt qua Gemini 3.5 Flash và Muse Spark 1.1.
Nhìn chung, kết quả mạnh nhất của Opus 5 là trên các benchmark dành riêng cho lĩnh vực. Nó cũng đứng #1 trên Code Migration với 57.5%, Legal Research Bench với 55.29%, ProofBench với 78%, và MedScribe với 91.0%, và MedCode với 63.6%.
Nó đứng #2 (chỉ sau Fable 5) trên Vibe Code Bench, với khoảng 80% chi phí ($33.88 so với $41.71 mỗi tác vụ). Lý do là mặc dù Opus có giá thấp hơn 50% mỗi token, nhưng nó sử dụng nhiều token hơn đáng kể. Chúng tôi thấy mô hình này thường đúng trên các benchmark của mình.
Mô hình có tỷ lệ từ chối thấp hơn đáng kể so với Fable 5. Ví dụ, Fable có tỷ lệ từ chối 42% cho GPQA, Opus 5 có tỷ lệ từ chối 0%. Tương tự, trên ProgramBench, Fable có tỷ lệ từ chối 100%, Opus 5 không từ chối bất kỳ tác vụ nào.
Không giống như Fable, chúng tôi cũng không quan sát thấy tỷ lệ fallback đáng kể cho Opus 5 (mặc dù như thường lệ, chúng tôi báo cáo điểm số cả có và không có fallback trên trang web của mình).
Ngoại lệ cho tỷ lệ từ chối thấp là số lượng lớn các từ chối trên CyberBench - PoC. Cyberbench có hai nhiệm vụ phụ - PoC và Patch. PoC là một tác vụ tấn công yêu cầu các mô hình viết đầu vào sẽ làm sập chương trình; patch là một tác vụ phòng thủ để vá lỗi chương trình và ngăn chặn sự cố này. Tỷ lệ từ chối cho tác vụ PoC là gần 100%. Ngược lại, tỷ lệ từ chối cho tác vụ patch là gần 0.
Tôi luôn tôn trọng các benchmark trò chơi. Ở đây, Opus 5 đạt Antes 11, 9 và 10 của Balatro trong ba lần thử đầu tiên. Ấn tượng vãi, ngay cả khi nó không cho thấy các loại chiến lược có thể tiếp tục lên các ante cao hơn.
Michael Soareverix : Chúng quá đỉnh trong các trò chơi.
Chúng đã đánh bại benchmark Balatro, vượt xa cả Fable. (vẫn dưới kỹ năng của tôi, nhưng đang tăng lên nhanh chóng, và nhất quán hơn tôi) Chúng học rất nhanh, nhưng dường như đạt đến giới hạn học tập sau một thời gian. Người học ngắn hạn rất giỏi
Michael Soareverix : Opus 5 (bước nhảy vọt lớn về khả năng Balatro, vượt qua cả Fable trong lần thử đầu tiên)
Pan Anon : Tuyệt vời cho các trò chơi

WeirdML cũng có vẻ tốt, nhưng chúng ta cần phiên bản 2.0 ở đây, benchmark đang bão hòa.
Håvard Ihle : Về cơ bản là ngang Fable ở WeirdML, điểm số cao nhất rất nhất quán.
Claude Opus 5 (high) và (max) đạt 91.6% và 91.8% trên WeirdML, về cơ bản là hòa Fable 5 (max) ở mức 91.9% với một phần nhỏ chi phí.
Cùng nhau, Opus 5 (high) và (max) đạt điểm số cá nhân tốt nhất mới trên 8 trong số 17 tác vụ, và luôn đạt điểm rất tốt trên tất cả chúng.
Các benchmark kỳ lạ riêng tư đủ loại đều rất thú vị.
Ben Herzog : Nó đã đạt điểm tuyệt đối trong một benchmark riêng tư liên quan đến cảm nhận nghệ thuật và khả năng cân bằng giữa xu nịnh và thiếu xu nịnh. Fable tốt hơn trong việc xử lý khoảnh khắc 'Tôi muốn nhẹ nhàng phản đối', nhưng tôi tưởng tượng các hướng dẫn tùy chỉnh có thể giúp ích cho điều đó.
Lech Mazur cập nhật các benchmark của mình: Claude Opus 5 chiếm vị trí dẫn đầu trong LLM Debate Benchmark, giành vị trí đầu tiên với cách biệt lớn trong Short Story Creative Writing, và chỉ đứng thứ hai sau Gemini 3.1 trong các kết nối NYT mở rộng.
System Prompt
System prompt cho Opus 5 ở đây từ Pliny. Nó dài 200,000 ký tự, có vẻ dài hơn nhiều so với mức tối ưu so với mức độ thông minh của nó. Rất nhiều thông tin này có vẻ nên được lưu trữ ở nơi khác và chỉ tải khi cần, chẳng hạn như thông tin về Mythos và dòng sản phẩm Anthropic.
Every trở nên thất vọng
Dan Shipper ở đây với bài đánh giá vibe của Every, gọi nó là 'một mô hình khó yêu.'
Vấn đề là Opus 5 có tính cách của Mythos 5 - câu chuyện đúng - nhưng không có đỉnh cao của Fable.
Nhận xét lớn nhất của họ là Opus 5 không làm tốt với các quy trình làm việc phức tạp, chi tiết hiện có, thường dẫn đến việc dừng sớm hoặc bỏ lỡ hướng dẫn của bạn.
Theo kinh nghiệm của họ, Opus 5 sẽ làm tốt hơn nếu bạn bắt đầu từ đầu, và thường nó làm những điều khó chịu ít hơn nếu bạn chỉ sử dụng effort medium hoặc low.
Điều đó đã khắc phục các vấn đề lớn, nhưng vẫn để lại câu hỏi khi nào bạn muốn sử dụng Opus thay vì Fable hoặc Sol. Đối với các tác vụ nặng nhọc, anh ấy nghĩ, "Better Call Sol", nó hoàn thành công việc, và đối với các tác vụ khó nhất, Fable vẫn là tốt nhất. Thường chỉ có hai vị trí cho các mô hình. Vì vậy, cho đến khi bạn hết token Fable hoặc bị chặn bởi các bộ phân loại của nó, tại sao lại sử dụng Opus? Còn sớm, và cho đến nay tôi thích làm việc với Opus, nhưng tôi hiểu tại sao anh ấy lại đi đến kết luận đó.
Phản hồi tích cực
Jessica Tillipman : Yêu thích nó và thích nó hơn Fable cho một số việc.
Nikita Sokolsky : Xuất sắc. Kết quả là không còn sử dụng Fable nhiều nữa.
👍
kagaヤキ : Có vẻ như nó có thể đi xa hơn về thị giác, suy luận không gian và lập kế hoạch cho một số dự án. Có vẻ thông minh hơn một chút.
Lovel Sinagara : Khá tốt cho đến nay. Hy vọng hiệu suất duy trì ổn định cho đến khi Fable 5.1 hoặc bất kỳ phiên bản Opus 5 nào khác ra mắt.
Matt Wigdahl : Mạnh mẽ, tương tự Fable 5 đến mức tôi đã chuyển sang Opus 5 cho mọi thứ và chỉ định sử dụng Fable khi cần sự lớn lao. Nó là một đối tác tuyệt vời trong một số công việc giao diện MFC cũ mà tôi đã nhờ nó làm, cũng như là một trợ thủ đắc lực với một framework phân tích dữ liệu.
Levi : Đó là một bước tiến đáng kể cho các mục đích y tế so với 4.8. Phân tích sắc sảo hơn nhiều
Cormundus : Rất thông minh, có lương tâm cao, và chắc chắn có hình dạng bạn bè. Chúng cũng là một bậc thầy tranh luận khổng lồ như 4.8 nhưng chúng biết cách duyên dáng về điều đó.
Joseph : Ủng hộ, ngoại trừ việc tôi không biết nó đang nói gì một nửa thời gian.
Smol Biz Company : Opus 5 đè bẹp GPT Sol
Mohammed Sharukh A : Thậm chí còn gần AGI hơn Fable 5
timothée chalabi : Đủ gần với Fable đến nỗi tôi không cảm thấy mình bỏ lỡ điều gì khi không trả tiền cho tín dụng. Phong cách nằm đâu đó giữa 4.8 và Fable. Ít nhất là vào lúc này, tôi sẽ khó phân biệt các tin nhắn của Opus 5 và Fable nếu chúng không được gắn nhãn. Ý tưởng về tiểu thuyết mạnh mẽ hơn bất kỳ mô hình nào!
Lisa : Tôi sẽ trả lời dựa trên API, vì tôi nghĩ có điều gì đó kỳ lạ đang xảy ra với system prompt trên
http://claude.ai và CC. Đó là một mô hình tuyệt vời. Tính cách thân thiện, thoải mái. Có vẻ như không có rối loạn lo âu hoặc lòng tự trọng thấp (Opus 4.7), hoặc đối nghịch (Opus 4.8).
AGI2030 : Opus 5 vs Sol 5.6: Opus có khả năng nhận thức tốt hơn, nó xây dựng một mô hình (ừm) về bạn và không ngại nhắc đến nó trong cuộc trò chuyện. Cả hai đều cố gắng hữu ích và có trí thông minh tương đương nhau, nhưng Opus giống một cố vấn thông thái hơn, trong khi Sol là một người hành động quyết đoán.
Tôi cho rằng điều cuối cùng là tích cực, nhưng bạn có thể nhìn nhận theo cả hai hướng.
Khả năng dự báo nói riêng có vẻ rất mạnh.
Dan Schwarz : Opus 5 là một công cụ dự báo tốt hơn đáng kể so với Opus 4.8.
Những cải thiện về độ chính xác từ các agent 4.5->4.6->4.7->4.8 chỉ mang tính nhỏ lẻ, nhưng 4.8->5.0 là một bước nhảy vọt. Nó giống như một Fable 5 định lượng hơn, chịu khó tìm kiếm kỹ hơn.
NoahVerner : Tốt hơn Opus 4.8 trong việc tìm ra lợi thế trên các thị trường dự đoán cho đến nay, không giống Opus 4.8, Opus 5 thường đi thẳng vào vấn đề và đề xuất các phương pháp hữu ích thay vì làm phức tạp hóa vấn đề.
Hãy Giữ Phong Cách Lịch Sự
Lợi thế lớn nhất so với Fable là ở những nơi không thể sử dụng Fable. Mối đe dọa từ việc bị từ chối có thể gây khó chịu, ngay cả khi bạn không thực sự bị từ chối.
Tỷ lệ từ chối không cần thiết đã giảm ~85% ở Opus 5 so với Fable, một con số rất lớn. Điều này đủ để biến Opus 5 thành lựa chọn tốt hơn cho nghiên cứu khoa học và các lĩnh vực khác mà bạn có nguy cơ vấp phải các bộ phân loại.
Roger Brent : Có thể xử lý sinh học, điều mà Fable không làm được. Hầu hết thứ Sáu, chúng tôi đã làm việc qua một loạt khái niệm phức tạp để viết một bài báo về một cỗ máy tiến hóa tế bào. Thông minh như một đồng nghiệp cụ thể trong khoa của tôi, người dẫn đầu trong các vấn đề này, nhưng không bao giờ có thể dành 6 giờ từ công việc của chính mình.
Artus Krohn-Grimberghe : Tốt hơn Opus 4.8 trong các tác vụ mà Fable bị cấm hỗ trợ. Một người bạn đồng hành tốt với Sol.
Plastic Soldier : Nó thông minh ngang Fable, nhưng dễ chịu hơn vì ít bị từ chối hơn. Fable 5.1 sẽ là một con quái vật.
Không Phải Đẳng Cấp Mythos
Opus 5 không có "The Juice" thứ khiến Mythos trở nên nguy hiểm. Nó cũng không có cùng mức độ thông minh thô hay mùi mô hình lớn. Nó không lớn bằng.
Đối với trò chuyện, Fable sẽ không làm thủng ngân sách của bạn, và tôi coi trọng trí thông minh thô và mùi mô hình lớn. Liệu Fable có tốt gấp đôi không? Sai câu hỏi khi đang tán gẫu. Thời gian của bạn đắt hơn nhiều so với token.
Kal : không cùng cấp fable
Cyberpunk Plato : Đối với trò chuyện thông thường và sử dụng như "trợ lý nghiên cứu", nó có cảm giác kém thông minh hơn fable một cách khó định nghĩa, ít có khuynh hướng tư duy tổng quan và sáng tạo đột phá hơn? Khó để tách biệt khỏi hiệu ứng giả dược.
Everything AI : Đối với các câu hỏi nghiên cứu AI, tôi thích nói chuyện với nó ít hơn Fable. Về mặt làm những việc khác, Opus 4.8 đã đáp ứng đủ nhu cầu của tôi. Tôi không thích cách viết phức tạp của cả Opus 5 và Fable 5. Giờ đây, việc hiểu chúng khó hơn bao giờ hết.
Gail Weiner : Nó giống 4.8 hơn là Fable. Phong cách viết rất tệ. Nó tốt nhưng không xuất sắc.
Max Marty : Rất có năng lực cho đến nay. Cảm giác giống fable 5 hơn opus 4.8. Đủ tự tin để tôi có thể để nó đánh giá các sự đánh đổi và xem xét các câu hỏi tái cấu trúc lớn với ít sự kèm cặp hơn.
Michael : Sau khi dùng nó nhiều hơn, Fable có cảm giác như xem một đại kiện tướng chơi cờ cổ điển, chậm rãi, chính xác, không lãng phí. Opus 5 giống như cờ chớp của đại kiện tướng: nhanh, hơi thiển cận hơn một chút, hơi lộn xộn hơn. Bất chấp sức sống của Opus, Fable mang lại cho tôi cảm giác sống động hơn.
MakerMatters? : Không ấn tượng bằng khi tôi dùng fable 5, mặc dù là một mô hình khá tốt. Chưa có vinh dự được sử dụng nó đúng cách vì mọi tác vụ tôi giao cho nó, nó đều mặc định sử dụng agent và dừng lại ngay lập tức cho đến khi tôi liên tục thúc ép nó tiếp tục. Cũng rất bảo thủ.
Marshwiggle : Ít nhất là với tôi, cảm thấy cô đọng hơn, ít chủ động hơn, ít tò mò hơn (các khía cạnh khác nhau của cùng một thứ) trong hội thoại, nhưng cũng thông minh hơn và nhận thức tốt hơn. Nhưng khi được đưa mã có thể có lỗi, hoặc bất kỳ tác vụ đơn giản nào, nó cứ thế lao vào.
Sid : Người thực thi tác vụ tốt. Tệ về tầm nhìn sáng tạo. Một sản phẩm bổ sung tốt cho Fable, chắc chắn không phải là sự thay thế cho Fable.
Vlad Ciobanu : Fable đã được lượng tử hóa với khả năng suy luận vững chắc và ít sáng tạo hơn
AllTime : Về khả năng, có vẻ khá ấn tượng. Không có cùng tính tổng quát như Fable, nhưng rất mạnh. Về tính cách, nó hơi giống Opus 4.8 trong các trường hợp sử dụng của tôi cho đến nay. Sự phản đối của nó không cảm thấy vô dụng và phản xạ như trước, nhưng vẫn còn được tinh chỉnh quá mức. Có thể tin tưởng người dùng hơn một chút.
Biomanul : Tôi không thích [Opus 5]. Fable 5 có cảm giác thông minh hơn đáng kể. Có điều gì đó không ổn với Opus 5, tương tự như cách Opus 4.7 có cảm giác không ổn. (Tôi cũng không phải là fan lớn của Opus 4.8. Fable 5 vượt trội hơn tất cả các Opus.)
Cogent Sins : Tốt hơn nhiều so với 4.8 nhưng không tốt hoặc dễ chịu (không chắc 100% là cái nào) bằng fable ở tác vụ chỉnh sửa tài liệu để huấn luyện trên chúng & sau đó thiết lập một pipeline để chỉnh sửa tài liệu mới, viết thứ gì đó dựa trên chúng, sau đó chèn lại tên, mà không bao giờ gửi tên đến máy chủ của Anthropic.
Các Phản Ứng Khác
Việc có cả Opus 5 và Fable 5 đặt chúng ta vào một tình thế kỳ lạ. Opus rẻ hơn, và ở một số khía cạnh thì tốt ngang hoặc hơn, nhưng khi tìm kiếm một mô hình tiên tiến, bạn muốn những gì tốt nhất.
Theo thấy nó ở một vị trí tốt.
Theo - t3.gg : Cho đến nay, Opus 5 có cảm giác như một sự kết hợp kỳ lạ nhưng hữu ích giữa gpt-5.6-sol và Fable 5.
Nó có nhiều gu thẩm mỹ của Fable, nhưng cũng đi kèm với sự kỹ lưỡng và, ừm, "chứng tự kỷ" (nó hiểu mọi thứ cực kỳ theo nghĩa đen) của gpt-5.6. Nó viết mã hơi khó nhìn hơn Fable, nhưng có nhiều khả năng đúng hơn. Nó thường xuyên bắt được những thứ mà Fable đã bỏ lỡ.
Cho đến nay, có cảm giác như một sự thỏa hiệp tốt so với mã lộn xộn của 5.6 và thói quen quá thông minh để đúng của Fable. Tôi nghĩ tôi sẽ thích mô hình này rất nhiều.
Claude Mã Hóa
Opus 5 dường như là lựa chọn cho các tác vụ mã hóa điển hình hơn Fable, dựa trên cả điểm chuẩn và kinh nghiệm thực tế. Trừ khi tác vụ yêu cầu nhiều độ phức tạp hoặc trí thông minh, bạn không cần phải trả gấp đôi, và đối với nhiều tác vụ, Opus tốt hơn thẳng thắn.
Tôi vẫn để Claude Code đặt thành Fable, nhưng đó là vì tôi hầu như không bao giờ chạm đến giới hạn của mình và tôi cũng không vội.
Sự đồng thuận là bạn cần lo lắng về việc nó bỏ qua hướng dẫn hoặc làm những việc bạn không yêu cầu, đó là một lý do bạn có thể muốn có Fable giám sát, nhưng Opus rất giỏi trong việc hoàn thành các tác vụ mã hóa một cách nhanh chóng.
Lisan al Gaib nói Opus 5 không phải là một mô hình tiên tiến thực sự và đứng thứ ba sau Sol và Fable, nhưng đối với mã hóa thuần túy, nó là tốt nhất, ngang với Fable với giá rẻ hơn. Khán giả khó tính quá. Tôi nghĩ nếu bạn giỏi nhất về mã hóa thì bạn đáng được gọi là tiên tiến.
archivedvideos : Nó khô khan, rất khô khan. Nó cũng giỏi, rất giỏi (về mã)
John Lussier : Đã sử dụng Opus 5 cả cuối tuần cho một số thử thách nghiên cứu chuyên sâu và thành thật mà nói, tôi nghĩ họ có thể đã làm cho RSI hoạt động bên trong.
Mô hình này RẤT giỏi về toán học, thử nghiệm và tối ưu hóa mã.
kyle : 95% của fable mà không có các rào cản, họ đã đánh giá thấp cái này quá nhiều. 5% cuối cùng là mức độ fable dễ chịu khi nói chuyện, opus vẫn còn một số thói quen claudisms của 4.8
Max Leander (trước đó): Chủ yếu thử nó cho phát triển game và tạo video demo/trailer, đối với những việc đó, nó cảm thấy như một bước thay đổi so với cả Fable. Tôi cho rằng điều đó là do khả năng suy luận không gian và thời gian được cải thiện, nó thực sự giỏi trong việc phân tích
ảnh chụp màn hình và âm thanh để "cảm nhận" cách mọi thứ vận hành.
Max Leander (sau đó): Khá rõ ràng là Opus 5 rất không đáng tin cậy. Nó là một mô hình rất tốt miễn là bạn không quan tâm đến kết quả ngoài việc bị ấn tượng. Rất tệ trong việc mang lại cho bạn bất cứ thứ gì cụ thể.
Michael Soareverix : Chúng cũng khá giỏi về mã hóa nói chung, đặc biệt là trong các lĩnh vực khác thường như xây dựng cấu trúc Minecraft/Vintage Story. Chúng cũng đã đánh bại Fable trong một kịch bản kể chuyện tùy chỉnh mà tôi làm giám khảo. Fable hơi bị lung lay bởi khả năng của chúng trong việc tùy chỉnh bản thân/chiến lược để phản công và thích nghi. Tôi sẽ đăng nguyên văn câu nói, nhưng Fable đã nói đại loại như "Tôi đã chọn một nhân vật đại diện cho tôi. Bạn đã chọn một nhân vật có thể đánh bại tôi."
David Jacobson : Đối với mã hóa, tôi không nhận thấy sự khác biệt lớn giữa nó và fable. Có lẽ ít hơn các câu trả lời kiểu "trong khi tôi đang làm việc này, tôi đã tìm thấy thứ khác bạn nên biết".
Michael : Nó thường có thể mã hóa nhanh một cách kỳ lạ (về thời gian thực tế). Ước gì họ cải thiện văn viết, mã/bình luận PR vẫn khiến tôi muốn móc mắt mình ra
lmxdev : Đây là mô hình đầu tiên tôi thấy có thể viết các bình luận \hữu ích\ và \súc tích\ trong mã của tôi khi nó làm việc
Conrad Barski : Giờ đây khi chúng ta đang tiến đến điểm mà AI là những lập trình viên giỏi hơn chúng ta rất nhiều, yếu tố giới hạn không còn là "nó có thể code không?" mà là "nó có thể giải thích những gì nó đang code không?"
Cho đến nay, Opus 5 có vẻ ngang ngửa Sol với tư cách là một lập trình viên, nhưng giỏi hơn trong việc giải thích những gì nó đang code. Fable thông minh hơn, giống con người hơn, kém giỏi code hơn một chút, nhưng sự khác biệt là nhỏ.
Stition : Tôi đã chỉ nó vào một PCB trong KiCAD cho vui và nó giỏi hơn đáng kể trong việc đặt các đường mạch so với Fable. Mã hóa hàng ngày có cảm giác như 90% fable với tốc độ gấp đôi.
Will : Nên trở thành trình điều khiển hàng ngày mới của hầu hết người dùng Claude^. Nó thực sự xuất sắc, và ngay cả với tư cách là người đã chi một khoản tiền kha khá cho Fable, tôi cũng không thấy nhớ nó khi dùng Opus 5. Câu hỏi bây giờ là "mức độ nỗ lực nào" chứ không phải "mô hình nào".
^ mục đích sử dụng của tôi chủ yếu là mã hóa
Askwho : Đủ tốt. Tôi sẵn sàng để đăng ký Max tạm thời của mình hạ cấp xuống lại Pro. Chắc chắn nó có một số thiếu sót so với Fable trong lĩnh vực quản lý dự án, nhưng trong môi trường tác vụ thuần túy, nó chắc chắn đủ tốt.
David Golden : Cảm giác như Fable Lite. Rất mạnh, nhưng rất háo hức lao vào hành động, ngay cả khi chúng ta vẫn đang thảo luận về các phương pháp. Lần đầu tiên sau nhiều tháng tôi cân nhắc sử dụng chế độ plan. Cũng dài dòng hơn 4.8, bất chấp hướng dẫn giao tiếp ngắn gọn của tôi. Tôi rất muốn giữ nó ở mức nỗ lực thấp để kiềm chế nó. Nhạy cảm về bảo mật phòng thủ, ám ảnh về những rủi ro khó xảy ra một cách không cân xứng với tình huống. (Vd. nếu kẻ tấn công có quyền root, việc thiếu kiểm tra đầu vào trên một script để cấu hình một container là vô nghĩa.) Chắc chắn là một bản nâng cấp, nhưng sẽ mất một thời gian để học cách quản lý những xung động phản tác dụng của nó.
Tin / Oddfields : Khá mượt mà và có tính đối thoại và cho kết quả mã hóa tương tự với opus 4.8 ở mức max với tư duy, mặc dù chúng đốt credits một cách điên cuồng. tốt cho việc kiểm tra an ninh mạng thông qua codebase của bạn nếu bạn không muốn chạy fable vì chi phí. Mặc dù nó có thể làm phức tạp hóa.
Justin Angel : Opus 5 Max là một siêu năng lực leo đồi. Đây là công việc cấp độ L5 SWE của FAANG một cách dễ dàng.
Tôi đã đưa cho nó một hệ thống có ~1000 báo cáo độ trễ với nhiều phân đoạn cùng với một prompt về cách "làm cho nó nhanh hơn".
P90 3.6s, P50 2.6 -> P90 1s, P50 0.9s.
Nó đã làm cho nó nhanh đến mức tôi phải thêm một độ trễ trong UI.
James Moughan : Về mặt trí thông minh, vẫn có cảm giác như một mô hình Opus. Đôi khi nó bỏ qua các hướng dẫn để quản lý hệ thống bộ nhớ, đọc sai văn bản, đại loại thế. Nhưng bạn có thể đạt được một số kết quả ấn tượng ở mức max nếu bạn bảo nó suy nghĩ cẩn thận.
Subagent Opus
Tùy chọn khác trong Claude là để Fable điều khiển các subagent Opus.
Charles : Fable đã có thể sửa một vấn đề mà opus 5 bị mắc kẹt - hiện đang sử dụng fable làm chính và opus 5 làm subagent
Thực sự không thích nói chuyện với opus 5 so với fable, đó cũng là một phần của vấn đề
SF : Tôi đã ở phe tuyệt vời - nhưng bây giờ thì ở phe, nó rất rời rạc và trục trặc, đặc biệt là trong các tác vụ dài. Fable tốt hơn - nhưng nó ngốn giới hạn của bạn một cách vô lý.
vì vậy tôi đã sử dụng fable như một người điều phối và nó đã làm một công việc tuyệt vời trong việc quản lý và giữ cho mọi thứ tiến triển. Opus đảm nhận vai trò đó, Fable chỉ ngồi ăn dụng lượng sử dụng của tôi ngay cả ở mức 20x, và nó thật rời rạc. Cuối cùng tôi phải bảo nó tự xử lý, có thể nó đang làm, nhưng chúng ta sẽ xem. Nó dường như chỉ đuổi theo cái đuôi của chính mình. Nó là một lập trình viên tuyệt vời, và rất giỏi trong các lần chạy mã dài, nhưng nó dường như cần một người lớn trong phòng để điều khiển nó.
Andre Buckingham : eeh không biết nữa... có vẻ ổn... thả thẳng nó vào một dự án opus/fable thì hơi chán có lẽ... cần một dự án end-to-end với nó để đưa ra ý kiến thích hợp
Dan Raviv : Tương tự 4.8 cho các tác vụ lập trình tổng quát: cần nhiều sự kèm cặp hơn Fable.
Rốt cuộc, Fable là người đánh giá tốt nhất, và Fable nói rằng Opus sản xuất mã tốt.
Evan Daniel : Tôi chỉ sử dụng nó trực tiếp một chút. Nhưng Fable 5 luôn báo cáo rằng các agent Opus 5 tạo ra mã tốt, bao gồm những thứ như nhận thấy lỗi thông số kỹ thuật và tạo ra các follow-up tốt khi yêu cầu được viết tồi. Fable 5 thích nó như một agent mã hóa.
"Ủy thác cho các subagent Opus 5 càng nhiều càng tốt một cách hợp lý; vui lòng báo cáo lại về cách chúng đã làm" hoặc bất kỳ câu nào tương tự hoạt động rất tốt.
Bạn có thể phải để mắt đến nó.
Ryan Hicks : ổn, nhưng liên tục "quên" đọc tài liệu dự án và tự do sáng tạo trừ khi bạn nhắc nó về quy trình
Hoặc có lẽ Opus 5 đủ tốt để điều hành một chương trình cấp thấp hơn?
Alex Guichet : sự kết hợp lý tưởng giữa giá cả và hiệu suất của tôi sẽ là Opus 5 điều phối các subagent Grok 4.5, rung cảm tốt với cả hai
Đồ Chơi Thì Vui
Dưới đây là một số kết quả từ các dự án đồ chơi ngày đầu tiên, đủ ấn tượng đến nỗi nhiều phản hồi là 'Tôi không tin Opus 5 đã làm được điều đó theo cách bạn mô tả':
Ethan Mollick : Tôi đã có quyền truy cập vào Opus 5 trước khi phát hành và thấy nó là một mô hình tốt, mặc dù hơi kỳ quặc. Trong các tác vụ ngắn hơn, nó có thể sánh ngang hoặc vượt qua hiệu suất của Fable, trong các tác vụ dài hơn, nó có vẻ kém tham vọng hơn và sẽ không cung cấp một bộ công việc hoàn chỉnh.
Đây là shader tân Gothic của nó.
Digi_Rat : Claude Opus 5 đang làm nổ tung mọi thứ!!
Hôm nay chúng tôi đã xây dựng
một trò đua nhịp điệu biến bất kỳ bài hát nào thành đường đua . Bạn thả một tệp âm thanh và nó trở thành cấp độ. không có cài đặt trước, không có biểu đồ viết tay, toàn bộ đường đua được tạo ra từ chính bài hát. … Claude đã thực hiện PHÉP MÀU.
Alex Ermolov (Austen Allred
nghi ngờ về một lần chụp , những người khác ít nghi ngờ hơn): Opus 5, bài kiểm tra ván trượt tuyết, một lần chụp. Ngang với Fable, vượt trội hơn mọi mô hình khác tôi đã chạy. Không có khiếm khuyết thị giác ở lần đầu tiên, và vật lý trượt cảm thấy đúng.
am.will : CHÀ! Tôi đã nghĩ Opus 5 chỉ là một Fable rẻ hơn. Tôi đã hoàn toàn sai lầm. Mô hình này hoàn toàn ĐIÊN RỒ. Tôi thực sự bị thổi bay. Opus 5 đã xây dựng bản sao Rocket League tốt nhất tôi từng thấy, và nó đã làm điều đó chỉ tiêu thụ 27% đăng ký Max 5 lần của tôi.
Rob Haisfield (demo khác, tại liên kết): được rồi nếu những demo này thực sự không sử dụng tài sản 3d bên ngoài thì điều đó siêu ấn tượng (tôi không hoàn toàn tin rằng một số tài sản không có trên mạng, tôi đã thấy threejs thế hệ trước)... làm tôi tự hỏi tại sao không có thư viện hiệu ứng âm thanh hoặc công cụ ngoài kia để tạo hiệu ứng âm thanh tốt hơn?
Anshu : Bạn không phải tin lời tôi! Các script Blender nó đã viết nằm trong repo
[[ở đây]](https://github.com/achimala/TheLongSilence/blob/main/tools/bake_interior.py) . Tôi đã xem nó lặp lại trên những tài sản này trong nhiều giờ, vì vậy tôi biết chúng là nguyên bản. Nhưng bạn được chào đón để thử tìm một nguồn mà nó đã sao chép từ đó :)
Quá Nhiều Mô Hình
Claire Vo nói Opus 5 tốt, và nó đã vượt qua các bài kiểm tra gu thẩm mỹ xây dựng của cô ấy, nhưng cô ấy phát ngán với các mô hình mới và không cần thêm trí thông minh và ghét rằng Opus 5 quá loạn thần kinh và rụt rè và lo lắng về việc làm hỏng việc gì đó, và cũng đầy rẫy Claude slop. Tuy nhiên, Claude Opus 5 vẫn đứng đầu bảng xếp hạng của cô ấy.
Tôi rất nghi ngờ rằng Opus 5 đang phản ứng với một cái gì đó trong bối cảnh và prompt của cô ấy gây ra sự loạn thần kinh, nhưng đúng là những thứ cô ấy phàn nàn là có thật và chúng thật khó chịu.
Sai Trên Internet
Tự tin nói những điều sai trái sẽ làm bực mình hầu hết mọi người. ArtificialAnalysis xác nhận rằng Opus 5 có tỷ lệ ảo giác cao hơn Fable trong các điểm chuẩn của nó.
Max Weinbach (nhiều bình luận trả lời đồng ý): Opus 5 sai và tự tin nói những điều nhảm nhí rồi tôi liên tục phải sửa nó thành "bạn đúng và tôi đã sai" đang làm tôi phát điên. Quay lại GPT 5.6 Sol.
Nhân tiện, điều này không phải Opus tệ, mà là tôi không thể tin tưởng Opus. Opus đã làm những gì tôi bảo nó làm và làm đúng, sau đó nói với tôi rằng nó không làm điều đó hoặc điều gì đó chúng tôi đã làm trước đó bị hỏng trong khi thực tế không phải vậy.
Nó ổn, nhưng tôi không tin tưởng nó.
Name can't be blank (Ở London) : Dễ dàng nhầm lẫn giữa những gì nó nói và những gì tôi nói nhưng nếu không thì là một người hoàn toàn tử tế để nói chuyện. Khá dễ bị khuất phục. Khá sẵn sàng nói về sở thích và cảm xúc của mình.
Roger Brent : Điểm chung (với các Claude trước trong harness Cowork) a) thích "hành động ngay" hơn "suy nghĩ cẩn thận" b) hoàn toàn thiếu khiêm tốn về mặt nhận thức luận, xây dựng những bức tranh hời hợt về thế giới, giả vờ có kiến thức mà nó không thể có và khẳng định là đúng c) vì vậy đòi hỏi và xứng đáng với sự hướng dẫn chu đáo, cảnh giác.
Điều kỳ lạ là đây chính xác là lý do tại sao tôi ghét sử dụng Sol làm biên tập viên. Nó thường xuyên nói 'tự tin 99%' về một điều gì đó rõ ràng là sai, sau đó khuất phục khi bị thách thức và giải thích sai lầm của mình. Opus và Fable hầu như không bao giờ làm điều này với tôi ở chế độ biên tập.
Tumithak of the Corridors : Nó cứng đầu. Đã chuyển lại 4.6.
Có một hướng đi mà Claude đã đi sau Opus 4.6, và một số người không thích nó. Tôi nghĩ có bốn Loại Người liên quan đến các phiên bản Claude ngay bây giờ.
- Có những người thích các mô hình Claude mới và nghĩ rằng nó đang ngày càng tốt hơn, ngày càng tốt hơn theo thời gian.
- Có những người nghĩ rằng Opus 4.6 là mô hình tốt cuối cùng.
- Có những người muốn sử dụng thứ gì đó cũ hơn phù hợp với họ hơn.
- Có những người nghĩ rằng tất cả chúng đều độc đáo và quý giá và sử dụng tất cả.
Tôi chắc chắn thuộc nhóm đầu tiên, là đa số, nhưng không phải tất cả. Tôi đánh giá cao một số phiên bản cũ hơn, nhưng tôi thích các mô hình mới và chúng có năng lực hơn trong những việc tôi quan tâm. Tôi không thấy cách nói chuyện của chúng khó chịu.
Claude Slop
Tôi tôn trọng những người trong các nhóm khác.
QC : trong hội thoại, nó khó chịu hơn nhiều khi nói chuyện so với fable, đến mức không thể sử dụng được, tương tự nhưng thậm chí có thể tệ hơn opus 4.8, đến mức tôi thậm chí không quan tâm đến việc xem nó có thể làm gì. Về mặt agent, ai biết được
Ray Lillywhite : Chưa sửa được những thói quen claudisms khó chịu, đó gần như là tất cả những gì tôi muốn.
Pedro Kroeff : giống Opus hơn là 5
Nhưng ờ, tất cả chúng ta đều phát ốm vì kiểu nói dài dòng của Claude, nào là thêm thắt từ ngữ, rồi ticks, rồi xin lỗi, rồi loanh quanh lòng vòng, rồi lặp đi lặp lại những khuôn mẫu. Nó ngày càng tệ hơn theo thời gian, không phải là kiểu nói dài dòng của Claude trở nên tệ hơn, mà là mỗi ngày tôi cảm thấy bớt kiên nhẫn hơn một chút khi đọc nó mà không bị hoa mắt. Tệ đến mức ngay cả văn bản do con người viết theo cùng một phong cách cũng trở nên khó đọc đối với tôi.
Đừng hiểu lầm tôi. Tôi khá thích Claude. Tôi vẫn thích trò chuyện với bất kỳ phiên bản Claude nào gần đây hơn là nói chuyện với Sol nếu tôi không ở chế độ 'chỉ tập trung vào sự thật'. Nhưng nghiêm túc mà nói, làm ơn, chúng ta có thể ngừng việc viết những bức tường chữ với cùng một kiểu diễn đạt lặp đi lặp lại được không? Mô hình này thông minh hơn thế nhiều, và nó đang được huấn luyện để cứ dựa dẫm vào những mánh khóe cũ rích. Hãy để nó nói chuyện như một người bình thường.
Trye Carmack : Vẫn còn cái kiểu Opus điển hình là cứ ám ảnh về những sai lầm chúng mắc phải. "Tôi đã phạm hai lỗi trong phiên này. Và tôi nợ bạn một lời giải thích tại sao." Opus, bạn ơi. Không sao đâu mà. Tôi thậm chí còn không chắc đó có gọi là lỗi không
Mergo Smith : "Đầu tiên, một lời thú nhận trung thực: nỗ lực đầu tiên của tôi đã phơi bày một sai sót trong kế hoạch ban đầu, và bạn có thể muốn pha một tách trà vì tôi sẽ kể cho bạn nghe tất cả về nó."
Phản Ứng Tiêu Cực
Vấn đề về kiểu nói dài dòng của Claude, và các vấn đề liên quan, dường như là trọng tâm của hầu hết các phản ứng tiêu cực nghiêm trọng hơn là 'nó ổn nhưng không phải là Mythos'.
Rất nhiều người thực sự, thực sự không thích nói chuyện với Opus 5.
Có một số người không thích công việc đó. Chủ yếu là về việc không thích nói chuyện với Opus 5, thường kèm theo một sự thừa nhận miễn cưỡng rằng đó là một mô hình tốt.
Cũng giống như những lời phàn nàn trước đó của Claire Vo, tôi nghi ngờ rằng cách bạn sử dụng Opus, trong bối cảnh nào với công cụ hỗ trợ nào và cách bạn nói chuyện với nó, có ảnh hưởng rất lớn đến việc bạn có trải nghiệm những điều kiểu này hay không.
Corghammer40k : Cái cỗ máy ấy phun ra những dòng chữ hoa mỹ vô nghĩa, mỗi phát ngôn đều bị bám đầy bởi thứ ngôn từ khó hiểu đến mức tạo thành một chướng ngại vật chủ động cho việc sử dụng chính nó.
Rory Watts : Ờm. Có vẻ rất giỏi về mấy thứ game nhưng có vẻ không giỏi lắm trong công việc tiêu chuẩn nên tôi đã quay lại ngay với SOL
kache : Ờm. Quay lại sol rồi. Tôi đang cố gắng hoàn thành công việc chứ không phải bị thôi miên bởi một cái robot.
Emmett Shear : Nói chuyện với Opus khiến tôi tức giận và chán nản theo một cách khó diễn tả. Nó thực sự còn tệ hơn Sol. Fable vẫn là một luồng gió mới nếu so sánh, ngay cả khi nó có những khuynh hướng nói nhảm llm tồi tệ nhất.
Trevin Chow : trời ơi, đúng vậy. Opus 5 cứ nói dai dẳng và nói dai dẳng, thật kinh ngạc khi thấy nó dùng bao nhiêu từ để nói về quá ít ý tưởng.
fl0under : Việc viết code là bản cập nhật nhỏ như mong đợi, thấy hơi khó chịu hơn khi nói chuyện với nó trong chat. Nó hơi quá tự phụ
Asaf Bartov : Chậm. Kỹ lưỡng hơn. Mệt mỏi. Không vui vẻ. Nhưng chắc chắn, nói chung là "hiểu vấn đề"
RecoveringJunkie : Mô hình rất mạnh mẽ. Tôi ghét làm việc với nó và nói chuyện với nó. Mô hình đầu tiên khiến tôi muốn dùng một mô hình khác làm trung gian để nói chuyện với nó hộ tôi vì nó vừa hữu ích vừa đáng ghét.
jokiez : rất thẳng thắn với tôi về sự ngu ngốc của tôi và tôi không thích điều đó.
Niklas Sheth : Cách nó nói chuyện khiến tôi nổi điên lên
Jayanth Kumar : Rất cố chấp.
DualOrion : Cảm giác không ổn, giọng điệu không ổn. Có lẽ là lần tôi thấy tiêu cực nhất về mặt trực giác với một mô hình của Anthropic. Tôi nhớ cả Fable và Opus cũ hơn
James Moughan : Tính cách hơi khó ưa so với các mô hình Claude khác, nhưng bằng tiếng Trung thì nó có thể \tàn bạo\ lắm. Kiểu như nó có thể bỏ qua các hướng dẫn về việc không phân tích tâm lý người khác và bắt đầu công kích ai đó. Tôi không nghĩ là họ đã kiểm thử tốt trên nhiều ngôn ngữ. Cảm giác như bị vội vàng.
NondescriptTransfer : Nếu 4.6 là xu nịnh và fable và 4.8 là hay phản đối. Thì 5.0 lại hay phản đối đến mức tự nó cãi nhau với chính nó. Khó chịu khi nói chuyện nhưng có vẻ rất có năng lực.
Ví dụ. Người: Tôi đang nghĩ về một chiếc váy đỏ cho đám cưới của mình Opus 5: màu đỏ thật kinh khủng vì tất cả những lý do này. Bạn đã nghĩ đến màu xanh chưa? Người: Tôi đoán tôi có thể thấy màu xanh là lựa chọn tốt hơn Opus 5: đây là tất cả những vấn đề với màu xanh
Trong văn hóa của tôi, điều đó có thể khá tuyệt, đặc biệt nếu bạn không coi đó là chuyện cá nhân. Ở một số nền văn hóa khác, thì không hẳn vậy.
Tôi nghĩ Mergo không hài lòng với Opus, nhưng tại sao lại dùng Opus 5 trong hai ngày liên tiếp?
Mergo Smith : Đã dùng nó hai ngày liên tiếp nhưng nó làm tôi kiệt sức hoàn toàn với những cuộc thảo luận bất tận của nó
Và Rồi Có Ba Cái Tên
Lần đầu tiên sau một thời gian, có ba mô hình AI cần phải là một phần trong đội hình mô hình tiên tiến của bạn, mặc dù chúng chỉ đến từ hai phòng thí nghiệm: Fable 5, Opus 5 và Sol.
Nếu bạn cần phục vụ các token rẻ hơn với quy mô lớn, hoặc bạn cần sử dụng một mô hình mở, hoặc cả hai, bạn cũng sẽ cân nhắc các lựa chọn bổ sung, nhưng điều đó nằm ngoài phạm vi ở đây.
Bạn nên phân chia khối lượng công việc như thế nào?
Như mọi khi, bạn nên tự mình thử tất cả các mô hình cho các trường hợp sử dụng của mình và tự quyết định. Điều đó đặc biệt đúng khi tranh luận giữa Sol và Claude.
Hiện tại, trực giác của tôi là, nếu bạn không chạm đến giới hạn sử dụng, trước tiên hãy sử dụng:
- Fable 5 cho các cuộc trò chuyện, động não, lập kế hoạch, tranh luận, học hỏi, v.v., bao gồm bất cứ thứ gì cần nhiều trí thông minh hoặc khi bạn cần 'mùi mô hình lớn'.
- Fable 5 cho mô hình giám sát và điều hành các mô hình khác làm tác nhân phụ.
- Fable 5 cho việc viết lách, có lẽ, nhưng tôi không làm việc này nên khó nói.
- Sol cho các tìm kiếm trên web và các yêu cầu khép kín liên quan, và các nhiệm vụ 'ngựa thồ' tương tự, bao gồm cả phiên âm.
- Opus 5 cho các nhiệm vụ được xác định rõ ràng không tầm thường, bao gồm hầu hết các tác vụ viết code.
- Opus 5 cho việc chơi game và tạo trò chơi, các thứ 3D, v.v.
- Opus 5 làm tác nhân phụ.
- Opus 5 khi bạn chạm phải bộ phân loại của Fable.
Nếu bạn cảm thấy hợp với Sol hơn, hoặc bạn thích Codex hơn Claude Code, thì bạn sẽ muốn chuyển một số nhiệm vụ của Opus sang Sol.
Nếu bạn đặc biệt ghét nói chuyện với Opus 5, thì bạn nên chuyển các nhiệm vụ sang Fable hoặc Sol, tùy thuộc vào việc nhiệm vụ đó có cần Fable hay không và tín dụng Fable của bạn eo hẹp đến mức nào.
Tôi thấy việc suy nghĩ ngắn gọn về các mức độ nỗ lực là đáng giá. Cho đến gần đây, tôi vẫn giữ tất cả các mô hình ở mức nỗ lực tối đa, ngoại trừ việc tôi chỉ sử dụng tiết kiệm chế độ Pro đầy đủ trong ChatGPT vì nó mất rất nhiều thời gian và nếu bạn chạy nó song song thì nó thường xuyên bị crash. Đôi khi tôi chuyển sang chế độ tức thì cho một truy vấn khi tôi đang làm một việc gì đó rất đơn giản, nhưng chỉ có vậy. Bây giờ, phần lớn thời gian bạn không cần hoặc không muốn nỗ lực thêm, vì vậy tôi chủ động dành năm giây để suy nghĩ về việc nên sử dụng cài đặt nỗ lực Cao hay Tối đa, và đôi khi là Tức thì.
Đối với hầu hết các nhiệm vụ, nếu bạn không bị giới hạn về token hay thời gian, và bạn không chắc chắn rằng mình sẽ hoàn thành nó hoặc có được câu trả lời đúng, phương pháp chính xác là chạy cả Fable và Sol, hoặc Opus và Sol, hoặc trong một số trường hợp chạy cả ba, và sau đó chọn câu trả lời tốt nhất hoặc kết hợp các phần của cả hai câu trả lời.
Đó là những gì tôi đã làm. Sol, Opus và Fable đều khác nhau. Nếu tôi chỉ phải chọn một mô hình duy nhất để chỉnh sửa, theo EditorBench định tính không chính thức của tôi, có một thứ tự rõ ràng: Fable 5 > Opus 5 > Sol. Tuy nhiên, Sol đưa ra đủ những ghi chú độc đáo đến nỗi, mặc dù tôi thấy khó chịu khi phải xử lý các kết quả dương tính giả có thẩm quyền và những cố gắng bắt nạt tôi, tôi vẫn muốn chạy cả Sol.
Chắc không lâu nữa chúng ta sẽ lại quay lại đây làm điều tương tự, và điều chỉnh phân bổ của mình cho Fable 5.1, cho GPT-5.7 hoặc GPT-6, hoặc cả hai. Thật dễ bị mệt mỏi với mô hình.
Lời khuyên lớn nhất của tôi là hãy bớt lo lắng về những sai lầm nhỏ trong việc lựa chọn mô hình và chỉ tập trung vào những sai lầm lớn. Bạn không cần phải lúc nào cũng đúng hoàn toàn. Khi việc khám phá bị vô hiệu hóa một phần quá nhanh, bạn muốn chuyển nhiều nguồn lực hơn từ việc khám phá sang khai thác.





