YouMind
Đăng nhập

Opus 4.8: Cùng một mức giá, hiệu quả gấp đôi

@shmidtqq
TIẾNG ANH30 thg 5, 2026
1.2M
215
18
33
516

TL;DR

Opus 4.8 của Anthropic mang đến những nâng cấp vận hành đáng kể, bao gồm kiểm soát nỗ lực và quy trình làm việc linh hoạt. Mặc dù các bài kiểm tra hiệu năng chỉ cho thấy mức tăng trưởng khiêm tốn, giá trị thực sự nằm ở việc tối ưu hóa mức sử dụng token và tốc độ cho các tác vụ lập trình phức tạp.

Cùng một mức giá. Hầu hết mọi người sẽ chỉ đổi model và bỏ lỡ mọi thứ khác.

shmidt - inline image

Cùng với Opus 4.8, Anthropic đã phát hành ba thứ thay đổi cách bạn làm việc trong Claude Code nhiều hơn các con số benchmark: kiểm soát nỗ lực (effort control), quy trình làm việc động (dynamic workflows) và chế độ nhanh rẻ hơn. Những người cấu hình chúng đúng cách sẽ đạt kết quả tốt hơn và tốn ít chi phí hơn. Đây là phân tích chi tiết.

Con số quan trọng nhất

Không phải là 69.2% về code. Mà là 4.8 ít bỏ sót lỗi trong code do chính nó viết hơn khoảng 4 lần.

Các model cũ thích tự tin nói "xong, lỗi đã sửa" với bằng chứng mỏng manh. Anthropic đã nghiêng về sự trung thực: 4.8 chậm lại thường xuyên hơn và đánh dấu những chỗ nó không chắc chắn, thay vì tạo ra code có vẻ hợp lý nhưng âm thầm gây lỗi ở các trường hợp ngoại lệ. Trong một phiên làm việc dài, điều này tích lũy lại. Một model thừa nhận sự không chắc chắn ở lượt thứ 15 giúp bạn tiết kiệm vài giờ gỡ lỗi ở lượt thứ 40.

Những gì đã thay đổi: phiên bản ngắn

Code.

SWE-bench Verified: 87.6% → 88.6% (gần mức trần).

SWE-bench Pro (khó hơn, ít bị nhiễu hơn): 64.3% → 69.2%, hơn GPT-5.5 10+ điểm.

Đây là con số code chính.

Terminal.

Terminal-Bench 2.1: 66.1% → 74.6% (+8.5), nhưng GPT-5.5 vẫn dẫn đầu (78.2%). Benchmark duy nhất trong số bảy cái mà 4.8 thua.

Công việc tri thức.

GDPval-AA: 1890 Elo so với 1769 của GPT-5.5. Khoảng cách lớn nhất trên toàn bảng.

Sử dụng máy tính.

OSWorld-Verified: 83.4% (một phần của sự cải thiện đến từ một harness được cập nhật, điều mà Anthropic công khai thừa nhận).

Khoa học.

GPQA Diamond: 93.6%, về cơ bản là không đổi (cả hai model đều trên 93%, đó là sự bão hòa, không phải là sự thoái lui).

shmidt - inline image

Chính Anthropic gọi bản phát hành này là "một sự cải thiện khiêm tốn nhưng hữu hình." Các benchmark là một điểm cộng. Những thay đổi về vận hành dưới đây mới là câu chuyện thực sự.

Tính năng 1. Kiểm soát nỗ lực (cái bị đánh giá thấp nhất)

Opus 4.8 mặc định ở mức nỗ lực Cao. Nhưng bây giờ bạn quyết định nó sẽ dành bao nhiêu suy nghĩ cho một tác vụ. Hãy nghĩ về nó như một hộp số sàn cho lý luận.

Trong claude.ai và Cowork, thanh trượt nằm cạnh bộ chọn model, với năm mức: Thấp, Trung bình, Cao (Mặc định), Thêm, Tối đa, cùng với một nút bật/tắt Suy nghĩ riêng. Trong Claude Code, đó là các mức tương tự với tên hơi khác và có chế độ tự động:

Lưu ý: "Thêm" trong claude.ai và xhigh trong Claude Code là cùng một mức, chỉ khác nhãn trên các bề mặt khác nhau.

shmidt - inline image

Phần quan trọng, để không có sự nhầm lẫn. KHÔNG có phụ phí riêng cho mỗi mức nỗ lực. Giá là như nhau ở mọi mức: $5 cho 1M token đầu vào, $25 cho 1M token đầu ra. Sự khác biệt không phải là giá mỗi token, mà là số lượng token model tiêu tốn. Mức Thấp trả lời ngắn gọn và ít suy nghĩ, mức Tối đa suy nghĩ lâu và đốt cháy nhiều token hơn gấp nhiều lần. Vì vậy, Tối đa "đắt hơn" vì khối lượng, không phải vì giá.

Một hướng dẫn sơ bộ về chi tiêu tương đối cho cùng một tác vụ (các con số mang tính minh họa, để dễ hình dung):

Một ví dụ về tiền bạc. Giả sử một câu trả lời ở mức Cao tốn khoảng $0.05. Cùng một yêu cầu ở mức Thấp tốn khoảng ~$0.005, và ở mức Tối đa có thể dễ dàng lên tới ~$0.20-0.40. Nếu 60% lời nhắc của bạn là nhỏ ("hàm này trả về cái gì?"), việc chuyển chúng từ Cao xuống Thấp sẽ cắt giảm chi tiêu hàng ngày nhiều lần, mà không ảnh hưởng đến chất lượng ở những chỗ quan trọng.

Tại sao điều này ảnh hưởng nhiều nhất đến hóa đơn. Hầu hết mọi người sẽ để mọi thứ ở mức Cao (hoặc vặn lên Tối đa "để an toàn") và không bao giờ chạm vào thanh trượt. Những người định tuyến nỗ lực theo từng tác vụ sẽ nhận được kết quả tương tự với chi phí thấp hơn đáng kể. Đó là tính năng bị đánh giá thấp nhất trong bản phát hành.

Tính năng 2. Chế độ nhanh (rẻ hơn 3 lần)

Chế độ nhanh chạy Opus với tốc độ nhanh gấp 2.5 lần với chất lượng tương tự và hiện rẻ hơn 3 lần so với trước đây.

Bật nó trong Claude Code bằng /fast (một phiên đang hoạt động được đánh dấu bằng biểu tượng ↯). Quyền truy cập API hiện đang được giới hạn (danh sách chờ tại claude.com/fast-mode).

Sử dụng chế độ nhanh cho: tái cấu trúc nhiều tệp lớn, tạo code từ đặc tả, tài liệu, tạo test. Bất cứ nơi nào tốc độ vượt trội hơn chiều sâu. Ở lại chế độ tiêu chuẩn cho: gỡ lỗi phức tạp, quyết định kiến trúc, đánh giá bảo mật. Bất cứ nơi nào chất lượng suy nghĩ vượt trội hơn tốc độ.

Tính năng 3. Quy trình làm việc động (cái lớn)

Claude Code hiện viết một script điều phối JavaScript cho tác vụ của bạn và chạy nó trong nền trong khi phiên làm việc của bạn vẫn phản hồi. Kế hoạch nằm trong code, không phải trong ngữ cảnh của model, vì vậy chỉ có câu trả lời cuối cùng quay lại phiên làm việc của bạn.

Những điều cần biết, từ tài liệu chính thức:

  • Lên đến 16 tác nhân phụ đồng thời, giới hạn cứng là 1,000 tổng số mỗi lần chạy.
  • Có thể tiếp tục: nếu laptop của bạn chết hoặc bạn đóng terminal, lần chạy sẽ tiếp tục từ chỗ nó dừng lại.
  • Yêu cầu Claude Code v2.1.154+. Bản xem trước nghiên cứu.
  • Bật theo mặc định trên Max, Team, Enterprise. Trên Pro, bật nó trong /config (và chuyển sang Opus 4.8 trước).
  • Các tác nhân phụ chạy ở chế độ acceptEdits và kế thừa danh sách cho phép công cụ của bạn.

Kích hoạt nó bằng /effort ultracode (một cài đặt Claude Code: xhigh cộng với điều phối quy trình làm việc tự động), hoặc chỉ cần mô tả một tác vụ lớn bằng lời:

shmidt - inline image

Tốt cho: di chuyển qua 200+ tệp, kiểm tra bảo mật toàn bộ codebase, tạo test trên toàn dự án, tái cấu trúc lớn, nghiên cứu qua nhiều kho lưu trữ. Không tốt cho: sửa lỗi đơn giản, chỉnh sửa một tệp, câu hỏi nhanh. Quá mức cần thiết.

Về chi phí. Quy trình làm việc tiêu tốn nhiều token hơn đáng kể so với một phiên bình thường. Cách chính thức để giữ chi tiêu trong tầm kiểm soát là xác định phạm vi tác vụ: chạy kiểm tra trên một thư mục trước, xem nó tạo ra bao nhiêu tác nhân phụ, sau đó hiệu chỉnh lần chạy lớn từ đó.

Để tắt hoàn toàn quy trình làm việc:

Ví dụ cấu hình Claude Code (mẫu khởi đầu)

Biến môi trường (trong ~/.zshrc hoặc ~/.bashrc):

Sau đó là phần hữu ích: một tệp settings.json với các quyền an toàn. Nó cho phép model đọc và chỉnh sửa code, chạy test và commit, nhưng chặn cứng những thứ nguy hiểm: đọc .env và khóa SSH, rm -rf, sudo và git push. Tác nhân làm việc tự do nhưng không thể phá vỡ bất cứ thứ gì hoặc rò rỉ bất cứ thứ gì.

shmidt - inline image

Tệp settings.json sẵn sàng để dán nằm trong kênh Telegram của tôi (định dạng quá lớn để đọc rõ ở đây): t.me/+JmDeelv5UCwwMTcy

shmidt - inline image

Bảng cheat lệnh hàng ngày

Cài đặt Opus 4.8: ba cách

A. Trình duyệt hoặc ứng dụng. Trên claude.ai, chọn Claude Opus 4.8 trong danh sách model và đặt thanh trượt nỗ lực. Không cần cài đặt.

B. API. Model ID claude-opus-4-8. Giá $5/$25 cho mỗi 1M. Ngữ cảnh lên đến 1M (200k trên Microsoft Foundry), đầu ra lên đến 128k. Suy nghĩ mở rộng với ngân sách cố định không được hỗ trợ: sử dụng suy nghĩ thích ứng (thinking: {type: "adaptive"}) và tham số nỗ lực.

C. Claude Code (terminal). Trình cài đặt gốc hiện là phương pháp được khuyến nghị (npm là kế thừa):

Sau đó chạy claude, đăng nhập qua trình duyệt và chọn Opus 4.8 bằng /model.

Danh sách kiểm tra di chuyển: 4.7 lên 4.8

  • Thay đổi model ID thành claude-opus-4-8
  • Chạy 10-20 tác vụ thực tế của bạn trên 4.7 và 4.8 với các lời nhắc giống hệt nhau
  • So sánh: tỷ lệ hoàn thành, số bước, token, tỷ lệ đậu test
  • Kiểm tra các lời nhắc được tinh chỉnh cho hành vi của 4.7
  • Chỉ định mức nỗ lực cho từng loại tác vụ
  • Kiểm tra chế độ nhanh ở những nơi tốc độ quan trọng
  • Cập nhật Claude Code lên v2.1.154+ (cho quy trình làm việc)
  • Kiểm tra lại hóa đơn API sau tuần đầu tiên

Thẻ lưu: mọi thứ trong một nơi

Model: claude-opus-4-8 · phát hành 2026-05-28

Giá: $5 / $25 cho mỗi 1M · chế độ nhanh $10 / $50

Ngữ cảnh: lên đến 1M · đầu ra lên đến 128k

Chính: SWE-bench Pro 64.3% → 69.2% (+10 so với GPT-5.5) · SWE-bench Verified 88.6% · Ít lỗi bị bỏ sót hơn 4 lần · GDPval-AA 1890 Elo

Mới: kiểm soát nỗ lực · chế độ nhanh rẻ hơn 3 lần · quy trình làm việc động (16 đồng thời / 1,000 mỗi lần chạy)

Cảm ơn bạn đã đọc. Nếu bạn chỉ nhớ một điều từ bài viết này, hãy nhớ "định tuyến nỗ lực theo từng tác vụ."

Phần còn lại của các ghi chú của tôi về Claude và vibe coding nằm ở đây: t.me/+JmDeelv5UCwwMTcy.

Hẹn gặp lại ở đó.

@shmidtqq.

Lưu một chạm

Đọc sâu bài viết viral bằng AI trong YouMind

Lưu nguồn, đặt câu hỏi tập trung, tóm tắt lập luận và biến một bài viết viral thành các ghi chú có thể tái sử dụng trong một không gian làm việc AI duy nhất.

Khám phá YouMind
Dành cho nhà sáng tạo

Biến Markdown của bạn thành bài viết 𝕏 gọn gàng

Khi bạn đăng bài viết dài của riêng mình, việc định dạng hình ảnh, bảng và khối mã cho 𝕏 rất mệt mỏi. YouMind biến cả bản nháp Markdown thành một bài viết 𝕏 gọn gàng, sẵn sàng để đăng.

Thử Markdown sang 𝕏

Thêm pattern để giải mã

Bài viết viral gần đây

Khám phá thêm bài viết viral