Fable 5.1 là một con quái vật. Và nó đốt token cũng chẳng kém cạnh.
Đây là cách cắt giảm lãng phí token với bốn lệnh, và các kho lưu trữ mã nguồn mở miễn phí giúp cắt giảm sâu hơn nữa.
Không có thao tác nào ảnh hưởng đến chất lượng đầu ra. Nó chỉ thay đổi những gì bạn trả cho cùng một kết quả.
Và tất cả đều hoạt động dù bạn có dùng Fable 5.1 hay không, bởi vì chi phí token được tính theo cùng một cách bất kể bạn chạy mô hình nào.
Bây giờ hãy bắt đầu.
Bước 1: Giảm mức độ nỗ lực của bạn.
Đây là mẹo lớn nhất, và đó là một cài đặt bạn có thể kiểm soát trên mọi yêu cầu.
Có năm mức độ: low, medium, high, xhigh, và max.
Effort kiểm soát mức độ suy luận của mô hình trước khi nó trả lời. Effort cao hơn đồng nghĩa với việc suy nghĩ nhiều hơn trước khi phản hồi, điều này tốn nhiều token hơn cho dù tác vụ có thực sự cần sự suy luận đó hay không.
Đây là cách nghĩ về nó. Mức độ nỗ lực giống như việc bạn để ai đó suy nghĩ bao lâu trước khi họ trả lời. Hỏi bất kỳ ai 2+2 bằng mấy, họ sẽ nói "4." Bảo họ suy nghĩ kỹ trong mười phút trước, và bạn phải trả cho mười phút suy nghĩ để nhận được cùng một kết quả "4."
Vâng...hầu hết các tác vụ đều là 2+2.
Hướng dẫn của Anthropic cho Fable 5.1 là: bắt đầu ở mức high, đây là mức mặc định. Tăng lên xhigh hoặc max chỉ dành cho các công việc viết mã và tác nhân đòi hỏi khả năng cao nhất. Giảm xuống medium hoặc low cho các tác vụ thông thường hoặc nhạy cảm với độ trễ, sau khi đã xác nhận mức thấp hơn vẫn giữ được chất lượng.

Các con số thật đáng kinh ngạc. Trên CursorBench, Fable 5.1 ở mức low effort đạt điểm cao hơn Fable 5 ở mức high effort, với chi phí chỉ bằng một phần ba.
Hãy kiểm tra trước khi tin tưởng. Chọn một tác vụ mà bạn đã biết câu trả lời đúng, sau đó chạy nó ở mức low.
"Hãy chạy yêu cầu này ở mức low effort và cho tôi biết điều gì đã thay đổi trong phản hồi"
Sử dụng một trong các tác vụ thực tế của bạn. So sánh trực tiếp đầu ra trước khi cho rằng low effort đồng nghĩa với kết quả tồi tệ hơn. Giữ lại những thứ nặng ký, suy luận nhiều bước, gỡ lỗi thực sự, bất cứ thứ gì mà một câu trả lời sai sẽ tốn thời gian về sau, ở mức high hoặc cao hơn.
Bước 2: Chạy cost-optimize.
Lệnh này ra mắt vào ngày 26 tháng 8 như một phần của kỹ năng claude-api. Nó xem xét việc sử dụng gần đây và xếp hạng các đòn bẩy chi phí quan trọng cho một dự án cụ thể.
1/claude-api cost-optimize
Nó kiểm tra bộ nhớ đệm (caching), vệ sinh token, xử lý hàng loạt (batch processing), mức độ nỗ lực và lựa chọn mô hình, theo thứ tự đó. Bộ nhớ đệm và vệ sinh token thường là các bản sửa lỗi rẻ nhất và mang lại lợi ích nhanh nhất, trước khi nó đề xuất bất cứ điều gì mang tính cấu trúc như chuyển đổi mô hình.

Mỗi đề xuất được chấp thuận hoặc bỏ qua từng cái một. Không có gì thay đổi nếu không có xác nhận, vì vậy không có rủi ro nó viết lại toàn bộ thiết lập.
Bước 3: Chạy prompt-audit.
Các prompt và kỹ năng (skills) tích tụ rác rưởi theo thời gian.
Hãy nghĩ về nó như một ngăn kéo đồ linh tinh. Mỗi lần chỉnh sửa lại bỏ thêm một thứ vào, và bạn không bao giờ dọn dẹp nó. Ngoại trừ việc "ngăn kéo" này tính phí token cho mọi yêu cầu, mãi mãi, cho đến khi đống rác được loại bỏ.
1/claude-api prompt-audit

Chạy nó trên bất kỳ thư mục Skills nào bạn có. Các kỹ năng cũ, những kỹ năng mà bạn có thể đã chỉnh sửa đi chỉnh sửa lại, chính xác là nơi nó tìm thấy nhiều rác nhất. Mỗi lần chỉnh sửa đều thêm thứ gì đó mà không loại bỏ những gì nó đã thay thế. Hãy chạy nó và bạn sẽ nhận thấy sự khác biệt.
Bước 4: Di chuyển các cấu hình API cũ.
Nếu một dự án vẫn đang chạy cấu hình được xây dựng cho một mô hình trước đó, lệnh này sẽ xử lý việc hoán đổi ID mô hình cùng với bất kỳ thay đổi tham số phá vỡ nào trong toàn bộ mã nguồn.
1/claude-api migrate this project to claude-fable-5-1
Đặt tên cho mô hình đích thực tế. Nó xác nhận phạm vi trước, toàn bộ thư mục làm việc, một thư mục con hoặc một danh sách tệp cụ thể, trước khi chỉnh sửa bất cứ thứ gì. Sau đó, nó trả lại cho bạn một danh sách kiểm tra những gì còn lại để xác minh bằng tay.
Bốn kho lưu trữ để cắt giảm lãng phí hơn nữa.
Những thứ này không dành riêng cho Fable 5.1. Trên bất kỳ mô hình nào, việc tiết kiệm token tương tự cũng được áp dụng, vì vậy thật tốt khi biết những gì có sẵn và mỗi thứ thực sự làm gì.
Caveman

Nén các phản hồi của chính mô hình thành các câu trả lời ngắn gọn, kiểu điện tín thay vì dài dòng.
Thiết lập:
1curl -fsSL https://raw.githubusercontent.com/JuliusBrussee/caveman/main/install.sh | bash
RTK

Một proxy Rust nén đầu ra lệnh shell trước khi nó đến ngữ cảnh của mô hình.
Thiết lập:
1brew install rtk2rtk init -g
Ponytail

Làm cho tác nhân viết ít mã hơn ngay từ đầu. Một góc nhìn của senior developer, người chọn một dòng thay vì năm mươi dòng.
Thiết lập:
1/plugin marketplace add DietrichGebert/ponytail2/plugin install ponytail@ponytail
CodeGraph

Công cụ này hoạt động hoàn toàn khác. Thay vì nén văn bản, nó xây dựng một đồ thị tri thức (knowledge graph) của mã nguồn, để tác nhân có thể truy vấn trực tiếp các mối quan hệ ký hiệu và đồ thị gọi hàm (call graphs) thay vì quét các tệp bằng grep và read.
Thiết lập:
1npx @colbymchenry/codegraph2cd your-project3codegraph init -i
Bắt đầu từ đâu.
Nếu không làm gì khác, hãy thực hiện Bước 1. Giảm mức độ nỗ lực cho tác vụ thông thường tiếp theo và so sánh đầu ra. Một cài đặt đó có tác động đến tín dụng của bạn hơn bất kỳ kho lưu trữ nào, và nó chẳng tốn kém gì để thử.
Sau đó chạy cost-optimize và prompt-audit trên bất kỳ dự án nào của bạn.
Bốn cài đặt đã được xác nhận từ chính nhóm của Anthropic đánh bại bất cứ thứ gì được cài đặt từ một kho lưu trữ. Hãy khám phá hệ sinh thái rộng lớn hơn sau đó với bốn kho lưu trữ tôi đã đưa cho bạn.
Nếu điều này giúp bạn tiết kiệm token/tiền bạc, hãy nhớ like và chia sẻ nó với mạng lưới của bạn.
Hẹn gặp lại bạn ở bài viết tiếp theo :)





