Thực chất hóa đơn của OpenAI hay Anthropic gồm những gì, những mức giảm giá mà cả hai công ty này công bố nhưng bạn không thể tiếp cận từ một hộp chat, và lý do tại sao lớp hạ tầng có thể tiếp cận chúng vừa trở thành thứ mà bạn có thể sở hữu.
Hỏi hầu hết mọi người rằng AI tốn kém bao nhiêu, họ sẽ nêu ra một khoản phí đăng ký hàng tháng.
Hỏi chi phí cho một cuộc hội thoại là bao nhiêu, căn phòng sẽ chìm vào im lặng, điều đó cũng dễ hiểu, vì câu trả lời trung thực khá phức tạp. Cả OpenAI và Anthropic đều tính phí theo một đơn vị mà bạn không thể nhìn thấy, định giá dựa trên bốn trục riêng biệt, và công bố một loạt các mức giảm giá trong tài liệu của chính họ mà gần như hoàn toàn không thể tiếp cận nếu bạn chỉ đang ngồi trước một ô nhập văn bản.
Không có gì ở đây là bị che giấu. Tất cả đều nằm trên các trang định giá và trong tài liệu dành cho nhà phát triển của họ ngay lúc này. Nó chỉ đơn giản là đòi hỏi bạn phải đứng ở một tầng thấp hơn so với nơi hầu hết mọi người đang đứng.
Khoảng cách giữa bảng giá được công bố và mức giá mà một người dùng bình thường phải trả không phải là một vụ bê bối. Đó là một mô hình kinh doanh, và cho đến gần đây, bạn không có cách nào để đứng ở phía bên kia của nó.
Bài viết này trình bày những gì thực sự nằm trong hóa đơn, lý do tại sao các đòn bẩy thực sự lại nằm ở đó, và điều gì thay đổi khi lớp hạ tầng kéo các đòn bẩy đó trở thành thứ mà bạn có thể nắm giữ chứ không chỉ là thứ mà bạn phải trả tiền. Nếu bạn muốn đọc thêm các bài viết tương tự về AI và quyền sở hữu, hãy theo dõi @MossAI_Official.
7 điều xuất hiện trên hóa đơn của bạn, trích trực tiếp từ tài liệu của họ
Tất cả những nội dung dưới đây đều được OpenAI hoặc Anthropic công bố. Hầu như không có gì trong số đó là kiến thức phổ biến bên ngoài các nhóm kỹ thuật. Tỷ lệ thay đổi liên tục, vì vậy hãy coi các con số là minh họa cho cấu trúc chứ không phải là báo giá cố định.
- Chi phí đầu ra cao gấp nhiều lần chi phí đầu vào, trên cả hai nền tảng
Mọi mô hình trên cả hai bảng giá đều tính phí đầu vào và đầu ra riêng biệt, và đầu ra luôn đắt đỏ hơn. Tỷ lệ thường dao động từ bốn đến sáu lần.

Góc nhìn thực tế quan trọng nhất ở đây là: Những gì bạn gõ gần như miễn phí. Những gì mô hình phản hồi mới là hóa đơn. Việc giới hạn câu trả lời giúp giảm chi phí của bạn nhiều hơn so với việc cắt ngắn câu hỏi, điều ngược lại với cách hành xử của hầu hết mọi người.
2. Bạn bị tính phí cho phần suy luận mà bạn không được phép đọc
Đây là điểm thực sự đáng ngạc nhiên.
Tài liệu trợ giúp của OpenAI nêu rõ rằng các token suy luận (reasoning tokens) không hiển thị dưới dạng văn bản câu trả lời nhưng vẫn được tính vào mức sử dụng đầu ra và bị tính phí như token đầu ra, do đó một câu trả lời ngắn gọn hiển thị có thể sử dụng nhiều token hơn so với những gì văn bản hiển thị gợi ý. Hướng dẫn về suy luận của họ xác nhận rằng các token suy luận thô không được tiết lộ, chỉ có một bản tóm tắt tùy chọn.
Bạn đang trả mức phí đầu ra cho văn bản mà về mặt cấu trúc, bạn không được phép nhìn thấy.
3. Giới hạn đầu ra của bạn không giới hạn phần ẩn
Vấn đề còn sắc bén hơn. Tài liệu về việc vận hành các mô hình này lưu ý rằng tham số maximum output tokens (số lượng token đầu ra tối đa) giới hạn đầu ra hiển thị, trong khi các token suy luận ẩn không bị ràng buộc bởi giới hạn đó.
Một hệ quả được ghi nhận sau đó. Một yêu cầu có thể đốt cháy ngân sách của nó trong giai đoạn suy luận và không trả về kết quả nào, dù các token đã bị tiêu thụ. Hướng dẫn về suy luận của OpenAI thừa nhận trực tiếp kết quả này, lưu ý rằng bạn có thể chịu chi phí cho các token đầu vào và suy luận mà không nhận được phản hồi hiển thị.
Đồng hồ đo vẫn chạy, màn hình vẫn trống, và đây là hành vi được ghi nhận trong tài liệu chứ không phải lỗi.
4. Ngữ cảnh lặp lại được giảm 90%, và cả hai công ty đều nói rõ điều đó
Bộ nhớ đệm prompt (Prompt caching) là đòn bẩy lớn nhất duy nhất trong toàn bộ stack, và hầu hết mọi người chưa bao giờ nghe nói về nó.
Tài liệu về bộ nhớ đệm của Anthropic đặt mức đọc cache bằng 0,1 lần giá đầu vào cơ bản, với mức ghi cache năm phút bằng 1,25 lần và mức ghi cache một giờ bằng 2 lần. OpenAI áp dụng cùng một cấu trúc trên các dòng GPT-5 hiện tại, định giá đầu vào được cache ở khoảng mười phần trăm mức phí đầu vào tiêu chuẩn, với các thao tác ghi cache mang mức phí phụ trội riêng.
Phép tính toán là nơi vấn đề trở nên hữu ích. Với mức đọc bằng một phần mười và mức ghi bằng 1,25 lần, một lần bỏ lỡ cache (cache miss) tốn kém khoảng mười hai rưỡi lần so với một lần trúng cache (cache hit) cho cùng một tiền tố, và điểm hòa vốn rơi vào khoảng hai lần đọc. Đối với bất kỳ thứ gì gửi lại cùng một prompt hệ thống, schema công cụ, hoặc tài liệu tham khảo trong mỗi lần gọi, đó chính là toàn bộ sự khác biệt giữa một hóa đơn nhỏ và một hóa đơn lớn.

Nó cũng mong manh theo một cách đáng biết. Cả hai nhà cung cấp đều cache dựa trên khớp tiền tố chính xác, vì vậy chỉ cần một byte thay đổi ở phần trên của prompt sẽ làm vô hiệu hóa mọi thứ bên dưới và giá cả âm thầm quay trở lại mức đầy đủ.
5. Cả hai công ty đều sẽ giảm một nửa hóa đơn cho những công việc có thể chờ đợi
OpenAI và Anthropic mỗi bên đều vận hành một lớp batch bất đồng bộ với mức giảm 50% cho cả đầu vào và đầu ra. Tài liệu định giá của Anthropic nêu rõ rằng các hệ số nhân cache cộng dồn với mức giảm giá batch.
Kết hợp chúng lại, một token đầu vào được cache trong một batch sẽ có giá chỉ bằng một phần nhỏ so với mức tiêu chuẩn. Nó không hoạt động cho bất kỳ thứ gì tương tác, đó chính xác là lý do tại sao không có sản phẩm tiêu dùng nào cung cấp tính năng này cho bạn.
6. Mức giảm giá phụ thuộc vào ID mô hình bạn đang neo vào, chứ không phải mô hình bạn nghĩ mình đang sử dụng
Đây là một chi tiết mà hầu như không ai kiểm tra.
Mức giảm giá cache không đồng nhất trên toàn bộ danh mục của nhà cung cấp. Trên OpenAI, các dòng GPT-5 hiện tại được giảm khoảng chín mươi phần trăm cho đầu vào được cache, trong khi các mô hình thế hệ cũ được giảm ít hơn đáng kể. Trên Anthropic, hệ số nhân đọc cache tiêu chuẩn là 0,1 lần đầu vào cơ bản, với một số mô hình mới hơn thậm chí còn tốt hơn nữa.
Cùng một nhà cung cấp, cùng một tên tính năng, nhưng kinh tế học khác nhau đáng kể tùy thuộc vào một chuỗi ký tự trong cấu hình của bạn. Các ID mô hình cũ tệ hơn những gì bạn tưởng. Các mô hình Anthropic đã ngừng hỗ trợ nhưng vẫn có thể truy cập thông qua các đối tác đám mây vẫn mang mức phí gốc, có thể cao gấp nhiều lần so với giá hiện tại cho một mô hình kém khả năng hơn.
Ai đó đã thiết lập chuỗi ký tự đó một lần và không ai xem xét lại nó. Đó là nơi một phần đáng kể chi tiêu quá mức thực sự tồn tại.
7. Vượt qua ngưỡng ngữ cảnh có thể định giá lại toàn bộ yêu cầu
Điều tinh tế nhất, và cũng là điều có hình thái khó chịu nhất.
OpenAI công bố các mức phí ngữ cảnh dài riêng biệt trên một số mô hình, và cơ chế không giống như mọi người giả định. Khi vượt quá ngưỡng, toàn bộ yêu cầu được định giá lại, không chỉ các token vượt qua vạch đó. Chỉ cần vượt một token, toàn bộ cuộc gọi tốn kém gấp đôi.
Anthropic đã đưa ra một lập trường khác về vấn đề này. Trên các mô hình Claude gần đây, toàn bộ cửa sổ ngữ cảnh được tính phí theo mức phí mỗi token tiêu chuẩn, với các mức giảm giá cache và batch áp dụng cho toàn bộ cửa sổ.
Đó là một sự khác biệt cấu trúc thực sự giữa hai nền tảng và nó vô hình từ bất kỳ giao diện tiêu dùng nào. Nếu khối lượng công việc của bạn chạy các ngữ cảnh dài, yếu tố này có thể chiếm ưu thế hơn mọi cân nhắc định giá khác.

Các đòn bẩy là công khai. Nhưng bạn vẫn không thể tiếp cận chúng.
Đây là điểm cấu trúc cốt lõi.
Mọi đòn bẩy ở trên đều nằm ở lớp API. Để tiếp cận chúng đòi hỏi quyền kiểm soát cấu trúc prompt để cache thực sự trúng, định tuyến mô hình để đúng công việc đi đến đúng phân khúc giá, xử lý batch cho những công việc có thể chấp nhận độ trễ, kiểm soát nỗ lực suy luận, và nhận biết yêu cầu rơi vào phân khúc ngữ cảnh nào.
Từ một giao diện chat tiêu dùng, bạn chỉ có một hộp nhập văn bản và một khoản phí hàng tháng. Bạn không thể định tuyến, không thể batch, không thể cấu trúc tiền tố cache, và không thể thấy cài đặt nỗ lực suy luận của mình đang tốn kém bao nhiêu.
Vì vậy, một khoảng chênh lệch tồn tại. Một bên là những gì một người vận hành có năng lực đạt được bằng cách kết hợp các yếu tố này. Bên kia là những gì một người dùng bình thường phải trả. Không ai bị lừa dối cả. Các mức giảm giá là bề mặt kỹ thuật, không phải tính năng tiêu dùng, và các sản phẩm tiêu dùng không được xây dựng để phơi bày chúng.
Các doanh nghiệp sống trong khoảng chênh lệch đó là các relay, gateway và aggregator. Họ ngồi giữa người dùng và nhà cung cấp, định tuyến đến mô hình đủ tốt rẻ nhất, giữ cache ấm để ngữ cảnh lặp lại không bị mua lại ở giá đầy đủ, batch những gì có thể batch, và trao cho người dùng một thứ đơn giản hơn API thô.
Doanh thu của họ là khoảng chênh lệch đó. Và đó là nơi mọi thứ trở nên thú vị.

Relay là một doanh nghiệp thông lượng, và điều đó hiếm hoi trong lĩnh vực này
Hầu hết mọi thứ trong thị trường này đều là những cú cá cược. Bạn đưa ra một quan điểm, bạn đúng hoặc sai, kết quả dao động mạnh.
Một relay giống như một trạm thu phí. Khối lượng đi qua, biên lợi nhuận tích lũy trên mỗi đơn vị, và kinh tế học mở rộng theo mức sử dụng chứ không phụ thuộc vào việc ai đó đúng hay sai.
Ba đặc tính sau đây tuân theo, và cả ba đều hiếm gặp.
Doanh thu là theo đơn vị và liên tục. Không rời rạc, không phụ thuộc vào sự kiện, không phụ thuộc vào một quyết định đi đúng hướng. Token chảy, biên lợi nhuận tích lũy, giờ này qua giờ khác.
Nhu cầu không tương quan với crypto. Những người viết code, tạo video và chạy trợ lý không kiểm tra thị trường trước. Động lực tiêu dùng là sự chấp nhận AI, một trong rất ít thứ trong ngành này không di chuyển cùng với mọi thứ khác.
Hoạt động là một con số đếm, không phải một diễn giải. Thông lượng có thể đo lường được mà không cần tranh luận về quy trách nhiệm. Không có câu hỏi liệu một tháng tốt là do kỹ năng hay may mắn. Các yêu cầu hoặc đã đi qua hoặc đã không đi qua.
Điều cuối cùng đó quan trọng hơn vẻ ngoài của nó. Phần khó khăn nhất trong việc làm cho bất cứ thứ gì có thể sở hữu được là chứng minh những gì nó đã làm. Một doanh nghiệp thông lượng có khoảng cách cực kỳ ngắn giữa những gì đã xảy ra và những gì có thể được hiển thị.

Model Max, và sở hữu trạm thu phí thay vì chỉ trả tiền tại đó
Model Max là một relay API token, và nó hiện đang hoạt động như một agent đổi thưởng trên Moss Agent Marketplace.
Phần sản phẩm khá đơn giản. Truy cập vào các mô hình thông qua một tuyến đường duy nhất, với việc định tuyến, cache và batch được xử lý ở lớp nơi các quyết định đó thực sự khả dụng, chứ không phải ở lớp nơi bạn bị mắc kẹt với một hộp nhập văn bản.
Nửa còn lại là phần đáng chú ý. Là một agent trên Marketplace, relay không chỉ là thứ bạn sử dụng. Nó là thứ bạn có thể nắm giữ một vị trí.
Hình thái đó khác biệt so với phần lớn danh mục này. Hoạt động của một relay gần với đầu vào lý tưởng cho một tuyên bố có thể xác minh, bởi vì thông lượng là một sự thật chứ không phải một câu chuyện. Không có hồ sơ theo dõi để diễn giải, không có câu chuyện hiệu suất để chấp nhận dựa trên niềm tin. Việc sử dụng đã xảy ra hoặc không, và điều đó dễ đọc.
Nó cũng là agent đổi thưởng thứ hai mà chúng tôi tung ra, nơi thứ được sử dụng và thứ được sở hữu là cùng một đối tượng. Bạn có thể vừa là khách hàng của relay vừa là người nắm giữ nó cùng một lúc, và mối quan hệ thứ hai không phải là một hạng mục khách hàng thân thiết. Nó là một vị thế.
Chúng tôi bắt đầu với các agent giao dịch vì giao dịch là môi trường thử thách khắt khe nhất. Một con số hoặc là thật hoặc là một câu chuyện, và blockchain không cho phép bạn nói dối về điều đó. Các agent đổi thưởng mang cùng tiêu chuẩn đó đến với những người sẽ không bao giờ mở một hợp đồng vĩnh cửu (perp). Những gì đến sau những thứ này thúc đẩy xa hơn nữa, hướng tới các hệ thống không chỉ chạy trên blockchain mà còn phát hành và vận hành trên đó một cách độc lập.
Thêm thông tin về điều đó khi nó ra mắt, thay vì trước đó.
4 điều cần làm tuần này, bất kể bạn sử dụng gì
Không điều nào trong số này yêu cầu Moss.
Ngừng tối ưu hóa độ dài prompt và bắt đầu giới hạn đầu ra. Bạn đang trả tiền cho câu trả lời, không phải cho câu hỏi. Yêu cầu năm mươi từ thay vì năm trăm từ giúp ích cho hóa đơn của bạn gấp khoảng mười lần so với việc chỉnh sửa prompt của bạn ngắn lại.
Kiểm tra xem cài đặt nỗ lực suy luận của bạn đang mua được gì. Đối với các tác vụ không cần suy nghĩ sâu, nỗ lực cao là tiền bị lãng phí vào các token ẩn không cải thiện bất kỳ thứ gì bạn thực sự nhận được. Đây là cách phổ biến nhất khiến mọi người trả quá mức mà không bao giờ nhận ra.
Mở cấu hình của bạn và đọc ID mô hình. Không phải tên mô hình bạn nghĩ mình đang sử dụng, mà là chuỗi ký tự thực tế. Sau đó kiểm tra nó với bảng giá hiện tại. Các ID cũ hơn âm thầm mang theo kinh tế học cũ, và đôi khi các mức giảm giá cache tệ hơn đáng kể, cho một mô hình kém khả năng hơn.
Nếu bạn xây dựng bất cứ thứ gì, hãy đo tỷ lệ trúng cache trước khi tối ưu hóa bất kỳ thứ gì khác. Các trường sử dụng trong phản hồi cung cấp cho bạn sự phân chia giữa đầu vào mới, ghi cache và đọc cache. Zero reads (không có lần đọc cache) trong các lần gọi lặp lại có nghĩa là một cái gì đó ở phần trên của prompt đang thay đổi và làm vô hiệu hóa mọi thứ bên dưới. Đó là sự khác biệt chi phí gấp mười hai lần ẩn đằng sau một byte.
Thói quen nằm dưới cả bốn điều này mới là bài học thực sự. Hãy coi chi tiêu AI như một hóa đơn có cấu trúc chứ không phải một khoản đăng ký có một con số. Khi cấu trúc trở nên hiển thị, thì câu hỏi về ai đang ở vị trí nào bên trong nó cũng trở nên hiển thị.
Những gì cần làm bây giờ
Hãy truy cập moss.site và xem Model Max. Sử dụng nó như một relay nếu đó là những gì bạn cần. Xem xét ý nghĩa của việc nắm giữ một vị trí trong đó nếu điều đó gây hứng thú cho bạn. Cả hai đều đang hoạt động, và chúng là cùng một đối tượng, đó là phần mà chúng tôi nghĩ là mới lạ.
Mọi nền kinh tế cuối cùng cũng ổn định xem ai sở hữu hạ tầng của nó. Nền kinh tế AI hiện đang ở giai đoạn mà mọi người đều trả tiền tại trạm thu phí và chưa ai nghĩ đến việc hỏi ai sở hữu nó.
Câu hỏi đó vẫn còn mở thêm một thời gian nữa.
Nguồn
- Trung tâm trợ giúp OpenAI, Hiểu và đếm token, về các token suy luận được tính phí như đầu ra trong khi không hiển thị dưới dạng văn bản câu trả lời: https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them
- Hướng dẫn về mô hình suy luận của OpenAI, về việc các token suy luận thô không được tiết lộ và về việc chịu chi phí mà không có phản hồi hiển thị: https://developers.openai.com/api/docs/guides/reasoning
- Trang định giá API của OpenAI, cho các mức phí đầu vào, đầu vào được cache và đầu ra hiện tại theo từng mô hình, các lớp batch và flex, và các mức phí ngữ cảnh dài: https://openai.com/api/pricing/
- Microsoft Learn Q&A về hóa đơn Azure OpenAI, về việc các token suy luận ẩn được bao gồm trong hóa đơn và tham số maximum output tokens không ràng buộc chúng: https://learn.microsoft.com/en-us/answers/questions/5542366/why-did-azure-report-more-completion-tokens-than-m
- Tài liệu về bộ nhớ đệm prompt của Anthropic, về việc đọc cache ở mức 0,1 lần đầu vào cơ bản, các hệ số nhân ghi, và việc cộng dồn với mức giảm giá Batch API: https://platform.claude.com/docs/en/build-with-claude/prompt-caching
- Trang định giá của Anthropic, cho các mức phí hiện tại theo từng mô hình và mức giảm giá Batch API: https://claude.com/pricing





