OpenAI 或 Anthropic 的帳單裡究竟藏著什麼?兩家公司都公布了折扣,但如果你只盯著聊天視窗,根本觸及不到。而那個能觸及這些折扣的層級,現在變成了你可以持有的資產。
問大多數人 AI 花了他們多少錢,他們會說出一個月訂閱費。
問一次對話花了多少錢,現場就會陷入沉默。這很合理,因為誠實的答案其實很複雜。OpenAI 和 Anthropic 都是按照你看不見的單位計費,在四個不同的維度上定價,並且在自家文件中公布了一系列折扣——如果你只是坐在文字輸入框前,幾乎完全無法享受到這些優惠。
這些都不是秘密。所有資訊現在都攤開在他們的定價頁面和開發者文件中。它只是需要你往下走一層,脫離大多數人目前所站的位置。
公布的價目表與普通人實際支付的價格之間的落差,並不是一樁醜聞。這是一门生意,而且直到最近,你都沒有辦法站在這門生意的另一端。
這篇文章要談的是帳單裡到底有什麼、為什麼真正的籌碼藏在那些地方,以及當拉動這些籌碼的層級變成你可以「持有」而非只能「支付」的東西時,會發生什麼變化。如果你想看到更多關於 AI 與所有權的內容,請追蹤 @MossAI_Official。
來自官方文件的帳單真相:7 個關鍵點
以下內容均由 OpenAI 或 Anthropic 發布。除了工程團隊之外,幾乎沒有人知道這些細節。費率變動頻繁,因此請將這些數字視為結構說明,而非固定報價。
- 輸出成本是輸入成本的數倍,兩個平台皆然
兩家平台的每個模型都分別對輸入和輸出計費,且輸出永遠貴得多。比例通常介於四到六倍之間。

這裡的重點在於觀念的转变。你輸入的文字幾乎免費。模型回傳的內容才是帳單的大頭。限制回答長度對降低成本的影響,遠比精簡提問來得大,這與幾乎所有人的直覺行為恰恰相反。
2. 你正在為無法讀取的推理過程付費
這一點應該真的讓你感到驚訝。
OpenAI 的官方幫助文件指出,推理 tokens(tokens)不會顯示在回答文本中,但會計算在輸出用量中並按輸出 tokens 計費。因此,一個簡短的可见回答可能使用了比顯示文字更多的 tokens。他們的推理指南也確認原始推理 tokens 不會暴露給用戶,只提供可選的摘要。
你在以輸出費率支付那些結構上禁止你查看的文字費用。
3. 你的輸出上限管不住隱藏的部分
情況更嚴峻了。運行這些模型的文件指出,最大輸出 tokens 參數僅限制可見輸出,而隱藏的推理 tokens 不受此限制約束。
由此產生了一個有據可查的後果。請求可能在推理階段就耗盡預算並返回空結果,同時 tokens 已被消耗。OpenAI 的推理指南直接承認了這種情況,指出你可能支付了輸入和推理 tokens 的費用,卻沒有收到任何可見的回覆。
計量表在轉動,螢幕一片空白,這是文件記載的行為,而不是 Bug。
4. 重複上下文打九折,兩家都明確告知了你
Prompt Caching(提示詞快取)是整個技術堆疊中最大的單一槓桿,但大多數人從未聽過它。
Anthropic 的快取文件指出,快取讀取價格為基礎輸入價格的 0.1 倍,五分鐘快取寫入為 1.25 倍,一小時寫入為 2 倍。OpenAI 在目前的 GPT-5 系列上應用了相同的邏輯,將快取輸入定價為標準輸入費率的約 10%,而快取寫入則有自己的溢價。
算術部分才是重點。如果讀取是 0.1 倍,寫入是 1.25 倍,那麼對於相同的前綴,快取未命中(miss)的成本約為命中(hit)的十二點五倍,而損益平衡點大約在兩次讀取。對於每次呼叫都重新發送相同系統提示、工具架構或參考文檔的任何應用來說,這就是小額帳單和大額帳單之間的全部差異。

此外,它的脆弱性也值得注意。兩家供應商都基於精確的前綴匹配進行快取,因此提示詞頂部的一個字節改變就會使下方所有内容失效,價格也會無聲地恢復為全額費率。
5. 對於可以等待的工作,兩家都會讓帳單減半
OpenAI 和 Anthropic 各自提供異步批次層級,輸入和輸出均享有 50% 的折扣。Anthropic 的定價文件明確指出,快取乘數可以與批次折扣疊加。
將兩者疊加,批次內的快取輸入 tokens 成本僅為標準費率的一小部分。這不適用於任何交互式任務,這正是為什麼沒有消費級產品將其暴露給你。
6. 折扣取決於你鎖定哪個 Model ID,而不是你認為自己在用哪個模型
這是一個幾乎沒人檢查的地方。
快取折扣在供應商的目錄中並非統一。在 OpenAI 上,目前的 GPT-5 系列獲得約 90% 的快取輸入折扣,而較舊一代的模型折扣則少得多。在 Anthropic 上,標準快取讀取乘數為基礎輸入的 0.1 倍,某些較新的模型甚至更低。
同一供應商,同一功能名稱,經濟效益卻因配置中的一個字符串而有實質差異。遺留的 Model ID 比這看起來更糟。透過雲端合作夥伴仍可訪問的已退役 Anthropic 模型仍維持其原始費率,這可能是當前價格的好幾倍,儘管模型能力較弱。
有人設定了一次那個字符串,然後再也沒人去檢查它。令人意外的超支往往就藏在這裡。
7. 跨越上下文閾值可能會重新定價整個請求
最微妙的一點,也是形狀最難看的一點。
OpenAI 在某些模型上發布了單獨的長上下文費率,其機制並非人們所想的那樣。超過閾值後,整個請求都會重新定價,而不僅僅是超出部分的 tokens。只要多出一個 token,整個呼叫的成本就會大約翻倍。
Anthropic 在此採取了不同的立場。在最近的 Claude 模型上,完整的上下文窗口均按標準每 token 費率計費,快取和批次折扣適用於整個窗口。
這是兩個平台之間真正的結構性差異,從任何消費者介面都看不出來。如果你的工作負載涉及長上下文,這可能會主導其他所有的定價考量。

槓桿是公開的。但你仍然觸及不到。
這裡是核心結構觀點。
上述每個槓桿都存在於 API 層級。要觸及它們,你需要控制提示詞結構以便快取真正命中、進行模型路由以確保正確的任務進入正確的價格層級、對可容忍延遲的工作進行批次處理、控制推理強度,以及了解請求落在哪個上下文層級。
從消費者聊天介面來看,你只有一個文字框和一個月度收費。你無法路由、無法批次處理、無法構造快取前綴,也看不到你的推理強度設置花費了多少。
因此存在一個價差。一端是有能力的運營者通過組合這些手段所達到的效果。另一端是普通用戶支付的費用。沒有人被欺騙。這些折扣是工程介面,不是消費特性,而消費產品並非為了暴露它們而構建。
生活在這個價差中的企業是中繼器(Relays)、閘道器和聚合器。他們位於用戶和供應商之間,路由到最便宜且足夠好的模型,保持快取溫暖以免重複上下文以全價重新購買,批次處理可批次處理的内容,並交給用戶一些比原始 API 更簡單的東西。
他們的收入就是這個價差。這就是有趣的地方。

中繼器是吞吐量業務,而在這裡這很罕見
這個市場上的大多數事物都是賭注。你持有一個觀點,你對或錯,結果隨之波動。
中繼器是一個收費站。流量通過,利潤按單位累積,經濟效益隨著使用量擴展,而不是依賴任何人是否正確。
由此衍生出三個特性,這三者都很罕見。
收入是按單位且連續的。 不是塊狀的,不是事件驅動的,也不取決於某個判斷是否正確。Tokens 流動,利潤累積,_hour after hour_。
需求與加密貨幣無關。 編寫代碼、生成視頻和運行助手的人不會先看市場行情。消費驅動因素是 AI 採用率,這是這個行業中少數幾個不隨其他一切波動的指標之一。
活動是一個計數,而不是一種解釋。 吞吐量是可衡量的,無需歸因論證。不需要爭論好月份是靠技巧還是運氣。請求要么通過了,要么沒有。
最後一點比聽起來更重要。讓任何東西變得「可擁有」的困難之處在於證明它做了什麼。吞吐量業務在「發生了什麼」和「可以展示什麼」之間有著異常短的距離。

Model Max:持有收費站,而不只是在收費站付費
Model Max 是一個 Token API 中繼器,現已在 Moss Agent Marketplace 上作為贖回代理(Redemption Agent)上線。
產品部分很簡單。通過一條路徑訪問模型,其中路由、快取和批次處理在那些決策實際可用的層級進行,而不是在你被困在文字框裡的層級。
另一半是值得關注的部分。作為 Marketplace 上的一個代理,中繼器不僅僅是你使用的東西。它是你可以持有倉位的東西。
這種形態與該類別中的大多數不同。中繼器的活動非常接近可驗證聲明的理想輸入,因為吞吐量是事實而非敘事。沒有需要解讀的過往紀錄,沒有需要信任接受的績效故事。使用發生了或者沒有發生,這是清晰可見的。
這也是我們推出的第二個贖回代理,其中被使用的東西和被擁有的東西是同一個對象。你可以同時成為中繼器的客戶和中繼器的持有者,而第二種關係不是忠誠度等級。它是一個倉位。
我們從交易代理開始,因為交易是最嚴酷的試金石。數字要么是真實的,要么是一個故事,鏈上數據不允許你在這一點上撒謊。贖回代理將同樣的標準帶給了那些永遠不會打開永續合約的人。這些之後推出的系統將進一步推進,走向不僅在鏈上運行,而且在鏈上發行和操作的系統。
更多細節將在推出時分享,而不是在此之前。
無論你用什麼,這週可以做這 4 件事
這些都不需要 Moss。
停止優化提示詞長度,開始限制輸出。 你是在為答案付費,而不是問題。要求 50 個字而不是 500 個字,對帳單的影響大約是編輯提示詞縮短長度的十倍。
檢查你的推理強度設置買到了什麼。 對於不需要深思熟慮的任務,高強度意味著金錢花在隱藏的 tokens 上,而你實際收到的內容沒有任何改善。這是人們在未察覺的情況下過度付費的最常見方式。
打開你的配置並閱讀 Model ID。 不是你認為自己在用的模型名稱,而是實際的字符串。然後將其與當前的價目表進行核對。較舊的 ID 悄悄承載著較舊的經濟效益,有時甚至是針對較弱模型的更差的快取折扣。
如果你構建任何東西,在優化其他任何事情之前先測量快取命中率。 響應中的使用字段給出了新輸入、快取寫入和快取讀取的分佈。重複呼叫中的零讀取意味著你的提示詞頂部有東西在變化,並使下方所有内容失效。這是一個隱藏在一個字節背後的十二倍成本差異。
這四件事背後的習慣才是真正的收穫。將 AI 支出視為具有結構的帳單,而不是一個帶有數字的訂閱。一旦結構可見,誰在其中處於什麼位置的問題也就隨之浮現。
現在該做什麼
前往 moss.site 查看 Model Max。如果你需要,把它當作中繼器使用。看看持有它的倉位意味著什麼,如果這讓你感興趣的話。兩者都已上線,而且是同一個對象,我們認為這是全新的部分。
每個經濟體最終都會決定誰擁有其基礎設施。AI 經濟目前處於每個人都在收費站付費,但沒有人想過詢問誰擁有收費站的階段。
這個問題還會開放一段時間。
來源
- OpenAI Help Center, Understanding and counting tokens, on reasoning tokens being billed as output while not visible as answer text: https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them
- OpenAI reasoning models guide, on raw reasoning tokens not being exposed and on incurring cost without a visible response: https://developers.openai.com/api/docs/guides/reasoning
- OpenAI API pricing page, for current per model input, cached input and output rates, batch and flex tiers, and long context rates: https://openai.com/api/pricing/
- Microsoft Learn Q&A on Azure OpenAI billing, on hidden reasoning tokens being included in billing and the maximum output tokens parameter not constraining them: https://learn.microsoft.com/en-us/answers/questions/5542366/why-did-azure-report-more-completion-tokens-than-m
- Anthropic prompt caching documentation, on cache reads at 0.1 times base input, write multipliers, and stacking with the Batch API discount: https://platform.claude.com/docs/en/build-with-claude/prompt-caching
- Anthropic pricing page, for current per model rates and the Batch API discount: https://claude.com/pricing





