절대 볼 수 없는 토큰에 비용을 지불하고 있습니다

@MossAI_Official
영어2026년 9월 17일
119K
169
87
26
97

TL;DR

AI 과금 구조 분석을 통해 보이지 않는 추론 토큰 및 복잡한 캐싱 할인과 같은 숨겨진 비용을 확인하고, 사용자가 이러한 요소를 최적화하거나 인프라 지분을 소유할 수 있도록 하는 릴레이 서비스를 소개합니다.

OpenAI나 Anthropic의 청구서에는 실제로 무엇이 들어 있는지, 채팅 창에서는 절대 도달할 수 없는 두 회사가 공개한 할인 혜택은 무엇인지, 그리고 그 혜택에 도달할 수 있는 계층이 왜 이제 당신이 소유할 수 있는 것이 되었는지 알아보자.

대부분의 사람에게 AI 비용이 얼마인지 물으면 월 구독료를 말할 것이다.

대화 한 번의 비용이 얼마인지 물으면 방은 조용해진다. 정당한 반응이다. 솔직한 답은 복잡하기 때문이다. OpenAI와 Anthropic 모두 볼 수 없는 단위로 과금하며, 네 가지 축으로 가격을 책정하고, 텍스트 입력창 앞에 앉아 있다면 거의 도달할 수 없는 자체 문서화된 할인 정책을 공개한다.

이 모든 것은 숨겨져 있지 않다. 지금 당장 그들의 가격 페이지와 개발자 문서에 나와 있다. 다만 대부분의 사람이 서 있는 곳에서 한 단계 아래를 내려다봐야 할 뿐이다.

공개된 가격표와 일반 사용자가 실제로 지불하는 가격 사이의 이 간극은 스캔들이 아니다. 이는 비즈니스이며, 최근까지 당신은 그 반대편에 설 방법이 없었다.

이 글은 청구서에 실제로 무엇이 담겨 있는지, 진정한 레버가 왜 그곳에 존재하는지, 그리고 그 레버를 당기는 계층이 단순히 지불하는 것을 넘어 보유할 수 있는 것이 될 때 무엇이 변하는지를 다룬다. AI와 소유권에 관한 더 많은 내용이 궁금하다면 @MossAI_Official을 팔로우하라.

자체 문서에서 직접 확인한 청구서의 7가지 사실

아래 내용은 모두 OpenAI 또는 Anthropic이 공개한 것이다. 엔지니어링 팀 밖에서는 거의 알려지지 않은 내용이다. 요금은 수시로 변동하므로, 숫자는 견적이 아닌 구조를 설명하는 예시로 이해하라.

  1. 두 플랫폼 모두 출력 비용이 입력 비용보다 몇 배 비싸다

두 가격표의 모든 모델은 입력과 출력을 별도로 과금하며, 출력은 항상 훨씬 비싸다. 비율은 보통 4 대 1에서 6 대 1 사이이다.

MOSS - inline image

실용적인 관점 전환이 중요하다. 당신이 입력하는 것은 거의 무료이다. 모델이 응답하는 것이 청구 대상이다. 질문을 줄이는 것보다 답변을 제한하는 것이 비용 절감에 훨씬 더 효과적이다. 이는 거의 모든 사람의 행동 방식과 정반대이다.

2. 읽을 수 없는 추론(reasoning)에도 과금된다

이것이 진정으로 당신을 놀라게 해야 하는 부분이다.

OpenAI의 공식 도움말 문서에는 추론 토큰이 답변 텍스트로는 보이지 않지만 출력 사용량으로 계산되어 출력 토큰으로 과금되며, 따라서 짧은 가시적 답변도 표시된 텍스트보다 더 많은 토큰을 사용할 수 있다고 명시되어 있다. 그들의 추론 가이드는 원시 추론 토큰이 노출되지 않으며 선택적 요약만 제공됨을 확인한다.

당신은 구조적으로 볼 수 없도록 되어 있는 텍스트에 대해 출력 요율을 지불하고 있다.

3. 출력 상한선이 숨겨진 부분을 제한하지 않는다

더 날카로워진다. 이러한 모델을 실행하기 위한 문서에 따르면 최대 출력 토큰 매개변수는 가시적 출력만 제한하며, 숨겨진 추론 토큰은 해당 제한의 영향을 받지 않는다고 한다.

문서화된 결과가 뒤따른다. 요청이 추론 단계에서 예산을 소진하고 아무것도 반환하지 않을 수 있으며, 이때 토큰은 이미 소비된 상태이다. OpenAI의 추론 가이드는 가시적 응답 없이 입력 및 추론 토큰 비용을 발생할 수 있다는 결과를 직접 인정한다.

계기판은 돌아가고 화면은 공백으로 남아 있으며, 이는 버그가 아니라 문서화된 동작이다.

4. 반복되는 컨텍스트는 90% 할인되며, 두 회사 모두 이를 고지한다

프롬프트 캐싱은 스택 내에서 가장 큰 단일 레버이지만, 대부분의 사람은 이에 대해 들어본 적이 없다.

Anthropic의 캐싱 문서는 캐시 읽기를 기본 입력 가격의 0.1배로, 5분 캐시 쓰기를 1.25배, 1시간 쓰기를 2배로 규정한다. OpenAI는 현재 GPT-5 계열에서도 동일한 형태를 적용하여 캐시된 입력을 표준 입력 요율의 약 10%로 책정하며, 캐시 쓰기에는 자체 프리미엄이 부과된다.

산술이 유용해지는 지점이다. 읽기가 1/10이고 쓰기가 1.25배일 때, 동일한 접두어에 대한 캐시 미스는 히트보다 약 12.5배의 비용이 들며, 손익분기점은 약 2번의 읽기에서 달성된다. 모든 호출마다 동일한 시스템 프롬프트, 도구 스키마 또는 참조 문서를 재전송하는 경우라면, 이것이 작은 청구서와 큰 청구서 사이의 전체 차이이다.

MOSS - inline image

또한 알아둘 가치가 있는 방식으로 취약하다. 두 공급자 모두 정확한 접두어 일치를 기준으로 캐싱하므로, 프롬프트 상단에서 바이트 하나가 변경되면 하단의 모든 것이 무효화되고 가격은 조용히 전체 요율로 되돌아간다.

5. 두 회사 모두 기다릴 수 있는 작업에 대해서는 청구서를 절반으로 줄여준다

OpenAI와 Anthropic 모두 입력 및 출력 비용을 50% 할인하는 비동기 배치(batch) 계층을 운영한다. Anthropic의 가격 문서는 캐싱 승수가 배치 할인과 중첩(stack)될 수 있음을 명시한다.

중첩하면 배치 내의 캐시된 입력 토큰은 표준의 아주 작은 일부가 된다. 대화형 작업에는 작동하지 않으며, 바로 이 때문에 소비자 제품은 이를 사용자에게 노출하지 않는다.

6. 할인은 당신이 사용하고 있다고 생각하는 모델이 아니라, 고정된 모델 ID에 따라 결정된다

거의 아무도 확인하지 않는 사항이 하나 있다.

캐싱 할인은 공급자의 카탈로그 전반에 걸쳐 균일하지 않다. OpenAI의 경우 현재 GPT-5 계열은 캐시된 입력에 대해 약 90% 할인을 받지만, 이전 세대 모델은 훨씬 적게 할인된다. Anthropic의 경우 표준 캐시 읽기 승수는 기본 입력의 0.1배이며, 일부 최신 모델은 더 높은 할인을 제공한다.

동일한 공급자, 동일한 기능 이름임에도 불구하고 설정 파일의 문자열 값에 따라 경제성이 실질적으로 달라진다. 레거시 모델 ID는 예상보다 더 나쁘다. 클라우드 파트너를 통해 여전히 접근 가능한 은퇴한 Anthropic 모델은 원래 요율을 유지하는데, 이는 성능이 떨어지는 모델임에도 현재 가격의 몇 배가 될 수 있다.

누군가가 그 문자열을 한 번 설정했고 이후 아무도 재검토하지 않았다. 놀라운 수준의 초과 지출이 실제로 발생하는 지점이 여기이다.

7. 컨텍스트 임계값을 넘으면 전체 요청의 가격이 재책정될 수 있다

가장 미묘하지만 가장 악랄한 형태를 가진 항목이다.

OpenAI는 일부 모델에 대해 별도의 장문 컨텍스트(long context) 요율을 공개하며, 메커니즘은 사람들이 가정하는 것과 다르다. 임계값 이상에서는 선 위의 토큰만이 아니라 전체 요청의 가격이 재책정된다. 토큰 하나가 기준선을 넘으면 전체 호출 비용이 약 두 배가 된다.

Anthropic은 이 문제에 대해 다른 입장을 취했다. 최신 Claude 모델에서는 전체 컨텍스트 윈도우가 표준 토큰별 요율로 과금되며, 캐싱 및 배치 할인이 전체 윈도우에 적용된다.

이는 두 플랫폼 간의 진정한 구조적 차이이며, 어떤 소비자 인터페이스에서도 보이지 않는다. 워크로드가 긴 컨텍스트를 처리한다면, 이는 다른 모든 가격 고려 사항을 압도할 수 있다.

MOSS - inline image

레버는 공개되어 있다. 하지만 당신은 여전히 도달할 수 없다.

구조적 요점은 다음과 같다.

위의 모든 레버는 API 계층에 존재한다. 그것들에 도달하려면 캐시가 실제로 히트되도록 하는 프롬프트 구조 제어, 올바른 작업을 올바른 가격 계층으로 라우팅하는 모델 라우팅, 지연 시간을 감수할 수 있는 작업에 대한 배치 처리, 추론 노력(effort) 제어, 그리고 요청이 어느 컨텍스트 계층에 속하는지에 대한 인식이 필요하다.

소비자 채팅 인터페이스에서는 텍스트 상자와 월간 요금만 있을 뿐이다. 라우팅할 수 없고, 배치할 수 없으며, 캐시 접두어를 구성할 수 없고, 추론 노력 설정이 얼마나 드는지 확인할 수도 없다.

따라서 스프레드(차액)가 존재한다. 한쪽에는 이것들을 조합하여 유능한 운영자가 달성하는 수준이 있고, 다른 쪽에는 일반 사용자가 지불하는 금액이 있다. 누구도 사기를 당하는 것이 아니다. 할인은 소비자 기능이 아닌 엔지니어링 표면(engineering surfaces)이며, 소비자 제품은 이를 노출하도록 설계되지 않았기 때문이다.

그 스프레드 안에서 살아가는 기업들은 릴레이(relay), 게이트웨이, 애그리게이터(aggregator)이다. 그들은 사용자와 공급자 사이에 위치하여 가장 저렴하면서도 충분한 성능을 내는 모델로 라우팅하고, 반복되는 컨텍스트를 전체 가격으로 재구매하지 않도록 캐시를 따뜻하게(warm) 유지하며, 배치 가능한 것은 배치하고, 원시 API보다 단순한 것을 사용자에게 전달한다.

그들의 수익은 그 스프레드이다. 여기서부터 흥미로운 지점이 시작된다.

MOSS - inline image

릴레이는 처리량(throughput) 비즈니스이며, 이는 이 시장에서 희귀하다

이 시장의 대부분은 베팅이다. 당신은 전망을 세우고, 맞거나 틀리며, 결과는 크게 흔들린다.

릴레이는 톨부스(toll booth, 통행료 징수소)이다. 볼륨이 통과하고, 단위당 마진이 누적되며, 경제성은 누군가의 정확도가 아닌 사용량에 따라 확장된다.

세 가지 특성이 따르는데, 모두 흔치 않다.

수익은 단위당 발생하며 연속적이다. 덩어리 지지 않고, 이벤트 구동형이 아니며, 특정 판단이 옳았는지에 좌우되지 않는다. 토큰이 흐르고, 마진이 누적되며, 시간과 시간이 지나도 계속된다.

수요는 암호화폐와 상관관계가 없다. 코드를 작성하고, 영상을 생성하고, 어시스턴트를 실행하는 사람들은 시장 상황을 먼저 확인하지 않는다. 소비 동력은 AI 채택률이며, 이는 이 산업에서 다른 모든 것과 연동되지 않는 몇 안 되는 요소 중 하나이다.

활동은 해석이 아닌 수치(count)이다. 처리량은 귀속(attribution) 논쟁 없이 측정 가능하다. 좋은 달이 실력 때문이었는지 운 때문이었는지 묻는 질문이 없다. 요청이 통과했든 아니든 그것은 사실일 뿐이다.

마지막 항목은 소리보다 더 중요하다. 무언가를 소유 가능하게 만드는 어려운 부분은 그것이 무엇을 했는지 증명하는 것이다. 처리량 비즈니스는 발생한 일과 입증할 수 있는 일 사이의 거리가 비정상적으로 짧다.

MOSS - inline image

Model Max, 톨부스에서 단순히 돈을 내는 대신 그것을 소유하기

Model Max는 토큰 API 릴레이이며, 현재 Moss Agent Marketplace의 리딤 에이전트(redemption agent)로서 라이브 상태이다.

제품 측면은 명확하다. 하나의 경로를 통한 모델 접근성 제공, 라우팅, 캐싱 및 배치는 당신이 텍스트 상자에 갇혀 있는 계층이 아닌, 이러한 결정이 실제로 가능한 계층에서 처리된다.

다른 절반은 주목할 만한 부분이다. Marketplace의 에이전트로서 릴레이는 단순히 사용하는 것이 아니다. 당신은 그 안에 포지션을 보유할 수 있다.

이 형태는 이 카테고리의 대부분과 다르다. 릴레이의 활동은 검증 가능한 주장에 대한 이상적인 입력에 가깝다. 왜냐하면 처리량은 서사가 아닌 사실이이기 때문이다. 해석해야 할 트랙 레코드가 없고, 신뢰로 받아들여야 할 성과 이야기가 없다. 사용량이 발생했든 아니든, 그것은 명백하다.

또한 우리가 출시한 두 번째 리딤 에이전트로, 사용되는 것과 소유되는 것이 동일한 객체이다. 당신은 릴레이의 고객이자 동시에 보유자가 될 수 있으며, 두 번째 관계는 충성도 등급이 아니다. 그것은 포지션이다.

우리는 트레이딩 에이전트로 시작했다. 트레이딩은 존재하는 가장 혹독한 시험장이기 때문이다. 숫자는 진짜이거나 아니면 이야기일 뿐이며, 블록체인은 어느 쪽인지를 거짓말할 수 없게 만든다. 리딤 에이전트는 퍼프(perp)를 열어보지 않을 사람들에게도 동일한 기준을 가져온다. 이것들 이후에 오는 것은 단순히 체인 위에서 실행되는 것을 넘어, 스스로 체인 위에서 발행하고 운영하는 시스템으로 더욱 나아가고 있다.

출시되기 전보다는 출시 후에 더 자세히 이야기하겠다.

무엇을 사용하든 이번 주에 할 수 있는 4가지

이 중 어느 것도 Moss를 필요로 하지 않는다.

프롬프트 길이 최적화를 멈추고 출력 제약에 집중하라. 당신은 질문이 아니라 답변에 돈을 지불하고 있다. 500단어 대신 50단어를 요구하는 것은 프롬프트를 편집하는 것보다 청구서에 약 10배 더 큰 영향을 미친다.

추론 노력(reasoning effort) 설정이 무엇을 사주는지 확인하라. 숙고가 필요하지 않은 작업에서 높은 노력 설정은 실제로 받는 것을 개선하지 않는 숨겨진 토큰에 돈을 쓰는 것이다. 이는 사람들이 인지하지 못한 채 과잉 지불하는 가장 일반적인 방법이다.

설정 파일을 열고 모델 ID를 읽어라. 당신이 사용하고 있다고 생각하는 모델 이름이 아니라 실제 문자열이다. 그런 다음 현재 가격표와 대조하라. 오래된 ID는 조용히 오래된 경제성을 유지하며, 성능이 떨어지는 모델에 대해 때로는 훨씬 불리한 캐싱 할인을 적용받는다.

무언가를 구축한다면, 다른 것을 최적화하기 전에 캐시 히트율을 측정하라. 응답의 사용량 필드는 신규 입력, 캐시 쓰기, 캐시 읽기의 분포를 보여준다. 반복 호출에서 읽기 횟수가 0이라는 것은 프롬프트 상단의 무언가가 변경되어 하단의 모든 것을 무효화하고 있다는 뜻이다. 이는 바이트 하나 뒤에 숨겨진 12배의 비용 차이이다.

네 가지 모두 밑바탕에 깔린 습관이 진정한 교훈이다. AI 지출을 숫자가 있는 구독료가 아니라 구조가 있는 청구서로 취급하라. 구조가 보이면, 그 안에서 누가 어디에 위치해 있는지에 대한 질문도 보인다.

지금 해야 할 일

moss.site로 가서 Model Max를 살펴봐라. 필요하다면 릴레이로 사용해라. 관심이 있다면 그 안에 포지션을 보유한다는 것이 의미하는 바를 봐라. 둘 다 라이브 상태이며, 동일한 객체이다. 우리가 새로운 부분이라고 생각하는 지점이 바로 여기이다.

모든 경제는 결국 인프라를 누가 소유할지 정착된다. AI 경제는 현재 모두가 톨부스에서 돈을 내고 있지만, 누가 그것을 소유하는지 물어볼 생각을 하지 못한 단계에 있다.

그 질문은 조금 더 열려 있을 것이다.

👉 moss.site

출처

원클릭 저장

YouMind로 바이럴 글을 AI 심층 읽기

소스를 저장하고, 핵심 질문을 던지고, 주장을 요약해 바이럴 글을 다시 활용할 수 있는 노트로 바꾸세요. 하나의 AI 워크스페이스에서 모두 할 수 있습니다.

YouMind 둘러보기
크리에이터를 위해

당신의 Markdown을 깔끔한 𝕏 글로

직접 쓴 장문을 올릴 때 이미지, 표, 코드 블록을 𝕏에 맞게 정리하는 일은 번거롭습니다. YouMind는 전체 Markdown 초안을 깔끔하고 바로 게시할 수 있는 𝕏 글로 바꿔 줍니다.

Markdown → 𝕏 사용해 보기

분석할 패턴 더 보기

최근 바이럴 아티클

더 많은 바이럴 아티클 보기