Qué hay realmente en una factura de OpenAI o Anthropic, los descuentos que ambas publican pero a los que no puedes acceder desde una ventana de chat, y por qué la capa que sí puede alcanzarlos se ha convertido en algo que ahora puedes poseer.
Pregúntale a la mayoría de las personas cuánto les cuesta la IA y te dirán el precio de su suscripción mensual.
Pregúntales cuánto cuesta una sola conversación y el silencio reinante será total, lo cual es justo, porque la respuesta honesta es complicada. Tanto OpenAI como Anthropic facturan en una unidad que no puedes ver, fijan precios según cuatro ejes distintos y publican en su propia documentación una serie de descuentos casi inalcanzables si estás sentado frente a una simple caja de texto.
Nada de esto está oculto. Todo aparece en sus páginas de precios y en sus documentos para desarrolladores ahora mismo. Simplemente requiere estar un nivel más abajo de donde suele situarse la mayoría de la gente.
Esa brecha entre la lista de precios publicada y lo que paga una persona normal no es un escándalo. Es un negocio, y hasta hace poco no tenías ninguna forma de estar al otro lado.
Este artículo explica qué contiene realmente la factura, por qué las palancas reales están donde están y qué cambia cuando la capa que las maneja pasa a ser algo que puedes controlar en lugar de solo pagar. Si quieres más contenido sobre IA y propiedad, sigue a @MossAI_Official.
7 cosas en tu factura, directamente de su propia documentación
Todo lo siguiente está publicado por OpenAI o Anthropic. Casi nada de esto es de conocimiento común fuera de los equipos de ingeniería. Las tarifas cambian constantemente, así que considera estas cifras como ilustraciones de la estructura, no como cotizaciones firmes.
- La salida cuesta varias veces más que la entrada, en ambas plataformas
Cada modelo en ambas listas de precios factura la entrada y la salida por separado, y la salida siempre es mucho más cara. La ratio suele estar entre cuatro y seis a uno.

El cambio de perspectiva práctico es la parte importante. Lo que tú escribes es casi gratis. Lo que el modelo responde es la factura. Limitar la respuesta reduce tus costes mucho más que recortar la pregunta, lo cual es lo opuesto a cómo actúa casi todo el mundo.
2. Te cobran por razonamientos que no tienes permitido leer
Esto es lo que debería sorprenderte de verdad.
La propia documentación de ayuda de OpenAI establece que los tokens de razonamiento no son visibles como texto de respuesta, pero cuentan para el uso de salida y se facturan como tokens de salida; por tanto, una respuesta visible corta puede consumir más tokens de los que sugiere su texto mostrado. Su guía de razonamiento confirma que los tokens de razonamiento brutos no se exponen, solo un resumen opcional.
Estás pagando tarifas de salida por texto estructuralmente invisible para ti.
3. Tu límite de salida no limita la parte oculta
Se pone más interesante. La documentación para ejecutar estos modelos indica que el parámetro de máximo de tokens de salida limita la salida visible, mientras que los tokens de razonamiento ocultos no están restringidos por ese límite.
Consecuencia documentada: una solicitud puede agotar su presupuesto durante la fase de razonamiento y no devolver nada, con los tokens ya consumidos. La guía de razonamiento de OpenAI reconoce este resultado directamente, señalando que podrías incurrir en costes por tokens de entrada y de razonamiento sin recibir una respuesta visible.
El contador corre, la pantalla permanece en blanco y esto es comportamiento documentado, no un error.
4. El contexto repetido tiene un 90% de descuento, y ambas te lo dicen
El almacenamiento en caché del prompt (prompt caching) es la mayor palanca individual en la pila tecnológica y la mayoría de la gente nunca ha oído hablar de ello.
La documentación de caché de Anthropic sitúa las lecturas de caché a 0.1 veces el precio base de entrada, con una escritura de caché de cinco minutos a 1.25 veces y una escritura de una hora a 2 veces. OpenAI aplica la misma estructura en las familias actuales de GPT-5, fijando el precio de la entrada en caché en aproximadamente el diez por ciento de la tarifa estándar de entrada, con las escrituras de caché teniendo su propio premium.
La aritmética es donde resulta útil. Con una lectura a una décima parte y una escritura a 1.25 veces, un fallo de caché cuesta aproximadamente doce veces y media más que un acierto para el mismo prefijo, y el punto de equilibrio se alcanza tras unas dos lecturas. Para cualquier cosa que reenvíe el mismo prompt de sistema, esquema de herramientas o documento de referencia en cada llamada, esa es toda la diferencia entre una factura pequeña y una grande.

También es frágil de una manera que vale la pena conocer. Ambos proveedores almacenan en caché mediante coincidencia exacta de prefijos, por lo que un byte cambiado en la parte alta del prompt invalida todo lo que hay debajo y el precio revierte silenciosamente a la tarifa completa.
5. Ambas reducirán la factura a la mitad para trabajos que pueden esperar
OpenAI y Anthropic operan cada una un nivel asincrónico por lotes (batch tier) con un 50% de descuento en entrada y salida. La documentación de precios de Anthropic establece explícitamente que los multiplicadores de caché se acumulan con el descuento por lotes.
Si los combinas, un token de entrada en caché dentro de un lote termina costando una fracción mínima del estándar. No funciona para nada interactivo, que es precisamente la razón por la que ningún producto de consumo te lo expone.
6. El descuento depende de a qué ID de modelo estés anclado, no de qué modelo creas que estás usando
Aquí va uno que casi nadie comprueba.
El descuento por caché no es uniforme en todo el catálogo de un proveedor. En OpenAI, las familias actuales de GPT-5 obtienen aproximadamente un 90% de descuento en la entrada en caché, mientras que los modelos de generaciones anteriores tienen descuentos considerablemente menores. En Anthropic, el multiplicador estándar de lectura de caché es 0.1 veces la entrada base, con ciertos modelos nuevos llegando aún más lejos.
Mismo proveedor, mismo nombre de función, economías materialmente diferentes dependiendo de una cadena de texto en tu configuración. Los IDs de modelos heredados son peores de lo que sugiere esto. Los modelos retirados de Anthropic aún accesibles a través de socios en la nube mantienen sus tarifas originales, que pueden ser varias veces el precio actual por un modelo menos capaz.
Alguien configuró esa cadena una vez y nadie la revisó. Ahí es donde vive una cantidad sorprendente de gasto excesivo.
7. Cruzar un umbral de contexto puede repriciar toda la solicitud
La más sutil, y la que tiene la forma más traicionera.
OpenAI publica tarifas separadas para contextos largos en algunos modelos, y la mecánica no es lo que la gente asume. Por encima del umbral, toda la solicitud se repricia, no solo los tokens por encima de la línea. Un token más allá y toda la llamada cuesta aproximadamente el doble.
Anthropic ha adoptado una postura diferente en esto. En los modelos Claude recientes, toda la ventana de contexto se factura a las tarifas estándar por token, con los descuentos de caché y por lotes aplicándose a través de toda la ventana.
Esta es una diferencia estructural genuina entre las dos plataformas y es invisible desde cualquier interfaz de consumo. Si tu carga de trabajo utiliza contextos largos, puede dominar todas las demás consideraciones de precios.

Las palancas son públicas. Aún así, no puedes alcanzarlas.
Aquí está el punto estructural.
Cada palanca mencionada arriba vive en la capa de API. Alcanzarlas requiere control sobre la estructura del prompt para que la caché realmente funcione, enrutamiento de modelos para que el trabajo correcto vaya al nivel de precio correcto, procesamiento por lotes para trabajos que toleran latencia, control del esfuerzo de razonamiento y conciencia de en qué nivel de contexto cae una solicitud.
Desde una interfaz de chat de consumidor, tienes una caja de texto y un cargo mensual. No puedes enrutar, no puedes procesar por lotes, no puedes estructurar un prefijo de caché y no puedes ver cuánto te está costando tu configuración de esfuerzo de razonamiento.
Así que existe una brecha. Por un lado está lo que logra un operador competente combinando estas técnicas. Por el otro, lo que paga un usuario ordinario. Nadie está siendo engañado. Los descuentos son superficies de ingeniería, no funciones de consumo, y los productos de consumo no están construidos para exponerlos.
Los negocios que viven dentro de esa brecha son relés, pasarelas y agregadores. Se sientan entre usuarios y proveedores, enrutan hacia el modelo suficiente más barato, mantienen las cachés calientes para que el contexto repetido no se recompre a precio completo, agrupan lo que se puede agrupar y entregan al usuario algo más simple que una API cruda.
Su ingreso es la brecha. Y ahí es donde esto se pone interesante.

Un relé es un negocio de rendimiento, y eso es raro aquí
La mayoría de las cosas en este mercado son apuestas. Tomas una postura, aciertas o fallas, y el resultado oscila.
Un relé es una caseta de cobro. Pasa volumen, el margen se acumula por unidad y la economía escala con el uso, no con que alguien tenga razón.
De esto se derivan tres propiedades, y las tres son poco comunes.
El ingreso es por unidad y continuo. No irregular, no impulsado por eventos, no contingente a que una apuesta salga bien. Fluyen tokens, se acumula margen, hora tras hora.
La demanda no está correlacionada con las criptomonedas. La gente que escribe código, genera video y ejecuta asistentes no mira primero el mercado. El motor de consumo es la adopción de IA, una de las muy pocas cosas en esta industria que no se mueve junto con todo lo demás.
La actividad es un conteo, no una interpretación. El rendimiento es medible sin argumentos de atribución. No hay duda de si un buen mes fue habilidad o suerte. Las solicitudes pasaron o no pasaron.
Esa última importa más de lo que parece. La parte difícil de hacer que algo sea transferible es probar qué hizo. Un negocio de rendimiento tiene una distancia inusualmente corta entre lo que pasó y lo que se puede demostrar.

Model Max, y poseer la caseta de cobro en lugar de solo pagar en ella
Model Max es un relé de API de tokens, y está activo ahora como agente de canje en Moss Agent Marketplace.
La mitad del producto es sencilla. Acceso a modelos a través de una sola ruta, con enrutamiento, caché y procesamiento por lotes manejados en la capa donde esas decisiones están realmente disponibles, en lugar de en la capa donde estás atrapado con una caja de texto.
La otra mitad es la parte digna de atención. Como agente en el Marketplace, el relé no es solo algo que usas. Es algo en lo que puedes tener una posición.
Esa forma es diferente a la mayoría de esta categoría. La actividad de un relé está cerca del input ideal para una reclamación verificable, porque el rendimiento es un hecho, no una narrativa. Sin historial que interpretar, sin historia de desempeño que aceptar por confianza. El uso ocurrió o no, y eso es legible.
También es el segundo agente de canje que hemos lanzado donde la cosa que se usa y la cosa que se posee son el mismo objeto. Puedes ser cliente del relé y titular de él al mismo tiempo, y la segunda relación no es un nivel de fidelización. Es una posición.
Empezamos con agentes de trading porque el trading es el campo de pruebas más duro que existe. Un número es real o es una historia, y la cadena no te deja mentir sobre cuál. Los agentes de canje llevan ese mismo estándar a personas que nunca abrirán un perp. Lo que viene después de estos empuja aún más lejos, hacia sistemas que no solo funcionan en la cadena, sino que emiten y operan en ella por sí mismos.
Más sobre eso cuando esté disponible, no antes.
4 cosas para hacer esta semana, uses lo que uses
Ninguna de estas requiere Moss.
Deja de optimizar la longitud del prompt y empieza a limitar la salida. Estás pagando por la respuesta, no por la pregunta. Pedir cincuenta palabras en lugar de quinientas hace aproximadamente diez veces más por tu factura que editar tu prompt para que sea más corto.
Comprueba qué te está comprando tu configuración de esfuerzo de razonamiento. En tareas que no necesitan deliberación, un esfuerzo alto es dinero gastado en tokens ocultos que no mejoran nada de lo que realmente recibes. Esta es la forma más común en que la gente paga de más sin darse cuenta jamás.
Abre tu configuración y lee el ID del modelo. No el nombre del modelo que crees que estás usando, la cadena real. Luego compáralo con la lista de precios actual. Los IDs antiguos transportan silenciosamente economías antiguas, y a veces descuentos de caché considerablemente peores, por un modelo menos capaz.
Si construyes algo, mide la tasa de aciertos de caché antes de optimizar cualquier otra cosa. Los campos de uso en la respuesta te dan la división entre entrada fresca, escrituras de caché y lecturas de caché. Cero lecturas en llamadas repetidas significa que algo en la parte alta de tu prompt está cambiando e invalidando todo lo de abajo. Esa es una diferencia de coste de doce veces escondida detrás de un byte.
El hábito subyacente a las cuatro es la verdadera lección. Trata el gasto en IA como una factura con una estructura, no como una suscripción con un número. Una vez que la estructura es visible, también lo es la pregunta de quién está posicionado dónde dentro de ella.
Qué hacer ahora
Ve a moss.site y mira Model Max. Úsalo como relé si eso es lo que necesitas. Mira qué significa tener una posición en uno si eso es lo que te interesa. Ambos están activos, y son el mismo objeto, que es la parte que creemos nueva.
Toda economía eventualmente decide quién posee su infraestructura. La economía de la IA está actualmente en la fase donde todos pagan en la caseta de cobro y nadie ha pensado en preguntar quién la posee.
Esa pregunta permanece abierta un poco más.
Fuentes
- Centro de Ayuda de OpenAI, Entendiendo y contando tokens, sobre los tokens de razonamiento facturados como salida aunque no sean visibles como texto de respuesta: https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them
- Guía de modelos de razonamiento de OpenAI, sobre los tokens de razonamiento brutos no expuestos y sobre incurrir en costes sin una respuesta visible: https://developers.openai.com/api/docs/guides/reasoning
- Página de precios de la API de OpenAI, para las tasas actuales por modelo de entrada, entrada en caché y salida, niveles por lotes y flexibles, y tasas de contexto largo: https://openai.com/api/pricing/
- Microsoft Learn Q&A sobre facturación de Azure OpenAI, sobre la inclusión de tokens de razonamiento ocultos en la facturación y el parámetro de máximo de tokens de salida que no los restringe: https://learn.microsoft.com/en-us/answers/questions/5542366/why-did-azure-report-more-completion-tokens-than-m
- Documentación de caché de prompts de Anthropic, sobre lecturas de caché a 0.1 veces la entrada base, multiplicadores de escritura y acumulación con el descuento de Batch API: https://platform.claude.com/docs/en/build-with-claude/prompt-caching
- Página de precios de Anthropic, para las tasas actuales por modelo y el descuento de Batch API: https://claude.com/pricing





