Qué hay realmente dentro de una factura de OpenAI o Anthropic, los descuentos que ambas publican y a los que no puedes acceder desde un cuadro de chat, y por qué la capa que sí puede alcanzarlos se ha convertido en algo que ahora puedes poseer.
Pregúntale a la mayoría de las personas cuánto les cuesta la IA y te darán el precio de una suscripción mensual.
Pregúntales cuánto cuesta una sola conversación y el silencio será total, lo cual es justo, porque la respuesta honesta es complicada. Tanto OpenAI como Anthropic facturan en una unidad que no puedes ver, fijan precios en cuatro ejes separados y publican una serie de descuentos en su propia documentación que son casi inalcanzables si estás sentado frente a un simple cuadro de texto.
Nada de esto está oculto. Todo está disponible en sus páginas de precios y en sus documentos para desarrolladores ahora mismo. Simplemente requiere estar una capa por debajo de donde se encuentra la mayoría de las personas.
Esa brecha entre la lista de precios publicada y el precio que paga una persona común no es un escándalo. Es un negocio, y hasta hace poco no tenías ninguna forma de estar al otro lado de esa brecha.
Este artículo explica qué hay realmente en la factura, por qué las verdaderas palancas están donde están, y qué cambia cuando la capa que las mueve se convierte en algo que puedes sostener en lugar de solo pagar. Si quieres más contenido así sobre IA y propiedad, sigue a @MossAI_Official.
7 cosas en tu factura, directamente de su propia documentación
Todo lo siguiente es publicado por OpenAI o Anthropic. Casi nada de esto es conocimiento común fuera de los equipos de ingeniería. Las tarifas cambian constantemente, así que considera estas cifras como ilustraciones de la estructura, no como cotizaciones exactas.
- La salida cuesta varias veces más que la entrada, en ambas plataformas
Cada modelo en ambas listas de precios factura la entrada y la salida por separado, y la salida siempre es mucho más cara. La relación suele estar entre cuatro y seis a uno.

El cambio de perspectiva práctico es la parte importante. Lo que tú escribes es casi gratis. Lo que el modelo dice de vuelta es la factura. Restringir la respuesta ayuda mucho más a reducir tus costos que recortar la pregunta, lo cual es lo opuesto a cómo actúa casi todo el mundo.
2. Te cobran por razonamientos que no tienes permitido leer
Esta es la que debería sorprenderte genuinamente.
La documentación de ayuda de OpenAI establece que los tokens de razonamiento no son visibles como texto de respuesta pero cuentan hacia el uso de salida y se facturan como tokens de salida, por lo que una respuesta visible corta puede usar más tokens de los que su texto mostrado sugiere. Su guía de razonamiento confirma que los tokens de razonamiento brutos no se exponen, solo un resumen opcional.
Estás pagando tarifas de salida por texto que estructuralmente no tienes permitido ver.
3. Tu límite de salida no limita la parte oculta
Se pone más interesante. La documentación para ejecutar estos modelos indica que el parámetro de máximo de tokens de salida limita la salida visible, mientras que los tokens de razonamiento ocultos no están restringidos por ese límite.
Consecuencia documentada: Una solicitud puede gastar su presupuesto dentro de la fase de razonamiento y no devolver nada, con los tokens ya consumidos. La guía de razonamiento de OpenAI reconoce este resultado directamente, señalando que podrías incurrir en costos por tokens de entrada y razonamiento sin recibir una respuesta visible.
El medidor corre, la pantalla permanece en blanco, y esto es comportamiento documentado, no un error.
4. El contexto repetido tiene un 90% de descuento, y ambas te lo dicen
El almacenamiento en caché del prompt (prompt caching) es la palanca individual más grande en la pila tecnológica y la mayoría de la gente nunca ha oído hablar de ella.
La documentación de caché de Anthropic coloca las lecturas de caché a 0.1 veces el precio base de entrada, con una escritura de caché de cinco minutos a 1.25 veces y una escritura de una hora a 2 veces. OpenAI aplica la misma forma en las familias GPT-5 actuales, fijando el precio de la entrada en caché aproximadamente al diez por ciento de la tarifa estándar de entrada, con escrituras de caché que llevan su propio premium.
La aritmética es donde se vuelve útil. Con una lectura a una décima parte y una escritura a 1.25 veces, un fallo de caché (cache miss) cuesta aproximadamente doce veces y media lo que cuesta un acierto (hit) para el mismo prefijo, y el punto de equilibrio llega a unas dos lecturas. Para cualquier cosa que reenvíe el mismo prompt de sistema, esquema de herramientas o documento de referencia en cada llamada, esa es toda la diferencia entre una factura pequeña y una grande.

También es frágil de una manera que vale la pena conocer. Ambos proveedores hacen caché mediante coincidencia exacta de prefijos, por lo que un byte cambiado alto en el prompt invalida todo lo que está debajo y el precio revierte silenciosamente a la tarifa completa.
5. Ambas reducirán la factura a la mitad para trabajos que pueden esperar
OpenAI y Anthropic operan cada una un nivel asincrónico de lote (batch tier) con un cincuenta por ciento de descuento en entrada y salida. La documentación de precios de Anthropic establece explícitamente que los multiplicadores de caché se acumulan con el descuento de lote.
Acumúlalos y un token de entrada en caché dentro de un lote aterriza en una pequeña fracción del estándar. No funciona para nada interactivo, que es precisamente por lo que ningún producto de consumo te lo expone.
6. El descuento depende de a qué ID de modelo estás vinculado, no de qué modelo crees que estás usando
Aquí hay algo que casi nadie revisa.
El descuento de caché no es uniforme a través del catálogo de un proveedor. En OpenAI, las familias GPT-5 actuales obtienen aproximadamente un noventa por ciento de descuento en entrada en caché, mientras que los modelos de generaciones anteriores tienen descuentos considerablemente menores. En Anthropic, el multiplicador estándar de lectura de caché es 0.1 veces la entrada base, con ciertos modelos nuevos yendo aún más lejos.
Mismo proveedor, mismo nombre de función, economías materialmente diferentes dependiendo de una cadena de texto en tu configuración. Los IDs de modelos heredados son peores de lo que esto sugiere. Los modelos retirados de Anthropic aún accesibles a través de socios en la nube conservan sus tarifas originales, que pueden ser varias veces el precio actual por un modelo menos capaz.
Alguien configuró esa cadena una vez y nadie la volvió a revisar. Ahí es donde vive una cantidad sorprendente de gasto excesivo.
7. Cruzar un umbral de contexto puede repricingear toda la solicitud
La más sutil, y la que tiene la forma más desagradable.
OpenAI publica tarifas separadas para contextos largos en algunos modelos, y la mecánica no es lo que la gente asume. Por encima del umbral, toda la solicitud se repricingea, no solo los tokens por encima de la línea. Un token por encima y toda la llamada cuesta aproximadamente el doble.
Anthropic ha tomado una posición diferente sobre esto. En los modelos Claude recientes, toda la ventana de contexto se factura a tarifas estándar por token, con descuentos de caché y de lote aplicándose a través de toda la ventana.
Esa es una diferencia estructural genuina entre las dos plataformas y es invisible desde cualquier interfaz de consumo. Si tu carga de trabajo ejecuta contextos largos, puede dominar todas las demás consideraciones de precios.

Las palancas son públicas. Aún así, no puedes alcanzarlas.
Aquí está el punto estructural.
Cada palanca anterior vive en la capa API. Alcanzarlas requiere control sobre la estructura del prompt para que la caché realmente funcione, enrutamiento de modelos para que el trabajo correcto vaya al nivel de precio correcto, procesamiento por lotes para trabajos que puedan tolerar latencia, control del esfuerzo de razonamiento, y conciencia de en qué nivel de contexto cae una solicitud.
Desde una interfaz de chat de consumo tienes un cuadro de texto y un cargo mensual. No puedes enrutar, no puedes hacer lotes, no puedes estructurar un prefijo de caché, y no puedes ver cuánto te está costando tu configuración de esfuerzo de razonamiento.
Así que existe un margen. Por un lado está lo que logra un operador competente combinando estas técnicas. Por el otro está lo que paga un usuario ordinario. Nadie está siendo engañado. Los descuentos son superficies de ingeniería, no funciones de consumo, y los productos de consumo no están construidos para exponerlos.
Los negocios que viven dentro de ese margen son relés, pasarelas (gateways) y agregadores. Se sientan entre usuarios y proveedores, enrutan al modelo suficiente más barato, mantienen las cachés calientes para que el contexto repetido no sea recomprado a precio completo, procesan por lotes lo que puede serlo, y entregan al usuario algo más simple que una API cruda.
Su ingreso es el margen. Y ahí es donde esto se pone interesante.

Un relé es un negocio de throughput, y eso es raro aquí
La mayoría de las cosas en este mercado son apuestas. Tomas una postura, tienes razón o te equivocas, y el resultado oscila.
Un relé es una caseta de cobro. El volumen pasa, el margen se acumula por unidad, y la economía escala con el uso en lugar de depender de que alguien tenga razón.
Tres propiedades siguen, y las tres son poco comunes.
El ingreso es por unidad y continuo. No es irregular, no es impulsado por eventos, no depende de que una apuesta salga bien. Los tokens fluyen, el margen se acumula, hora tras hora.
La demanda no está correlacionada con las criptomonedas. Las personas escribiendo código, generando video y ejecutando asistentes no revisan el mercado primero. El conductor del consumo es la adopción de IA, que es una de las muy pocas cosas en esta industria que no se mueve junto con todo lo demás.
La actividad es un conteo, no una interpretación. El throughput es medible sin un argumento de atribución. No hay pregunta sobre si un buen mes fue habilidad o suerte. Las solicitudes pasaron o no pasaron.
Esa última importa más de lo que suena. La parte difícil de hacer que algo sea poseíble es probar qué hizo. Un negocio de throughput tiene una distancia inusualmente corta entre lo que pasó y lo que se puede mostrar.

Model Max, y poseer la caseta de cobro en lugar de solo pagar en ella
Model Max es un relé de API de tokens, y está activo ahora como agente de redención en Moss Agent Marketplace.
La mitad del producto es directa. Acceso a modelos a través de una sola ruta, con enrutamiento, caché y procesamiento por lotes manejados en la capa donde esas decisiones están realmente disponibles, en lugar de en la capa donde estás atrapado con un cuadro de texto.
La otra mitad es la parte que merece atención. Como agente en el Marketplace, el relé no es solo algo que usas. Es algo en lo que puedes tener una posición.
Esa forma es diferente a la mayoría de esta categoría. La actividad de un relé está cerca de la entrada ideal para una afirmación verificable, porque el throughput es un hecho, no una narrativa. No hay historial que interpretar, ni historia de rendimiento que aceptar por confianza. El uso ocurrió o no ocurrió, y eso es legible.
También es el segundo agente de redención que hemos lanzado donde la cosa que se usa y la cosa que se posee son el mismo objeto. Puedes ser un cliente del relé y un titular de él al mismo tiempo, y la segunda relación no es un nivel de lealtad. Es una posición.
Empezamos con agentes de trading porque el trading es el campo de pruebas más duro que existe. Un número es real o es una historia, y la cadena no te deja mentir sobre cuál. Los agentes de redención llevan ese mismo estándar a personas que nunca abrirán un contrato perpetuo. Lo que viene después de estos empuja aún más lejos, hacia sistemas que no simplemente corren en la cadena, sino que emiten y operan en ella ellos mismos.
Más sobre eso cuando esté listo, no antes.
4 cosas para hacer esta semana, uses lo que uses
Ninguna de estas requiere Moss.
Deja de optimizar la longitud del prompt y empieza a restringir la salida. Estás pagando por la respuesta, no por la pregunta. Pedir cincuenta palabras en lugar de quinientas hace aproximadamente diez veces más por tu factura que editar tu prompt hacia abajo.
Revisa qué te está comprando tu configuración de esfuerzo de razonamiento. En tareas que no necesitan deliberación, un esfuerzo alto es dinero gastado en tokens ocultos que mejoran nada de lo que realmente recibes. Esta es la forma más común en que la gente paga de más sin darse cuenta jamás.
Abre tu configuración y lee el ID del modelo. No el nombre del modelo que crees que estás usando, la cadena real. Luego compárala contra la lista de precios actual. Los IDs antiguos silenciosamente traen economías antiguas, y a veces descuentos de caché considerablemente peores, por un modelo menos capaz.
Si construyes algo, mide la tasa de aciertos de caché antes de optimizar cualquier otra cosa. Los campos de uso en la respuesta te dan la división entre entrada fresca, escrituras de caché y lecturas de caché. Cero lecturas en llamadas repetidas significa que algo alto en tu prompt está cambiando e invalidando todo lo de abajo. Esa es una diferencia de costo de doce veces escondida detrás de un byte.
El hábito subyacente a las cuatro es la verdadera conclusión. Trata el gasto de IA como una factura con una estructura, no como una suscripción con un número. Una vez que la estructura es visible, también lo es la pregunta de quién está posicionado dónde dentro de ella.
Qué hacer ahora
Ve a moss.site y mira Model Max. Úsalo como un relé si eso es lo que necesitas. Mira qué significa tener una posición en uno si eso es lo que te interesa. Ambos están activos, y son el mismo objeto, que es la parte que creemos que es nueva.
Toda economía eventualmente decide quién posee su infraestructura. La economía de la IA está actualmente en la fase donde todos pagan en la caseta de cobro y nadie ha pensado en preguntar quién la posee.
Esa pregunta permanece abierta un poco más.
Fuentes
- Centro de Ayuda de OpenAI, Entendiendo y contando tokens, sobre los tokens de razonamiento siendo facturados como salida aunque no sean visibles como texto de respuesta: https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them
- Guía de modelos de razonamiento de OpenAI, sobre los tokens de razonamiento brutos no siendo expuestos y sobre incurrir en costos sin una respuesta visible: https://developers.openai.com/api/docs/guides/reasoning
- Página de precios de la API de OpenAI, para las tasas actuales por modelo de entrada, entrada en caché y salida, niveles de lote y flex, y tasas de contexto largo: https://openai.com/api/pricing/
- Q&A de Microsoft Learn sobre facturación de Azure OpenAI, sobre los tokens de razonamiento ocultos siendo incluidos en la facturación y el parámetro de máximo de tokens de salida no restringiéndolos: https://learn.microsoft.com/en-us/answers/questions/5542366/why-did-azure-report-more-completion-tokens-than-m
- Documentación de caché de prompts de Anthropic, sobre lecturas de caché a 0.1 veces la entrada base, multiplicadores de escritura, y acumulación con el descuento de la API Batch: https://platform.claude.com/docs/en/build-with-claude/prompt-caching
- Página de precios de Anthropic, para las tasas actuales por modelo y el descuento de la API Batch: https://claude.com/pricing





