Estás pagando por tokens que nunca verás

@MossAI_Official
INGLÉS17 sept 2026
119K
169
87
26
97

TL;DR

Un análisis de las estructuras de facturación de la IA revela costos ocultos, como los tokens de razonamiento invisibles y los complejos descuentos de caché. Se introduce un servicio de retransmisión que permite a los usuarios optimizar estos factores o gestionar su propia infraestructura.

Qué hay realmente dentro de una factura de OpenAI o Anthropic, los descuentos que ambas publican y a los que no puedes acceder desde un cuadro de chat, y por qué la capa que sí puede alcanzarlos se ha convertido en algo que ahora puedes poseer.

Pregúntale a la mayoría de las personas cuánto les cuesta la IA y te darán el precio de una suscripción mensual.

Pregúntales cuánto cuesta una sola conversación y el silencio será total, lo cual es justo, porque la respuesta honesta es complicada. Tanto OpenAI como Anthropic facturan en una unidad que no puedes ver, fijan precios en cuatro ejes separados y publican una serie de descuentos en su propia documentación que son casi inalcanzables si estás sentado frente a un simple cuadro de texto.

Nada de esto está oculto. Todo está disponible en sus páginas de precios y en sus documentos para desarrolladores ahora mismo. Simplemente requiere estar una capa por debajo de donde se encuentra la mayoría de las personas.

Esa brecha entre la lista de precios publicada y el precio que paga una persona común no es un escándalo. Es un negocio, y hasta hace poco no tenías ninguna forma de estar al otro lado de esa brecha.

Este artículo explica qué hay realmente en la factura, por qué las verdaderas palancas están donde están, y qué cambia cuando la capa que las mueve se convierte en algo que puedes sostener en lugar de solo pagar. Si quieres más contenido así sobre IA y propiedad, sigue a @MossAI_Official.

7 cosas en tu factura, directamente de su propia documentación

Todo lo siguiente es publicado por OpenAI o Anthropic. Casi nada de esto es conocimiento común fuera de los equipos de ingeniería. Las tarifas cambian constantemente, así que considera estas cifras como ilustraciones de la estructura, no como cotizaciones exactas.

  1. La salida cuesta varias veces más que la entrada, en ambas plataformas

Cada modelo en ambas listas de precios factura la entrada y la salida por separado, y la salida siempre es mucho más cara. La relación suele estar entre cuatro y seis a uno.

MOSS - inline image

El cambio de perspectiva práctico es la parte importante. Lo que tú escribes es casi gratis. Lo que el modelo dice de vuelta es la factura. Restringir la respuesta ayuda mucho más a reducir tus costos que recortar la pregunta, lo cual es lo opuesto a cómo actúa casi todo el mundo.

2. Te cobran por razonamientos que no tienes permitido leer

Esta es la que debería sorprenderte genuinamente.

La documentación de ayuda de OpenAI establece que los tokens de razonamiento no son visibles como texto de respuesta pero cuentan hacia el uso de salida y se facturan como tokens de salida, por lo que una respuesta visible corta puede usar más tokens de los que su texto mostrado sugiere. Su guía de razonamiento confirma que los tokens de razonamiento brutos no se exponen, solo un resumen opcional.

Estás pagando tarifas de salida por texto que estructuralmente no tienes permitido ver.

3. Tu límite de salida no limita la parte oculta

Se pone más interesante. La documentación para ejecutar estos modelos indica que el parámetro de máximo de tokens de salida limita la salida visible, mientras que los tokens de razonamiento ocultos no están restringidos por ese límite.

Consecuencia documentada: Una solicitud puede gastar su presupuesto dentro de la fase de razonamiento y no devolver nada, con los tokens ya consumidos. La guía de razonamiento de OpenAI reconoce este resultado directamente, señalando que podrías incurrir en costos por tokens de entrada y razonamiento sin recibir una respuesta visible.

El medidor corre, la pantalla permanece en blanco, y esto es comportamiento documentado, no un error.

4. El contexto repetido tiene un 90% de descuento, y ambas te lo dicen

El almacenamiento en caché del prompt (prompt caching) es la palanca individual más grande en la pila tecnológica y la mayoría de la gente nunca ha oído hablar de ella.

La documentación de caché de Anthropic coloca las lecturas de caché a 0.1 veces el precio base de entrada, con una escritura de caché de cinco minutos a 1.25 veces y una escritura de una hora a 2 veces. OpenAI aplica la misma forma en las familias GPT-5 actuales, fijando el precio de la entrada en caché aproximadamente al diez por ciento de la tarifa estándar de entrada, con escrituras de caché que llevan su propio premium.

La aritmética es donde se vuelve útil. Con una lectura a una décima parte y una escritura a 1.25 veces, un fallo de caché (cache miss) cuesta aproximadamente doce veces y media lo que cuesta un acierto (hit) para el mismo prefijo, y el punto de equilibrio llega a unas dos lecturas. Para cualquier cosa que reenvíe el mismo prompt de sistema, esquema de herramientas o documento de referencia en cada llamada, esa es toda la diferencia entre una factura pequeña y una grande.

MOSS - inline image

También es frágil de una manera que vale la pena conocer. Ambos proveedores hacen caché mediante coincidencia exacta de prefijos, por lo que un byte cambiado alto en el prompt invalida todo lo que está debajo y el precio revierte silenciosamente a la tarifa completa.

5. Ambas reducirán la factura a la mitad para trabajos que pueden esperar

OpenAI y Anthropic operan cada una un nivel asincrónico de lote (batch tier) con un cincuenta por ciento de descuento en entrada y salida. La documentación de precios de Anthropic establece explícitamente que los multiplicadores de caché se acumulan con el descuento de lote.

Acumúlalos y un token de entrada en caché dentro de un lote aterriza en una pequeña fracción del estándar. No funciona para nada interactivo, que es precisamente por lo que ningún producto de consumo te lo expone.

6. El descuento depende de a qué ID de modelo estás vinculado, no de qué modelo crees que estás usando

Aquí hay algo que casi nadie revisa.

El descuento de caché no es uniforme a través del catálogo de un proveedor. En OpenAI, las familias GPT-5 actuales obtienen aproximadamente un noventa por ciento de descuento en entrada en caché, mientras que los modelos de generaciones anteriores tienen descuentos considerablemente menores. En Anthropic, el multiplicador estándar de lectura de caché es 0.1 veces la entrada base, con ciertos modelos nuevos yendo aún más lejos.

Mismo proveedor, mismo nombre de función, economías materialmente diferentes dependiendo de una cadena de texto en tu configuración. Los IDs de modelos heredados son peores de lo que esto sugiere. Los modelos retirados de Anthropic aún accesibles a través de socios en la nube conservan sus tarifas originales, que pueden ser varias veces el precio actual por un modelo menos capaz.

Alguien configuró esa cadena una vez y nadie la volvió a revisar. Ahí es donde vive una cantidad sorprendente de gasto excesivo.

7. Cruzar un umbral de contexto puede repricingear toda la solicitud

La más sutil, y la que tiene la forma más desagradable.

OpenAI publica tarifas separadas para contextos largos en algunos modelos, y la mecánica no es lo que la gente asume. Por encima del umbral, toda la solicitud se repricingea, no solo los tokens por encima de la línea. Un token por encima y toda la llamada cuesta aproximadamente el doble.

Anthropic ha tomado una posición diferente sobre esto. En los modelos Claude recientes, toda la ventana de contexto se factura a tarifas estándar por token, con descuentos de caché y de lote aplicándose a través de toda la ventana.

Esa es una diferencia estructural genuina entre las dos plataformas y es invisible desde cualquier interfaz de consumo. Si tu carga de trabajo ejecuta contextos largos, puede dominar todas las demás consideraciones de precios.

MOSS - inline image

Las palancas son públicas. Aún así, no puedes alcanzarlas.

Aquí está el punto estructural.

Cada palanca anterior vive en la capa API. Alcanzarlas requiere control sobre la estructura del prompt para que la caché realmente funcione, enrutamiento de modelos para que el trabajo correcto vaya al nivel de precio correcto, procesamiento por lotes para trabajos que puedan tolerar latencia, control del esfuerzo de razonamiento, y conciencia de en qué nivel de contexto cae una solicitud.

Desde una interfaz de chat de consumo tienes un cuadro de texto y un cargo mensual. No puedes enrutar, no puedes hacer lotes, no puedes estructurar un prefijo de caché, y no puedes ver cuánto te está costando tu configuración de esfuerzo de razonamiento.

Así que existe un margen. Por un lado está lo que logra un operador competente combinando estas técnicas. Por el otro está lo que paga un usuario ordinario. Nadie está siendo engañado. Los descuentos son superficies de ingeniería, no funciones de consumo, y los productos de consumo no están construidos para exponerlos.

Los negocios que viven dentro de ese margen son relés, pasarelas (gateways) y agregadores. Se sientan entre usuarios y proveedores, enrutan al modelo suficiente más barato, mantienen las cachés calientes para que el contexto repetido no sea recomprado a precio completo, procesan por lotes lo que puede serlo, y entregan al usuario algo más simple que una API cruda.

Su ingreso es el margen. Y ahí es donde esto se pone interesante.

MOSS - inline image

Un relé es un negocio de throughput, y eso es raro aquí

La mayoría de las cosas en este mercado son apuestas. Tomas una postura, tienes razón o te equivocas, y el resultado oscila.

Un relé es una caseta de cobro. El volumen pasa, el margen se acumula por unidad, y la economía escala con el uso en lugar de depender de que alguien tenga razón.

Tres propiedades siguen, y las tres son poco comunes.

El ingreso es por unidad y continuo. No es irregular, no es impulsado por eventos, no depende de que una apuesta salga bien. Los tokens fluyen, el margen se acumula, hora tras hora.

La demanda no está correlacionada con las criptomonedas. Las personas escribiendo código, generando video y ejecutando asistentes no revisan el mercado primero. El conductor del consumo es la adopción de IA, que es una de las muy pocas cosas en esta industria que no se mueve junto con todo lo demás.

La actividad es un conteo, no una interpretación. El throughput es medible sin un argumento de atribución. No hay pregunta sobre si un buen mes fue habilidad o suerte. Las solicitudes pasaron o no pasaron.

Esa última importa más de lo que suena. La parte difícil de hacer que algo sea poseíble es probar qué hizo. Un negocio de throughput tiene una distancia inusualmente corta entre lo que pasó y lo que se puede mostrar.

MOSS - inline image

Model Max, y poseer la caseta de cobro en lugar de solo pagar en ella

Model Max es un relé de API de tokens, y está activo ahora como agente de redención en Moss Agent Marketplace.

La mitad del producto es directa. Acceso a modelos a través de una sola ruta, con enrutamiento, caché y procesamiento por lotes manejados en la capa donde esas decisiones están realmente disponibles, en lugar de en la capa donde estás atrapado con un cuadro de texto.

La otra mitad es la parte que merece atención. Como agente en el Marketplace, el relé no es solo algo que usas. Es algo en lo que puedes tener una posición.

Esa forma es diferente a la mayoría de esta categoría. La actividad de un relé está cerca de la entrada ideal para una afirmación verificable, porque el throughput es un hecho, no una narrativa. No hay historial que interpretar, ni historia de rendimiento que aceptar por confianza. El uso ocurrió o no ocurrió, y eso es legible.

También es el segundo agente de redención que hemos lanzado donde la cosa que se usa y la cosa que se posee son el mismo objeto. Puedes ser un cliente del relé y un titular de él al mismo tiempo, y la segunda relación no es un nivel de lealtad. Es una posición.

Empezamos con agentes de trading porque el trading es el campo de pruebas más duro que existe. Un número es real o es una historia, y la cadena no te deja mentir sobre cuál. Los agentes de redención llevan ese mismo estándar a personas que nunca abrirán un contrato perpetuo. Lo que viene después de estos empuja aún más lejos, hacia sistemas que no simplemente corren en la cadena, sino que emiten y operan en ella ellos mismos.

Más sobre eso cuando esté listo, no antes.

4 cosas para hacer esta semana, uses lo que uses

Ninguna de estas requiere Moss.

Deja de optimizar la longitud del prompt y empieza a restringir la salida. Estás pagando por la respuesta, no por la pregunta. Pedir cincuenta palabras en lugar de quinientas hace aproximadamente diez veces más por tu factura que editar tu prompt hacia abajo.

Revisa qué te está comprando tu configuración de esfuerzo de razonamiento. En tareas que no necesitan deliberación, un esfuerzo alto es dinero gastado en tokens ocultos que mejoran nada de lo que realmente recibes. Esta es la forma más común en que la gente paga de más sin darse cuenta jamás.

Abre tu configuración y lee el ID del modelo. No el nombre del modelo que crees que estás usando, la cadena real. Luego compárala contra la lista de precios actual. Los IDs antiguos silenciosamente traen economías antiguas, y a veces descuentos de caché considerablemente peores, por un modelo menos capaz.

Si construyes algo, mide la tasa de aciertos de caché antes de optimizar cualquier otra cosa. Los campos de uso en la respuesta te dan la división entre entrada fresca, escrituras de caché y lecturas de caché. Cero lecturas en llamadas repetidas significa que algo alto en tu prompt está cambiando e invalidando todo lo de abajo. Esa es una diferencia de costo de doce veces escondida detrás de un byte.

El hábito subyacente a las cuatro es la verdadera conclusión. Trata el gasto de IA como una factura con una estructura, no como una suscripción con un número. Una vez que la estructura es visible, también lo es la pregunta de quién está posicionado dónde dentro de ella.

Qué hacer ahora

Ve a moss.site y mira Model Max. Úsalo como un relé si eso es lo que necesitas. Mira qué significa tener una posición en uno si eso es lo que te interesa. Ambos están activos, y son el mismo objeto, que es la parte que creemos que es nueva.

Toda economía eventualmente decide quién posee su infraestructura. La economía de la IA está actualmente en la fase donde todos pagan en la caseta de cobro y nadie ha pensado en preguntar quién la posee.

Esa pregunta permanece abierta un poco más.

👉 moss.site

Fuentes

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales