Entiende cada céntimo antes de enviar una solicitud.
Model.sale usa una tarifa mixta prepago por modelo. La tarifa pública es fácil de comparar, mientras que el libro de uso conserva el desglose detallado de tokens y el cargo final exacto.
La respuesta corta
En una solicitud completada, el cargo es la cantidad de tokens cobrables informada multiplicada por el precio público vigente. Antes del envío puede retenerse un mínimo de reserva, pero no es una tarifa final y la parte no utilizada se libera:
charged_tokens = uncached_input + output + 0.4 × cached_input
charge = charged_tokens / 1,000,000 × model_price
final_charge = measured_charge
released_reservation = reserved_amount - final_chargeLa versión de precio se fija en el momento en que se admite la solicitud. Un cambio de precio posterior no puede alterar una solicitud en curso. Si falta el uso final, la solicitud permanece como billing_pending para conciliación en lugar de cobrarse por suposición.
Qué significan los «tokens cobrables»
Los protocolos nombran los campos de uso de forma distinta, así que Model.sale los normaliza en una vista coherente del libro mayor:
| Campo de uso | Cómo se muestra | Tratamiento de facturación |
|---|---|---|
| Entrada / prompt | Tokens de entrada | Se incluye una vez en los tokens cobrables |
| Entrada en caché | Tokens en caché | Se cobra al 40 % del precio del modelo |
| Salida / completion | Tokens de salida | Se incluye una vez en los tokens cobrables |
| Razonamiento | Tokens de razonamiento | Subconjunto diagnóstico cuando se informa; nunca se suma a la salida |
Si un protocolo no devuelve el uso final, la solicitud se marca como billing_pending en lugar de adivinar en silencio un importe final.
Ejemplos prácticos
Los ejemplos usan una tarifa mixta de 0,09 US$. El mínimo de reserva es solo una retención temporal; la tarifa vigente de tu modelo aparece en la página de precios.
| Tokens cobrables | Cálculo bruto | Cargo final |
|---|---|---|
| 10.000 | $0.0009 | $0.0009 |
| 100.000 | $0.009 | $0.009 |
| 1.000.000 | $0.09 | $0.09 |
| 2.000.000 | $0.18 | $0.18 |
Una conversación con varios mensajes se liquida mensaje a mensaje a partir del uso medido de cada respuesta.
Cómo comparar precios con justicia
Las API oficiales suelen publicar tarifas separadas de entrada, entrada en caché y salida. Un «ahorro» porcentual solo tiene sentido para una carga concreta con la misma mezcla de tokens, la misma moneda y las mismas reglas de caché.
- Mide la mezcla de entrada, caché y salida en tus propias solicitudes.
- Aplica la tarifa oficial a esa mezcla exacta.
- Aplica la tarifa mixta de Model.sale al total medido de tokens cobrables.
- Incluye en la estimación el comportamiento de solicitudes fallidas, reintentos, liberación de reservas y redondeo.
Los precios de referencia de la página de comparación incluyen una URL de origen y una fecha de comprobación. No son un benchmark ni una promesa de que modelos con nombres parecidos produzcan la misma salida.
Versiones de precios y transparencia
Cada tarifa pública tiene una versión vigente, un mínimo de reserva y una marca de tiempo de comprobación. La reserva no es un cargo final: tras el uso final, solo se liquidan los tokens medidos y el resto se libera. La disponibilidad es aparte: un modelo no disponible puede conservar un precio visible mientras se repara su ruta, pero no puede recibir tráfico de clientes.
Model.sale no almacena prompts ni cuerpos de respuesta para la facturación. Los registros operativos contienen metadatos de solicitud, recuento de tokens, cargo, margen y una clasificación segura de errores.