Metodología de precios · actualizado 2026-08-26

Entiende cada céntimo antes de enviar una solicitud.

Model.sale usa una tarifa mixta prepago por modelo. La tarifa pública es fácil de comparar, mientras que el libro de uso conserva el desglose detallado de tokens y el cargo final exacto.

La respuesta corta

En una solicitud completada, el cargo es la cantidad de tokens cobrables informada multiplicada por el precio público vigente. Antes del envío puede retenerse un mínimo de reserva, pero no es una tarifa final y la parte no utilizada se libera:

charged_tokens = uncached_input + output + 0.4 × cached_input
charge = charged_tokens / 1,000,000 × model_price
final_charge = measured_charge
released_reservation = reserved_amount - final_charge

La versión de precio se fija en el momento en que se admite la solicitud. Un cambio de precio posterior no puede alterar una solicitud en curso. Si falta el uso final, la solicitud permanece como billing_pending para conciliación en lugar de cobrarse por suposición.

01 · Reservar
Proteger el monederoAntes de enviar la solicitud al modelo, el monedero reserva una estimación basada en la entrada y en el límite de salida solicitado, cuando existe.
02 · Medir
Leer el uso finalEl uso en JSON y SSE se extrae del protocolo seleccionado. El ID de solicitud vincula la respuesta con su registro de uso.
03 · Liquidar
Liberar el restoEl libro mayor registra una liquidación idempotente y libera cualquier reserva no utilizada. No se añade ninguna cuota mensual por puesto.

Qué significan los «tokens cobrables»

Los protocolos nombran los campos de uso de forma distinta, así que Model.sale los normaliza en una vista coherente del libro mayor:

Campo de usoCómo se muestraTratamiento de facturación
Entrada / promptTokens de entradaSe incluye una vez en los tokens cobrables
Entrada en cachéTokens en cachéSe cobra al 40 % del precio del modelo
Salida / completionTokens de salidaSe incluye una vez en los tokens cobrables
RazonamientoTokens de razonamientoSubconjunto diagnóstico cuando se informa; nunca se suma a la salida

Si un protocolo no devuelve el uso final, la solicitud se marca como billing_pending en lugar de adivinar en silencio un importe final.

Ejemplos prácticos

Los ejemplos usan una tarifa mixta de 0,09 US$. El mínimo de reserva es solo una retención temporal; la tarifa vigente de tu modelo aparece en la página de precios.

Tokens cobrablesCálculo brutoCargo final
10.000$0.0009$0.0009
100.000$0.009$0.009
1.000.000$0.09$0.09
2.000.000$0.18$0.18

Una conversación con varios mensajes se liquida mensaje a mensaje a partir del uso medido de cada respuesta.

Solicitudes fallidasUna solicitud rechazada antes del envío al modelo no consume inferencia. La admisión, la clase de error y cualquier reserva liberada siguen visibles en el uso.
StreamingLas respuestas en streaming se envían de inmediato. Un evento final completado liquida el uso informado; las desconexiones siguen la política de uso documentada del proveedor.
LímitesEl saldo del monedero, los límites de la clave y el tope por solicitud se comprueban antes del envío. La pasarela nunca sustituye un modelo por otro para ajustarse a un límite.

Cómo comparar precios con justicia

Las API oficiales suelen publicar tarifas separadas de entrada, entrada en caché y salida. Un «ahorro» porcentual solo tiene sentido para una carga concreta con la misma mezcla de tokens, la misma moneda y las mismas reglas de caché.

  1. Mide la mezcla de entrada, caché y salida en tus propias solicitudes.
  2. Aplica la tarifa oficial a esa mezcla exacta.
  3. Aplica la tarifa mixta de Model.sale al total medido de tokens cobrables.
  4. Incluye en la estimación el comportamiento de solicitudes fallidas, reintentos, liberación de reservas y redondeo.

Los precios de referencia de la página de comparación incluyen una URL de origen y una fecha de comprobación. No son un benchmark ni una promesa de que modelos con nombres parecidos produzcan la misma salida.

Abrir la calculadora de cargas

Versiones de precios y transparencia

Cada tarifa pública tiene una versión vigente, un mínimo de reserva y una marca de tiempo de comprobación. La reserva no es un cargo final: tras el uso final, solo se liquidan los tokens medidos y el resto se libera. La disponibilidad es aparte: un modelo no disponible puede conservar un precio visible mientras se repara su ruta, pero no puede recibir tráfico de clientes.

Model.sale no almacena prompts ni cuerpos de respuesta para la facturación. Los registros operativos contienen metadatos de solicitud, recuento de tokens, cargo, margen y una clasificación segura de errores.