Costes y ROI9 min de lectura

Precios de las API de LLM: cómo se suman los tokens

Cómo funcionan los precios de las API de LLM: tokens de entrada y salida, contexto, caché, descuentos por lotes y costes ocultos, con un ejemplo mensual.

Los precios de las API de LLM dependen del uso: pagas por los tokens que envías al modelo (entrada) y por los que genera (salida), cada uno a su precio, normalmente expresado por millón de tokens. El coste de una solicitud es tokens de entrada × precio de entrada más tokens de salida × precio de salida. Tu factura mensual es esa cifra multiplicada por el número de solicitudes, más extras como llamadas a herramientas o almacenamiento. El resto de esta guía explica qué impulsa cada parte de la fórmula y dónde suelen fallar las estimaciones.

Este es el artículo central de nuestra serie sobre costes de la IA. Si quieres calcular mientras lees, abre la calculadora de coste de API de LLM en otra pestaña.

El modelo de precios básico

Los modelos de lenguaje no leen palabras, sino tokens: fragmentos de texto como palabras cortas enteras, partes de palabras largas, signos de puntuación o espacios. Si los tokens son nuevos para ti, lee primero qué son los tokens en los LLM. Para los precios importan tres cosas:

  1. Cada solicitud se cobra por tokens. Cuentan ambas direcciones.
  2. Entrada y salida tienen precios distintos. La salida suele ser varias veces más cara por token.
  3. Los precios se expresan por millón de tokens. Un precio de 2,00 € por millón de tokens de entrada significa 0,000002 € por token.

La fórmula básica es:

Coste por solicitud = (tokens de entrada × precio de entrada + tokens de salida × precio de salida) ÷ 1.000.000

Los precios varían mucho entre proveedores y entre modelos de un mismo proveedor. Los modelos más pequeños y rápidos pueden costar una fracción de los más grandes. Como estos precios cambian a menudo, consulta la página oficial de precios del proveedor antes de presupuestar; cualquier cifra que leas en un artículo, incluidos los ejemplos de aquí, es solo ilustrativa.

Qué cuenta como entrada

La entrada es todo lo que envías con una solicitud, no solo la pregunta del usuario. En una aplicación empresarial típica incluye:

  • Prompt de sistema: las instrucciones fijas que definen el rol, las reglas y el formato del asistente.
  • Historial de conversación: en un chat, los mensajes anteriores suelen reenviarse en cada turno para que el modelo tenga contexto.
  • Contexto recuperado: documentos, pasajes de una base de conocimiento o registros insertados en el prompt, por ejemplo con generación aumentada por recuperación (RAG).
  • Definiciones de herramientas: si el modelo puede llamar a funciones, sus descripciones forman parte de la entrada.
  • Imágenes o archivos: muchos modelos también los convierten en tokens, a menudo en cantidades considerables por imagen o página.
  • El propio mensaje del usuario.

Por eso la entrada suele ser la mayor parte del coste, aunque su precio por token sea menor. Una pregunta corta puede viajar con miles de tokens de instrucciones y contexto.

Qué cuenta como salida

La salida es el texto que genera el modelo en su respuesta. Dos cosas hacen que se subestime con facilidad:

  • Respuestas extensas. Sin indicaciones de longitud, los modelos tienden a ser generosos. Una instrucción de formato clara puede reducir mucho la salida.
  • Tokens de razonamiento. Algunos modelos «piensan» antes de responder y generan tokens de razonamiento internos. Según el proveedor, se cobran como salida aunque no los veas en la respuesta. Comprueba cómo los informa y factura el modelo que elijas.

Funciones de precio que cambian el cálculo

Más allá de las tarifas básicas, la mayoría de proveedores ofrece mecanismos que pueden bajar o subir tus costes. Los nombres y condiciones varían, así que lee la documentación de tu proveedor.

Función Qué hace Efecto en el coste
Caché de prompts Reutiliza un inicio de prompt idéntico entre solicitudes La entrada en caché se cobra a una tarifa reducida; escribir en la caché puede costar aparte
Procesamiento por lotes Las solicitudes se procesan de forma asíncrona, no en tiempo real A menudo con descuento frente a las solicitudes estándar
Tramos por longitud de contexto Algunos modelos cobran más por encima de cierta longitud de prompt Los prompts muy largos pueden costar más por token
Llamadas a herramientas y búsqueda Búsqueda web, ejecución de código o búsqueda en archivos integradas A menudo se cobran por llamada o uso, además de los tokens
Modelos ajustados Modelos entrenados con tus datos Coste de entrenamiento más, normalmente, otros precios de uso
Capacidad prioritaria o reservada Rendimiento garantizado Gasto mayor o comprometido

La caché merece especial atención. Si muchas solicitudes comparten un prompt de sistema largo o el mismo documento de referencia, la caché puede reducir mucho el coste de entrada de esa parte común. La calculadora te permite indicar la parte de la entrada servida desde caché y un precio de caché aparte. Nuestro artículo sobre cómo reducir los costes de API de LLM explica cómo estructurar los prompts para que la caché se aplique de verdad.

Un ejemplo práctico

Estimemos un asistente de atención al cliente. Todas las cifras son supuestos ilustrativos, y los precios son valores de ejemplo, no los de ningún proveedor real.

Supuestos de uso

  • Prompt de sistema y reglas: 800 tokens
  • Pasajes recuperados del centro de ayuda: 1.200 tokens
  • Historial de conversación (media): 600 tokens
  • Mensaje del usuario: 100 tokens
  • Respuesta: 300 tokens
  • Solicitudes: 1.000 al día, 30 días al mes

Por solicitud

  • Entrada: 800 + 1.200 + 600 + 100 = 2.700 tokens
  • Salida: 300 tokens

Precios de ejemplo: 1,00 € por millón de tokens de entrada, 4,00 € por millón de tokens de salida.

  • Coste de entrada: 2.700 × 1,00 € ÷ 1.000.000 = 0,0027 €
  • Coste de salida: 300 × 4,00 € ÷ 1.000.000 = 0,0012 €
  • Coste por solicitud: 0,0039 €

Al mes: 0,0039 € × 1.000 × 30 = 117 €

Fíjate en que la entrada supone cerca del 70 % del coste aunque los tokens de salida sean cuatro veces más caros. Acortar el contexto recuperado o cachear el prompt de sistema tendría aquí más efecto que acortar las respuestas.

Ahora cambia un supuesto. Si el equipo pasa a un modelo mayor con precios de ejemplo de 5,00 € y 20,00 €, el mismo uso cuesta 585 € al mes. Con un modelo más pequeño a 0,20 € y 0,80 €, unos 23 €. Esa horquilla es típica: la elección de modelo suele ser la mayor palanca de coste, y por eso elegir el LLM adecuado es en parte una decisión de precio.

Suscripciones frente a precios de API

Mucha gente conoce la IA a través de suscripciones de chat con una cuota mensual fija por usuario. El acceso por API es distinto:

Suscripción de chat API
Facturación Cuota fija por usuario y mes Pago por token usado
Ideal para Personal que usa un asistente directamente Aplicaciones, automatizaciones, integraciones
Previsibilidad del coste Alta Depende del uso, requiere supervisión
Control sobre prompts y flujo de datos Limitado Total, dentro de las condiciones del proveedor
Límites de uso Límites de uso razonable del proveedor Límites de solicitudes y de gasto que puedes configurar

Una empresa suele usar ambos: suscripciones para el personal del conocimiento y la API para los procesos automatizados. No los compares solo por precio. Una suscripción no te permite construir un flujo de trabajo y una API no da al personal una interfaz lista para usar.

Multiplicadores ocultos que conviene prever

La fórmula es sencilla; el uso real, no. Estos factores suelen elevar el coste real por encima de la primera estimación:

  • Reintentos y errores. Los resultados fallidos o rechazados que se vuelven a generar cuestan tokens dos veces.
  • Bucles de agentes. Un agente de IA puede llamar al modelo muchas veces para completar una tarea: planificar, usar herramientas, leer resultados y revisar su trabajo. Una solicitud de usuario puede suponer diez llamadas o más. Lee agentes de IA vs. automatización de flujos para ver cómo afecta al diseño.
  • Historial creciente. En chats largos, cada turno reenvía el historial, así que el coste por mensaje crece a lo largo de la conversación.
  • Varios pasos por proceso. Un flujo que clasifica, extrae, redacta y revisa hace cuatro llamadas por documento.
  • Desarrollo y pruebas. Los experimentos con prompts y las evaluaciones cuestan dinero antes de que llegue el primer usuario real.
  • Crecimiento. Las funciones que funcionan se usan más. Presupuesta el crecimiento, no solo el piloto.

Una regla práctica: mide los tokens reales en una muestra de solicitudes de prueba en lugar de estimarlos a partir del número de palabras, y añade un margen para lo anterior.

Cómo estimar tus propios costes

  1. Reúne solicitudes de muestra. De diez a veinte ejemplos realistas de lo que enviará y recibirá la aplicación.
  2. Mide los tokens. Usa la herramienta de recuento de tu proveedor o las cifras de uso que devuelve la API. Para una primera estimación rápida, el estimador de la calculadora de coste da una cifra aproximada a partir de un texto de muestra.
  3. Calcula por solicitud. Media de tokens de entrada y salida, multiplicada por los precios actuales.
  4. Multiplica por el volumen. Solicitudes al día × días al mes. Cuenta las llamadas por acción del usuario, no solo las acciones.
  5. Compara escenarios. Prueba al menos dos modelos. La calculadora muestra tres a la vez.
  6. Añade un margen. Para reintentos, crecimiento y pruebas.
  7. Fija límites de gasto. La mayoría de proveedores permite configurar alertas de presupuesto o límites estrictos. Úsalos desde el primer día.

Errores habituales

  • Contar solo el mensaje del usuario como entrada. El prompt de sistema y el contexto suelen pesar más.
  • Usar los precios del año pasado. Los precios cambian a menudo, con frecuencia a la baja en los modelos antiguos, a veces con nuevas estructuras de precio. Consulta siempre la tarifa vigente.
  • Ignorar la longitud de la salida. Una frase en el prompt sobre la longitud deseada puede ahorrar más que cambiar de modelo.
  • Olvidar los cargos que no son tokens. Las llamadas a herramientas, el almacenamiento, el fine-tuning y la transferencia de datos pueden cobrarse aparte.
  • Optimizar el coste antes que la calidad. El modelo más barato solo lo es si sus respuestas son suficientemente buenas. Uno que necesita más reintentos o más corrección humana puede costar más en total.

Próximos pasos

Para convertir tu estimación en una decisión de negocio, combina el lado del coste con el del valor: la calculadora de ROI de la automatización con IA compara los costes recurrentes con el tiempo ahorrado. Si la estimación es mayor de lo que esperabas, continúa con las doce tácticas de cómo reducir los costes de API de LLM.

Preguntas frecuentes

¿Cómo se factura el uso de una API de LLM?

La mayoría de proveedores cobra por token, con precios distintos para los tokens de entrada (lo que envías) y los de salida (lo que genera el modelo), normalmente expresados por millón de tokens. Algunas funciones, como la caché, el procesamiento por lotes o el uso de herramientas, tienen tarifas propias.

¿Por qué la salida cuesta más que la entrada?

Generar tokens uno a uno requiere más cálculo que procesar la entrada, por eso los proveedores suelen cobrar más por la salida. Las respuestas largas pueden dominar la factura.

¿Qué encarece una aplicación de LLM más de lo previsto?

Normalmente la entrada: los prompts de sistema largos, el historial de conversación y los documentos recuperados se reenvían en cada solicitud. Los reintentos, los bucles de agentes y los tokens de razonamiento ocultos también pueden multiplicar los costes.

¿Cómo estimo el coste mensual de una API de LLM?

Multiplica la media de tokens de entrada y salida por solicitud por sus precios y después por el número de solicitudes al mes. Mide los tokens con solicitudes reales de muestra y añade un margen para el crecimiento y los reintentos.

Artículos relacionados

Costes y ROI9 min de lectura

Cómo reducir los costes de API de LLM: 12 tácticas

Doce formas prácticas de reducir los costes de API de LLM sin perder calidad: enrutado de modelos, caché de prompts, menos contexto, límites de salida, lotes.

Costes y ROI9 min de lectura

Cómo calcular el ROI de la automatización con IA

Método paso a paso para calcular el ROI de la automatización con IA: tiempo ahorrado, revisión, costes recurrentes e iniciales y recuperación, con un ejemplo.

← Volver al blog