El costo de una función de IA: tokens, caching y el modelo correcto para cada tarea
Lo que de verdad cuesta una función de IA es un número por unidad de valor: por lección, por respuesta, por documento. Cómo estimarlo, lograr primero la calidad y después bajar el costo con el modelo adecuado por tarea, caching y procesamiento por lotes.
“¿Cuánto nos va a costar la IA?” se suele preguntar como una factura mensual. La pregunta útil es más concreta: ¿cuánto cuesta una unidad de valor? Una lección escrita, una pregunta respondida, un documento procesado. Cuando conoces ese número, puedes decidir si la función se paga sola y puedes ver qué lo mueve.
Si lideras el equipo: qué preguntar
- ¿Cuánto nos cuesta una unidad de valor: una respuesta, un documento, una lección?
- ¿Elegimos el modelo primero por la calidad que necesitamos, y solo después miramos el precio?
- ¿Hay una alerta que detecte un salto repentino en el costo de una función con IA antes de que llegue la factura?
Estima por unidad, no por mes
Los modelos cobran por tokens, los pedazos de texto que leen y escriben, y los tokens de salida suelen costar más que los de entrada. Para una unidad de valor, suma:
- Entrada: las instrucciones, el contexto que envías (documentos, historial, ejemplos) y la solicitud en sí.
- Salida: lo que el modelo escribe de vuelta, incluido lo que terminas descartando.
- Llamadas: cuántas llamadas al modelo necesita una unidad. Una función que planifica, escribe y luego revisa hace tres llamadas, no una.
- Reintentos: la proporción de llamadas que no pasan la validación y se repiten.
Aplica el precio de lista del modelo y tienes un costo por unidad. Multiplícalo por el volumen que esperas y tienes un presupuesto. Mídelo con una muestra de entradas reales, no con una suposición: el tamaño del contexto varía mucho más de lo que la gente cree.
Primero la calidad, después el costo
El modelo más barato es tentador, y es el lugar equivocado para empezar. Una respuesta barata y equivocada cuesta más que una cara y correcta, porque alguien tiene que detectarla, corregirla o vivir con ella.
SuperEscuela, una plataforma de aprendizaje gratuita para niños, es un buen ejemplo. Sus lecciones se generaron primero con el modelo más pequeño. Después de revisar el resultado contra lo que necesitan los niños (correcto, claro, a su nivel), la generación pasó a un modelo de mayor calidad. Con ese modelo, una lección cuesta unos 2–4 centavos de dólar en IA: las lecciones de toda una escuela por aproximadamente entre 60 y 130 dólares. El ahorro del modelo pequeño nunca valió la calidad que sacrificaba.
Así que el orden es: define cómo se ve un buen resultado, encuentra el modelo que lo alcanza y solo entonces trabaja en el precio.
Lleva cada tarea al tamaño de modelo correcto
Una función suele ser varias tareas de dificultad muy distinta. Clasificar una solicitud, extraer campos o revisar un formato son trabajos que un modelo pequeño y rápido muchas veces hace bien. Planificar, escribir para un público exigente o razonar sobre documentos largos puede requerir uno más grande. Y algunos pasos no necesitan modelo: el flujo de contenido de SuperEscuela usa IA en solo dos de sus cuatro etapas, y las otras dos son código simple, que no cuesta nada por ejecución y se comporta igual cada vez.
Prueba cada tarea por separado y dale a cada una el modelo más pequeño que cumpla su estándar.
Deja de pagar dos veces por lo mismo
- Usa caching para el contexto repetido. Si cada llamada envía las mismas instrucciones largas, los mismos ejemplos o el mismo documento de referencia, ponlos al principio y usa el prompt caching del proveedor. La entrada en caché se cobra a una fracción del precio normal.
- Procesa por lotes lo que no es urgente. La generación de contenido, el enriquecimiento nocturno y las cargas históricas pueden ir por APIs de lotes, que los proveedores ofrecen con descuento a cambio de una entrega más lenta.
- Recorta el contexto. Envía los tres párrafos relevantes, no el manual completo; los últimos turnos, no toda la conversación. Un contexto más pequeño es más barato y muchas veces más preciso.
- Limita la salida. Pide una salida estructurada con solo los campos que necesitas. Las respuestas largas y conversadas se pagan en los tokens más caros.
Dale seguimiento como a cualquier otro costo
Registra tokens y costo en cada llamada, etiquetados por función y por unidad: esta lección, este ticket, este cliente. Así puedes responder cuánto cuesta cada función, cuál está creciendo y si un cambio en el prompt abarató o encareció las cosas.
Configura alertas de presupuesto por función y por día, para que un ciclo que reintenta sin fin o un prompt que de pronto duplica su tamaño se detecte en horas, no en la factura. Y revisa los números cuando sale un modelo nuevo: el modelo correcto para una tarea hoy puede no serlo en seis meses, en cualquiera de las dos direcciones.
La versión corta
Ponle precio a la unidad de valor. Alcanza primero el estándar de calidad. Después elige el modelo por tarea, usa caching, procesa por lotes, recorta, y mira el costo por función todos los días.
Mira cómo funcionó esto en todo un plan de estudios en el caso de estudio de SuperEscuela.
Este artículo se basa en un proyecto real. Datos del cliente reservados; cada cifra proviene de los datos del propio cliente.
Leer el caso de estudio completo →