
La Inteligencia Artificial puede parecer barata cuando se prueba con pocos mensajes, pero puede volverse costosa cuando entra a producción. Un chatbot interno, un agente que consulta documentos, un sistema de generación de reportes, un asistente de programación o una API con miles de usuarios puede multiplicar rápidamente el consumo de tokens, llamadas a modelos, GPU, almacenamiento, embeddings, búsquedas y monitoreo.
El problema no es usar IA. El problema es usarla sin medición. Las plataformas de IA suelen cobrar por tokens de entrada, tokens de salida, tokens en caché, llamadas a herramientas, procesamiento por lotes o recursos adicionales. OpenAI, Anthropic y Google Gemini publican tablas de precios que separan entrada, salida, caché, procesamiento batch u otros conceptos, lo que confirma que el costo real depende del patrón de uso y no solo del modelo elegido.
Idea central: controlar el costo de la IA exige medir cada llamada, saber cuántos tokens entran y salen, elegir el modelo correcto para cada tarea, usar caché, limitar respuestas, optimizar prompts, evaluar modelos locales y monitorear GPU, latencia y consumo por usuario o aplicación.
1. El primer error: pensar que la IA cuesta “por pregunta”
Muchas personas creen que una consulta de IA cuesta lo mismo sin importar el tamaño del texto. No es así. En la mayoría de servicios LLM, el cobro depende de tokens. Un token puede ser una palabra corta, parte de una palabra, un signo, un fragmento de código o una unidad interna del modelo. Por eso, una pregunta breve con una respuesta larga puede costar más que una pregunta compleja con una respuesta corta.
Además, las aplicaciones modernas no envían solo la pregunta del usuario. También envían instrucciones del sistema, historial de conversación, documentos recuperados por RAG, ejemplos, herramientas disponibles, metadatos, contexto de seguridad y datos internos. Todo eso entra en la factura.
| Componente | Cómo impacta el costo |
|---|---|
| Prompt del usuario | Mientras más largo, más tokens de entrada. |
| Instrucciones del sistema | Se envían en cada llamada si no se usa caché o arquitectura eficiente. |
| Historial de conversación | Puede crecer sin control y duplicar o triplicar el gasto. |
| Documentos RAG | Enviar demasiados fragmentos aumenta tokens de entrada y latencia. |
| Respuesta del modelo | Los tokens de salida suelen ser más caros que los de entrada en muchos proveedores. |
2. Fórmula básica para calcular el costo de una llamada
La fórmula más simple es:
Esta fórmula debe calcularse por modelo, usuario, aplicación, endpoint, caso de uso y ambiente. No sirve mirar solo el total mensual. Una empresa necesita saber qué proceso consume más: soporte al cliente, generación de informes, agentes internos, análisis documental, búsqueda semántica o automatización de código.
Regla práctica: no midas solo “cuánto gasté en IA este mes”. Mide “cuánto cuesta cada tarea útil”: responder un ticket, resumir un documento, analizar una convocatoria, clasificar un correo, generar un reporte o atender a un usuario.
3. Los cuatro grandes costos de ejecutar IA
El gasto de IA no está en un solo lugar. Un sistema real puede combinar API de modelos, GPU propia, bases vectoriales, almacenamiento de documentos, monitoreo, logs, procesamiento batch, caché y herramientas externas.
| Costo | Ejemplo | Cómo reducirlo |
|---|---|---|
| Tokens | Prompt, historial, documentos y respuesta. | Limitar contexto, resumir, cachear, usar modelos pequeños. |
| GPU | Inferencia local, vLLM, Ollama, modelos de visión o embeddings. | Batching, cuantización, autoscaling, apagar recursos ociosos. |
| Herramientas | Búsqueda web, ejecución de código, lectura de archivos, agentes. | Usar solo cuando sea necesario y registrar cada llamada. |
| Operación | Monitoreo, logs, almacenamiento, red, vector DB, backups. | Retención controlada, compresión, políticas de ciclo de vida. |
4. Tokens de entrada: el gasto invisible
Los tokens de entrada son todo lo que envías al modelo. En aplicaciones con RAG, asistentes empresariales o agentes, el usuario puede escribir una pregunta de una línea, pero el sistema puede enviar veinte páginas de contexto sin que nadie lo note. Ese es uno de los principales motivos de facturas inesperadas.
Para reducir tokens de entrada, no envíes todo el documento. Recupera solo fragmentos relevantes, elimina texto repetido, resume conversaciones largas, corta metadatos innecesarios, usa plantillas breves y cachea instrucciones estáticas. Las páginas oficiales de precios de proveedores muestran que los tokens de entrada, salida, caché y procesamiento batch pueden tener tarifas distintas, por lo que optimizar cada categoría importa.
Cómo reducir tokens de entrada
- Recorta el historial: conserva solo lo necesario para la tarea actual.
- Resume conversaciones largas: convierte 20 turnos en una memoria breve.
- Filtra documentos: usa búsqueda semántica y envía pocos fragmentos relevantes.
- Elimina HTML basura: menús, pies, scripts, estilos y publicidad aumentan tokens.
- Usa caché de prompt: útil cuando instrucciones o documentos se repiten.
- Divide tareas: no uses un modelo grande para todo el flujo.
5. Tokens de salida: la respuesta larga también cuesta
Los tokens de salida son los que genera el modelo. En muchos proveedores suelen tener un precio mayor que los tokens de entrada. Esto obliga a controlar respuestas largas, especialmente cuando se generan reportes, artículos, análisis legales, código o explicaciones extensas.
La solución no es pedir siempre respuestas cortas, sino definir longitud por caso de uso. Un resumen ejecutivo puede tener 200 palabras; un informe técnico puede requerir 2.000; una clasificación puede devolver solo JSON. Cada tarea debe tener un límite razonable de salida.
6. El costo oculto de los agentes de IA
Los agentes pueden ser mucho más caros que una llamada simple porque realizan ciclos: razonan, llaman herramientas, leen archivos, consultan bases, hacen búsquedas, generan código, verifican resultados y vuelven a intentarlo. Google Gemini advierte en su documentación de precios que la inferencia de agentes administrados se cobra según las tarifas estándar del modelo, incluyendo tokens de entrada, salida y tokens intermedios o de razonamiento generados durante los bucles del agente.
Por eso, una pregunta aparentemente sencilla puede convertirse en 5, 10 o 30 llamadas internas. Si no hay límites, un agente puede consumir más presupuesto investigando que resolviendo.
| Riesgo | Control recomendado |
|---|---|
| Demasiadas llamadas a herramientas. | Límite de pasos por tarea y aprobación para acciones caras. |
| Búsquedas repetidas. | Caché de resultados y deduplicación de consultas. |
| Contexto creciente. | Memoria resumida y límites de historial. |
| Uso de modelo grande para todo. | Enrutamiento por dificultad: pequeño, mediano, grande. |
7. Modelos locales: cuándo convienen y cuándo no
Ejecutar modelos locales puede reducir dependencia de proveedores externos y mejorar privacidad, pero no siempre reduce costos. El costo pasa de tokens API a hardware, GPU, electricidad, administración, actualizaciones, monitoreo, rendimiento, seguridad y personal técnico.
Ollama permite ejecutar modelos localmente y ofrece integración mediante API; su documentación indica que puede correr modelos en macOS, Windows o Linux, y su FAQ señala que, al ejecutar localmente, Ollama no ve los prompts ni datos del usuario. Para producción de alto rendimiento, vLLM se presenta como un motor open source de inferencia y serving con alto throughput, API compatible con OpenAI y soporte para una amplia gama de modelos open source.
Cuándo conviene modelo local
- Alto volumen repetitivo: muchas llamadas similares todos los días.
- Privacidad fuerte: datos sensibles que no deben salir de la organización.
- Latencia controlada: necesidad de respuesta local o sin Internet.
- Casos simples: clasificación, extracción, resumen corto, búsqueda interna.
- Equipo técnico disponible: Linux, GPU, monitoreo, seguridad y MLOps.
Cuidado: un modelo local no es gratis. Si la GPU está ociosa 80% del tiempo, si el equipo técnico debe mantenerlo manualmente o si el modelo responde peor y exige más reintentos, puede terminar costando más que una API.
8. GPU: el costo que más se subestima
Cuando una empresa ejecuta IA local o en nube, la GPU se convierte en el principal costo operativo. No basta saber cuántas GPUs tienes. Hay que saber utilización, memoria, temperatura, consumo, colas, latencia, throughput, tokens por segundo y tiempo ocioso.
NVIDIA DCGM Exporter permite exponer métricas de GPU para Prometheus; la guía de observabilidad de NVIDIA indica que GPU Operator puede desplegar DCGM Exporter junto con drivers y plugins de Kubernetes para monitorear GPUs en entornos Kubernetes.
| Métrica GPU | Por qué importa |
|---|---|
| Utilización GPU | GPU ociosa significa dinero inmovilizado. |
| VRAM usada | Define qué tamaño de modelo puede ejecutarse. |
| Tokens por segundo | Mide productividad real del servidor de inferencia. |
| Latencia p50/p95/p99 | Ayuda a decidir escalamiento y calidad del servicio. |
| Cola de solicitudes | Permite saber si falta capacidad o si el modelo es demasiado pesado. |
9. Herramientas open source para controlar costos
Una estrategia seria necesita observabilidad. Debes registrar modelo, proveedor, usuario, aplicación, tokens de entrada, tokens de salida, latencia, error, costo estimado, prompt, versión del prompt, documentos usados y resultado.
Langfuse es una plataforma open source de observabilidad para aplicaciones LLM. Su documentación indica que puede rastrear uso y costo de cada llamada LLM, desglosar gasto por modelo, caso de uso y tiempo, y también soporta modelos personalizados si se proporcionan precios o uso.
| Herramienta | Uso principal |
|---|---|
| Langfuse | Observabilidad LLM, trazas, tokens, costos, usuarios, prompts y evaluaciones. |
| vLLM | Serving de modelos open source con alto rendimiento y API compatible con OpenAI. |
| Ollama | Ejecución local sencilla de modelos en Linux, macOS y Windows. |
| Prometheus + Grafana | Métricas de infraestructura, GPU, servicios, latencia y consumo. |
| NVIDIA DCGM Exporter | Métricas de GPU para monitoreo en Prometheus. |
10. Estrategias concretas para reducir costos de IA
Plan de optimización
- Medir todo: ninguna llamada LLM debe ejecutarse sin logging de tokens y costo.
- Elegir modelo por tarea: no usar el modelo más potente para clasificación simple.
- Limitar salida: respuestas estructuradas, JSON, tablas breves o resúmenes.
- Usar caché: instrucciones, documentos y respuestas repetidas.
- Reducir RAG: enviar 3 fragmentos buenos es mejor que 20 mediocres.
- Procesar en batch: tareas no urgentes pueden ejecutarse por lotes si el proveedor ofrece ahorro.
- Usar modelos locales selectivamente: clasificación, extracción y tareas repetitivas.
- Cuantizar modelos: menor VRAM y menor costo por inferencia, aceptando posible pérdida de calidad.
- Apagar GPU ociosa: autoscaling y horarios de operación.
- Asignar presupuesto por equipo: cada área debe ver su consumo real.
11. Arquitectura recomendada para IA con control de costos
Una arquitectura madura no conecta la aplicación directamente al proveedor sin control. Debe existir una capa intermedia para observabilidad, límites, enrutamiento, caché, seguridad y auditoría.
12. Cuándo usar API y cuándo usar modelos locales
| Caso | API externa | Modelo local |
|---|---|---|
| Prototipo rápido. | Muy conveniente. | Puede ser más lento de implementar. |
| Datos sensibles. | Requiere contrato, privacidad y control legal. | Mejor control si se administra correctamente. |
| Alta calidad general. | Suele ser mejor para tareas complejas. | Depende del modelo, hardware y ajuste. |
| Volumen masivo repetitivo. | Puede volverse caro. | Puede convenir si la GPU se usa bien. |
| Equipo técnico limitado. | Más simple de operar. | Riesgo de mala administración. |
13. RAG barato: no conviertas tu base documental en una factura gigante
Los sistemas RAG pueden ahorrar costos si evitan enviar documentos completos. Pero también pueden elevar el gasto si recuperan demasiados fragmentos, duplican contenido, incluyen HTML basura o envían contexto irrelevante. La clave es mejorar recuperación antes de aumentar tokens.
Buenas prácticas para RAG económico
- Chunking razonable: fragmentos ni demasiado pequeños ni demasiado extensos.
- Top-k limitado: comenzar con 3 a 5 fragmentos relevantes.
- Reranking: ordenar mejor antes de enviar al LLM.
- Compresión contextual: resumir fragmentos largos antes de enviarlos.
- Deduplicación: evitar enviar párrafos repetidos.
- Respuesta con citas: obliga al modelo a usar solo evidencia enviada.
14. Presupuesto, alertas y límites: la parte que todos olvidan
La IA necesita controles financieros como cualquier servicio cloud. Debes establecer límites por usuario, por aplicación, por equipo, por día y por mes. También conviene bloquear tareas caras si no tienen aprobación o si superan umbrales de seguridad.
Alertas obligatorias
- Gasto diario supera 50%, 80% o 100% del presupuesto esperado.
- Un usuario consume más de lo normal.
- Un endpoint dispara demasiadas llamadas.
- El promedio de tokens por solicitud se duplica.
- La latencia sube y genera reintentos caros.
- Un agente usa herramientas repetidamente sin resolver la tarea.
- Una GPU está activa pero con baja utilización.
15. Indicadores que debes revisar cada semana
| Indicador | Pregunta que responde |
|---|---|
| Costo por usuario | ¿Quién consume más IA? |
| Costo por tarea | ¿Cuánto cuesta resolver un caso real? |
| Tokens promedio por solicitud | ¿El prompt está creciendo sin control? |
| Porcentaje de caché | ¿Estamos reutilizando contexto repetido? |
| Calidad por modelo | ¿Un modelo barato resuelve igual que uno caro? |
| Utilización GPU | ¿Estamos pagando hardware ocioso? |
16. Errores comunes que disparan el costo de la IA
- Usar el modelo más caro para todas las tareas.
- Enviar todo el historial de conversación en cada solicitud.
- Meter documentos completos en el prompt sin filtrar.
- No limitar tokens de salida.
- Permitir agentes sin límite de pasos.
- No cachear instrucciones ni respuestas repetidas.
- No registrar costo por usuario, aplicación o endpoint.
- Tener GPUs encendidas sin carga real.
- No medir calidad antes de cambiar a un modelo más barato.
- No revisar facturas hasta fin de mes.
17. Preguntas clave
¿Qué es lo que más encarece una aplicación de IA?
Normalmente, el exceso de tokens de entrada, respuestas largas, agentes con muchos pasos, modelos sobredimensionados y falta de caché. En modelos locales, el costo principal suele ser GPU ociosa, mala utilización y operación técnica.
¿Conviene más usar API o modelo local?
Depende del volumen, privacidad, calidad requerida y capacidad técnica. API suele ser mejor para empezar rápido; modelo local puede convenir en tareas repetitivas, sensibles o de alto volumen, siempre que la GPU tenga buena utilización.
¿Ollama sirve para empresas?
Sirve para pruebas, laboratorios, prototipos y ciertos despliegues locales. Ollama permite ejecutar modelos localmente e integrarlos mediante API, pero una empresa debe complementar con seguridad, monitoreo, control de acceso, backup, actualización y gobierno.
¿vLLM ayuda a reducir costos?
Puede ayudar cuando se necesita servir modelos open source con alto rendimiento y mejor aprovechamiento de GPU. vLLM ofrece serving con alto throughput y API compatible con OpenAI, lo que facilita integrarlo en arquitecturas existentes.
¿Qué herramienta open source permite controlar tokens y costo?
Langfuse es una opción sólida para observabilidad LLM. Permite rastrear tokens, costo, modelo, usuario, caso de uso, trazas y evolución del gasto en el tiempo.
Recomendamos
- Cómo usar IA para administrar Linux: comandos, diagnóstico, automatización y seguridad con asistentes inteligentes
- Google libera un nuevo framework open source para impedir que agentes de IA introduzcan fallos de seguridad en el código
- Cómo usar Inteligencia Artificial para detectar vulnerabilidades en código Python, JavaScript, Java y C/C++
- Linux para principiantes: 25 tareas prácticas que debes dominar para pasar de usuario básico a profesional
- Por qué los servidores usan Linux: ventajas para empresas y administradores TI
En resumen
Controlar cuánto cuesta ejecutar Inteligencia Artificial no se logra eligiendo simplemente el modelo más barato. Se logra entendiendo el costo completo: tokens de entrada, tokens de salida, agentes, herramientas, embeddings, RAG, GPU, latencia, calidad, observabilidad y operación.
Las empresas deben medir cada llamada, asignar costos por usuario y aplicación, usar modelos pequeños cuando sea suficiente, limitar salidas, cachear contexto repetido, evaluar modelos locales y monitorear GPUs. La IA rentable no es la que responde más bonito, sino la que entrega valor medible a un costo controlado.
Conclusión editorial
Desde SomosLibres.org, indicamos que la próxima etapa de la IA empresarial será menos espectacular y más disciplinada: FinOps para IA. Quienes controlen tokens, GPU, modelos locales, observabilidad y calidad podrán escalar sin sorpresas. Quienes no midan, descubrirán demasiado tarde que la inteligencia artificial no falló por técnica, sino por costos invisibles.

