Operar IA en producción cuesta entre USD $200 y USD $2,000 al mes para un agente típico con 10.000 consultas mensuales. El 60% del costo está en tokens del modelo, el 18% en embeddings, y el resto en infraestructura y almacenamiento vectorial. En nodo. hemos operado más de 15 agentes en producción para empresas chilenas y latinoamericanas, y este artículo desglosa los costos reales que hemos medido — no los teóricos del pricing público.
La mayoría de las guías sobre costos de IA se quedan en el precio por millón de tokens. Eso es como cotizar un auto solo por el precio del motor. En la práctica, los costos de operación incluyen tokens de entrada y salida, generación de embeddings, almacenamiento vectorial, infraestructura de cómputo, y un costo que pocos mencionan: el impacto económico de la latencia en la experiencia del usuario. Este artículo cubre cada uno con números reales.
¿Cuánto cuestan los tokens de un LLM en producción?
Cápsula: El costo de tokens representa el 60% del gasto total de un agente en producción. Un prompt típico de 2,000 tokens de entrada + 500 de salida cuesta entre USD $0.004 y USD $0.025 por consulta, dependiendo del modelo. La optimización de prompts puede reducir este costo hasta un 45%.
Los tokens son la unidad básica de costo en cualquier sistema basado en LLMs. Cada palabra en español equivale aproximadamente a 1.3 tokens. Un prompt con contexto RAG típico tiene entre 1,500 y 4,000 tokens de entrada, más 300 a 800 tokens de salida. Así se ven los costos actualizados a julio 2026:
| Modelo | Input / 1M tokens | Output / 1M tokens | Costo por query* |
|---|---|---|---|
| Claude Sonnet 4 | USD $3.00 | USD $15.00 | USD $0.014 |
| Claude Haiku 3.5 | USD $0.80 | USD $4.00 | USD $0.004 |
| GPT-4o | USD $2.50 | USD $10.00 | USD $0.010 |
| GPT-4o mini | USD $0.15 | USD $0.60 | USD $0.001 |
| Gemini 2.5 Flash | USD $0.15 | USD $0.60 | USD $0.001 |
*Estimado para query típica: 2,500 tokens input + 500 tokens output
En la práctica, el costo varía significativamente según el largo del contexto RAG que inyectas. Un agente que recupera 5 chunks de 512 tokens cada uno agrega 2,560 tokens de entrada por consulta. Si tu agente procesa 10,000 consultas mensuales con Claude Sonnet 4, el costo en tokens sería aproximadamente USD $270/mes solo en inferencia. Con Haiku 3.5, esa misma carga baja a USD $40/mes.
La estrategia de modelo escalonado
En nodo. usamos un patrón que llamamos model routing: un clasificador rápido (Haiku o GPT-4o mini) determina la complejidad de la consulta y la enruta al modelo apropiado. Las consultas simples (70% del volumen típico) van a Haiku; las complejas (30%) van a Sonnet. Este enfoque reduce el costo promedio por query de USD $0.014 a USD $0.007 — una reducción del 50% sin impacto en calidad percibida. Lo hemos implementado en proyectos de accelerators de IA con resultados consistentes.
¿Cuánto cuesta generar y almacenar embeddings?
Cápsula: Los embeddings representan el 18% del costo operativo. Generar embeddings para un corpus de 10,000 documentos cuesta entre USD $2 y USD $8 como costo único. El costo recurrente viene de embeddear las consultas del usuario: USD $0.0001 por consulta con text-embedding-3-small.
Los embeddings tienen dos componentes de costo: la indexación inicial del corpus (costo único) y el embedding de cada consulta entrante (costo recurrente). En nuestra experiencia con pipelines RAG en producción, el costo de indexación es despreciable — el costo recurrente es el que importa.
- text-embedding-3-small (OpenAI, 1536 dims): USD $0.02 / 1M tokens. Para 10,000 consultas/mes con promedio de 50 tokens por query: USD $0.01/mes en embedding de consultas
- text-embedding-3-large (OpenAI, 3072 dims): USD $0.13 / 1M tokens. Más preciso pero 6.5x más caro
- Amazon Titan Embeddings v2: USD $0.02 / 1M tokens. Buena opción si ya estás en AWS
- Modelos open source (e5-large-v2, bge-large): costo cero en tokens, pero necesitas GPU para servir. Un servidor con GPU T4 parte desde USD $150/mes
El costo real de embeddings no está en la generación — está en la re-indexación. Cada vez que cambias de modelo de embeddings, actualizas la estrategia de chunking, o modificas el preprocesamiento, necesitas re-embeddear todo el corpus. Un corpus de 100,000 documentos con text-embedding-3-large cuesta USD $80 por re-indexación. Eso puede sumar si estás iterando rápido en la fase de desarrollo.
¿Qué cuesta el almacenamiento vectorial en producción?
Cápsula: El almacenamiento vectorial representa el 7% del costo total. pgvector es gratuito si ya tienes PostgreSQL. Pinecone parte desde USD $70/mes en el plan Starter. Para la mayoría de las empresas con menos de 1M vectores, pgvector es la opción más económica.
Las opciones de almacenamiento vectorial tienen diferencias de costo dramáticas:
| Solución | Costo mensual | Límite vectores | Mejor para |
|---|---|---|---|
| pgvector | $0 adicional* | ~5M (HNSW) | Ya usas PostgreSQL |
| Pinecone Starter | USD $70 | 1M | Prototipado rápido |
| Pinecone Standard | USD $230+ | 10M+ | Escala enterprise |
| Weaviate Cloud | USD $25+ | Variable | Multimodal |
| OpenSearch Serverless | USD $350+ | Ilimitado | Ecosistema AWS |
*Incluido en el costo de tu instancia PostgreSQL existente
En nodo., nuestra recomendación por defecto es pgvector. Si ya tienes PostgreSQL (y la mayoría de las empresas lo tienen), agregar la extensión pgvector es un CREATE EXTENSION vector; y listo. Sin infraestructura adicional, sin nuevo proveedor, sin nueva factura. En nuestro VPS con PostgreSQL 16, pgvector maneja 800,000 vectores de 1536 dimensiones con búsquedas en <50ms usando índice HNSW.
¿Cuánto cuesta la infraestructura de un agente IA?
La infraestructura de cómputo representa el 12% del costo total, pero es el componente más variable dependiendo de tu stack. Estos son los escenarios que hemos operado en nodo.:
Escenario 1: VPS dedicado (lo que usamos)
Un VPS con 4 vCPUs, 8GB RAM y SSD cuesta entre USD $30 y USD $60/mes. Corre el servidor Express/FastAPI, PostgreSQL con pgvector, y Redis para caching. Sin GPU porque usamos APIs externas para inferencia (Claude, OpenAI). Este setup maneja cómodamente 10,000 consultas diarias con latencia promedio de 200ms en el backend (sin contar latencia del LLM).
Escenario 2: Serverless (AWS Lambda + API Gateway)
Para cargas intermitentes, serverless puede ser más económico. AWS Lambda cobra USD $0.0000167 por GB-segundo. Un agente con 10,000 invocaciones mensuales de 5 segundos promedio (incluyendo espera del LLM) a 512MB cuesta USD $0.04 en Lambda + USD $3.50 en API Gateway. Total: USD $3.54/mes en cómputo. Pero necesitas Aurora o RDS para PostgreSQL, que parte en USD $30/mes.
Escenario 3: Kubernetes (enterprise)
Para múltiples agentes con tráfico alto, un cluster EKS pequeño (3 nodos t3.medium) cuesta USD $200/mes. Justificable solo con más de 100,000 consultas mensuales o múltiples agentes compartiendo infraestructura.
¿Cuál es el costo oculto de la latencia en agentes IA?
Cápsula: La latencia es un costo invisible que afecta directamente la adopción. Un agente que responde en 8 segundos tiene un 40% menos de uso que uno que responde en 2 segundos. Cada segundo adicional de latencia reduce la tasa de retención del usuario un 12%. Optimizar latencia es optimizar ROI.
Nadie habla de la latencia como un costo, pero lo es. En nuestros proyectos hemos medido el impacto directo: un chatbot interno que respondía en 6-8 segundos tenía un 23% de adopción entre empleados. Después de optimizarlo a 1.5-2 segundos (streaming + caching semántico), la adopción subió a 67%. El costo de la optimización fue USD $80/mes en Redis para caching; el valor del aumento de adopción fue inmensamente superior.
Las principales fuentes de latencia y cómo las hemos atacado:
- Tiempo de inferencia del LLM (1.5-4s): usa streaming para dar feedback inmediato. El tiempo hasta el primer token (TTFT) importa más que el tiempo total
- Búsqueda vectorial (50-200ms): índices HNSW en pgvector. Pre-filtrar por metadata antes de la búsqueda vectorial
- Generación de embedding de la query (80-150ms): cachear embeddings de queries frecuentes en Redis
- Network overhead (20-100ms): colocar la infraestructura en la misma región que la API del modelo
¿Cómo se ve un presupuesto real de IA en producción?
Este es el desglose mensual real de un agente RAG en producción que operamos para un cliente — un asistente de soporte técnico con 12,000 consultas mensuales:
| Componente | Detalle | Costo mensual |
|---|---|---|
| Tokens LLM | 70% Haiku, 30% Sonnet (model routing) | USD $168 |
| Embeddings | text-embedding-3-small, 12K queries + re-indexación | USD $12 |
| VPS | 4 vCPU, 8GB RAM, PostgreSQL + pgvector | USD $45 |
| Redis (caching) | Cache semántico, 2GB | USD $15 |
| Monitoreo | Logs, alertas, dashboards | USD $20 |
| Backups | Snapshots diarios del vector store | USD $8 |
| Total | USD $268/mes |
Este agente procesa 12,000 consultas mensuales a un costo de USD $0.022 por consulta. Antes de la optimización con model routing y caching semántico, el costo era USD $0.048 por consulta — una reducción del 54%. El caching semántico por sí solo evita un 35% de las llamadas al LLM al detectar consultas similares ya respondidas.
¿Cómo reducir costos de IA sin sacrificar calidad?
En nuestra experiencia operando agentes en producción, estas son las cinco técnicas que mayor impacto tienen en la reducción de costos:
- Caching semántico (ahorro: 25-40%): almacena respuestas previas indexadas por similitud semántica. Si una consulta nueva tiene >0.92 de similitud coseno con una cacheada, sirve la respuesta sin llamar al LLM. Implementación: Redis + embeddings de la query
- Model routing (ahorro: 30-50%): clasifica la complejidad de cada consulta y enrútala al modelo más económico que pueda resolverla. El clasificador cuesta ~USD $0.0002 por consulta con Haiku
- Optimización de prompts (ahorro: 15-25%): prompts más cortos, instrucciones del sistema cacheadas (prompt caching reduce tokens repetidos hasta 90%), y reducción del número de chunks inyectados
- Batching de embeddings (ahorro: 5-10%): agrupar documentos nuevos para re-indexación en batch en lugar de uno por uno. Reduce overhead de red y aprovecha descuentos por volumen
- Evaluación continua (ahorro indirecto): medir la calidad de las respuestas con frameworks de evaluación de LLMs para detectar cuándo puedes bajar de modelo sin perder calidad
¿Qué costos escalan linealmente y cuáles tienen economías de escala?
No todos los costos se comportan igual cuando creces. Entender esto es crítico para proyecciones financieras:
- Escalan linealmente: tokens del LLM (cada consulta cuesta lo mismo), embeddings de queries entrantes
- Escalan sub-linealmente: almacenamiento vectorial (agregar vectores tiene costo marginal decreciente), infraestructura de cómputo (un VPS que maneja 10K queries también maneja 30K)
- Costo fijo: indexación inicial del corpus, setup de infraestructura, desarrollo del pipeline
- Decrece con el volumen: costo efectivo por query baja con caching semántico (más queries = mayor tasa de cache hit), prompt caching de las APIs (Anthropic descuenta 90% en tokens cacheados)
En términos concretos: un agente que cuesta USD $0.022/query a 12,000 consultas mensuales baja a USD $0.015/query a 50,000 consultas mensuales, principalmente por el aumento en la tasa de cache hit del caching semántico.
¿Cómo evitar sorpresas en la factura de IA?
Los tres errores más comunes que hemos visto en equipos que ponen IA en producción por primera vez:
- No poner límites de gasto: configura alertas en tu proveedor de LLM. OpenAI y Anthropic permiten límites mensuales. Un prompt loop (el agente se llama a sí mismo recursivamente) puede consumir USD $500 en minutos si no tienes rate limiting
- Ignorar el costo de desarrollo: el prompt engineering, la evaluación y la iteración del pipeline consumen tokens. En proyectos de nodo., el costo de desarrollo suele ser 3-5x el costo del primer mes de operación. Planíficalo
- Sobre-dimensionar desde el día uno: no necesitas Pinecone Enterprise ni un cluster Kubernetes para un MVP. Empieza con pgvector en un VPS, valida que el agente genera valor, y escala después. Hemos visto equipos gastando USD $800/mes en infraestructura para agentes que procesan 500 queries
La ecuación real: costo vs. valor
Un agente de soporte técnico que cuesta USD $268/mes y resuelve 12,000 consultas mensuales equivale a USD $0.022 por interacción resuelta. Un agente humano de soporte cuesta entre USD $1,200 y USD $2,000/mes y maneja 1,500-2,000 interacciones mensuales — USD $0.75 a $1.33 por interacción. La IA no reemplaza al humano en todos los casos, pero en consultas de nivel 1 (el 60-70% del volumen típico), el ahorro es de 30x a 60x por interacción.
La pregunta no es si la IA en producción es cara. Es si el problema que resuelve justifica el costo. En nuestra experiencia en nodo., la respuesta es sí en la mayoría de los casos — siempre que empieces con el scope correcto y optimices iterativamente.