Operar IA en producción cuesta entre USD $200 y USD $2,000 al mes para un agente típico con 10.000 consultas mensuales. El 60% del costo está en tokens del modelo, el 18% en embeddings, y el resto en infraestructura y almacenamiento vectorial. En nodo. hemos operado más de 15 agentes en producción para empresas chilenas y latinoamericanas, y este artículo desglosa los costos reales que hemos medido — no los teóricos del pricing público.

La mayoría de las guías sobre costos de IA se quedan en el precio por millón de tokens. Eso es como cotizar un auto solo por el precio del motor. En la práctica, los costos de operación incluyen tokens de entrada y salida, generación de embeddings, almacenamiento vectorial, infraestructura de cómputo, y un costo que pocos mencionan: el impacto económico de la latencia en la experiencia del usuario. Este artículo cubre cada uno con números reales.

¿Cuánto cuestan los tokens de un LLM en producción?

Cápsula: El costo de tokens representa el 60% del gasto total de un agente en producción. Un prompt típico de 2,000 tokens de entrada + 500 de salida cuesta entre USD $0.004 y USD $0.025 por consulta, dependiendo del modelo. La optimización de prompts puede reducir este costo hasta un 45%.

Los tokens son la unidad básica de costo en cualquier sistema basado en LLMs. Cada palabra en español equivale aproximadamente a 1.3 tokens. Un prompt con contexto RAG típico tiene entre 1,500 y 4,000 tokens de entrada, más 300 a 800 tokens de salida. Así se ven los costos actualizados a julio 2026:

Modelo Input / 1M tokens Output / 1M tokens Costo por query*
Claude Sonnet 4 USD $3.00 USD $15.00 USD $0.014
Claude Haiku 3.5 USD $0.80 USD $4.00 USD $0.004
GPT-4o USD $2.50 USD $10.00 USD $0.010
GPT-4o mini USD $0.15 USD $0.60 USD $0.001
Gemini 2.5 Flash USD $0.15 USD $0.60 USD $0.001

*Estimado para query típica: 2,500 tokens input + 500 tokens output

En la práctica, el costo varía significativamente según el largo del contexto RAG que inyectas. Un agente que recupera 5 chunks de 512 tokens cada uno agrega 2,560 tokens de entrada por consulta. Si tu agente procesa 10,000 consultas mensuales con Claude Sonnet 4, el costo en tokens sería aproximadamente USD $270/mes solo en inferencia. Con Haiku 3.5, esa misma carga baja a USD $40/mes.

La estrategia de modelo escalonado

En nodo. usamos un patrón que llamamos model routing: un clasificador rápido (Haiku o GPT-4o mini) determina la complejidad de la consulta y la enruta al modelo apropiado. Las consultas simples (70% del volumen típico) van a Haiku; las complejas (30%) van a Sonnet. Este enfoque reduce el costo promedio por query de USD $0.014 a USD $0.007 — una reducción del 50% sin impacto en calidad percibida. Lo hemos implementado en proyectos de accelerators de IA con resultados consistentes.

¿Cuánto cuesta generar y almacenar embeddings?

Cápsula: Los embeddings representan el 18% del costo operativo. Generar embeddings para un corpus de 10,000 documentos cuesta entre USD $2 y USD $8 como costo único. El costo recurrente viene de embeddear las consultas del usuario: USD $0.0001 por consulta con text-embedding-3-small.

Los embeddings tienen dos componentes de costo: la indexación inicial del corpus (costo único) y el embedding de cada consulta entrante (costo recurrente). En nuestra experiencia con pipelines RAG en producción, el costo de indexación es despreciable — el costo recurrente es el que importa.

El costo real de embeddings no está en la generación — está en la re-indexación. Cada vez que cambias de modelo de embeddings, actualizas la estrategia de chunking, o modificas el preprocesamiento, necesitas re-embeddear todo el corpus. Un corpus de 100,000 documentos con text-embedding-3-large cuesta USD $80 por re-indexación. Eso puede sumar si estás iterando rápido en la fase de desarrollo.

¿Qué cuesta el almacenamiento vectorial en producción?

Cápsula: El almacenamiento vectorial representa el 7% del costo total. pgvector es gratuito si ya tienes PostgreSQL. Pinecone parte desde USD $70/mes en el plan Starter. Para la mayoría de las empresas con menos de 1M vectores, pgvector es la opción más económica.

Las opciones de almacenamiento vectorial tienen diferencias de costo dramáticas:

Solución Costo mensual Límite vectores Mejor para
pgvector $0 adicional* ~5M (HNSW) Ya usas PostgreSQL
Pinecone Starter USD $70 1M Prototipado rápido
Pinecone Standard USD $230+ 10M+ Escala enterprise
Weaviate Cloud USD $25+ Variable Multimodal
OpenSearch Serverless USD $350+ Ilimitado Ecosistema AWS

*Incluido en el costo de tu instancia PostgreSQL existente

En nodo., nuestra recomendación por defecto es pgvector. Si ya tienes PostgreSQL (y la mayoría de las empresas lo tienen), agregar la extensión pgvector es un CREATE EXTENSION vector; y listo. Sin infraestructura adicional, sin nuevo proveedor, sin nueva factura. En nuestro VPS con PostgreSQL 16, pgvector maneja 800,000 vectores de 1536 dimensiones con búsquedas en <50ms usando índice HNSW.

¿Cuánto cuesta la infraestructura de un agente IA?

La infraestructura de cómputo representa el 12% del costo total, pero es el componente más variable dependiendo de tu stack. Estos son los escenarios que hemos operado en nodo.:

Escenario 1: VPS dedicado (lo que usamos)

Un VPS con 4 vCPUs, 8GB RAM y SSD cuesta entre USD $30 y USD $60/mes. Corre el servidor Express/FastAPI, PostgreSQL con pgvector, y Redis para caching. Sin GPU porque usamos APIs externas para inferencia (Claude, OpenAI). Este setup maneja cómodamente 10,000 consultas diarias con latencia promedio de 200ms en el backend (sin contar latencia del LLM).

Escenario 2: Serverless (AWS Lambda + API Gateway)

Para cargas intermitentes, serverless puede ser más económico. AWS Lambda cobra USD $0.0000167 por GB-segundo. Un agente con 10,000 invocaciones mensuales de 5 segundos promedio (incluyendo espera del LLM) a 512MB cuesta USD $0.04 en Lambda + USD $3.50 en API Gateway. Total: USD $3.54/mes en cómputo. Pero necesitas Aurora o RDS para PostgreSQL, que parte en USD $30/mes.

Escenario 3: Kubernetes (enterprise)

Para múltiples agentes con tráfico alto, un cluster EKS pequeño (3 nodos t3.medium) cuesta USD $200/mes. Justificable solo con más de 100,000 consultas mensuales o múltiples agentes compartiendo infraestructura.

¿Cuál es el costo oculto de la latencia en agentes IA?

Cápsula: La latencia es un costo invisible que afecta directamente la adopción. Un agente que responde en 8 segundos tiene un 40% menos de uso que uno que responde en 2 segundos. Cada segundo adicional de latencia reduce la tasa de retención del usuario un 12%. Optimizar latencia es optimizar ROI.

Nadie habla de la latencia como un costo, pero lo es. En nuestros proyectos hemos medido el impacto directo: un chatbot interno que respondía en 6-8 segundos tenía un 23% de adopción entre empleados. Después de optimizarlo a 1.5-2 segundos (streaming + caching semántico), la adopción subió a 67%. El costo de la optimización fue USD $80/mes en Redis para caching; el valor del aumento de adopción fue inmensamente superior.

Las principales fuentes de latencia y cómo las hemos atacado:

¿Cómo se ve un presupuesto real de IA en producción?

Este es el desglose mensual real de un agente RAG en producción que operamos para un cliente — un asistente de soporte técnico con 12,000 consultas mensuales:

Componente Detalle Costo mensual
Tokens LLM 70% Haiku, 30% Sonnet (model routing) USD $168
Embeddings text-embedding-3-small, 12K queries + re-indexación USD $12
VPS 4 vCPU, 8GB RAM, PostgreSQL + pgvector USD $45
Redis (caching) Cache semántico, 2GB USD $15
Monitoreo Logs, alertas, dashboards USD $20
Backups Snapshots diarios del vector store USD $8
Total USD $268/mes

Este agente procesa 12,000 consultas mensuales a un costo de USD $0.022 por consulta. Antes de la optimización con model routing y caching semántico, el costo era USD $0.048 por consulta — una reducción del 54%. El caching semántico por sí solo evita un 35% de las llamadas al LLM al detectar consultas similares ya respondidas.

¿Cómo reducir costos de IA sin sacrificar calidad?

En nuestra experiencia operando agentes en producción, estas son las cinco técnicas que mayor impacto tienen en la reducción de costos:

  1. Caching semántico (ahorro: 25-40%): almacena respuestas previas indexadas por similitud semántica. Si una consulta nueva tiene >0.92 de similitud coseno con una cacheada, sirve la respuesta sin llamar al LLM. Implementación: Redis + embeddings de la query
  2. Model routing (ahorro: 30-50%): clasifica la complejidad de cada consulta y enrútala al modelo más económico que pueda resolverla. El clasificador cuesta ~USD $0.0002 por consulta con Haiku
  3. Optimización de prompts (ahorro: 15-25%): prompts más cortos, instrucciones del sistema cacheadas (prompt caching reduce tokens repetidos hasta 90%), y reducción del número de chunks inyectados
  4. Batching de embeddings (ahorro: 5-10%): agrupar documentos nuevos para re-indexación en batch en lugar de uno por uno. Reduce overhead de red y aprovecha descuentos por volumen
  5. Evaluación continua (ahorro indirecto): medir la calidad de las respuestas con frameworks de evaluación de LLMs para detectar cuándo puedes bajar de modelo sin perder calidad

¿Qué costos escalan linealmente y cuáles tienen economías de escala?

No todos los costos se comportan igual cuando creces. Entender esto es crítico para proyecciones financieras:

En términos concretos: un agente que cuesta USD $0.022/query a 12,000 consultas mensuales baja a USD $0.015/query a 50,000 consultas mensuales, principalmente por el aumento en la tasa de cache hit del caching semántico.

¿Cómo evitar sorpresas en la factura de IA?

Los tres errores más comunes que hemos visto en equipos que ponen IA en producción por primera vez:

  1. No poner límites de gasto: configura alertas en tu proveedor de LLM. OpenAI y Anthropic permiten límites mensuales. Un prompt loop (el agente se llama a sí mismo recursivamente) puede consumir USD $500 en minutos si no tienes rate limiting
  2. Ignorar el costo de desarrollo: el prompt engineering, la evaluación y la iteración del pipeline consumen tokens. En proyectos de nodo., el costo de desarrollo suele ser 3-5x el costo del primer mes de operación. Planíficalo
  3. Sobre-dimensionar desde el día uno: no necesitas Pinecone Enterprise ni un cluster Kubernetes para un MVP. Empieza con pgvector en un VPS, valida que el agente genera valor, y escala después. Hemos visto equipos gastando USD $800/mes en infraestructura para agentes que procesan 500 queries

La ecuación real: costo vs. valor

Un agente de soporte técnico que cuesta USD $268/mes y resuelve 12,000 consultas mensuales equivale a USD $0.022 por interacción resuelta. Un agente humano de soporte cuesta entre USD $1,200 y USD $2,000/mes y maneja 1,500-2,000 interacciones mensuales — USD $0.75 a $1.33 por interacción. La IA no reemplaza al humano en todos los casos, pero en consultas de nivel 1 (el 60-70% del volumen típico), el ahorro es de 30x a 60x por interacción.

La pregunta no es si la IA en producción es cara. Es si el problema que resuelve justifica el costo. En nuestra experiencia en nodo., la respuesta es sí en la mayoría de los casos — siempre que empieces con el scope correcto y optimices iterativamente.