TL;DR
Los costos de tokens de los agentes de IA aumentan cuando cada paso vuelve a procesar instrucciones, historial de conversación, resultados de herramientas y estado intermedio.
Reduzca el volumen de tokens con presupuestos a nivel de ejecución, filtrado de resultados de herramientas, compactación del contexto, límites de reintentos y razonamiento controlado. Use caché de prompts para entradas repetidas estables, pero optimice el bucle del agente antes de cambiar a un modelo más barato.
La métrica de producción más útil es el costo por tarea exitosa, medido en toda la ejecución, no el precio por solicitud ni el tamaño del contexto de la llamada final.
Esta guía se centra específicamente en agentes de IA de múltiples pasos. Explica cómo el contexto repetido se compone a lo largo de la ejecución, cómo identificar la mayor fuente de desperdicio y qué controles implementar primero.
Introduction
Un chatbot puede hacer una solicitud de modelo por mensaje de usuario. Un agente de IA puede hacer 10, 20 o más llamadas antes de completar una tarea.
Cada paso puede reenviar instrucciones, historial de conversación, resultados de herramientas y estado intermedio. Los reintentos, el razonamiento y los subagentes agregan más uso, por lo que una respuesta final breve aún puede consumir una gran cantidad de tokens.
A medida que escala el uso, estos costos se vuelven más difíciles de predecir y pueden reducir rápidamente los márgenes del producto. Reducirlos requiere optimizar todo el bucle del agente, no simplemente cambiar a un modelo más barato.
Este artículo se concentra en los costos específicos de los agentes. Para una guía más amplia que cubra el caché de prompts, caché de respuestas exactas, caché semántica, enrutamiento de modelos y gestión general de costos de API, consulte How to Reduce AI API Costs (https://www.cometapi.com/reduce-ai-api-costs/).
Why Do AI Agent Token Costs Compound?
En un agente de múltiples pasos, el costo de una tarea es la suma de cada llamada al modelo, no solo la respuesta final.
Las principales fuentes de uso de tokens de un agente son:
| Fuente de costo | Qué lo causa | Primer control a probar |
|---|---|---|
| Instrucciones repetidas | Prompts del sistema, esquemas de herramientas, políticas, ejemplos | Estabilizar el prefijo reutilizable |
| Historial creciente | Turnos anteriores se reenvían en cada paso | Compactar o recuperar selectivamente el estado |
| Resultados de herramientas | Páginas de búsqueda, archivos, registros y registros de bases de datos | Filtrar antes de agregarlos al contexto |
| Salida intermedia | Planes, mensajes de estado y decisiones verbosas de herramientas | Usar salidas estructuradas compactas |
| Tokens de razonamiento | Alto esfuerzo de razonamiento en pasos rutinarios | Ajustar el esfuerzo a la complejidad de la tarea |
| Reintentos | Salida inválida, timeouts, errores de herramientas y límites de tasa | Clasificar fallas y limitar reintentos |
| Subagentes | Los trabajadores duplican contexto, herramientas y análisis | Enviar a cada trabajador un segmento estrecho de contexto |
Hay dos formas distintas de reducir la factura:
- Procesar menos tokens mediante filtrado, compactación, límites de salida y controles del bucle.
- Reducir el precio efectivo de los tokens necesarios mediante caché de prompts o selección de modelo.
Distinción clave: El caché de prompts reduce el costo de la entrada repetida. La compactación del contexto reduce la propia entrada repetida.
How Can a 12-Step Agent Process 147,000 Tokens?
Considere un agente de soporte hipotético con:
- Un prefijo estable de 4,000 tokens
- 1,500 tokens nuevos añadidos después de cada paso
- Todo el historial acumulado reenviado en cada solicitud
- 12 llamadas al modelo en total
La entrada en el paso n es:
Input at step n = 4,000 + 1,500 × (n - 1)
La entrada acumulada a lo largo de 12 llamadas es:
Total input
= 4,000 × 12 + 1,500 × (0 + 1 + ... + 11)
= 48,000 + 99,000
= 147,000 input tokens
La llamada final contiene solo 20,500 tokens de entrada, pero la ejecución completa procesa 147,000 tokens de entrada acumulados.
Ahora aplique dos controles:
- Poner en caché el prefijo estable de 4,000 tokens después de la primera llamada.
- Compactar el historial después del paso seis en un resumen de estado de 2,500 tokens.
| Escenario | Entrada sin caché | Entrada en caché | Total de entrada procesada | Cambio |
|---|---|---|---|---|
| Historial completo en cada paso | 147,000 | 0 | 147,000 | Línea base |
| Prefijo estable en caché | 103,000 | 44,000 | 147,000 | Mismo volumen, combinación más barata |
| Caché más compactación | 64,000 | 44,000 | 108,000 | 26.5% menos tokens procesados |
Este es un cálculo de planificación, no un punto de referencia del proveedor.
Asume que cada solicitud incluye todo el historial acumulado. Los agentes que construyen el estado selectivamente, resumen mensajes antiguos o recuperan solo información relevante pueden seguir una curva de costos diferente.
Regla de crecimiento de costos: Mida la entrada acumulada en toda la ejecución. El tamaño del contexto final no representa el número total de tokens procesados.

Which Metrics Reveal Agent Token Waste?
No empiece cambiando de modelos. Primero identifique dónde el flujo de trabajo está gastando tokens sin mejorar el resultado.
Registre estos campos para cada paso del agente:
| Campo | Por qué importa |
|---|---|
run_id, step_id, parent_step_id | Reconstruye el árbol del agente y subagentes |
| Tokens de entrada renderizados | Muestra cómo crece el contexto entre llamadas |
| Entrada en caché y no en caché | Separa la reutilización del contexto nuevo |
| Tokens de salida y de razonamiento | Identifica pasos de generación costosos |
| Tamaño de resultados de herramientas y tokens retenidos | Muestra cuánta evidencia bruta entra en prompts posteriores |
| Motivo del reintento y número de intento | Identifica fallas repetidas |
| Tokens de compactación antes y después | Mide la reducción real del contexto |
| ID del trabajador y tokens devueltos | Revela trabajo duplicado de subagentes |
| Resultado aceptado, rechazado o escalado | Conecta el costo con la calidad de la tarea |
La métrica principal debe ser:
cost per successful task
= total workflow cost
/ accepted tasks
Una ejecución más barata no es una mejora si causa más tareas fallidas, herramientas repetidas o corrección humana.
Cuatro métricas específicas del agente ayudan a localizar el problema.
Context Amplification
context amplification
= cumulative input tokens
/ final-step input tokens
Un valor alto indica que el contexto anterior se ha procesado repetidamente.
Tool Retention Ratio
tool retention ratio
= tool-result tokens retained in context
/ tokens originally returned by tools
Una proporción alta puede indicar que el agente está cargando demasiada evidencia bruta entre pasos.
Retry Tax
retry tax
= retry and repair cost
/ total workflow cost
Reasoning Share
reasoning share
= reasoning-token cost
/ total model cost
Mida cada carga de trabajo por separado. Los agentes de investigación, codificación, navegador y soporte al cliente no deben compartir una línea base global.
Six Ways to Reduce AI Agent Token Costs
1. Set a Budget for the Complete Run
Un límite de salida por solicitud no controla a un agente de múltiples pasos.
Establezca límites a nivel de ejecución para:
- Total de pasos del modelo
- Entradas y salidas acumuladas
- Llamadas a herramientas y tamaño de resultados de herramientas
- Reintentos por tipo de fallo
- Subagentes
- Tiempo total transcurrido o costo estimado
El siguiente ejemplo en Python, neutral al proveedor, evalúa la ejecución antes de cada llamada al modelo:
from dataclasses import dataclass
from enum import Enum
class Action(str, Enum):
CONTINUE = "continue"
COMPACT = "compact"
STOP = "stop"
@dataclass(frozen=True)
class Budget:
max_steps: int = 12
max_input_tokens: int = 120_000
max_output_tokens: int = 18_000
compact_at: float = 0.80
@dataclass
class Usage:
steps: int = 0
input_tokens: int = 0
output_tokens: int = 0
def evaluate_budget(usage: Usage, budget: Budget) -> Action:
if (
usage.steps >= budget.max_steps
or usage.input_tokens >= budget.max_input_tokens
or usage.output_tokens >= budget.max_output_tokens
):
return Action.STOP
input_ratio = usage.input_tokens / budget.max_input_tokens
if input_ratio >= budget.compact_at:
return Action.COMPACT
return Action.CONTINUE
Ejecute la comprobación antes de cada solicitud al modelo y actualice Usage a partir de los datos de tokens informados por el proveedor.
Al 80% del presupuesto de entrada, compacte el estado o estreche la próxima consulta de herramientas. Al 100%, deténgase con un motivo estructurado.
Error común: Limitar cada respuesta mientras se permiten pasos, herramientas y reintentos ilimitados.
2. Filter Tool Results Before They Enter the Transcript
Devuelva solo la evidencia requerida para la próxima decisión del agente.
No agregue un:
- Página web
- Archivo de registro
- Árbol de repositorio
- Respuesta de base de datos
- Sesión de terminal
- Carga útil de API
completos cuando el siguiente paso solo necesita unos pocos campos.
Una herramienta de búsqueda podría devolver:
{
"source_id": "search_17",
"title": "Relevant page title",
"url": "https://example.com/page",
"relevant_passage": "A short evidence block"
}
Almacene el artefacto completo fuera del prompt y recupere una sección más estrecha más adelante.
Regla de filtrado de herramientas: Devuelva los campos necesarios para la próxima decisión, no todos los campos que podrían ser útiles más tarde.
Error común: Truncar los primeros 1,000 caracteres de una carga útil JSON. Esto puede romper la estructura o eliminar los registros que el agente realmente necesita.
Analice primero la carga útil, seleccione campos de forma estructural, limite los arreglos y luego serialice JSON válido.
3. Compact Operational State, Not Just Conversation Text
La compactación debe preservar la información necesaria para continuar la tarea mientras elimina el historial que ya no afecta la siguiente acción.
Un estado compactado útil contiene:
- Objetivo del usuario y criterios de éxito
- Decisiones ya tomadas
- Hechos verificados e IDs de fuentes
- Archivos o registros cambiados
- Enfoques fallidos
- Preguntas abiertas
- La siguiente acción
- Restricciones de seguridad y de salida
No debe volver a contar la conversación completa.
OpenAI documenta la compactación para interacciones de larga duración con Responses API. Anthropic proporciona controles de gestión de contexto para limpiar o resumir contenido antiguo. Estas implementaciones difieren, así que verifique los campos actuales del proveedor antes de la integración.
Regla de compactación: Preserve decisiones y trabajo no resuelto. Elimine la narración y la evidencia que se pueda recuperar de nuevo.
Error común: Omitir IDs de fuentes, nombres de archivos cambiados, enfoques rechazados o restricciones no resueltas.
Después de añadir la compactación, mida si el agente repite búsquedas o llamadas a herramientas. Un prompt más corto no es más barato si el agente debe reconstruir el estado perdido.
4. Keep the Reusable Prefix Stable
Los prompts de agentes a menudo contienen bloques reutilizables grandes:
- Instrucciones del sistema
- Esquemas de herramientas
- Políticas de seguridad
- Formatos de salida
- Material de referencia compartido
- Instrucciones del repositorio o del producto
Coloque estos elementos estables antes de los datos específicos de la solicitud:
1. System instructions
2. Policies and constraints
3. Tool definitions
4. Stable examples
5. Shared reference material
6. Request-specific data
Evite colocar marcas de tiempo, IDs de solicitud, datos de sesión o valores que cambien con frecuencia cerca del comienzo.
La caché es más útil cuando el prefijo es largo, estable y reutilizado. Puede que no ahorre dinero en sesiones cortas o prompts que cambian con frecuencia.
Error común: Optimizar para la tasa de aciertos de caché sin medir el costo de escritura, lectura o almacenamiento de la caché.
Para una comparación más amplia del caché de prompts del proveedor, caché de respuestas exactas y caché semántica, consulte How to Reduce AI API Costs (https://www.cometapi.com/reduce-ai-api-costs/).
5. Prevent Retries From Replaying the Same Context
Un reintento es otro paso del agente, a menudo con el mismo prompt grande.
No repita una solicitud fallida sin cambiar la causa de la falla.
| Falla | Mejor respuesta |
|---|---|
| Salida estructurada inválida | Devolver el error de validación y reintentar una vez |
| Timeout de herramienta | Reintentar una operación idempotente una vez, luego detener o usar un respaldo |
| Desbordamiento de contexto | Compactar el estado o recuperar menos evidencia |
| Llamada de herramienta repetida | Desduplicar usando un hash de operación |
| Límite de tasa | Hacer backoff o usar una ruta de respaldo probada |
| Resultado de baja confianza | Solicitar la información faltante o escalar |
Use claves de idempotencia para operaciones con efectos secundarios como pagos, correos, despliegues y escrituras en bases de datos.
Error común: Reintentar un modelo con límite de tasa varias veces reenviando todo el contexto del agente en cada intento.
Haga un seguimiento del impuesto de reintentos por tipo de falla para que el equipo pueda arreglar primero el bucle más costoso.
6. Limit Reasoning and Subagents to Steps That Need Them
No todos los pasos del agente requieren razonamiento profundo.
La extracción, el formateo, la clasificación, la validación y la selección rutinaria de herramientas a menudo pueden usar menor esfuerzo de razonamiento y salidas estructuradas compactas.
Reserve mayor esfuerzo de razonamiento para tareas como:
- Planificación compleja
- Codificación difícil
- Síntesis de múltiples documentos
- Decisiones ambiguas
- Recuperación de ejecuciones fallidas
Regla de razonamiento: Use el menor esfuerzo de razonamiento que preserve la tasa de tareas aceptadas.
Los subagentes también requieren un límite claro. Dé a cada trabajador:
- Una tarea estrecha
- Un segmento de contexto específico de la tarea
- Una lista permitida de herramientas
- Un presupuesto de tokens
- Un esquema de salida compacto
El agente raíz por lo general necesita hallazgos, IDs de evidencias, confianza y problemas no resueltos, no la transcripción completa del trabajador.
Regla para subagentes: Paralelice trabajo independiente, no contexto duplicado.
Error común: Enviar todo el historial del agente raíz a cada trabajador antes de asignar una tarea estrecha.
Which Optimization Should You Apply First?
Use telemetría del agente para elegir la primera intervención.
Los umbrales siguientes son disparadores de investigación, no estándares universales.
| Señal observada | Empiece aquí |
|---|---|
| La amplificación del contexto es alta | Compactar el historial y recuperar el estado selectivamente |
| La salida de herramientas domina el prompt | Filtrar campos y almacenar artefactos completos externamente |
| El impuesto de reintentos es alto | Corregir validación, timeouts y llamadas repetidas a herramientas |
| La participación del razonamiento es alta | Reducir el esfuerzo en pasos rutinarios |
| Los subagentes repiten la misma evidencia | Estrechar alcances de los trabajadores y segmentos de contexto |
| La entrada en caché se mantiene baja | Estabilizar el prefijo reutilizable |
| Los costos siguen siendo altos después de depurar el bucle | Comparar rutas de modelos de menor costo |
Una secuencia de implementación segura es:
- Medir entrada acumulada, retención de herramientas, reintentos y razonamiento.
- Agregar límites estrictos para pasos, herramientas, reintentos y tokens totales.
- Filtrar resultados grandes de herramientas.
- Compactar el estado más antiguo en un umbral medido.
- Estabilizar el prefijo reutilizable del prompt.
- Comparar rutas de modelos solo después de limpiar el bucle del agente.
Cambie una variable importante a la vez y repita el mismo conjunto de evaluación.
Compare:
- Tasa de aceptación de tareas
- Costo por tarea exitosa
- Entrada acumulada
- Conteo de llamadas a herramientas
- Impuesto de reintentos
- Participación del razonamiento
- Latencia p50 y p95
- Tiempo de revisión humana
Revierta cambios que ahorren tokens reduciendo la calidad de la tarea o eliminando evidencia necesaria.
Test Agent Workflows With CometAPI
Antes de ejecutar una evaluación multimodelo, use la página de precios de CometAPI (https://www.cometapi.com/pricing/?utm_source=chatgpt.com) y la guía de estimación de costos (https://apidoc.cometapi.com/guides/how-to-estimate-cost-before-calling-a-model) para estimar costos de entrada, salida, tokens en caché y razonamiento.
Luego use el catálogo de modelos (https://www.cometapi.com/models/?utm_source=chatgpt.com) para identificar rutas elegibles y el Quickstart (https://www.cometapi.com/quickstart/?utm_source=chatgpt.com) para configurar un cliente compatible con OpenAI.
Para respaldo en producción, siga la guía de rutas de respaldo de modelos de CometAPI (https://apidoc.cometapi.com/guides/model-fallback-with-cometapi) para cambiar de ruta sin repetir herramientas ya completadas ni descartar estado validado.
El acceso unificado simplifica la comparación de modelos y la integración de respaldos. Los presupuestos de tokens, la compactación, la validación, el filtrado de herramientas, los límites de reintentos y los criterios de aceptación siguen perteneciendo al nivel de la aplicación.
FAQ
Why do AI agents use more tokens than chatbots?
Los agentes hacen múltiples llamadas al modelo y pueden reenviar mensajes previos, resultados de herramientas, instrucciones y estado intermedio en cada paso. Esto hace que el contexto anterior se procese repetidamente.
Does prompt caching reduce context-window usage?
No. El caché de prompts puede reducir el precio efectivo o la latencia de la entrada repetida, pero los tokens en caché siguen formando parte del contexto procesado. Use compactación, filtrado o recuperación selectiva para reducir el tamaño del prompt.
When should an AI agent compact its context?
Compacte antes de que el crecimiento del contexto empiece a afectar el costo, la latencia o el espacio de salida disponible. Verifique que el estado compactado preserve decisiones, IDs de evidencia, archivos cambiados, preguntas abiertas y restricciones de seguridad.
Do subagents reduce token costs?
No automáticamente. Pueden reducir el tiempo transcurrido o mejorar la cobertura para trabajo independiente, pero el contexto duplicado y el análisis superpuesto a menudo aumentan el uso total de tokens.
What is the best metric for AI agent cost optimization?
Use el costo por tarea exitosa como métrica principal. Diagnostíquelo con entrada acumulada, amplificación del contexto, retención de herramientas, impuesto de reintentos, participación del razonamiento, latencia y tiempo de revisión humana.
