GPT-5.6 Luna price down 80%, Terra down 20% →

Cómo reducir los costes de tokens de los agentes de IA en producción

CometAPI
Mia MarenAug 5, 2026
Cómo reducir los costes de tokens de los agentes de IA en producción

TL;DR

Los costos de tokens de los agentes de IA aumentan cuando cada paso vuelve a procesar instrucciones, historial de conversación, resultados de herramientas y estado intermedio.

Reduzca el volumen de tokens con presupuestos a nivel de ejecución, filtrado de resultados de herramientas, compactación del contexto, límites de reintentos y razonamiento controlado. Use caché de prompts para entradas repetidas estables, pero optimice el bucle del agente antes de cambiar a un modelo más barato.

La métrica de producción más útil es el costo por tarea exitosa, medido en toda la ejecución, no el precio por solicitud ni el tamaño del contexto de la llamada final.

Esta guía se centra específicamente en agentes de IA de múltiples pasos. Explica cómo el contexto repetido se compone a lo largo de la ejecución, cómo identificar la mayor fuente de desperdicio y qué controles implementar primero.

Introduction

Un chatbot puede hacer una solicitud de modelo por mensaje de usuario. Un agente de IA puede hacer 10, 20 o más llamadas antes de completar una tarea.

Cada paso puede reenviar instrucciones, historial de conversación, resultados de herramientas y estado intermedio. Los reintentos, el razonamiento y los subagentes agregan más uso, por lo que una respuesta final breve aún puede consumir una gran cantidad de tokens.

A medida que escala el uso, estos costos se vuelven más difíciles de predecir y pueden reducir rápidamente los márgenes del producto. Reducirlos requiere optimizar todo el bucle del agente, no simplemente cambiar a un modelo más barato.

Este artículo se concentra en los costos específicos de los agentes. Para una guía más amplia que cubra el caché de prompts, caché de respuestas exactas, caché semántica, enrutamiento de modelos y gestión general de costos de API, consulte How to Reduce AI API Costs (https://www.cometapi.com/reduce-ai-api-costs/).

Why Do AI Agent Token Costs Compound?

En un agente de múltiples pasos, el costo de una tarea es la suma de cada llamada al modelo, no solo la respuesta final.

Las principales fuentes de uso de tokens de un agente son:

Fuente de costoQué lo causaPrimer control a probar
Instrucciones repetidasPrompts del sistema, esquemas de herramientas, políticas, ejemplosEstabilizar el prefijo reutilizable
Historial crecienteTurnos anteriores se reenvían en cada pasoCompactar o recuperar selectivamente el estado
Resultados de herramientasPáginas de búsqueda, archivos, registros y registros de bases de datosFiltrar antes de agregarlos al contexto
Salida intermediaPlanes, mensajes de estado y decisiones verbosas de herramientasUsar salidas estructuradas compactas
Tokens de razonamientoAlto esfuerzo de razonamiento en pasos rutinariosAjustar el esfuerzo a la complejidad de la tarea
ReintentosSalida inválida, timeouts, errores de herramientas y límites de tasaClasificar fallas y limitar reintentos
SubagentesLos trabajadores duplican contexto, herramientas y análisisEnviar a cada trabajador un segmento estrecho de contexto

Hay dos formas distintas de reducir la factura:

  1. Procesar menos tokens mediante filtrado, compactación, límites de salida y controles del bucle.
  2. Reducir el precio efectivo de los tokens necesarios mediante caché de prompts o selección de modelo.

Distinción clave: El caché de prompts reduce el costo de la entrada repetida. La compactación del contexto reduce la propia entrada repetida.

How Can a 12-Step Agent Process 147,000 Tokens?

Considere un agente de soporte hipotético con:

  • Un prefijo estable de 4,000 tokens
  • 1,500 tokens nuevos añadidos después de cada paso
  • Todo el historial acumulado reenviado en cada solicitud
  • 12 llamadas al modelo en total

La entrada en el paso n es:

Input at step n = 4,000 + 1,500 × (n - 1)

La entrada acumulada a lo largo de 12 llamadas es:

Total input
= 4,000 × 12 + 1,500 × (0 + 1 + ... + 11)
= 48,000 + 99,000
= 147,000 input tokens

La llamada final contiene solo 20,500 tokens de entrada, pero la ejecución completa procesa 147,000 tokens de entrada acumulados.

Ahora aplique dos controles:

  1. Poner en caché el prefijo estable de 4,000 tokens después de la primera llamada.
  2. Compactar el historial después del paso seis en un resumen de estado de 2,500 tokens.
EscenarioEntrada sin cachéEntrada en cachéTotal de entrada procesadaCambio
Historial completo en cada paso147,0000147,000Línea base
Prefijo estable en caché103,00044,000147,000Mismo volumen, combinación más barata
Caché más compactación64,00044,000108,00026.5% menos tokens procesados

Este es un cálculo de planificación, no un punto de referencia del proveedor.

Asume que cada solicitud incluye todo el historial acumulado. Los agentes que construyen el estado selectivamente, resumen mensajes antiguos o recuperan solo información relevante pueden seguir una curva de costos diferente.

Regla de crecimiento de costos: Mida la entrada acumulada en toda la ejecución. El tamaño del contexto final no representa el número total de tokens procesados.

imagen

Which Metrics Reveal Agent Token Waste?

No empiece cambiando de modelos. Primero identifique dónde el flujo de trabajo está gastando tokens sin mejorar el resultado.

Registre estos campos para cada paso del agente:

CampoPor qué importa
run_id, step_id, parent_step_idReconstruye el árbol del agente y subagentes
Tokens de entrada renderizadosMuestra cómo crece el contexto entre llamadas
Entrada en caché y no en cachéSepara la reutilización del contexto nuevo
Tokens de salida y de razonamientoIdentifica pasos de generación costosos
Tamaño de resultados de herramientas y tokens retenidosMuestra cuánta evidencia bruta entra en prompts posteriores
Motivo del reintento y número de intentoIdentifica fallas repetidas
Tokens de compactación antes y despuésMide la reducción real del contexto
ID del trabajador y tokens devueltosRevela trabajo duplicado de subagentes
Resultado aceptado, rechazado o escaladoConecta el costo con la calidad de la tarea

La métrica principal debe ser:

cost per successful task
= total workflow cost
/ accepted tasks

Una ejecución más barata no es una mejora si causa más tareas fallidas, herramientas repetidas o corrección humana.

Cuatro métricas específicas del agente ayudan a localizar el problema.

Context Amplification

context amplification
= cumulative input tokens
/ final-step input tokens

Un valor alto indica que el contexto anterior se ha procesado repetidamente.

Tool Retention Ratio

tool retention ratio
= tool-result tokens retained in context
/ tokens originally returned by tools

Una proporción alta puede indicar que el agente está cargando demasiada evidencia bruta entre pasos.

Retry Tax

retry tax
= retry and repair cost
/ total workflow cost

Reasoning Share

reasoning share
= reasoning-token cost
/ total model cost

Mida cada carga de trabajo por separado. Los agentes de investigación, codificación, navegador y soporte al cliente no deben compartir una línea base global.

Six Ways to Reduce AI Agent Token Costs

1. Set a Budget for the Complete Run

Un límite de salida por solicitud no controla a un agente de múltiples pasos.

Establezca límites a nivel de ejecución para:

  • Total de pasos del modelo
  • Entradas y salidas acumuladas
  • Llamadas a herramientas y tamaño de resultados de herramientas
  • Reintentos por tipo de fallo
  • Subagentes
  • Tiempo total transcurrido o costo estimado

El siguiente ejemplo en Python, neutral al proveedor, evalúa la ejecución antes de cada llamada al modelo:

from dataclasses import dataclass
from enum import Enum


class Action(str, Enum):
    CONTINUE = "continue"
    COMPACT = "compact"
    STOP = "stop"


@dataclass(frozen=True)
class Budget:
    max_steps: int = 12
    max_input_tokens: int = 120_000
    max_output_tokens: int = 18_000
    compact_at: float = 0.80


@dataclass
class Usage:
    steps: int = 0
    input_tokens: int = 0
    output_tokens: int = 0


def evaluate_budget(usage: Usage, budget: Budget) -> Action:
    if (
        usage.steps >= budget.max_steps
        or usage.input_tokens >= budget.max_input_tokens
        or usage.output_tokens >= budget.max_output_tokens
    ):
        return Action.STOP

    input_ratio = usage.input_tokens / budget.max_input_tokens

    if input_ratio >= budget.compact_at:
        return Action.COMPACT

    return Action.CONTINUE

Ejecute la comprobación antes de cada solicitud al modelo y actualice Usage a partir de los datos de tokens informados por el proveedor.

Al 80% del presupuesto de entrada, compacte el estado o estreche la próxima consulta de herramientas. Al 100%, deténgase con un motivo estructurado.

Error común: Limitar cada respuesta mientras se permiten pasos, herramientas y reintentos ilimitados.

2. Filter Tool Results Before They Enter the Transcript

Devuelva solo la evidencia requerida para la próxima decisión del agente.

No agregue un:

  • Página web
  • Archivo de registro
  • Árbol de repositorio
  • Respuesta de base de datos
  • Sesión de terminal
  • Carga útil de API

completos cuando el siguiente paso solo necesita unos pocos campos.

Una herramienta de búsqueda podría devolver:

{
  "source_id": "search_17",
  "title": "Relevant page title",
  "url": "https://example.com/page",
  "relevant_passage": "A short evidence block"
}

Almacene el artefacto completo fuera del prompt y recupere una sección más estrecha más adelante.

Regla de filtrado de herramientas: Devuelva los campos necesarios para la próxima decisión, no todos los campos que podrían ser útiles más tarde.

Error común: Truncar los primeros 1,000 caracteres de una carga útil JSON. Esto puede romper la estructura o eliminar los registros que el agente realmente necesita.

Analice primero la carga útil, seleccione campos de forma estructural, limite los arreglos y luego serialice JSON válido.

3. Compact Operational State, Not Just Conversation Text

La compactación debe preservar la información necesaria para continuar la tarea mientras elimina el historial que ya no afecta la siguiente acción.

Un estado compactado útil contiene:

  • Objetivo del usuario y criterios de éxito
  • Decisiones ya tomadas
  • Hechos verificados e IDs de fuentes
  • Archivos o registros cambiados
  • Enfoques fallidos
  • Preguntas abiertas
  • La siguiente acción
  • Restricciones de seguridad y de salida

No debe volver a contar la conversación completa.

OpenAI documenta la compactación para interacciones de larga duración con Responses API. Anthropic proporciona controles de gestión de contexto para limpiar o resumir contenido antiguo. Estas implementaciones difieren, así que verifique los campos actuales del proveedor antes de la integración.

Regla de compactación: Preserve decisiones y trabajo no resuelto. Elimine la narración y la evidencia que se pueda recuperar de nuevo.

Error común: Omitir IDs de fuentes, nombres de archivos cambiados, enfoques rechazados o restricciones no resueltas.

Después de añadir la compactación, mida si el agente repite búsquedas o llamadas a herramientas. Un prompt más corto no es más barato si el agente debe reconstruir el estado perdido.

4. Keep the Reusable Prefix Stable

Los prompts de agentes a menudo contienen bloques reutilizables grandes:

  • Instrucciones del sistema
  • Esquemas de herramientas
  • Políticas de seguridad
  • Formatos de salida
  • Material de referencia compartido
  • Instrucciones del repositorio o del producto

Coloque estos elementos estables antes de los datos específicos de la solicitud:

1. System instructions
2. Policies and constraints
3. Tool definitions
4. Stable examples
5. Shared reference material
6. Request-specific data

Evite colocar marcas de tiempo, IDs de solicitud, datos de sesión o valores que cambien con frecuencia cerca del comienzo.

La caché es más útil cuando el prefijo es largo, estable y reutilizado. Puede que no ahorre dinero en sesiones cortas o prompts que cambian con frecuencia.

Error común: Optimizar para la tasa de aciertos de caché sin medir el costo de escritura, lectura o almacenamiento de la caché.

Para una comparación más amplia del caché de prompts del proveedor, caché de respuestas exactas y caché semántica, consulte How to Reduce AI API Costs (https://www.cometapi.com/reduce-ai-api-costs/).

5. Prevent Retries From Replaying the Same Context

Un reintento es otro paso del agente, a menudo con el mismo prompt grande.

No repita una solicitud fallida sin cambiar la causa de la falla.

FallaMejor respuesta
Salida estructurada inválidaDevolver el error de validación y reintentar una vez
Timeout de herramientaReintentar una operación idempotente una vez, luego detener o usar un respaldo
Desbordamiento de contextoCompactar el estado o recuperar menos evidencia
Llamada de herramienta repetidaDesduplicar usando un hash de operación
Límite de tasaHacer backoff o usar una ruta de respaldo probada
Resultado de baja confianzaSolicitar la información faltante o escalar

Use claves de idempotencia para operaciones con efectos secundarios como pagos, correos, despliegues y escrituras en bases de datos.

Error común: Reintentar un modelo con límite de tasa varias veces reenviando todo el contexto del agente en cada intento.

Haga un seguimiento del impuesto de reintentos por tipo de falla para que el equipo pueda arreglar primero el bucle más costoso.

6. Limit Reasoning and Subagents to Steps That Need Them

No todos los pasos del agente requieren razonamiento profundo.

La extracción, el formateo, la clasificación, la validación y la selección rutinaria de herramientas a menudo pueden usar menor esfuerzo de razonamiento y salidas estructuradas compactas.

Reserve mayor esfuerzo de razonamiento para tareas como:

  • Planificación compleja
  • Codificación difícil
  • Síntesis de múltiples documentos
  • Decisiones ambiguas
  • Recuperación de ejecuciones fallidas

Regla de razonamiento: Use el menor esfuerzo de razonamiento que preserve la tasa de tareas aceptadas.

Los subagentes también requieren un límite claro. Dé a cada trabajador:

  • Una tarea estrecha
  • Un segmento de contexto específico de la tarea
  • Una lista permitida de herramientas
  • Un presupuesto de tokens
  • Un esquema de salida compacto

El agente raíz por lo general necesita hallazgos, IDs de evidencias, confianza y problemas no resueltos, no la transcripción completa del trabajador.

Regla para subagentes: Paralelice trabajo independiente, no contexto duplicado.

Error común: Enviar todo el historial del agente raíz a cada trabajador antes de asignar una tarea estrecha.

Which Optimization Should You Apply First?

Use telemetría del agente para elegir la primera intervención.

Los umbrales siguientes son disparadores de investigación, no estándares universales.

Señal observadaEmpiece aquí
La amplificación del contexto es altaCompactar el historial y recuperar el estado selectivamente
La salida de herramientas domina el promptFiltrar campos y almacenar artefactos completos externamente
El impuesto de reintentos es altoCorregir validación, timeouts y llamadas repetidas a herramientas
La participación del razonamiento es altaReducir el esfuerzo en pasos rutinarios
Los subagentes repiten la misma evidenciaEstrechar alcances de los trabajadores y segmentos de contexto
La entrada en caché se mantiene bajaEstabilizar el prefijo reutilizable
Los costos siguen siendo altos después de depurar el bucleComparar rutas de modelos de menor costo

Una secuencia de implementación segura es:

  1. Medir entrada acumulada, retención de herramientas, reintentos y razonamiento.
  2. Agregar límites estrictos para pasos, herramientas, reintentos y tokens totales.
  3. Filtrar resultados grandes de herramientas.
  4. Compactar el estado más antiguo en un umbral medido.
  5. Estabilizar el prefijo reutilizable del prompt.
  6. Comparar rutas de modelos solo después de limpiar el bucle del agente.

Cambie una variable importante a la vez y repita el mismo conjunto de evaluación.

Compare:

  • Tasa de aceptación de tareas
  • Costo por tarea exitosa
  • Entrada acumulada
  • Conteo de llamadas a herramientas
  • Impuesto de reintentos
  • Participación del razonamiento
  • Latencia p50 y p95
  • Tiempo de revisión humana

Revierta cambios que ahorren tokens reduciendo la calidad de la tarea o eliminando evidencia necesaria.

Test Agent Workflows With CometAPI

Antes de ejecutar una evaluación multimodelo, use la página de precios de CometAPI (https://www.cometapi.com/pricing/?utm_source=chatgpt.com) y la guía de estimación de costos (https://apidoc.cometapi.com/guides/how-to-estimate-cost-before-calling-a-model) para estimar costos de entrada, salida, tokens en caché y razonamiento.

Luego use el catálogo de modelos (https://www.cometapi.com/models/?utm_source=chatgpt.com) para identificar rutas elegibles y el Quickstart (https://www.cometapi.com/quickstart/?utm_source=chatgpt.com) para configurar un cliente compatible con OpenAI.

Para respaldo en producción, siga la guía de rutas de respaldo de modelos de CometAPI (https://apidoc.cometapi.com/guides/model-fallback-with-cometapi) para cambiar de ruta sin repetir herramientas ya completadas ni descartar estado validado.

El acceso unificado simplifica la comparación de modelos y la integración de respaldos. Los presupuestos de tokens, la compactación, la validación, el filtrado de herramientas, los límites de reintentos y los criterios de aceptación siguen perteneciendo al nivel de la aplicación.

FAQ

Why do AI agents use more tokens than chatbots?

Los agentes hacen múltiples llamadas al modelo y pueden reenviar mensajes previos, resultados de herramientas, instrucciones y estado intermedio en cada paso. Esto hace que el contexto anterior se procese repetidamente.

Does prompt caching reduce context-window usage?

No. El caché de prompts puede reducir el precio efectivo o la latencia de la entrada repetida, pero los tokens en caché siguen formando parte del contexto procesado. Use compactación, filtrado o recuperación selectiva para reducir el tamaño del prompt.

When should an AI agent compact its context?

Compacte antes de que el crecimiento del contexto empiece a afectar el costo, la latencia o el espacio de salida disponible. Verifique que el estado compactado preserve decisiones, IDs de evidencia, archivos cambiados, preguntas abiertas y restricciones de seguridad.

Do subagents reduce token costs?

No automáticamente. Pueden reducir el tiempo transcurrido o mejorar la cobertura para trabajo independiente, pero el contexto duplicado y el análisis superpuesto a menudo aumentan el uso total de tokens.

What is the best metric for AI agent cost optimization?

Use el costo por tarea exitosa como métrica principal. Diagnostíquelo con entrada acumulada, amplificación del contexto, retención de herramientas, impuesto de reintentos, participación del razonamiento, latencia y tiempo de revisión humana.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más