Agende una llamada
Economía de la IA

Cuánto cuesta realmente operar un agente de IA

Operar un agente de IA cuesta lo que su diseño le permite gastar. El precio por token cambia cada pocos meses; la forma en que se construye el agente decide la factura. Cada token cae en uno de tres tipos de gasto: el que gira en vacío, que se recorta primero; el que produce, que se afina; y el que enseña, que se protege. Mida el costo por tarea aceptada, no el precio por token, y ajuste los ocho controles que lo determinan.

Denver, CO · 29 sep 2026 · 9 min de lectura

Podemos construirle el camión. ¿Cuánto cuesta la gasolina? Un indicador de combustible casi en vacío.
La construcción es el camión. La factura es cada ejecución que viene después.

Podemos construirle el camión. ¿Cuánto cuesta la gasolina? Es la pregunta más justa que hace un comprador sobre la IA, y la mayoría de los proveedores la responde encogiéndose de hombros. La respuesta honesta es que la gasolina depende del trayecto: tres kilómetros al día, o cruzar el país ida y vuelta cada semana. Pero el trayecto no es un misterio. Es un conjunto de decisiones de diseño, y las decisiones de diseño se pueden medir.

A continuación encontrará tres tareas reales del propio trabajo de Pisteyo, medidas a partir de registros de sesión y valoradas con los precios de lista que Anthropic publicaba el 1 de septiembre de 2026. Después viene la única cifra que vale la pena medir y los ocho controles que la mueven.

¿Por qué el precio por token es la cifra equivocada?

Porque caduca, y nunca fue la parte que usted controla. El costo de la IA tiene dos capas, una que perdura y otra que se vuelve obsoleta, y confundirlas es la forma en que los presupuestos se equivocan.

Ignore el precio por token. Caduca. Las tarifas cambian cada pocos meses, así que cualquier cifra que recuerde ya está desactualizada, incluidas las nuestras. En la lista de precios de Anthropic de hoy, el modelo Opus más reciente cuesta un 20% menos que el Opus con el que se midieron estos ejemplos, y el modelo Fable más reciente relee el contexto en caché por una cuarta parte de lo que cobraba su predecesor. El precio también puede mantenerse mientras la factura cambia: Anthropic señala que sus modelos Claude 4.7 y posteriores usan un tokenizador más nuevo que produce aproximadamente un 30% más de tokens para el mismo texto, y que el aumento exacto depende del contenido (documentación de precios de Anthropic, consultada el 29 de septiembre de 2026).

Aprenda cómo se construye. Eso perdura. La forma en que se construye un agente fija la factura, y ese conocimiento no caduca. Una tarea agéntica suele implicar entre diez y veinte llamadas al modelo, cada una releyendo lo anterior, y lo que dispara el costo son los reintentos, no la primera respuesta.

¿Qué paga realmente cuando compra tokens?

Cada solicitud se factura en tres capas, y cada una tiene un precio muy distinto.

CapaQué esCómo se facturaEjemplo: 500 palabras en Claude Opus 5
EntradaSu instrucción, toda la conversación hasta ese momento, los archivos y la definición de cada herramienta conectadaEs lo más barato por token, pero se acumula en silencio porque se reenvía en cada turnoUnos $0.003 USD. 500 palabras son unos 670 tokens: un tercio de centavo.
RazonamientoLo que el modelo piensa antes de responderUsted no lo ve, y se factura a la tarifa de salidaUnos $0.05 (razonamiento moderado): cerca de 2,000 tokens de razonamiento.
SalidaLa respuesta que usted leeEs lo más caro por token, y normalmente la más pequeña de las tresUnos $0.02. Una respuesta de 500 palabras son unos 670 tokens a la tarifa de salida.

Precios estimados con las tarifas de lista de Anthropic al 29 de septiembre de 2026: $5 USD por millón de tokens de entrada y $25 USD por millón de tokens de salida en Claude Opus 5. En un mes, estas cifras estarán desactualizadas.

Escribir 500 palabras costó un tercio de centavo. Las mismas 500 palabras de respuesta costaron cinco veces más, y un razonamiento moderado entre ambas costó unas quince veces más. El intercambio completo, 500 palabras de entrada y 500 de salida, cuesta unos 7 centavos. Así que diga todo lo que necesita decir, en voz alta si es más rápido. Ahorre ajustando el razonamiento y la respuesta a la tarea, no recortando su instrucción.

El razonamiento es la capa que sorprende. Una respuesta breve puede apoyarse en un largo monólogo interno que usted nunca ve y que igual paga, como el tiempo de cocina en la cuenta de un restaurante. La entrada es donde las facturas de los agentes crecen sin que nadie lo note, porque un agente relee sus instrucciones, sus herramientas y su historial cada vez que da un paso.

¿Cuáles son los tres tipos de gasto en tokens y qué hacer con cada uno?

Cada token que compra una organización cae en uno de tres tipos. El marco proviene de Nufar Gaspar en The AI Daily Brief, y convierte “nuestra factura de IA es demasiado alta” en una lista de tareas. Estos son los tres, cada uno con una tarea real de nuestro propio trabajo.

Gasto en vacío (spin): ataque esto primero

El gasto en vacío es actividad sin resultado. Tareas que se ejecutan con más frecuencia de la que cambian los datos, informes que nadie abre, agentes esperando en un horario. Es el único tipo de gasto que se recorta de inmediato.

Medido: un agente de informe nocturno

$675 USD al año

en informes automáticos que nadie lee

Una ejecución
3.5 millones de tokens en Claude Opus 5, $5.39
Por año
$1,350 en 250 ejecuciones
El desperdicio
$675, si la mitad de los informes no se lee

Nada falló. El agente hizo exactamente aquello para lo que fue construido, según lo programado. Esa es la lección del gasto en vacío: una automatización que funciona puede convertirse en desperdicio sin un solo error. La solución rara vez es un modelo más barato. Es ejecutar la tarea solo cuando cambian los datos y apagar las que nadie lee.

Producir (produce): afínelo

Producir es el trabajo que se entrega. El entregable, el análisis, el código. No lo recorte. El objetivo es que cada resultado aceptado cueste menos.

Medido: una presentación estratégica para la junta directiva

$21

por una presentación que reemplazó cerca de $6,500 de tiempo de personas

Una construcción
16.4 millones de tokens en Claude Opus 5
Por año
$43 en 2 construcciones
Tiempo de personas
2 o 3 personas durante una semana, a $65 la hora

Aquí es donde el miedo a la factura hace más daño. Un equipo que mira el gasto en IA en un tablero y se asusta empieza a racionar el trabajo que genera valor. Mejor afínelo: el modelo adecuado para cada paso, un primer borrador sólido y ediciones baratas después.

Enseñar (teach): protéjalo

Enseñar son los intentos necesarios para que un nuevo flujo de trabajo funcione. Experimentos, enfoques fallidos, la misma tarea ejecutada de tres maneras para saber cuál se sostiene. En un tablero parece puro desperdicio, porque no se entregó nada. Es el precio de aprender.

Medido: la depuración de un nuevo flujo de trabajo de IA

$16

118 intentos construyeron un flujo de trabajo que la empresa usa a diario

Una construcción
13.0 millones de tokens en Claude Fable 5
Por año
$32 en 2 ajustes
Lo que dejó
Un flujo de trabajo que se ejecuta todos los días desde entonces

Recortar el gasto en aprendizaje ahorra una cifra insignificante y sacrifica la curva de aprendizaje. Protéjalo y dé espacio para intentar a quienes lo hacen.

El orden importa, así que dígalo siempre igual: elimine el gasto en vacío, afine la producción, proteja el aprendizaje. Es lo que hace que una conversación sobre costos se sienta como ingeniería y no como austeridad.

¿Cuál es la única cifra que conviene medir?

El costo por tarea aceptada (cost per accepted task), no el precio por token. El precio por token es la etiqueta. El costo por tarea aceptada es lo que realmente cuesta un resultado que una persona acepta, contando cada reintento y cada minuto de revisión.

costo por
tarea aceptada =
todos los tokens gastados, reintentos incluidos + (minutos de revisión × costo total por hora)
resultados que una persona realmente aceptó

Pase por la fórmula la presentación de arriba. Los tokens costaron $21. Suponga que un revisor sénior dedica dos horas a revisarla: a $65 la hora, son $130. La presentación aceptada costó en realidad unos $151, y la revisión costó seis veces más que los tokens. Aun así, es cerca del 2% de los $6,500 de tiempo de personas que reemplazó.

De esa cuenta salen dos lecciones. Primero, un modelo barato que necesita tres intentos cuesta más que uno premium que acierta a la primera, y cuando se cuenta el tiempo de revisión, la diferencia es enorme. Segundo, cuente solo el tiempo de revisión que agrega la IA. Si alguien iba a revisar esa presentación de todos modos, esos minutos no son costo de la IA, y un buen director financiero lo va a preguntar.

Si una solución no puede reportar su propio costo por tarea aceptada, no está terminada.

¿Cuáles son los ocho controles que fijan la factura?

Estas son las decisiones de diseño que mueven una factura en un orden de magnitud. Evalúe con ellas cualquier flujo de trabajo, equipo o solución de un proveedor.

  1. Un modelo a la medida de la tarea. Ajuste la capacidad del modelo a la tarea, no a su precio. Pruebe con cinco a diez ejemplos reales antes de comprometerse, porque la intuición sobre qué modelo sale más barato suele estar al revés.
  2. Ponga presupuesto al ciclo. Limite las iteraciones y defina cómo se ve el trabajo terminado, para que pueda detenerse solo. La mayor parte del costo de una tarea agéntica llega después de la primera respuesta, al verificar y rehacer.
  3. Pague el costo de configuración una sola vez. Cada ejecución reenvía la configuración del agente, sus instrucciones permanentes y las definiciones de sus herramientas, antes de que alguien escriba una palabra. Manténgala ligera y guarde en caché lo que no cambia: en la lista de precios actual de Anthropic, una lectura en caché cuesta una décima parte del precio normal de entrada, o menos.
  4. Filtre en el origen. Recupere veinte filas, no quinientas. Anthropic estima una página web promedio de 10 kB en unos 2,500 tokens y un PDF de investigación de 500 kB en unos 125,000, así que entregarle al agente la página correcta en lugar del documento completo es una diferencia de cincuenta a uno. La precisión cuesta menos y responde mejor.
  5. Delimite la sesión. Tarea nueva, sesión nueva. El historial se reenvía en cada turno, así que una conversación maratónica cuesta más con cada mensaje y, por lo general, empeora en lugar de mejorar.
  6. Dosifique el razonamiento. Es el control más importante. El razonamiento se factura a la tarifa de salida, y pensar de más una pregunta simple sale más caro y peor. Defina el esfuerzo en cada paso, no una sola vez para todo.
  7. Instrumente la solución. Registre los tokens por ejecución y por resultado aceptado, y tome muestras de los minutos que las personas dedican a revisar. Si una solución no puede reportar su propio costo, no está terminada.
  8. Instale un interruptor de apagado. Todo lo programado lleva un límite de gasto, una alerta cuando el costo se dispara y una fecha de revisión. Nufar Gaspar ha contado el caso de un asistente propio, siempre activo, que acumuló una factura de cuatro cifras en dos semanas mientras ella viajaba y no lo usaba en absoluto: leyó cientos de millones de tokens y casi no escribió nada, por tareas programadas que el propio agente había creado. Los sistemas autónomos fallan en silencio, y hacia arriba.

Llévese la versión de una página

Todo el marco cabe en una página: los tres tipos de gasto, la fórmula y los ocho controles. Descargue el resumen de una página (PDF, en inglés) y téngalo a mano junto al presupuesto.

Crédito del marco: los tres tipos de gasto en tokens provienen de “Everything You Need to Know About AI Tokens”, The AI Daily Brief, 2 de agosto de 2026, con Nufar Gaspar. Los ejemplos de Pisteyo se midieron a partir de registros reales de sesión y se valoraron con los precios de lista que Anthropic publicaba el 1 de septiembre de 2026, incluidas las tarifas de caché. Cada uno cubre una sesión de trabajo, así que léalos como un orden de magnitud cercano y no como una factura. El tiempo de las personas se valora en $65 USD la hora.

medido, no adivinado

Acerca de Pisteyo

Pisteyo es una firma de consultoría de gestión que ayuda a las organizaciones a aprovechar la IA para impulsar la eficiencia operativa, fomentar la innovación y lograr una ventaja competitiva sostenible. A través de la asesoría estratégica, la implementación y la gobernanza, Pisteyo faculta a los líderes para integrar la IA de forma responsable y eficaz, escalando las personas, la adopción y el desempeño.

Más del tablero

Siga leyendo.

01

GPT-4o vs. o3: cómo se diferencian en la forma de pensar y resolver problemas con IA

Modelos de IA
02

Transformar la incorporación de empleados con automatización inteligente impulsada por IA

Recursos Humanos
03

Modelos de lenguaje pequeños: libere el poder de la IA de escritorio para resultados transformadores

Herramientas de IA