Podemos construirle el camión. ¿Cuánto cuesta la gasolina? Es la pregunta más justa que hace un comprador sobre la IA, y la mayoría de los proveedores la responde encogiéndose de hombros. La respuesta honesta es que la gasolina depende del trayecto: tres kilómetros al día, o cruzar el país ida y vuelta cada semana. Pero el trayecto no es un misterio. Es un conjunto de decisiones de diseño, y las decisiones de diseño se pueden medir.
A continuación encontrará tres tareas reales del propio trabajo de Pisteyo, medidas a partir de registros de sesión y valoradas con los precios de lista que Anthropic publicaba el 1 de septiembre de 2026. Después viene la única cifra que vale la pena medir y los ocho controles que la mueven.
¿Por qué el precio por token es la cifra equivocada?
Porque caduca, y nunca fue la parte que usted controla. El costo de la IA tiene dos capas, una que perdura y otra que se vuelve obsoleta, y confundirlas es la forma en que los presupuestos se equivocan.
Ignore el precio por token. Caduca. Las tarifas cambian cada pocos meses, así que cualquier cifra que recuerde ya está desactualizada, incluidas las nuestras. En la lista de precios de Anthropic de hoy, el modelo Opus más reciente cuesta un 20% menos que el Opus con el que se midieron estos ejemplos, y el modelo Fable más reciente relee el contexto en caché por una cuarta parte de lo que cobraba su predecesor. El precio también puede mantenerse mientras la factura cambia: Anthropic señala que sus modelos Claude 4.7 y posteriores usan un tokenizador más nuevo que produce aproximadamente un 30% más de tokens para el mismo texto, y que el aumento exacto depende del contenido (documentación de precios de Anthropic, consultada el 29 de septiembre de 2026).
Aprenda cómo se construye. Eso perdura. La forma en que se construye un agente fija la factura, y ese conocimiento no caduca. Una tarea agéntica suele implicar entre diez y veinte llamadas al modelo, cada una releyendo lo anterior, y lo que dispara el costo son los reintentos, no la primera respuesta.
¿Qué paga realmente cuando compra tokens?
Cada solicitud se factura en tres capas, y cada una tiene un precio muy distinto.
| Capa | Qué es | Cómo se factura | Ejemplo: 500 palabras en Claude Opus 5 |
|---|---|---|---|
| Entrada | Su instrucción, toda la conversación hasta ese momento, los archivos y la definición de cada herramienta conectada | Es lo más barato por token, pero se acumula en silencio porque se reenvía en cada turno | Unos $0.003 USD. 500 palabras son unos 670 tokens: un tercio de centavo. |
| Razonamiento | Lo que el modelo piensa antes de responder | Usted no lo ve, y se factura a la tarifa de salida | Unos $0.05 (razonamiento moderado): cerca de 2,000 tokens de razonamiento. |
| Salida | La respuesta que usted lee | Es lo más caro por token, y normalmente la más pequeña de las tres | Unos $0.02. Una respuesta de 500 palabras son unos 670 tokens a la tarifa de salida. |
Precios estimados con las tarifas de lista de Anthropic al 29 de septiembre de 2026: $5 USD por millón de tokens de entrada y $25 USD por millón de tokens de salida en Claude Opus 5. En un mes, estas cifras estarán desactualizadas.
Escribir 500 palabras costó un tercio de centavo. Las mismas 500 palabras de respuesta costaron cinco veces más, y un razonamiento moderado entre ambas costó unas quince veces más. El intercambio completo, 500 palabras de entrada y 500 de salida, cuesta unos 7 centavos. Así que diga todo lo que necesita decir, en voz alta si es más rápido. Ahorre ajustando el razonamiento y la respuesta a la tarea, no recortando su instrucción.
El razonamiento es la capa que sorprende. Una respuesta breve puede apoyarse en un largo monólogo interno que usted nunca ve y que igual paga, como el tiempo de cocina en la cuenta de un restaurante. La entrada es donde las facturas de los agentes crecen sin que nadie lo note, porque un agente relee sus instrucciones, sus herramientas y su historial cada vez que da un paso.
¿Cuáles son los tres tipos de gasto en tokens y qué hacer con cada uno?
Cada token que compra una organización cae en uno de tres tipos. El marco proviene de Nufar Gaspar en The AI Daily Brief, y convierte “nuestra factura de IA es demasiado alta” en una lista de tareas. Estos son los tres, cada uno con una tarea real de nuestro propio trabajo.
Gasto en vacío (spin): ataque esto primero
El gasto en vacío es actividad sin resultado. Tareas que se ejecutan con más frecuencia de la que cambian los datos, informes que nadie abre, agentes esperando en un horario. Es el único tipo de gasto que se recorta de inmediato.
Medido: un agente de informe nocturno
$675 USD al año
en informes automáticos que nadie lee
- Una ejecución
- 3.5 millones de tokens en Claude Opus 5, $5.39
- Por año
- $1,350 en 250 ejecuciones
- El desperdicio
- $675, si la mitad de los informes no se lee
Nada falló. El agente hizo exactamente aquello para lo que fue construido, según lo programado. Esa es la lección del gasto en vacío: una automatización que funciona puede convertirse en desperdicio sin un solo error. La solución rara vez es un modelo más barato. Es ejecutar la tarea solo cuando cambian los datos y apagar las que nadie lee.
Producir (produce): afínelo
Producir es el trabajo que se entrega. El entregable, el análisis, el código. No lo recorte. El objetivo es que cada resultado aceptado cueste menos.
Medido: una presentación estratégica para la junta directiva
$21
por una presentación que reemplazó cerca de $6,500 de tiempo de personas
- Una construcción
- 16.4 millones de tokens en Claude Opus 5
- Por año
- $43 en 2 construcciones
- Tiempo de personas
- 2 o 3 personas durante una semana, a $65 la hora
Aquí es donde el miedo a la factura hace más daño. Un equipo que mira el gasto en IA en un tablero y se asusta empieza a racionar el trabajo que genera valor. Mejor afínelo: el modelo adecuado para cada paso, un primer borrador sólido y ediciones baratas después.
Enseñar (teach): protéjalo
Enseñar son los intentos necesarios para que un nuevo flujo de trabajo funcione. Experimentos, enfoques fallidos, la misma tarea ejecutada de tres maneras para saber cuál se sostiene. En un tablero parece puro desperdicio, porque no se entregó nada. Es el precio de aprender.
Medido: la depuración de un nuevo flujo de trabajo de IA
$16
118 intentos construyeron un flujo de trabajo que la empresa usa a diario
- Una construcción
- 13.0 millones de tokens en Claude Fable 5
- Por año
- $32 en 2 ajustes
- Lo que dejó
- Un flujo de trabajo que se ejecuta todos los días desde entonces
Recortar el gasto en aprendizaje ahorra una cifra insignificante y sacrifica la curva de aprendizaje. Protéjalo y dé espacio para intentar a quienes lo hacen.
El orden importa, así que dígalo siempre igual: elimine el gasto en vacío, afine la producción, proteja el aprendizaje. Es lo que hace que una conversación sobre costos se sienta como ingeniería y no como austeridad.
¿Cuál es la única cifra que conviene medir?
El costo por tarea aceptada (cost per accepted task), no el precio por token. El precio por token es la etiqueta. El costo por tarea aceptada es lo que realmente cuesta un resultado que una persona acepta, contando cada reintento y cada minuto de revisión.
tarea aceptada =
Pase por la fórmula la presentación de arriba. Los tokens costaron $21. Suponga que un revisor sénior dedica dos horas a revisarla: a $65 la hora, son $130. La presentación aceptada costó en realidad unos $151, y la revisión costó seis veces más que los tokens. Aun así, es cerca del 2% de los $6,500 de tiempo de personas que reemplazó.
De esa cuenta salen dos lecciones. Primero, un modelo barato que necesita tres intentos cuesta más que uno premium que acierta a la primera, y cuando se cuenta el tiempo de revisión, la diferencia es enorme. Segundo, cuente solo el tiempo de revisión que agrega la IA. Si alguien iba a revisar esa presentación de todos modos, esos minutos no son costo de la IA, y un buen director financiero lo va a preguntar.
Si una solución no puede reportar su propio costo por tarea aceptada, no está terminada.
¿Cuáles son los ocho controles que fijan la factura?
Estas son las decisiones de diseño que mueven una factura en un orden de magnitud. Evalúe con ellas cualquier flujo de trabajo, equipo o solución de un proveedor.
- Un modelo a la medida de la tarea. Ajuste la capacidad del modelo a la tarea, no a su precio. Pruebe con cinco a diez ejemplos reales antes de comprometerse, porque la intuición sobre qué modelo sale más barato suele estar al revés.
- Ponga presupuesto al ciclo. Limite las iteraciones y defina cómo se ve el trabajo terminado, para que pueda detenerse solo. La mayor parte del costo de una tarea agéntica llega después de la primera respuesta, al verificar y rehacer.
- Pague el costo de configuración una sola vez. Cada ejecución reenvía la configuración del agente, sus instrucciones permanentes y las definiciones de sus herramientas, antes de que alguien escriba una palabra. Manténgala ligera y guarde en caché lo que no cambia: en la lista de precios actual de Anthropic, una lectura en caché cuesta una décima parte del precio normal de entrada, o menos.
- Filtre en el origen. Recupere veinte filas, no quinientas. Anthropic estima una página web promedio de 10 kB en unos 2,500 tokens y un PDF de investigación de 500 kB en unos 125,000, así que entregarle al agente la página correcta en lugar del documento completo es una diferencia de cincuenta a uno. La precisión cuesta menos y responde mejor.
- Delimite la sesión. Tarea nueva, sesión nueva. El historial se reenvía en cada turno, así que una conversación maratónica cuesta más con cada mensaje y, por lo general, empeora en lugar de mejorar.
- Dosifique el razonamiento. Es el control más importante. El razonamiento se factura a la tarifa de salida, y pensar de más una pregunta simple sale más caro y peor. Defina el esfuerzo en cada paso, no una sola vez para todo.
- Instrumente la solución. Registre los tokens por ejecución y por resultado aceptado, y tome muestras de los minutos que las personas dedican a revisar. Si una solución no puede reportar su propio costo, no está terminada.
- Instale un interruptor de apagado. Todo lo programado lleva un límite de gasto, una alerta cuando el costo se dispara y una fecha de revisión. Nufar Gaspar ha contado el caso de un asistente propio, siempre activo, que acumuló una factura de cuatro cifras en dos semanas mientras ella viajaba y no lo usaba en absoluto: leyó cientos de millones de tokens y casi no escribió nada, por tareas programadas que el propio agente había creado. Los sistemas autónomos fallan en silencio, y hacia arriba.
Llévese la versión de una página
Todo el marco cabe en una página: los tres tipos de gasto, la fórmula y los ocho controles. Descargue el resumen de una página (PDF, en inglés) y téngalo a mano junto al presupuesto.
Crédito del marco: los tres tipos de gasto en tokens provienen de “Everything You Need to Know About AI Tokens”, The AI Daily Brief, 2 de agosto de 2026, con Nufar Gaspar. Los ejemplos de Pisteyo se midieron a partir de registros reales de sesión y se valoraron con los precios de lista que Anthropic publicaba el 1 de septiembre de 2026, incluidas las tarifas de caché. Cada uno cubre una sesión de trabajo, así que léalos como un orden de magnitud cercano y no como una factura. El tiempo de las personas se valora en $65 USD la hora.
