Costes
La factura mensual de la IA: cuánto cuesta de verdad tenerla encendida
Atender diez mil conversaciones con un modelo pequeño cuesta lo que hora y media de trabajo administrativo. Y sin embargo hay empresas pagando cientos de euros al mes por lo mismo, casi siempre por uno de estos cuatro motivos.
Los precios de esta nota los comprobé en la documentación de cada fabricante el 1 de septiembre de 2026, los revisé el 8, y están en dólares porque así los publican. El cambio que uso es el de referencia del BCE de ese día: 1,1590 $ por euro.
¿Cuánto cuesta usar un modelo de IA al mes?
Mucho menos de lo que la gente teme. La propia documentación de Anthropic publica la cuenta: diez mil conversaciones de soporte, con una media de 3.700 tokens cada una, cuestan unos 37 $ con su modelo pequeño. Son unos 32 €. La factura del modelo casi nunca es lo que decide si un proyecto sale a cuenta.
Para ponerlo al lado de algo conocido: una hora efectiva de trabajo administrativo cuesta 20,15 € de coste real de empresa en España. Diez mil conversaciones atendidas equivalen a hora y media de ese coste. Tres milésimas de euro por conversación.
Si alguien te ha dicho que la IA es cara por el consumo, o está vendiéndote otra cosa o la ha montado mal. Las dos posibilidades aparecen más adelante.
¿Qué es un token y por qué se factura así?
Un token es un trozo de palabra. La regla gruesa que dan los fabricantes es que un token son unos cuatro caracteres, o tres cuartos de palabra en inglés; en español salen algunos más para el mismo texto. Todo lo que entra y todo lo que sale se cuenta en esa unidad.
Y se cobran por separado, que es la parte que sorprende: la salida cuesta entre cuatro y seis veces más que la entrada en casi todos los modelos. Un sistema que lee mucho y responde poco —clasificar correos, extraer datos de una factura, decidir a quién va un aviso— es barato por diseño. Uno que escribe informes largos, no.
Éstos son los precios por millón de tokens el día que escribo:
| Modelo | Entrada | Salida |
|---|---|---|
| Gemini 2.5 Flash-Lite | 0,10 $ | 0,40 $ |
| GPT-5.6-luna | 0,20 $ | 1,20 $ |
| Claude Haiku 4.5 | 1 $ | 5 $ |
| Claude Sonnet 5 | 2 $ | 10 $ |
| GPT-5.6-terra | 2 $ | 12 $ |
| Claude Opus 5 | 5 $ | 25 $ |
Entre la primera fila y la última hay un factor de cincuenta en la entrada. Elegir modelo por tarea en vez de elegir uno para todo es, con diferencia, la decisión que más mueve la factura.
Las cuatro formas de multiplicar la factura sin darte cuenta
Aquí es donde se va el dinero de verdad. Ninguna de las cuatro se ve en una demo, y las cuatro se arreglan.
1. No usar caché
Casi todos los asistentes reenvían el mismo bloque de texto en cada consulta: el manual, las instrucciones, el catálogo, las reglas de la casa. Eso no cambia, y aun así se paga entero cada vez.
La caché de contexto existe justo para eso. Leer de caché cuesta el 10 % del precio de entrada normal; escribirla cuesta un 25 % más que la entrada, y se amortiza en la primera lectura.
La cuenta, con un asistente que lleva delante un manual de 20.000 tokens y atiende mil consultas al mes sobre un modelo intermedio: sin caché son 20 millones de tokens de entrada, unos 40 $. Con caché, suponiendo que se reescriba doscientas veces porque va caducando, salen unos 13 $. Tres veces menos por un cambio que es una línea de configuración.
2. Volver a pagar toda la conversación en cada turno
Un modelo no recuerda nada. Cada vez que respondes, se le vuelve a mandar la conversación entera. Eso significa que el turno veinte paga los diecinueve anteriores otra vez.
Con turnos de 500 tokens y una conversación de veinte, el texto son 10.000 tokens y lo facturado son 105.000. Diez veces más, y crece con el cuadrado de la longitud, no en línea recta. Por eso una conversación larga no es «un poco más cara»: es otra categoría de gasto.
Se arregla resumiendo lo viejo, recortando lo que ya no hace falta o cerrando la conversación cuando el asunto terminó. Ninguna de las tres cosas ocurre sola.
3. El agente que reintenta
Un agente que falla y lo vuelve a intentar paga las dos veces. Si falla tres, paga tres. Y como el reintento suele estar programado para ser silencioso, la única señal que llega es la factura a fin de mes.
Esto no es un problema de precios, es un problema de diseño, y lo conté entero en qué es un agente de IA y dónde falla: el mismo modelo que acierta el 97,8 % en una prueba de laboratorio baja al 11 % en otra, y cada intento fallido es dinero.
4. Subir de modelo «porque es mejor»
Pasar del modelo pequeño al grande multiplica por cinco entrada y salida. A veces vale la pena; casi nunca para todas las tareas del sistema.
Y hay una vuelta de tuerca que casi nadie ha visto venir: los modelos nuevos de Anthropic, de la versión 4.7 en adelante, usan un tokenizador que produce alrededor de un 30 % más de tokens para el mismo texto. Es decir, que actualizar a un modelo con el mismo precio por millón de tokens puede subirte la factura un tercio sin que hayas cambiado ni una coma de tu sistema. Lo dice su propia documentación, y es el tipo de detalle que sólo encuentras si vas a leer la fuente.
Lo que se factura y no son tokens
Tres partidas que aparecen en la factura y no en el presupuesto:
- Búsqueda web: 10 $ por cada mil búsquedas en la API de Anthropic, más los tokens de lo que la búsqueda traiga. Un asistente que busca en internet en cada respuesta tiene un coste por consulta que no depende del texto.
- Ejecución de código: 0,05 $ por hora y contenedor pasadas las 1.550 horas gratis al mes, en el mismo proveedor. Poco dinero, pero es una partida que no existe hasta que existe.
- Almacenamiento de caché: Google cobra la caché por hora que la tengas guardada, además de por leerla. Cachear cosas que se consultan una vez al día puede salir más caro que no cachear.
Y luego está lo de siempre, que no es IA: el servidor donde vive el asistente, entre 10 y 30 € al mes, y las tarifas del canal por el que habla. Si es WhatsApp, ésas las pone Meta y tienen su propia lógica, que desmenucé en cuánto cuesta un asistente de WhatsApp.
La rebaja que casi nadie usa: por lotes
Si la tarea puede esperar unas horas, el procesamiento por lotes cuesta la mitad, en los tres proveedores. Clasificar el correo de la noche, resumir las llamadas del día, extraer los datos de las facturas de la semana: todo eso puede esperar.
Lo que no puede esperar es un cliente delante de un chat. La regla es simple: si hay una persona esperando la respuesta, precio normal; si no la hay, por lotes. Mucha gente paga precio de urgencia por tareas que nadie está mirando.
¿Y cuál es el gasto real de una pyme, entonces?
En los sistemas que yo mantengo, el consumo de modelo de una pyme típica va de 5 a 60 € al mes. Un asistente de atención con volumen normal, un buscador documental que se consulta cien veces al día, una automatización que clasifica correo: todo eso vive ahí abajo.
La consecuencia incómoda es ésta: si el consumo es la partida pequeña, no es donde hay que optimizar. Ahorrar veinte euros de tokens rediseñando medio sistema es una hora de trabajo que cuesta más que el ahorro anual. El dinero está en las horas humanas que el sistema quita o deja de quitar, y de eso hablo en qué procesos compensa automatizar.
Dicho lo cual, hay un caso en el que sí importa y mucho: cuando alguien montó el sistema sin caché, sin control de contexto y con el modelo más caro «por si acaso». Ahí no estás pagando IA, estás pagando negligencia, y suele multiplicar por veinte lo que debería costar.
Cómo le pongo yo un techo a esto
Cuatro cosas, y ninguna es sofisticada:
- Un límite de gasto en el panel del proveedor, con aviso al 50 %. Es una casilla y evita el disgusto del mes siguiente.
- Un modelo por tarea, no un modelo para todo. Clasificar con el pequeño; redactar de cara al cliente con el bueno.
- Caché en todo lo que no cambia, y un límite de longitud en las conversaciones.
- Una cifra en el informe mensual: cuánto se ha gastado y cuántas veces se ha usado. Sin eso, no hay forma de saber si el coste por consulta sube o baja.
Esto es literalmente parte de lo que entrego en el Doc de guardia de lo que lleva IA, desde 190 €/mes: el consumo del modelo lo pagas tú directamente al proveedor, con tu cuenta y tu tarjeta, y yo pongo los límites y te digo cada mes qué ha pasado. Nunca revendo consumo con margen, porque el día que gane dinero con tu factura de tokens dejo de ser quien te la baja.
Las tres preguntas para tu proveedor
Si ya tienes a alguien montándotelo, esto se contesta en un correo:
- ¿Qué modelo usas y cuánto cuesta cada consulta? Si no sabe el coste por consulta, no lo ha medido nunca.
- ¿Está cacheado el contexto fijo? Si la respuesta es «¿el qué?», ahí tienes tu factor diez.
- ¿Con qué cuenta se paga el consumo? Si es la suya y te la refactura, estás pagando el margen de alguien sobre una cifra que no puedes auditar.
Y si lo que tienes es un sistema heredado del que nadie sabe ni qué modelo usa, eso se mira antes de tocarlo: es un rescate, sale con la factura desmenuzada y con una lista de lo que se puede bajar la semana siguiente.
Fuentes
Todo lo que se afirma arriba con una cifra o una fecha sale de aquí. Si alguna de estas páginas cambia y esta nota no, escríbeme y la corrijo.
¿Tienes este problema ahora mismo?
Cuéntame en dos líneas a qué os dedicáis y qué proceso os come más horas. Te digo si hay algo que hacer, o si la respuesta honesta es esperar.
Se abre WhatsApp con el mensaje ya escrito. Lo lees, lo cambias y lo envías. Lo leo yo, no un bot — el día que conteste un bot, te lo diré. Respondo en menos de 4 horas laborables. Si prefieres hablarlo, la primera llamada es gratis: 25 minutos por teléfono.