Agentes de IA

Qué es un agente de IA y dónde falla de verdad

El 97,8 % y el 11,0 % son el mismo modelo, el mismo benchmark y la misma semana. Lo único que cambia es la longitud de la tarea. Toda la demo que te han enseñado está en el primer número y todo lo que te quieren vender está en el segundo.

¿Qué es exactamente un agente de IA?

Un agente es un modelo de lenguaje al que le has dado herramientas y permiso para decidir en qué orden usarlas. Le dices el objetivo, no los pasos. Él mira, prueba, lee el resultado, corrige y vuelve a intentarlo hasta que cree que ha terminado.

La definición que uso no es mía, es la de Anthropic en su propia guía de ingeniería, y distingue dos cosas que el mercado mezcla a propósito:

  • Un flujo de trabajo es un sistema donde el modelo y las herramientas se orquestan por caminos de código escritos de antemano. Tú decides la ruta; el modelo rellena los huecos.
  • Un agente es un sistema donde el modelo dirige dinámicamente su propio proceso y decide qué herramientas usa y cuándo.

Esa misma guía —escrita por el fabricante que vende los modelos— avisa de que la autonomía sale más cara, tarda más y acumula errores, y recomienda no empezar por ahí. Cuando el que cobra por el motor te dice que no le pongas más gas del necesario, conviene escucharle.

La regla corta, para el que no quiera leer más: si no hay un bucle de herramientas ni memoria de lo que ya ha hecho, no es un agente. Es un chatbot con un buen guion.

¿En qué se diferencia de un chatbot y de una automatización de toda la vida?

En quién decide el camino. Es la única diferencia que importa, y ordena todo lo demás:

Automatización clásica Chatbot Agente
Quién decide los pasos Tú, al montarla Tú, en el guion El modelo, sobre la marcha
Qué pasa con un caso raro Falla y avisa Contesta cualquier cosa Improvisa, y a veces acierta
Se puede probar antes Sí, entero Sí, casi entero Sólo estadísticamente
Cuesta por ejecución Céntimos o nada Muy poco Entre 2,5 y 4,2 dólares
Cuando falla, ¿de qué forma? Se para, o acierta mal en silencio Contesta mal y se ve Sigue adelante y da la tarea por hecha

Esa última fila es la que hay que leer dos veces. Una automatización mal montada también falla en silencio —eso lo he contado en por qué se rompen las automatizaciones—, pero cuando falla, falla siempre igual, y por eso se puede vigilar con una alerta. Un agente se equivoca de una forma distinta cada vez: improvisa un camino nuevo, escribe una nota de entrega con el número mal y da la tarea por terminada. No hay condición fija que vigilar, porque no hay un fallo, hay muchos.

¿De verdad funcionan los agentes de IA?

A veces, y depende casi sólo de la longitud de la tarea. En Odysseys, un banco de pruebas de abril de 2026 con 200 tareas web reales, el mejor modelo acierta el 97,8 % de las tareas fáciles y el 11,0 % de las difíciles. La media, 44,5 %, no describe bien a ninguno de los dos grupos.

Merece la pena mirarlo despacio, porque es el dato que ordena la conversación entera. Las tareas arrancan desde una búsqueda en Google, como haría una persona, y el modelo probado —Claude Opus 4.6, tope de gama en ese momento— era lo mejor que había. El desglose por dificultad:

Dificultad Tareas Acierto
Fáciles 45 97,8 %
Medias 46 71,7 %
Difíciles 109 11,0 %

Mismo modelo. Mismo benchmark. La misma semana. Lo único que cambia entre el 97,8 % y el 11,0 % es cuántos pasos encadenados hay que dar sin equivocarse.

Y esto no es un problema que se arregle esperando a la versión siguiente. Es aritmética: si cada paso sale bien el 95 % de las veces, veinte pasos seguidos salen bien el 36 % de las veces. La fiabilidad de una cadena es el producto de sus eslabones, y una cadena larga de decisiones buenas sigue siendo una cadena frágil.

Por eso el número que te tienes que llevar de aquí no es el 44,5 %. Es la brecha. El número global subirá con cada modelo nuevo; la brecha entre lo corto y lo largo lleva años sin cerrarse.

¿Por qué la demo siempre sale bien?

Porque toda demo que has visto es del primer grupo de esa tabla.

«Mira, le pido que me busque los tres proveedores más baratos de este material y me haga una tabla.» Eso es una tarea fácil: una fuente, pocos pasos, resultado verificable de un vistazo. Sale bien el 97,8 % de las veces, y la vez que sale mal se repite delante de ti y ya está.

«Que revise los albaranes del mes, los case con las facturas, detecte las diferencias, escriba a los proveedores que se han pasado y me deje un resumen.» Eso es el tercer grupo. Ochenta pasos, cuatro sistemas, y nadie mirando.

Lo que se vende en la demo y lo que se factura en el proyecto no están en la misma fila de la tabla. No hay engaño necesariamente: hay una extrapolación que el vendedor hace de buena fe y que los números no aguantan.

¿Qué miden los otros estudios que nadie te va a enseñar?

Van todos en la misma dirección.

La Universidad Carnegie Mellon montó una empresa de software falsa pero completa —con GitLab, OwnCloud, Plane y RocketChat, es decir, las herramientas de verdad— y le puso a los agentes 175 tareas de oficina normales. El mejor terminó por su cuenta el 30,3 %. Con puntuación parcial, es decir, dando crédito por haber avanzado algo, sube al 39,3 %. Tardó 27,2 pasos de media y costó unos 4,2 dólares por tarea. Los otros modelos que probaron se quedaron bastante por debajo: uno en el 26,3 % y otro en el 8,6 %.

Salesforce hizo lo más honesto que ha hecho un fabricante últimamente: medir agentes sobre su propio CRM y publicar que salen regular. Alrededor del 58 % de acierto cuando la tarea cabe en un solo turno, y cerca del 35 % cuando hay que mantener una conversación. Pero dentro de ese 58 % hay una categoría que se despega: cuando la tarea consiste en ejecutar un flujo con los pasos definidos de antemano, el acierto sube por encima del 83 %.

Ese último número es el que paga tu proyecto. No compares el 83 con el 35, que se miden de formas distintas; compáralo con el 58 de su propia columna. Aun así la lección es la misma que en Odysseys, y aquí medida sobre un CRM real: cuanto más acotado está el camino, más acierta. Eso no es una versión descafeinada de la idea. Es el diseño correcto.

Y hay un tercer trabajo, tau2-bench, que mide otra cosa y añade el matiz más incómodo: la repetibilidad. Ejecuta cada tarea cuatro veces y mira en cuántas sale bien las cuatro, no en cuántas sale bien alguna. Cuantas más repeticiones exiges, más baja la nota — es decir, el agente que te hizo la demo no es el mismo que se ejecuta el martes siguiente. Tu proceso no corre una vez para la foto: corre todas las semanas.

¿Cuánto cuesta cada intento, y cuánto cuesta cada tarea terminada?

Son dos preguntas distintas y sólo te van a contestar la primera.

Un intento agéntico multi-paso cuesta entre 2,5 y 4,2 dólares según cuál de los dos estudios mires. Suena barato comparado con una persona, y ahí se acaba la mayoría de las presentaciones.

Pero un intento no es una tarea terminada. A un 44,5 % de acierto, cada tarea realmente hecha te sale por unos 5,6 dólares. En el grupo difícil, con un 11,0 %, por unos 23 dólares. Y eso contando sólo el gasto del modelo, sin contar el rato que alguien dedica a comprobar cuáles de los intentos valen.

Ahora el otro lado. La documentación de precios de Anthropic pone como ejemplo unos 37 dólares por 10.000 conversaciones de soporte con su modelo pequeño, con unos 3.700 tokens por conversación. Eso son unos 0,0037 dólares por ticket.

Cuatro milésimas de dólar contra dos dólares y medio: unas setecientas veces. Parte de esa distancia es que ahí hay un modelo pequeño y en el agente uno caro, y hay que decirlo. Pero ningún modelo caro cuesta setecientas veces más que uno barato, así que el resto —la mayor parte— es lo otro: uno resuelve una decisión acotada de una sola pasada y el otro deambula ochenta pasos por cuatro sistemas, pagando cada paso.

La conclusión práctica es incómoda para quien vende agentes y muy útil para ti: casi todo lo que quieres hacer cabe en la fila barata, si alguien se toma la molestia de trocearlo.

¿Qué pasa con tus datos cuando el agente entra en el CRM?

El mismo estudio de Salesforce documenta algo que no he visto citado ni una vez en castellano: los agentes tienen una noción de confidencialidad casi nula. No distinguen bien qué dato es sensible ni a quién se le puede enseñar.

Y el remate: cuando les instruyes explícitamente para que la tengan, empeoran en la tarea. Hay un intercambio real entre que el agente sea cuidadoso y que el agente sea útil, y hoy no está resuelto.

Un agente con acceso a tu CRM tiene, por definición, acceso a datos personales de tus clientes. Eso te convierte en responsable de un tratamiento, con todo lo que eso arrastra, y el asunto merece su propia lectura: lo he desarrollado en IA y protección de datos en una pyme española, y dónde acaban físicamente esos datos está en dónde viven tus datos.

Lo que sí quiero dejar aquí es la regla operativa: dale al agente los permisos de la tarea, no los permisos de la persona. Si sólo necesita leer pedidos, no le des el CRM entero porque es más rápido de configurar.

¿Y el MCP? ¿Tengo que enterarme de esto?

Tú no. Quien te lo monte, sí.

El Model Context Protocol es un estándar abierto para que un modelo hable con herramientas y datos sin que haya que escribir un conector a medida para cada cosa. Nació en Anthropic, que lo donó en diciembre de 2025 a la Linux Foundation dentro de una fundación creada al efecto junto a Block y OpenAI. Hoy hay más de 10.000 servidores públicos y los kits de desarrollo se descargan cientos de millones de veces al mes; OpenAI lo documenta en su propia API.

Traducido a lo que te importa: es la diferencia entre que tu integración con el almacén sea un estándar o sea una pieza que sólo entiende quien la escribió. Es exactamente la conversación de siempre sobre no quedarte atado a un proveedor, con siglas nuevas.

La pregunta que tienes que hacer no es «¿usáis MCP?», que suena a examen y se contesta que sí. Es esta: «cuando terminemos, ¿esta integración la puede mantener otro sin rehacerla?»

¿Dónde sí aguanta hoy un agente en una pyme?

Donde la tarea es corta, la fuente es una, y hay alguien que ve el resultado antes de que salga por la puerta. Por orden de menos a más riesgo:

  1. Buscar y resumir dentro de tus propios documentos, con el enlace al original al lado para poder comprobarlo.
  2. Clasificar y encaminar: leer un correo entrante y decidir a qué cola va. Un fallo cuesta un reenvío.
  3. Extraer datos de un documento a un formulario, con revisión humana de lo dudoso.
  4. Redactar un borrador que una persona firma. El agente no envía; propone.
  5. Comprobar y avisar: mirar dos listas y decir en qué se diferencian, sin tocar ninguna.
  6. Actuar sobre un sistema real —crear el pedido, emitir el abono, escribir al cliente— sólo con pasos definidos de antemano y un tope de gasto.

Fíjate en que las cinco primeras terminan en un humano. Eso no es desconfianza: es que en las cinco primeras el error cuesta un minuto, y en la sexta cuesta un cliente.

Y una cosa que sí obliga la ley desde el 2 de agosto de 2026: si el agente habla con una persona, esa persona tiene derecho a saber que no está hablando con nadie. No es letra pequeña, es el artículo 50 del Reglamento europeo de IA. La Comisión, por cierto, ya ha aclarado que «agente de IA» no es una categoría legal aparte: se le aplican las definiciones que ya existían.

Un apunte antes del consejo, para que no te sientas tarde: en España usaba IA el 21,1 % de las empresas de 10 o más empleados en el primer trimestre de 2025 —25,7 % en servicios, 17,5 % en industria y 11,4 % en construcción—. Cuatro de cada cinco no habían empezado.

Lo que yo haría en tu lugar

No preguntarme «¿me pongo un agente?». Preguntarte esto:

¿Cuántos pasos seguidos tiene que dar esto sin que nadie mire?

Si son uno o dos, hoy funciona y es barato. Si son tres o cuatro con una revisión en medio, funciona y hay que diseñarlo con cuidado. Si son veinte y nadie mira, hoy la respuesta honesta es que se rompe, y quien te diga lo contrario o no lo ha medido o no te lo va a contar.

La jugada para una pyme en 2026 no es comprar autonomía. Es trocear el trabajo en tramos cortos, pegarlos con automatización de la aburrida y dejarle al modelo sólo los pasos que de verdad piden criterio. Es menos vistoso en una demo, cuesta una fracción y funciona el martes por la mañana.

Y aquí va la parte que me cuesta dinero decir: si al hacer esa cuenta te salen uno o dos pasos, no me necesitas. Eso lo monta tu informático, o tú mismo en una tarde, con las herramientas que ya pagas. Te lo voy a decir por teléfono antes de mandarte un presupuesto, porque cobrar por eso es cobrar por poner un modelo donde sobraba.

Si son más, y quieres saber en qué fila de la primera tabla cae tu proceso, eso se mide antes de comprar nada: es un diagnóstico, y sale con números. Y si ya has montado algo que a veces acierta y a veces no, empieza por entender por qué se rompe antes de rehacerlo.

Fuentes

Todo lo que se afirma arriba con una cifra o una fecha sale de aquí. Si alguna de estas páginas cambia y esta nota no, escríbeme y la corrijo.

  1. Odysseys — Benchmark de agentes web en tareas largas y realistas (arXiv, abril de 2026)
  2. TheAgentCompany — Universidad Carnegie Mellon, agentes en tareas de oficina (arXiv)
  3. CRMArena-Pro — Salesforce AI Research, agentes sobre un CRM real (arXiv)
  4. tau2-bench — Fiabilidad de agentes al repetir la misma tarea (arXiv)
  5. Anthropic — Building effective agents (flujo de trabajo frente a agente)
  6. npm — Descargas mensuales del SDK de TypeScript del Model Context Protocol
  7. Especificación oficial del Model Context Protocol
  8. INE — Uso de inteligencia artificial en las empresas españolas (ETICCE)

¿Tienes este problema ahora mismo?

Cuéntame en dos líneas a qué os dedicáis y qué proceso os come más horas. Te digo si hay algo que hacer, o si la respuesta honesta es esperar.

Cuéntame tu proceso por WhatsAppVolver a las notas

Se abre WhatsApp con el mensaje ya escrito. Lo lees, lo cambias y lo envías. Lo leo yo, no un bot — el día que conteste un bot, te lo diré. Respondo en menos de 4 horas laborables. Si prefieres hablarlo, la primera llamada es gratis: 25 minutos por teléfono.