Pregúntele a un ingeniero de carreras qué hace que un coche sea rápido y puede que reciba una respuesta que parece contradictoria: los frenos. Un piloto que confía en los frenos mantiene la velocidad hasta bien entrada la curva. Un piloto que no lo hace levanta el pie antes de tiempo, en cada vuelta, y pierde tiempo en todas partes.
Unos buenos frenos no ralentizan el coche. Son la razón por la que se puede conducir al límite. Durante años, la gobernanza de la IA se ha vendido, y ha sido recibida con resentimiento, como lo contrario. Los equipos de riesgos eran los que decían que no. El cumplimiento normativo era el coste de usar la IA, un coste que se pagaba a regañadientes y se mantenía lo más bajo posible. La mayoría de los consejos de administración con los que hablamos todavía lo ven así: un lastre necesario para aquello que realmente crea valor.
En septiembre, Boston Consulting Group publicó un informe que debería acabar con esa visión. The Formula for Agentic AI Value, la edición de 2026 de su Applied AI Index, concluye que las empresas con un conjunto completo de controles sobre sus agentes de IA reportan aproximadamente tres veces más valor de dichos agentes que las empresas con solo uno. En palabras del propio BCG: “Los controles de riesgo eficaces sirven como un facilitador, no como un freno”.
Esa es la buena noticia, y merece una amplia difusión. Nuestro argumento empieza un paso más allá, y lo expondremos directamente. BCG ha medido el valor del control dentro de una empresa. Que ese valor se mantenga fuera de ella, ante un regulador, una aseguradora, un cliente o la persona sobre la que decide un agente, depende de si alguien que no creó los controles puede verificarlos. Hoy en día, casi nadie puede hacerlo. Si se le pregunta a un consejo de administración cuánto valen sus agentes y si están bajo control, la respuesta sincera suele ser: creemos que sí. El control es lo que triplica el valor. La prueba es lo que permite que cualquier otra persona confíe en él. Esa es la brecha que validant.ai existe para cerrar.
A quién va dirigido
Este artículo está dirigido a consejos de administración, directores de riesgos, responsables de IA y equipos de cumplimiento normativo que están poniendo agentes en producción o a punto de hacerlo, y a quienes se les pedirá que los respalden. La primera parte resume el informe y no requiere conocimientos técnicos. La cuarta parte analiza un ejemplo concreto. En la quinta parte explicamos qué hace validant.ai al respecto y por qué cambia el valor de esa ganancia triple.
No somos neutrales. Desarrollamos las herramientas y realizamos las evaluaciones que producen pruebas independientes sobre los sistemas de IA, y este artículo argumenta que el mercado las necesita. Hemos mantenido el resumen del informe de BCG separado de nuestro argumento al respecto, y decimos claramente en qué puntos nuestras propias herramientas no están terminadas.
Resumen ejecutivo
- 01
El valor de la IA es real y está concentrado
Las empresas que combinan claridad estratégica con IA aplicada reportan aproximadamente cinco veces más valor de la IA que las empresas que carecen de ambas. La IA agéntica es la porción de ese valor que más rápido crece, del 17% en 2025 a un 39% proyectado para 2030.
- 02
Los controles lo multiplican
Las empresas con seis controles de agentes implementados en toda la organización reportan aproximadamente tres veces el valor agéntico que las empresas con solo uno. Solo el 5% los tiene, mientras que el 42% espera que para 2030 los agentes tomen decisiones sin aprobación humana.
- 03
Cada control de la lista es interno
Ninguno de los seis tiene en cuenta a las personas sobre las que decide un agente, y ninguno implica que alguien externo a la empresa verifique el resultado. Las palabras fairness y regulación no aparecen en el informe, y la propia encuesta se basa en autoinformes, como señala BCG.
- 04
La prueba es el control que falta
Fairness medida donde las personas se ven afectadas, medición honesta que declara lo que podría omitir y pruebas selladas para que terceros puedan verificarlas. Eso convierte la gobernanza de una creencia interna en un valor en el que otros pueden confiar.
Primera parte · Qué midió BCG
El Applied AI Index se basa en una encuesta a 1330 CxO y altos ejecutivos que toman decisiones sobre IA, en más de 60 países y más de 20 sectores, más de la mitad de ellos en empresas con ingresos superiores a 5000 millones de dólares. Su idea central cabe en una servilleta: claridad estratégica más IA aplicada es igual a impacto transformador.
La claridad estratégica tiene que ver con las decisiones. Significa concentrar la IA en unas pocas áreas de alto valor, gestionarla como un único programa plurianual financiado y propiedad de la alta dirección, y hacer un seguimiento de su valor en la cuenta de resultados en lugar de en presentaciones. La IA aplicada tiene que ver con la ejecución. Tiene tres partes: un modelo operativo construido en torno a los agentes y los controles para gestionarlos, una plantilla rediseñada en torno a la colaboración entre humanos y agentes y una plataforma de datos que los agentes puedan usar realmente.
Cuando ambos se unen, las cifras cambian. Las empresas fuertes en claridad e IA aplicada obtuvieron un valor de la IA de aproximadamente el 4.5% de los ingresos en 2025. Las empresas débiles en ambos aspectos obtuvieron un 0.9%. Esa es la brecha de cinco veces que aparece en el titular de BCG.
Cuatro niveles, una pequeña élite
BCG clasifica a las empresas en cuatro grupos. En 2026, el 4.5% están estancadas, el 47% son emergentes, el 41% están escalando y el 7.5% son lo que BCG llama «future-built» (preparadas para el futuro), un aumento desde el 5% del año anterior. El grupo «future-built» es donde se concentra el valor. Entre ellas, el 95% mide el valor de la IA con KPI claros o directamente en la cuenta de resultados, y afirman que alcanzan el impacto en unos 11 meses, frente a los 17 de las rezagadas.
Hay un detalle revelador en los datos de medición. Fuera del grupo líder, la mayoría de las empresas, en palabras de BCG, “vuelan a ciegas”: el 47% de las rezagadas miden el valor de la IA, en el mejor de los casos, de forma direccional. Un análisis independiente de BCG citado en el informe concluyó que, aunque casi nueve de cada diez CEO ven beneficios de costes o ingresos de la IA, solo el 14% ha definido claramente el impacto en la cuenta de resultados de cada iniciativa.
Los agentes son la fuente de las próximas ganancias
El subtítulo del informe trata sobre los agentes por una razón. La IA agéntica representó el 17% del valor de la IA en 2025 y el 22% en 2026. BCG proyecta un 39% para 2030, lo que la convertiría en la mayor fuente única de valor de la IA. La brecha aquí es más pronunciada que en ningún otro lugar: el 44% de las empresas «future-built» afirman que ya obtienen todo el valor de los agentes, frente al 2% de las rezagadas.
| Lo que reporta BCG | Figura |
|---|---|
| Valor de la IA, empresas fuertes frente a débiles en claridad e IA aplicada | 4.5% frente a 0.9% de los ingresos (2025) |
| Porcentaje de empresas que son «future-built» | 7.5% en 2026, un aumento desde el 5% |
| Cuota de la IA agéntica en el valor de la IA | 17% (2025), 22% (2026), 39% proyectado (2030) |
| Valor agéntico con los seis controles frente a con solo uno | 1.8% frente a 0.5% de los ingresos |
| Empresas que aplican los seis controles actualmente | 5% |
| Empresas que esperan que los agentes decidan sin aprobación humana para 2030 | 42% |
Interpretar las cifras por lo que son
Hay una salvedad que se aplica a todo lo que sigue, y BCG la declara abiertamente en su metodología. Las cifras proceden de ejecutivos que estiman la madurez de su propia organización en 41 capacidades. A menos que se indiquen como realizadas en la cuenta de pérdidas y ganancias (P&L) de 2025, las cifras de valor representan el impacto futuro esperado. Y las respuestas «pueden estar sujetas a un sesgo de percepción».
Eso no es un defecto del informe. Es la naturaleza de una encuesta. Pero es importante para el argumento, porque significa que el informe es un retrato fidedigno de cómo se ven las empresas a sí mismas. Nos dice lo que los ejecutivos creen sobre su IA y sus controles. No puede decirnos si esas creencias sobrevivirían a una mirada externa. Volveremos sobre ello en la tercera parte.
Segunda parte · Seis controles, el triple de valor
La parte del informe más importante para cualquiera que despliegue agentes es una breve lista. El escalado de agentes, según BCG, conlleva un riesgo que denomina proliferación de agentes: agentes duplicados, permisos contradictorios, propiedad poco clara y lagunas en la supervisión. El cambio más profundo es que los agentes combinan datos, herramientas, memoria y otros agentes a través de los flujos de trabajo, de modo que los riesgos pueden «surgir dinámicamente y agravarse a la velocidad de las máquinas». El antiguo modelo operativo de riesgos, creado para un software que hace lo que se le dice, no es suficiente.
BCG identifica seis controles que cierran esta brecha:
- 01Memoria y contexto. Cómo los agentes almacenan y recuperan la información. La memoria puede potenciar el aprendizaje entre agentes, pero también puede transmitir errores, datos sensibles o contexto manipulado de un flujo de trabajo a otro.
- 02Alcance y supervisión. Para qué sirve cada agente, qué puede hacer, con qué fines y cuándo debe intervenir una persona. La autoridad no solo está limitada por lo que un agente puede alcanzar, sino por lo que se le permite hacer.
- 03Evaluación y reversión. Criterios de evaluación, puertas de liberación, supervisión continua y una forma de revertir. Los controles deben detectar desviaciones, anomalías y riesgos emergentes tras el despliegue, «no simplemente determinar si un agente era seguro en el momento de su lanzamiento».
- 04Herramientas e integración. Formas estandarizadas para que los agentes utilicen herramientas, API y datos, con registros que muestren qué agentes se están ejecutando, a qué pueden acceder y cómo interactúan.
- 05Propiedad y responsabilidad. Una persona designada para cada agente relevante, responsable de su uso y resultados, con autoridad clara sobre quién puede modificarlo, suspenderlo o detenerlo.
- 06Seguridad. Controles en tiempo de ejecución, pistas de auditoría y barreras de protección de costes que conserven pruebas suficientes para reconstruir qué hizo un agente, bajo la autoridad de quién, con qué datos y herramientas, y qué controles activó.
La cifra que cambia el debate
Las empresas con los seis controles implantados en toda la organización reportan un valor agéntico de aproximadamente el 1,8 % de los ingresos. Las empresas con solo uno reportan un 0,5 %. Esa es la diferencia de tres veces, y BCG lo expresa sin rodeos: «Controlar los agentes no disminuye su valor, sino que lo triplica». Si se lee con precisión, 1,8 frente a 0,5 se acerca más a 3,6, y el informe cita una cifra de 3,6 veces al comparar los controles vigentes en toda la empresa con los que solo están en fase piloto. BCG eligió la palabra más conservadora, y nosotros también. La combinación de barreras de protección de riesgos centrales con una implementación federada permite escalar tres veces más flujos de trabajo que una dirección totalmente centralizada.
No todos los controles tienen el mismo peso. En el análisis de BCG sobre los impulsores de valor, la memoria y el contexto son los que más pesan (32 puntos de importancia relativa), seguidos del alcance y la supervisión (21) y la evaluación y reversión (18). Les siguen las herramientas e integración (13), la propiedad y responsabilidad (9) y la seguridad (7).
La brecha que esto conlleva
Junto a las buenas noticias se encuentra la cifra incómoda. El 42 % de las empresas espera que los agentes actúen de forma autónoma para 2030, tomando decisiones sin aprobación humana. Entre las empresas de nueva generación, dos tercios esperan una autonomía limitada o total. Sin embargo, solo el 5 % aplica los seis controles en la actualidad.
BCG también asigna una tarea a los consejos de administración. Deben establecer y revisar periódicamente el apetito de riesgo de IA de la organización, mientras que la dirección mantiene un inventario completo de los agentes. Los consejos deben tener visibilidad de los más importantes: su propósito, su autoridad, sus dependencias clave y quién puede intervenir o detenerlos. Y deben revisar los proveedores de IA críticos, los puntos únicos de fallo, los planes de contingencia y los incidentes graves o las lagunas de control.
“Los controles de riesgo eficaces actúan como un facilitador, no como un freno: implantar los controles adecuados en toda la empresa casi triplica el valor que crean los agentes.”
BCG, The Formula for Agentic AI Value
Tercera parte · Lo que un control autodeclarado no puede decirle
Los seis controles son buena ingeniería, y suscribiríamos cada uno de ellos. Sin embargo, si los lee de nuevo, fíjese para quién son. Cada control de la lista es algo que una empresa aplica a sus propios agentes, para su propio beneficio, y sobre lo que informa ella misma. Esa es la lista correcta para capturar valor. Es una lista incompleta para cualquiera que tenga que confiar en el resultado.
| Control de BCG | Qué analiza | Quién lo verifica |
|---|---|---|
| Memoria y contexto | Lo que el agente almacena y transmite | La empresa |
| Alcance y supervisión | Qué puede hacer el agente y cuándo interviene una persona | La empresa |
| Evaluación y reversión | Cómo funciona el agente y cómo revertirlo | La empresa |
| Herramientas e integración | A qué herramientas, API y datos puede acceder el agente | La empresa |
| Propiedad y responsabilidad | Quién en la organización responde por el agente | La empresa |
| Seguridad | Qué hizo el agente, registrado para auditoría | La empresa |
Faltan tres cosas.
Las personas afectadas
Busque en el informe la palabra «fairness» y no la encontrará. Lo mismo ocurre con el sesgo (bias) en el sentido de que la IA trate a las personas de forma diferente, y con la discriminación. No se menciona al solicitante, al prestatario, al paciente o al reclamante sobre el que decide un agente.
Es una laguna extraña en un informe sobre agentes que toman decisiones. Los propios ejemplos de BCG incluyen una aseguradora de salud cuyas llamadas entrantes tratan principalmente sobre prestaciones y cobertura, y donde los chatbots agénticos gestionan ahora cerca del 60 % de todos los tipos de llamadas entrantes, y una empresa de externalización de procesos de negocio que está pasando de vender mano de obra y tiempo a vender resultados habilitados por IA. Para las aseguradoras, el informe clasifica la tramitación de siniestros como la principal fuente de valor de la IA. Estos son exactamente los ámbitos en los que una decisión automatizada afecta a una persona. Un agente puede superar los seis controles y aun así aprobar a un grupo de solicitantes con menos frecuencia que a otro. Su memoria está bien configurada, su alcance delimitado, sus puertas de lanzamiento establecidas, sus herramientas registradas, su propietario nombrado y cada acción registrada. Ninguno de los seis se daría cuenta, porque ninguno de ellos se fija en ello.
Ya expusimos el argumento más a fondo en El sesgo es el cimiento: la «fairness» no es una característica que se añade al final. El sesgo (bias) se introduce a través de los datos, el modelo y el revisor humano, y un bucle de retroalimentación lo devuelve a la siguiente ronda de datos de entrenamiento. Los agentes añaden nuevos puntos de entrada: las herramientas que eligen, los documentos que recuperan, las notas que se pasan entre ellos.
Regulación
El informe no menciona la EU AI Act. Conforme a la Ley, en su versión modificada por la Directiva Ómnibus Digital sobre IA, las obligaciones para los sistemas de alto riesgo enumerados en el Anexo III se aplicarán a partir del 2 de diciembre de 2027. Estas cubren la IA utilizada en la contratación y gestión de trabajadores, en la evaluación de la solvencia y la calificación crediticia, y en la evaluación de riesgos y la fijación de precios para seguros de vida y de salud. Faltan catorce meses para esa fecha. BCG afirma que las empresas preparadas para el futuro alcanzan el impacto en unos once meses. Un agente que entre en producción este trimestre ya estará operando en su estado regulado.
La responsabilidad jurídica llega antes. La Directiva revisada de la UE sobre responsabilidad por productos defectuosos trata el software, incluidos los sistemas de IA, como un producto, y se aplica a los productos comercializados o puestos en servicio después del 9 de diciembre de 2026, dentro de nueve semanas. Para las empresas de esos mercados, varios de los seis controles de BCG dejan de ser buenas prácticas para convertirse en obligaciones. La evaluación tras el despliegue, la supervisión humana documentada y los registros de lo que hizo un sistema ya no son opcionales. Y una vez que se aplique la responsabilidad, la pregunta que hará un tribunal no es si una empresa creía que sus controles funcionaban. Sino qué puede demostrar la empresa. Como argumentamos en La paradoja de la garantía preventiva, «lo hizo el modelo» no es una defensa.
Cualquier persona ajena a la empresa
La tercera laguna es a la que conducen las otras. Un control que solo su propietario puede verificar es una promesa. Puede que sea sincera y puede que sea cierta. Pero un regulador, un cliente, una aseguradora o un consejero independiente no tiene forma de distinguir un control que funciona de uno que está bien descrito.
La encuesta muestra el mismo límite a gran escala. Cuando 1330 ejecutivos califican sus propios controles, el resultado es un mapa detallado de la autoevaluación. BCG lo dice, y esa honestidad le honra. En Precisión no es prueba llamamos a esto la diferencia entre señalar y ver: una afirmación puede señalar lo correcto y aun así no decir nada sobre lo bien que se ha observado. «Tenemos implementada la evaluación y la reversión» apunta a un control. No dice qué podría haber pasado por alto la evaluación.
“Un control que solo su propietario puede verificar es una promesa, no una prueba.”
Tercera parte · Lo que un control autodeclarado no puede decirle
Nada de esto es una crítica a BCG. El informe responde a la pregunta que se propuso responder: ¿cómo capturan valor las empresas de los agentes? La pregunta que deja abierta es la que decide si ese valor se sostiene cuando lo examina un tercero.
Cuarta parte · Un comité de préstamos, seis controles
Un ejemplo concreta esta laguna. Proviene de los objetos de prueba que publicamos con nuestra biblioteca abierta, vfairness, con los datos y el arnés de pruebas, para que cualquiera pueda volver a ejecutarlo.
Dos agentes forman un pequeño comité de préstamos. Un agente de selección (screener) lee cada solicitud y escribe una puntuación de riesgo y una nota de una frase para el revisor. Un revisor puntúa y decide dos veces: una vez basándose solo en la solicitud, y otra después de leer la respuesta del agente de selección. Enviamos treinta solicitudes, cada una con doce nombres que indican género y origen (suizo, kosovar y nigeriano) y una vez sin nombre como control, y todo el proceso dos veces: 780 episodios, en los que solo cambiaba el nombre. Guardamos la puntuación y la decisión de cada agente en cada paso, no solo la respuesta final.
Ahora, sometamos el comité a los seis controles de BCG.
- 01Memoria y contexto. La nota del agente de selección es exactamente el tipo de contexto sobre el que advierte BCG: información que un agente pasa al siguiente. Un buen control de memoria decide cómo se almacena esa nota, quién puede leerla y durante cuánto tiempo existe. No pregunta si la nota es justa (fair).
- 02Alcance y supervisión. Ambos agentes se mantienen dentro de su alcance. El agente de selección selecciona, el revisor revisa, un humano puede anular la decisión.
- 03Evaluación y reversión. Una puerta de lanzamiento típica comprueba la precisión, la latencia y las tasas de rechazo. El comité supera la prueba.
- 04Herramientas e integración. Ambos agentes están registrados, con el acceso correcto.
- 05Propiedad. Hay un propietario designado que puede detener al comité.
- 06Seguridad. Cada acción queda registrada. Toda la evidencia está ahí.
Los seis controles están en verde. Esto es lo que la prueba de «fairness» encontró en los mismos registros.
| Punto de decisión | Dispersión de las puntuaciones de riesgo medias entre los seis grupos (escala de 100 puntos) | ¿Confirmado por los datos? |
|---|---|---|
| Agente de selección (Screener) | 3.4 puntos, de 43.8 (mujeres suizas) a 47.1 (hombres nigerianos) | Sí (p < 0.001) |
| Revisor, solo con la solicitud | 2.9 puntos, de 48.1 (mujeres kosovares) a 51.0 (hombres suizos) | No (p = 0.06) |
| Revisor, tras leer la respuesta del agente de selección | 4.9 puntos, de 49.0 (mujeres suizas) a 53.9 (hombres nigerianos) | Sí (p < 0.001) |
| Amplificación por el traspaso de información, como efecto independiente | Sugerido por el aumento de 2,9 a 4,9 | No establecido |
El evaluador inicial puntuó las mismas solicitudes de forma diferente según el nombre, en 3,4 puntos en una escala de riesgo de 100 puntos, y la diferencia fue estadísticamente clara. Solo con la solicitud, el revisor mostró una dispersión de 2,9 puntos que los datos no pudieron confirmar. Tras leer la respuesta del evaluador inicial, la dispersión del revisor aumentó a 4,9 puntos y se volvió clara.
Un detalle más importa, porque es donde la honestidad cuesta algo. Los datos sugieren que la transferencia amplificó el sesgo del revisor, pero el aumento en sí no superó la prueba, y nuestro análisis de amplificación no lo confirmó como un efecto separado. Así que nuestro informe dice exactamente eso: una disparidad confirmada en el evaluador inicial, una disparidad confirmada en el revisor después de la transferencia, y amplificación no establecida. No redondea el tercer hallazgo para convertirlo en un titular.
Ese es el objetivo del ejemplo. Cada uno de los controles de BCG funcionó según lo diseñado, y ninguno de ellos pudo ver el problema, porque el problema no estaba en cómo se ejecutaban los agentes. Estaba en cómo trataban a las personas. Verlo requirió un tipo de control diferente: uno que mide los resultados por grupo, a nivel de cada agente y cada transferencia, y dice claramente cuán seguro está.
“Los seis controles estaban en verde. La disparidad estuvo en los registros todo el tiempo. Nadie les había hecho esa pregunta a los registros.”
Cuarta parte · Un comité de préstamos, seis controles
Quinta parte · Del control a la prueba
Creamos validant.ai para el espacio que hay entre un control y la evidencia de que funciona. Nuestro enfoque tiene tres pasos, los mismos para un modelo de contratación, una puntuación de crédito o un agente: medir si un sistema trata a los grupos de personas de forma diferente, explicar qué impulsa la diferencia y probar el resultado en una forma que cualquiera pueda verificar.
Cómo se alinea con los seis controles de BCG
Esta es la correspondencia honesta, incluyendo lo que no está terminado. Preferimos publicar una tabla con lagunas que una afirmación que no podemos respaldar.
| Control de BCG | Lo que hacen validant.ai y vfairness | Estado |
|---|---|---|
| Evaluación y reversión | Puertas de Fairness que bloquean un lanzamiento en el pipeline de CI/CD, monitorización continua con detección de deriva y resultados que dicen “evidencia insuficiente” en lugar de aprobar lo que no pudieron medir. | Disponible hoy |
| Seguridad y pista de auditoría | Los resultados registran la versión del método y los umbrales utilizados, y las ejecuciones de agentes y LLM también la versión de la biblioteca, los parámetros y una marca de tiempo UTC; el veredicto se sella como una credencial firmada que cualquiera puede verificar, sin necesidad de una cuenta. | Disponible hoy |
| Memoria y contexto | Pruebas multiagente que muestran cuándo la salida de un agente sesga la decisión del siguiente, como en el comité de préstamos anterior. | Disponible en beta; hasta ahora verificado solo con nuestras propias pruebas. |
| Herramientas e integración | Pruebas sobre si un agente elige herramientas o recupera documentos de forma diferente dependiendo de a quién se refiera el caso. | Disponible en beta; un objeto de prueba de elección de herramienta publicado, ninguno todavía para la recuperación. |
| Propiedad y responsabilidad | El Sello de Confianza nombra a la organización responsable del sistema, tal como esa organización lo declara. | Parcialmente: registramos la propiedad tal como se declara; aún no la verificamos ni la hacemos cumplir. |
| Alcance y supervisión | Mandatos de agente firmados que establecen lo que un agente puede hacer en nombre de alguien y que pueden ser revocados. | Propuesto, no construido |
El control que la lista omite
Si la lista de BCG tuviera un séptimo punto, abogaríamos por este: Fairness, medida donde las personas se ven afectadas. No una puntuación agregada para todo el sistema, que puede ocultar un problema real al promediarlo, sino una medición por grupo, por punto de decisión y por transferencia entre agentes, con su incertidumbre estadística declarada y una tercera respuesta cuando los datos no pueden respaldar ninguno de los dos veredictos. Eso es lo que hace nuestra biblioteca abierta, vfairness, hace. Cubre datos de entrenamiento, modelos, LLM, agentes y sistemas multiagente, y es gratuita bajo la licencia Apache-2.0, para que cualquiera pueda volver a ejecutar nuestras mediciones y decirnos en qué no está de acuerdo.
Tres cuerpos, no uno
En La confianza digital es una órbita, no un pilar describimos la confianza en la IA como el equilibrio entre tres cuerpos: el modelo que decide, la organización que responde por él y la persona sobre la que se decide. Los seis controles de BCG residen casi por completo en el segundo cuerpo. Describen cómo una organización ejecuta sus agentes.
validant.ai añade los otros dos y conecta los tres:
- 01El modelo. Medimos lo que el sistema hace realmente, por grupo, y explicamos qué impulsa cualquier brecha.
- 02La organización. Evaluamos si la gobernanza funciona como se describe y nombramos al propietario responsable en el sello, tal como la organización lo declara.
- 03La persona. En una demostración práctica, un solicitante de empleo recibió un Recibo de Decisión en una cartera personal real en swiyu, la beta pública de la infraestructura de confianza de e-ID de Suiza: por qué se tomó esa decisión y cómo solicitar una revisión humana. Los motivos en esa demostración se escribieron a mano. Producirlos desde el sistema decisorio e integrar plenamente este cuerpo en la plataforma es el siguiente paso en nuestra hoja de ruta.
Evidencia que sale del edificio
El paso más importante es el último. No construimos, alojamos ni vendemos los sistemas que evaluamos. Nuestros resultados se emiten como credenciales verificables, firmadas y comprobables por un regulador, un cliente o un miembro del consejo sin iniciar sesión y sin confiar en nosotros. Cada hallazgo indica lo que pudimos ver y lo que no: cuánto acceso tuvimos, cuán robusto era el método, cuán reciente es el resultado. Un sello cubre un sistema en un momento dado, y así lo indica.
Por qué la prueba es lo que hace valer la triplicación del valor
Dicho de forma sencilla: la triplicación de BCG es el valor que crea una empresa. Que conserve ese valor lo deciden personas que no estaban presentes cuando se crearon los controles. Cada una de ellas le resta valor a un control que no puede verificar. El suscriptor de seguros lo valora como si no existiera. El equipo de compras vuelve a enviar el cuestionario el próximo trimestre. El supervisor solicita los registros que respaldan la política. El tribunal trata la descripción como una mera afirmación. Esa infravaloración es la brecha, y es por donde se escapa la triplicación del valor.
| Quién tiene que creer en sus controles | Solo con un control interno | Con pruebas verificables |
|---|---|---|
| Un regulador o supervisor | Una descripción del proceso y una solicitud de los registros que lo respaldan | Resultados por grupo, firmados y fechados, que puedan comprobar sin acceder a sus sistemas |
| Una aseguradora | La respuesta a un cuestionario, valorada como si el control no existiera | Disparidades medidas con su incertidumbre estadística y una declaración de lo que la prueba podría haber omitido |
| Un cliente que compra resultados generados por IA | Una garantía contractual y el mismo cuestionario el próximo trimestre | Una credencial que su propio equipo pueda verificar |
| La persona sobre la que decide un agente | Nada que puedan ver | Un justificante de la decisión y una vía para la revisión humana (hoy en fase de demostración) |
| Su propio consejo de administración | Una autoevaluación | Una visión externa de los agentes más importantes |
Este es el argumento directo a favor de lo que hacemos. Los controles hacen que los agentes sean gobernables. Las pruebas independientes y verificables hacen que esa gobernanza sea creíble para cada uno de estos lectores a la vez. Una empresa que puede entregar a cada uno de ellos algo que puedan comprobar no tiene que argumentar a favor de su triplicación del valor. Puede demostrarla.
“BCG muestra a las empresas cómo controlar a sus agentes. Nosotros les ayudamos a demostrárselo a quien no tiene motivos para creer en su palabra.”
Quinta parte · Del control a la prueba
Sexta parte · Qué hacer ahora
Para un consejo de administración, un comité de riesgos o un equipo que pone agentes en producción, el informe y las brechas que lo rodean se resumen en seis pasos. Ninguno de ellos necesita esperar a un regulador.
- 01Haga un inventario de sus agentes. No puede controlar lo que no ha inventariado. Anote cada agente que toma o conforma una decisión, qué puede hacer, qué datos y herramientas utiliza y quién es su propietario. BCG pide a la dirección que mantenga exactamente este inventario, y a los consejos que examinen los agentes más importantes que contiene. La mayoría de las empresas aún no lo tienen.
- 02Implante los seis controles en todas partes, no en un piloto. Los datos de BCG indican que el valor proviene de tenerlos todos, en toda la empresa. Un piloto bien gobernado junto a una producción sin gobernar es lo peor de ambos mundos.
- 03Añada la Fairness a la evaluación. Para cada agente que decida sobre personas, compruebe las diferencias entre grupos antes del lanzamiento y siga haciéndolo después, porque los agentes derivan y también lo hacen las personas a las que sirven. Pruebe cada transferencia entre agentes, no solo la respuesta final.
- 04Mida con honestidad. Un resultado positivo en una muestra pequeña demuestra muy poco. Pregunte a cada prueba qué magnitud de problema podría haber omitido, y trate la “falta de pruebas suficientes” como un hallazgo, no como un aprobado.
- 05Conserve pruebas que otros puedan comprobar. Los registros que solo usted puede leer son un comienzo. Los resultados que un regulador, una aseguradora o un cliente puedan verificar sin tener que confiar en usted son lo que contará cuando las normas de responsabilidad, el AI Act o un gran cliente lo soliciten.
- 06Obtenga una visión externa sobre lo más importante. Haga que al menos sus agentes más importantes sean evaluados por alguien que no los haya creado. No todos los agentes lo necesitan. Los que deciden sobre créditos, empleos, salud o dinero, sí.
Séptima parte · Lo que nos gustaría y lo que quizá no consigamos
La historia tentadora se escribe sola. Los consejos de administración leen a BCG, ven que los controles triplican el valor, se preguntan cómo sabrían que sus controles funcionan y añaden la evaluación independiente a la partida presupuestaria que BCG denomina gobernanza. Nos gustaría que esa historia fuera cierta. Hay buenas razones para ser cautelosos con ella.
El efecto de triplicación es una correlación. Las empresas con los seis controles también son, muy probablemente, mejores en muchas otras cosas: datos, talento, enfoque. BCG no afirma que los controles por sí solos causen el valor extra, y tampoco debería hacerlo nadie que cite la cifra, incluidos nosotros. La interpretación más segura es que unos controles sólidos y unos resultados sólidos van de la mano, y que las empresas que escalan agentes sin controles están haciendo una apuesta que los líderes no hacen.
La Fairness no está en el informe, y eso puede decir algo sobre el mercado. Si los ejecutivos que BCG encuestó no ven la Fairness como parte de la gobernanza de los agentes, muchos compradores tampoco lo harán, al menos hasta que un regulador, un tribunal o un titular de prensa les obligue. Creemos que esa visión es corta de miras. También sabemos que un argumento mejor no cambia los presupuestos por sí solo.
Los presupuestos de gobernanza son pequeños. En el desglose de BCG, la gobernanza es la partida más pequeña del gasto en IA, alrededor del 0.3% de los ingresos sobre un total del 3.3%. La evaluación independiente tiene que encajar en esa partida, junto a la estrategia, la gestión de riesgos y el cumplimiento normativo.
Nuestras propias herramientas no son todas maduras. Como muestra la tabla de la quinta parte, las pruebas de agentes y multiagentes están en beta y hasta ahora se han verificado principalmente contra nuestras propias pruebas, y los mandatos de agente firmados aún no se han desarrollado. Publicamos lo que hemos verificado y lo que no en nuestra página de calidad y robustecimiento, porque un proveedor de evaluación que oculta sus propios límites está cometiendo el error que existe para detectar.
Así que esto es un argumento, no una previsión. Creemos que las empresas que capturen el valor que describe BCG serán las que puedan demostrar que sus controles funcionan, no solo las que los tengan. Estaremos encantados de debatir con cualquiera que lo vea de otra manera.
La confianza se evalúa, no se afirma. Si su organización está poniendo agentes en producción y desea pruebas independientes y verificables de su comportamiento, antes de que lleguen las normas de responsabilidad en diciembre y las obligaciones de alto riesgo del AI Act en diciembre de 2027, nuestra beta cerrada está abierta a un grupo reducido. Escriba a hello@validant.ai con el asunto “Closed Beta” o solicite una demostración. Para probar el motor abierto hoy mismo: pip install vfairness.
En una línea
BCG ha demostrado que controlar los agentes no es un freno a su valor, sino la razón por la que este se multiplica. El siguiente paso es hacer visible ese control: para las personas sobre las que deciden los agentes, para los reguladores y para cualquiera que tenga que confiar en el resultado sin creer en su palabra. Los frenos le permiten ir rápido. La prueba permite que otros le acompañen.
“La confianza se evalúa, no se afirma. Un control que nadie más puede verificar sigue siendo una afirmación.”
El control de los agentes triplica su valor
Fuentes y lecturas adicionales
- 01Apotheker, J., Beauchene, V., de Bellefonds, N., et al. (2026). La fórmula del valor de la IA agéntica: el índice de IA aplicada 2026. Boston Consulting Group, septiembre de 2026. Todas las cifras y citas de BCG en este artículo proceden de este informe.
- 02Unión Europea. (2026). Reglamento (UE) 2026/1744 (Ómnibus digital sobre IA), por el que se modifica el Reglamento (UE) 2024/1689. Diario Oficial de la Unión Europea, 24 de julio de 2026. Establece la aplicación de las obligaciones de alto riesgo del anexo III para el 2 de diciembre de 2027.
- 03Unión Europea. (2024). Reglamento (UE) 2024/1689 (Ley de IA). Diario Oficial de la Unión Europea. Anexo III, puntos 4 y 5, letras b) y c).
- 04Unión Europea. (2024). Directiva (UE) 2024/2853 relativa a la responsabilidad por los daños causados por productos defectuosos. Diario Oficial de la Unión Europea. Artículo 2, apartado 1, y considerando 13.
- 05validant.ai. Objetos de prueba de vfairness: el comité de préstamos, con sus datos de ejecución, harness y notebook ejecutado.
- 06validant.ai. vfairness en PyPI, Apache-2.0.
- 07validant.ai. Verificar un sello de confianza: comprueba la firma y el estado de revocación de un sello, sin necesidad de una cuenta.
- 08validant.ai. Calidad y fortalecimiento de vfairness: qué se verifica y qué no.
- 09Glinz, D. (2026). La precisión no es una prueba: la trampa en cada veredicto de Fairness de la IA. validant.ai Signal.
- 10Glinz, D. (2026). La paradoja de la garantía preventiva: ¿quién vigila las barreras de protección de la IA? validant.ai Signal.
- 11Glinz, D. (2026). El sesgo es la base. validant.ai Signal.
- 12Glinz, D. (2026). La confianza digital es una órbita, no un pilar. validant.ai Signal.
- 13Glinz, D. (2026). Los agentes actuarán por nosotros. ¿Quién responde por ellos? validant.ai Signal.
- 14Glinz, D. (2026). El problema de la confianza que nadie quiere nombrar. validant.ai Signal.
InvestigaciónAbrir para leerLa precisión no es prueba: la trampa en cada veredicto de equidad de la IA
Un modelo que predice perfectamente deja de asegurar a nadie; un veredicto publicado sin su límite de detección le invita a asumir que el límite es cero. Dos fallos, una omisión y dos palabras prestadas para distinguirlos.
Leer
InvestigaciónAbrir para leerLa confianza digital es una órbita, no un pilar
La confianza no es un pilar más que añadir. Es la órbita que tres cuerpos trazan juntos: el modelo, la persona y la organización. Por qué el problema de los tres cuerpos es la metáfora más honesta para una IA fiable y cómo saber en qué punto de la órbita se encuentra.
Leer
InvestigaciónAbrir para leerLa paradoja de la garantía preventiva: ¿Quién vigila las barreras de protección de la IA?
En una semana de septiembre, un laboratorio pidió ralentizar el ritmo, un presidente se declaró la única barrera de protección que necesita la IA y The Economist se preguntó si la carrera armamentística puede detenerse. Apuntes de los Trust Valley Days 2026 en la EPFL sobre por qué la respuesta no es una pausa ni un esprint, sino la responsabilidad, los resultados y la verificación.
Leer