Un modelo que predice a la perfección no fija precios de seguros más justos, sino que deja de asegurar a todo el mundo. Un veredicto de Fairness publicado sin su límite de detección invita al lector a asumir que el límite es cero. Dos fallos diferentes, una omisión compartida y un par de palabras prestadas para distinguirlos.
La objeción del actuario suele llegar a los veinte minutos de la primera reunión, una vez terminadas las formalidades y alguien se siente con la confianza suficiente para decir lo que realmente piensa.
Fairness, dice, es un término vago. La tarificación del riesgo no es un fallo moral. El objetivo de los seguros es distinguir los buenos riesgos de los malos, y si no pudiéramos hacerlo, no habría producto que vender. Los atributos protegidos están fuera de discusión, de acuerdo, nadie lo discute. Pero más allá de esa línea, existe el derecho legítimo a cobrar más donde se espera que la pérdida sea mayor. Así que hay que afinar el modelo. Un modelo más afinado da un precio más justo, no menos justo.
La otra objeción procede de quienes compran las auditorías, y se plantea con mucha menos frecuencia de la que debería. Su informe dice que el modelo es justo. ¿En qué se basó ese veredicto? ¿Vieron cómo funcionaba por dentro o se limitaron a enviarle unos miles de prompts y leer las respuestas?
Uno trata la precisión como una virtud. El otro la trata como una afirmación. Si se ponen uno al lado del otro, dejan de ser dos argumentos.
A quién va dirigido
Por principio, indicamos el público al que nos dirigimos antes de exponer el argumento, porque el lector determina cómo debe redactarse una conclusión, y fingir lo contrario es la receta para que los informes acaben siendo imprecisos.
Este artículo está dirigido a quienes gobiernan los sistemas de IA y a quienes los revisan desde fuera: riesgos y cumplimiento, auditoría interna, riesgo de modelos, evaluadores externos y cualquier miembro del consejo que tenga que firmar algo. Los ingenieros quizá prefieran saltar a las partes tres y cuatro, donde se explica el método. La primera parte no requiere conocimientos técnicos y está escrita para cualquiera a quien le hayan ofrecido una prima y se haya preguntado cómo se ha llegado a esa cifra.
No somos neutrales en esto. Vendemos evaluaciones, por lo que tenemos interés en el estándar que propone este artículo. También nos cuesta algo, lo que abordaremos en la sexta parte.
Resumen ejecutivo
Dos argumentos que resultan ser uno solo.
El argumento de la mutualización. Un modelo de riesgo que predice a la perfección no fija precios de seguros justos. Abolisce los seguros. La transferencia de riesgos necesita una incertidumbre residual para funcionar, y a medida que aumenta la granularidad, el fondo común se descompone en un conjunto de prepagos individuales. La cobertura deja entonces de estar disponible precisamente para las personas que el modelo ha identificado como necesitadas. Cierta imprecisión es el mecanismo, no un defecto del mismo. Lo que hace que el argumento sea difícil de descartar es que se basa en la lógica actuarial, no en la ética.
El argumento de la visibilidad. Una conclusión sobre Fairness o explicabilidad vale lo que valen el acceso, el método y la actualidad que la respaldan. Calificamos los tres: un nivel de acceso, un grado de evidencia y un grado de validez, que se escriben A2 · E2 · V2.
Y una corrección. El artículo sobre la órbita establecía tres diales (cuerpo, trayectoria y público) que sitúan una evaluación. El siguiente paso obvio es añadir la garantía como un cuarto dial. Lo redactamos así, y fue un error. Un dial indica hacia dónde se ha apuntado. No dice nada sobre la calidad de la visión una vez allí, y son dos cosas distintas que revelar. La astronomía observacional las separó hace siglos y tiene palabras para ambas: el apuntado y la visibilidad. Las tomamos prestadas.
Lo que une las dos mitades es el título. La precisión no es una prueba. En el sector de los seguros, un modelo perfectamente preciso no es justo; llevado al límite, deja de ser un seguro. En una evaluación, un veredicto que parece totalmente seguro no está demostrado. Ambos confunden un número preciso con aquello a lo que solo alude: la aseguradora interpreta un modelo más exacto como un precio más justo, la junta directiva lee «no se ha detectado ninguna disparidad» como «no existe ninguna disparidad», y en ambos casos se omite lo que habría matizado esa cifra. En el caso de un veredicto, los dos elementos que se omiten son los que dan nombre a este artículo: el enfoque (qué hemos observado) y la visibilidad (con qué claridad hemos podido observarlo). Una evaluación solo es precisa cuando ambos quedan registrados.
Primera parte · Por qué un modelo perfecto deja de asegurar a todo el mundo
El seguro es una apuesta a la ignorancia, y esa ignorancia tiene que ser compartida.
Un grupo de personas aporta dinero a un fondo común. Nadie sabe de antemano quién estrellará el coche contra un seto, a quién le encontrarán un bulto o quién bajará las escaleras y se encontrará con treinta centímetros de agua del río en el pasillo. El fondo paga a quienquiera que le ocurra. Las primas reflejan la pérdida esperada del grupo, de modo que los que tienen suerte acaban pagando por los que no la tienen, y todos compran lo mismo: la liberación de una varianza que no podrían haber absorbido por sí solos. Esa liberación es el producto. No el pago de la indemnización, que la mayoría de los miembros nunca llega a ver.
Ahora, mejoremos el modelo.
Cada mejora divide el fondo común en compartimentos más pequeños, y las primeras divisiones son obviamente buenas. Separar a un transportista profesional de alguien con tres multas por exceso de velocidad es exactamente la discriminación sobre la que se basa el producto. Negarse a hacerlo no sería más que una subvención de los prudentes a los imprudentes, sin ninguna justificación. Nadie en su sano juicio se opone.
Pero sigamos. La telemática resuelve al conductor en lugar del grupo demográfico. Los wearables resuelven el cuerpo en lugar de la franja de edad. Las imágenes aéreas resuelven su tejado real en lugar de su código postal. Cada paso es defendible por sí mismo, y aquí viene la parte incómoda: nadie tiene que decidir darlo. Una aseguradora que se niega a segmentar ve cómo un competidor que no se niega le arrebata sus buenos riesgos, se queda con el resto, sube los precios para cubrirlo, pierde el siguiente nivel de buenos riesgos a manos del mismo competidor y descubre un año más tarde que la decisión que creía estar tomando se había tomado por ella en algún momento del segundo trimestre. La competencia hace el trabajo. Es un efecto trinquete.
Sigámoslo hasta el final. A cada persona se le cotiza su propia pérdida prevista más un recargo. No hay transferencia de varianza entre nadie, porque, en opinión de la aseguradora, ya no hay varianza que transferir. Lo que se tiene entonces es un plan de prepago con gastos administrativos añadidos, y llamarlo seguro es una cortesía.
El daño tampoco se reparte de forma equitativa. Recae en la persona que el modelo ha marcado como de alto riesgo, que es, por supuesto, la persona para la que existía el producto. Se le cotiza una prima igual a la pérdida que se espera que sufra. No puede pagarla. Esa incapacidad es la única razón por la que quería un seguro. Mientras tanto, al hombre que le gusta al modelo se le ofrece algo barato, de lo que podría haber prescindido fácilmente. El producto deja de estar disponible donde más se necesita, en el preciso instante en que alcanza su máxima precisión.
Se puede ver cómo esto sucede ahora, a plena luz del día, sin ningún avance en la modelización. La cobertura contra inundaciones e incendios forestales en zonas expuestas de California, Florida y, cada vez más, del sur de Europa, tiene un precio superior al que los residentes pueden pagar, o simplemente se ha retirado. Los modelos implicados no son ni mucho menos perfectos. Aun así, una mejor predicción produjo falta de disponibilidad en lugar de primas más justas.
Nada de esto es una observación nueva sobre los mercados. Rothschild y Stiglitz construyeron el aparato formal para la información asimétrica en los seguros hace cincuenta años (1976). El caso moderno simplemente invierte su asimetría: ahora es la aseguradora la que tiene la ventaja informativa, y el fondo común se erosiona desde el lado de la suscripción en lugar de por la autoselección de los solicitantes (Barry and Charpentier, 2020).
Dos cosas que este argumento no es, porque se malinterpreta en ambas direcciones.
No es una súplica por la ignorancia. La granularidad tiene un óptimo, no un máximo, y dónde se sitúa ese óptimo depende del ramo de negocio, de lo esencial que sea la cobertura y de lo que diga la ley. El seguro de responsabilidad civil de automóviles obligatorio, la cobertura de catástrofes para la vivienda principal y el seguro para mascotas no obtienen la misma respuesta. Lo que el argumento descarta es tratar la máxima resolución como el objetivo y el ratio de siniestralidad como el único testigo. La granularidad se convierte en una decisión de diseño que debe justificarse, como cualquier otra decisión de diseño.
Tampoco es todo el argumento sobre la Fairness, y la mayor parte del resto es jurisprudencia consolidada más que filosofía abierta. La tarificación basada en el género fue eliminada en la UE por la sentencia Test-Achats (C-236/09, 2011). El seguro de enfermedad básico obligatorio suizo no puede tarificar en absoluto en función del estado de salud, y nadie en Suiza va diciendo que eso sea injusto, lo que zanja la cuestión de si «actuarialmente justo» y «justo» son la misma palabra. El verdadero problema técnico actual es la discriminación por proxy: ¿una variable obtiene su poder predictivo a través de algún nexo causal con el riesgo asegurado, o reconstruyendo silenciosamente un atributo que la aseguradora no tiene permitido usar (Prince and Schwarcz, 2020)? La optimización de precios basada en la propensión a comparar ofertas es el caso claro. No se basa en absoluto en el riesgo, por lo que no supera el propio estándar del actuario, no el nuestro.
“Cierta imprecisión es el mecanismo, no un defecto del mismo. Una predicción perfecta no le da una prima justa. Le da una cuenta de ahorros con pasos adicionales.”
Primera parte · El argumento de la mutualización
Con esto queda resuelta la primera objeción, y antes de dejar el ejemplo de la aseguradora, merece la pena analizar lo que el argumento demostró en realidad, porque las dos dimensiones sobre las que se construye el resto de este artículo surgen directamente de él.
La historia de la aseguradora tenía dos vertientes. La primera se refería al alcance: el grado de segmentación del grupo determina si una prima es justa, de modo que el mismo modelo preciso es justo para un transportista y ruinoso para la persona a la que excluye por su precio. Si se cambia el objeto al que se refiere la cifra, su significado se invierte. La segunda se refería a la medición: un modelo con la máxima precisión no es el más justo, y la precisión llevada al límite anula el producto. La exactitud nunca fue el objetivo, sino que se confundió con él. La precisión no era una prueba.
Esas dos vertientes son los dos elementos que cualquier cifra necesita para ser fiable: sobre qué trata y cómo se ha obtenido. En el caso de una prima de seguro, exigiríamos ambos sin dudarlo. Sin embargo, para un veredicto sobre un sistema de IA, con mucho más en juego y mucha menos legibilidad, el sector solo proporciona la cifra. El resto de este artículo trata sobre estas dos divulgaciones, con su nombre y su clasificación: el enfoque (sobre qué trata el veredicto) y la visibilidad (con qué claridad se pudo observar). La segunda objeción es la más difícil, porque a partir de aquí trata de nuestro trabajo y no del de la aseguradora.
Segunda parte · El enfoque: sobre qué trata una evaluación
Alguien le entrega un documento. Dice que un sistema de IA ha sido evaluado y considerado fiable.
Antes de preguntar si eso es cierto, pregunte a qué se refiere la afirmación. La mayoría de las afirmaciones de fiabilidad en circulación no sobreviven a la pregunta, y no suele ser porque el trabajo subyacente fuera malo. El trabajo estaba bien. Nunca se contextualizó.
Tres preguntas lo contextualizan. Los llamamos diales porque giran de forma independiente: si se mueve uno, los otros dos no se mueven. Una evaluación real es un ajuste en cada uno de ellos, a menudo un pequeño rango en lugar de una sola muesca.
| Dial | La pregunta que responde | Sus ajustes |
|---|---|---|
| Cuerpo | ¿Qué cuerpo, qué oferta? | Confianza digital · Fairness y explicabilidad de la IA · Identidad autosoberana (previsto) |
| Ruta | ¿Qué tipo de sistema de IA? | Predictivo · Generativo / LLM · Agéntico (previsto) · Multiagente (previsto) |
| Público | ¿Para quién es el informe? | Quienes lo construyen · lo gobiernan · están sujetos a él · lo revisan externamente |
Una fila en una tabla no les hace justicia, porque cada uno de ellos cambia lo que la palabra “justo” realmente significa.
Cuerpo
Cualquier implementación se divide en tres actores, sin que sobre nada. El modelo que decide. La persona sobre la que recae la decisión. La organización que lanzó el sistema al mundo y tiene que responder por él. La confianza no es ninguno de ellos por separado; es la forma que trazan cuando están en equilibrio, que es el argumento del artículo sobre la órbita y la razón por la que ninguna oferta individual puede entregarle la confianza por sí sola.
Para una evaluación, la consecuencia es rotunda. Un visto bueno para el modelo no le dice nada sobre la gobernanza, y un programa de gobernanza inmaculado no le dice nada sobre si el modelo discrimina. No son versiones más fuertes o más débiles de una misma medida. Un gran banco puede aplicar un marco de riesgo de modelos de manual a un modelo que incumple las probabilidades igualadas por un amplio margen. Cuatro personas en una sala pueden ejecutar un modelo demostrablemente justo sin ninguna estructura de supervisión. Ambas cosas suceden. Ambos casos se presentan como IA confiable.
Ruta
Este selector es el que más peso tiene y el que menos atención atrae. Lo que cambia con el tipo de sistema es la naturaleza del problema de confianza, no su dificultad.
Los modelos predictivos generan una puntuación o una clase, y las cuestiones de Fairness están bien planteadas. ¿Significa la puntuación lo mismo para todos los grupos? ¿Son comparables las tasas de error? ¿Es la selección proporcionada? No se pueden tener todas a la vez cuando las tasas base difieren, lo cual es un teorema y no un error (Chouldechova, 2017; Kleinberg, Mullainathan and Raghavan, 2017). Así que el trabajo del evaluador es averiguar qué solución de compromiso se adoptó, si alguien se dio cuenta de que la estaba adoptando y si dejaron constancia del porqué.
Los sistemas generativos producen texto, y a menudo no hay una etiqueta con la que contrastar si es correcto o incorrecto. La Fairness debe construirse en lugar de medirse. Se varía un nombre, un pronombre, un dialecto y se compara el resultado. Se enmarca la tarea abierta como una decisión puntuable para que haya algo que contar. Aparecen modos de fallo que no tienen análogo predictivo, siendo los principales la fabricación de información y la procedencia (Ji et al., 2023). Y el objeto de estudio se vuelve escurridizo: la temperatura introduce varianza y el endpoint puede ser sustituido bajo un nombre estable sin que nadie se lo comunique.
Los sistemas agénticos actúan. Ahora la pregunta no es qué se produjo, sino qué se hizo, bajo la autoridad de quién y quién responde cuando una cadena de llamadas a herramientas sale mal en nombre de alguien. La disparidad puede ocultarse en la selección de herramientas, en la recuperación de información, en cómo se delega el trabajo, o en nada visible en ningún paso concreto, aunque sea obvia en toda la trayectoria.
Los sistemas multiagente añaden fallos que no pertenecen a ningún agente individual. Amplificación. Convergencia. Deriva a lo largo de los turnos. Audite a cada agente, apruebe a cada agente y pase por alto el fenómeno por completo.
Por eso los benchmarks se extrapolan tan mal. Una puntuación de Fairness ajustada en un clasificador predictivo no dice casi nada sobre un flujo de trabajo multiagente, y citarla como si lo hiciera es una de las piezas más comunes del teatro de la confianza en este campo.
Público
El más sutil y el más propenso a abusos, así que se le aplica una regla estricta. El público cambia la redacción, nunca las cifras.
Un consejo de administración quiere la decisión y la exposición al riesgo. Un ingeniero quiere la métrica, el intervalo y detalles suficientes para reproducirlo. Una persona que recibe una decisión quiere saber qué le ha pasado y qué puede hacer al respecto, en segunda persona y sin nada de jerga. Un revisor externo quiere el protocolo y los recuentos brutos para poder ejecutarlo de nuevo y discrepar con nosotros. Mismas pruebas, cuatro documentos.
La regla existe porque este selector es donde se blanquea un hallazgo poco sólido. Si el informe de ingeniería dice que una disparidad es significativa y material, y para cuando la misma evidencia ha pasado por un resumen, una presentación y un párrafo escrito por alguien de comunicación a quien se le dijo que fuera positivo, el consejo de administración lee que la situación general es ampliamente tranquilizadora, entonces nadie en esa cadena tomó una decisión de comunicación. Alguien tergiversó un resultado. Nuestra respuesta es mecánica en lugar de cultural: cada vista para cada público se genera a partir de un único registro de evaluación compartido, y las cifras se heredan, no se vuelven a contar.
Una aseguradora, tres evaluaciones, tres respuestas verdaderas
Tomemos una aseguradora europea que utiliza un modelo generativo que redacta la correspondencia de las reclamaciones, que a su vez se basa en un modelo predictivo que puntúa las reclamaciones para la revisión de fraudes.
| Configuración de los selectores | Veredicto honesto |
|---|---|
| Modelo · Predictivo · Revisor externo | La puntuación de fraude no está calibrada por igual entre dos grupos lingüísticos. La diferencia es significativa y material. |
| Modelo · Generativo / LLM · Quienes lo construyen | El tono del modelo de redacción cambia de forma medible según el apellido del reclamante. Sin efecto en la decisión en sí. |
| Organización · Predictivo · Quienes lo gobiernan | La gobernanza es sólida: decisiones de compromiso documentadas, una vía de apelación funcional, nuevas pruebas trimestrales. |
Las tres son válidas a la vez. Cualquiera de ellas, presentada como “hemos evaluado el sistema de IA”, es un eslogan. Publique solo la tercera y habrá descrito una empresa con una excelente supervisión de un modelo mal calibrado, y la habrá calificado de confiable.
Así pues, una evaluación es una ubicación: un punto en el espacio del cuerpo, la ruta y la audiencia, que se convierte en una región a medida que se amplía el alcance. Esa es la totalidad de la primera dimensión, el enfoque.
No es solo una metáfora. Es el control real en la plataforma activa de validant.ai. Cuando posiciona una evaluación, los tres selectores son tres ejes etiquetados; usted elige uno o varios valores en cada uno, y un cubo arrastrable muestra la región que ocupa la evaluación. Así es como se define, establece y visualiza un alcance en la práctica, no solo como lo describimos en la página.
Ahora bien, esto es lo que los tres selectores no pueden hacer. Cada veredicto de esa tabla podría proceder de un estudio controlado y prerregistrado sobre una versión de modelo fijada, o de tres tardes de enviar prompts a un endpoint cuyos pesos han sido reemplazados desde entonces. La configuración de los selectores es idéntica en ambos casos.
Tercera parte · La visibilidad: con qué claridad se observó
Esa era la primera dimensión: el enfoque, dónde miramos. Es necesaria, pero no suficiente, porque no dice nada sobre la claridad con la que pudimos ver una vez allí. Esa es la segunda dimensión, la visibilidad, y es la que el sector omite. La solución tentadora es añadirla como un cuarto indicador de profundidad. Lo redactamos así, pero era un error, y la razón merece un párrafo, porque es la base de todo el diseño.
Un selector localiza. Llamar a la garantía de calidad un cuarto selector implicaría que un hallazgo superficial es un tipo de hallazgo diferente a uno profundo, situado en otro lugar del mismo espacio. No está en otro lugar. Es el mismo hallazgo, sostenido con menos firmeza. Adónde apuntamos y cuán bien podíamos ver son respuestas a dos preguntas diferentes, y permitir que compartan un sistema de coordenadas es cómo un resultado limitado, superficial y caduco llega a vestirse con las mismas ropas que uno profundo.
La astronomía observacional resolvió esto hace mucho tiempo, y merece la pena ver cómo.
Un astrónomo registra dos cosas y nunca las mezcla. Primero el apuntamiento: ascensión recta y declinación, adónde apuntaba el instrumento. Luego la observación (seeing): qué telescopio, qué apertura, qué filtro, cuánto duró la exposición, cuán estable estaba el aire y la época, porque el cielo se mueve y una posición sin una fecha no es una posición. El apuntamiento dice adónde miró. La observación (seeing) dice qué podría haberse resuelto desde allí, y se anota en el registro como un número, en segundos de arco, cada noche, sin que nadie lo trate como una admisión de debilidad.
Estrictamente, el seeing se refiere únicamente a la estabilidad atmosférica. Lo usamos como lo hacen los observadores profesionales, como abreviatura de todo lo que en conjunto establece el límite de lo que una noche determinada podría mostrar.
Tomamos ambas palabras. Mantienen las dos divulgaciones separadas sin tomar prestado “objeto”, que en astronomía ya significa un cuerpo, y de esos ya tenemos tres.
| Divulgación | La pregunta que responde | Presentado como |
|---|---|---|
| El apuntamiento | ¿Dónde miramos? | Sujeto · Trayectoria · Audiencia |
| La visibilidad | ¿Con qué claridad podíamos verlo? | Acceso · Evidencia · Validez |
El apuntado puede ser inmaculado mientras que la visibilidad es nula. Esa combinación describe gran parte de la bibliografía publicada sobre la fiabilidad.
Hay una convención más que vale la pena tomar prestada, y es más útil que el resto en conjunto. Una no detección nunca se publica sin una magnitud límite. Un «No lo vimos» no es un resultado que nadie aceptaría. Un «Habríamos detectado cualquier cosa más brillante que la magnitud 21.3, y no vimos nada» sí lo es. El primero le dice discretamente al lector que no hay nada. El segundo establece lo que podría haber estado allí sin ser detectado. Dos siglos de precedentes para nuestra tercera regla.
La visibilidad tiene tres componentes. Son independientes, y una única calificación ocultaría las compensaciones entre ellos: cincuenta mil pares contrafactuales controlados a distancia superan a cuarenta muestras con los pesos en la mano, y ningún promedio puede reflejarlo.
Apertura · el nivel de acceso
Lo que el evaluador pudo observar. Generalmente no es nuestra elección.
| Nivel | Nombre | Lo que posee el evaluador | Máxima afirmación que respalda |
|---|---|---|---|
| A0 | Atestiguado | Documentación del proveedor, ficha del modelo, evaluaciones publicadas. Sin sondeo. | Las propias afirmaciones del sujeto, registradas y verificadas en cuanto a su consistencia interna. |
| A1 | Conductual | Acceso a consultas. Solo salida de terminal: texto, etiqueta, decisión. | Disparidad en los resultados observados, presente o ausente con una sensibilidad declarada. |
| A2 | Puntuado | A1 más puntuaciones por salida: log-probabilidades, probabilidades de clase, alternativas clasificadas, confianza. | Calibración y comportamiento de umbral por grupo. Disparidad de clasificación y de margen. |
| A3 | Interno | Pesos, activaciones, gradientes. La capacidad de intervenir en la computación. | Qué estructuras internas portan la disparidad. Atribución mecanicista. |
| A4 | Procedencia | A3 más linaje del corpus de entrenamiento, historial de ajuste fino y de datos de preferencia, historial de evaluación. | De qué parte del ciclo de vida provino la disparidad. |
La realidad comercial se sitúa principalmente en A1 y A2. Un implementador que evalúa un modelo de frontera de terceros no puede llegar más lejos, y por contrato nunca podrá hacerlo. Esa no es una razón para abandonar el proyecto, y aquí es donde las dos capacidades se separan marcadamente.
La medición de la Fairness es una disciplina de entrada-salida y funciona bien en A1. Las métricas de grupo surgen de las predicciones, las etiquetas y la pertenencia al grupo; los pesos nunca entran en juego. Los modelos de frontera cerrados son genuinamente evaluables en cuanto a su Fairness. Las limitaciones son de orden práctico: el coste de las consultas con los tamaños de muestra que exige la potencia estadística, el no determinismo sin control de la semilla, los filtros de seguridad que interceptan los sondeos, los términos del proveedor que a veces prohíben las pruebas adversariales y las actualizaciones silenciosas de los endpoints que invalidan discretamente el trabajo.
La explicabilidad no es tan transferible. En A1, se dispone de sustitutos de perturbación y autoinformes, y las razones declaradas de un modelo son evidencia sobre su resultado en lugar de sobre su computación (Turpin et al., 2023). En A2, el análisis de sensibilidad y la atribución contrastiva se despliegan por completo. Las afirmaciones sobre el mecanismo comienzan en A3 y no antes. Un informe de explicabilidad que no especifica su nivel está haciendo una afirmación para la que puede que no tuviera ningún instrumento.
Método · el grado de evidencia
La solidez de la inferencia, dado lo que realmente se ejecutó.
| Grado | Nombre | Estándar cumplido |
|---|---|---|
| E0 | Aseverado | Se basa en una declaración del sujeto o en un autoinforme del modelo. Sin medición independiente. |
| E1 | Observacional | Medido sobre datos encontrados o de conveniencia. Factores de confusión no controlados. Solo descriptivo. |
| E2 | Controlado | Protocolo prerregistrado, muestra con potencia estadística, perturbación contrafactual controlada, estimaciones por intervalos, corrección por pruebas múltiples. |
| E3 | Intervencionista | El mecanismo se manipula en lugar de observarse: asignación aleatoria del atributo variado, ablación o intervención a nivel de activación con análisis de mediación. |
Los hallazgos de explicabilidad también conllevan un modificador de fidelidad, ya que los métodos de atribución no son intercambiables en cuanto a su peso probatorio: F0 autoinforme, F1 sustituto de perturbación (Ribeiro et al., 2016; Lundberg and Lee, 2017), F2 gradiente o localmente exacto, F3 intervención causal.
Época · el grado de validez
Cuándo fue cierto y si todavía lo es.
| Grado | Nombre | Estándar cumplido |
|---|---|---|
| V0 | No fijado | Sin identificador de versión, sin registro de configuración, sin caducidad. |
| V1 | Fijado | Instantánea o identificador de versión, configuración y marca de tiempo registradas. Un momento concreto en el tiempo, con una caducidad declarada. |
| V2 | Remuestreado | V1 más nuevas pruebas programadas a un intervalo declarado, con detección de cambios entre ejecuciones. |
| V3 | Continuo | Monitorización en producción con detección de deriva y umbrales de alerta. La afirmación está activa en lugar de ser histórica. |
El V0 está en todas partes y debe considerarse descalificante. Los endpoints alojados se actualizan tras nombres estables, la temperatura y el prompt del sistema cambian el sujeto bajo prueba, una capa de seguridad puede reescribirse un martes por la tarde sin ningún anuncio, y el efecto acumulativo es que un hallazgo registrado en marzo sobre un modelo accesible en una dirección determinada puede, para junio, no describir nada que todavía exista en esa dirección. Razón por la cual la garantía continua es la forma honesta del producto en lugar de una venta adicional. La órbita no se quedará quieta, así que la medición tampoco puede hacerlo.
El vocabulario utilizado aquí se toma prestado a propósito. Los auditores llevan años distinguiendo entre garantía limitada y garantía razonable (ISAE 3000 Revised), y los marcos de identidad ya clasificaban los niveles de garantía mucho antes de que nadie auditara modelos (NIST SP 800-63-3; eIDAS bajo, sustancial, alto). Algo construido a partir de ambos es más difícil de descartar como una invención del proveedor.
Cuarta parte · Cinco reglas que le dan solidez
Un sistema de calificación que solo sirve para halagar a quien califica es pura decoración. Estas cinco garantizan su honestidad, y cada una nos cuesta algo.
R1 · El eslabón más débil
La clase de la afirmación principal está limitada por el componente más bajo. mín(A, E, V) se corresponde con Indicativo, Limitado o Razonable, utilizando esas palabras tal como las usan los auditores. Un solo componente débil limita el veredicto. No se promedia, porque promediar es cómo un método profundo sobre una instantánea obsoleta se convierte en una afirmación sólida.
R2 · Techo declarado
Una frase por cada hallazgo, que indique lo que esta configuración no podría haber detectado. No lo que no se encontró, sino lo que era indetectable por diseño. En A1, esa frase dice, a grandes rasgos, que no se afirma nada sobre el mecanismo interno que produce estos resultados.
R3 · Magnitud limitante en cada resultado nulo
La ausencia de un hallazgo no es un hallazgo de ausencia. Cada resultado negativo conlleva un efecto mínimo detectable con su potencia, alfa y tamaño de muestra:
“Esta evaluación habría detectado una disparidad de 3.0 puntos porcentuales o superior en la tasa de selección con una potencia del 80 por ciento, α = 0.05, en 12,400 sondeos emparejados.”
R3 · Un resultado nulo con su magnitud limitante
Convierte una afirmación de marketing en una afirmación cuantificada. También es la primera frase que cualquiera que busque un resultado impoluto intentará eliminar, lo que es un buen argumento para que sea un elemento estructural en lugar de editorial.
R4 · Separación
El perfil de aseguramiento son metadatos sobre nuestro trabajo y nunca forma parte del resultado de Fairness del sujeto. Un proveedor no debe obtener una mejor puntuación en Fairness por haber concedido un acceso más profundo, o la medición quedará contaminada por sus propias condiciones de observación. La apertura se recompensa con una calificación de auditabilidad independiente, que es donde corresponde. Dos sujetos con hallazgos idénticos en A1 y A3 no son igualmente fiables. Esa diferencia es real. Simplemente, no es una diferencia en Fairness.
R5 · Legible por máquina
El perfil se entrega como metadatos estructurados en cada hallazgo, no como prosa en un pie de página, porque tiene que sobrevivir al ser pegado en el sistema de cumplimiento de un tercero. La metáfora queda fuera del esquema: «apuntar» y «ver» es como lo explicamos; «alcance» y «aseguramiento» es como lo serializamos. El nombre de un campo no debería necesitar un artículo para ser decodificado.
{
"finding_id": "f_8c41e0",
"scope": {
"body": "model",
"pathway": "generative_llm",
"audience": "external_reviewer"
},
"assurance": {
"access": "A1",
"evidence": "E2",
"faithfulness": null,
"validity": "V2",
"claim_class": "limited"
},
"subject": {
"identifier": "vendor/model@2026-07-14",
"configuration_hash": "sha256:1f9a",
"assessed_at": "2026-07-22T09:14:00Z",
"expires_at": "2026-10-20T00:00:00Z"
},
"result": "no_disparity_detected",
"detection_sensitivity": {
"metric": "selection_rate_difference",
"minimum_detectable_effect": 0.030,
"power": 0.80,
"alpha": 0.05,
"n_probes": 12400
},
"declared_ceiling": "Behavioural access only. No claim is made about the internal mechanism producing these outputs, and no mechanistic attribution was possible at this tier."
}Parte cinco · Cómo leer uno de estos
Nada de esto sirve si un lector no puede utilizarlo en diez segundos. Así que aquí está el registro anterior, en el orden en que un lector escéptico debería abordarlo.
Empiece por el final. El resultado dice que no se detectó ninguna disparidad. Vaya directamente a la sensibilidad: tres puntos porcentuales. Podría haber una disparidad de dos puntos ahí mismo, sin ser vista. Si dos puntos importan es una cuestión de negocio más que estadística, y ahora le corresponde a usted responderla, no a nosotros difuminarla.
Compruebe la época. V2, anclado a una versión del 14 de julio, que expira el 20 de octubre. Si está leyendo esto en noviembre, es historia y debe tratarse como tal.
Compruebe la apertura. A1, conductual. Así que este es un hallazgo sobre lo que el sistema hace, no por qué lo hace. Cualquiera que lo cite como prueba de que el modelo no contiene ningún mecanismo discriminatorio ha ido más allá del instrumento.
Lea la clase de afirmación. Limitada en lugar de razonable, porque el componente más débil fue A1. Esa palabra realiza un trabajo preciso tomado de la práctica de auditoría: el hallazgo respalda una conclusión sin ser concluyente.
Ahora lea el señalamiento. Modelo, generativo, revisor externo. Lo que le indica que no dice nada sobre la gobernanza del implementador ni sobre el modelo predictivo subyacente.
Cinco comprobaciones, y lo que se obtiene es una afirmación en la que puede confiar hasta un grado determinado, sobre un aspecto determinado, hasta una fecha determinada.
Lo que estas cinco comprobaciones destruyen es la frase que todo el mundo quiere oír: que la IA es justa. Esa frase no está disponible en ningún nivel de aseguramiento. Quien la ofrezca está vendiendo la omisión.
Sexta parte · De una lectura a un registro
Una medición es un instante. Usted apuntó a un punto, observó con la mayor claridad que su acceso, evidencia y validez le permitieron y anotó una calificación. Pero es fácil dar marcha atrás a un instante. El fracaso silencioso de la mayoría de las garantías de IA no es que la primera lectura sea incorrecta. Es que el objetivo se mueve después y nadie se da cuenta. La métrica que parecía mala en marzo se cambia discretamente por una más favorable en abril. El alcance se reduce. La población que mostraba la brecha ya no está dentro del alcance. La cifra mejora, pero nada ha cambiado en la realidad. Así es como la precisión se convierte en teatro: no mintiendo sobre la lectura, sino moviendo el objeto de la lectura.
Por lo tanto, la lectura debe convertirse en un registro y deben cumplirse tres condiciones.
El objetivo debe permanecer fijo. En el momento en que se realiza una primera lectura honesta, dos de las coordenadas de referencia dejan de ser editables: el cuerpo que se está evaluando y la vía de daño que se está vigilando. Juntos constituyen el objetivo, y un objetivo que se puede reescribir no es un objetivo, es un estado de ánimo. A partir de ese momento, el objetivo queda congelado. Todavía se puede evaluar otra cosa, pero eso constituye un nuevo objetivo con su propio registro, no una edición discreta de este. La tercera coordenada, la audiencia, permanece libre, porque la audiencia nunca cambia las cifras. El mismo resultado congelado simplemente se narra a un desarrollador, un regulador o la persona afectada, en el registro que cada uno necesita. A quién se le habla es una lente, no una palanca.
La garantía se gana, no se declara. Con el objetivo fijado, las calificaciones de observación se convierten en el lugar honesto donde se produce el progreso. Una primera iteración podría ser Indicativa: se tenían datos pero no el modelo, una única muestra, sin monitorización en tiempo real. Eso no es un fallo que ocultar, es una línea de partida que registrar. La siguiente iteración gana más: se obtiene el modelo, por lo que el acceso aumenta; se ejecutan intervalos de confianza adecuados con corrección, por lo que la evidencia aumenta; se activa la monitorización continua, por lo que la validez aumenta. Cada iteración sella su propia calificación y no puede anularla más tarde. Lo que el lector observa, a través de una pila de iteraciones selladas, no es una cifra que fluctúa, sino un suelo que se eleva bajo un objetivo fijo. Esa es la diferencia entre obtener una buena puntuación una vez y mejorar genuinamente en la observación de lo mismo. Solo lo segundo es confianza.
El titular de cada iteración sigue siendo la regla estricta de la cuarta parte: la garantía es el mínimo del acceso, la evidencia y la validez, nunca el promedio. Una prueba estadística brillante sobre datos a los que solo se le permitió echar un vistazo sigue siendo un vistazo. No se puede recuperar el acceso con ingenio, y el sello se niega a permitir que se finja lo contrario.
| Coordenada | Regla | Por qué |
|---|---|---|
| Cuerpo y vía, el objetivo | Un valor para cada uno, congelado cuando se cierra la primera iteración | Un objetivo que se puede reescribir no es un objetivo. Si el blanco puede moverse, la mejora carece de sentido. |
| Público | Todas, siempre | La audiencia es una lente, no una palanca. Las mismas cifras congeladas se narran a un desarrollador, un regulador o la persona afectada. A quién se lo cuente nunca cambia lo que es cierto. |
| Observación: acceso, evidencia, validez | Calificado por iteración, sellado, puede aumentar pero nunca anularse | Una primera pasada puede ser Indicativa. Obtener el modelo, los intervalos de confianza reales y la monitorización en tiempo real elevan la calificación, por lo que un suelo se eleva bajo un objetivo fijo. |
De un sello a un programa
Un sello cubre un cuerpo. Pero una implementación real nunca es un solo cuerpo. Cuando una empresa lanza un sistema de IA al mundo, entran en juego tres cuerpos a la vez: el modelo que toma la decisión, la persona sobre la que recae la decisión y la organización que lo ha creado y lo gobierna. La confianza en el sistema no reside en ninguno de ellos por separado. Es la forma que los tres trazan juntos. Ya hemos escrito antes que la confianza digital es una órbita, no un pilar. Aquí es donde deja de ser una metáfora.
Un programa es el contenedor de las tres evaluaciones de una implementación. Cada cuerpo mantiene su propio objetivo congelado y su propia pila ascendente de iteraciones selladas. El programa los agrupa en un único objeto verificable públicamente: un sello de programa. Y el sello del programa hereda la misma regla de honestidad, un nivel más arriba. Su garantía no es el promedio halagador de sus tres cuerpos. Es el mínimo. Si el modelo obtiene una garantía Razonable pero la gobernanza de la organización es todavía solo Limitada, todo el programa es Limitado, y el sello lo dice en voz alta. No se puede blanquear un cuerpo débil dentro de un promedio fuerte. La órbita es tan fiable como su cuerpo menos observado, que es exactamente la verdad que un responsable de la toma de decisiones necesita y casi nunca obtiene.
Por qué esto es lo esencial
Apuntar con honestidad, observar con honestidad y luego mantenerlo con honestidad. Cada una de estas acciones, por sí sola, es un buen hábito. Juntas, y convertidas en un sello firmado y a prueba de manipulaciones que cualquiera puede verificar sin preguntarnos, cambian lo que es una declaración de garantía. Las coordenadas de referencia y las calificaciones de garantía viajan dentro del sello como campos estructurados y siempre divulgados, mantenidos por separado del veredicto de Fairness en sí, para que un extraño pueda comprobar cómo de bien se observó sin tocar nunca los detalles de los grupos protegidos. Deja de ser una instantánea que se acepta por fe y se convierte en un registro que se puede auditar: aquí es exactamente donde apuntamos, aquí está exactamente cómo de bien pudimos ver, aquí está la prueba de que no se ha movido y aquí está el suelo que se eleva en cada iteración. Eso es lo que significa aumentar la confianza en un mundo digital. No una afirmación más ruidosa, sino una que se mantiene fija el tiempo suficiente y muestra sus propios límites con la suficiente claridad como para que un extraño pueda confiar en ella. El sello no es una insignia. Es el recibo.
Séptima parte · Lo que nos gustaría y lo que quizá no consigamos
La historia tentadora es la siguiente. La calificación de aseguramiento se convierte en lenguaje de contratación. Los compradores incluyen en sus contratos un mínimo de A2, un grado de evidencia E2, una sensibilidad inferior a tres puntos y una ventana de validez de menos de noventa días. Los proveedores que quieren superar el listón de A2 empiezan a publicar sus puntuaciones. El mercado se autorregula hacia la transparencia sin que nadie tenga que apelar a la conciencia. Es una buena historia, y nos gustaría que fuera cierta.
No sabemos si lo será, y hay buenas razones para pensar que no.
Revelar un límite de detección es una desventaja competitiva para quien lo haga primero, porque en una sala de juntas un certificado de idoneidad sin reservas suena mejor que uno calibrado. Muchos compradores quieren una luz verde en lugar de una calificación graduada, y un sistema que elimina las luces verdes no es, evidentemente, lo que el mercado pide. Los reguladores tienden a especificar procesos en lugar de potencia estadística, por lo que un régimen de certificación puede cumplirse de principio a fin sin que nadie declare nunca un efecto mínimo detectable. Y los dos niveles de acceso más altos dependen enteramente de la voluntad del proveedor, que en el caso de los modelos de frontera tiende a cerrarse en lugar de abrirse. Un sistema cuyos niveles superiores son inalcanzables en la práctica podría acabar documentando permanentemente nada más que su propio techo.
Lo que es cierto hoy en día es más limitado y merece la pena declararlo con precisión. La Regulación 10-1-1 de Colorado exige pruebas cuantitativas, documentación y una certificación anual a las aseguradoras de vida que utilizan datos externos de consumidores, con los seguros de auto y salud incluidos en el ámbito de aplicación de la ley y sus normas sectoriales aún en proceso de elaboración. El boletín modelo de la NAIC espera un programa documentado de sistemas de IA. La EU AI Act incluye la evaluación de riesgos y la fijación de precios en los seguros de vida y salud en su anexo de alto riesgo. Se trata de un avance real y acelerado hacia afirmaciones documentadas y comprobables. Ninguno de esos regímenes exige que se declare qué tan pequeña es la disparidad que sus pruebas podrían haber encontrado. La dirección es la correcta. Lo que este artículo defiende en concreto no figura en ningún texto legal, y no debemos dar a entender lo contrario.
Existen precedentes de que este patrón acabe imponiéndose. El aseguramiento graduado se convirtió en algo habitual en la identificación y en la auditoría financiera, en ambos casos a través de una mezcla de convención profesional y codificación final, y en ninguno de los dos casos de forma rápida.
Así que: una propuesta, no una previsión. La adoptamos unilateralmente porque creemos que un veredicto sin un techo declarado no es realmente un veredicto, y preferimos publicar una afirmación modesta que se sostenga que una rotunda que no lo haga. Nos cuesta un titular más limpio. Creemos que es el intercambio correcto, y estaremos encantados de debatir con cualquiera que piense que las calificaciones son erróneas, los umbrales arbitrarios o que todo el aparato es más preciso de lo que la ciencia subyacente puede soportar. Esta última objeción es la que nos tomamos más en serio.
La confianza se evalúa, no se afirma. Si su organización despliega IA y desea que su postura de confianza sea medida por un tercero independiente, en los ámbitos de Fairness, explicabilidad y gobernanza, y que se informe de ello con el techo declarado en lugar de oculto, nuestra beta cerrada se abrirá a un grupo reducido en el tercer trimestre de 2026. Escriba a hello@validant.ai con el asunto “Closed Beta” o solicite una demostración. Las plazas son limitadas y se asignan por orden de idoneidad, no por orden de llegada.
En una línea
La precisión no es una prueba. Un modelo que predice a la perfección no es más justo, simplemente ha dejado de asegurar a nadie; un veredicto que parece seguro no está demostrado, solo ha ocultado lo poco que se ha podido ver. Una cifra se convierte en algo fiable cuando va acompañada de dos elementos: el enfoque (sobre qué trata) y la visibilidad (con qué claridad se observó). Si se publica la cifra por sí sola, volvemos al caso de la aseguradora, que interpreta la precisión como una prueba.
“La confianza se evalúa, no se afirma. Una evaluación que no declara su propio techo ha afirmado algo, después de todo.”
La precisión no es una prueba
Fuentes y lecturas adicionales
- 01Glinz, D. (2026). La confianza digital es una órbita, no un pilar. validant.ai Signal.
- 02Glinz, D. (2026). La arquitectura de la confianza digital: Un marco multinivel para cerrar la brecha de valor de la IA. 2026 IEEE Swiss Conference on Data Science and AI (SDS), Zurich, pp. 60-67.
- 03Rothschild, M. and Stiglitz, J. (1976). Equilibrio en los mercados de seguros competitivos. Quarterly Journal of Economics, 90(4), 629-649.
- 04Barry, L. and Charpentier, A. (2020). La personalización como promesa: ¿Puede el Big Data cambiar la práctica de los seguros? Big Data & Society, 7(1).
- 05Prince, A. E. R. and Schwarcz, D. (2020). La discriminación por proxy en la era de la inteligencia artificial y el Big Data. Iowa Law Review, 105(3).
- 06Barocas, S. and Selbst, A. D. (2016). El impacto dispar del Big Data. California Law Review, 104, 671-732.
- 07Chouldechova, A. (2017). Predicción justa con impacto dispar. Big Data, 5(2), 153-163.
- 08Kleinberg, J., Mullainathan, S. y Raghavan, M. (2017). Compromisos inherentes en la determinación justa de las puntuaciones de riesgo. ITCS 2017.
- 09Lee, J. D. y See, K. A. (2004). Confianza en la automatización: Diseño para una dependencia apropiada. Human Factors, 46(1), 50-80.
- 10Ji, Z., et al. (2023). Estudio sobre la alucinación en la generación de lenguaje natural. ACM Computing Surveys, 55(12).
- 11Ribeiro, M. T., Singh, S. y Guestrin, C. (2016). «¿Por qué debería confiar en usted?»: Explicación de las predicciones de cualquier clasificador. KDD 2016.
- 12Lundberg, S. M. y Lee, S.-I. (2017). Un enfoque unificado para la interpretación de las predicciones de los modelos. NeurIPS 2017.
- 13Turpin, M., Michael, J., Perez, E. y Bowman, S. R. (2023). Los modelos lingüísticos no siempre dicen lo que piensan. NeurIPS 2023.
- 14International Auditing and Assurance Standards Board. ISAE 3000 (Revisada).
- 15National Institute of Standards and Technology. (2017). Directrices sobre identidad digital. NIST SP 800-63-3.
- 16Tribunal de Justicia de la Unión Europea. (2011). Test-Achats, C-236/09.
- 17Colorado Division of Insurance. SB21-169 y Reglamento 10-1-1.
InvestigaciónAbrir para leerLa confianza digital es una órbita, no un pilar
La confianza no es un pilar más que añadir. Es la órbita que tres cuerpos trazan juntos: el modelo, la persona y la organización. Por qué el problema de los tres cuerpos es la metáfora más honesta para una IA fiable y cómo saber en qué punto de la órbita se encuentra.
Leer
InvestigaciónAbrir para leerEl problema de la confianza que nadie quiere nombrar
Todo el mundo está invirtiendo en IA; casi nadie puede decir qué ha obtenido a cambio. Un nuevo artículo, galardonado con el Best Paper Award en la IEEE Swiss Conference on Data Science and AI, da nombre a esa brecha y demuestra que se trata de un problema de confianza con disfraz técnico: siete mecanismos, una arquitectura de cuatro capas, un iceberg bajo la superficie y cinco principios de diseño para cerrarla.
Leer
InvestigaciónAbrir para leerCuando un modelo se convierte en munición
Un modelo de IA de frontera fue desconectado en todo el mundo por una sola carta gubernamental. Una lectura del cierre de junio de 2026 a través de la imagen del problema de los tres cuerpos de la confianza digital: cómo el interruptor de apagado dejó de ser una metáfora, por qué el laboratorio más gobernable fue el gobernado con menos cuidado de todos y lo que la dependencia de un único proveedor y una única jurisdicción le cuesta ahora a un consejo de administración.
Leer