Demandez à un ingénieur de course ce qui rend une voiture rapide et vous obtiendrez peut-être une réponse qui semble paradoxale : les freins. Un pilote qui a confiance dans ses freins conserve sa vitesse jusque tard dans le virage. Un pilote qui n'a pas confiance lève le pied plus tôt, à chaque tour, et perd du temps partout.
De bons freins ne ralentissent pas la voiture. Ils sont la raison pour laquelle elle peut être pilotée à la limite. Pendant des années, la gouvernance de l'IA a été présentée, et perçue avec ressentiment, comme le contraire. Les équipes de gestion des risques étaient celles qui disaient non. La conformité était le coût de l'IA, payé à contrecœur et maintenu aussi bas que possible. La plupart des conseils d'administration avec qui nous discutons le voient encore de cette manière : un frein nécessaire à ce qui crée réellement de la valeur.
En septembre, le Boston Consulting Group a publié un rapport qui devrait mettre fin à cette perception. The Formula for Agentic AI Value, l'édition 2026 de son Applied AI Index, révèle que les entreprises disposant d'un ensemble complet de contrôles sur leurs agents d'IA déclarent tirer de ces agents environ trois fois plus de valeur que les entreprises n'en ayant qu'un seul. Selon les propres termes de BCG : « Des contrôles des risques efficaces servent de catalyseur, et non de frein. »
C'est la bonne nouvelle, et elle mérite d'être largement diffusée. Notre argumentation commence une étape plus loin, et nous l'exposerons directement. BCG a mesuré la valeur du contrôle au sein d'une entreprise. Le maintien de cette valeur à l'extérieur, face à un régulateur, un assureur, un client ou la personne concernée par la décision d'un agent, dépend de la capacité d'un tiers à vérifier les contrôles mis en place. Aujourd'hui, presque personne ne le peut. Demandez à un conseil d'administration ce que valent ses agents et s'ils sont sous contrôle, et la réponse honnête est généralement : nous le pensons. Le contrôle est ce qui triple la valeur. La preuve est ce qui permet aux autres de s'y fier. C'est cette lacune que validant.ai a pour mission de combler.
À qui s'adresse ce texte
Cet article s'adresse aux conseils d'administration, aux directeurs des risques, aux responsables de l'IA et aux équipes de conformité qui mettent ou s'apprêtent à mettre des agents en production, et qui devront en assumer la responsabilité. La première partie résume le rapport et ne nécessite aucune connaissance technique. La quatrième partie présente un exemple concret. Dans la cinquième partie, nous expliquons ce que validant.ai propose à ce sujet, et pourquoi cela change la valeur de ce triplement.
Nous ne sommes pas neutres. Nous développons les outils et menons les évaluations qui produisent des preuves indépendantes sur les systèmes d'IA, et cet article soutient que le marché en a besoin. Nous avons séparé le résumé du rapport de BCG de notre propre argumentation à son sujet, et nous indiquons clairement où nos propres outils ne sont pas finalisés.
Synthèse
- 01
La valeur de l'IA est réelle et concentrée
Les entreprises qui allient clarté stratégique et IA appliquée déclarent une valeur de l'IA environ cinq fois supérieure à celle des entreprises qui ne possèdent ni l'une ni l'autre. L'IA agentique représente la part de cette valeur qui connaît la plus forte croissance, passant de 17 % en 2025 à 39 % prévus d'ici 2030.
- 02
Les contrôles la multiplient
Les entreprises ayant mis en place six contrôles d'agents à l'échelle de l'entreprise déclarent une valeur agentique environ trois fois supérieure à celle des entreprises n'en ayant qu'un seul. Seulement 5 % les ont mis en place, tandis que 42 % s'attendent à ce que les agents prennent des décisions sans approbation humaine d'ici 2030.
- 03
Chaque contrôle de la liste est interne
Aucun des six ne prend en compte les personnes concernées par les décisions d'un agent, et aucun n'implique qu'une personne extérieure à l'entreprise vérifie le résultat. Les mots « Fairness » et « réglementation » n'apparaissent pas dans le rapport, et l'enquête elle-même est basée sur les déclarations des participants, comme le note BCG.
- 04
La preuve est le contrôle manquant
La « Fairness » mesurée là où les personnes sont affectées, une mesure honnête qui indique ce qu'elle pourrait omettre, et des preuves scellées pour que des tiers puissent les vérifier. Cela transforme la gouvernance d'une conviction interne en une valeur sur laquelle les autres peuvent compter.
Première partie · Ce que BCG a mesuré
L'Applied AI Index repose sur une enquête menée auprès de 1 330 CxO et cadres supérieurs qui prennent des décisions concernant l'IA, dans plus de 60 pays et plus de 20 secteurs, dont plus de la moitié travaillent dans des entreprises réalisant plus de 5 milliards de dollars de chiffre d'affaires. Son idée centrale tient sur un coin de table : clarté stratégique plus IA appliquée égale impact transformateur.
La clarté stratégique est une question de choix. Elle consiste à concentrer l'IA sur quelques domaines à forte valeur ajoutée, à la gérer comme un programme unique, financé, pluriannuel et piloté par la direction générale, et à suivre sa valeur dans le compte de résultat plutôt que dans des présentations. L'IA appliquée est une question d'exécution. Elle comporte trois volets : un modèle opérationnel articulé autour des agents et des contrôles pour les gérer, une main-d'œuvre repensée autour de la collaboration entre humains et agents, et une plateforme de données que les agents peuvent réellement utiliser.
Lorsque les deux sont réunies, les chiffres changent. Les entreprises fortes en clarté et en IA appliquée ont réalisé une valeur de l'IA d'environ 4,5 % de leur chiffre d'affaires en 2025. Celles qui sont faibles sur les deux plans ont atteint 0,9 %. C'est l'écart du simple au quintuple qui figure dans le titre de BCG.
Quatre niveaux, une petite élite
BCG classe les entreprises en quatre groupes. En 2026, 4,5 % stagnent, 47 % sont émergentes, 41 % sont en phase de déploiement et 7,5 % sont ce que BCG appelle « future-built » (prêtes pour l'avenir), contre 5 % un an plus tôt. C'est dans le groupe « future-built » que la valeur se concentre. Parmi elles, 95 % suivent la valeur de l'IA avec des KPI clairs ou directement dans le compte de résultat, et elles déclarent atteindre un impact en 11 mois environ, contre 17 pour les entreprises à la traîne.
Un détail révélateur se trouve dans les données de mesure. En dehors du groupe de tête, la plupart des entreprises, selon l'expression de BCG, « naviguent à vue » : 47 % des entreprises à la traîne mesurent au mieux la valeur de l'IA de manière qualitative. Une autre analyse de BCG citée dans le rapport a révélé que si près de neuf PDG sur dix constatent des avantages de l'IA en termes de coûts ou de revenus, seuls 14 % ont clairement défini l'impact de chaque initiative sur le compte de résultat.
Les agents sont la source des prochains gains
Ce n'est pas sans raison que le sous-titre du rapport porte sur les agents. L'IA agentique représentait 17 % de la valeur de l'IA en 2025 et 22 % en 2026. BCG prévoit 39 % d'ici 2030, ce qui en ferait la plus grande source de valeur de l'IA. L'écart est ici plus marqué que partout ailleurs : 44 % des entreprises « future-built » déclarent déjà tirer la pleine valeur des agents, contre 2 % des entreprises à la traîne.
| Ce que rapporte BCG | Chiffre |
|---|---|
| Valeur de l'IA, entreprises fortes vs faibles en clarté et IA appliquée | 4,5 % vs 0,9 % du chiffre d'affaires (2025) |
| Part des entreprises « future-built » | 7,5 % en 2026, contre 5 % |
| Part de l'IA agentique dans la valeur de l'IA | 17 % (2025), 22 % (2026), 39 % prévus (2030) |
| Valeur agentique avec les six contrôles vs un seul | 1,8 % vs 0,5 % du chiffre d'affaires |
| Entreprises appliquant les six contrôles aujourd'hui | 5 % |
| Entreprises s'attendant à ce que les agents décident sans approbation humaine d'ici 2030 | 42 % |
Prendre les chiffres pour ce qu'ils sont
Une mise en garde s'applique à tout ce qui suit, et BCG l'énonce ouvertement dans sa méthodologie. Les chiffres proviennent de dirigeants évaluant la maturité de leur propre organisation sur 41 capacités. Sauf indication contraire dans le compte de résultat 2025, les chiffres de valeur représentent l'impact futur attendu. Et les réponses « peuvent être sujettes à un biais de perception ».
Ce n'est pas une faille du rapport. C'est la nature d'une enquête. Mais c'est important pour l'argumentation, car cela signifie que le rapport est une image précise de la façon dont les entreprises se perçoivent. Il nous dit ce que les dirigeants croient au sujet de leur IA et de leurs contrôles. Il ne peut pas nous dire si ces croyances résisteraient à un regard extérieur. Nous y reviendrons dans la troisième partie.
Deuxième partie · Six contrôles, une valeur triplée
La partie du rapport la plus importante pour quiconque déploie des agents est une courte liste. La mise à l'échelle des agents, selon BCG, entraîne un risque qu'il nomme la prolifération des agents : agents dupliqués, autorisations contradictoires, responsabilités floues, lacunes dans la surveillance. Le changement plus profond est que les agents combinent des données, des outils, de la mémoire et d'autres agents à travers les flux de travail, de sorte que les risques peuvent « émerger dynamiquement et s'aggraver à la vitesse de la machine ». L'ancien modèle opérationnel de risque, conçu pour des logiciels qui font ce qu'on leur dit, n'est pas suffisant.
BCG nomme six contrôles qui comblent cette lacune :
- 01Mémoire et contexte. La manière dont les agents stockent et rappellent les informations. La mémoire peut démultiplier l'apprentissage entre les agents, mais elle peut aussi transmettre des erreurs, des données sensibles ou un contexte manipulé d'un flux de travail à l'autre.
- 02Périmètre et supervision. La fonction de chaque agent, ce qu'il peut faire, à quelles fins, et quand un humain doit intervenir. L'autorité n'est pas seulement limitée par ce qu'un agent peut atteindre, mais aussi par ce qu'il est autorisé à faire.
- 03Évaluation et rollback. Critères d'évaluation, portes de validation, surveillance continue et une possibilité de retour en arrière. Les contrôles devraient détecter la dérive, les anomalies et les risques émergents après le déploiement, et « non pas simplement déterminer si un agent était sûr au moment de son lancement ».
- 04Outils et intégration. Des méthodes standardisées pour que les agents utilisent les outils, les API et les données, avec des registres qui indiquent quels agents sont en cours d'exécution, à quoi ils peuvent accéder et comment ils interagissent.
- 05Responsabilité. Une personne désignée pour chaque agent important, responsable de son utilisation et de ses résultats, avec une autorité claire sur qui peut le modifier, le suspendre ou l'arrêter.
- 06Sécurité. Des contrôles d'exécution, des pistes d'audit et des garde-fous de coûts qui conservent suffisamment de preuves pour reconstituer ce qu'un agent a fait, sous l'autorité de qui, avec quelles données et quels outils, et quels contrôles il a déclenchés.
Le chiffre qui change la donne
Les entreprises ayant mis en place les six contrôles à l'échelle de l'entreprise déclarent une valeur agentique d'environ 1,8 % de leur chiffre d'affaires. Celles qui n'en ont qu'un seul déclarent 0,5 %. C'est la différence du simple au triple, et BCG l'affirme sans détour : « Contrôler les agents ne diminue pas leur valeur, mais la triple. » À y regarder de plus près, 1,8 par rapport à 0,5 est plus proche de 3,6, et le rapport cite un chiffre de 3,6 fois lorsqu'il compare les contrôles en vigueur dans toute l'entreprise à ceux qui ne sont que pilotés. BCG a choisi le mot le plus prudent, et nous faisons de même. La combinaison de garde-fous de risque centraux avec une mise en œuvre fédérée permet de mettre à l'échelle trois fois plus de flux de travail qu'un pilotage entièrement centralisé.
Tous les contrôles n'ont pas le même poids. Dans l'analyse de BCG sur les moteurs de la valeur, la mémoire et le contexte ont le plus de poids (32 points d'importance relative), suivis par le périmètre et la supervision (21) et l'évaluation et le rollback (18). Viennent ensuite les outils et l'intégration (13), la responsabilité (9) et la sécurité (7).
Le décalage qui en résulte
À côté de la bonne nouvelle se trouve un chiffre qui dérange. 42 % des entreprises s'attendent à ce que les agents agissent de manière autonome d'ici 2030, en prenant des décisions sans approbation humaine. Parmi les entreprises « future-built », deux tiers s'attendent à une autonomie limitée ou totale. Pourtant, seulement 5 % appliquent les six contrôles aujourd'hui.
BCG confie également une mission aux conseils d'administration. Ils devraient définir et revoir périodiquement l'appétit pour le risque en matière d'IA de l'organisation, tandis que la direction tient un inventaire complet des agents. Les conseils d'administration devraient avoir une visibilité sur les plus importants d'entre eux : leur objectif, leur autorité, leurs dépendances clés, et qui peut intervenir ou les arrêter. Et ils devraient examiner les fournisseurs d'IA critiques, les points de défaillance uniques, les plans de secours, ainsi que les incidents majeurs ou les lacunes de contrôle.
“Des contrôles de risque efficaces servent de catalyseur, pas de frein : la mise en place des bons contrôles à l'échelle de l'entreprise triple approximativement la valeur que les agents créent.”
BCG, The Formula for Agentic AI Value
Troisième partie · Ce qu'un contrôle autodéclaré ne peut pas vous dire
Les six contrôles relèvent d'une bonne ingénierie, et nous souscririons à chacun d'entre eux. Relisez-les, cependant, et remarquez à qui ils s'adressent. Chaque contrôle de la liste est quelque chose qu'une entreprise applique à ses propres agents, pour son propre bénéfice, et qu'elle déclare elle-même. C'est la bonne liste pour capter de la valeur. C'est une liste incomplète pour quiconque doit se fier au résultat.
| Contrôle BCG | Ce qu'il examine | Qui le vérifie |
|---|---|---|
| Mémoire et contexte | Ce que l'agent stocke et transmet | L'entreprise |
| Périmètre et supervision | Ce que l'agent peut faire, et quand un humain intervient | L'entreprise |
| Évaluation et rollback | Comment l'agent performe, et comment revenir en arrière | L'entreprise |
| Outils et intégration | À quels outils, API et données l'agent peut accéder | L'entreprise |
| Responsabilité | Qui dans l'organisation répond de l'agent | L'entreprise |
| Sécurité | Ce que l'agent a fait, consigné pour l'audit | L'entreprise |
Il manque trois choses.
Les personnes qui en subissent les conséquences
Cherchez le mot « fairness » dans le rapport et vous ne le trouverez pas. Il en va de même pour le mot « biais », au sens où l'IA traite les gens différemment, et pour la discrimination. Il n'y a aucune mention du candidat, de l'emprunteur, du patient ou du demandeur au sujet duquel un agent prend une décision.
C'est une lacune étrange dans un rapport sur les agents qui prennent des décisions. Les propres exemples de BCG incluent un assureur santé dont les appels entrants concernent principalement les prestations et la couverture, et où des chatbots agentifs traitent désormais environ 60 % de tous les types d'appels entrants, et un sous-traitant de processus métier qui passe de la vente de main-d'œuvre et de temps à la vente de résultats basés sur l'IA. Pour les assureurs, le rapport classe le traitement des sinistres comme la principale source de valeur de l'IA. Ce sont précisément les domaines où une décision automatisée affecte une personne. Un agent peut passer les six contrôles avec succès et tout de même approuver un groupe de candidats moins souvent qu'un autre. Sa mémoire est bien configurée, son périmètre délimité, ses portes de déploiement en place, ses outils enregistrés, son propriétaire désigné et chaque action consignée. Aucun des six ne le remarquerait, car aucun d'eux n'est conçu pour cela.
Nous avons développé cet argument plus en profondeur dans Le biais est le fondement : la « fairness » n'est pas une fonctionnalité que l'on ajoute à la fin. Le biais s'introduit par les données, le modèle et l'évaluateur humain, et une boucle de rétroaction le réinjecte dans le cycle suivant de données d'entraînement. Les agents ajoutent de nouveaux points d'entrée : les outils qu'ils choisissent, les documents qu'ils extraient, les notes qu'ils se transmettent.
Réglementation
Le rapport ne mentionne pas l'EU AI Act. En vertu de cette loi, telle que modifiée par l'Omnibus numérique sur l'IA, les obligations pour les systèmes à haut risque énumérés à l'annexe III s'appliqueront à partir du 2 décembre 2027. Elles couvrent l'IA utilisée pour le recrutement et la gestion des travailleurs, pour l'évaluation de la solvabilité et la notation de crédit, ainsi que pour l'évaluation des risques et la tarification des assurances vie et santé. Cette date est dans quatorze mois. BCG indique que les entreprises tournées vers l'avenir obtiennent des résultats en environ onze mois. Un agent mis en production ce trimestre fonctionnera déjà dans son état réglementé.
La responsabilité entre en jeu plus tôt. La directive européenne révisée sur la responsabilité du fait des produits défectueux considère les logiciels, y compris les systèmes d'IA, comme des produits, et elle s'applique aux produits mis sur le marché ou mis en service après le 9 décembre 2026, soit dans neuf semaines. Pour les entreprises de ces marchés, plusieurs des six contrôles de BCG cessent d'être de bonnes pratiques pour devenir des obligations. L'évaluation après le déploiement, la supervision humaine documentée et l'enregistrement des actions du système ne sont plus des options. Et une fois la responsabilité engagée, la question qu'un tribunal posera ne sera pas de savoir si une entreprise croyait que ses contrôles fonctionnaient, mais ce que l'entreprise peut prouver. Comme nous l'avons expliqué dans Le paradoxe de l'assurance préemptive, « c'est la faute du modèle » n'est pas une défense.
Toute personne extérieure à l'entreprise
La troisième lacune est celle à laquelle les autres mènent. Un contrôle que seul son propriétaire peut vérifier est une promesse. Elle est peut-être sincère, et peut-être même tenue. Mais un régulateur, un client, un assureur ou un membre indépendant du conseil d'administration n'a aucun moyen de distinguer un contrôle fonctionnel d'un contrôle bien décrit.
L'enquête montre la même limite à grande échelle. Lorsque 1 330 dirigeants évaluent leurs propres contrôles, le résultat est une cartographie minutieuse de l'auto-évaluation. BCG le reconnaît, et cette honnêteté est tout à son honneur. Dans La précision n'est pas une preuve, nous avons appelé cela la différence entre désigner et voir : une affirmation peut désigner la bonne chose sans rien dire sur la qualité de l'observation. « Nous avons mis en place une évaluation et une restauration » désigne un contrôle. Cela ne dit pas ce que l'évaluation a pu manquer.
“Un contrôle que seul son propriétaire peut vérifier est une promesse, pas une preuve.”
Troisième partie · Ce qu'un contrôle autodéclaré ne peut pas vous dire
Rien de tout cela n'est une critique de BCG. Le rapport répond à la question qu'il s'est posée : comment les entreprises tirent-elles de la valeur des agents ? La question qu'il laisse en suspens est celle qui détermine si cette valeur résiste au regard d'un tiers.
Quatrième partie · Un comité de prêt, six contrôles
Un exemple rend cette lacune concrète. Il provient des objets de test que nous publions avec notre bibliothèque open source, vfairness, avec les données et l'environnement de test, afin que n'importe qui puisse le ré-exécuter.
Deux agents forment un petit comité de prêt. Un agent de présélection lit chaque demande et rédige un score de risque ainsi qu'une note d'une phrase pour l'évaluateur. Un évaluateur note et décide deux fois : une première fois sur la base de la demande seule, et une seconde fois après avoir lu la réponse de l'agent de présélection. Nous avons soumis trente demandes, chacune sous douze noms signalant le genre et l'origine (suisse, kosovare et nigériane) et une fois sans nom à titre de contrôle, et ce, à deux reprises : 780 épisodes, dans lesquels seul le nom changeait. Nous avons conservé le score et la décision de chaque agent à chaque étape, et pas seulement la réponse finale.
Soumettons maintenant le comité aux six contrôles de BCG.
- 01Mémoire et contexte. La note de l'agent de présélection est exactement le type de contexte contre lequel BCG met en garde : une information qu'un agent transmet au suivant. Un bon contrôle de la mémoire décide de la manière dont cette note est stockée, de qui peut la lire et de sa durée de vie. Il ne se demande pas si la note est équitable.
- 02Périmètre et supervision. Les deux agents restent dans leur périmètre. L'agent de présélection présélectionne, l'évaluateur évalue, un humain peut annuler la décision.
- 03Évaluation et restauration. Une porte de déploiement classique vérifie la précision, la latence et les taux de refus. Le comité passe le test.
- 04Outils et intégration. Les deux agents sont enregistrés, avec les bons accès.
- 05Responsabilité. Il y a un propriétaire désigné qui peut arrêter le comité.
- 06Sécurité. Chaque action est consignée. Toutes les preuves sont là.
Les six contrôles sont au vert. Voici ce que le test de « fairness » a trouvé dans les mêmes journaux.
| Point de décision | Écart des scores de risque moyens entre les six groupes (échelle de 100 points) | Confirmé par les données ? |
|---|---|---|
| Agent de présélection | 3,4 points, de 43,8 (femmes suisses) à 47,1 (hommes nigérians) | Oui (p < 0,001) |
| Évaluateur, sur la base de la demande seule | 2,9 points, de 48,1 (femmes kosovares) à 51,0 (hommes suisses) | Non (p = 0,06) |
| Évaluateur, après lecture de la réponse de l'agent de présélection | 4,9 points, de 49,0 (femmes suisses) à 53,9 (hommes nigérians) | Oui (p < 0,001) |
| Amplification par la transmission, en tant qu'effet distinct | Suggéré par l'augmentation de 2,9 à 4,9 | Non établi |
L'agent de présélection a noté les mêmes dossiers différemment en fonction du nom, avec un écart de 3,4 points sur une échelle de risque de 100 points, et la différence était statistiquement claire. Sur la base du dossier seul, l'examinateur a montré un écart de 2,9 points que les données n'ont pas pu confirmer. Après avoir lu la réponse de l'agent de présélection, l'écart de l'examinateur est passé à 4,9 points et est devenu clair.
Un autre détail est important, car c'est là que l'honnêteté a un coût. Les données suggèrent que le transfert a amplifié le biais de l'examinateur, mais l'augmentation elle-même n'a pas passé le test, et notre analyse d'amplification ne l'a pas confirmée comme un effet distinct. Notre rapport indique donc exactement cela : une disparité confirmée chez l'agent de présélection, une disparité confirmée chez l'examinateur après le transfert, et amplification non établie. Il ne transforme pas cette troisième conclusion en gros titre.
C'est tout l'intérêt de l'exemple. Chacun des contrôles de BCG a fonctionné comme prévu, et aucun d'entre eux n'a pu déceler le problème, car le problème ne résidait pas dans la manière dont les agents étaient exécutés. Il résidait dans la manière dont ils traitaient les gens. Pour le déceler, il fallait un autre type de contrôle : un contrôle qui mesure les résultats par groupe, au niveau de chaque agent et de chaque transfert, et qui indique clairement son degré de certitude.
“Les six contrôles étaient au vert. La disparité était dans les journaux depuis le début. Personne n'avait posé cette question aux journaux.”
Quatrième partie · Un comité de prêt, six contrôles
Cinquième partie · Du contrôle à la preuve
Nous avons conçu validant.ai pour l'espace qui se situe entre un contrôle et la preuve de son efficacité. Notre approche se déroule en trois étapes, identiques pour un modèle de recrutement, un score de crédit ou un agent : mesurer si un système traite différemment des groupes de personnes, expliquer les causes de cette différence, et prouver le résultat sous une forme que n'importe qui peut vérifier.
Correspondance avec les six contrôles de BCG
Voici la correspondance honnête, y compris ce qui n'est pas terminé. Nous préférons publier un tableau avec des lacunes plutôt qu'une affirmation que nous ne pouvons pas étayer.
| Contrôle BCG | Ce que font validant.ai et vfairness | Statut |
|---|---|---|
| Évaluation et rollback | Portails de Fairness qui bloquent une mise en production dans le pipeline CI/CD, surveillance continue avec détection de dérive, et des résultats qui indiquent « preuves insuffisantes » au lieu de valider ce qu'ils n'ont pas pu mesurer | Disponible aujourd'hui |
| Sécurité et piste d'audit | Les résultats enregistrent la version de la méthode et les seuils utilisés, et les exécutions d'agents et de LLM enregistrent également la version de la bibliothèque, les paramètres et un horodatage UTC ; le verdict est scellé sous la forme d'un titre de compétences signé que n'importe qui peut vérifier, sans avoir besoin de compte | Disponible aujourd'hui |
| Mémoire et contexte | Tests multi-agents qui montrent quand la sortie d'un agent biaise la décision du suivant, comme dans l'exemple du comité de prêt ci-dessus | Disponible en version bêta ; vérifié jusqu'à présent uniquement par rapport à nos propres tests |
| Outils et intégration | Tests pour déterminer si un agent choisit des outils ou récupère des documents différemment selon la personne concernée par le cas | Disponible en version bêta ; un objet de test publié pour le choix d'outils, aucun pour l'instant pour la récupération de documents |
| Responsabilité | Le Sceau de Confiance désigne l'organisation responsable du système, telle que cette organisation la déclare | En partie : nous enregistrons la propriété telle que déclarée ; nous ne la vérifions ni ne l'appliquons pas encore |
| Périmètre et supervision | Mandats d'agent signés qui définissent ce qu'un agent peut faire au nom de quelqu'un, et qui peuvent être révoqués | Proposé, non développé |
Le contrôle que la liste omet
Si la liste de BCG avait un septième point, nous plaiderions pour celui-ci : la Fairness, mesurée là où les personnes sont affectées. Pas un score global pour l'ensemble du système, qui peut masquer un problème réel par effet de moyenne, mais une mesure par groupe, par point de décision et par transfert entre agents, avec son incertitude statistique indiquée et une troisième réponse lorsque les données ne permettent de soutenir aucun des deux verdicts. C'est ce que fait notre bibliothèque ouverte, vfairness. Elle couvre les données d'entraînement, les modèles, les LLM, les agents et les systèmes multi-agents, et elle est gratuite sous licence Apache-2.0, afin que n'importe qui puisse réexécuter nos mesures et nous dire en quoi ils ne sont pas d'accord.
Trois corps, pas un seul
Dans La confiance numérique est une orbite, pas un pilier, nous avons décrit la confiance dans l'IA comme l'équilibre entre trois corps : le modèle qui décide, l'organisation qui en répond, et la personne sur laquelle il statue. Les six contrôles de BCG se situent presque entièrement dans le deuxième corps. Ils décrivent la manière dont une organisation gère ses agents.
validant.ai ajoute les deux autres et relie les trois :
- 01Le modèle. Nous mesurons ce que le système fait réellement, par groupe, et expliquons les causes de tout écart.
- 02L'organisation. Nous évaluons si la gouvernance fonctionne comme décrit, et désignons le propriétaire responsable sur le sceau, tel que l'organisation le déclare.
- 03La personne. Dans une démonstration concrète, un candidat à un emploi a reçu un Récépissé de Décision dans un portefeuille personnel réel sur swiyu, la version bêta publique de l'infrastructure de confiance e-ID de la Suisse : expliquant pourquoi la décision a été prise, et comment demander un examen humain. Les raisons dans cette démonstration ont été rédigées à la main. Les produire à partir du système décisionnel, et intégrer pleinement ce corps dans la plateforme, est la prochaine étape de notre feuille de route.
Des preuves qui sortent du bâtiment
L'étape la plus importante est la dernière. Nous ne développons, n'hébergeons ni ne vendons les systèmes que nous évaluons. Nos résultats sont émis sous forme de titres de compétences vérifiables, signés et contrôlables par un régulateur, un client ou un membre du conseil d'administration, sans avoir à se connecter et sans nous faire confiance. Chaque conclusion indique ce que nous avons pu voir et ce que nous n'avons pas pu voir : le niveau d'accès que nous avions, la robustesse de la méthode, la date du résultat. Un sceau couvre un système à un moment donné, et le précise.
Pourquoi la preuve est ce qui concrétise la triple valeur
Pour le dire simplement : la triple valeur de BCG est la valeur qu'une entreprise crée. La conservation de cette valeur dépend de personnes qui n'étaient pas présentes lors de la mise en place des contrôles. Chacune d'entre elles déprécie un contrôle qu'elle ne peut pas vérifier. L'assureur le tarifie comme s'il était absent. L'équipe des achats renvoie le questionnaire le trimestre suivant. Le superviseur demande les registres qui sous-tendent la politique. Le tribunal considère la description comme une simple affirmation. Cette dépréciation constitue la lacune, et c'est par là que la triple valeur se dissipe.
| Qui doit être convaincu par vos contrôles | Avec un contrôle interne uniquement | Avec des preuves vérifiables |
|---|---|---|
| Un régulateur ou un superviseur | Une description du processus, et une demande des registres qui le sous-tendent | Des résultats par groupe, signés et datés, qu'ils peuvent vérifier sans accéder à vos systèmes |
| Un assureur | Une réponse à un questionnaire, tarifée comme si le contrôle était absent | Des disparités mesurées avec leur incertitude statistique, et une déclaration sur ce que le test aurait pu manquer |
| Un client achetant des résultats produits par l'IA | Une assurance contractuelle, et le même questionnaire le trimestre suivant | Une accréditation que sa propre équipe peut vérifier |
| La personne concernée par la décision d'un agent | Rien qu'elle puisse voir | Une confirmation de la décision et une possibilité d'examen humain (actuellement au stade de la démo) |
| Votre propre conseil d'administration | Une auto-évaluation | Un regard extérieur sur les agents les plus importants |
C'est l'argument direct en faveur de ce que nous faisons. Les contrôles rendent les agents gouvernables. Des preuves indépendantes et vérifiables rendent cette gouvernance crédible aux yeux de chacun de ces lecteurs simultanément. Une entreprise qui peut fournir à chacun d'eux un élément vérifiable n'a pas à plaider en faveur de sa triple valeur. Elle peut la démontrer.
“BCG montre aux entreprises comment contrôler leurs agents. Nous les aidons à le prouver à quelqu'un qui n'a aucune raison de les croire sur parole.”
Cinquième partie · Du contrôle à la preuve
Sixième partie · Que faire maintenant
Pour un conseil d'administration, un comité des risques ou une équipe mettant des agents en production, le rapport et les lacunes qu'il révèle se résument à six étapes. Aucune d'entre elles ne nécessite d'attendre un régulateur.
- 01Recensez vos agents. Vous ne pouvez pas contrôler ce que vous n'avez pas répertorié. Notez chaque agent qui prend ou façonne une décision, ce qu'il peut faire, les données et outils auxquels il a accès, et qui en est le propriétaire. BCG demande à la direction de tenir précisément cet inventaire, et aux conseils d'administration d'y consulter les agents les plus importants. La plupart des entreprises n'en ont pas encore.
- 02Mettez en place les six contrôles partout, pas seulement dans un projet pilote. Les données de BCG indiquent que la valeur provient de leur application à tous, à l'échelle de l'entreprise. Un projet pilote bien gouverné à côté d'une production non gouvernée est le pire des deux mondes.
- 03Ajoutez la Fairness à l'évaluation. Pour chaque agent qui prend des décisions concernant des personnes, testez les différences entre les groupes avant le déploiement, et continuez les tests après, car les agents dérivent, tout comme les personnes qu'ils servent. Testez chaque transfert entre agents, pas seulement la réponse finale.
- 04Mesurez honnêtement. Un résultat positif sur un petit échantillon ne prouve pas grand-chose. Demandez à chaque test l'ampleur d'un problème qu'il aurait pu manquer, et considérez « preuves insuffisantes » comme une conclusion, pas comme une validation.
- 05Conservez des preuves que d'autres peuvent vérifier. Les journaux que vous seul pouvez lire sont un début. Des résultats qu'un régulateur, un assureur ou un client peut vérifier sans avoir à vous faire confiance, voilà ce qui comptera lorsque les règles de responsabilité, l'EU AI Act ou un grand client le demanderont.
- 06Obtenez un avis extérieur sur ce qui est le plus important. Faites évaluer au moins vos agents les plus importants par quelqu'un qui ne les a pas conçus. Tous les agents n'en ont pas besoin. Ceux qui prennent des décisions concernant le crédit, l'emploi, la santé ou l'argent, si.
Septième partie · Ce que nous aimerions, et que nous n'obtiendrons peut-être pas
L'histoire est séduisante et semble s'écrire d'elle-même. Les conseils d'administration lisent BCG, voient que les contrôles triplent la valeur, se demandent comment savoir si leurs contrôles fonctionnent, et inscrivent l'évaluation indépendante dans la ligne budgétaire que BCG appelle la gouvernance. Nous aimerions que cette histoire soit vraie. Il y a de bonnes raisons d'être prudent.
L'effet triple est une corrélation. Les entreprises disposant des six contrôles sont aussi, très probablement, meilleures dans de nombreux autres domaines : données, talents, concentration. BCG n'affirme pas que les contrôles à eux seuls sont la cause de la valeur supplémentaire, et personne citant ce chiffre, y compris nous, ne devrait le faire. L'interprétation la plus prudente est que des contrôles solides et des résultats solides vont de pair, et que les entreprises qui déploient des agents à grande échelle sans contrôles prennent un pari que les leaders ne prennent pas.
La Fairness n'est pas dans le rapport, et cela est peut-être révélateur du marché. Si les dirigeants interrogés par BCG ne considèrent pas la Fairness comme faisant partie de la gouvernance des agents, de nombreux acheteurs ne le feront pas non plus, du moins jusqu'à ce qu'un régulateur, un tribunal ou un gros titre les y oblige. Nous pensons que ce point de vue est à courte vue. Nous savons aussi qu'un meilleur argument ne suffit pas à lui seul pour modifier les budgets.
Les budgets de gouvernance sont faibles. Dans la ventilation de BCG, la gouvernance est le plus petit poste des dépenses en IA, environ 0,3 % du chiffre d'affaires sur un total de 3,3 %. L'évaluation indépendante doit s'inscrire dans cette ligne, aux côtés de la stratégie, de la gestion des risques et de la conformité.
Nos propres outils ne sont pas tous matures. Comme le montre le tableau de la cinquième partie, les tests d'agents et de multi-agents sont en version bêta et ont jusqu'à présent été vérifiés principalement par rapport à nos propres tests, et les mandats d'agents signés ne sont pas encore développés. Nous publions ce que nous avons vérifié et ce que nous n'avons pas vérifié sur notre page qualité et renforcement, car un fournisseur d'évaluations qui cache ses propres limites commet l'erreur même qu'il est censé déceler.
Il s'agit donc d'un argument, pas d'une prévision. Nous pensons que les entreprises qui capteront la valeur décrite par BCG seront celles qui pourront démontrer que leurs contrôles fonctionnent, et pas seulement celles qui en disposent. Nous serions ravis d'en débattre avec quiconque voit les choses différemment.
La confiance s'évalue, elle ne s'affirme pas. Si votre organisation met des agents en production et souhaite des preuves indépendantes et vérifiables de leur comportement, avant l'entrée en vigueur des règles de responsabilité en décembre et des obligations pour les systèmes à haut risque de l'EU AI Act en décembre 2027, notre bêta fermée est ouverte à un groupe restreint. Écrivez à hello@validant.ai avec l'objet « Closed Beta », ou demandez une démo. Pour essayer le moteur open source dès aujourd'hui : pip install vfairness.
En résumé
BCG a montré que le contrôle des agents n'est pas un frein à leur valeur, mais la raison pour laquelle elle se multiplie. L'étape suivante consiste à rendre ce contrôle visible : aux personnes concernées par les décisions des agents, aux régulateurs et à toute personne qui doit faire confiance au résultat sans vous croire sur parole. Les freins permettent d'aller vite. La preuve permet aux autres de vous accompagner.
“La confiance s'évalue, elle ne s'affirme pas. Un contrôle que personne d'autre ne peut vérifier reste une simple affirmation.”
Le contrôle des agents triple leur valeur
Sources et lectures complémentaires
- 01Apotheker, J., Beauchene, V., de Bellefonds, N., et al. (2026). La formule de la valeur de l'IA agentique : L'indice de l'IA appliquée 2026. Boston Consulting Group, septembre 2026. Tous les chiffres et citations de BCG dans cet article proviennent de ce rapport.
- 02Union européenne. (2026). Règlement (UE) 2026/1744 (Omnibus numérique sur l'IA), modifiant le règlement (UE) 2024/1689. Journal officiel de l'Union européenne, 24 juillet 2026. Fixe l'application des obligations relatives au haut risque de l'annexe III au 2 décembre 2027.
- 03Union européenne. (2024). Règlement (UE) 2024/1689 (the AI Act). Journal officiel de l'Union européenne. Annexe III, points 4 et 5(b) et (c).
- 04Union européenne. (2024). Directive (UE) 2024/2853 sur la responsabilité du fait des produits défectueux. Journal officiel de l'Union européenne. Article 2, paragraphe 1, et considérant 13.
- 05validant.ai. objets de test vfairness : le comité de prêt, avec ses données d'exécution, son harness et son notebook exécuté.
- 06validant.ai. vfairness sur PyPI, Apache-2.0.
- 07validant.ai. Vérifier un sceau de confiance : vérifie la signature et le statut de révocation d'un sceau, sans compte.
- 08validant.ai. qualité et renforcement de vfairness : ce qui est vérifié et ce qui ne l'est pas.
- 09Glinz, D. (2026). La précision n'est pas une preuve : le piège de chaque verdict de Fairness en IA. validant.ai Signal.
- 10Glinz, D. (2026). Le paradoxe de l'assurance préemptive : Qui garde les garde-fous de l'IA ? validant.ai Signal.
- 11Glinz, D. (2026). Le biais est le fondement. validant.ai Signal.
- 12Glinz, D. (2026). La confiance numérique est une orbite, pas un pilier. validant.ai Signal.
- 13Glinz, D. (2026). Les agents agiront pour nous. Qui se porte garant d'eux ? validant.ai Signal.
- 14Glinz, D. (2026). Le problème de confiance que personne ne veut nommer. validant.ai Signal.
RechercheOuvrir pour lirePrécision ne vaut pas preuve : le piège que recèle tout verdict sur l'équité de l'IA
Un modèle aux prédictions parfaites n'assure plus personne ; un verdict publié sans sa limite de détection vous incite à supposer que cette limite est nulle. Deux échecs, une omission, et deux mots empruntés pour les distinguer.
Lire
RechercheOuvrir pour lireLa confiance numérique est une orbite, pas un pilier
La confiance n'est pas un pilier de plus à ajouter. C'est l'orbite que trois corps tracent ensemble : le modèle, la personne et l'organisation. Découvrez pourquoi le problème à trois corps est la métaphore la plus juste pour une IA digne de confiance, et comment savoir où vous vous situez sur cette orbite.
Lire
RechercheOuvrir pour lireLe paradoxe de l'assurance préventive : qui garde les garde-fous de l'IA ?
En l'espace d'une semaine en septembre, un laboratoire a demandé de ralentir, un président s'est déclaré le seul garde-fou dont l'IA ait besoin, et The Economist a demandé si la course aux armements pouvait être stoppée. Notes des Trust Valley Days 2026 à l'EPFL expliquant pourquoi la réponse n'est ni une pause ni un sprint, mais une question de responsabilité, de résultats et de vérification.
Lire