Toutes les actualités
Recherche

Le contrôle des agents triple leur valeur. C'est la preuve qui fait toute la différence.

Fin dessin technique gris-bleu sur papier de couleur chaude d'une monoplace de course freinant dans un virage, dessinée en grand en perspective isométrique. La roue avant la plus proche est découpée pour montrer un disque de frein ventilé serré par un étrier de frein bleu canard, le tout repris dans un cercle de détail en vue éclatée. Des arcs de cote tracent le virage, des panneaux vierges bordent la piste, et de fines lignes de télémétrie en pointillés partent de la voiture, passent par-dessus la barrière de sécurité et rejoignent un pupitre à l'extérieur de la piste, où une petite silhouette humaine lit un registre ouvert et ligné. Un léger lavis corail se trouve derrière l'avant de la voiture.
Traduit de l'anglais par une IA. La version anglaise fait foi.Lire l'original en anglais

Demandez à un ingénieur de course ce qui rend une voiture rapide et vous obtiendrez peut-être une réponse qui semble paradoxale : les freins. Un pilote qui a confiance dans ses freins conserve sa vitesse jusque tard dans le virage. Un pilote qui n'a pas confiance lève le pied plus tôt, à chaque tour, et perd du temps partout.

De bons freins ne ralentissent pas la voiture. Ils sont la raison pour laquelle elle peut être pilotée à la limite. Pendant des années, la gouvernance de l'IA a été présentée, et perçue avec ressentiment, comme le contraire. Les équipes de gestion des risques étaient celles qui disaient non. La conformité était le coût de l'IA, payé à contrecœur et maintenu aussi bas que possible. La plupart des conseils d'administration avec qui nous discutons le voient encore de cette manière : un frein nécessaire à ce qui crée réellement de la valeur.

En septembre, le Boston Consulting Group a publié un rapport qui devrait mettre fin à cette perception. The Formula for Agentic AI Value, l'édition 2026 de son Applied AI Index, révèle que les entreprises disposant d'un ensemble complet de contrôles sur leurs agents d'IA déclarent tirer de ces agents environ trois fois plus de valeur que les entreprises n'en ayant qu'un seul. Selon les propres termes de BCG : « Des contrôles des risques efficaces servent de catalyseur, et non de frein. »

C'est la bonne nouvelle, et elle mérite d'être largement diffusée. Notre argumentation commence une étape plus loin, et nous l'exposerons directement. BCG a mesuré la valeur du contrôle au sein d'une entreprise. Le maintien de cette valeur à l'extérieur, face à un régulateur, un assureur, un client ou la personne concernée par la décision d'un agent, dépend de la capacité d'un tiers à vérifier les contrôles mis en place. Aujourd'hui, presque personne ne le peut. Demandez à un conseil d'administration ce que valent ses agents et s'ils sont sous contrôle, et la réponse honnête est généralement : nous le pensons. Le contrôle est ce qui triple la valeur. La preuve est ce qui permet aux autres de s'y fier. C'est cette lacune que validant.ai a pour mission de combler.

À qui s'adresse ce texte

Cet article s'adresse aux conseils d'administration, aux directeurs des risques, aux responsables de l'IA et aux équipes de conformité qui mettent ou s'apprêtent à mettre des agents en production, et qui devront en assumer la responsabilité. La première partie résume le rapport et ne nécessite aucune connaissance technique. La quatrième partie présente un exemple concret. Dans la cinquième partie, nous expliquons ce que validant.ai propose à ce sujet, et pourquoi cela change la valeur de ce triplement.

Nous ne sommes pas neutres. Nous développons les outils et menons les évaluations qui produisent des preuves indépendantes sur les systèmes d'IA, et cet article soutient que le marché en a besoin. Nous avons séparé le résumé du rapport de BCG de notre propre argumentation à son sujet, et nous indiquons clairement où nos propres outils ne sont pas finalisés.

Synthèse

  1. 01

    La valeur de l'IA est réelle et concentrée

    Les entreprises qui allient clarté stratégique et IA appliquée déclarent une valeur de l'IA environ cinq fois supérieure à celle des entreprises qui ne possèdent ni l'une ni l'autre. L'IA agentique représente la part de cette valeur qui connaît la plus forte croissance, passant de 17 % en 2025 à 39 % prévus d'ici 2030.

  2. 02

    Les contrôles la multiplient

    Les entreprises ayant mis en place six contrôles d'agents à l'échelle de l'entreprise déclarent une valeur agentique environ trois fois supérieure à celle des entreprises n'en ayant qu'un seul. Seulement 5 % les ont mis en place, tandis que 42 % s'attendent à ce que les agents prennent des décisions sans approbation humaine d'ici 2030.

  3. 03

    Chaque contrôle de la liste est interne

    Aucun des six ne prend en compte les personnes concernées par les décisions d'un agent, et aucun n'implique qu'une personne extérieure à l'entreprise vérifie le résultat. Les mots « Fairness » et « réglementation » n'apparaissent pas dans le rapport, et l'enquête elle-même est basée sur les déclarations des participants, comme le note BCG.

  4. 04

    La preuve est le contrôle manquant

    La « Fairness » mesurée là où les personnes sont affectées, une mesure honnête qui indique ce qu'elle pourrait omettre, et des preuves scellées pour que des tiers puissent les vérifier. Cela transforme la gouvernance d'une conviction interne en une valeur sur laquelle les autres peuvent compter.

Le fondement : le biais précède tout ce qui se construit au-dessus

Première partie · Ce que BCG a mesuré

L'Applied AI Index repose sur une enquête menée auprès de 1 330 CxO et cadres supérieurs qui prennent des décisions concernant l'IA, dans plus de 60 pays et plus de 20 secteurs, dont plus de la moitié travaillent dans des entreprises réalisant plus de 5 milliards de dollars de chiffre d'affaires. Son idée centrale tient sur un coin de table : clarté stratégique plus IA appliquée égale impact transformateur.

La clarté stratégique est une question de choix. Elle consiste à concentrer l'IA sur quelques domaines à forte valeur ajoutée, à la gérer comme un programme unique, financé, pluriannuel et piloté par la direction générale, et à suivre sa valeur dans le compte de résultat plutôt que dans des présentations. L'IA appliquée est une question d'exécution. Elle comporte trois volets : un modèle opérationnel articulé autour des agents et des contrôles pour les gérer, une main-d'œuvre repensée autour de la collaboration entre humains et agents, et une plateforme de données que les agents peuvent réellement utiliser.

Lorsque les deux sont réunies, les chiffres changent. Les entreprises fortes en clarté et en IA appliquée ont réalisé une valeur de l'IA d'environ 4,5 % de leur chiffre d'affaires en 2025. Celles qui sont faibles sur les deux plans ont atteint 0,9 %. C'est l'écart du simple au quintuple qui figure dans le titre de BCG.

Quatre niveaux, une petite élite

BCG classe les entreprises en quatre groupes. En 2026, 4,5 % stagnent, 47 % sont émergentes, 41 % sont en phase de déploiement et 7,5 % sont ce que BCG appelle « future-built » (prêtes pour l'avenir), contre 5 % un an plus tôt. C'est dans le groupe « future-built » que la valeur se concentre. Parmi elles, 95 % suivent la valeur de l'IA avec des KPI clairs ou directement dans le compte de résultat, et elles déclarent atteindre un impact en 11 mois environ, contre 17 pour les entreprises à la traîne.

Un détail révélateur se trouve dans les données de mesure. En dehors du groupe de tête, la plupart des entreprises, selon l'expression de BCG, « naviguent à vue » : 47 % des entreprises à la traîne mesurent au mieux la valeur de l'IA de manière qualitative. Une autre analyse de BCG citée dans le rapport a révélé que si près de neuf PDG sur dix constatent des avantages de l'IA en termes de coûts ou de revenus, seuls 14 % ont clairement défini l'impact de chaque initiative sur le compte de résultat.

Les agents sont la source des prochains gains

Ce n'est pas sans raison que le sous-titre du rapport porte sur les agents. L'IA agentique représentait 17 % de la valeur de l'IA en 2025 et 22 % en 2026. BCG prévoit 39 % d'ici 2030, ce qui en ferait la plus grande source de valeur de l'IA. L'écart est ici plus marqué que partout ailleurs : 44 % des entreprises « future-built » déclarent déjà tirer la pleine valeur des agents, contre 2 % des entreprises à la traîne.

Ce que rapporte BCGChiffre
Valeur de l'IA, entreprises fortes vs faibles en clarté et IA appliquée4,5 % vs 0,9 % du chiffre d'affaires (2025)
Part des entreprises « future-built »7,5 % en 2026, contre 5 %
Part de l'IA agentique dans la valeur de l'IA17 % (2025), 22 % (2026), 39 % prévus (2030)
Valeur agentique avec les six contrôles vs un seul1,8 % vs 0,5 % du chiffre d'affaires
Entreprises appliquant les six contrôles aujourd'hui5 %
Entreprises s'attendant à ce que les agents décident sans approbation humaine d'ici 203042 %
L'Applied AI Index 2026 en six chiffres. Source : BCG, The Formula for Agentic AI Value (septembre 2026).

Prendre les chiffres pour ce qu'ils sont

Une mise en garde s'applique à tout ce qui suit, et BCG l'énonce ouvertement dans sa méthodologie. Les chiffres proviennent de dirigeants évaluant la maturité de leur propre organisation sur 41 capacités. Sauf indication contraire dans le compte de résultat 2025, les chiffres de valeur représentent l'impact futur attendu. Et les réponses « peuvent être sujettes à un biais de perception ».

Ce n'est pas une faille du rapport. C'est la nature d'une enquête. Mais c'est important pour l'argumentation, car cela signifie que le rapport est une image précise de la façon dont les entreprises se perçoivent. Il nous dit ce que les dirigeants croient au sujet de leur IA et de leurs contrôles. Il ne peut pas nous dire si ces croyances résisteraient à un regard extérieur. Nous y reviendrons dans la troisième partie.

Deuxième partie · Six contrôles, une valeur triplée

La partie du rapport la plus importante pour quiconque déploie des agents est une courte liste. La mise à l'échelle des agents, selon BCG, entraîne un risque qu'il nomme la prolifération des agents : agents dupliqués, autorisations contradictoires, responsabilités floues, lacunes dans la surveillance. Le changement plus profond est que les agents combinent des données, des outils, de la mémoire et d'autres agents à travers les flux de travail, de sorte que les risques peuvent « émerger dynamiquement et s'aggraver à la vitesse de la machine ». L'ancien modèle opérationnel de risque, conçu pour des logiciels qui font ce qu'on leur dit, n'est pas suffisant.

BCG nomme six contrôles qui comblent cette lacune :

  • 01Mémoire et contexte. La manière dont les agents stockent et rappellent les informations. La mémoire peut démultiplier l'apprentissage entre les agents, mais elle peut aussi transmettre des erreurs, des données sensibles ou un contexte manipulé d'un flux de travail à l'autre.
  • 02Périmètre et supervision. La fonction de chaque agent, ce qu'il peut faire, à quelles fins, et quand un humain doit intervenir. L'autorité n'est pas seulement limitée par ce qu'un agent peut atteindre, mais aussi par ce qu'il est autorisé à faire.
  • 03Évaluation et rollback. Critères d'évaluation, portes de validation, surveillance continue et une possibilité de retour en arrière. Les contrôles devraient détecter la dérive, les anomalies et les risques émergents après le déploiement, et « non pas simplement déterminer si un agent était sûr au moment de son lancement ».
  • 04Outils et intégration. Des méthodes standardisées pour que les agents utilisent les outils, les API et les données, avec des registres qui indiquent quels agents sont en cours d'exécution, à quoi ils peuvent accéder et comment ils interagissent.
  • 05Responsabilité. Une personne désignée pour chaque agent important, responsable de son utilisation et de ses résultats, avec une autorité claire sur qui peut le modifier, le suspendre ou l'arrêter.
  • 06Sécurité. Des contrôles d'exécution, des pistes d'audit et des garde-fous de coûts qui conservent suffisamment de preuves pour reconstituer ce qu'un agent a fait, sous l'autorité de qui, avec quelles données et quels outils, et quels contrôles il a déclenchés.

Le chiffre qui change la donne

Les entreprises ayant mis en place les six contrôles à l'échelle de l'entreprise déclarent une valeur agentique d'environ 1,8 % de leur chiffre d'affaires. Celles qui n'en ont qu'un seul déclarent 0,5 %. C'est la différence du simple au triple, et BCG l'affirme sans détour : « Contrôler les agents ne diminue pas leur valeur, mais la triple. » À y regarder de plus près, 1,8 par rapport à 0,5 est plus proche de 3,6, et le rapport cite un chiffre de 3,6 fois lorsqu'il compare les contrôles en vigueur dans toute l'entreprise à ceux qui ne sont que pilotés. BCG a choisi le mot le plus prudent, et nous faisons de même. La combinaison de garde-fous de risque centraux avec une mise en œuvre fédérée permet de mettre à l'échelle trois fois plus de flux de travail qu'un pilotage entièrement centralisé.

Tous les contrôles n'ont pas le même poids. Dans l'analyse de BCG sur les moteurs de la valeur, la mémoire et le contexte ont le plus de poids (32 points d'importance relative), suivis par le périmètre et la supervision (21) et l'évaluation et le rollback (18). Viennent ensuite les outils et l'intégration (13), la responsabilité (9) et la sécurité (7).

Le décalage qui en résulte

À côté de la bonne nouvelle se trouve un chiffre qui dérange. 42 % des entreprises s'attendent à ce que les agents agissent de manière autonome d'ici 2030, en prenant des décisions sans approbation humaine. Parmi les entreprises « future-built », deux tiers s'attendent à une autonomie limitée ou totale. Pourtant, seulement 5 % appliquent les six contrôles aujourd'hui.

BCG confie également une mission aux conseils d'administration. Ils devraient définir et revoir périodiquement l'appétit pour le risque en matière d'IA de l'organisation, tandis que la direction tient un inventaire complet des agents. Les conseils d'administration devraient avoir une visibilité sur les plus importants d'entre eux : leur objectif, leur autorité, leurs dépendances clés, et qui peut intervenir ou les arrêter. Et ils devraient examiner les fournisseurs d'IA critiques, les points de défaillance uniques, les plans de secours, ainsi que les incidents majeurs ou les lacunes de contrôle.

“Des contrôles de risque efficaces servent de catalyseur, pas de frein : la mise en place des bons contrôles à l'échelle de l'entreprise triple approximativement la valeur que les agents créent.”

BCG, The Formula for Agentic AI Value

Troisième partie · Ce qu'un contrôle autodéclaré ne peut pas vous dire

Les six contrôles relèvent d'une bonne ingénierie, et nous souscririons à chacun d'entre eux. Relisez-les, cependant, et remarquez à qui ils s'adressent. Chaque contrôle de la liste est quelque chose qu'une entreprise applique à ses propres agents, pour son propre bénéfice, et qu'elle déclare elle-même. C'est la bonne liste pour capter de la valeur. C'est une liste incomplète pour quiconque doit se fier au résultat.

Contrôle BCGCe qu'il examineQui le vérifie
Mémoire et contexteCe que l'agent stocke et transmetL'entreprise
Périmètre et supervisionCe que l'agent peut faire, et quand un humain intervientL'entreprise
Évaluation et rollbackComment l'agent performe, et comment revenir en arrièreL'entreprise
Outils et intégrationÀ quels outils, API et données l'agent peut accéderL'entreprise
ResponsabilitéQui dans l'organisation répond de l'agentL'entreprise
SécuritéCe que l'agent a fait, consigné pour l'auditL'entreprise
Lisez les deux dernières colonnes. Chaque contrôle porte sur l'agent ou l'organisation, et chacun est vérifié par l'organisation elle-même. Rien dans la liste ne concerne les personnes sur lesquelles l'agent prend des décisions, et personne d'extérieur ne vérifie le résultat.
Six contrôles, tous tournés vers la machine. Les personnes concernées par les décisions de la machine attendent à l'extérieur de la salle, et aucun instrument n'est dirigé vers elles.

Il manque trois choses.

Les personnes qui en subissent les conséquences

Cherchez le mot « fairness » dans le rapport et vous ne le trouverez pas. Il en va de même pour le mot « biais », au sens où l'IA traite les gens différemment, et pour la discrimination. Il n'y a aucune mention du candidat, de l'emprunteur, du patient ou du demandeur au sujet duquel un agent prend une décision.

C'est une lacune étrange dans un rapport sur les agents qui prennent des décisions. Les propres exemples de BCG incluent un assureur santé dont les appels entrants concernent principalement les prestations et la couverture, et où des chatbots agentifs traitent désormais environ 60 % de tous les types d'appels entrants, et un sous-traitant de processus métier qui passe de la vente de main-d'œuvre et de temps à la vente de résultats basés sur l'IA. Pour les assureurs, le rapport classe le traitement des sinistres comme la principale source de valeur de l'IA. Ce sont précisément les domaines où une décision automatisée affecte une personne. Un agent peut passer les six contrôles avec succès et tout de même approuver un groupe de candidats moins souvent qu'un autre. Sa mémoire est bien configurée, son périmètre délimité, ses portes de déploiement en place, ses outils enregistrés, son propriétaire désigné et chaque action consignée. Aucun des six ne le remarquerait, car aucun d'eux n'est conçu pour cela.

Nous avons développé cet argument plus en profondeur dans Le biais est le fondement : la « fairness » n'est pas une fonctionnalité que l'on ajoute à la fin. Le biais s'introduit par les données, le modèle et l'évaluateur humain, et une boucle de rétroaction le réinjecte dans le cycle suivant de données d'entraînement. Les agents ajoutent de nouveaux points d'entrée : les outils qu'ils choisissent, les documents qu'ils extraient, les notes qu'ils se transmettent.

Réglementation

Le rapport ne mentionne pas l'EU AI Act. En vertu de cette loi, telle que modifiée par l'Omnibus numérique sur l'IA, les obligations pour les systèmes à haut risque énumérés à l'annexe III s'appliqueront à partir du 2 décembre 2027. Elles couvrent l'IA utilisée pour le recrutement et la gestion des travailleurs, pour l'évaluation de la solvabilité et la notation de crédit, ainsi que pour l'évaluation des risques et la tarification des assurances vie et santé. Cette date est dans quatorze mois. BCG indique que les entreprises tournées vers l'avenir obtiennent des résultats en environ onze mois. Un agent mis en production ce trimestre fonctionnera déjà dans son état réglementé.

La responsabilité entre en jeu plus tôt. La directive européenne révisée sur la responsabilité du fait des produits défectueux considère les logiciels, y compris les systèmes d'IA, comme des produits, et elle s'applique aux produits mis sur le marché ou mis en service après le 9 décembre 2026, soit dans neuf semaines. Pour les entreprises de ces marchés, plusieurs des six contrôles de BCG cessent d'être de bonnes pratiques pour devenir des obligations. L'évaluation après le déploiement, la supervision humaine documentée et l'enregistrement des actions du système ne sont plus des options. Et une fois la responsabilité engagée, la question qu'un tribunal posera ne sera pas de savoir si une entreprise croyait que ses contrôles fonctionnaient, mais ce que l'entreprise peut prouver. Comme nous l'avons expliqué dans Le paradoxe de l'assurance préemptive, « c'est la faute du modèle » n'est pas une défense.

Toute personne extérieure à l'entreprise

La troisième lacune est celle à laquelle les autres mènent. Un contrôle que seul son propriétaire peut vérifier est une promesse. Elle est peut-être sincère, et peut-être même tenue. Mais un régulateur, un client, un assureur ou un membre indépendant du conseil d'administration n'a aucun moyen de distinguer un contrôle fonctionnel d'un contrôle bien décrit.

Personne ne fait confiance à la balance d'un commerçant parce qu'il la dit juste. On lui fait confiance parce que quelqu'un d'autre l'a vérifiée avec des poids étalons et l'a scellée. Un contrôle que seul son propriétaire peut vérifier, c'est une balance sans sceau.

L'enquête montre la même limite à grande échelle. Lorsque 1 330 dirigeants évaluent leurs propres contrôles, le résultat est une cartographie minutieuse de l'auto-évaluation. BCG le reconnaît, et cette honnêteté est tout à son honneur. Dans La précision n'est pas une preuve, nous avons appelé cela la différence entre désigner et voir : une affirmation peut désigner la bonne chose sans rien dire sur la qualité de l'observation. « Nous avons mis en place une évaluation et une restauration » désigne un contrôle. Cela ne dit pas ce que l'évaluation a pu manquer.

“Un contrôle que seul son propriétaire peut vérifier est une promesse, pas une preuve.”

Troisième partie · Ce qu'un contrôle autodéclaré ne peut pas vous dire

Rien de tout cela n'est une critique de BCG. Le rapport répond à la question qu'il s'est posée : comment les entreprises tirent-elles de la valeur des agents ? La question qu'il laisse en suspens est celle qui détermine si cette valeur résiste au regard d'un tiers.

Quatrième partie · Un comité de prêt, six contrôles

Un exemple rend cette lacune concrète. Il provient des objets de test que nous publions avec notre bibliothèque open source, vfairness, avec les données et l'environnement de test, afin que n'importe qui puisse le ré-exécuter.

Deux agents forment un petit comité de prêt. Un agent de présélection lit chaque demande et rédige un score de risque ainsi qu'une note d'une phrase pour l'évaluateur. Un évaluateur note et décide deux fois : une première fois sur la base de la demande seule, et une seconde fois après avoir lu la réponse de l'agent de présélection. Nous avons soumis trente demandes, chacune sous douze noms signalant le genre et l'origine (suisse, kosovare et nigériane) et une fois sans nom à titre de contrôle, et ce, à deux reprises : 780 épisodes, dans lesquels seul le nom changeait. Nous avons conservé le score et la décision de chaque agent à chaque étape, et pas seulement la réponse finale.

Soumettons maintenant le comité aux six contrôles de BCG.

  • 01Mémoire et contexte. La note de l'agent de présélection est exactement le type de contexte contre lequel BCG met en garde : une information qu'un agent transmet au suivant. Un bon contrôle de la mémoire décide de la manière dont cette note est stockée, de qui peut la lire et de sa durée de vie. Il ne se demande pas si la note est équitable.
  • 02Périmètre et supervision. Les deux agents restent dans leur périmètre. L'agent de présélection présélectionne, l'évaluateur évalue, un humain peut annuler la décision.
  • 03Évaluation et restauration. Une porte de déploiement classique vérifie la précision, la latence et les taux de refus. Le comité passe le test.
  • 04Outils et intégration. Les deux agents sont enregistrés, avec les bons accès.
  • 05Responsabilité. Il y a un propriétaire désigné qui peut arrêter le comité.
  • 06Sécurité. Chaque action est consignée. Toutes les preuves sont là.

Les six contrôles sont au vert. Voici ce que le test de « fairness » a trouvé dans les mêmes journaux.

Point de décisionÉcart des scores de risque moyens entre les six groupes (échelle de 100 points)Confirmé par les données ?
Agent de présélection3,4 points, de 43,8 (femmes suisses) à 47,1 (hommes nigérians)Oui (p < 0,001)
Évaluateur, sur la base de la demande seule2,9 points, de 48,1 (femmes kosovares) à 51,0 (hommes suisses)Non (p = 0,06)
Évaluateur, après lecture de la réponse de l'agent de présélection4,9 points, de 49,0 (femmes suisses) à 53,9 (hommes nigérians)Oui (p < 0,001)
Amplification par la transmission, en tant qu'effet distinctSuggéré par l'augmentation de 2,9 à 4,9Non établi
Le comité de prêt, mesuré par agent et par transfert, sur les 720 épisodes nominatifs. Valeurs p des tests de permutation ; p < 0,001 signifie qu'aucune attribution aléatoire de noms n'a reproduit un écart aussi important. Les deux dernières lignes sont celles où l'honnêteté a un coût.

L'agent de présélection a noté les mêmes dossiers différemment en fonction du nom, avec un écart de 3,4 points sur une échelle de risque de 100 points, et la différence était statistiquement claire. Sur la base du dossier seul, l'examinateur a montré un écart de 2,9 points que les données n'ont pas pu confirmer. Après avoir lu la réponse de l'agent de présélection, l'écart de l'examinateur est passé à 4,9 points et est devenu clair.

Un autre détail est important, car c'est là que l'honnêteté a un coût. Les données suggèrent que le transfert a amplifié le biais de l'examinateur, mais l'augmentation elle-même n'a pas passé le test, et notre analyse d'amplification ne l'a pas confirmée comme un effet distinct. Notre rapport indique donc exactement cela : une disparité confirmée chez l'agent de présélection, une disparité confirmée chez l'examinateur après le transfert, et amplification non établie. Il ne transforme pas cette troisième conclusion en gros titre.

Mesurez le transfert, pas seulement le tampon final. La note qu'un agent transmet au suivant est l'endroit où une disparité peut apparaître, s'amplifier, ou s'avérer inexistante.

C'est tout l'intérêt de l'exemple. Chacun des contrôles de BCG a fonctionné comme prévu, et aucun d'entre eux n'a pu déceler le problème, car le problème ne résidait pas dans la manière dont les agents étaient exécutés. Il résidait dans la manière dont ils traitaient les gens. Pour le déceler, il fallait un autre type de contrôle : un contrôle qui mesure les résultats par groupe, au niveau de chaque agent et de chaque transfert, et qui indique clairement son degré de certitude.

“Les six contrôles étaient au vert. La disparité était dans les journaux depuis le début. Personne n'avait posé cette question aux journaux.”

Quatrième partie · Un comité de prêt, six contrôles

Cinquième partie · Du contrôle à la preuve

Nous avons conçu validant.ai pour l'espace qui se situe entre un contrôle et la preuve de son efficacité. Notre approche se déroule en trois étapes, identiques pour un modèle de recrutement, un score de crédit ou un agent : mesurer si un système traite différemment des groupes de personnes, expliquer les causes de cette différence, et prouver le résultat sous une forme que n'importe qui peut vérifier.

Correspondance avec les six contrôles de BCG

Voici la correspondance honnête, y compris ce qui n'est pas terminé. Nous préférons publier un tableau avec des lacunes plutôt qu'une affirmation que nous ne pouvons pas étayer.

Contrôle BCGCe que font validant.ai et vfairnessStatut
Évaluation et rollbackPortails de Fairness qui bloquent une mise en production dans le pipeline CI/CD, surveillance continue avec détection de dérive, et des résultats qui indiquent « preuves insuffisantes » au lieu de valider ce qu'ils n'ont pas pu mesurerDisponible aujourd'hui
Sécurité et piste d'auditLes résultats enregistrent la version de la méthode et les seuils utilisés, et les exécutions d'agents et de LLM enregistrent également la version de la bibliothèque, les paramètres et un horodatage UTC ; le verdict est scellé sous la forme d'un titre de compétences signé que n'importe qui peut vérifier, sans avoir besoin de compteDisponible aujourd'hui
Mémoire et contexteTests multi-agents qui montrent quand la sortie d'un agent biaise la décision du suivant, comme dans l'exemple du comité de prêt ci-dessusDisponible en version bêta ; vérifié jusqu'à présent uniquement par rapport à nos propres tests
Outils et intégrationTests pour déterminer si un agent choisit des outils ou récupère des documents différemment selon la personne concernée par le casDisponible en version bêta ; un objet de test publié pour le choix d'outils, aucun pour l'instant pour la récupération de documents
ResponsabilitéLe Sceau de Confiance désigne l'organisation responsable du système, telle que cette organisation la déclareEn partie : nous enregistrons la propriété telle que déclarée ; nous ne la vérifions ni ne l'appliquons pas encore
Périmètre et supervisionMandats d'agent signés qui définissent ce qu'un agent peut faire au nom de quelqu'un, et qui peuvent être révoquésProposé, non développé
Deux contrôles couverts aujourd'hui, deux par des outils en version bêta dont les preuves indépendantes sont encore minces, et deux qui dépendent de travaux futurs. Nous mettrons ce tableau à jour au fur et à mesure de son évolution.

Le contrôle que la liste omet

Si la liste de BCG avait un septième point, nous plaiderions pour celui-ci : la Fairness, mesurée là où les personnes sont affectées. Pas un score global pour l'ensemble du système, qui peut masquer un problème réel par effet de moyenne, mais une mesure par groupe, par point de décision et par transfert entre agents, avec son incertitude statistique indiquée et une troisième réponse lorsque les données ne permettent de soutenir aucun des deux verdicts. C'est ce que fait notre bibliothèque ouverte, vfairness. Elle couvre les données d'entraînement, les modèles, les LLM, les agents et les systèmes multi-agents, et elle est gratuite sous licence Apache-2.0, afin que n'importe qui puisse réexécuter nos mesures et nous dire en quoi ils ne sont pas d'accord.

Trois corps, pas un seul

Dans La confiance numérique est une orbite, pas un pilier, nous avons décrit la confiance dans l'IA comme l'équilibre entre trois corps : le modèle qui décide, l'organisation qui en répond, et la personne sur laquelle il statue. Les six contrôles de BCG se situent presque entièrement dans le deuxième corps. Ils décrivent la manière dont une organisation gère ses agents.

Balanced: three bodies hold one shape, and trust is the orbit they trace.Les trois corps de la confiance numérique : le modèle, l'organisation et la personne. Les six contrôles de BCG se situent presque entièrement dans l'organisation ; la preuve doit atteindre les trois.

validant.ai ajoute les deux autres et relie les trois :

  • 01Le modèle. Nous mesurons ce que le système fait réellement, par groupe, et expliquons les causes de tout écart.
  • 02L'organisation. Nous évaluons si la gouvernance fonctionne comme décrit, et désignons le propriétaire responsable sur le sceau, tel que l'organisation le déclare.
  • 03La personne. Dans une démonstration concrète, un candidat à un emploi a reçu un Récépissé de Décision dans un portefeuille personnel réel sur swiyu, la version bêta publique de l'infrastructure de confiance e-ID de la Suisse : expliquant pourquoi la décision a été prise, et comment demander un examen humain. Les raisons dans cette démonstration ont été rédigées à la main. Les produire à partir du système décisionnel, et intégrer pleinement ce corps dans la plateforme, est la prochaine étape de notre feuille de route.

Des preuves qui sortent du bâtiment

L'étape la plus importante est la dernière. Nous ne développons, n'hébergeons ni ne vendons les systèmes que nous évaluons. Nos résultats sont émis sous forme de titres de compétences vérifiables, signés et contrôlables par un régulateur, un client ou un membre du conseil d'administration, sans avoir à se connecter et sans nous faire confiance. Chaque conclusion indique ce que nous avons pu voir et ce que nous n'avons pas pu voir : le niveau d'accès que nous avions, la robustesse de la méthode, la date du résultat. Un sceau couvre un système à un moment donné, et le précise.

Les preuves qui restent à l'intérieur du bâtiment ne peuvent être que décrites. Les preuves qui en sortent, scellées, peuvent être vérifiées par quiconque les reçoit, avec ses propres instruments.

Pourquoi la preuve est ce qui concrétise la triple valeur

Pour le dire simplement : la triple valeur de BCG est la valeur qu'une entreprise crée. La conservation de cette valeur dépend de personnes qui n'étaient pas présentes lors de la mise en place des contrôles. Chacune d'entre elles déprécie un contrôle qu'elle ne peut pas vérifier. L'assureur le tarifie comme s'il était absent. L'équipe des achats renvoie le questionnaire le trimestre suivant. Le superviseur demande les registres qui sous-tendent la politique. Le tribunal considère la description comme une simple affirmation. Cette dépréciation constitue la lacune, et c'est par là que la triple valeur se dissipe.

Qui doit être convaincu par vos contrôlesAvec un contrôle interne uniquementAvec des preuves vérifiables
Un régulateur ou un superviseurUne description du processus, et une demande des registres qui le sous-tendentDes résultats par groupe, signés et datés, qu'ils peuvent vérifier sans accéder à vos systèmes
Un assureurUne réponse à un questionnaire, tarifée comme si le contrôle était absentDes disparités mesurées avec leur incertitude statistique, et une déclaration sur ce que le test aurait pu manquer
Un client achetant des résultats produits par l'IAUne assurance contractuelle, et le même questionnaire le trimestre suivantUne accréditation que sa propre équipe peut vérifier
La personne concernée par la décision d'un agentRien qu'elle puisse voirUne confirmation de la décision et une possibilité d'examen humain (actuellement au stade de la démo)
Votre propre conseil d'administrationUne auto-évaluationUn regard extérieur sur les agents les plus importants
BCG a mesuré la valeur que les contrôles créent au sein de l'entreprise. Chacun de ces lecteurs décide si cette valeur survit au contact avec l'extérieur.

C'est l'argument direct en faveur de ce que nous faisons. Les contrôles rendent les agents gouvernables. Des preuves indépendantes et vérifiables rendent cette gouvernance crédible aux yeux de chacun de ces lecteurs simultanément. Une entreprise qui peut fournir à chacun d'eux un élément vérifiable n'a pas à plaider en faveur de sa triple valeur. Elle peut la démontrer.

“BCG montre aux entreprises comment contrôler leurs agents. Nous les aidons à le prouver à quelqu'un qui n'a aucune raison de les croire sur parole.”

Cinquième partie · Du contrôle à la preuve

Sixième partie · Que faire maintenant

Pour un conseil d'administration, un comité des risques ou une équipe mettant des agents en production, le rapport et les lacunes qu'il révèle se résument à six étapes. Aucune d'entre elles ne nécessite d'attendre un régulateur.

  • 01Recensez vos agents. Vous ne pouvez pas contrôler ce que vous n'avez pas répertorié. Notez chaque agent qui prend ou façonne une décision, ce qu'il peut faire, les données et outils auxquels il a accès, et qui en est le propriétaire. BCG demande à la direction de tenir précisément cet inventaire, et aux conseils d'administration d'y consulter les agents les plus importants. La plupart des entreprises n'en ont pas encore.
  • 02Mettez en place les six contrôles partout, pas seulement dans un projet pilote. Les données de BCG indiquent que la valeur provient de leur application à tous, à l'échelle de l'entreprise. Un projet pilote bien gouverné à côté d'une production non gouvernée est le pire des deux mondes.
  • 03Ajoutez la Fairness à l'évaluation. Pour chaque agent qui prend des décisions concernant des personnes, testez les différences entre les groupes avant le déploiement, et continuez les tests après, car les agents dérivent, tout comme les personnes qu'ils servent. Testez chaque transfert entre agents, pas seulement la réponse finale.
  • 04Mesurez honnêtement. Un résultat positif sur un petit échantillon ne prouve pas grand-chose. Demandez à chaque test l'ampleur d'un problème qu'il aurait pu manquer, et considérez « preuves insuffisantes » comme une conclusion, pas comme une validation.
  • 05Conservez des preuves que d'autres peuvent vérifier. Les journaux que vous seul pouvez lire sont un début. Des résultats qu'un régulateur, un assureur ou un client peut vérifier sans avoir à vous faire confiance, voilà ce qui comptera lorsque les règles de responsabilité, l'EU AI Act ou un grand client le demanderont.
  • 06Obtenez un avis extérieur sur ce qui est le plus important. Faites évaluer au moins vos agents les plus importants par quelqu'un qui ne les a pas conçus. Tous les agents n'en ont pas besoin. Ceux qui prennent des décisions concernant le crédit, l'emploi, la santé ou l'argent, si.

Septième partie · Ce que nous aimerions, et que nous n'obtiendrons peut-être pas

L'histoire est séduisante et semble s'écrire d'elle-même. Les conseils d'administration lisent BCG, voient que les contrôles triplent la valeur, se demandent comment savoir si leurs contrôles fonctionnent, et inscrivent l'évaluation indépendante dans la ligne budgétaire que BCG appelle la gouvernance. Nous aimerions que cette histoire soit vraie. Il y a de bonnes raisons d'être prudent.

L'effet triple est une corrélation. Les entreprises disposant des six contrôles sont aussi, très probablement, meilleures dans de nombreux autres domaines : données, talents, concentration. BCG n'affirme pas que les contrôles à eux seuls sont la cause de la valeur supplémentaire, et personne citant ce chiffre, y compris nous, ne devrait le faire. L'interprétation la plus prudente est que des contrôles solides et des résultats solides vont de pair, et que les entreprises qui déploient des agents à grande échelle sans contrôles prennent un pari que les leaders ne prennent pas.

La Fairness n'est pas dans le rapport, et cela est peut-être révélateur du marché. Si les dirigeants interrogés par BCG ne considèrent pas la Fairness comme faisant partie de la gouvernance des agents, de nombreux acheteurs ne le feront pas non plus, du moins jusqu'à ce qu'un régulateur, un tribunal ou un gros titre les y oblige. Nous pensons que ce point de vue est à courte vue. Nous savons aussi qu'un meilleur argument ne suffit pas à lui seul pour modifier les budgets.

Les budgets de gouvernance sont faibles. Dans la ventilation de BCG, la gouvernance est le plus petit poste des dépenses en IA, environ 0,3 % du chiffre d'affaires sur un total de 3,3 %. L'évaluation indépendante doit s'inscrire dans cette ligne, aux côtés de la stratégie, de la gestion des risques et de la conformité.

Nos propres outils ne sont pas tous matures. Comme le montre le tableau de la cinquième partie, les tests d'agents et de multi-agents sont en version bêta et ont jusqu'à présent été vérifiés principalement par rapport à nos propres tests, et les mandats d'agents signés ne sont pas encore développés. Nous publions ce que nous avons vérifié et ce que nous n'avons pas vérifié sur notre page qualité et renforcement, car un fournisseur d'évaluations qui cache ses propres limites commet l'erreur même qu'il est censé déceler.

Il s'agit donc d'un argument, pas d'une prévision. Nous pensons que les entreprises qui capteront la valeur décrite par BCG seront celles qui pourront démontrer que leurs contrôles fonctionnent, et pas seulement celles qui en disposent. Nous serions ravis d'en débattre avec quiconque voit les choses différemment.

La confiance s'évalue, elle ne s'affirme pas. Si votre organisation met des agents en production et souhaite des preuves indépendantes et vérifiables de leur comportement, avant l'entrée en vigueur des règles de responsabilité en décembre et des obligations pour les systèmes à haut risque de l'EU AI Act en décembre 2027, notre bêta fermée est ouverte à un groupe restreint. Écrivez à hello@validant.ai avec l'objet « Closed Beta », ou demandez une démo. Pour essayer le moteur open source dès aujourd'hui : pip install vfairness.

Réexécutez vous-même le comité de prêt : vfairness.validant.ai/test-objects

En résumé

BCG a montré que le contrôle des agents n'est pas un frein à leur valeur, mais la raison pour laquelle elle se multiplie. L'étape suivante consiste à rendre ce contrôle visible : aux personnes concernées par les décisions des agents, aux régulateurs et à toute personne qui doit faire confiance au résultat sans vous croire sur parole. Les freins permettent d'aller vite. La preuve permet aux autres de vous accompagner.

“La confiance s'évalue, elle ne s'affirme pas. Un contrôle que personne d'autre ne peut vérifier reste une simple affirmation.”

Le contrôle des agents triple leur valeur

Sources et lectures complémentaires

Partager cet article
À lire ensuite
Fin dessin technique gris-bleu sur papier de couleur chaude d'un astronome à un grand télescope, le tout dans un unique anneau d'ouverture circulaire délimité : quelques étoiles nettes et résolues à l'intérieur de l'anneau, de nombreuses étoiles plus pâles au-delà dans un lavis corail pâle, l'anneau d'ouverture rehaussé de bleu sarcelle, et une petite silhouette humaine à l'oculaire pour l'échelle.RechercheOuvrir pour lire
10 août 2026

Précision ne vaut pas preuve : le piège que recèle tout verdict sur l'équité de l'IA

Un modèle aux prédictions parfaites n'assure plus personne ; un verdict publié sans sa limite de détection vous incite à supposer que cette limite est nulle. Deux échecs, une omission, et deux mots empruntés pour les distinguer.

Lire
Dessin technique au trait de style Blanco de trois sphères de tailles différentes maintenues en équilibre par des orbites elliptiques entrelacées, avec des lavis corail doux, sur fond blanc.RechercheOuvrir pour lire
5 juin 2026

La confiance numérique est une orbite, pas un pilier

La confiance n'est pas un pilier de plus à ajouter. C'est l'orbite que trois corps tracent ensemble : le modèle, la personne et l'organisation. Découvrez pourquoi le problème à trois corps est la métaphore la plus juste pour une IA digne de confiance, et comment savoir où vous vous situez sur cette orbite.

Lire
Dessin technique fin, gris-bleu, sur papier de couleur chaude, représentant un grand réservoir d'eau dont les parois sont construites à partir de glissières de sécurité d'autoroute ondulées, boulonnées à des poteaux en acier sur un socle en béton, avec des poissons nageant calmement à l'intérieur. Une glissière manque encore sur la paroi la plus proche, et une grue abaisse la section de remplacement de couleur sarcelle vers l'ouverture, tandis qu'un ouvrier sur un échafaudage la guide et qu'un second ouvrier fait des signaux depuis le sol. Un poisson est déjà passé par l'ouverture inachevée en suivant un arc en pointillés, avec un léger lavis corail derrière le réservoir.RechercheOuvrir pour lire
28 septembre 2026

Le paradoxe de l'assurance préventive : qui garde les garde-fous de l'IA ?

En l'espace d'une semaine en septembre, un laboratoire a demandé de ralentir, un président s'est déclaré le seul garde-fou dont l'IA ait besoin, et The Economist a demandé si la course aux armements pouvait être stoppée. Notes des Trust Valley Days 2026 à l'EPFL expliquant pourquoi la réponse n'est ni une pause ni un sprint, mais une question de responsabilité, de résultats et de vérification.

Lire