Fragen Sie einen Renningenieur, was ein Auto schnell macht, und Sie erhalten vielleicht eine Antwort, die widersinnig klingt: die Bremsen. Ein Fahrer, der den Bremsen vertraut, nimmt die Geschwindigkeit bis weit in die Kurve mit. Ein Fahrer, der das nicht tut, geht in jeder Runde früh vom Gas und verliert überall Zeit.
Gute Bremsen verlangsamen das Auto nicht. Sie sind der Grund, warum es am Limit gefahren werden kann. Jahrelang wurde KI-Governance als das Gegenteil verkauft und widerwillig hingenommen. Risikoteams waren diejenigen, die Nein sagten. Compliance war der Preis für den Einsatz von KI, der widerstrebend gezahlt und so gering wie möglich gehalten wurde. Die meisten Vorstände, mit denen wir sprechen, sehen das immer noch so: als notwendige Bremse für das, was tatsächlich Wert schafft.
Im September veröffentlichte die Boston Consulting Group einen Bericht, der diese Sichtweise beenden sollte. The Formula for Agentic AI Value, die 2026er-Ausgabe ihres Applied AI Index, stellt fest, dass Unternehmen mit einem vollständigen Satz an Kontrollen für ihre KI-Agents einen etwa dreimal so hohen Wert aus diesen Agents ziehen wie Unternehmen mit nur einer einzigen Kontrolle. Mit den Worten von BCG: „Wirksame Risikokontrollen dienen als Wegbereiter, nicht als Bremse.“
Das ist die gute Nachricht, und sie verdient ein breites Publikum. Unsere Argumentation setzt einen Schritt weiter an, und wir werden sie direkt formulieren. BCG hat gemessen, was Kontrolle innerhalb eines Unternehmens wert ist. Ob dieser Wert auch außerhalb Bestand hat, gegenüber einer Regulierungsbehörde, einem Versicherer, einem Kunden oder der Person, über die ein Agent entscheidet, hängt davon ab, ob jemand, der die Kontrollen nicht selbst entwickelt hat, sie überprüfen kann. Heute kann das fast niemand. Fragen Sie einen Vorstand, was seine Agents wert sind und ob sie unter Kontrolle sind, und die ehrliche Antwort lautet meist: Wir glauben schon. Kontrolle ist es, was den Wert verdreifacht. Der Nachweis ist es, was ihn für andere verlässlich macht. Diese Lücke zu schließen, ist die Aufgabe von validant.ai.
An wen sich dieser Artikel richtet
Dieser Artikel richtet sich an Vorstände, Chief Risk Officers, Leiter von KI-Abteilungen und Compliance-Teams, die Agents in die Produktion überführen oder dies in Kürze tun werden und die für sie geradestehen müssen. Teil eins fasst den Bericht zusammen und erfordert kein technisches Hintergrundwissen. Teil vier führt durch ein konkretes Beispiel. In Teil fünf erklären wir, was validant.ai in dieser Hinsicht tut und warum dies den Wert des Dreifachen verändert.
Wir sind nicht neutral. Wir entwickeln die Werkzeuge und führen die Bewertungen durch, die unabhängige Nachweise über KI-Systeme erbringen, und dieser Artikel argumentiert, dass der Markt sie braucht. Wir haben die Zusammenfassung des BCG-Berichts von unserer Argumentation dazu getrennt, und wir sagen offen, wo unsere eigenen Werkzeuge noch nicht fertiggestellt sind.
Zusammenfassung
- 01
Der Wert von KI ist real und konzentriert
Unternehmen, die strategische Klarheit mit angewandter KI kombinieren, berichten von einem etwa fünfmal so hohen KI-Wert wie Unternehmen, denen beides fehlt. Agentic AI ist der am schnellsten wachsende Anteil an diesem Wert, von 17% im Jahr 2025 auf voraussichtlich 39% bis 2030.
- 02
Kontrollen vervielfachen ihn
Unternehmen mit sechs unternehmensweit implementierten Agent-Kontrollen berichten von einem rund dreimal so hohen Wert durch Agents wie Unternehmen mit nur einer einzigen Kontrolle. Nur 5% haben sie implementiert, während 42% erwarten, dass Agents bis 2030 Entscheidungen ohne menschliche Zustimmung treffen werden.
- 03
Jede Kontrolle auf der Liste ist intern
Keine der sechs Kontrollen berücksichtigt die Menschen, über die ein Agent entscheidet, und keine bezieht eine externe Überprüfung des Ergebnisses mit ein. Die Begriffe Fairness und Regulierung kommen in dem Bericht nicht vor, und die Umfrage selbst basiert auf Selbsteinschätzungen, wie BCG anmerkt.
- 04
Der Nachweis ist die fehlende Kontrolle
Fairness, gemessen dort, wo Menschen betroffen sind, eine ehrliche Messung, die angibt, was sie möglicherweise nicht erfasst, und Nachweise, die so versiegelt sind, dass Außenstehende sie überprüfen können. Das verwandelt Governance von einer internen Überzeugung in einen Wert, auf den sich andere verlassen können.
Teil eins · Was BCG gemessen hat
Der Applied AI Index basiert auf einer Umfrage unter 1,330 CxOs und leitenden Angestellten, die Entscheidungen über KI treffen, in mehr als 60 Ländern und über 20 Sektoren, von denen mehr als die Hälfte bei Unternehmen mit über $5 billion in revenue tätig ist. Seine Kernidee passt auf eine Serviette: strategische Klarheit plus angewandte KI gleich transformative Wirkung.
Bei strategischer Klarheit geht es um Entscheidungen. Sie bedeutet, KI auf wenige hochwertige Bereiche zu konzentrieren, sie als ein einziges, finanziertes, mehrjähriges Programm zu betreiben, das von der Führungsebene verantwortet wird, und ihren Wert in der GuV statt in Präsentationsfolien zu verfolgen. Bei angewandter KI geht es um die Umsetzung. Sie besteht aus drei Teilen: einem Betriebsmodell, das auf Agents und den Kontrollen für deren Betrieb aufbaut, einer Belegschaft, die auf die Zusammenarbeit von Menschen und Agents ausgerichtet ist, und einer Datenplattform, die Agents tatsächlich nutzen können.
Wenn beides zusammenkommt, bewegen sich die Zahlen. Unternehmen, die bei Klarheit und angewandter KI stark sind, realisierten 2025 einen KI-Wert von etwa 4.5% des Umsatzes. Unternehmen, die bei beidem schwach sind, realisierten 0.9%. Das ist der fünffache Unterschied, den BCG in der Schlagzeile nennt.
Vier Stufen, eine kleine Elite
BCG teilt Unternehmen in vier Gruppen ein. Im Jahr 2026 stagnieren 4,5 %, 47 % sind aufstrebend, 41 % skalieren und 7,5 % sind das, was BCG als zukunftsfähig bezeichnet, nach 5 % im Vorjahr. In der zukunftsfähigen Gruppe konzentriert sich der Wert. Von ihnen verfolgen 95 % den KI-Wert mit klaren KPIs oder direkt in der GuV, und sie geben an, in etwa 11 Monaten eine Wirkung zu erzielen, im Vergleich zu 17 Monaten bei den Nachzüglern.
Ein aufschlussreiches Detail findet sich in den Messdaten. Außerhalb der führenden Gruppe fliegen die meisten Unternehmen, um es mit den Worten von BCG zu sagen, „im Blindflug“: 47% der Nachzügler messen den KI-Wert bestenfalls tendenziell. Eine separate, im Bericht zitierte BCG-Analyse ergab, dass zwar fast neun von zehn CEOs Kosten- oder Umsatzvorteile durch KI sehen, aber nur 14% die GuV-Auswirkungen jeder einzelnen Initiative klar definiert haben.
Bei Agents liegen die nächsten Gewinne
Der Untertitel des Berichts handelt aus gutem Grund von Agents. Agentic AI machte 17% des KI-Wertes im Jahr 2025 und 22% im Jahr 2026 aus. BCG prognostiziert 39% bis 2030, was sie zur größten Einzelquelle für KI-Wert machen würde. Die Lücke ist hier deutlicher als irgendwo sonst: 44% der zukunftsfähigen Unternehmen geben an, bereits den vollen Wert aus Agents zu ziehen, im Vergleich zu 2% der Nachzügler.
| Was BCG berichtet | Abbildung |
|---|---|
| KI-Wert, stark vs. schwach bei Klarheit und angewandter KI | 4.5% vs 0.9% of revenue (2025) |
| Anteil der zukunftsfähigen Unternehmen | 7.5% in 2026, up from 5% |
| Anteil von Agentic AI am KI-Wert | 17% (2025), 22% (2026), 39% projected (2030) |
| Wert durch Agents mit allen sechs Kontrollen vs. nur einer | 1.8% vs 0.5% of revenue |
| Unternehmen, die heute alle sechs Kontrollen durchsetzen | 5% |
| Unternehmen, die erwarten, dass Agents bis 2030 ohne menschliche Zustimmung entscheiden | 42% |
Was die Zahlen aussagen
Ein Vorbehalt zieht sich durch alles Folgende, und BCG benennt ihn offen in seiner Methodik. Die Zahlen stammen von Führungskräften, die die Reife ihrer eigenen Organisation in 41 Kompetenzbereichen einschätzen. Sofern nicht als in der GuV 2025 realisiert gekennzeichnet, handelt es sich bei den Wertzahlen um erwartete zukünftige Auswirkungen. Und die Antworten könnten „einem Wahrnehmungsfehler unterliegen“.
Das ist kein Mangel des Berichts. Es liegt in der Natur einer Umfrage. Aber es ist für die Argumentation von Bedeutung, denn es bedeutet, dass der Bericht ein sorgfältiges Bild davon zeichnet, wie Unternehmen sich selbst sehen. Er sagt uns, was Führungskräfte über ihre KI und ihre Kontrollen glauben. Er kann uns nicht sagen, ob diese Überzeugungen einer externen Prüfung standhalten würden. Darauf kommen wir in Teil drei zurück.
Teil zwei · Sechs Kontrollen, dreifacher Wert
Der Teil des Berichts, der für jeden, der Agents einsetzt, am wichtigsten ist, ist eine kurze Liste. Die Skalierung von Agents, so BCG, birgt ein Risiko, das sie Agent Sprawl nennt: duplizierte Agents, widersprüchliche Berechtigungen, unklare Zuständigkeiten, Lücken bei der Überwachung. Die tiefgreifendere Veränderung besteht darin, dass Agents Daten, Tools, Speicher und andere Agents über Workflows hinweg kombinieren, sodass Risiken „dynamisch entstehen und sich in Maschinengeschwindigkeit potenzieren“ können. Das alte Betriebsmodell für Risiken, das für Software entwickelt wurde, die tut, was man ihr sagt, reicht nicht aus.
BCG benennt sechs Kontrollen, die diese Lücke schließen:
- 01Speicher und Kontext. Wie Agents Informationen speichern und abrufen. Der Speicher kann das Lernen über Agents hinweg potenzieren, aber er kann auch Fehler, sensible Daten oder manipulierten Kontext von einem Workflow zum nächsten weitergeben.
- 02Umfang und Aufsicht. Wofür jeder Agent da ist, was er tun darf, zu welchen Zwecken und wann ein Mensch eingeschaltet werden muss. Die Befugnisse sind nicht nur durch das begrenzt, was ein Agent erreichen kann, sondern auch durch das, was er tun darf.
- 03Evaluierung und Rollback. Evaluierungskriterien, Release Gates, kontinuierliche Überwachung und ein Weg zurück. Kontrollen sollten Drift, Anomalien und neu entstehende Risiken nach der Inbetriebnahme erkennen und „nicht nur feststellen, ob ein Agent beim Start sicher war“.
- 04Tools und Integration. Standardisierte Wege für Agents, Tools, APIs und Daten zu nutzen, mit Verzeichnissen, die zeigen, welche Agents laufen, worauf sie zugreifen können und wie sie interagieren.
- 05Verantwortlichkeit. Eine benannte Person für jeden wesentlichen Agent, die für dessen Nutzung und Ergebnisse verantwortlich ist und die klare Befugnis hat, wer ihn ändern, aussetzen oder stoppen kann.
- 06Sicherheit. Laufzeitkontrollen, Audit Trails und Kostenschutzplanken, die genügend Beweise sichern, um zu rekonstruieren, was ein Agent getan hat, unter wessen Autorität, mit welchen Daten und Tools und welche Kontrollen er ausgelöst hat.
Die Zahl, die alles verändert
Unternehmen, die alle sechs Kontrollen unternehmensweit eingeführt haben, berichten von einem Wertbeitrag durch Agents von etwa 1,8 % des Umsatzes. Unternehmen mit nur einer Kontrolle berichten von 0,5 %. Das ist der dreifache Unterschied, und BCG formuliert es unumwunden: „Die Kontrolle von Agents schmälert ihren Wert nicht, sondern verdreifacht ihn.“ Genau genommen ist 1,8 gegenüber 0,5 näher an 3,6, und der Bericht zitiert eine 3,6-fache Zahl, wenn er unternehmensweit geltende Kontrollen mit nur pilotierten Kontrollen vergleicht. BCG hat das konservativere Wort gewählt, und das tun wir auch. Die Kombination von zentralen Risiko-Leitplanken mit einer föderierten Implementierung bringt dreimal so viele Workflows zur Skalierung wie eine vollständig zentralisierte Steuerung.
Nicht alle Kontrollen haben das gleiche Gewicht. In der BCG-Analyse der Werttreiber haben Speicher und Kontext das größte Gewicht (32 Punkte relativer Wichtigkeit), gefolgt von Umfang und Aufsicht (21) sowie Evaluierung und Rollback (18). Tools und Integration (13), Verantwortlichkeit (9) und Sicherheit (7) folgen dahinter.
Die Lücke, die damit einhergeht
Neben der guten Nachricht steht die unbequeme Zahl. 42 % der Unternehmen erwarten, dass Agents bis 2030 autonom handeln und Entscheidungen ohne menschliche Zustimmung treffen. Unter den „Future-built Companies“ erwarten zwei Drittel eine begrenzte oder vollständige Autonomie. Doch nur 5 % setzen heute alle sechs Kontrollen durch.
BCG gibt auch den Aufsichtsräten eine Aufgabe. Sie sollten die KI-Risikobereitschaft der Organisation festlegen und regelmäßig überprüfen, während das Management ein vollständiges Inventar der Agents führt. Aufsichtsräte sollten Einblick in die folgenreichsten Agents haben: ihren Zweck, ihre Befugnisse, ihre wichtigsten Abhängigkeiten und wer eingreifen oder sie stoppen kann. Und sie sollten kritische KI-Anbieter, Single Points of Failure, Notfallpläne und größere Vorfälle oder Kontrolllücken überprüfen.
“Wirksame Risikokontrollen dienen als Wegbereiter, nicht als Bremse: Die unternehmensweite Einführung der richtigen Kontrollen verdreifacht in etwa den Wert, den Agents schaffen.”
BCG, The Formula for Agentic AI Value
Teil drei · Was eine selbstberichtete Kontrolle nicht aussagen kann
Die sechs Kontrollen sind gutes Engineering, und wir würden jede einzelne davon unterschreiben. Lesen Sie sie jedoch noch einmal und achten Sie darauf, für wen sie bestimmt sind. Jede Kontrolle auf der Liste ist etwas, das ein Unternehmen mit seinen eigenen Agents zu seinem eigenen Vorteil tut und über das es selbst berichtet. Das ist die richtige Liste, um Wert zu schaffen. Es ist eine unvollständige Liste für jeden, der sich auf das Ergebnis verlassen muss.
| BCG-Kontrolle | Was sie betrachtet | Wer sie prüft |
|---|---|---|
| Speicher und Kontext | Was der Agent speichert und weitergibt | Das Unternehmen |
| Umfang und Aufsicht | Was der Agent tun darf und wann ein Mensch eingreift | Das Unternehmen |
| Evaluierung und Rollback | Wie der Agent arbeitet und wie man ihn zurücksetzt | Das Unternehmen |
| Tools und Integration | Welche Tools, APIs und Daten der Agent erreichen kann | Das Unternehmen |
| Verantwortlichkeit | Wer in der Organisation für den Agent verantwortlich ist | Das Unternehmen |
| Sicherheit | Was der Agent getan hat, für die Prüfung protokolliert | Das Unternehmen |
Drei Dinge fehlen.
Die Betroffenen
Suchen Sie im Bericht nach dem Wort Fairness, und Sie werden es nicht finden. Dasselbe gilt für Bias im Sinne einer unterschiedlichen Behandlung von Menschen durch KI und für Diskriminierung. Es gibt keine Erwähnung des Bewerbers, des Kreditnehmers, des Patienten oder des Antragstellers, über den ein Agent entscheidet.
Das ist eine merkwürdige Lücke in einem Bericht über Agenten, die Entscheidungen treffen. Die Beispiele von BCG selbst umfassen eine Krankenversicherung, bei der es bei den eingehenden Anrufen hauptsächlich um Leistungen und Versicherungsschutz geht und bei der agentenbasierte Chatbots inzwischen etwa 60 % aller eingehenden Anruftypen bearbeiten, sowie einen Business-Process-Outsourcer, der vom Verkauf von Arbeitskraft und Zeit auf den Verkauf von KI-gestützten Ergebnissen umstellt. Für Versicherer stuft der Bericht die Schadensbearbeitung als wichtigste Quelle für den Wert von KI ein. Dies sind genau die Stellen, an denen eine automatisierte Entscheidung eine Person betrifft. Ein Agent kann alle sechs Kontrollen bestehen und dennoch eine Gruppe von Bewerbern seltener genehmigen als eine andere. Sein Speicher ist gut konfiguriert, sein Geltungsbereich begrenzt, seine Release-Gates sind vorhanden, seine Werkzeuge registriert, sein Eigentümer benannt und jede Aktion protokolliert. Keine der sechs würde es bemerken, weil keine von ihnen hinsieht.
Wir haben das tiefgreifendere Argument in Bias Is the Foundation dargelegt: Fairness ist kein Merkmal, das man am Ende hinzufügt. Bias gelangt über die Daten, das Modell und den menschlichen Prüfer ins System, und eine Feedbackschleife trägt ihn in die nächste Runde von Trainingsdaten zurück. Agenten schaffen neue Eintrittspunkte: die Werkzeuge, die sie auswählen, die Dokumente, die sie abrufen, die Notizen, die sie untereinander austauschen.
Regulierung
Der Bericht erwähnt den EU AI Act nicht. Gemäß dem Gesetz in der durch den Digital Omnibus on AI geänderten Fassung gelten die Verpflichtungen für die in Anhang III aufgeführten Hochrisikosysteme ab dem 2. Dezember 2027. Sie umfassen KI, die bei der Einstellung und Verwaltung von Arbeitskräften, bei der Beurteilung der Kreditwürdigkeit und der Kreditvergabe sowie bei der Risikobewertung und Preisgestaltung für Lebens- und Krankenversicherungen eingesetzt wird. Dieses Datum liegt vierzehn Monate in der Zukunft. Laut BCG erzielen zukunftsorientierte Unternehmen in etwa elf Monaten Wirkung. Ein Agent, der in diesem Quartal in Produktion geht, wird bereits in seinem regulierten Zustand laufen.
Die Haftung tritt früher ein. Die überarbeitete EU-Produkthaftungsrichtlinie behandelt Software, einschließlich KI-Systemen, als Produkt, und sie gilt für Produkte, die nach dem 9. Dezember 2026, also in neun Wochen, auf den Markt gebracht oder in Betrieb genommen werden. Für Unternehmen in diesen Märkten hören einige der sechs Kontrollen von BCG auf, bewährte Praktiken zu sein, und werden zu Pflichten. Evaluierung nach der Bereitstellung, dokumentierte menschliche Aufsicht und Aufzeichnungen über die Aktivitäten eines Systems sind keine Optionen mehr. Und sobald die Haftung greift, wird ein Gericht nicht fragen, ob ein Unternehmen glaubte, dass seine Kontrollen funktionierten. Sondern was das Unternehmen nachweisen kann. Wie wir in The Preemptive Assurance Paradox argumentiert haben, ist „das Modell war’s“ keine Verteidigung.
Jeder außerhalb des Unternehmens
Die dritte Lücke ist diejenige, zu der die anderen führen. Eine Kontrolle, die nur ihr Eigentümer überprüfen kann, ist ein Versprechen. Es mag ein aufrichtiges sein, und es mag wahr sein. Aber ein Regulator, ein Kunde, ein Versicherer oder ein unabhängiges Vorstandsmitglied hat keine Möglichkeit, eine funktionierende Kontrolle von einer gut beschriebenen zu unterscheiden.
Die Umfrage zeigt dieselbe Einschränkung in größerem Maßstab. Wenn 1.330 Führungskräfte ihre eigenen Kontrollen bewerten, ist das Ergebnis eine sorgfältige Landkarte der Selbsteinschätzung. BCG sagt dies selbst, und diese Ehrlichkeit ist ihnen hoch anzurechnen. In Precision Is Not Proof nannten wir dies den Unterschied zwischen Zeigen und Sehen: Eine Behauptung kann auf die richtige Sache hinweisen und dennoch nichts darüber aussagen, wie gut sie gesehen wurde. „Wir haben Evaluierung und Rollback implementiert“ verweist auf eine Kontrolle. Es sagt nicht aus, was die Evaluierung möglicherweise übersehen hat.
“Eine Kontrolle, die nur ihr Eigentümer überprüfen kann, ist ein Versprechen, kein Beweis.”
Teil drei · Was eine selbstberichtete Kontrolle nicht aussagen kann
Nichts davon ist eine Kritik an BCG. Der Bericht beantwortet die Frage, die er sich gestellt hat: Wie schöpfen Unternehmen Wert aus Agenten? Die Frage, die er offen lässt, ist die, die darüber entscheidet, ob dieser Wert Bestand hat, wenn jemand anderes hinsieht.
Teil vier · Ein Kreditausschuss, sechs Kontrollen
Ein Beispiel macht die Lücke konkret. Es stammt aus den Testobjekten, die wir mit unserer offenen Bibliothek vfairness veröffentlichen, zusammen mit den Daten und dem Test-Harness, sodass jeder es erneut ausführen kann.
Zwei Agenten bilden einen kleinen Kreditausschuss. Ein Screener liest jeden Antrag und schreibt einen Risikoscore und eine einzeilige Notiz für den Reviewer. Ein Reviewer bewertet und entscheidet zweimal: einmal nur auf Basis des Antrags und einmal nach dem Lesen der Antwort des Screeners. Wir haben dreißig Anträge eingereicht, jeden unter zwölf Namen, die Geschlecht und Herkunft signalisieren (schweizerisch, kosovarisch und nigerianisch) und einmal ohne Namen als Kontrolle, und das Ganze zweimal: 780 Durchläufe, bei denen sich nur der Name änderte. Wir haben den Score und die Entscheidung jedes Agenten bei jedem Schritt festgehalten, nicht nur die endgültige Antwort.
Unterziehen wir den Ausschuss nun den sechs Kontrollen von BCG.
- 01Speicher und Kontext. Die Notiz des Screeners ist genau die Art von Kontext, vor der BCG warnt: Informationen, die ein Agent an den nächsten weitergibt. Eine gute Speicherkontrolle entscheidet, wie diese Notiz gespeichert wird, wer sie lesen kann und wie lange sie bestehen bleibt. Sie fragt nicht, ob die Notiz fair ist.
- 02Geltungsbereich und Aufsicht. Beide Agenten bleiben innerhalb ihres Geltungsbereichs. Der Screener prüft vor, der Reviewer begutachtet, ein Mensch kann die Entscheidung aufheben.
- 03Evaluierung und Rollback. Ein typisches Release-Gate prüft Genauigkeit, Latenz und Ablehnungsraten. Der Ausschuss besteht.
- 04Tools und Integration. Beide Agenten sind registriert und haben die richtigen Zugriffsrechte.
- 05Verantwortlichkeit. Es gibt einen benannten Verantwortlichen, der den Ausschuss stoppen kann.
- 06Sicherheit. Jede Aktion wird protokolliert. Alle Beweise sind vorhanden.
Alle sechs Kontrollen stehen auf Grün. Hier ist, was der Fairness-Test in denselben Protokollen gefunden hat.
| Entscheidungspunkt | Streuung der durchschnittlichen Risikoscores über die sechs Gruppen (100-Punkte-Skala) | Durch die Daten bestätigt? |
|---|---|---|
| Screener | 3.4 Punkte, von 43.8 (Schweizerinnen) bis 47.1 (nigerianische Männer) | Ja (p < 0.001) |
| Reviewer, nur auf Basis des Antrags | 2.9 Punkte, von 48.1 (kosovarische Frauen) bis 51.0 (Schweizer Männer) | Nein (p = 0.06) |
| Reviewer, nach dem Lesen der Antwort des Screeners | 4.9 Punkte, von 49.0 (Schweizerinnen) bis 53.9 (nigerianische Männer) | Ja (p < 0.001) |
| Verstärkung durch die Übergabe, als separater Effekt | Nahegelegt durch den Anstieg von 2.9 auf 4.9 | Nicht nachgewiesen |
Der Vorprüfer bewertete die gleichen Anträge je nach Name unterschiedlich, um 3.4 Punkte auf einer 100-Punkte-Risikoskala, und der Unterschied war statistisch eindeutig. Allein auf Basis des Antrags zeigte der Gutachter eine Streuung von 2.9 Punkten, die die Daten nicht bestätigen konnten. Nach Lektüre der Antwort des Vorprüfers wuchs die Streuung des Gutachters auf 4.9 Punkte an und wurde eindeutig.
Ein weiteres Detail ist wichtig, denn hier ist der Punkt, an dem Ehrlichkeit etwas kostet. Die Daten deuten darauf hin, dass die Übergabe die Voreingenommenheit des Gutachters verstärkte, aber der Anstieg selbst bestand den Test nicht, und unsere Verstärkungsanalyse bestätigte dies nicht als separaten Effekt. Unser Bericht sagt also genau das aus: eine bestätigte Disparität beim Vorprüfer, eine bestätigte Disparität beim Gutachter nach der Übergabe und Verstärkung nicht nachgewiesen. Er rundet das dritte Ergebnis nicht zu einer Schlagzeile auf.
Das ist der Kern des Beispiels. Jede einzelne der Kontrollen von BCG funktionierte wie vorgesehen, und keine von ihnen konnte das Problem erkennen, weil das Problem nicht in der Ausführung der Agents lag. Es lag darin, wie sie Menschen behandelten. Um es zu erkennen, bedurfte es einer anderen Art von Kontrolle: einer, die Ergebnisse nach Gruppen misst, auf der Ebene jedes Agents und jeder Übergabe, und klar aussagt, wie sicher sie ist.
“Alle sechs Kontrollen standen auf Grün. Die Disparität war die ganze Zeit in den Logs. Niemand hatte den Logs diese Frage gestellt.”
Teil vier · Ein Kreditausschuss, sechs Kontrollen
Teil fünf · Von der Kontrolle zum Nachweis
Wir haben validant.ai für den Raum zwischen einer Kontrolle und dem Nachweis ihrer Wirksamkeit entwickelt. Unser Ansatz hat drei Schritte, die für ein Einstellungsmodell, einen Kredit-Score oder einen Agenten gleich sind: messen, ob ein System Personengruppen unterschiedlich behandelt, erklären, was den Unterschied verursacht, und das Ergebnis in einer Form beweisen, die jeder überprüfen kann.
Wie dies mit den sechs Kontrollen von BCG übereinstimmt
Hier ist die ehrliche Zuordnung, einschließlich dessen, was noch nicht fertig ist. Wir veröffentlichen lieber eine Tabelle mit Lücken als eine Behauptung, die wir nicht belegen können.
| BCG-Kontrolle | Was validant.ai und vfairness leisten | Status |
|---|---|---|
| Evaluierung und Rollback | Fairness-Gates, die ein Release in der CI/CD-Pipeline blockieren, kontinuierliche Überwachung mit Drift-Erkennung und Ergebnisse, die „nicht genügend Evidenz“ ausgeben, anstatt etwas passieren zu lassen, das sie nicht messen konnten. | Heute verfügbar |
| Sicherheit und Audit-Trail | Ergebnisse zeichnen die verwendete Methodenversion und Schwellenwerte auf, und Agent- und LLM-Durchläufe zusätzlich die Bibliotheksversion, Parameter und einen UTC-Zeitstempel; das Urteil wird als signierte Bescheinigung versiegelt, die jeder ohne Konto verifizieren kann. | Heute verfügbar |
| Speicher und Kontext | Multi-Agenten-Tests, die zeigen, wann die Ausgabe eines Agenten die Entscheidung des nächsten verzerrt, wie im obigen Beispiel des Kreditausschusses. | In der Beta-Version verfügbar; bisher nur gegen unsere eigenen Tests geprüft. |
| Tools und Integration | Tests, ob ein Agent Werkzeuge oder Dokumente je nach der Person, um die es im Fall geht, unterschiedlich auswählt oder abruft. | In der Beta-Version verfügbar; ein veröffentlichtes Testobjekt für die Werkzeugauswahl, noch keines für den Dokumentenabruf. |
| Verantwortlichkeit | Das Trust Seal benennt die für das System verantwortliche Organisation, so wie diese Organisation es deklariert. | Teilweise: wir erfassen die Eigentümerschaft wie deklariert; wir verifizieren oder erzwingen sie noch nicht. |
| Umfang und Aufsicht | Signierte Agenten-Mandate, die festlegen, was ein Agent im Namen einer Person tun darf, und die widerrufen werden können. | Vorgeschlagen, nicht umgesetzt |
Die Kontrolle, die die Liste auslässt
Hätte die Liste von BCG einen siebten Punkt, würden wir für diesen plädieren: Fairness, gemessen dort, wo Menschen betroffen sind. Nicht ein aggregierter Wert für das gesamte System, der ein echtes Problem durch Mittelung unsichtbar machen kann, sondern eine Messung pro Gruppe, pro Entscheidungspunkt und pro Übergabe zwischen Agents, mit Angabe der statistischen Unsicherheit und einer dritten Antwort, wenn die Daten keines der beiden Urteile stützen können. Genau das leistet unsere offene Bibliothek, vfairness. Sie deckt Trainingsdaten, Modelle, LLMs, Agents und Multi-Agenten-Systeme ab und ist unter Apache-2.0 kostenlos verfügbar, sodass jeder unsere Messungen wiederholen und uns mitteilen kann, wo sie anderer Meinung sind.
Drei Körper, nicht einer
In Digitales Vertrauen ist eine Umlaufbahn, kein Pfeiler haben wir Vertrauen in KI als das Gleichgewicht zwischen drei Körpern beschrieben: dem Modell, das entscheidet, der Organisation, die dafür verantwortlich ist, und der Person, über die es entscheidet. Die sechs Kontrollen von BCG sind fast ausschließlich im zweiten Körper angesiedelt. Sie beschreiben, wie eine Organisation ihre Agents betreibt.
validant.ai fügt die anderen beiden hinzu und verbindet alle drei:
- 01Das Modell. Wir messen, was das System tatsächlich tut, nach Gruppen aufgeschlüsselt, und erklären, was eine etwaige Lücke verursacht.
- 02Die Organisation. Wir bewerten, ob die Governance wie beschrieben funktioniert, und benennen den verantwortlichen Eigentümer auf dem Siegel, so wie die Organisation es deklariert.
- 03Die Person. In einer ausgearbeiteten Demo erhielt ein Bewerber eine Entscheidungsbestätigung (Decision Receipt) in einer echten persönlichen Wallet auf swiyu, der öffentlichen Beta der Schweizer e-ID-Vertrauensinfrastruktur: warum die Entscheidung so ausfiel, wie sie ausfiel, und wie man eine menschliche Überprüfung beantragen kann. Die Gründe in dieser Demo wurden von Hand geschrieben. Sie aus dem entscheidenden System zu generieren und diesen Körper vollständig in die Plattform zu integrieren, ist der nächste Schritt auf unserer Roadmap.
Beweise, die das Gebäude verlassen
Der wichtigste Schritt ist der letzte. Wir erstellen, hosten oder verkaufen die von uns bewerteten Systeme nicht. Unsere Ergebnisse werden als verifizierbare Bescheinigungen (verifiable credentials) ausgestellt, signiert und überprüfbar durch eine Regulierungsbehörde, einen Kunden oder ein Vorstandsmitglied, ohne sich anzumelden und ohne uns vertrauen zu müssen. Jedes Ergebnis gibt an, was wir sehen konnten und was nicht: wie viel Zugriff wir hatten, wie stark die Methode war, wie aktuell das Ergebnis ist. Ein Siegel deckt ein System zu einem bestimmten Zeitpunkt ab und weist darauf hin.
Warum der Nachweis den dreifachen Wert ausmacht
Einfach ausgedrückt: Der von BCG beschriebene dreifache Wert ist der Wert, den ein Unternehmen schafft. Ob es diesen Wert behält, entscheiden Personen, die nicht dabei waren, als die Kontrollen entwickelt wurden. Jede dieser Personen wertet eine Kontrolle ab, die sie nicht überprüfen kann. Der Risikoprüfer bepreist sie, als ob sie nicht vorhanden wäre. Die Beschaffungsabteilung sendet den Fragebogen im nächsten Quartal erneut. Die Aufsichtsbehörde verlangt die der Richtlinie zugrunde liegenden Aufzeichnungen. Das Gericht behandelt die Beschreibung als eine Behauptung. Dieser Abschlag ist die Lücke, durch die der dreifache Wert verloren geht.
| Wer Ihren Kontrollen vertrauen muss | Nur mit einer internen Kontrolle | Mit nachprüfbaren Nachweisen |
|---|---|---|
| Eine Regulierungs- oder Aufsichtsbehörde | Eine Beschreibung des Prozesses und eine Anforderung der zugrunde liegenden Aufzeichnungen | Nach Gruppen aufgeschlüsselte, signierte und datierte Ergebnisse, die sie ohne Zugriff auf Ihre Systeme überprüfen können |
| Ein Versicherer | Eine Antwort im Fragebogen, bepreist, als ob die Kontrolle nicht vorhanden wäre | Gemessene Disparitäten mit ihrer statistischen Unsicherheit und eine Angabe dazu, was der Test übersehen haben könnte |
| Ein Kunde, der KI-gestützte Ergebnisse kauft | Eine vertragliche Zusicherung und derselbe Fragebogen im nächsten Quartal | Ein Nachweis, den ihr eigenes Team verifizieren kann |
| Die Person, über die ein Agent entscheidet | Nichts, was sie sehen können | Eine Bestätigung der Entscheidung und ein Weg zur menschlichen Überprüfung (heute im Demostadium) |
| Ihr eigener Vorstand | Eine Selbsteinschätzung | Eine externe Beurteilung der wichtigsten Agenten |
Dies ist das direkte Argument für unsere Arbeit. Die Kontrollen machen Agenten steuerbar. Unabhängige, nachprüfbare Nachweise machen diese Steuerung für jeden dieser Adressaten auf einmal glaubwürdig. Ein Unternehmen, das jedem von ihnen etwas an die Hand geben kann, das sie überprüfen können, muss nicht für seinen dreifachen Wert argumentieren. Es kann ihn belegen.
“BCG zeigt Unternehmen, wie sie ihre Agenten kontrollieren können. Wir helfen ihnen, dies jemandem zu beweisen, der keinen Grund hat, ihnen beim Wort zu glauben.”
Teil fünf · Von der Kontrolle zum Nachweis
Teil sechs · Was jetzt zu tun ist
Für einen Vorstand, einen Risikoausschuss oder ein Team, das Agenten in die Produktion überführt, laufen der Bericht und die damit verbundenen Lücken auf sechs Schritte hinaus. Keiner davon muss auf eine Regulierungsbehörde warten.
- 01Erfassen Sie Ihre Agenten. Sie können nicht kontrollieren, was Sie nicht aufgelistet haben. Dokumentieren Sie jeden Agenten, der eine Entscheidung trifft oder gestaltet, was er tun kann, welche Daten und Werkzeuge er berührt und wer für ihn verantwortlich ist. BCG fordert das Management auf, genau dieses Inventar zu führen, und Vorstände, die folgenreichsten Agenten darin einzusehen. Die meisten Unternehmen haben noch keins.
- 02Führen Sie die sechs Kontrollen überall ein, nicht nur in einem Pilotprojekt. Die Daten von BCG besagen, dass der Wert dadurch entsteht, dass alle Kontrollen unternehmensweit vorhanden sind. Ein gut gesteuertes Pilotprojekt neben einer ungesteuerten Produktion ist das Schlechteste aus beiden Welten.
- 03Ergänzen Sie die Evaluierung um Fairness. Testen Sie bei jedem Agenten, der über Menschen entscheidet, vor der Veröffentlichung auf Unterschiede zwischen Gruppen und testen Sie auch danach weiter, denn Agenten driften und ebenso die Menschen, denen sie dienen. Testen Sie jede Übergabe zwischen Agenten, nicht nur das Endergebnis.
- 04Messen Sie ehrlich. Ein grünes Ergebnis bei einer kleinen Stichprobe beweist sehr wenig. Fragen Sie bei jedem Test, wie groß ein Problem sein könnte, das er übersehen hat, und behandeln Sie „nicht genügend Nachweise“ als Ergebnis, nicht als bestandenen Test.
- 05Bewahren Sie Nachweise auf, die andere prüfen können. Protokolle, die nur Sie lesen können, sind ein Anfang. Ergebnisse, die eine Regulierungsbehörde, ein Versicherer oder ein Kunde verifizieren kann, ohne Ihnen vertrauen zu müssen, sind das, was zählt, wenn die Haftungsregeln, der EU AI Act oder ein Großkunde anfragen.
- 06Holen Sie sich eine externe Beurteilung für die wichtigsten Agenten ein. Lassen Sie zumindest Ihre folgenreichsten Agenten von jemandem bewerten, der sie nicht entwickelt hat. Nicht jeder Agent benötigt dies. Diejenigen, die über Kredite, Arbeitsplätze, Gesundheit oder Geld entscheiden, schon.
Teil sieben · Was wir uns wünschen und vielleicht nicht bekommen
Die verlockende Geschichte schreibt sich von selbst. Vorstände lesen BCG, sehen, dass Kontrollen den Wert verdreifachen, fragen sich, woher sie wissen sollen, dass ihre Kontrollen funktionieren, und nehmen die unabhängige Bewertung in die Budgetposition auf, die BCG als Governance bezeichnet. Wir würden uns wünschen, dass diese Geschichte wahr ist. Es gibt gute Gründe, damit vorsichtig zu sein.
Der dreifache Effekt ist eine Korrelation. Unternehmen mit allen sechs Kontrollen sind sehr wahrscheinlich auch in vielen anderen Bereichen besser: Daten, Talente, Fokus. BCG behauptet nicht, dass die Kontrollen allein den Mehrwert verursachen, und das sollte auch niemand tun, der die Zahl zitiert, uns eingeschlossen. Die sicherere Lesart ist, dass starke Kontrollen und starke Ergebnisse Hand in Hand gehen und dass Unternehmen, die Agenten ohne Kontrollen skalieren, eine Wette eingehen, die die führenden Unternehmen nicht eingehen.
Fairness kommt im Bericht nicht vor, und das sagt möglicherweise etwas über den Markt aus. Wenn die von BCG befragten Führungskräfte Fairness nicht als Teil der Agent-Governance betrachten, werden es viele Käufer auch nicht tun, zumindest bis eine Regulierungsbehörde, ein Gericht oder eine Schlagzeile sie dazu zwingt. Wir halten diese Ansicht für kurzsichtig. Wir wissen auch, dass ein besseres Argument allein keine Budgets ändert.
Die Budgets für Governance sind klein. In der Aufschlüsselung von BCG ist Governance der kleinste Posten bei den KI-Ausgaben, etwa 0,3 % des Umsatzes von insgesamt 3,3 %. Die unabhängige Bewertung muss in diesen Posten passen, neben Strategie, Risikomanagement und Compliance.
Unsere eigenen Tools sind nicht alle ausgereift. Wie die Tabelle in Teil fünf zeigt, befinden sich die Agent- und Multi-Agent-Tests in der Beta-Phase und wurden bisher hauptsächlich gegen unsere eigenen Tests geprüft, und signierte Agentenmandate sind noch nicht entwickelt. Wir veröffentlichen, was wir verifiziert haben und was nicht, auf unserer Seite zu Qualität und Härtung, denn ein Anbieter von Bewertungen, der seine eigenen Grenzen verbirgt, macht genau den Fehler, den er aufdecken soll.
Dies ist also ein Argument, keine Prognose. Wir glauben, dass die Unternehmen, die den von BCG beschriebenen Wert realisieren, diejenigen sein werden, die zeigen können, dass ihre Kontrollen funktionieren, nicht nur diejenigen, die sie haben. Wir freuen uns über eine Diskussion mit jedem, der dies anders sieht.
Vertrauen wird bewertet, nicht behauptet. Wenn Ihre Organisation Agenten in die Produktion überführt und unabhängige, nachprüfbare Nachweise über deren Verhalten wünscht, bevor die Haftungsregeln im Dezember und die Hochrisikopflichten des EU AI Act im Dezember 2027 in Kraft treten, steht unsere geschlossene Beta einer kleinen Gruppe offen. Schreiben Sie an hello@validant.ai mit dem Betreff „Closed Beta“ oder fordern Sie eine Demo an. Um die offene Engine noch heute auszuprobieren: pip install vfairness.
Kurz gesagt
BCG hat gezeigt, dass die Kontrolle von Agenten nicht deren Wert bremst, sondern der Grund für seine Vervielfachung ist. Der nächste Schritt ist, diese Kontrolle sichtbar zu machen: für die Menschen, über die Agenten entscheiden, für Regulierungsbehörden und für jeden, der dem Ergebnis vertrauen muss, ohne sich auf Ihr Wort zu verlassen. Bremsen ermöglichen es, schnell zu fahren. Nachweise ermöglichen es anderen, mitzufahren.
“Vertrauen wird geprüft, nicht bloß behauptet. Eine Kontrolle, die niemand sonst überprüfen kann, ist immer noch eine Behauptung.”
Die Kontrolle von Agents verdreifacht ihren Wert
Quellen und weiterführende Literatur
- 01Apotheker, J., Beauchene, V., de Bellefonds, N., et al. (2026). Die Formel für den Wert agentischer KI: Der Applied AI Index 2026. Boston Consulting Group, September 2026. Alle BCG-Zahlen und Zitate in diesem Artikel stammen aus diesem Bericht.
- 02Europäische Union. (2026). Verordnung (EU) 2026/1744 (Digital-Omnibus-Gesetz zu KI), zur Änderung der Verordnung (EU) 2024/1689. Amtsblatt der Europäischen Union, 24. Juli 2026. Legt die Anwendung der Hochrisikoverpflichtungen aus Anhang III auf den 2. Dezember 2027 fest.
- 03Europäische Union. (2024). Verordnung (EU) 2024/1689 (der AI Act). Amtsblatt der Europäischen Union. Anhang III, Punkte 4 und 5(b) und (c).
- 04Europäische Union. (2024). Richtlinie (EU) 2024/2853 über die Haftung für fehlerhafte Produkte. Amtsblatt der Europäischen Union. Artikel 2(1) und Erwägungsgrund 13.
- 05validant.ai. vfairness-Testobjekte: der Kreditausschuss, mit seinen Laufzeitdaten, Harness und ausgeführtem Notebook.
- 06validant.ai. vfairness auf PyPI, Apache-2.0.
- 07validant.ai. Ein Vertrauenssiegel verifizieren: prüft die Signatur und den Widerrufsstatus eines Siegels, ohne Konto.
- 08validant.ai. vfairness-Qualität und -Härtung: was verifiziert wird und was nicht.
- 09Glinz, D. (2026). Präzision ist kein Beweis: Die Falle in jedem KI-Fairness-Urteil. validant.ai Signal.
- 10Glinz, D. (2026). Das Paradoxon der präventiven Zusicherung: Wer bewacht die KI-Leitplanken? validant.ai Signal.
- 11Glinz, D. (2026). Bias ist die Grundlage. validant.ai Signal.
- 12Glinz, D. (2026). Digitales Vertrauen ist eine Umlaufbahn, kein Pfeiler. validant.ai Signal.
- 13Glinz, D. (2026). Agenten werden für uns handeln. Wer bürgt für sie? validant.ai Signal.
- 14Glinz, D. (2026). Das Vertrauensproblem, das niemand benennen will. validant.ai Signal.
ForschungZum Lesen öffnenPräzision ist kein Beweis: Die Falle in jedem Urteil zur KI-Fairness
Ein Modell, das perfekt vorhersagt, versichert niemanden mehr; ein Ergebnis, das ohne seine Nachweisgrenze veröffentlicht wird, verleitet zu der Annahme, dass die Grenze bei Null liegt. Zwei Fehler, eine Unterlassung und zwei Lehnwörter, um sie auseinanderzuhalten.
Lesen
ForschungZum Lesen öffnenDigitales Vertrauen ist ein Orbit, keine Säule
Vertrauen ist keine weitere Säule, die man einfach aufbaut. Es ist der Orbit, den drei Körper gemeinsam beschreiben: das Modell, die Person und die Organisation. Warum das Dreikörperproblem die ehrlichere Metapher für vertrauenswürdige KI ist und wie Sie feststellen können, wo Sie sich im Orbit befinden.
Lesen
ForschungZum Lesen öffnenDas Paradoxon der präemptiven Zusicherung: Wer bewacht die KI-Leitplanken?
In einer einzigen Septemberwoche forderte ein Labor eine Verlangsamung, ein Präsident erklärte, er sei die einzige Leitplanke, die KI brauche, und The Economist fragte, ob das Wettrüsten gestoppt werden könne. Notizen von den Trust Valley Days 2026 an der EPFL darüber, warum die Antwort weder eine Pause noch ein Sprint ist, sondern Haftung, Ergebnisse und Verifizierung.
Lesen