Deterministischer Kern, agentische Hülle: Wie KI in Freigabeprozesse kommt.
Diese Woche ist mir eine Ausschreibung eines europäischen Konzerns über den Tisch gelaufen. Gesucht wird eine Person. Eine. Sie soll enterprise-weit eine AI-Fabrik aufbauen, den ersten großen Anwendungsfall aus dem Finanzbereich end-to-end umsetzen, die Anbindung an das ERP verantworten, Governance und Auditierbarkeit sicherstellen und die Fachbereiche befähigen. Nebenbei soll sie deutlich mehr Fachwissen im Prozess mitbringen als die meisten internen Mitarbeitenden. Wenn Sie diese Person kennen, geben Sie ihre Kontaktdaten bitte weiter — die halbe Branche sucht sie.
Wer ein Einhorn sucht, hat kein Personalproblem.
Ich habe die Ausschreibung nicht als Personalanzeige gelesen. Ich habe sie als Signal gelesen. Ein Konzern, der intern spürt, dass ihm zwischen AI-Piloten und produktivem Kernprozess ein ganzes Handwerk fehlt, und der glaubt, dieses Handwerk als Einzelperson einkaufen zu können. Das ist keine Beschaffungsentscheidung, das ist ein Hilferuf.
Die eigentliche Nachricht ist eine andere. Die Disziplin, die dort gesucht wird, existiert als strukturierte Leistung noch nicht. Nicht als Rolle, nicht als Angebot am Markt, in weiten Teilen nicht einmal als Vokabular. Wir haben Modelle im Überfluss. Wir haben Prompt-Engineers, RAG-Berater, MLOps-Boutiquen. Was wir nicht haben, ist eine Fabrik, die aus einem Piloten einen freigabepflichtigen, auditierbaren, betriebenen Kernprozess macht. Nicht als Projekt. Als Fähigkeit.
Wahrscheinlichkeit trifft auf Freigabepflicht.
In derselben Ausschreibung steht ein Satz, den ich mehrfach gelesen habe. Sinngemäß: Die AI soll angebunden werden unter Beibehaltung der bestehenden deterministischen Berechnungs- und Freigabeprozesse. Klingt harmlos, ist es nicht. Dieser eine Nebensatz beschreibt den Kernkonflikt der nächsten Enterprise-AI-Phase.
Ein probabilistisches System trifft auf einen Prozess, dessen Existenzberechtigung Determinismus ist. Ein Model, das jede Woche neu evaluiert, ausrollt und gelegentlich anders antwortet, trifft auf eine Freigabelogik, die im Zweifel vor einem Prüfer bestehen muss. Beide Welten haben ihre gute Berechtigung. Das Problem ist, dass die Übergangsstelle zwischen ihnen bisher nicht gebaut ist. Sie wird pro Anwendungsfall neu erfunden — von jedem Team, das gerade den Piloten in die Linie ziehen soll. Der zweite Anwendungsfall bezahlt fast das gleiche wie der erste, obwohl er das nicht müsste.
Der Kern muss deterministisch bleiben. Aber die Hülle darum kann agentisch sein. Das ist die Übersetzungsleistung, die wir uns schuldig sind.
Vier Punkte, an denen Produktionsfähigkeit sich messen lässt
Keine Vollständigkeit. Nur die Stellen, an denen sich für mich entscheidet, ob ein Vorhaben ein Pilot bleibt oder in die Linie geht.
Deterministischer Kern, agentische Hülle Das System of Record bleibt unangetastet
Wenn der Fehlerfall eines Agenten eine falsche Rechnung ist, war die Architektur falsch. Der deterministische Kern muss die Berechnung und die Buchung besitzen. Der Agent darf die Vorbereitung, den Vorschlag, die Erklärung und die Nachbereitung besitzen. Die Trennlinie ist keine Nettigkeit, sie ist die Bedingung dafür, dass Prüfer und Revision überhaupt mitgehen.
Ein Blueprint, keine Einzelstücke Standardisierte Schnittstellen für Daten, Modelle, Freigaben, Trace
Für jeden neuen Anwendungsfall dieselben Fragen zu beantworten — welches Auth, welches Trace-Format, welches Eval-Setup, welche Freigabeschwelle — ist keine Sorgfalt. Es ist Ineffizienz. Eine Fabrik hat eine Referenzarchitektur, an der Anwendungsfälle andocken. Das kostet vorne mehr, hinten aber einen Bruchteil.
Governance ist Teil der Linie, nicht Nacharbeit Trace, Eval, Back-Testing, Quality Gates vor jeder Freigabe
Jeder Output muss rückführbar sein: auf welche Daten, welche Modellversion, welchen Prompt, welche Freigabe. Das ist eine architektonische Entscheidung, keine Compliance-Tapete. Und ein Eval-Harness, der neben dem Prozess läuft, entscheidet vor jeder Freigabe, ob die Antwort in die Buchung darf. Wer das nachlagert, hat den Prozess nicht verstanden.
Betrieb ist der eigentliche Beruf Drift, Re-Validierung, Modellwechsel, Audit-Nachweis
Ein Modell verhält sich in Monat sechs nicht so wie in Monat eins. Daten drehen sich, Anbieter wechseln Endpunkte, Prompts vertragen keine Modellversionen mehr. Wenn im Haus niemand die Verantwortung für diese Drift trägt, wird der beste Pilot zu einer Ruine, an die sich alle noch gerne erinnern. Betrieb ist die Disziplin, die Enterprise-AI heute am meisten fehlt.
Ein Beispiel, das ich gut kenne.
Nehmen Sie eine Deckungsbeitragsprognose bei einem Direktvermarkter. Der Portfoliomanager fragt jeden Morgen dieselben Fragen: Was hat der Vortag gebracht, wo weichen Ist- und Prognose voneinander ab, welche Anlagen sind auffällig, welche Vermarktungsentscheidung leitet sich für heute ab. Klassisch gebaut, laufen dafür Berichte, Abstimmungen und Excel-Runden — und um zehn Uhr ist die Entscheidung teils schon zu spät.
Wie ich das heute baue: Der Agent bereitet die Datenlage auf, erkennt Anomalien, schlägt Prognosewerte vor, formuliert den Kommentar für die Portfolio-Runde und markiert offen, was er nicht mit hoher Konfidenz sagen kann. Das Handelssystem bleibt System of Record. Die Buchung, die Grenzwerte, die Freigabe bleiben deterministisch. Der Portfoliomanager entscheidet. Was er gewinnt, ist Zeit — und einen Kommentar, den sonst niemand vor der Runde geschrieben hätte. Was er nicht verliert, ist Kontrolle. [BEISPIEL AUS EIGENEM PROJEKT — konkrete Anlagen-Zahl, Zeitgewinn und Freigabepfad hier ergänzen, sobald der Kunde die Nennung freigibt.]
Nach dem Go-live beginnt die eigentliche Arbeit.
Der blindeste Fleck, den ich in Enterprise-AI-Vorhaben sehe, ist der Übergang vom Go-live in den Betrieb. Der Pilot wird gefeiert, die Präsentation erfolgt, die Champagner-Bewegung setzt ein. Und dann ist niemand da, der drei Monate später bemerkt, dass die Konfidenzen driften, dass der neue Modellrelease anders formuliert, dass der Eval-Score gefallen ist, dass die Prüfer den Trace anders lesen wollen. Wer das nicht besetzt, liefert keinen Prozess, sondern eine Anekdote.
Ich mache das jeden Werktag konkret: Monitoring, Drift-Erkennung, Re-Validierung, Modellwechsel, Audit-Nachweis. Nicht als Backoffice, sondern als Beruf. Der Kunde bekommt jeden Monat einen kurzen Bericht: Wie hat sich der Prozess bewegt, wo sind Grenzwerte gewandert, was wurde nachgeschärft. Das ist keine Beratung. Das ist Betrieb.
Das stärkste Gegenargument.
Das ehrlichste Gegenargument lautet: „Alles, was Sie beschreiben, gibt es schon. Es heißt Softwareentwicklung, Change-Management, MLOps, Interne Revision. Warum brauchen wir dafür einen neuen Namen?" Die Antwort ist unbequem. Ich behaupte nicht, dass eine der Zutaten neu ist. Ich behaupte, dass das Rezept fehlt — als adressierbare Leistung, die ein Entscheider einkaufen kann, ohne zwischen fünf Dienstleistern die Verantwortung selbst zu integrieren. Solange Sie im Konzern jede Integrationslast selbst tragen, brauchen Sie einen eigenen Kader, ein eigenes Programm und viel Geduld. Das schaffen wenige Häuser gut. Für die anderen soll dieses Handwerk als geschlossene Leistung existieren. Heute tut es das kaum.
Eine ehrliche Frage an Ihren eigenen Laden.
Wenn Sie in einem Konzern arbeiten, in dem gerade AI-Piloten laufen, hätte ich einen einzigen Prüfstein. Nehmen Sie den Piloten, der Ihnen am wichtigsten ist — der, der in Ihren Kernprozess soll. Und beantworten Sie diese Frage im Raum: Wer ist bei uns in zwölf Monaten dafür verantwortlich, dass der Agent noch stimmt?
Wenn Sie den Namen sofort haben und die Person das Budget, die Rechte und die Runbooks besitzt, gratuliere ich. Dann sind Sie weiter als die meisten. Wenn die Antwort schwieriger ist — zwischen IT, Fachbereich und Data Science verteilt, im Zweifel „das schauen wir uns dann an" — dann wissen Sie, wo Ihr Projekt hingehen wird. Es wird in der Präsentation gut aussehen. Und danach leise verfallen.
Die nächste Phase von Enterprise-AI wird nicht im Prompting entschieden. Sie wird im Betrieb entschieden. Und im Zweifel von der Person, die am Freitag abends bemerkt, dass sich der Eval-Score verschoben hat.
Ich schreibe das, weil ich es täglich sehe. Und weil die Ausschreibung, mit der ich angefangen habe, wahrscheinlich nie besetzt wird. Nicht, weil es die Person nicht gibt. Sondern, weil eine Person allein diese Aufgabe nicht tragen kann. Es ist ein Handwerk, keine Rolle. Und Handwerke lassen sich einkaufen, wenn jemand sie geordnet anbietet.
Wer ist bei Ihnen in zwölf Monaten dafür verantwortlich, dass der Agent noch stimmt?
Wenn Sie mit dieser Frage schon eine Weile leben — reden wir eine halbe Stunde darüber. Kein Verkaufsgespräch, sondern eine ehrliche Runde am Whiteboard.
Gespräch vereinbaren