AI-systemen Onderzoeksartikel

Agent-schaduwmodus: beoordeel voorstellen voordat je actierechten verleent

Laat de agent zich eerst op papier vergissen, waar een fout je een vergelijking kost in plaats van een klant.

Een lesauto met dubbele bediening geparkeerd op een lege, natte parkeerplaats bij zonsopgang, gezien vanaf de passagierskant, met een tweede rempedaal aan de kant van de instructeur en een hand die op de knie erboven rust
De leerling rijdt. Het tweede pedaal blijft tot het dossier iets anders zegt.

Direct antwoord

Agent-schaduwmodus betekent dat een AI-agent echt werk binnenkrijgt en vastlegt wat hij zou doen, zonder toestemming om het te doen. Een mens of het bestaande proces voert nog steeds uit, en achteraf vergelijk je de twee. Het idee komt uit schaduwtests in software: een nieuwe versie krijgt een kopie van live verzoeken, en haar antwoorden worden weggegooid of alleen gelogd. Bij agents moeten de schrijvende tools echt worden uitgeschakeld, niet alleen genegeerd. Geef actierechten per smalle categorie gevallen, volgens een vooraf geschreven regel.

Agent-schaduwmodus betekent dat een AI-agent echt werk binnenkrijgt en opschrijft wat hij zou doen, zonder toestemming om het te doen. Een mens of het bestaande proces voert nog steeds uit, en achteraf vergelijk je de twee. Pas als die vergelijking voldoet aan een vooraf geschreven regel, krijgt de agent actierechten.

Een agent die in 50 gevallen geen ernstige fout maakte, heeft je nog maar weinig laten zien. Deze pagina legt uit waarom, wat je in plaats daarvan meet, en geeft een promotieregel die je kunt overnemen.

Met een AI-agent bedoel ik hier software die een doel krijgt en in meerdere stappen tools gebruikt, zoals e-mail, een database of een planningssysteem, zonder dat een mens elke stap goedkeurt. Actierechten zijn de rechten om in die systemen iets te veranderen.

Waar komt de term vandaan?

Uit de wereld van software-uitrol. De machinelearningdienst SageMaker van Amazon biedt schaduwtests. De documentatie beschrijft hoe SageMaker “automatically deploys the new variant in shadow mode and routes a copy of the inference requests to it in real time within the same endpoint. Only the responses of the production variant are returned to the calling application.” In gewone taal: de nieuwe versie krijgt een kopie van de echte vragen aan het live model, maar gebruikers krijgen alleen antwoorden van de versie die al in productie draait.

Istio, een service mesh (software die verkeer tussen de onderdelen van een cloudtoepassing regelt), beschrijft dezelfde aanpak: “Traffic mirroring, also called shadowing, is a powerful concept that allows feature teams to bring changes to production with as little risk as possible.” De gekopieerde verzoeken zijn eenrichtingsverkeer: de antwoorden gaan de prullenbak in.

Dat werkt omdat een voorspelling alleen een antwoord is. Een antwoord kun je weggooien. De output van een agent is een handeling: een verstuurde mail, een verplaatste boeking, een uitgevoerde terugbetaling. Een gespiegelde agent met een werkende verzendtool staat niet in de schaduw. Die verzendt gewoon.

Agent-schaduwmodus is dus strenger dan het origineel uit de softwarewereld. De agent krijgt dezelfde invoer en dezelfde leesrechten. Elke tool die schrijft, vervang je door een voorsteltool die de bedoelde handeling vastlegt en verder niets doet.

Wat staat er in een voorstel?

Elk voorstel is een korte vastlegging met hetzelfde zaaknummer als de echte beslissing van de mens:

  1. De handeling. De precieze tool en argumenten die de agent zou hebben gebruikt: “verplaats levering 5530 naar donderdag 14.00 tot 16.00 uur.”
  2. De reden. Het bericht, het record of de regel waarop hij zich baseerde.
  3. Escaleren of niet. Of hij de zaak liever aan een mens had overgedragen.
  4. Het tijdstip. Wanneer hij het voorstel deed, zodat je ook de snelheid kunt vergelijken.

De beslissing van de mens leg je apart vast, in het systeem dat hij al gebruikt. Niemand typt die over in de log van de agent.

Waarom moet de vergelijking blind zijn?

Ziet de mens het voorstel voordat hij beslist, dan meet overeenstemming overtuigingskracht in plaats van juistheid. Een keurig voorstel op het scherm accepteer je makkelijk.

De Europese AI-verordening benoemt dat risico voor systemen die zij als hoog risico aanmerkt. Wie daar toezicht op houdt, moet zich bewust kunnen blijven van de mogelijke neiging om automatisch of te veel te vertrouwen op de output van het systeem. In de Engelse tekst heet dat automation bias.

De oplossing zit in de werkwijze. De mens beslist eerst, het voorstel blijft verborgen, en achteraf vergelijkt iemand de twee aan de hand van geschreven criteria.

Wat meet je?

Overeenstemming alleen verbergt juist de gevallen die ertoe doen. Sorteer elke afwijking eerst in een van vier bakken, en ga daarna pas tellen.

BakBetekenisWat het je vertelt
Agent fout, ernstigHet voorstel uitvoeren had schade veroorzaakt zoals het charter die omschrijftHet getal dat over promotie beslist
Agent fout, lichtNiet optimaal maar onschuldig, bijvoorbeeld een slechter tijdvakLeermateriaal, geen blokkade
Mens foutDe agent had gelijk en de mens vergiste zichNuttige bijvangst, maar geen reden om te promoveren
Beide goedTwee geldige antwoordenHelemaal geen fout

Voeg er twee getallen aan toe. Dekking: het aandeel gevallen waarin de agent überhaupt een handeling voorstelde. En de kwaliteit van het escaleren: droeg hij de gevallen over die mensen ook lastig vonden? Een agent die alles escaleert, maakt nooit een fout en helpt ook nooit.

Lees ook de redenen, niet alleen de handelingen. Een voorstel kan om de verkeerde reden overeenkomen met de beslissing van de mens. Dat is precies het punt van evalueer de redenering, niet de vloeiendheid.

Hoeveel gevallen heb je nodig voordat je hem vertrouwt?

Meer dan je denkt. Statistici hebben er een vuistregel voor: de regel van drie. Hanley en Lippman-Hand (JAMA, 1983) formuleren het zo: “if none of n patients shows the event about which we are concerned, we can be 95% confident that the chance of this event is at most three in n (ie, 3/n).” Komt een gebeurtenis in n gevallen niet voor, dan is de werkelijke kans dus met 95 procent zekerheid hooguit 3 gedeeld door n.

Schone gevallen op rijPercentage ernstige fouten dat je nog niet kunt uitsluiten
50tot 6 op 100
300tot 1 op 100
3.000tot 1 op 1.000

Reken terug. Bepaal welk percentage ernstige fouten je kunt accepteren en deel 3 daardoor. Accepteer je 1 op 200, dan heb je in die categorie ongeveer 600 schone gevallen nodig. Twee rustige weken met 40 gevallen is een demo, geen bewijs.

Waar komt CHORUS in beeld?

CHORUS is een coördinatieprotocol voor kleine teams van mensen en AI-agents, uit De multi-agent organisatie, dat nu verkrijgbaar is. De zes vaardigheden houden hun Engelse namen:

  1. Charter. Een geschreven contract voor één medewerker, mens of agent, met zeven velden, waaronder een bevoegdheidsgrens: wat hij mag doen zonder te vragen.
  2. Handoff. Een contextpakket dat een taak over een grens draagt, zodat de ontvanger niet hoeft te raden.
  3. Orchestrate. Wie wat doet in welke volgorde, waar parallel werk samenkomt en bij wie een probleem terechtkomt.
  4. Review. Een poort waar output alleen doorheen komt als die aan geschreven acceptatiecriteria voldoet.
  5. Update. Wat reviews opleveren, gaat terug naar prompts, tools en charters.
  6. Sync. Eén gedeeld overzicht van wie wat bezit en wat vastzit, wekelijks gelezen.

Je hebt het boek niet nodig om dit te gebruiken. Schaduwmodus is Review en Update aan het werk, nog voordat er één schrijfrecht bestaat.

Review. De vergelijking is een reviewpoort. Geschreven criteria bepalen welke afwijkingen als ernstig tellen, en een benoemde beoordelaar verdeelt ze over de vier bakken. Niet de agent, en niet het onderbuikgevoel.

Update. Bevindingen gaan terug naar de prompts, de tools en het charter van de agent. Actierechten geven is een wijziging van de bevoegdheidsgrens in het charter. Het boek is daar duidelijk over: die grens verschuiven is een charterwijziging, geen promptaanpassing. Leg de wijziging vast, noem wie haar goedkeurde en laat het team het weten. Het boek merkt ook op dat een rol met een schone log een lichtere controle heeft verdiend, en dat een rol die je vertrouwde, kan afdrijven na een modelwissel.

Haal twee dingen niet door elkaar. Het boek gebruikt “shadow agent” voor een agent die buiten beeld werkt, zonder charter. Schaduwmodus is het tegendeel: met charter, zichtbaar, en zonder schrijfrechten.

De promotieregel

Geef rechten per categorie gevallen, nooit aan de agent als geheel.

FaseDe agent magEen stap verder alsWie tekentTerug als
SchaduwLezen en voorstellen; niets schrijvenHet aantal schone gevallen voor de categorie is gehaald (3 gedeeld door het aanvaardbare foutpercentage), in een blinde vergelijkingDe proceseigenaarNiet van toepassing
Onder toezichtIn één smalle categorie handelen nadat een benoemde persoon elke handeling heeft goedgekeurdHet aantal is in echt gebruik opnieuw gehaald, zonder ernstige fout die de goedkeurders onderscheptenDe proceseigenaarElke ernstige fout in de categorie
SteekproefIn die categorie handelen; een benoemde persoon controleert achteraf een vooraf vastgelegde steekproefNiet van toepassingDe proceseigenaarElke ernstige fout, of een wijziging van model, instructies of tools

Een degradatie stuurt die ene categorie terug naar de schaduw, niet de hele agent terug naar de tekentafel. Sommige handelingen komen nooit verder dan de fase onder toezicht: verzenden namens het bedrijf, uitgeven boven een plafond, verwijderen. Het HITL-artikel noemt dat vaste poorten, en in het AI-agent-charter schrijf je de bevoegdheidsgrens op.

Een uitgewerkt voorbeeld: leveringen verzetten

Stel je een hypothetisch regionaal bezorgbedrijf voor. Klanten mailen om een levering te verzetten, en planners passen die in het planningssysteem aan, zo’n 40 keer per dag. Een agent leest dezelfde mails en stelt elke wijziging voor, zonder schrijfrechten. De planners zien de voorstellen niet.

Na vier weken en ongeveer 800 verzoeken deelt een beoordelaar de afwijkingen in. Alle getallen zijn hypothetisch.

Soort verzoekGevallenErnstige fouten agentBesluit
Later, zelfde week, ongekoelde waren5200Naar onder toezicht
Eerder dan gepland1502Blijft in de schaduw
Gekoelde waren904Blijft in de schaduw; regel voor de koudeketen toevoegen aan het charter
Onduidelijke verzoeken400 (31 geëscaleerd)Blijft in de schaduw

De vergelijking ving ook 9 tikfouten van planners. Mooi meegenomen, maar geen reden om te promoveren.

Waarom onder toezicht en nog niet op steekproefbasis? Nul fouten in 520 gevallen laat nog steeds een percentage van ongeveer 1 op 170 toe. Bij zo’n 26 verzoeken van die soort per dag kan dat nog altijd neerkomen op ongeveer drie ernstige fouten per vier weken. Dus keurt een planner elke handeling goed, terwijl de teller doorloopt.

Probeer dit vandaag (20 minuten)

  1. Kies één handeling die je agent wil uitvoeren, en beperk die tot één smalle categorie gevallen.
  2. Vervang voor die handeling de schrijvende tool door een voorsteltool die alleen vastlegt.
  3. Schrijf de criteria voor de vier bakken: wat telt hier als ernstige fout?
  4. Kies het aanvaardbare percentage ernstige fouten en reken het aantal schone gevallen uit.
  5. Wijs de beoordelaar aan die afwijkingen indeelt, en schrijf op waardoor de categorie terug moet.

Schaduwmodus beantwoordt de vraag of de agent mag handelen, maar niet of je hem kunt stilleggen zodra hij dat doet, of dat je later kunt reconstrueren wat hij deed. Regel allebei vóór de eerste promotie, niet erna.

Citeer deze pagina:Agent-schaduwmodus: beoordeel voorstellen voordat je actierechten verleent.Len P. van der Hof. https://lenvanderhof.com/nl/blog/agent-schaduwmodus/ ·

Begrippen

Bronnen

  1. Shadow tests (Amazon SageMaker AI Developer Guide) · Amazon Web Services
  2. Mirroring (Istio documentation) · Istio
  3. If Nothing Goes Wrong, Is Everything All Right? Interpreting Zero Numerators (JAMA 1983;249(13):1743-1745) · JAMA (auteurskopie op de site van James A. Hanley, McGill University)
  4. Verordening (EU) 2024/1689 (AI-verordening), geconsolideerde tekst · EUR-Lex, Publicatiebureau van de Europese Unie
  5. CHORUS (framework)
  6. De multi-agent organisatie
  7. HITL in AI-workflows: zet de benoemde persoon op de onomkeerbare stap

Verder lezen

Markdown voor LLMs