AI-systemen Onderzoeksartikel

Waarom multi-agent systemen falen: de coördinatiekloof

Capaciteit voeg je in een middag toe. Het protocol ontbrak. Die kloof vertelt het hele verhaal.

Bouwplaats 's nachts, kranen die onafhankelijk draaien, kabels in de knoop, lege keet
De agents waren er. Het protocol nooit.

Een klein team voegt drie agents toe en de week vertraagt. De ruis in je inbox neemt toe. Er wordt minder werk afgerond. Iemand roept dat de modellen niet goed genoeg zijn. Meestal ligt het niet aan de modellen. Het team heeft simpelweg nooit een protocol geïnstalleerd.

De coördinatiekloof

Capaciteit is goedkoop. Een gespecialiseerde AI-agent die schrijft, archiveert of onderzoek doet, heb je vanavond nog draaien.

Coördinatie is duur. Wie bewaakt het doel bij de overdracht. Welke context reist er mee. Wat moet er gereviewd worden. Hoe het bord wordt bijgewerkt. Hoe het team op maandag de actuele status ziet.

Dat is wat agent-orchestratie inhoudt. Een graaf van model calls is dat niet. Als je niet kunt aanwijzen welk pakket de grens is overgegaan, heb je niet georkestreerd. Je hebt iets gelanceerd.

Dit is waarom “we hebben multi-agent geprobeerd” vaak betekent “we hebben een zwerm-demo geprobeerd.” De demo ziet er misschien lekker druk uit. Maar de organisatie heeft geen idee wie eigenaar is van de output.

Een agentische workflow heeft nog steeds een doel, een charter en een plafond nodig. Een zwerm zonder deze drie is hetzelfde ontbrekende protocol, maar dan luidruchtiger.

Labsystemen lopen vast op diezelfde breekpunten. Cemri, Pan, Jun en collega’s annoteerden 1642 executiesporen over zeven open-source multi-agent frameworks (arXiv 2503.13657v3, NeurIPS 2025 Datasets and Benchmarks). Het uitvalpercentage van taken in die systemen lag tussen de 41% en 86,7%. Hun taxonomie groepeert de missers in systeemontwerp, gebrekkige afstemming tussen agents en taakverificatie: genegeerde rolspecificaties, weggevallen geschiedenis, overgeslagen input van andere agents, en ontbrekende of foute verificatie. Dat is een labresultaat op bekende frameworks. Het is geen onderzoek naar bedrijfsprojecten. Het rijmt wel. De reparatie door een operator is nog steeds een specifieke vaardigheid, geen nieuw model.

Waar het stukloopt

Zes oersaaie breekpunten, in de volgorde waarin ik ze tegenkom. Elk breekpunt benoemt een ontbrekende CHORUS-vaardigheid.

Charter. Het werk begint omdat iemand een prompt intypte. Er is geen uitgeschreven doel, geen autoriteitsplafond, geen escalatie. Er verschijnt output die door geen enkele rol met een charter geproduceerd mocht worden. Dat is een schaduw-agent.

Handoff. De eerste agent is klaar. De tweede begint vanuit een chatlog. Restricties sterven in de copy-paste. Een pakket van zes velden was genoeg geweest: doel, restricties, input, herkomst (provenance), acceptatie en deadline. De charter is een ander artefact (zeven velden). Voeg ze niet samen.

Orchestrate. Twee werkers pakken dezelfde taak op. Niemand heeft de merge benoemd. Er komen twee concepten binnen. Iemand plakt simpelweg degene die het best klinkt. Een graaf van calls leek druk. Niemand was eigenaar van de samenvoeging.

Review. Output wordt opgeleverd omdat het wel goed klonk. Er is geen uitgeschreven acceptatieregel. De mens-in-de-lus is een toeschouwer. Een goedkeuringspercentage van bijna 100% is geen kwaliteitssysteem. Het is review-theater.

Update. De wereld is veranderd. Je agent-roster niet. Oude tools, oude prompts, oude klantfeiten. Plausibele antwoorden over een wereld die niet meer bestaat.

Sync. De standup ontaardt in een rondleiding langs model traces. Een dashboard was beter geweest. De meeting bestaat alleen omdat niemand de status kan zien. Beslissingen leven in de chat. Het bord is een leugen.

Falen dat je kunt benoemen is op te lossen. “Agenten vielen ons tegen” niet.

Een pakket dat de copy-paste overleeft

Hier is het verschil tussen een thread en een overdracht.

De thread zegt: “Kun je de launch note afmaken? De context staat hierboven.” De tweede werker verzint vervolgens zelf de toon, de doelgroep en wat “klaar” betekent.

Het pakket zegt:

  • Doel. Eén launch note voor bestaande klanten, 180–220 woorden, waarin de cutover van dinsdag wordt aangekondigd.
  • Restricties. Geen prijzen. Geen vergelijking met een bij naam genoemde concurrent. Geen beloftes waar het onboarding-team niet voor getekend heeft.
  • Input. De cutover-checklist van 12 augustus. De laatst goedgekeurde klant-e-mail. Het supportscript voor de eerste 24 uur.
  • Herkomst. De eigenaar van de checklist is ops. De eigenaar van de e-mail is de founder. Het supportscript is de enige bron voor “wat te doen als inloggen mislukt”.
  • Acceptatie. Een bij naam genoemde reviewer kan het afkeuren als het een feature verzint, de cutover-tijd aanpast, of zich op prospects richt in plaats van op klanten.
  • Deadline. Maandag 16:00, zodat de reviewer nog een uur heeft voor verzending.

Dat zijn zes velden. Geen zeven. Als je ze niet kunt invullen, ben je er niet klaar voor om het werk aan wie dan ook over te dragen, mens of agent.

De override-doctrine staat naast het pakket, er niet in. Het pakket vertelt wat de taak inhoudt. De doctrine bepaalt wat de werker nóóit mag doen: meer uitgeven dan een bepaald plafond, namens het bedrijf spreken, productiedata wijzigen, of een besluit nemen waar jij nog de eigenaar van bent. Schrijf de doctrine voordat je de tool bouwt die daadwerkelijk kan verzenden.

Een diagnose die je deze week kunt uitvoeren

SignaalOntbrekende vaardigheidEerste fix
Output die geen enkele rol met een charter mocht producerenCharterSchrijf doel, plafond en escalatie op vóór de volgende run
De tweede werker begint vanuit een chatlogHandoffVul de zes velden in. Weiger de taak als een veld leeg is
Twee concepten, geen benoemde mergeOrchestrateEén eigenaar van de merge. Serieel of fan-in, hardop uitgesproken
Goedkeuring zonder uitgeschreven checkReviewEén acceptatieregel waarop de reviewer kan afkeuren
Antwoorden over het product van vorige maandUpdateVoorzie het roster van een datum. Elimineer verouderde tools publiekelijk
De standup is een rondleiding langs tracesSyncEén overzicht. Lees het. Vertel het niet na

Tien minuten is genoeg om te beginnen. Maak een lijst van elke agent die vorige week werk heeft aangeraakt. Schrijf bij elk van hen de laatste mens op die de output heeft geaccepteerd. Als je die persoon niet kunt benoemen, heb je de kloof gevonden.

Waar CHORUS voor is, en waarvoor niet

CHORUS is een protocol van zes vaardigheden: Charter, Handoff, Orchestrate, Review, Update, Sync. Charter bestaat uit zeven velden die een vage intentie omzetten in een contract. Handoff is het pakket van zes velden. Orchestrate gaat over seriële stappen, fan-out, fan-in en een benoemde menselijke escalatie. Review is een poortwachter op basis van uitgeschreven acceptatie, geen vibe-check. Update stuurt bevindingen terug naar prompts, tools en charters. Sync is één overzicht, gelezen in een kort wekelijks ritueel.

Het is voor teams van 2 tot 15 mensen die nu al mensen en gespecialiseerde agents combineren.

Het is geen CrewAI-tutorial. Het is geen graph-product. Het is geen organogram. Het is geen muziek- of chatmerk. Het is ook geen protocol voor een platformteam van 200 man; die organisatie heeft een andere blauwdruk nodig. Een mens-in-de-lus die de output niet mag afkeuren, is slechts decoratie.

The Multi-Agent Organization is het boek. De introductie leert je de zes vaardigheden in detail. Deze pagina gaat alleen over de kloof: waarom het team trager werd, en welke ontbrekende vaardigheid daar de oorzaak van was.

Als je eerst één driehoek installeert, installeer dan deze.

  • Dag 1–30. Geef elke rol een charter, de duurste het eerst.
  • Dag 31–60. Eén echte review-poort.
  • Dag 61–90. Eén wekelijkse sync die geen standup-rondleiding is.

Voeg daarna pas agents toe, niet eerder. Een SENSE-laag gaat een team dat geen werk over een grens kan overdragen niet redden. Een MCP-contract redt een team zonder reviewer niet. Vul de charter in voordat je de vierde agent toevoegt.

Begrippen

Bronnen

  1. CHORUS framework
  2. The Multi-Agent Organization
  3. Agent-orkestratie (begrippen)
  4. Why Do Multi-Agent LLM Systems Fail? · Cemri, Pan, Jun, et al. (arXiv 2503.13657v3; NeurIPS 2025 Datasets and Benchmarks)

Verder lezen

Markdown voor LLMs