Je vraagt het model om de marktomvang te bepalen, een regel te checken of een paper samen te vatten. Wat je terugkrijgt is een strakke alinea. Je plakt hem direct in je deck. Drie weken later blijkt een cijfer verzonnen, was een “toonaangevende studie” slechts een blogpost, en schoof een deal op basis van bewijs dat nooit heeft bestaan. De output was niet onderzocht. Het was gewoon vloeiend. Vloeiendheid is tegenwoordig het allergoedkoopste wat een model kan produceren.
Score de trace
Redeneringen evalueren betekent niet vragen: “Klinkt dit logisch?” Met die vraag beoordeel je puur het proza. En het proza is slechts de laatste mijl.
Een gescoorde trace beantwoordt vier goedkopere vragen.
- Wat is er verzameld? Benoemde bronnen, of een vibe uit de pretraining.
- Wat is er opgehaald? Een passage waar je letterlijk naar kunt wijzen, of extra context die simpelweg in een prompt is gepropt.
- Wat is er aangenomen? De dragende aanname. Als die onjuist is, stort de hele alinea in.
- Hoe zeker mag je eigenlijk zijn? Een getal dat je bereid bent te verdedigen, niet zomaar een tone of voice.
Als je die vier stappen niet kunt naspelen, kun je het antwoord niet beoordelen. Je kunt het hooguit mooi geformuleerd vinden.
Dit is dezelfde scheidslijn als die tussen een agent versus een automatisering. Een script loopt stuk op een specifieke node die jij hebt aangewezen. Een vloeiende gok faalt midden in een zin die je zojuist nog bewonderde.
Verwar deze Evaluate niet met de Evaluate-stap in SENSE. SENSE Evaluate transformeert een marktsignaal in een onderbouwde claim voor de maandagmeeting. Deze pagina scoort puur de keten van een model, lang voordat je die claim überhaupt in het register toelaat.
Een vloeiende misser die je kunt naspelen
De alinea luidde: “De enterprise-adoptie ligt al boven de 70 procent, volgens een recente toonaangevende studie.” Het las vlot. Er stond zelfs een perfect geplaatste komma in.
De trace, mocht iemand de moeite hebben genomen om ernaar te vragen:
- Verzameld: niets wat je hard kunt maken. Geen URL. Geen PDF. Geen tabel.
- Opgehaald: niets. Er was helemaal geen chunk.
- Aangenomen: dat een rond getal plus het label “toonaangevende studie” telt als een CITATION.
- Gerechtvaardigde zekerheid: nul, aangezien de tweede regel leeg is.
De fix is hier niet het zoeken naar een beter bijvoeglijk naamwoord. Schrijf de claim op, het bewijs, en het percentage dat je zou inzetten. Als de tweede regel leeg blijft, gaat de zin simpelweg niet live. Dat is de essentie van CALIBRATE, toegepast op een copy-paste actie, niet als een of andere les in persoonlijkheid.
CALIBRATE: zekerheid is een rapportage
CALIBRATE is de praktijk waarbij je de hardheid van een oordeel direct koppelt aan de hardheid van het bewijs, om je standpunt vervolgens te updaten zodra de feiten verschuiven. Zekerheid is een rapportage, geen karaktertrek.
Pas dit meedogenloos toe op het model en op jezelf.
Het model zal altijd heel zeker overkomen. Dat is een weergavekeuze. Het is geen waarschijnlijkheid.
Jij zult je ook zeker voelen, simpelweg omdat de alinea zo strak in elkaar zit. Dat gevoel is de zekerheidsvalkuil: een binaire ‘ja’ verkleed als een volzin. De gekalibreerde geest is het boek dat juist de menselijke kant hiervan traint. De Engelse en de Nederlandse editie zijn nu verkrijgbaar. De test op deze pagina kun je nu al inzetten.
Schrijf de claim op één regel. Schrijf het bewijs op één regel. Noteer een percentage dat je er echt onder zou durven verwedden. Kun je die tweede regel niet invullen, dan is de eerste regel geen oordeel. Dan is het slechts een stemming.
Een voorspellingslogboek is de scorecard die weigert te liegen. Je geheugen zal dat gevoel van zekerheid achteraf altijd verdedigen. Je logboek doet dat niet.
GRAIN: benoem de chunk
Als het antwoord afhing van jouw eigen bestanden, jouw web of een corpus, dan is vloeiendheid het verkeerde instrument.
RAG houdt in dat het model specifieke, benoemde passages moet ophalen voordat het überhaupt een antwoord formuleert. De retrieval is het daadwerkelijke product. De generatie is slechts de laatste mijl. Als je niet kunt inspecteren welke chunk is gebruikt, draai je geen RAG. Dan heb je simpelweg een taalmodel met extra context.
GRAIN vormt de loop: Gather, Rank, Assemble, Inspect, Navigate. Een antwoord blijft onlosmakelijk verbonden aan een chunk die je bij naam kunt noemen. The RAG Engineer is het boek hierover. Het is in productie. De loop zelf is nu al de test.
Vraag degene die “even RAG heeft toegevoegd” maar eens om één slecht antwoord met je door te lopen.
- Welke passage werd er verzameld?
- Waarom scoorde deze hoog in de ranking?
- Wat is er precies omheen geassembleerd?
- Heeft iemand een foute output geïnspecteerd, of keken we alleen naar een demo?
- Waarnaar zou je als volgende stap navigeren?
Als deze regels leeg blijven, stop dan direct met discussiëren over embeddings. Je bent simpelweg een symptoom aan het finetunen.
Waar de andere twee boeken voor zijn
ML for Strategic Founders draait om de aangrenzende basiskennis: hoe je een model dat directe impact heeft op omzet of reputatie strak afbakent en audit, zonder dat je zelf moet transformeren tot data scientist. SIGNAL is die specifieke loop. Het is in productie. Gebruik het wanneer de hamvraag luidt “mag dit model wel aan het stuur zitten bij deze beslissing”, in plaats van “las die alinea een beetje lekker”.
The Judgement Gym vertegenwoordigt de trainingskant. REPS is een protocol om keihard vast te houden aan je eigen conclusie, in een tijd waarin analyse steeds goedkoper wordt. Het is in design. Zet het in wanneer de verleiding ontstaat om de beoordeling te delegeren, puur omdat het proza in vier seconden op je scherm stond.
Niets van dit alles is een ReasonKit benchmark. Deze site gaat er ook geen verzinnen.
Een audit van tien minuten
Neem het laatste antwoord van een model dat je vol overtuiging hebt vertrouwd.
| Onderstreep | Bron of “onbekend” | Chunk in acht woorden | Gerechtvaardigde zekerheid | Wat zou dit 20 punten laten verschuiven |
|---|---|---|---|---|
| eerste getal | ||||
| eerste causale werkwoord | ||||
| eerste eigennaam |
Onbekende variabelen die alsnog de eindstreep hebben gehaald, vormen je defect. Vloeiendheid was het rookgordijn dat ze verborg. Het volgende antwoord dat je daadwerkelijk behoudt, is degene die deze lijst overleeft.
CALIBRATE en GRAIN zijn de namen. De audit is het harde werk. De boeken volgen vanzelf.