---
title: "Evalueer LLM-redenering, niet vloeiendheid | Len P. van der Hof"
description: "Een vloeiend antwoord is het goedkoopste wat een model produceert. Beoordeel het spoor: wat is er opgehaald, wat is er aangenomen, en hoe zeker mag je zijn voordat je het in een besluit plakt."
image: "https://lenvanderhof.com/media/generated/blog-hero-fluency-nl-v2.e21b412aed30.wide.webp"
---

[AI-systemen](https://lenvanderhof.com/nl/blog/categorie/ai-systemen/) Onderzoeksartikel

# Evalueer de redenering, niet de vloeiendheid

Een vloeiend antwoord is geen beoordeeld antwoord. Beoordeel het spoor voordat je de zin vertrouwt.

Len P. van der HofGepubliceerd 21 augustus 2026Bijgewerkt 27 augustus 20265 min. leestijd

Beoordeel het spoor. Niet de krul.

Direct antwoord

Vloeiendheid is geen bewijs. Een taalmodel kan een keurige alinea teruggeven met een verzonnen getal, een blogpost die als onderzoek wordt geciteerd, of met een stalen gezicht de verkeerde chunk ophalen. De redenering evalueren betekent het spoor beoordelen: welke bronnen zijn verzameld, of je de passage kunt benoemen, welke aanname dragend is, en hoe sterk de bewering mag zijn. CALIBRATE is die afstemming van zekerheid op bewijs. GRAIN is de retrieval-lus die een antwoord vasthoudt aan een chunk die je kunt aanwijzen. Als je beide niet kunt inspecteren, heb je geen evaluatie. Je hebt een sfeerbeeld.

## Belangrijkste inzichten

- Beoordeel de keten, niet het proza. Als je de stappen niet kunt afspelen, kun je het antwoord niet cijferen.
- CALIBRATE: zekerheid is een rapport tegenover bewijs, geen toon.
- GRAIN: als je de chunk niet kunt benoemen, heb je een vloeiende gok, geen retrieval.
- De gekalibreerde geest is live. De RAG-engineer is live. De lussen zijn al bruikbaar. Deze pagina is geen productclaim voor ReasonKit.

Je vraagt het model om de marktomvang te bepalen, een regel te checken of een paper samen te vatten. Wat je terugkrijgt is een strakke alinea. Je plakt hem direct in je deck. Drie weken later blijkt een cijfer verzonnen, was een “toonaangevende studie” slechts een blogpost, en schoof een deal op basis van bewijs dat nooit heeft bestaan. De output was niet onderzocht. Het was gewoon vloeiend. Vloeiendheid is tegenwoordig het allergoedkoopste wat een model kan produceren.

## Score de trace

Redeneringen evalueren betekent niet vragen: “Klinkt dit logisch?” Met die vraag beoordeel je puur het proza. En het proza is slechts de laatste mijl.

Een gescoorde trace beantwoordt vier goedkopere vragen.

1. **Wat is er verzameld?** Benoemde bronnen, of een vibe uit de pretraining.
2. **Wat is er opgehaald?** Een passage waar je letterlijk naar kunt wijzen, of extra context die simpelweg in een prompt is gepropt.
3. **Wat is er aangenomen?** De dragende aanname. Als die onjuist is, stort de hele alinea in.
4. **Hoe zeker mag je eigenlijk zijn?** Een getal dat je bereid bent te verdedigen, niet zomaar een tone of voice.

Als je die vier stappen niet kunt naspelen, kun je het antwoord niet beoordelen. Je kunt het hooguit mooi geformuleerd vinden.

Dit is dezelfde scheidslijn als die tussen [een agent versus een automatisering](https://lenvanderhof.com/nl/blog/wat-is-een-ai-agent/). Een script loopt stuk op een specifieke node die jij hebt aangewezen. Een vloeiende gok faalt midden in een zin die je zojuist nog bewonderde.

Verwar deze Evaluate niet met de Evaluate-stap in [SENSE](https://lenvanderhof.com/nl/frameworks/sense/). SENSE Evaluate transformeert een marktsignaal in een onderbouwde claim voor de maandagmeeting. Deze pagina scoort puur de keten van een model, lang voordat je die claim überhaupt in het register toelaat.

## Een vloeiende misser die je kunt naspelen

De alinea luidde: “De enterprise-adoptie ligt al boven de 70 procent, volgens een recente toonaangevende studie.” Het las vlot. Er stond zelfs een perfect geplaatste komma in.

De trace, mocht iemand de moeite hebben genomen om ernaar te vragen:

- Verzameld: niets wat je hard kunt maken. Geen URL. Geen PDF. Geen tabel.
- Opgehaald: niets. Er was helemaal geen chunk.
- Aangenomen: dat een rond getal plus het label “toonaangevende studie” telt als een CITATION.
- Gerechtvaardigde zekerheid: nul, aangezien de tweede regel leeg is.

De fix is hier niet het zoeken naar een beter bijvoeglijk naamwoord. Schrijf de claim op, het bewijs, en het percentage dat je zou inzetten. Als de tweede regel leeg blijft, gaat de zin simpelweg niet live. Dat is de essentie van [CALIBRATE](https://lenvanderhof.com/nl/begrippen/calibrate/), toegepast op een copy-paste actie, niet als een of andere les in persoonlijkheid.

## CALIBRATE: zekerheid is een rapportage

CALIBRATE is de praktijk waarbij je de hardheid van een oordeel direct koppelt aan de hardheid van het bewijs, om je standpunt vervolgens te updaten zodra de feiten verschuiven. Zekerheid is een rapportage, geen karaktertrek.

Pas dit meedogenloos toe op het model *en* op jezelf.

Het model zal altijd heel zeker overkomen. Dat is een weergavekeuze. Het is geen waarschijnlijkheid.

Jij zult je ook zeker voelen, simpelweg omdat de alinea zo strak in elkaar zit. Dat gevoel is de zekerheidsvalkuil: een binaire ‘ja’ verkleed als een volzin. [De gekalibreerde geest](https://lenvanderhof.com/boeken/the-calibrated-mind/) is het boek dat juist de menselijke kant hiervan traint. De Engelse en de Nederlandse editie zijn nu verkrijgbaar. De test op deze pagina kun je nu al inzetten.

Schrijf de claim op één regel. Schrijf het bewijs op één regel. Noteer een percentage dat je er echt onder zou durven verwedden. Kun je die tweede regel niet invullen, dan is de eerste regel geen oordeel. Dan is het slechts een stemming.

Een voorspellingslogboek is de scorecard die weigert te liegen. Je geheugen zal dat gevoel van zekerheid achteraf altijd verdedigen. Je logboek doet dat niet.

## GRAIN: benoem de chunk

Als het antwoord afhing van jouw eigen bestanden, jouw web of een corpus, dan is vloeiendheid het verkeerde instrument.

[RAG](https://lenvanderhof.com/nl/begrippen/rag/) houdt in dat het model specifieke, benoemde passages moet ophalen voordat het überhaupt een antwoord formuleert. De retrieval is het daadwerkelijke product. De generatie is slechts de laatste mijl. Als je niet kunt inspecteren welke chunk is gebruikt, draai je geen RAG. Dan heb je simpelweg een taalmodel met extra context.

[GRAIN](https://lenvanderhof.com/nl/begrippen/grain/) vormt de loop: Gather, Rank, Assemble, Inspect, Navigate. Een antwoord blijft onlosmakelijk verbonden aan een chunk die je bij naam kunt noemen. [De RAG-engineer](https://lenvanderhof.com/boeken/the-rag-engineer/) is het boek hierover. Het is nu verkrijgbaar. De loop zelf is nu al de test.

Vraag degene die “even RAG heeft toegevoegd” maar eens om één slecht antwoord met je door te lopen.

- Welke passage werd er verzameld?
- Waarom scoorde deze hoog in de ranking?
- Wat is er precies omheen geassembleerd?
- Heeft iemand een foute output geïnspecteerd, of keken we alleen naar een demo?
- Waarnaar zou je als volgende stap navigeren?

Als deze regels leeg blijven, stop dan direct met discussiëren over embeddings. Je bent simpelweg een symptoom aan het finetunen.

## Waar de andere twee boeken voor zijn

[ML for Strategic Founders](https://lenvanderhof.com/boeken/ml-for-strategic-founders/) draait om de aangrenzende basiskennis: hoe je een model dat directe impact heeft op omzet of reputatie strak afbakent en audit, zonder dat je zelf moet transformeren tot data scientist. SIGNAL is die specifieke loop. Het is in productie. Gebruik het wanneer de hamvraag luidt “mag dit model wel aan het stuur zitten bij deze beslissing”, in plaats van “las die alinea een beetje lekker”.

[The Judgement Gym](https://lenvanderhof.com/boeken/the-judgement-gym/) vertegenwoordigt de trainingskant. REPS is een protocol om keihard vast te houden aan je eigen conclusie, in een tijd waarin analyse steeds goedkoper wordt. Het is in design. Zet het in wanneer de verleiding ontstaat om de *beoordeling* te delegeren, puur omdat het *proza* in vier seconden op je scherm stond.

Niets van dit alles is een ReasonKit benchmark. Deze site gaat er ook geen verzinnen.

## Een audit van tien minuten

Neem het laatste antwoord van een model dat je vol overtuiging hebt vertrouwd.

OnderstreepBron of “onbekend”Chunk in acht woordenGerechtvaardigde zekerheidWat zou dit 20 punten laten verschuiveneerste getaleerste causale werkwoordeerste eigennaam

Onbekende variabelen die alsnog de eindstreep hebben gehaald, vormen je defect. Vloeiendheid was het rookgordijn dat ze verborg. Het volgende antwoord dat je daadwerkelijk behoudt, is degene die deze lijst overleeft.

[CALIBRATE](https://lenvanderhof.com/nl/begrippen/calibrate/) en [GRAIN](https://lenvanderhof.com/nl/begrippen/grain/) zijn de namen. De audit is het harde werk. De boeken volgen vanzelf.

## Begrippen

- [CALIBRATE](https://lenvanderhof.com/nl/begrippen/calibrate/)
- [GRAIN](https://lenvanderhof.com/nl/begrippen/grain/)
- [RAG](https://lenvanderhof.com/nl/begrippen/rag/)

## Bronnen

1. [CALIBRATE (begrippenlijst)](https://lenvanderhof.com/nl/begrippen/calibrate/)
2. [GRAIN (begrippenlijst)](https://lenvanderhof.com/nl/begrippen/grain/)
3. [RAG (begrippenlijst)](https://lenvanderhof.com/nl/begrippen/rag/)
4. [De gekalibreerde geest](https://lenvanderhof.com/boeken/the-calibrated-mind/)
5. [De RAG-engineer](https://lenvanderhof.com/boeken/the-rag-engineer/)
6. [TRACE (begrippenlijst)](https://lenvanderhof.com/nl/begrippen/trace/)
7. [De geverifieerde research-loop](https://lenvanderhof.com/boeken/the-verified-research-loop/)
8. [ML voor Strategische Oprichters](https://lenvanderhof.com/boeken/ml-for-strategic-founders/)
9. [De Oordeels-Gym](https://lenvanderhof.com/boeken/the-judgement-gym/)

## Verwante essays

- [Kalibratie betekenis: vertrouwen afstemmen op bewijs](https://lenvanderhof.com/nl/blog/kalibratie-betekenis/)
- [Wat is RAG? Eerst ophalen, dan genereren](https://lenvanderhof.com/nl/blog/wat-is-rag/)

## Verder lezen

- [CALIBRATE](https://lenvanderhof.com/nl/begrippen/calibrate/)
- [GRAIN](https://lenvanderhof.com/nl/begrippen/grain/)
- [RAG](https://lenvanderhof.com/nl/begrippen/rag/)
- [De gekalibreerde geest](https://lenvanderhof.com/boeken/the-calibrated-mind/)
- [De RAG-engineer](https://lenvanderhof.com/boeken/the-rag-engineer/)
- [TRACE](https://lenvanderhof.com/nl/begrippen/trace/)
- [De geverifieerde research-loop](https://lenvanderhof.com/boeken/the-verified-research-loop/)
- [Wat is een AI-agent?](https://lenvanderhof.com/nl/blog/wat-is-een-ai-agent/)

Over de auteur

## [Len P. van der Hof](https://lenvanderhof.com/nl/auteurs/len-p-van-der-hof/)

Ondernemer, AI-innovator en venture builder

Len P. van der Hof bouwt praktische AI-systemen, digitale ventures en evidence-informed hulpmiddelen voor founders.

```json
{
	"@context": "https://schema.org",
	"@graph": [
		{
			"@type": "Person",
			"@id": "https://lenvanderhof.com/#person",
			"name": "Len P. van der Hof",
			"alternateName": [
				"Len van der Hof",
				"L.P. van der Hof",
				"Leendert Pieter van der Hof"
			],
			"honorificSuffix": "MSc",
			"url": "https://lenvanderhof.com/",
			"image": [
				"https://lenvanderhof.com/photos/len-portrait-1.jpg",
				"https://lenvanderhof.com/photos/len-portrait-2.jpg",
				"https://lenvanderhof.com/photos/len-portrait-3.jpg",
				"https://lenvanderhof.com/photos/len-portrait-4.jpg",
				"https://lenvanderhof.com/photos/len-speaking.jpg",
				"https://lenvanderhof.com/photos/len-hero.jpg"
			],
			"jobTitle": "Ondernemer, AI-innovator en venture builder",
			"description": "Len P. van der Hof is een Nederlandse ondernemer en AI-innovator die ReasonKit, MindSesh, Undominated.ai, het fictie-imprint LPH98.lifestyle en technologieventures bouwt via LPH98.ventures.",
			"address": {
				"@type": "PostalAddress",
				"addressLocality": "Zwijndrecht",
				"addressCountry": "NL"
			},
			"alumniOf": {
				"@type": "CollegeOrUniversity",
				"name": "Rotterdam School of Management, Erasmus University"
			},
			"knowsAbout": [
				"Artificial intelligence",
				"AI agents",
				"Agentic AI systems",
				"LLM routing",
				"SEO",
				"Generative engine optimization",
				"Answer engine optimization",
				"Venture building",
				"Founder performance",
				"Founder psychology",
				"Evidence-based decision-making"
			],
			"sameAs": [
				"https://www.linkedin.com/in/lenvanderhof/",
				"https://x.com/LenvanderHof",
				"https://www.youtube.com/channel/UCTG20buKqYYbitqqf7l3zJA",
				"https://www.instagram.com/Lenvanderhof/",
				"https://www.threads.com/@lenvanderhof",
				"https://github.com/Lenvanderhof",
				"https://huggingface.co/LPH98",
				"https://www.npmjs.com/~lenvanderhof",
				"https://www.goodreads.com/author/show/70983905.Len_P_van_der_Hof",
				"https://www.amazon.com/author/lenvanderhof",
				"https://www.bol.com/nl/nl/b/len-p-van-der-hof-msc/609879394/",
				"https://bsky.app/profile/lenvanderhof.com",
				"https://mastodon.social/@Lenvanderhof",
				"https://crates.io/users/Lenvanderhof",
				"https://cursor.com/@Lenvanderhof",
				"https://medium.com/@Lenvanderhof",
				"https://gitlab.com/Lenvanderhof",
				"https://hub.docker.com/u/lenvanderhof/",
				"https://dev.to/lenvanderhof",
				"https://www.facebook.com/Lenvanderhof",
				"https://soundcloud.com/Lenvanderhof"
			],
			"affiliation": [
				{
					"@id": "https://lenvanderhof.com/#publisher"
				},
				{
					"@id": "https://lenvanderhof.com/#mindsesh"
				},
				{
					"@id": "https://lenvanderhof.com/#lifestyle"
				}
			]
		},
		{
			"@type": "WebSite",
			"@id": "https://lenvanderhof.com/#website",
			"url": "https://lenvanderhof.com/",
			"name": "Len P. van der Hof",
			"description": "Len P. van der Hof is een Nederlandse ondernemer en AI-innovator die ReasonKit, MindSesh, Undominated.ai, het fictie-imprint LPH98.lifestyle en technologieventures bouwt via LPH98.ventures.",
			"inLanguage": [
				"en",
				"nl"
			],
			"publisher": {
				"@id": "https://lenvanderhof.com/#person"
			}
		},
		{
			"@type": "Organization",
			"@id": "https://lenvanderhof.com/#publisher",
			"name": "LPH98.ventures",
			"url": "https://lph98.ventures",
			"founder": {
				"@id": "https://lenvanderhof.com/#person"
			}
		},
		{
			"@type": "Organization",
			"@id": "https://lenvanderhof.com/#mindsesh",
			"name": "MindSesh",
			"url": "https://mindsesh.net",
			"founder": {
				"@id": "https://lenvanderhof.com/#person"
			}
		},
		{
			"@type": "SoftwareApplication",
			"@id": "https://lenvanderhof.com/#reasonkit",
			"name": "ReasonKit",
			"url": "https://reasonkit.sh",
			"creator": {
				"@id": "https://lenvanderhof.com/#person"
			}
		},
		{
			"@type": "SoftwareApplication",
			"@id": "https://lenvanderhof.com/#undominated",
			"name": "Undominated.ai",
			"url": "https://undominated.ai",
			"creator": {
				"@id": "https://lenvanderhof.com/#person"
			}
		},
		{
			"@type": "Organization",
			"@id": "https://lenvanderhof.com/#lifestyle",
			"name": "LPH98.lifestyle",
			"url": "https://lph98.lifestyle",
			"founder": {
				"@id": "https://lenvanderhof.com/#person"
			}
		},
		{
			"@type": "ImageObject",
			"@id": "https://lenvanderhof.com/nl/blog/evalueer-de-redenering-niet-de-vloeiendheid/#primaryimage",
			"url": "https://lenvanderhof.com/media/generated/blog-hero-fluency-nl-v2.e21b412aed30.wide.webp",
			"contentUrl": "https://lenvanderhof.com/media/generated/blog-hero-fluency-nl-v2.e21b412aed30.wide.webp",
			"representativeOfPage": true
		},
		{
			"@type": "BreadcrumbList",
			"@id": "https://lenvanderhof.com/nl/blog/evalueer-de-redenering-niet-de-vloeiendheid/#breadcrumb",
			"itemListElement": [
				{
					"@type": "ListItem",
					"position": 1,
					"name": "Home",
					"item": "https://lenvanderhof.com/nl/"
				},
				{
					"@type": "ListItem",
					"position": 2,
					"name": "Blog",
					"item": "https://lenvanderhof.com/nl/blog/"
				},
				{
					"@type": "ListItem",
					"position": 3,
					"name": "AI-systemen",
					"item": "https://lenvanderhof.com/nl/blog/categorie/ai-systemen/"
				},
				{
					"@type": "ListItem",
					"position": 4,
					"name": "Evalueer de redenering, niet de vloeiendheid",
					"item": "https://lenvanderhof.com/nl/blog/evalueer-de-redenering-niet-de-vloeiendheid/"
				}
			]
		},
		{
			"@type": "WebPage",
			"@id": "https://lenvanderhof.com/nl/blog/evalueer-de-redenering-niet-de-vloeiendheid/#webpage",
			"url": "https://lenvanderhof.com/nl/blog/evalueer-de-redenering-niet-de-vloeiendheid/",
			"name": "Evalueer de redenering, niet de vloeiendheid",
			"description": "Een vloeiend antwoord is het goedkoopste wat een model produceert. Beoordeel het spoor: wat is er opgehaald, wat is er aangenomen, en hoe zeker mag je zijn voordat je het in een besluit plakt.",
			"isPartOf": {
				"@id": "https://lenvanderhof.com/#website"
			},
			"primaryImageOfPage": {
				"@id": "https://lenvanderhof.com/nl/blog/evalueer-de-redenering-niet-de-vloeiendheid/#primaryimage"
			},
			"breadcrumb": {
				"@id": "https://lenvanderhof.com/nl/blog/evalueer-de-redenering-niet-de-vloeiendheid/#breadcrumb"
			},
			"inLanguage": "nl-NL"
		},
		{
			"@type": "BlogPosting",
			"@id": "https://lenvanderhof.com/nl/blog/evalueer-de-redenering-niet-de-vloeiendheid/#article",
			"mainEntityOfPage": {
				"@id": "https://lenvanderhof.com/nl/blog/evalueer-de-redenering-niet-de-vloeiendheid/#webpage"
			},
			"headline": "Evalueer de redenering, niet de vloeiendheid",
			"description": "Een vloeiend antwoord is het goedkoopste wat een model produceert. Beoordeel het spoor: wat is er opgehaald, wat is er aangenomen, en hoe zeker mag je zijn voordat je het in een besluit plakt.",
			"datePublished": "2026-08-21T09:05:00.000Z",
			"dateModified": "2026-08-27T19:52:00.000Z",
			"author": {
				"@id": "https://lenvanderhof.com/#person"
			},
			"publisher": {
				"@id": "https://lenvanderhof.com/#person"
			},
			"image": [
				"https://lenvanderhof.com/media/generated/blog-hero-fluency-nl-v2.e21b412aed30.square.webp",
				"https://lenvanderhof.com/media/generated/blog-hero-fluency-nl-v2.e21b412aed30.landscape.webp",
				"https://lenvanderhof.com/media/generated/blog-hero-fluency-nl-v2.e21b412aed30.wide.webp"
			],
			"articleSection": "AI-systemen",
			"inLanguage": "nl-NL"
		}
	]
}
```
