Mensen zoeken op “wat is RAG” nadat een leverancier de letters in een presentatie als product heeft neergezet. De afkorting staat voor retrieval-augmented generation. De test in de praktijk is een stuk minder mooi en goedkoper dan de slide.
Wat is RAG? Het model moet benoemde passages ophalen voordat het antwoordt. Het ophalen (retrieval) is het product. Generatie is slechts de laatste stap. Als je niet kunt inzien welke chunk is gebruikt, heb je geen RAG. Je hebt extra context in een prompt.
Niet “het model heeft onze documenten gelezen”
Een PDF in het context window proppen is geen retrieval. Een vector store is een onderdeel. Embeddings zijn een onderdeel. Het systeem ontstaat pas wanneer je de passage kunt benoemen.
Loop een slecht antwoord eens na.
- Welke passage is verzameld?
- Waarom scoorde deze hoog voor de gestelde vraag?
- Wat is eromheen gebouwd?
- Heeft er iemand naar een misser gekeken, of alleen naar een demo?
- Waar zou je hierna naartoe navigeren?
Als die regels leeg blijven, kun je stoppen met discussiëren over de grootte van een chunk. Je hebt generatie opgeleverd.
RAG en GRAIN
GRAIN is de controleerbare loop: Gather, Rank, Assemble, Inspect, Navigate. RAG is de naam van de architectuur. GRAIN is de naam van de eerlijkheidscheck. Het zijn niet dezelfde woorden.
Evalueer de redenering, niet de vloeiendheid is de test die je ernaast legt als de zin netjes klinkt maar de bron ontbreekt. Vloeiendheid is goedkoop. Een benoemde chunk is dat niet.
Het boek en de pagina
The RAG Engineer bevat de uitgebreidere praktijk. Het boek is in productie. Het is niet te koop. Je hebt de hardcover niet nodig om de chunk te eisen.
Als het team de passage achter de zin niet kan openen, noem het dan geen RAG. Noem het een prompt met wat extra’s.