Begrip · uitleg zonder jargon

RAG (retrieval-augmented generation): wat het is en wanneer u het tegenkomt.

RAG (retrieval-augmented generation) is een techniek waarbij een taalmodel vóór het antwoorden eerst relevante stukken tekst opzoekt in een eigen bronbestand, zoals documenten, handleidingen of een kennisbank, en die als context meekrijgt. Het antwoord is daardoor gebaseerd op actuele, controleerbare bedrijfsinformatie in plaats van alleen op wat het model tijdens de training heeft geleerd.

Ook wel: retrieval-augmented generation, retrieval augmented generation, grounding, zoeken plus genereren.

5,0 uit 17 Google-reviews In de praktijk: Context Engineering Bijgewerkt op 28 september 2026

Door Saif Waleed Ibrahim, oprichter NEXTRIQ · 6× Anthropic-gecertificeerd · Bijgewerkt 28 september 2026

Uitleg

RAG in de praktijk.

Hoe werkt RAG in de praktijk?

Een RAG-systeem bestaat uit twee fasen. In de voorbereidingsfase worden documenten opgeknipt in stukken (chunks), omgezet in embeddings (getallenreeksen die de betekenis vastleggen) en opgeslagen in een vector database of een gewone database met vectorondersteuning, zoals Postgres met pgvector. In de antwoordfase wordt de vraag van de gebruiker op dezelfde manier omgezet, worden de stukken met de meest vergelijkbare betekenis opgehaald en worden die samen met de vraag aan het taalmodel gegeven. Het model formuleert het antwoord op basis van die stukken en kan verwijzen naar de bron. Moderne systemen combineren vectorzoeken met klassiek trefwoordzoeken (hybride zoeken) en laten een tweede model de gevonden stukken herordenen (reranking), omdat de eerste zoekronde vaak ruis bevat. De techniek is in 2020 beschreven door onderzoekers van Facebook AI Research en is sindsdien de standaardaanpak om bedrijfskennis aan taalmodellen te koppelen.

Wanneer is RAG beter dan fine-tuning?

Fine-tuning past het model zelf aan met extra trainingsdata. Dat is nuttig om een stijl, een vast uitvoerformaat of een specifieke taak aan te leren, maar het is duur, traag en de kennis veroudert zodra uw documenten veranderen. RAG laat het model ongemoeid en verandert alleen wat het te lezen krijgt. Nieuwe prijslijst? Vervang het document en het antwoord is direct actueel. RAG maakt bovendien zichtbaar waarop een antwoord is gebaseerd, wat voor controle en aansprakelijkheid belangrijk is. Fine-tuning heeft de voorkeur als het gaat om gedrag dat u niet in documenten kunt uitleggen, zoals een huisstijl die alleen uit duizenden voorbeelden te leren is. In de meeste mkb-situaties is RAG de eerste keuze. De grote contextvensters van moderne modellen maken RAG niet overbodig: honderden documenten passen nog steeds niet in één aanroep, en gerichte selectie houdt de kosten en de kwaliteit in de hand.

Wat zijn de valkuilen van RAG?

De kwaliteit van een RAG-systeem wordt bepaald door het zoeken, niet door het model. Slecht opgeknipte documenten, ontbrekende metadata of verouderde bestanden leiden tot antwoorden die keurig geformuleerd maar inhoudelijk fout zijn. Een tweede valkuil is autorisatie: als de vector database geen rekening houdt met wie wat mag zien, kan een medewerker via de assistent informatie ophalen die hij in het bronsysteem niet zou krijgen. Ten derde blijft hallucinatie mogelijk: het model kan de gevonden stukken verkeerd samenvatten of aanvullen met eigen aannames. Daarom hoort bij een serieuze implementatie een testset met echte vragen en goedgekeurde antwoorden, waarmee u meet hoe vaak het systeem het juiste stuk vindt en correct verwoordt. Ook het beheer van de bronnen verdient een eigenaar: wie werkt de documenten bij, en wanneer wordt de index opnieuw opgebouwd?

Voorbeeld

Zo ziet het eruit in een mkb-bedrijf.

Uit de praktijk

Een accountantskantoor krijgt van klanten steeds dezelfde vragen over btw-regels, deadlines en de eigen werkwijze. Met een RAG-assistent op de interne kennisbank, de procedurebeschrijvingen en de actuele belastingpublicaties kan een medewerker een vraag intypen en krijgt hij een antwoord met verwijzing naar de bron. De assistent gebruikt alleen documenten waartoe die medewerker toegang heeft en geeft aan wanneer hij geen passende bron vindt, zodat de vraag naar een collega gaat. Als een regeling wijzigt, wordt het bijbehorende document vervangen en is het antwoord direct actueel. U bespaart zoektijd en voorkomt dat verschillende medewerkers verschillende antwoorden geven, terwijl de eindverantwoordelijkheid bij de accountant blijft.

Wilt u dit toepassen? Kijk bij Context Engineering of plan een gratis gesprek.

Veelgestelde vragen

Vragen over RAG.

Wat is RAG in eenvoudige woorden?

RAG betekent dat een AI-assistent eerst in uw eigen documenten zoekt en pas daarna antwoordt. Vergelijk het met een medewerker die een vraag krijgt, het juiste dossier pakt en op basis daarvan antwoord geeft, in plaats van uit zijn hoofd te praten. Het model blijft hetzelfde; alleen de informatie die het te lezen krijgt komt uit uw bronnen. Daardoor is het antwoord actueel en controleerbaar.

Wanneer heeft mijn bedrijf RAG nodig?

RAG is zinvol zodra u wilt dat een AI-toepassing antwoordt op basis van uw eigen informatie: handleidingen, contracten, productdata, procedures of eerdere correspondentie. Een algemeen model kent die informatie niet. Als de vragen alleen over algemene kennis gaan, is RAG overbodig. Verandert uw informatie regelmatig of moet u kunnen aantonen waarop een antwoord is gebaseerd, dan is RAG vrijwel altijd de juiste aanpak.

Blijven mijn documenten privé bij RAG?

Dat hangt af van de inrichting. De documenten staan in een database die u zelf beheert of in de EU laat hosten, en alleen de relevante stukken worden per vraag naar het taalmodel gestuurd. Bij de zakelijke API's van Anthropic, OpenAI en Google worden die gegevens volgens hun voorwaarden niet gebruikt voor training. Wel moet u vastleggen welke documenten voor welke medewerkers zichtbaar zijn en dat in de zoekstap afdwingen.

Wat kost een RAG-oplossing?

De kosten bestaan uit de bouw (documenten verwerken, zoeken inrichten, koppelen aan uw systemen en testen) en het gebruik (opslag, embeddings en modelaanroepen per vraag). Het gebruik is doorgaans beperkt, omdat per vraag slechts enkele tekstfragmenten naar het model gaan. De bouw hangt af van het aantal bronnen en de eisen aan autorisatie. U krijgt een vaste prijs na een gratis gesprek waarin de bronnen en het doel worden doorgenomen.

Wilt u weten wat dit voor uw bedrijf betekent? Eén gesprek van twintig minuten.

We kijken samen naar uw situatie en zeggen eerlijk of dit begrip voor u relevant is. Daarna ontvangt u, als u verder wilt, een vaste prijs.

Verder lezen

Gerelateerd

Gratis & vrijblijvend
Zie je score in Google én AI
Start