Prompt engineering in 2026: van gokwerk naar vaste testcyclus
Ontwerp, test en beheer prompts op basis van succescriteria en representatieve evaluaties. Verbeter één onderdeel per ronde en houd productieprompts versieerbaar.
Prompt engineering is een testcyclus voor AI-gedrag, geen zoektocht naar magische woorden. Definieer eerst wat goed is, test een eenvoudige baseline op echte gevallen en wijzig daarna één onderdeel per ronde.
Prompt engineering en een goede losse prompt
De gids goede prompts maken helpt je één opdracht helder formuleren. Prompt engineering gaat verder: je beheert een herhaalbare taak met succescriteria, testgevallen, versies en een gecontroleerde uitrol.
Anthropic noemt in het prompt engineering-overzicht drie voorwaarden voordat je gaat optimaliseren: duidelijke succescriteria, een manier om die empirisch te testen en een eerste prompt. De OpenAI-documentatie legt daarnaast nadruk op duidelijke instructiehiërarchie, voorbeelden, relevante context en versieerbare productieprompts.
Het basismodel
Een onderhoudbare prompt heeft herkenbare onderdelen:
Doel
Wat moet het model bereiken?
Context en brongegevens
Welke informatie mag het gebruiken?
Instructies en grenzen
Wat moet het doen, vermijden en als onzeker markeren?
Uitvoer
Welke velden, volgorde en detailniveau zijn nodig?
Succescriteria
Hoe bepaal je of het resultaat bruikbaar is?
Zet onvertrouwde documenten of klantinvoer duidelijk apart van je vaste instructies. Een document dat je laat samenvatten mag niet ongemerkt nieuwe procesregels bepalen.
Stappenplan: verbeter een prompt meetbaar
Stap 1: beschrijf taak en risico
Schrijf op wie het resultaat gebruikt en wat er mis kan gaan. Een brainstorm met AI heeft een andere kwaliteitslat dan een contractanalyse of een handeling in een extern systeem.
Stap 2: maak succescriteria
Gebruik specifieke criteria, bijvoorbeeld:
- iedere conclusie verwijst naar een aangeleverde bron;
- ontbrekende gegevens worden als ontbrekend gemarkeerd;
- de uitvoer bevat exact de vereiste velden;
- persoonsgegevens buiten de opdracht worden niet herhaald;
- een externe actie vereist menselijke goedkeuring.
De Anthropic-gids Define success and build evaluations adviseert taakgerichte evaluaties die de echte verdeling en grensgevallen weerspiegelen.
Stap 3: bouw een representatieve testset
Neem normale invoer, moeilijke gevallen, ontbrekende informatie en bewust tegenstrijdige gegevens op. Bewaar waar mogelijk een verwachte uitkomst of duidelijke beoordelingsrubriek.
Gebruik geen productiegegevens wanneer fictieve gevallen hetzelfde gedrag kunnen testen. Als echte gegevens noodzakelijk zijn, minimaliseer en beveilig ze.
Stap 4: schrijf de eenvoudigste baseline
Volg de actuele richtlijn voor het gekozen model en gebruik de eenvoudigste aanbevolen opzet met doel, context, uitvoer en criteria. Bij OpenAI-reasoningmodellen is dat vaak zero-shot; andere modelhandleidingen kunnen juist een kleine few-shot-set aanbevelen.
Stap 5: meet en groepeer fouten
Kijk niet alleen naar het gemiddelde. Groepeer fouten, zoals:
- verkeerd label;
- ontbrekende bron;
- onjuist formaat;
- verzonnen invulling;
- te stellige conclusie;
- niet gevolgde goedkeuringsgrens.
Pas daarna de kleinste gerichte wijziging toe.
Stap 6: voeg een techniek alleen gericht toe
Gebruik few-shot prompting als voorbeelden een terugkerend patroon duidelijker maken. Gebruik prompt chaining wanneer tussenresultaten inspectie, validatie of een goedkeuringspunt nodig hebben.
Stap 7: vergelijk dezelfde testset opnieuw
Een wijziging is pas een verbetering als ze de bedoelde fout vermindert zonder andere belangrijke criteria te verslechteren. Google adviseert in de prompt design strategies eveneens om helder, direct en consistent te structureren en per gebruikssituatie te itereren.
Stap 8: versieer en rol beheerst uit
Bewaar promptcode, tests en wijzigingsreden samen. OpenAI adviseert actuele productieprompts in applicatiecode te beheren, met typed invoer, code review, tests en de normale deploymentprocedure.
Log in productie minimaal promptversie, resultaatstatus en foutcategorie. Sla geen sleutels, volledige vertrouwelijke invoer of onnodige persoonsgegevens op.
Welke techniek past bij welke fout?
| Gemeten probleem | Eerste gerichte stap |
|---|---|
| Doel of uitvoer is onduidelijk | Maak instructie en formaat concreter |
| Labels worden wisselend toegepast | Voeg representatieve few-shot-voorbeelden toe |
| Bron en opdracht lopen door elkaar | Gebruik duidelijke Markdown- of XML-grenzen |
| Complexe taak slaat controles over | Splits op met prompt chaining |
| Waarden zijn formeel verkeerd | Gebruik schema en applicatievalidatie |
| Feiten ontbreken of zijn verouderd | Voeg betrouwbare bronophaling toe |
| Externe actie wordt te snel uitgevoerd | Voeg bevoegdheidsgrens en goedkeuring toe |
Een prompt kan niet ieder architectuurprobleem oplossen. Soms heb je een andere tool, actuele bron, retrieval, ander model of menselijke controle nodig.
Veelgemaakte fouten
- Optimaliseren op één mooi antwoord. Gebruik een vaste testset met variatie en grensgevallen.
- Meerdere dingen tegelijk wijzigen. Je weet dan niet welke verandering effect had.
- Alle regels herhalen. Dubbele of conflicterende instructies maken de prompt onduidelijk.
- Alleen vorm testen. Een geldig schema bewijst niet dat de inhoud klopt.
- Voorbeelden en instructies laten botsen. Het model krijgt dan twee verschillende patronen.
- Prompts los van code beheren. Versie, invoercontract en deployment raken dan uit elkaar.
- Een prompt als beveiligingsgrens zien. Beperk tools en rechten ook technisch.
Veelgestelde vragen
Wat is prompt engineering?
Prompt engineering is het systematisch ontwerpen, testen, versiebeheer en verbeteren van instructies, context, voorbeelden en uitvoerafspraken voor een AI-taak. Het doel is meetbaar betrouwbaarder gedrag op representatieve gevallen, niet één indrukwekkend antwoord.
Hoe begin je met prompt engineering?
Definieer eerst het gewenste resultaat, de belangrijkste fouten en een kleine testset met normale gevallen en grensgevallen. Schrijf daarna een eenvoudige baselineprompt en verander één onderdeel per testronde.
Wat hoort in een goede prompt?
Een goede prompt bevat een duidelijk doel, relevante context, benodigde brongegevens, grenzen, gewenst uitvoerformaat en succescriteria. Voeg alleen voorbeelden toe als je test laat zien dat ze een patroon beter verduidelijken.
Hoe test je een prompt betrouwbaar?
Gebruik vaste, representatieve invoer die niet alleen uit makkelijke voorbeelden bestaat. Beoordeel vooraf gekozen criteria zoals juistheid, volledigheid, brongebruik, formaat, veiligheid en het herkennen van ontbrekende informatie.
Is een langere prompt altijd beter?
Nee. Herhaling, conflicterende regels en overbodige context kunnen prestaties verslechteren. Houd iedere instructie doelgericht, zet belangrijke regels op een duidelijke plek en verwijder tekst die geen gemeten bijdrage levert.
Wanneer kies je een ander model in plaats van een betere prompt?
Kies een ander model, tool of architectuur wanneer de fout niet met instructies te beheersen is, bijvoorbeeld door ontbrekende actuele kennis, ontoereikende context, vereiste tooltoegang of structureel onvoldoende taakprestatie.
Hoe beheer je prompts in productie?
Bewaar prompts versieerbaar naast de applicatie, scheid vaste instructies van dynamische invoer, voeg regressietests toe en rol wijzigingen gecontroleerd uit. Log de gebruikte versie zonder geheimen of onnodige persoonsgegevens op te slaan.
Officiële bronnen
Gerelateerde artikelen
Alles bekijkenPrompts
Goede prompts schrijven: praktische gids met voorbeelden (2026)
Schrijf betere prompts zonder vaste formule. Gebruik doel, relevante context, gewenste output en grenzen, en verbeter met gerichte vervolgvragen.
Prompts
Zero-shot prompting: begin zonder voorbeelden en test gericht (2026)
Geef een duidelijke taak, context, grenzen en uitvoerformaat zonder voorbeelden. Meet daarna of few-shot-voorbeelden of een andere aanpak echt nodig zijn.
Prompts
Few-shot prompting: stuur AI met goede voorbeelden (2026)
Gebruik representatieve invoer- en uitvoervoorbeelden om formaat, toon en beslisregels te verduidelijken. Test ook grensgevallen en voorkom dat voorbeelden elkaar tegenspreken.
Prompts
Prompt chaining: bouw een controleerbare AI-workflow (2026)
Splits een complexe AI-taak op in afgebakende stappen met vaste invoer, uitvoer, controles en stopmomenten. Zo kun je fouten eerder vinden en veilig bijsturen.
Hulp nodig met jouw situatie?
Stuur kort wat je wilt bereiken, welke AI-tool je gebruikt en waar je vastloopt. Je krijgt dezelfde dag antwoord.