Naar inhoud
hulpbijai
Alle artikelen
PromptsAuteur: Bouwmeester Consultancy

Prompt engineering in 2026: van gokwerk naar vaste testcyclus

Ontwerp, test en beheer prompts op basis van succescriteria en representatieve evaluaties. Verbeter één onderdeel per ronde en houd productieprompts versieerbaar.

Prompt engineering is een testcyclus voor AI-gedrag, geen zoektocht naar magische woorden. Definieer eerst wat goed is, test een eenvoudige baseline op echte gevallen en wijzig daarna één onderdeel per ronde.

Prompt engineering en een goede losse prompt

De gids goede prompts maken helpt je één opdracht helder formuleren. Prompt engineering gaat verder: je beheert een herhaalbare taak met succescriteria, testgevallen, versies en een gecontroleerde uitrol.

Anthropic noemt in het prompt engineering-overzicht drie voorwaarden voordat je gaat optimaliseren: duidelijke succescriteria, een manier om die empirisch te testen en een eerste prompt. De OpenAI-documentatie legt daarnaast nadruk op duidelijke instructiehiërarchie, voorbeelden, relevante context en versieerbare productieprompts.

Het basismodel

Een onderhoudbare prompt heeft herkenbare onderdelen:

Doel
Wat moet het model bereiken?

Context en brongegevens
Welke informatie mag het gebruiken?

Instructies en grenzen
Wat moet het doen, vermijden en als onzeker markeren?

Uitvoer
Welke velden, volgorde en detailniveau zijn nodig?

Succescriteria
Hoe bepaal je of het resultaat bruikbaar is?

Zet onvertrouwde documenten of klantinvoer duidelijk apart van je vaste instructies. Een document dat je laat samenvatten mag niet ongemerkt nieuwe procesregels bepalen.

Stappenplan: verbeter een prompt meetbaar

Stap 1: beschrijf taak en risico

Schrijf op wie het resultaat gebruikt en wat er mis kan gaan. Een brainstorm met AI heeft een andere kwaliteitslat dan een contractanalyse of een handeling in een extern systeem.

Stap 2: maak succescriteria

Gebruik specifieke criteria, bijvoorbeeld:

  • iedere conclusie verwijst naar een aangeleverde bron;
  • ontbrekende gegevens worden als ontbrekend gemarkeerd;
  • de uitvoer bevat exact de vereiste velden;
  • persoonsgegevens buiten de opdracht worden niet herhaald;
  • een externe actie vereist menselijke goedkeuring.

De Anthropic-gids Define success and build evaluations adviseert taakgerichte evaluaties die de echte verdeling en grensgevallen weerspiegelen.

Stap 3: bouw een representatieve testset

Neem normale invoer, moeilijke gevallen, ontbrekende informatie en bewust tegenstrijdige gegevens op. Bewaar waar mogelijk een verwachte uitkomst of duidelijke beoordelingsrubriek.

Gebruik geen productiegegevens wanneer fictieve gevallen hetzelfde gedrag kunnen testen. Als echte gegevens noodzakelijk zijn, minimaliseer en beveilig ze.

Stap 4: schrijf de eenvoudigste baseline

Volg de actuele richtlijn voor het gekozen model en gebruik de eenvoudigste aanbevolen opzet met doel, context, uitvoer en criteria. Bij OpenAI-reasoningmodellen is dat vaak zero-shot; andere modelhandleidingen kunnen juist een kleine few-shot-set aanbevelen.

Stap 5: meet en groepeer fouten

Kijk niet alleen naar het gemiddelde. Groepeer fouten, zoals:

  • verkeerd label;
  • ontbrekende bron;
  • onjuist formaat;
  • verzonnen invulling;
  • te stellige conclusie;
  • niet gevolgde goedkeuringsgrens.

Pas daarna de kleinste gerichte wijziging toe.

Stap 6: voeg een techniek alleen gericht toe

Gebruik few-shot prompting als voorbeelden een terugkerend patroon duidelijker maken. Gebruik prompt chaining wanneer tussenresultaten inspectie, validatie of een goedkeuringspunt nodig hebben.

Stap 7: vergelijk dezelfde testset opnieuw

Een wijziging is pas een verbetering als ze de bedoelde fout vermindert zonder andere belangrijke criteria te verslechteren. Google adviseert in de prompt design strategies eveneens om helder, direct en consistent te structureren en per gebruikssituatie te itereren.

Stap 8: versieer en rol beheerst uit

Bewaar promptcode, tests en wijzigingsreden samen. OpenAI adviseert actuele productieprompts in applicatiecode te beheren, met typed invoer, code review, tests en de normale deploymentprocedure.

Log in productie minimaal promptversie, resultaatstatus en foutcategorie. Sla geen sleutels, volledige vertrouwelijke invoer of onnodige persoonsgegevens op.

Welke techniek past bij welke fout?

Gemeten probleemEerste gerichte stap
Doel of uitvoer is onduidelijkMaak instructie en formaat concreter
Labels worden wisselend toegepastVoeg representatieve few-shot-voorbeelden toe
Bron en opdracht lopen door elkaarGebruik duidelijke Markdown- of XML-grenzen
Complexe taak slaat controles overSplits op met prompt chaining
Waarden zijn formeel verkeerdGebruik schema en applicatievalidatie
Feiten ontbreken of zijn verouderdVoeg betrouwbare bronophaling toe
Externe actie wordt te snel uitgevoerdVoeg bevoegdheidsgrens en goedkeuring toe

Een prompt kan niet ieder architectuurprobleem oplossen. Soms heb je een andere tool, actuele bron, retrieval, ander model of menselijke controle nodig.

Veelgemaakte fouten

  • Optimaliseren op één mooi antwoord. Gebruik een vaste testset met variatie en grensgevallen.
  • Meerdere dingen tegelijk wijzigen. Je weet dan niet welke verandering effect had.
  • Alle regels herhalen. Dubbele of conflicterende instructies maken de prompt onduidelijk.
  • Alleen vorm testen. Een geldig schema bewijst niet dat de inhoud klopt.
  • Voorbeelden en instructies laten botsen. Het model krijgt dan twee verschillende patronen.
  • Prompts los van code beheren. Versie, invoercontract en deployment raken dan uit elkaar.
  • Een prompt als beveiligingsgrens zien. Beperk tools en rechten ook technisch.

Veelgestelde vragen

Wat is prompt engineering?

Prompt engineering is het systematisch ontwerpen, testen, versiebeheer en verbeteren van instructies, context, voorbeelden en uitvoerafspraken voor een AI-taak. Het doel is meetbaar betrouwbaarder gedrag op representatieve gevallen, niet één indrukwekkend antwoord.

Hoe begin je met prompt engineering?

Definieer eerst het gewenste resultaat, de belangrijkste fouten en een kleine testset met normale gevallen en grensgevallen. Schrijf daarna een eenvoudige baselineprompt en verander één onderdeel per testronde.

Wat hoort in een goede prompt?

Een goede prompt bevat een duidelijk doel, relevante context, benodigde brongegevens, grenzen, gewenst uitvoerformaat en succescriteria. Voeg alleen voorbeelden toe als je test laat zien dat ze een patroon beter verduidelijken.

Hoe test je een prompt betrouwbaar?

Gebruik vaste, representatieve invoer die niet alleen uit makkelijke voorbeelden bestaat. Beoordeel vooraf gekozen criteria zoals juistheid, volledigheid, brongebruik, formaat, veiligheid en het herkennen van ontbrekende informatie.

Is een langere prompt altijd beter?

Nee. Herhaling, conflicterende regels en overbodige context kunnen prestaties verslechteren. Houd iedere instructie doelgericht, zet belangrijke regels op een duidelijke plek en verwijder tekst die geen gemeten bijdrage levert.

Wanneer kies je een ander model in plaats van een betere prompt?

Kies een ander model, tool of architectuur wanneer de fout niet met instructies te beheersen is, bijvoorbeeld door ontbrekende actuele kennis, ontoereikende context, vereiste tooltoegang of structureel onvoldoende taakprestatie.

Hoe beheer je prompts in productie?

Bewaar prompts versieerbaar naast de applicatie, scheid vaste instructies van dynamische invoer, voeg regressietests toe en rol wijzigingen gecontroleerd uit. Log de gebruikte versie zonder geheimen of onnodige persoonsgegevens op te slaan.

Officiële bronnen

Gerelateerde artikelen

Alles bekijken

Hulp nodig met jouw situatie?

Stuur kort wat je wilt bereiken, welke AI-tool je gebruikt en waar je vastloopt. Je krijgt dezelfde dag antwoord.