Wat is machine learning? Van data naar model (2026)
Machine learning traint een model met data om voorspellingen te doen of inhoud te genereren. Leer hoe training, evaluatie en gebruik in productie verschillen.
Machine learning is een aanpak waarbij software, een model, met data wordt getraind om voorspellingen te doen of inhoud te genereren. Het model is pas bruikbaar wanneer je de geleerde relatie op niet-gebruikte voorbeelden test en na ingebruikname blijft controleren.
Machine learning binnen AI
Kunstmatige intelligentie is het brede vakgebied. Machine learning is een veelgebruikte aanpak daarbinnen waarbij een algoritme modelparameters aanpast op basis van data en een leerdoel.
Google vat machine learning samen als het trainen van software, een model, om met data nuttige voorspellingen te doen of inhoud te genereren. Model betekent hier de wiskundige relatie die tijdens training wordt geleerd, niet een fysieke miniatuur of alleen de app waarin je het resultaat ziet.
Een traditioneel programma kan een vaste regel volgen:
als bedrag > grens, markeer voor controle
Een machine-learningmodel kan in historische voorbeelden leren welke combinatie van kenmerken samenhangt met een uitkomst. Dat maakt complexere patronen mogelijk, maar ook nieuwe risico's: de data kan niet representatief zijn, het doel kan verkeerd zijn gekozen en prestaties kunnen na verloop van tijd veranderen.
Training en inference zijn verschillende fasen
Tijdens training krijgt een algoritme voorbeelden en een doel. Het past parameters aan om een foutmaat te verkleinen of een beloning te vergroten. Tijdens inference gebruikt het getrainde model de vastgelegde parameters om voor nieuwe invoer een voorspelling of uitvoer te maken.
Dat onderscheid voorkomt een hardnekkig misverstand. Een model leert niet noodzakelijk vanzelf verder omdat je het gebruikt of nieuwe rijen laat verwerken. Een productieomgeving kan wel periodiek of continu opnieuw trainen, maar daarvoor is een expliciete updateprocedure nodig.
Een gecontroleerde update bevat minimaal:
- een afgebakende en goedgekeurde dataset;
- een vastgelegde model- en dataversie;
- dezelfde referentietests als voor de vorige versie;
- een vergelijking van kwaliteit en foutgroepen;
- een besluit om wel of niet uit te rollen;
- monitoring en een route om terug te gaan.
Vier vormen van machine learning
De indeling hangt af van hoe een systeem leert en waarvoor het wordt gebruikt. Eén product kan meerdere vormen combineren.
Supervised learning
Bij supervised learning bevat ieder trainingsvoorbeeld invoerkenmerken en een gewenst doel of label. Een classificatiemodel kan bijvoorbeeld leren of een bericht spam of geen spam is. Een regressiemodel kan een numerieke waarde schatten.
Het label is niet automatisch de waarheid. Als menselijke beoordelingen inconsistent zijn of historische besluiten oneerlijk uitpakten, kan het model die patronen leren.
Unsupervised learning
Bij unsupervised learning is er geen vooraf gegeven doellabel. Een methode zoekt structuur, bijvoorbeeld groepen van vergelijkbare voorbeelden of een compacte representatie van kenmerken.
De gevonden groepen hebben niet vanzelf een zakelijke of menselijke betekenis. Iemand moet nog beoordelen of de structuur stabiel, uitlegbaar en bruikbaar is.
Reinforcement learning
Bij reinforcement learning kiest een agent acties in een omgeving en ontvangt die een beloningssignaal. Het doel is niet per stap een label voorspellen, maar een beleid leren dat de verwachte opbrengst over opeenvolgende acties vergroot.
De gekozen beloning bepaalt sterk welk gedrag wordt aangeleerd. Een onvolledig beloningssignaal kan ongewenst gedrag aantrekkelijk maken.
Generatieve modellen
Generatieve modellen leren patronen in data om nieuwe uitvoer te maken, zoals tekst, beeld, audio of code. Generatieve decoder-LLM's zijn een bekend type. Andere taalmodellen kunnen bijvoorbeeld tokenrepresentaties maken of gemaskeerde tokens voorspellen, en niet ieder machine-learningmodel is generatief. Lees wat LLM's zijn voor tokens, Transformers en context.
Data bepaalt wat het model kan leren
Een dataset bestaat meestal uit voorbeelden met features, de invoerkenmerken, en soms een label, het gewenste doel. De hoeveelheid data alleen zegt weinig over kwaliteit.
Controleer onder meer:
- vertegenwoordigt de dataset de echte gebruikers, situaties en uitzonderingen?
- zijn labels consequent en relevant voor het huidige doel?
- staan dezelfde personen of gebeurtenissen onbedoeld in train- en testdata?
- bevat een feature informatie die pas na de voorspelling bekend is?
- ontbreken belangrijke groepen, talen of randgevallen?
- zijn persoonsgegevens en gebruiksrechten correct geregeld?
De workflow data opschonen met AI helpt bij formaten, duplicaten en controlekolommen, maar laat AI niet zelf bepalen wat als geldige bron of juiste correctie geldt.
Train-, validatie- en testdata
Om generalisatie te meten, houd je voorbeelden apart die niet worden gebruikt om parameters te leren:
| Deel | Doel | Belangrijke grens |
|---|---|---|
| Trainingsset | Parameters leren | Mag niet de enige kwaliteitsmeting zijn |
| Validatieset | Varianten en instellingen vergelijken | Herhaald kiezen kan ook op deze set overfitten |
| Testset | Eindcontrole van gekozen aanpak | Blijft afgeschermd tot de aanpak vaststaat |
| Productiedata | Werkelijke invoer na uitrol | Vereist monitoring en soms nieuw onderzoek |
Google's uitleg over generalisatie en overfitting benadrukt dat een model goed moet voorspellen op nieuwe data uit de beoogde verdeling. Een lage fout op trainingsdata is dus geen eindbewijs.
Wanneer tijd een rol speelt, kan een willekeurige splitsing misleiden. Train dan bijvoorbeeld op een eerdere periode en test op een latere periode, zodat de controle dichter bij de echte toepassing ligt.
Zo ontstaat een productievoorspelling
Een productieomgeving bevat vaak data-invoer, validatie, featureverwerking, modelservering, logging en menselijke opvolging. Google's module over production ML systems behandelt daarom veel meer dan alleen modelcode.
Een model kan technisch hetzelfde blijven terwijl de werkelijkheid verandert. Voorbeelden:
- klanten gebruiken andere woorden;
- sensoren worden vervangen;
- een formulier krijgt nieuwe velden;
- wetgeving of beleid verandert;
- gebruikers reageren op de voorspelling;
- een koppeling levert andere eenheden of lege waarden.
Dit heet vaak data- of conceptdrift, afhankelijk van wat verandert. Monitor daarom zowel invoer als uitkomst, en kijk naar relevante foutgroepen in plaats van alleen één gemiddelde score.
Stappenplan: beoordeel een machine-learningidee
Stap 1: formuleer de beslissing en referentie
Bepaal welke voorspelling nodig is, wie de uitkomst gebruikt en wat nu als referentie dient. Beschrijf afzonderlijk wat een fout-positief en fout-negatief resultaat veroorzaakt.
Stap 2: controleer brondata en labels
Onderzoek herkomst, toestemming, ontbrekende waarden, duplicaten, tijdsvolgorde en representatie. Laat vakdeskundigen beoordelen of labels werkelijk het gewenste doel meten.
Stap 3: maak een eenvoudige baseline
Vergelijk het model met een vaste regel, gemiddelde waarde of bestaande werkwijze. Een complex model is niet nuttig wanneer het de eenvoudige baseline niet aantoonbaar verbetert.
Stap 4: splits data vóór modelkeuze
Leg train-, validatie- en testset vast voordat je varianten vergelijkt. Voorkom dat dezelfde persoon, klant of gebeurtenis over meerdere sets lekt.
Stap 5: kies taakgerichte meetwaarden
Gebruik meetwaarden die de gevolgen van fouten weerspiegelen. Bekijk naast een totaalscore ook foutsoorten, groepen, onzekerheid en gevallen waarin het model moet weigeren of doorsturen.
Stap 6: test het volledige proces
Controleer invoervalidatie, eenheden, uitwijkgedrag, logging, toegangsrechten en menselijke opvolging. Voor generatieve uitvoer gebruik je daarnaast broncontrole zoals in AI-hallucinaties herkennen.
Stap 7: rol beperkt uit en monitor
Begin met een afgebakende groep of adviserende toepassing. Leg vast welke signalen een pauze, onderzoek, hertraining of herstel naar de vorige versie veroorzaken.
Een model is geen volledige oplossing
Een nauwkeurig model kan alsnog een slecht systeem opleveren wanneer de invoer verkeerd is, gebruikers de score verkeerd interpreteren of niemand een fout behandelt. Andersom kan een bescheiden model waardevol zijn wanneer het een duidelijk proces ondersteunt en een mens de uitzonderingen beoordeelt.
Visualiseer je modeluitkomsten, dan helpt AI voor datavisualisatie bij een controleerbare grafiekkeuze. Controleer in de bronsoftware altijd filters, berekeningen en uitgesloten rijen.
Veelgemaakte fouten
- Training en dagelijks gebruik verwarren. Inference verandert modelparameters niet automatisch.
- Veel data gelijkstellen aan goede data. Representatie, labels en herkomst bepalen wat het model leert.
- Op trainingsdata rapporteren. Gebruik niet-gebruikte voorbeelden en houd de eindtest afgeschermd.
- Data tussen sets laten lekken. Dubbele personen, gebeurtenissen of toekomstige informatie maken scores te optimistisch.
- Alleen één gemiddelde score gebruiken. Onderzoek foutsoorten, groepen en gevolgen.
- Het model los van het proces testen. Invoer, rechten, koppelingen en opvolging kunnen een andere foutbron zijn.
- Automatisch hertrainen zonder poort. Vergelijk versies en behoud een herstelroute.
Veelgestelde vragen
Wat is machine learning?
Machine learning is een aanpak waarbij software, een model, met data wordt getraind om voorspellingen te doen of inhoud te genereren. De geleerde relatie moet daarna met niet-gebruikte voorbeelden en praktijkmetingen worden gecontroleerd.
Wat is het verschil tussen AI en machine learning?
AI is het brede vakgebied van systemen die uitvoer afleiden voor een doel. Machine learning is een veelgebruikte aanpak binnen AI waarbij een model patronen uit data leert.
Wat is het verschil tussen training en inference?
Tijdens training worden modelparameters aangepast met voorbeelden en een leerdoel. Tijdens inference gebruikt het getrainde model die parameters voor nieuwe invoer, zonder dat iedere voorspelling de parameters automatisch wijzigt.
Wat zijn supervised en unsupervised learning?
Bij supervised learning bevat de trainingsdata een gewenst label of doel. Bij unsupervised learning zoekt een methode structuur in data zonder zo'n doellabel, bijvoorbeeld groepen van vergelijkbare voorbeelden.
Leert een machine-learningmodel vanzelf van nieuwe data?
Niet noodzakelijk. Nieuwe data verwerken tijdens inference verandert veel modellen niet. Voor leren is een gecontroleerde trainings- of updateprocedure nodig, gevolgd door evaluatie, versiebeheer en monitoring.
Heb je altijd veel data nodig voor machine learning?
Dat hangt af van taak, model, variatie en gewenste betrouwbaarheid. Een kleine representatieve dataset kan nuttiger zijn dan veel vervuilde data, maar je hebt ook voldoende onafhankelijke voorbeelden nodig om generalisatie te toetsen.
Hoe weet je of een machine-learningmodel goed werkt?
Kies meetwaarden die bij het praktijkdoel en de kosten van fouten passen, test op niet-gebruikte en lastige voorbeelden en monitor prestaties na ingebruikname. Eén gemiddeld cijfer is zelden voldoende.
Officiële bronnen
Gerelateerde artikelen
Alles bekijkenAI-begrippen
Wat is AI? Betekenis, werking en voorbeelden (2026)
AI is software die uit invoer afleidt welke voorspelling, inhoud, aanbeveling of beslissing past. Leer wat AI wel en niet is en hoe je een toepassing beoordeelt.
AI-begrippen
Wat zijn LLM's? Zo werken grote taalmodellen (2026)
Een LLM is een groot taalmodel dat tokens of tokenreeksen verwerkt en voorspelt. Leer hoe training, Transformers, context, tools en controle samen een AI-assistent vormen.
AI en Excel
Data opschonen met AI: controleerbaar stappenplan (2026)
Gebruik AI om dataproblemen te vinden en voorstellen te maken, terwijl je brondata intact blijft en iedere opschoonstap controleerbaar en herhaalbaar is.
AI-begrippen
AI-hallucinaties herkennen en controleren (2026)
Herken verzonnen bronnen, onjuiste feiten en foutieve berekeningen in AI-output. Controleer belangrijke claims met een praktisch stappenplan.
Hulp nodig met jouw situatie?
Stuur kort wat je wilt bereiken, welke AI-tool je gebruikt en waar je vastloopt. Je krijgt dezelfde dag antwoord.