Natural Language Processing (NLP) is een tak van kunstmatige intelligentie die computers in staat stelt om menselijke taal te begrijpen, te interpreteren en te genereren. Het combineert computationele linguïstiek met machine learning-algoritmen om tekst en spraak te verwerken op een manier die natuurlijke interactie mogelijk maakt.
Technische werking
- Tokenisatie: De tekst wordt opgesplitst in kleinere eenheden, zoals woorden of zinsdelen, die tokens worden genoemd.
- Stop-word verwijdering: Veelvoorkomende woorden zonder specifieke betekenis, zoals ‘de’, ‘het’ en ‘een’, worden gefilterd om de ruis te verminderen.
- Stemming en lemmatisering: Woorden worden teruggebracht naar hun stam of basisvorm, zodat ‘lopend’ en ‘liep’ als hetzelfde concept worden herkend.
- Vectorisatie: Tekst wordt omgezet in numerieke vectoren, omdat computers alleen met getallen kunnen rekenen.
- Analyse: Een model past patronen toe op deze vectoren om de betekenis, context of intentie van de zin te bepalen.
Belangrijke begrippen
- Semantische analyse: Het proces waarbij de werkelijke betekenis van een zin wordt vastgesteld, rekening houdend met de context.
- Syntactische analyse: Het onderzoeken van de grammaticale structuur van een zin om te bepalen hoe woorden zich tot elkaar verhouden.
- Sentimentanalyse: Een techniek om te bepalen of een tekst een positieve, negatieve of neutrale emotionele lading heeft.
- Named Entity Recognition (NER): Het automatisch identificeren en categoriseren van entiteiten in tekst, zoals namen van personen, organisaties of locaties.
- Neural models: Geavanceerde architecturen, zoals Recurrent Neural Networks, die patronen in sequentiële data herkennen.


