Het BERT-model is een deep learning systeem dat natuurlijke taal analyseert door woorden in een zin vanuit beide richtingen tegelijkertijd te bekijken. Hierdoor begrijpt het model de context van een woord op basis van alle omringende woorden, in plaats van alleen de woorden die ervoor of erna komen.
Technische werking
- Tokenisatie: De tekst wordt opgesplitst in kleinere eenheden, genaamd tokens. Woorden die niet in de standaardlijst staan, worden verder opgedeeld in subwords om onbekende termen te voorkomen.
- Masking: Tijdens de training worden willekeurige woorden in een zin gemaskeerd. Het model moet op basis van de overgebleven context voorspellen welk woord er op die plek staat.
- Bidirectionele analyse: Het model scant de zin van links naar rechts en van rechts naar links tegelijk. Hierdoor wordt het verband tussen woorden in een complexe zin vastgelegd.
- Fine-tuning: Het vooraf getrainde model wordt specifiek aangepast voor een bepaalde taak, zoals het beantwoorden van vragen of het classificeren van sentiment.
Belangrijke begrippen
- Transformers: De architectuur waarop BERT is gebouwd, die gebruikmaakt van een ‘attention mechanism’ om te bepalen welke woorden in een zin het meest relevant zijn voor elkaar.
- Contextual embeddings: Numerieke representaties van woorden die veranderen afhankelijk van de zin. Het woord ‘bank’ krijgt een andere waarde in een financiële context dan in een parkcontext.
- Pre-training: De fase waarin het model op enorme hoeveelheden ongestructureerde tekst wordt getraind om de algemene regels van een taal te leren.


