Een Transformer-model is een architectuur voor neurale netwerken die patronen in sequentiële data herkent door gewicht toe te kennen aan verschillende delen van de input. In tegenstelling tot oudere modellen verwerkt het alle data tegelijkertijd in plaats van stap voor stap, wat zorgt voor een beter begrip van context.
Technische werking
- Tokenisatie: De inputtekst wordt opgesplitst in kleinere eenheden, zoals woorden of lettergrepen, die worden omgezet in numerieke vectoren.
- Positional Encoding: Omdat het model geen volgorde kent, krijgt elk token een unieke waarde die de exacte positie in de zin aangeeft.
- Self-attention: Het model berekent de relatie tussen elk token en alle andere tokens in de zin om contextuele associaties te bepalen.
- Feedforward processing: De resultaten van de attention-stap gaan door lineaire lagen om complexe kenmerken uit de data te filteren.
- Decoding: De verwerkte informatie wordt omgezet naar een voorspelling, zoals het volgende woord in een zin of een vertaling.
Belangrijke begrippen
- Self-attention: Het mechanisme dat bepaalt welk deel van de input relevant is voor het begrijpen van een specifiek woord.
- Encoder- en decoder-lagen: De encoder analyseert de input; de decoder genereert op basis daarvan een nieuwe output.
- Token embeddings: Numerieke representaties van woorden waarbij woorden met een vergelijkbare betekenis dicht bij elkaar staan in een vectorruimte.
- Layer Normalization: Een techniek die de waarden binnen het netwerk stabiliseert om het trainingsproces te versnellen.


