Een embedding-model is een algoritme dat woorden, zinnen of documenten omzet in numerieke vectoren. Deze vectoren representeren de betekenis van de tekst, waardoor computers semantische relaties tussen verschillende stukken data kunnen berekenen op basis van hun positie in een meerdimensionale ruimte.
Technische werking
- Tokenisatie: De invoertekst wordt opgesplitst in kleinere eenheden, zoals woorden of delen van woorden, die tokens worden genoemd.
- Numerieke toewijzing: Elk token krijgt een uniek identificatienummer dat door het model wordt herkend.
- Vectorisatie: Het model projecteert deze tokens in een hoogdimensionale ruimte waarbij elk woord een reeks getallen (een vector) krijgt.
- Contextuele weging: Moderne modellen analyseren de woorden rondom een token om de exacte betekenis in die specifieke context te bepalen.
- Positionering: Woorden met een vergelijkbare betekenis worden dicht bij elkaar geplaatst in de vectorruimte, terwijl ongerelateerde termen ver uit elkaar staan.
Belangrijke begrippen
- Cosine similarity: Een wiskundige methode om de hoek tussen twee vectoren te meten; hoe kleiner de hoek, hoe groter de semantische overeenkomst.
- Vector Database: Een gespecialiseerde database die vectoren efficiënt kan opslaan en doorzoeken zonder dat elke waarde individueel vergeleken hoeft te worden.
- HNSW vector index: Een algoritme dat een graafstructuur gebruikt om razendsnel de meest nabije vectoren in een grote dataset te vinden.
- Multimodale embeddings: Modellen die verschillende soorten data, zoals afbeeldingen en tekst, naar dezelfde vectorruimte vertalen zodat je een plaatje kunt zoeken met tekst.
- Zin- en documentembeddings: De techniek om niet alleen losse woorden, maar volledige paragrafen of artikelen als één enkele vector te representeren.


