Het context window is het maximale aantal woorden of tekens dat een AI-model in één keer kan onthouden en verwerken. Alles wat buiten dit bereik valt, wordt simpelweg vergeten zodra het model een nieuw antwoord genereert.
Technische werking
- Omzetten naar tokens. De tekst die je invoert wordt opgeknipt in kleine stukjes, oftewel tokens. Dit zijn geen hele woorden, maar vaak lettergrepen of clusters van tekens via Byte Pair Encoding.
- Vullen van het geheugen. Deze tokens worden in een actieve buffer geplaatst. Dit is de beschikbare ruimte waar het model naar kijkt om verbanden te leggen tussen woorden.
- Berekening van aandacht. Het model weegt elk token in het window af tegen de andere tokens om te bepalen wat relevant is voor het antwoord.
- Verwijderen van oude data. Als de limiet is bereikt en er komt nieuwe tekst bij, schuift de oudste informatie uit het window. De AI heeft dan geen toegang meer tot die specifieke details.
Belangrijke begrippen
- Tokens. De rekeneenheid van een model. Een ruime schatting is dat 1000 tokens overeenkomen met 700 tot 800 woorden, afhankelijk van de taal en het model.
- System prompt. De vaste instructies die bovenaan het window staan en bepalen hoe de AI zich moet gedragen. Deze nemen ook tokens in beslag.
- Retrieval-augmented generation (RAG). Een techniek waarbij alleen de meest relevante fragmenten uit een database in het window worden geplaatst, zodat je geen gigantische hoeveelheden tekst hoeft te uploaden.
- Context caching. Het tijdelijk opslaan van een groot stuk tekst in het geheugen, zodat je niet bij elke nieuwe vraag dezelfde enorme hoeveelheid tokens opnieuw hoeft te versturen.


