Multimodale AI is een vorm van kunstmatige intelligentie die informatie uit verschillende soorten bronnen, zoals tekst, afbeeldingen, audio en video, gelijktijdig kan verwerken en begrijpen. Hierdoor kan het model verbanden leggen tussen verschillende datatypes om tot een complexer resultaat te komen dan bij systemen die slechts één type data gebruiken.
Technische werking
- Data-input: Het systeem ontvangt verschillende soorten ongestructureerde data, zoals een afbeelding en een bijbehorende tekstbeschrijving.
- >Encoding: Specifieke encoders zetten elke modaliteit om naar een numerieke representatie, ook wel embeddings genoemd.
- Alignment: Via een gedeelde vectorruimte worden deze embeddings met elkaar vergeleken om te bepalen welke delen van de tekst overeenkomen met welke delen van de afbeelding.
- Fusie: Het model combineert deze informatie via transformer architecturen om een overkoepelend begrip van de input te vormen.
- Outputgeneratie: Op basis van deze gecombineerde data genereert het model een antwoord in een gewenste vorm, zoals tekst of een nieuwe afbeelding.
Belangrijke begrippen
Unimodal AI
Systemen die beperkt zijn tot één type input en output, zoals een traditionele chatbot die alleen tekst verwerkt.
Embeddings
Numerieke vectoren die de betekenis van een object of woord representeren, waardoor het model wiskundig kan berekenen hoe dicht twee concepten bij elkaar liggen.
Cosine similarity
Een wiskundige methode om de hoek tussen twee vectoren te meten, wat aangeeft in hoeverre een tekstfragment overeenstemt met een visueel element.
Attention mechanisms
Een techniek die het model in staat stelt om te focussen op de meest relevante delen van de input, zoals een specifiek object in een foto bij een specifieke vraag.


