De Google Gemini-modelfamilie bestaat uit multimodale AI-modellen die tekst, afbeeldingen, audio, video en programmeercode gelijktijdig kunnen verwerken en genereren. Het systeem analyseert verschillende soorten input in één proces om verbanden te leggen tussen diverse datatypes zonder dat daarvoor aparte gespecialiseerde modellen nodig zijn.
Technische werking
- Inputverwerking: Het model ontvangt data in verschillende vormen, zoals een tekstvraag gecombineerd met een afbeelding of een videofragment.
- Tokenisatie: De input wordt omgezet in tokens, wat de kleinste eenheden van betekenis zijn die het model kan begrijpen.
- Multimodale analyse: In plaats van tekst eerst naar een afbeelding om te zetten, analyseert het model alle datastromen in dezelfde architectuur.
- Patroonherkenning: Het systeem gebruikt een neuraal netwerk om statistische waarschijnlijkheden te berekenen voor het volgende token in de reeks.
- Outputgeneratie: Het model produceert een antwoord in de gevraagde vorm, zoals een tekstuele uitleg of een stuk code.
Belangrijke begrippen
- Multimodaliteit: Het vermogen om verschillende soorten media (tekst, beeld, geluid) in één model te integreren.
- Context window: De maximale hoeveelheid informatie die het model in één keer kan onthouden en analyseren tijdens een gesprek.
- Gemini Pro: De versie van het model die is geoptimaliseerd voor een breed scala aan complexe taken en schaalbaarheid.
- Gemini Ultra: De meest krachtige variant, bedoeld voor hoogwaardige redenering en zeer complexe wetenschappelijke of technische taken.
- Gemini Nano: Een efficiënt model dat lokaal op apparaten kan draaien zonder verbinding met een server.
- Gemini API: De programmeerinterface waarmee ontwikkelaars de functies van het model integreren in eigen software.


