Computer vision is een onderdeel van kunstmatige intelligentie dat computers in staat stelt om visuele informatie uit afbeeldingen, video’s en andere digitale bronnen te analyseren. Het systeem herkent patronen, objecten en bewegingen om deze vervolgens om te zetten in bruikbare data of acties.
Technische werking
- Beeldverwerving: Een camera of sensor legt visuele data vast in de vorm van pixels, waarbij elk pixel een kleurwaarde en positie heeft.
- Preprocessing: Ruis wordt verwijderd en het contrast wordt aangepast om de belangrijkste kenmerken van het beeld te isoleren.
- Kenmerkextractie: Het systeem zoekt naar randen, hoeken en texturen om de lokale structuur van het beeld te bepalen.
- Classificatie: De geëxtraheerde kenmerken worden vergeleken met bekende patronen om te bepalen welk object of welke scène er wordt afgebeeld.
- Interpretatie: De software koppelt de herkende objecten aan een specifieke betekenis of actie, zoals het tellen van producten.
Belangrijke begrippen
- Convolutional Neural Networks (CNN): Een specifiek type deep learning dat ideaal is voor beeldherkenning omdat het automatisch hiërarchische patronen leert herkennen.
- Object Herkenning: Het proces waarbij het systeem niet alleen ziet wat er op een foto staat, maar ook waar het object zich bevindt via een bounding box.
- Optical Flow: De analyse van de beweging van pixels tussen twee opeenvolgende frames in een video om snelheid en richting te bepalen.
- Stereo Vision: Het gebruik van twee of meer camera’s om diepte te schatten, vergelijkbaar met hoe menselijke ogen werken.
- Model Training: Het proces waarbij een algoritme wordt gevoed met duizenden gelabelde afbeeldingen om de nauwkeurigheid van de herkenning te verhogen.


