Hoe herkent AI wat er op een foto staat?

← Actueel · 9 september 2026

Je fotoapp herkent je kinderen op duizenden foto's, de camera van een auto ziet een overstekende fietser, en in het ziekenhuis wijst software radiologen op verdachte plekjes in een scan. Voor ons is kijken moeiteloos. Voor een computer is een foto niets dan een raster van getallen: per beeldpunt een waarde voor rood, groen en blauw. Hoe wordt dat raster een "kat"?

Van beeldpunten naar patronen, laag voor laag

Beeldherkenning werkt met neurale netwerken die in lagen zijn opgebouwd, en het mooie is dat die lagen een herkenbare taakverdeling ontwikkelen. De eerste lagen reageren op het allersimpelste: randjes, overgangen van licht naar donker, kleurvlekjes. De lagen daarna combineren die randjes tot vormen: rondingen, hoeken, texturen zoals vacht of baksteen. Weer latere lagen combineren vormen tot onderdelen: een oor, een wiel, een oog. En de laatste lagen brengen onderdelen samen tot een oordeel: dit geheel past het best bij "kat".

Vergelijk het met hoe een tekenaar een gezicht opbouwt: eerst losse lijnen, dan vormen, dan herkenbare onderdelen, dan het geheel. Niemand heeft het netwerk die volgorde opgelegd; de taakverdeling ontstaat vanzelf tijdens de training.

Leren van voorbeelden, niet van regels

Niemand programmeert regels als "een kat heeft puntige oren". Dat is ook geprobeerd, decennialang, en het werkte slecht: voor elke regel bestaat een foto die hem breekt, een kat van achteren, half achter een gordijn, in de sneeuw. De doorbraak kwam met de omgekeerde aanpak: toon het netwerk miljoenen voorbeeldfoto's met het juiste label erbij, laat het gokken, en stel na elke fout de interne afstelling een beetje bij. Na genoeg voorbeelden heeft het netwerk zelf ontdekt welke patronen katten van honden onderscheiden, inclusief patronen die geen mens ooit in regels had kunnen vangen.

Dit verklaart meteen de zwakke plek: het netwerk kent alleen de wereld van zijn voorbeelden. Zaten er weinig foto's bij van katten in de sneeuw, dan gaat het daar vaker mis. Waren de trainingsfoto's niet divers, dan werkt gezichtsherkenning voor de ene groep mensen beter dan voor de andere, een probleem dat in de praktijk herhaaldelijk is aangetoond.

Herkennen is niet begrijpen

Een netwerk dat "kat" zegt, weet niet wat een kat is. Het heeft geen idee dat katten leven, miauwen of niet van water houden; het heeft alleen geleerd welke visuele patronen bij het label horen. Daarom kan beeldherkenning verrassend falen op beelden die voor mensen glashelder zijn: een vreemde hoek, een ongebruikelijke context, of bewust ontworpen verstoringen die voor het oog onzichtbaar zijn maar het netwerk op het verkeerde been zetten. Betrouwbaar in de situaties waarop het is getraind, breekbaar daarbuiten.

En tegenwoordig: kijken én praten

De nieuwste stap is dat beeldherkenning en taalmodellen zijn samengevloeid. Moderne AI-assistenten zijn multimodaal: je stuurt een foto en stelt er vragen over. Zulke systemen leren beelden en tekst in dezelfde "betekenisruimte" onder te brengen, zodat het taalmodel over een foto kan redeneren zoals over een alinea tekst. Handig en indrukwekkend, maar de basis blijft gelijk: patronen uit voorbeelden, geen begrip van de wereld. Een beschrijving van een foto kan dus net zo goed een hallucinatie bevatten als elk ander AI-antwoord.

In de les Computer vision: hoe AI kijkt bouwen we dit verhaal rustig op, en Multimodaliteit laat zien hoe beeld en taal in één model samenkomen. Zonder formules, mét inzicht.

Bekijk de cursussen Lees module 1 gratis