← blog

Wordt hallucineren een woord uit het verleden?

Tijdens mijn lezingen zie ik vaak twee soorten mensen. De eerste groep is heel optimistisch. Die zegt: AI gaat alles oplossen. De tweede groep is juist heel pessimistisch. Die zegt: AI is gevaarlijk, geeft verkeerde antwoorden en daarom moet je het eigenlijk niet gebruiken. Ik snap allebei de reacties, maar ik merk dat ik zelf steeds minder in die simpele tegenstelling geloof. De interessante vraag is niet of AI goed of slecht is. De interessante vraag is hoe AI zich ontwikkelt en op welk moment ons oordeel over AI moet meebewegen.

Toen ChatGPT 3.5 uitkwam, hadden de pessimisten vaak gewoon een punt. AI hallucineerde veel. Je stelde een vraag en kreeg een antwoord dat heel overtuigend klonk, maar niet klopte. Soms ging het om een verzonnen bron. Soms om een verkeerd feit. Soms om een redenering die logisch leek, maar bij controle uit elkaar viel. En dat maakte AI ingewikkeld, want juist de nette toon en de zelfverzekerde formulering zorgden ervoor dat je het antwoord makkelijk vertrouwde.

Waarom AI liever antwoord gaf

Het interessante is dat hallucineren niet alleen een technisch foutje was. Het had ook te maken met hoe AI werd beoordeeld. OpenAI schreef daar recent zelf over in een artikel over waarom taalmodellen hallucineren. Als een AI vooral wordt beloond voor het geven van het juiste antwoord, dan kan gokken aantrekkelijker zijn dan toegeven dat het antwoord niet bekend is. Een fout antwoord is dan soms statistisch voordeliger dan geen antwoord. Voor ons als gebruiker is dat natuurlijk precies verkeerdom. Ik heb liever dat een AI zegt: dit weet ik niet zeker, dan dat het met veel zelfvertrouwen iets verzint.

We hebben door de jaren heen allerlei oplossingen gezien om dat probleem kleiner te maken. AI ging meer redeneerstappen of samenvattingen van de redenering tonen. Antwoorden kregen bronverwijzingen. Tools zoals NotebookLM van Google maakten het mogelijk om de AI alleen met je eigen bronnen te laten werken. Dat hielp allemaal. Echt. Maar voor de pessimisten was het nooit genoeg. En eerlijk gezegd begrijp ik dat ook. Als je in een belangrijk vakgebied werkt, is "meestal klopt het wel" geen goed genoeg antwoord.

Stoppen als teken van kwaliteit

Nu is GPT-6 Astra uitgekomen en ik merk dat er iets aan het verschuiven is. Niet omdat hallucineren ineens helemaal verdwenen is. Dat zou ik niet durven zeggen. Maar wel omdat de richting verandert. OpenAI beschrijft zelf dat Astra beter is in het bewaken van grenzen, beter is in communiceren wanneer iets niet kan en minder snel onjuiste claims maakt over wat het wel of niet kan. Dat klinkt misschien als een detail, maar volgens mij is dat wezenlijk.

Ik zag op X bijvoorbeeld een voorbeeld van Wade Foster waarin GPT-6 Astra een taak probeerde uit te voeren, maar stopte toen het niet genoeg informatie kon vinden. GPT-5.6 Sol ging wel door en kreeg daardoor nog gedeeltelijk punten. Op het eerste gezicht lijkt dat misschien een zwakte van Astra. Je geeft een taak, de AI werkt een tijdje en stopt dan zonder volledig antwoord. Dat voelt irritant. Maar als je er langer over nadenkt, is het juist een teken van volwassenheid. Een AI die stopt omdat het antwoord niet betrouwbaar genoeg is, is in veel situaties waardevoller dan een AI die toch maar iets afmaakt.

Dat is volgens mij een fundamentele verandering. In het verleden was AI vaak gericht op het geven van een antwoord. Nu gaan we naar AI die beter begrijpt dat een onterecht antwoord soms erger is dan geen antwoord. Dat klinkt saai, maar dat is precies wat je nodig hebt als AI een grotere rol krijgt in werk, onderwijs, recht, zorg en bestuur.

Een antwoord is niet genoeg

Een tweede ontwikkeling vind ik minstens zo belangrijk. Aaron Levie deelde op X een voorbeeld uit een juridische benchmark. Daarin ging het niet alleen om de vraag of de AI tot de juiste conclusie kwam, maar ook of de AI kon aanwijzen waar die conclusie op gebaseerd was. GPT-5.6 Sol kwam volgens dat voorbeeld wel tot de juiste conclusie, maar gaf niet de juiste verwijzing mee. GPT-6 Astra deed dat wel.

Dat verschil is groot. Want een goed antwoord zonder onderbouwing blijft in veel professionele situaties moeilijk bruikbaar. Zeker in een vakgebied zoals recht is de conclusie niet genoeg. Je moet kunnen zien op basis waarvan die conclusie wordt getrokken. Welke passage? Welke regel? Welke afspraak? Welke bron? Zonder die controleerbaarheid blijft AI een soort zwarte doos die misschien gelijk heeft, maar waarbij je nog steeds niet weet waarom.

Ik herken dat uit mijn eigen lezingen. Ik laat daar soms een video zien waarin AI mij Frans laat spreken. Dat ziet er indrukwekkend uit, maar ik spreek zelf geen Frans. Dus ik kan eigenlijk niet goed controleren of het klopt wat ik zeg. Misschien is de uitspraak goed. Misschien is de grammatica fout. Misschien zeg ik iets raars zonder dat ik het doorheb. En precies daar zit het probleem. Als je de kennis niet hebt om iets te controleren, kun je een AI-antwoord eigenlijk maar beperkt gebruiken.

Bronnen veranderen dat. Niet omdat bronnen automatisch alles oplossen, maar omdat ze het antwoord controleerbaar maken. Dan hoef ik niet alleen te vertrouwen op de toon van de AI. Ik kan terug naar de basis. Waar staat dit? Waarop is dit gebaseerd? Klopt die bron? Is de conclusie logisch uit die bron afgeleid?

Menselijke controle verandert

Tijdens mijn lezingen zeg ik vaak dat menselijke controle belangrijk blijft. De AI kan het fout hebben en de verantwoordelijkheid ligt nog steeds bij de mens. Dat blijf ik vinden. Maar ik merk ook dat deze zin ingewikkelder wordt. Want wat bedoelen we precies met menselijke controle als AI zelf steeds beter bronnen geeft, fouten opspoort en zichzelf laat controleren?

Stel dat een antwoord niet alleen door mij wordt gecontroleerd, maar door tientallen verschillende AI-agenten. De ene agent controleert de bronnen. De andere controleert de cijfers. Een derde zoekt naar tegenargumenten. Een vierde kijkt of de conclusie wel volgt uit de onderbouwing. Een vijfde kijkt of er belangrijke uitzonderingen zijn vergeten. Is dat slechter dan één menselijke expert? Of is dat in sommige gevallen juist beter?

Daar wil ik voorzichtig in zijn. Meer AI-controle betekent niet automatisch waarheid. Als alle agents dezelfde fout maken, heb je nog steeds een probleem. Als de bronnen niet deugen, helpt extra controle ook niet genoeg. Maar het verandert wel de discussie. We moeten niet alleen vragen of een mens het antwoord heeft gecontroleerd. We moeten ook vragen hoe het antwoord is gecontroleerd, welke bronnen zijn gebruikt, welke onzekerheden zijn gemeld en welke onafhankelijke controles er hebben plaatsgevonden.

De pessimist krijgt minder houvast

Ik denk dat dit de komende tijd veel gaat veranderen in hoe mensen naar AI kijken. De pessimist kon lange tijd zeggen: AI hallucineert, dus ik vertrouw het niet. Dat was een sterk argument. Maar wat gebeurt er als AI steeds vaker zegt: ik kan dit niet betrouwbaar beantwoorden? Wat gebeurt er als AI uit zichzelf bronvermeldingen geeft? Wat gebeurt er als een AI-systeem het antwoord door tientallen controles haalt voordat jij het ziet?

Dan verdwijnt het probleem niet helemaal, maar het wordt wel kleiner en anders. De vraag wordt dan niet meer alleen: kan AI hallucineren? De betere vraag wordt: is dit antwoord controleerbaar genoeg voor deze taak? Bij een creatieve brainstorm maakt dat minder uit. Bij een juridisch advies maakt dat enorm uit. Bij een e-mailconcept is het anders dan bij een medische beslissing. De context bepaalt hoeveel zekerheid je nodig hebt.

Daarmee wordt ook de discussie tussen optimisten en pessimisten minder interessant. De optimist die zegt dat AI alles oplost, ziet de risico's niet scherp genoeg. De pessimist die zegt dat AI altijd verkeerde antwoorden geeft, ziet de ontwikkeling niet scherp genoeg. De werkelijkheid zit ertussenin. AI wordt niet magisch foutloos, maar wel steeds beter in betrouwbaarheid, controleerbaarheid en het erkennen van onzekerheid.

Een woord uit onze tijd

Misschien wordt hallucineren straks een woord uit onze tijd. Niet omdat AI nooit meer fouten maakt, maar omdat het probleem minder centraal wordt. Net zoals we vroeger veel vaker spraken over een internetverbinding die wegviel. Dat kan nog steeds gebeuren, maar het bepaalt niet meer ons hele beeld van internet. Het is een probleem geworden dat kleiner, specifieker en beter beheersbaar is.

Ik denk dat hallucineren met AI ook die kant op kan gaan. Nu is het nog een kernbegrip in bijna elk gesprek over AI. Maar als AI vaker stopt wanneer het iets niet weet, vaker bronnen geeft en vaker gecontroleerd wordt door andere AI-systemen, dan verschuift de discussie. Dan wordt de vraag niet meer: hallucineert AI? Dan wordt de vraag: hoe is dit antwoord onderbouwd, gecontroleerd en begrensd?

En misschien is dat wel het echte teken dat AI volwassen begint te worden. Niet dat het altijd antwoord geeft. Maar dat het soms durft te zeggen: dit weet ik niet zeker genoeg.