Een aardig, misschien ietwat activistisch, stukje van een onderzoeker op LinkedIn geplukt (ChatGPT vertaling). Hij beschrijft precies wat ik steeds vaker (o.a. bij collega's) zie, 'even aan Chat vragen' en er dan als grondhouding erop vertrouwen dat de output ook klopt - maar is dat ook zo?
60% VAN DE TIJD FOUT:
ChatGPT. Gemini. Grok. Perplexity. Copilot. DeepSeek
Premiummodellen, $20 tot $40 per maand, presteerden
slechter dan gratis versies.⁵
Hogere kosten. Hogere zekerheid.
Hogere foutpercentages.
Het Tow Center van Columbia University testte acht AI-zoekmachines op de simpelst denkbare taak:
Krijg je een rechtstreeks fragment uit een nieuwsartikel, identificeer dan de kop, uitgever, datum en URL.¹
Gezamenlijk gaven ze
meer dan 60% van de tijd een verkeerd antwoord.²
Niet op complexe redeneringen.
Niet op genuanceerde analyses.
Niet op toekomstvoorspellingen.
Maar op het
vermelden van hun bronnen.
Een gewone Google-zoekopdracht doet dit in één keer goed.
De individuele resultaten:
- Grok 3: 94% fout
- Gemini: 1 juist antwoord van de 200
- ChatGPT: 67% fout
- Perplexity: 37% fout (beste van de test)
Maar het foutpercentage is niet het echte probleem.
Het is de zekerheid.
ChatGPT gaf 134 keer onjuiste informatie. Het gaf slechts 15 keer aan onzeker te zijn.³
Het zei
nooit “Ik weet het niet.”
Nooit. Eén keer.
Grok 3 kreeg niet alleen bronnen fout, het
verzón ze.
Van de 200 zoekopdrachten leidden 154 verwijzingen naar verzonnen URLs.⁴
Pagina’s die niet bestaan.
Bewijs dat er nooit was.
Ze maken geen fouten.
Ze
fabriceren bewijs.
En hier wordt het absurd:
Denk eens na over waar deze tools worden ingezet.
Code schrijven. Contracten samenvatten. Beleggingsbeslissingen informeren. Juridische stukken opstellen. Medische informatie genereren.
Als ze al geen nieuwsartikel — de meest basale test van intellectuele eerlijkheid — correct kunnen citeren,
wat fabriceren ze dan nog meer met absolute zekerheid?
De onderzoekers waren duidelijk:
“De meeste tools die we testten presenteerden onnauwkeurige antwoorden met alarmerende zekerheid.”⁶
Dit is geen bug die je kunt patchen.
Dit
is hoe de architectuur werkt.
Grote taalmodellen
weten niets. Ze voorspellen wat
plausibel klinkt.
Ze hebben geleerd dat zelfvertrouwen wordt beloond — nauwkeurigheid maakt niet uit.
We bouwen kritieke infrastructuur op fundamenten die
60–94% van de tijd falen.
De kunst met technologie is te voorkomen dat je duisternis met de snelheid van het licht verspreidt.
Stephen Klein
Founder & CEO, Curiouser.AI
Docent, UC Berkeley Haas School of Business
WeFunder (link in comments)
Bronnen:
¹ Columbia Journalism Review, Tow Center for Digital Journalism, “AI Search Has A Citation Problem,” 6 maart 2025 – Studie analyseerde 1.600 zoekopdrachten over 8 AI-zoektools
² Ibid. – “Gezamenlijk gaven ze meer dan 60% van de zoekopdrachten een onjuist antwoord”
³ Ibid. – ChatGPT “signaleerde slechts vijftien keer onzekerheid in tweehonderd antwoorden en weigerde nooit een antwoord te geven”
⁴ Ibid. – “Van de 200 prompts die we testten voor Grok 3 leidden 154 verwijzingen naar foutpagina’s”
⁵ Ibid. – Premiummodellen “vertoonden hogere foutpercentages… neiging om stellige maar verkeerde antwoorden te geven”
⁶ Ibid. – Letterlijk citaat van de auteurs van de studie
Bron:
AI Search Tools Fail to Cite Sources Accurately | Stephen Klein posted on the topic | LinkedIn
Ik post deze jongedame met haar wijze woorden nog maar eens een keertje: