AIToday Live

S08E66 - Vibe citations: waarom de waarschuwing niet genoeg is

Aigency by Info Support Season 8 Episode 66

Use Left/Right to seek, Home/End to jump to start or end. Hold shift to jump forward or backward.

0:00 | 11:29

Drie van de vier grootste adviesbureaus ter wereld publiceerden rapporten met bronverwijzingen die niet kloppen — titels die niet bestaan, rechters die uitspraken nooit deden. Bij KPMG waren 40 van de 45 bronnen verzonnen of incorrect, en dat terwijl het rapport door tientallen reviewers ging.

Dat komt door vier patronen: automation bias maakt je minder kritisch naarmate je AI meer vertrouwt, nette opmaak laat nepbronnen eruitzien als echte, en gedeelde verantwoordelijkheid betekent in de praktijk dat niemand controleert.

Extra waarschuwingen lossen dit niet op — de structuur moet anders.

Pak één AI-gegenereerd document uit je organisatie en controleer drie bronverwijzingen willekeurig: als één niet klopt, heb je een structureel probleem. Morgen kun je dat gat dichten door verificatie aan één persoon toe te wijzen met een naam en een deadline, en een tool zoals GPTZero in je workflow op te nemen.

Onderwerpen

  • Vibe citations: AI-modellen die niet-bestaande bronverwijzingen genereren
  • Automation bias: waarom vertrouwen in AI kritisch denken vermindert
  • Het omstanderseffect in reviewprocessen: gedeelde verantwoordelijkheid leidt tot geen controle
  • Praktische maatregelen: verificatie automatiseren en expliciet toewijzen
Links

Genoemde entiteiten: KPMG - Deloitte - Ernst & Young - GPTZero - Microsoft - Carnegie Mellon - Universiteit van Melbourne

Stuur ons een bericht

Aigency
Aigency ontwerpt en ontwikkelt waardevolle, robuuste en betrouwbare Machine Learning-modellen.

Info Support
Info Support is de specialist in maatwerk software en leidend in kunstmatige intelligentie (AI).

Disclaimer: This post contains affiliate links. If you make a purchase, I may receive a commission at no extra cost to you.

Schrijf je in voor onze nieuwsbrief en ontvang exclusieve toegang tot nieuws, blik achter de schermen en meer!

1
00:00:02,560 --> 00:00:05,919
Hoi, welkom weer bij de korte aflevering van AIToday Live.

2
00:00:05,919 --> 00:00:08,800
Ik ben Joop Snijder, Head of AI bij Info Support.

3
00:00:09,120 --> 00:00:13,200
Vandaag gaan we het hebben over vibe citations.

4
00:00:14,000 --> 00:00:19,919
En om duidelijk te maken wat dat is, ga ik je eerst even meenemen naar een rapport.

5
00:00:19,920 --> 00:00:26,079
En wel een rapport van een van de meest gerespecteerde adviesbureaus ter wereld met een titel die er niet om liegt.

6
00:00:26,320 --> 00:00:30,160
Redefining Excellence in the Age of Agentic AI.

7
00:00:30,160 --> 00:00:32,959
Een wereldwijde studie naar klantbeleving.

8
00:00:32,960 --> 00:00:38,640
En achterin 45 bronverwijzingen netjes genummerd met auteur, titel en jaartal.

9
00:00:38,640 --> 00:00:41,280
Alles wijst op degelijk werk.

10
00:00:41,280 --> 00:00:46,799
Op één ding na, namelijk van die 45 bronnen kloppen er vijf.

11
00:00:46,799 --> 00:00:47,679
Vijf.

12
00:00:47,679 --> 00:00:48,800
De rest niet.

13
00:00:49,039 --> 00:00:52,159
Veertig titels bleken verzonnen.

14
00:00:52,160 --> 00:00:57,199
Sommige verwijzingen plakken de schrijvers van het ene stuk op de titel van een ander stuk.

15
00:00:57,199 --> 00:01:00,719
Eén verwijst naar een persbericht uit 2019.

16
00:01:01,039 --> 00:01:04,719
Over een technologie die in 2019 nog niet eens bestond.

17
00:01:06,000 --> 00:01:08,719
GPTZero heeft dit uitgezocht.

18
00:01:08,719 --> 00:01:15,839
GPTZero die bouwt naar eigen zeggen verantwoorde AI-producten, waaronder een tool die dus verzonnen bronnen opspoort.

19
00:01:15,840 --> 00:01:19,359
En met die tool haalden ze dit boven tafel.

20
00:01:19,599 --> 00:01:22,560
En die conclusie is moeilijk te ontkennen.

21
00:01:22,560 --> 00:01:27,439
Hier heeft een AI-tool de bronnen verzonnen en niemand heeft het gecontroleerd.

22
00:01:27,759 --> 00:01:29,920
Niks nieuws, zou je denken.

23
00:01:29,920 --> 00:01:33,759
Maar ik wil wat dieper zo directe induiken van.

24
00:01:34,000 --> 00:01:35,439
Wat is hier nou aan de hand.

25
00:01:35,920 --> 00:01:40,239
Het leuke is: GPTZero noemt dit vibe citations.

26
00:01:40,239 --> 00:01:41,439
Best wel een mooie term.

27
00:01:41,439 --> 00:01:44,479
Je kent misschien vibe coding, programmeren op gevoel.

28
00:01:44,480 --> 00:01:47,759
De AI laten doen en dan hopen dat het klopt.

29
00:01:48,000 --> 00:01:51,679
Vibe citations is laten we zeggen het bronnenbroertje hiervan.

30
00:01:51,679 --> 00:01:55,120
Dus een verwijzing die de juiste vibe heeft.

31
00:01:55,120 --> 00:02:00,079
Hij heeft de vorm van een echte bron auteur, titel, jaartal, uitgever.

32
00:02:00,399 --> 00:02:02,959
Daardoor voelt hij betrouwbaar.

33
00:02:02,959 --> 00:02:04,719
Tot je hem echt nakijkt.

34
00:02:04,719 --> 00:02:07,040
En dan blijkt de titel net iets anders.

35
00:02:07,040 --> 00:02:10,319
De auteur verwisseld of de hele bron bestaat niet.

36
00:02:10,560 --> 00:02:15,120
Het is een citaat dat klinkt als een citaat zonder de inhoud van het citaat.

37
00:02:15,120 --> 00:02:17,280
Maar hier wordt het interessant.

38
00:02:17,280 --> 00:02:20,879
Want dit bureau is niet het enige.

39
00:02:20,879 --> 00:02:26,400
GPTZero vond hetzelfde patroon bij Deloitte en Ernst & Young.

40
00:02:27,599 --> 00:02:31,200
Ik moet er wel even bij zeggen: die andere is van KPMG waar we het over hebben.

41
00:02:31,519 --> 00:02:35,599
Dus drie van de vier grootste adviesbureaus ter wereld.

42
00:02:35,840 --> 00:02:38,000
Die hebben hier last van gehad.

43
00:02:38,159 --> 00:02:43,039
Deloitte moest in Australië zelfs een deel van een overheidsopdracht terugbetalen.

44
00:02:43,039 --> 00:02:50,879
Nadat een onderzoeker had vastgesteld dat een rapport verwees naar boeken die niet bestaan en een rechter citeerde die dat nooit had gezegd.

45
00:02:51,599 --> 00:02:54,640
En daar moeten we toch even bij stilstaan.

46
00:02:54,639 --> 00:03:03,199
Want dit zijn dus bedrijven, organisaties die bestaan bij de gratie van hun reputatie.

47
00:03:03,199 --> 00:03:05,519
En daar gaan ze echt niet lichtzinnig mee om.

48
00:03:05,519 --> 00:03:12,319
Dat betekent dat zo'n rapport waarschijnlijk is gelezen door derden, nagekeken, gecorrigeerd, misschien zelfs in meerdere rondes.

49
00:03:12,319 --> 00:03:16,239
En toch heeft niemand die bronnen goed gecontroleerd.

50
00:03:16,479 --> 00:03:18,000
En we weten dit allemaal.

51
00:03:18,240 --> 00:03:27,120
Je krijgt overal te horen: misschien heb je dat nu net al ergens of zo tegen hardop geroepen met dit verhaal: controleer je bronnen.

52
00:03:27,120 --> 00:03:29,280
Een taalmodel verzint dingen.

53
00:03:29,280 --> 00:03:33,280
Die waarschuwing wordt zo vaak herhaald dat hij bijna obligaat is geworden.

54
00:03:33,439 --> 00:03:41,840
Het begint te klinken als die opdreunende stem onder een reclame van een financieel product in het verleden behaalde resultaten bieden geen garantie voor de toekomst.

55
00:03:41,840 --> 00:03:46,079
We horen het aan, knikken en gaan over tot de orde van de dag.

56
00:03:46,479 --> 00:03:49,280
En dan komen we eigenlijk bij de echte vraag.

57
00:03:49,600 --> 00:03:54,879
Want tot zover is dit gewoon een fout, foutje bedankt, kan iedereen gebeuren.

58
00:03:55,759 --> 00:03:58,319
Wat mij betreft is dat het saaie deel van het verhaal.

59
00:03:58,319 --> 00:04:00,879
Het interessante deel is de vraag erachter.

60
00:04:01,119 --> 00:04:03,680
Waarom kan dit nou zo gemakkelijk gebeuren?

61
00:04:03,679 --> 00:04:11,759
Niet bij een student die om twee uur 's nachts een deadline haalt, maar bij wat ze zelf in ieder geval vinden, de top van de top.

62
00:04:11,840 --> 00:04:17,360
Dus met alle reviewrondes, alle reputatie, alle expertise die je kunt voorstellen.

63
00:04:18,560 --> 00:04:21,760
Want als het hier gebeurt op dit niveau, dan gebeurt het overal.

64
00:04:21,759 --> 00:04:23,360
En dan hebben we geen incident.

65
00:04:23,360 --> 00:04:25,039
Wat mij betreft hebben we dan een patroon.

66
00:04:25,199 --> 00:04:29,040
Een patroon los je niet op met controleer je bronnen.

67
00:04:29,040 --> 00:04:31,600
Want die boodschap is al lang doorgekomen.

68
00:04:31,600 --> 00:04:34,560
Blijkbaar ligt er iets anders aan de grondslag.

69
00:04:35,199 --> 00:04:40,879
En ik denk vier dingen die er zijn die elkaar daarin versterken.

70
00:04:40,879 --> 00:04:42,639
Laten we die eens even aflopen.

71
00:04:42,879 --> 00:04:43,759
Eén.

72
00:04:44,400 --> 00:04:46,000
We vertrouwen de machine.

73
00:04:46,000 --> 00:04:48,800
Het eerste heet namelijk automation bias.

74
00:04:48,800 --> 00:04:55,439
De neiging om te leunen op een geautomatiseerd systeem en de uitkomsten ervan te vertrouwen in plaats van zelf nog scherp na te kijken.

75
00:04:55,599 --> 00:04:59,199
Onderzoek laat zien dat we daarbij minder vaak controleren dan zou moeten.

76
00:04:59,200 --> 00:05:03,160
En dat de uitkomst van de machine onze eigen waakzaamheid vervangt.

77
00:05:03,160 --> 00:05:12,360
En dat effect wordt sterker onder precies de omstandigheden waarin een adviesrapport ontstaat: gezag, werkdruk, deadlines.

78
00:05:12,839 --> 00:05:15,240
En er speelt iets bijzonders mee.

79
00:05:15,240 --> 00:05:17,719
De AI-tool was niet ongehoorzaam.

80
00:05:17,720 --> 00:05:19,639
Hij was juist te gehoorzaam.

81
00:05:19,639 --> 00:05:32,199
Hij kreeg de opdracht om voorbeelden te vinden van bedrijven met agentische AI en die werden geleverd, ook waar ze niet bestonden, vragen een model om voorbeelden en het komt met voorbeelden, of ze nou kloppen of niet.

82
00:05:34,519 --> 00:05:37,800
Controleren voelt als zelfsabotage.

83
00:05:37,800 --> 00:05:39,480
Dit patroon zit dieper.

84
00:05:39,480 --> 00:05:46,359
Een groot onderzoek van Microsoft en Carnegie Mellon, onder ruim 300 kenniswerkers vond iets ongemakkelijks.

85
00:05:46,360 --> 00:05:51,000
Hoe meer je op AI vertrouwt, hoe minder kritisch je zelf nadenkt.

86
00:05:51,159 --> 00:05:56,200
Let op de richting en juist wie veel vertrouwen heeft in de tool, denkt het minst kritisch mee.

87
00:05:56,199 --> 00:05:59,639
En dat klinkt als luiheid, maar het is logischer dan dat.

88
00:05:59,639 --> 00:06:05,720
Een AI-tool bestaat juist om je werk uit handen te nemen, om moeite te besparen.

89
00:06:05,720 --> 00:06:08,439
En dan is controleren, moeite, dus.

90
00:06:08,439 --> 00:06:11,720
Precies het ding dat het nut van de tool lijkt te ondergraven.

91
00:06:11,720 --> 00:06:15,560
Waarom zou je een assistent inhuren en daarna al zijn werk overdoen?

92
00:06:15,560 --> 00:06:20,920
Zo zit er een rem op de verificatie ingebouwd, in de tool en in onszelf.

93
00:06:20,920 --> 00:06:25,240
En ik moet je eerlijk zeggen, ik zeg dit niet als buitenstaander, ik merk het zelf ook.

94
00:06:25,879 --> 00:06:32,759
Dat verschil tussen iets fijn uit handen geven en de moeite die het kost om het echt na te lopen, dat blijft gewoon lastig.
95
00:06:32,759 --> 00:06:34,520
Ik probeer zorgvuldig te zijn.
 95
00:06:34,519 --> 00:06:39,000
En eerlijk gezegd vind ik het ook leuk om me in zo'n bron helemaal te verdiepen.
 96
00:06:39,000 --> 00:06:41,960
Dat kost tijd en die tijd neem je niet altijd.
 97
00:06:41,959 --> 00:06:44,439
Ik heb vast ook fouten gemaakt en ik zal ze nog maken.
 98
00:06:44,600 --> 00:06:45,719
Dit is geen makkelijk punt.
 99
00:06:45,720 --> 00:06:49,399
Het is echt een belangrijk punt.
 100
00:06:49,720 --> 00:06:54,839
Het verschil tussen gemak en de moeite die je er alsnog in moet steken.
 101
00:06:55,399 --> 00:06:57,160
Dan nummer 3.
 102
00:06:57,159 --> 00:06:59,960
Een nepbron met de juiste vibe.
 103
00:07:00,039 --> 00:07:07,400
Derde patroon verklaart waarom die verzonnen verwijzingen door de controle heen glippen.
 104
00:07:07,480 --> 00:07:10,840
Ons brein gebruikt namelijk gemak als signaal voor waarheid.
 105
00:07:10,840 --> 00:07:13,640
Wat vlot en moeiteloos binnenkomt, voelt waar.
 106
00:07:13,960 --> 00:07:18,680
Onderzoeken hebben dit keer op keer aangetoond.
 107
00:07:19,000 --> 00:07:29,319
Zelfs dezelfde tekst, maar dan in een nette, goed leesbare opmaak, komt geloofwaardiger over dan diezelfde tekst in een rommelige opmaak.
 108
00:07:29,560 --> 00:07:32,920
En AI-tekst is het toppunt van gemak.
 109
00:07:32,920 --> 00:07:36,680
Vlot, zelfverzekerd en bij die bron in exact de juiste vorm.
 110
00:07:36,680 --> 00:07:39,000
Auteur, titel, jaartal, uitgever.
 111
00:07:39,000 --> 00:07:44,199
Een nepbron heeft daardoor precies dezelfde gladde buitenkant als een echte.
 112
00:07:44,439 --> 00:07:46,759
Wie het dan vlug doorneemt, die merkt niet.
 113
00:07:46,759 --> 00:07:47,560
Vorm klopt.
 114
00:07:47,560 --> 00:07:50,360
Dus we nemen aan dat de inhoud ook klopt.
 115
00:07:50,360 --> 00:07:52,519
De vibe doet de rest.
 116
00:07:53,240 --> 00:07:54,520
En nummer vier.
 117
00:07:54,519 --> 00:07:58,599
Dat is ook wel een hele interessante, dat is namelijk iedereen wijst naar iemand anders.
 118
00:07:58,759 --> 00:08:01,720
Het vierde patroon gaat over de pijnlijkste vraag.
 119
00:08:01,879 --> 00:08:07,000
Het rapport ging waarschijnlijk door zoveel handen en juist daardoor controleerde niemand de bron.
 120
00:08:07,240 --> 00:08:10,040
Psychologen noemen dit het omstanderseffect.
 121
00:08:10,519 --> 00:08:13,720
Onderzoekers toonden al in 1968 aan.
 122
00:08:13,720 --> 00:08:17,319
Hoe meer mensen erbij zijn, hoe kleiner de kans dat iemand ingrijpt.
 123
00:08:17,319 --> 00:08:22,759
Niet uit onverschilligheid, maar omdat de verantwoordelijkheid zich uitsmeert over de groep.
 124
00:08:22,839 --> 00:08:27,800
Twee dingen maken dit concreet voor binnen een kantoorsetting.
 125
00:08:28,120 --> 00:08:35,639
Ten eerste, verantwoordelijkheid verdwijnt in een wolk van gedeelde mails, vage rollen, eindeloze cc's.
 126
00:08:35,639 --> 00:08:41,319
Iedereen gaat ervan uit dat een ander wel aan de bel trekt, dus trekt niemand aan de bel.
 127
00:08:41,320 --> 00:08:46,199
En ten tweede, we nemen aan dat wie meer status heeft ook meer verantwoordelijkheid draagt.
 128
00:08:46,360 --> 00:08:47,799
De junior denkt.
 129
00:08:47,799 --> 00:08:50,360
Ja, die senior partner keurt dit vast goed.
 130
00:08:50,360 --> 00:08:53,399
De partner denkt de analist heeft dit vast nagekeken.
 131
00:08:53,399 --> 00:08:55,080
De reviewer die denkt weer.
 132
00:08:55,319 --> 00:08:57,159
Dit komt van een gerenommeerd team.
 133
00:08:57,160 --> 00:08:58,439
Dus het zal wel kloppen.
 134
00:08:58,440 --> 00:09:00,600
Iedereen wijst naar iemand anders.
 135
00:09:00,600 --> 00:09:03,240
De bron controleert niemand.
 136
00:09:03,399 --> 00:09:05,320
En dan het mooiste van allemaal.
 137
00:09:06,039 --> 00:09:14,120
KPMG voerde samen met de Universiteit van Melbourne het grootste onderzoek ter wereld uit naar vertrouwen in AI.
 138
00:09:14,120 --> 00:09:17,480
48.000 mensen, 47 landen.
 139
00:09:17,480 --> 00:09:20,440
En een van de uitkomsten, het is misschien gek voor woorden.
 140
00:09:20,519 --> 00:09:25,559
Tweederde van de mensen gebruikt AI-output zonder de juistheid te controleren.
 141
00:09:25,559 --> 00:09:30,360
En meer dan de helft maakt door AI-fouten in het werk.
 142
00:09:31,319 --> 00:09:32,759
Laat het even bezinken.
 143
00:09:32,759 --> 00:09:35,879
Dus KPMG heeft dit zelf onderzocht.
 144
00:09:35,879 --> 00:09:40,399
Hij heeft dat dus uiteindelijk ook gewoon in een rapport geschreven, gepubliceerd het.
 145
00:09:40,399 --> 00:09:43,639
En liet het vervolgens precies zo gebeuren in het eigen rapport.
 146
00:09:43,960 --> 00:09:49,759
Het patroon dat ze documenteerden voltrok zich binnen de muren van de organisatie die het documenteerde.
 147
00:09:51,600 --> 00:09:55,040
Dit is geen verhaal over één slordig bureau.
 148
00:09:55,039 --> 00:09:58,080
En je zou erom kunnen lachen, maar het is eerder een spiegel.
 149
00:09:58,399 --> 00:10:02,800
Het is een spiegel van wat wij allemaal zelf ook doen.
 150
00:10:04,320 --> 00:10:06,879
Laatste is natuurlijk: ja, maar wat doe je dan hier aan?
 151
00:10:06,879 --> 00:10:10,320
En dat is niet nog een keer een waarschuwing, want dat werkt niet.
 152
00:10:10,320 --> 00:10:12,960
Dat is juist het hele punt wat ik hier wil maken.
 153
00:10:13,519 --> 00:10:15,680
Je moet je werk veranderen.
 154
00:10:15,679 --> 00:10:20,480
Maak het controleren goedkoop en automatisch, zodat het geen wilskracht meer kost.
 155
00:10:20,480 --> 00:10:25,200
Er bestaan inmiddels tools zoals bijvoorbeeld GPTZero.
 156
00:10:25,440 --> 00:10:27,360
Of je maakt zelf iets.
 157
00:10:27,360 --> 00:10:32,959
Maar maak het nakijken ook iemands expliciete taak met een naam erin.
 158
00:10:32,960 --> 00:10:35,679
Dus in plaats van iets wat in de cc's verdampt.
 159
00:10:35,919 --> 00:10:39,600
En natuurlijk stem je vertrouwen af op wat de tool echt kan.
 160
00:10:39,600 --> 00:10:48,639
Voor het vlot opschrijven van een verhaal is een taalmodel echt wel heel handig, voor het opleveren van kloppende bronnen is het gewoon zwak.
 161
00:10:48,639 --> 00:10:50,159
Dat is geen falen van de techniek.
 162
00:10:50,159 --> 00:10:52,399
Dat is weten waar je hem voor inzet.
 163
00:10:52,399 --> 00:10:54,719
Dus direct na deze aflevering.
 164
00:10:54,720 --> 00:10:59,760
Voordat je iets anders doet, pak je één document dat je organisatie recent met AI heeft gemaakt.
 165
00:10:59,759 --> 00:11:01,120
En stel één vraag.
 166
00:11:01,120 --> 00:11:04,960
Wie heeft de bronnen echt gecontroleerd en kunnen we dat ook aantonen?
 167
00:11:05,039 --> 00:11:10,639
Kan niemand die vraag beantwoorden, heb je een gat in je review te pakken.
 168
00:11:12,080 --> 00:11:14,720
Bedenk sowieso natuurlijk zoals altijd.
 169
00:11:17,120 --> 00:11:19,120
Onmisbaar waar het past.
 170
00:11:20,720 --> 00:11:22,319
Leuk dat je weer luisterde.
 171
00:11:22,319 --> 00:11:24,080
Tot volgende week.