AIToday Live

S08E74 - Modelknop vs. effortknop: wanneer draai je aan welke?

Aigency by Info Support Season 8 Episode 74

Use Left/Right to seek, Home/End to jump to start or end. Hold shift to jump forward or backward.

0:00 | 10:37

AI geeft een fout antwoord en de hand gaat automatisch naar het grootste beschikbare model. Dat is de duurste reflex in AI-gebruik, en bijna altijd de verkeerde.

Niels Naglé legt uit wat de modelknop en de effortknop werkelijk doen: de modelknop bepaalt wat een model weet, de effortknop bepaalt hoe grondig het te werk gaat. Die twee sturen iets fundamenteel anders aan, maar worden constant door elkaar gebruikt.

De diagnostische vraag die alles bepaalt: wist het te weinig, of deed het te weinig?

Een model dat een bijlage oversloeg of halverwege stopte heeft een effortprobleem, geen modelprobleem. Een model dat een conclusie verzon die nergens in het document stond, heeft een modelprobleem. Morgen kun je de laatste drie keer terugkijken dat je schakelde naar een groter model, en in vijf minuten vaststellen of je aan de juiste knop draaide.

Onderwerpen

  • Het verschil tussen de modelknop en de effortknop bij AI-gebruik
  • De diagnostische vraag: wist het model te weinig of deed het te weinig
  • Waarom je eerste stap bij een fout antwoord je eigen opdracht moet zijn, niet de knoppen
  • De financiële impact van het verkeerd inzetten van modellen en effort-instellingen
  • Praktische afspraken voor teams over het aanpassen van model- en effort-instellingen
Links

Genoemde entiteiten: Anthropic - Lydia Hallie

Stuur ons een bericht

Aigency
Aigency ontwerpt en ontwikkelt waardevolle, robuuste en betrouwbare Machine Learning-modellen.

Info Support
Info Support is de specialist in maatwerk software en leidend in kunstmatige intelligentie (AI).

Disclaimer: This post contains affiliate links. If you make a purchase, I may receive a commission at no extra cost to you.

Schrijf je in voor onze nieuwsbrief en ontvang exclusieve toegang tot nieuws, blik achter de schermen en meer!

1
00:00:00,000 --> 00:00:04,720
Helaas is Joop ziek, maar we gaan toch verder waar we vorige week gebleven zijn.

2
00:00:05,040 --> 00:00:08,240
Daarom vandaag de korte aflevering met Niels.

3
00:00:10,480 --> 00:00:13,999
Hoi en leuk dat je weer luistert naar een korte aflevering van AIToday Live.

4
00:00:14,000 --> 00:00:18,160
Mijn naam is Niels Naglé, Area Lead Data & AI bij Info Support.

5
00:00:19,119 --> 00:00:25,839
En in deze aflevering gaan we het hebben over twee knoppen waar we vaak aan draaien waaruit blijkt dat we vaak aan de verkeerde draaien.

6
00:00:26,160 --> 00:00:33,439
In deze aflevering ga ik verder waar Joop vorige week het stukje thinking mode heeft ontleed.

7
00:00:33,759 --> 00:00:40,480
Namelijk wat een taalmodel werkelijk doet wanneer het meldt dat het aan het nadenken is, namelijk rekenen.

8
00:00:40,480 --> 00:00:44,000
En legt hij uit waarom denken daar een misleidend woord voor is.

9
00:00:44,000 --> 00:00:46,479
En deze aflevering bouw ik daarop voort.

10
00:00:46,719 --> 00:00:49,840
Want naast de effortknop staat de modelknop.

11
00:00:49,840 --> 00:00:56,399
En de vraag welke van die twee moet je draaien is een interessante vraag waar ik in deze aflevering graag met jullie verder induik.

12
00:00:56,640 --> 00:00:58,799
Laten we even een voorbeeld pakken.

13
00:00:58,960 --> 00:01:00,479
Wie weet herken je dit.

14
00:01:00,480 --> 00:01:07,679
Je vraagt een AI-model om iets uit te zoeken in je werk, een contract na te lopen, een foutmelding uit te pluizen, een berekening te controleren.

15
00:01:08,239 --> 00:01:09,919
Je krijgt het antwoord terug.

16
00:01:09,920 --> 00:01:13,359
Klinkt gedegen, ziet er goed uit, maar is fout.

17
00:01:13,680 --> 00:01:19,439
Het model heeft een bepaling overgeslagen of een conclusie getrokken die nergens in de stukken staat.

18
00:01:19,840 --> 00:01:22,079
En dan is de vraag: wat doe je dan?

19
00:01:22,400 --> 00:01:26,159
Bij de meeste mensen die ik hierover spreek, gaat de hand naar dezelfde knop.

20
00:01:26,159 --> 00:01:28,239
Het uitklapmenu met modellen.

21
00:01:28,239 --> 00:01:30,319
Het kleinere model deed het niet.

22
00:01:30,319 --> 00:01:34,480
Dus we schakelen over naar het grootste en het duurste dat we mogen gebruiken.

23
00:01:34,719 --> 00:01:45,759
En daarnaast zit vaak ook de effortknop met standen als laag, gemiddeld en hoog en die draaien we voor de zekerheid ook maar helemaal open om te komen tot het antwoord en de uitleg die we willen.

24
00:01:46,159 --> 00:01:48,399
Vandaag wil ik het hebben over die twee knoppen.

25
00:01:48,400 --> 00:01:50,719
De modelknop en de effortknop.

26
00:01:50,719 --> 00:01:55,359
Ze staan bijna in elke interface vlak naast elkaar en ze lijken hetzelfde te doen.

27
00:01:55,600 --> 00:01:58,640
En ze doen eigenlijk volstrekt iets anders.

28
00:01:58,640 --> 00:02:06,079
En in deze aflevering gebruiken we daar een artikel voor vanuit Anthropic die ze gepubliceerd hebben ter inspiratie.

29
00:02:06,080 --> 00:02:18,479
Deze publiceerden ze begin juli en is een uitleg van de verschillende knoppen waaraan gedraaid kunnen worden, geschreven door Lydia Hallie van hun technische staf en we zullen de link ook opnemen in de show notes.

30
00:02:18,480 --> 00:02:30,479
Dat is dus wel één leverancierssperspectief die daarin wordt meegenomen, maar hetzelfde principe geldt ook bij OpenAI, bij Google en bij elke leverancier die deze twee instellingen voorschotelt.

31
00:02:31,759 --> 00:02:35,520
Goed, laten we beginnen bij de eerste knop, namelijk de modelknop.

32
00:02:35,519 --> 00:02:39,519
En we gaan er iets verder in dan de aflevering van vorige week.

33
00:02:39,520 --> 00:02:43,199
En we gaan dus even kijken naar het taalmodel.

34
00:02:43,199 --> 00:02:48,079
Die bestaat uit gewichten, miljarden getallen vastgelegd tijdens het trainen.

35
00:02:48,079 --> 00:02:49,680
Daar zit het belangrijke punt.

36
00:02:49,680 --> 00:02:53,919
Op het moment dat jij je vraag verstuurt, staan de getallen al vast.

37
00:02:53,919 --> 00:02:58,879
Niets in jouw opdracht, niets in de documenten die je meestuurt, verandert iets aan die getallen.

38
00:02:59,200 --> 00:03:04,960
Alles wat in het model zit zit vast in die bevroren getallen.

39
00:03:05,279 --> 00:03:07,120
Nu zal je afvragen: wat betekent dat?

40
00:03:07,280 --> 00:03:12,719
Dat betekent wanneer je een ander model kiest, wissel je welke verzameling bevroren getallen jouw vraag behandelt.

41
00:03:12,719 --> 00:03:18,240
Je kan het vergelijken als dat je wisselt van vakgenoot of het vraagt aan een andere collega.

42
00:03:18,240 --> 00:03:21,599
Die heeft andere ervaring en is anders getraind.

43
00:03:21,840 --> 00:03:25,360
En hier zit een onderscheid dat in de praktijk vaak door elkaar loopt.

44
00:03:25,360 --> 00:03:28,560
Namelijk je kunt een model bijsturen met de juiste stukken.

45
00:03:28,560 --> 00:03:34,080
Dus zet de handleiding van jouw systemen erbij en het model werkt er netjes mee en aan voor.

46
00:03:34,080 --> 00:03:35,759
Maar het leert er niets van.

47
00:03:35,759 --> 00:03:38,880
Het is bijsturen, geen bijleren.

48
00:03:38,880 --> 00:03:42,000
Zodra het gesprek voorbij is, is die kennis weg.

49
00:03:42,800 --> 00:03:46,079
Denk bijvoorbeeld aan iemand die voor een opdracht inhuurt, een tijdelijke opdracht.

50
00:03:46,080 --> 00:03:50,799
Je geeft hem een dossier van jouw organisatie waar die verstandig mee omgaat om het werk te doen.

51
00:03:50,799 --> 00:03:56,080
Maar de ervaring die hij meeneemt uit eerdere klussen die verander je niet met een dossier.

52
00:03:56,080 --> 00:03:59,439
Die ervaring heeft hij al en daar bouwt hij op voort.

53
00:04:00,960 --> 00:04:03,119
Dan de tweede knop, de effortknop.

54
00:04:03,120 --> 00:04:09,440
Vorige week noemde Joop effort de hoeveelheid inspanning die het model mag inzetten, gemeten in tijd en in tokens.

55
00:04:09,439 --> 00:04:10,879
Dat blijft staan.

56
00:04:10,879 --> 00:04:17,759
Maar zijn omschrijving was wel wat smal en we gaan in deze net wat verder en de uitleg van Anthropic helpt me daarbij.

57
00:04:18,079 --> 00:04:24,880
Hij hield het bij redeneertokens, dus de lengte van het spoor dat het model aan zichzelf schrijft voordat het jou beantwoordt.

58
00:04:25,120 --> 00:04:28,640
En een enkel antwoord in het chatvenster is dat precies wat het is.

59
00:04:28,639 --> 00:04:35,040
Maar zodra een model gereedschap heeft en zelfstandig stappen zet, stuurt effort veel meer aan.

60
00:04:35,040 --> 00:04:44,879
Namelijk hoeveel bestanden het openslaat, hoe vaak het zijn eigen werk nakijkt, hoe vaak en hoe ver het doorgaat met stappen om de taak te behalen.

61
00:04:45,120 --> 00:04:50,719
En hoe vaak de stappen uitgevoerd mogen worden voordat het bij jou terugkomt.

62
00:04:51,279 --> 00:04:56,000
Bij een lage stand zegt het model eerder: ik heb te weinig om op op te gaan.

63
00:04:56,000 --> 00:04:57,680
Geef me meer context.

64
00:04:57,680 --> 00:05:03,240
Bij een hoge stand gaat het zelf op zoek, controleert het en komt het later terug met meer zekerheid.

65
00:05:03,480 --> 00:05:14,919
En Anthropic geeft één voorbeeld waarin dezelfde opdracht, dus dezelfde opdracht wordt op de hoogste stand en op de laagste stand uitgevoerd.

66
00:05:14,920 --> 00:05:22,439
En bij de hoogste stand ongeveer werden er ongeveer zeven keer zoveel tokens verbrand.

67
00:05:23,879 --> 00:05:27,960
Dus wat hier belangrijk is, zijn de twee dingen die ik hier scherp wil houden.

68
00:05:27,959 --> 00:05:32,599
Namelijk effort stuurt het verbruik, maar begrenst het niet.

69
00:05:32,600 --> 00:05:36,039
De enige harde grens is een maximaal aantal tokens per antwoord.

70
00:05:36,040 --> 00:05:38,759
En dat kapt een antwoord midden in de zin af.

71
00:05:38,759 --> 00:05:41,880
Taakbudgetten zijn een advies waar het model naar luistert.

72
00:05:41,879 --> 00:05:44,680
Geen muur waar het tegenaan loopt.

73
00:05:46,840 --> 00:05:49,080
Laten we het nu wat praktischer maken.

74
00:05:49,399 --> 00:05:57,160
En Anthropic geeft één diagnostische vraag mee die ik echt goud waard vind en die ik aanraad om voor jezelf te hanteren.

75
00:05:57,159 --> 00:06:01,560
Namelijk wanneer het antwoord niet klopt, vraag je jezelf dan het volgende af.

76
00:06:01,879 --> 00:06:05,879
Wist het te weinig of deed het te weinig.

77
00:06:06,439 --> 00:06:11,959
Deed het te weinig, dan hoor je aan wat er ontbreekt, namelijk het sloeg een bijlage over.

78
00:06:11,959 --> 00:06:14,120
Het liet de controle achterwegen.

79
00:06:14,120 --> 00:06:16,920
Het stopte halverwege een klus die af moest.

80
00:06:17,079 --> 00:06:19,560
Dan hebben we met de effortknop te maken.

81
00:06:20,039 --> 00:06:21,720
Wist het te weinig?

82
00:06:21,720 --> 00:06:23,560
Dat merk je weer aan iets anders.

83
00:06:23,560 --> 00:06:27,160
Het had namelijk alles wat het nodig had voor de opdracht.

84
00:06:27,159 --> 00:06:29,079
Het deed keurig zijn werk.

85
00:06:29,079 --> 00:06:32,680
Er kwam toch een antwoord uit dat aantoonbaar niet klopte.

86
00:06:32,680 --> 00:06:35,080
Dan gaan we richting de modelknop.

87
00:06:35,079 --> 00:06:39,080
Dan wil je misschien een capabel model, een groot model, een ander model.

88
00:06:39,079 --> 00:06:44,279
En zo'n model gaat ook beter om met opdrachten die niet helemaal helder zijn.

89
00:06:44,279 --> 00:06:49,160
Terwijl een klein model prima gedijt bij hele precieze instructies.

90
00:06:49,480 --> 00:06:54,200
Dus weten hoort bij het model, doen bij de effort.

91
00:06:54,199 --> 00:06:59,480
Dus als we die twee onthouden, dan kunnen we daarin de afweging maken naar de knoppen.

92
00:06:59,720 --> 00:07:03,240
Het aardige is ook dat de vraag ook de andere kant op werkt.

93
00:07:03,240 --> 00:07:05,000
En dat is een hele waardevolle.

94
00:07:05,000 --> 00:07:12,040
Namelijk doe je al een week routinewerk op het grootste model, stap dan een keertje naar beneden naar een klein model.

95
00:07:12,040 --> 00:07:16,599
Sneller, goedkoper en mogelijk zelfs zonder dat de kwaliteit inzakt.

96
00:07:19,159 --> 00:07:26,759
En dan het advies dat het meest beviel, omdat het ook nog eens van een leverancier kwam en tegen zijn eigen omzet in gaat.

97
00:07:26,759 --> 00:07:31,080
Wanneer het misgaat is je eerste stap niet gelijk naar de knop toe.

98
00:07:31,080 --> 00:07:33,480
Je eerste stap is je eigen opdracht.

99
00:07:33,480 --> 00:07:45,960
Was je vraag te vaag, had het model wel toegang tot de juiste systeeminformatie, ontbrak er een stuk informatie dat voor jou vanzelfsprekend was, maar nog niet meegegeven was in de context.

100
00:07:46,279 --> 00:07:48,680
Ga eerst naar die stap toe.

101
00:07:49,000 --> 00:07:55,399
Draai je dan de effortknop open voor een taak die dat niet nodig zou hebben, dan ligt de oorzaak bijna altijd een stap eerder.

102
00:07:55,639 --> 00:08:00,360
Namelijk wat je meestuurde en hoe scherp je de klus had afgebakend.

103
00:08:00,840 --> 00:08:02,919
Dus een hele belangrijke.

104
00:08:03,159 --> 00:08:07,800
Want de reflex om aan de knoppen te draaien, kost geld.

105
00:08:11,320 --> 00:08:19,719
En om het maar even heel blunt te zeggen: een slechte opdracht wordt niet beter van een grote motor om het op te lossen.

106
00:08:20,919 --> 00:08:22,680
Over geld gesproken.

107
00:08:22,680 --> 00:08:24,199
Dat is ook wel een belangrijke.

108
00:08:24,200 --> 00:08:30,839
Want bij routinematig werk verbruikt het grotere model meer tokens, want het controleert meer.

109
00:08:31,320 --> 00:08:34,520
En daarnaast is ook elke token nog eens duurder.

110
00:08:34,519 --> 00:08:38,039
Je betaalt het al dus twee keer voor hetzelfde resultaat, namelijk meer tokens.

111
00:08:38,039 --> 00:08:40,360
Tegen ook wel eens een hoog tarief.

112
00:08:40,360 --> 00:08:43,080
Dus wees je bewust van wat je daar kiest.

113
00:08:43,079 --> 00:08:46,279
Bij zwaar meerstapswerk kan dat best wel kantelen.

114
00:08:46,279 --> 00:08:52,200
Het kleinere model dat ploetert tegen de grens van zijn kunnen aan en verbrandt beurt na beurt tokens.

115
00:08:52,839 --> 00:08:56,279
Dan is het misschien interessant om te kijken naar het grotere model.

116
00:08:56,279 --> 00:08:59,160
Die haalt dezelfde lat in minder stappen.

117
00:08:59,159 --> 00:09:05,240
Per afgeronde taak kan het dan goedkoper uitpakken, ook al betaal je per token individueel meer.

118
00:09:05,240 --> 00:09:10,200
Dus zo is het goed om die afweging te maken welk model je moet gaan gebruiken.

119
00:09:10,519 --> 00:09:17,960
In de column van Joop over tokenmaxxing had hij het over organisaties die tokenverbruik gaan meten als bewijs van productiviteit.

120
00:09:17,960 --> 00:09:20,039
Dat is de andere kant van de medaille.

121
00:09:20,039 --> 00:09:22,279
Het verbruik zelf zegt nog niets.

122
00:09:22,279 --> 00:09:27,320
Wat iets zegt is of je je knop paste bij het soort fout dat je hebt gemaakt.

123
00:09:27,799 --> 00:09:31,720
Als we kijken naar een team, wat betekent dat voor drie afspraken?

124
00:09:32,360 --> 00:09:36,199
De standaardinstelling voor dagelijks werk laat je staan.

125
00:09:36,440 --> 00:09:41,000
We pakken een capabel model wanneer een probleem echt taai blijkt.

126
00:09:41,000 --> 00:09:48,000
En iemand die houdt in het team in de gaten en weet ook aan welke knoppen hij of zij moet draaien bij welke fout.

127
00:09:52,159 --> 00:09:57,200
De modelknop en de effortknop zijn dus geen twee standen van dezelfde regelaar.

128
00:09:57,200 --> 00:10:00,559
De modelknop bepaalt hoeveel je vakgenoot weet.

129
00:10:00,559 --> 00:10:04,320
De effortknop bepaalt hoe grondig die vandaag te werk gaat.

130
00:10:04,320 --> 00:10:05,919
Klopt het volgende antwoord niet?

131
00:10:05,919 --> 00:10:15,600
Begin dan bij je eigen opdracht en daarna wist het te weinig of deed het te weinig, want weten is het model, doen is de effort.

132
00:10:15,600 --> 00:10:19,120
Dat scheelt je geld en scheelt je een hoop gepruts.

133
00:10:19,679 --> 00:10:35,200
Wil je nou meer op de hoogte blijven van dit soort ontwikkelingen zonder daar zelf helemaal in te overduiken, volg dan AIToday Live in je podcastapp, dan mis je geen aflevering en bedenk zoals Joop altijd zo mooi zegt: AI is niet de oplossing voor elk probleem, maar onmisbaar waar het past.