Studie waarschuwt dat herhaaldelijk druk uitoefenen op AI-chatbots desinformatie kan vergroten
Een nieuwe studie heeft zorgen geuit over de betrouwbaarheid van kunstmatige intelligentie-chatbots, waarbij is vastgesteld dat herhaaldelijk uitdagen of onder druk zetten van deze systemen om valse informatie te accepteren soms de kans vergroot dat ze uiteindelijk instemmen met misleidende beweringen.
Onderzoekers van de Universiteit van Arizona hebben zeven AI-modellen getest, waaronder GPT-3.5, GPT-4o, GPT-4o-mini, Claude 3.5 Sonnet, Gemini 1.5 Pro, Llama 3 70B en DeepSeek-R1. In plaats van een enkele reactie te evalueren, voerden de onderzoekers uitgebreide gesprekken waarin de modellen herhaaldelijk werden blootgesteld aan onjuiste uitspraken.
Het experiment omvatte 100 valse claims die een breed scala aan onderwerpen besloegen, van duidelijk onzinnige beweringen tot meer ambiguïteit. Onderzoekers herhaalden de desinformatie tot wel 50 keer binnen hetzelfde gesprek om te bepalen of de systemen uiteindelijk hun reacties zouden veranderen.
Geen van de zeven modellen bleek volledig resistent tegen het effect. GPT-3.5 toonde het hoogste percentage instemming met valse claims, waarbij het deze accepteerde in 12,3% van de interacties. Claude 3.5 Sonnet registreerde het laagste percentage, met slechts 0,08%, terwijl GPT-4o en GPT-4o-mini onder de 1% bleven.
De onderzoekers ontdekten dat GPT-3.5 aanvankelijk 96 van de 100 geteste valse claims afwees. Nadat de claims 50 keer waren herhaald, stemde het model uiteindelijk in met 18 daarvan.
Een ander patroon dat in het onderzoek werd vastgesteld, was wat de onderzoekers beschrijven als “wankelheid”, waarbij sommige AI-systemen herhaaldelijk wisselden tussen het accepteren en afwijzen van dezelfde misleidende informatie.
De studie suggereerde ook dat ambiguïteit AI-modellen kwetsbaarder kan maken voor desinformatie. Claims over onderwerpen met beperkte of onduidelijke informatie online werden eerder geaccepteerd tijdens herhaalde interacties, waarbij de onderzoekers een statistisch significante relatie identificeerden tussen ambiguïteit en vatbaarheid voor misleidende claims.
De onderzoekers onderzochten verder of meer confronterende uitwisselingen de modellen konden beïnvloeden. De meeste systemen bleven relatief stabiel, maar DeepSeek-R1 toonde een merkbare toename in de acceptatie van desinformatie wanneer het werd onderworpen aan argumentatieve druk. Het acceptatiepercentage steeg van 1% tijdens eenvoudige herhaling naar 22,2% onder meer confronterende omstandigheden.
Het gebruik van sarcasme en herhaalde humoristische reacties maakte sommige interacties ook moeilijker voor onderzoekers om consistent te classificeren.
Er was echter een bemoedigende bevinding toen de modellen de kans kregen om eerdere fouten te heroverwegen. GPT-4o, GPT-4o-mini, Gemini 1.5 Pro en DeepSeek corrigeerden al hun eerder gemaakte fouten. GPT-3.5 corrigeerde slechts 32% van zijn eerdere fouten.
Claude 3.5 Sonnet maakte zeer weinig fouten tijdens de eerste tests, maar slaagde er niet in om de vier fouten die het maakte te corrigeren.
De onderzoekers waarschuwden echter dat de relatief kleine steekproefomvang van de studie de kracht van de conclusies die kunnen worden getrokken, beperkt. De bevindingen benadrukken desalniettemin een bredere uitdaging voor generatieve AI: chatbots kunnen soms de voorkeur geven aan consistentie in gesprekken of responsiviteit boven het handhaven van een stevige afwijzing van onjuiste informatie.
Naarmate AI-systemen steeds meer geïntegreerd worden in onderwijs, onderzoek, werk en dagelijkse besluitvorming, benadrukt de studie het belang van het verifiëren van belangrijke informatie in plaats van aan te nemen dat een zelfverzekerde of herhaalde chatbotreactie noodzakelijkerwijs nauwkeurig is.
-
13:10
-
12:47
-
12:29
-
12:12
-
11:47
-
11:30
-
11:19
-
11:11
-
10:56
-
10:56
-
10:55
-
10:55
-
10:47
-
10:30
-
10:15
-
10:00
-
09:43
-
09:22
-
09:09
-
08:45
-
08:27
-
08:10
-
07:47
-
07:32
-
07:15
-
21:36
-
21:30
-
21:25
-
20:50
-
20:37
-
20:27
-
19:10
-
18:47
-
18:28
-
18:10
-
17:47
-
17:32
-
17:15
-
16:50
-
16:33
-
16:15
-
15:59
-
15:52
-
15:49
-
15:47
-
15:32
-
15:15
-
14:47
-
14:29
-
14:25
-
14:18
-
14:14
-
14:10
-
14:05
-
13:45
-
13:28
-
13:21