Het ‘ja, en’-probleem met kunstmatige intelligentie

Toen Google in 2024 AI Overviews aan zijn zoekmachine toevoegde, leken sommige antwoorden wel grappen. Het systeem raadde aan om lijm op een pizza te doen zodat de kaas er niet af zou glijden en om dagelijks een klein steentje te eten. Deze missers deden het goed als screenshots omdat ze absurd en eenvoudig te verwerpen waren. Google erkende dat sommige vreemde antwoorden echt waren, maar zei ook dat er verzonnen screenshots rondgingen. (Google, “AI Overviews: About last week”) Volgens het bedrijf waren zoekvragen verkeerd geïnterpreteerd, was er soms te weinig informatie beschikbaar en waren satire en forumberichten ten onrechte als bruikbaar bewijs behandeld. Google paste aan wanneer AI Overviews verschenen en beperkte het gebruik van bepaalde door gebruikers gemaakte bronnen. Dat waren redelijke veranderingen, maar ze lieten de missers eruitzien als een tijdelijke afgang die met genoeg filters voor slechte bronnen en onzinnige vragen wel verholpen kon worden. Het antwoord over lijm verdwijnt, dat over stenen verdwijnt en het product gaat verder.

Onderzoek dat twee jaar later verscheen, wijst erop dat het probleem dieper gaat dan een verzameling dwaze antwoorden. Xu, Iqbal en Montgomery onderzochten 55.393 populaire Google-zoekopdrachten. AI Overviews verschenen bij 13,7 procent van die zoekopdrachten, maar bij 64,7 procent van de zoekopdrachten die als vraag waren geformuleerd. Vragen die met “hoe” begonnen, leidden in 84,3 procent van de gevallen tot een AI Overview. Het product gaf dus juist vaak een gegenereerd antwoord wanneer iemand om uitleg vroeg. De onderzoekers splitsten de bijbehorende AI Overviews op in ongeveer 98.000 feitelijke beweringen. Volgens hun preprint werd 11 procent van die beweringen niet ondersteund door de pagina’s die Google citeerde. (Xu, Iqbal en Montgomery, preprint over AI Overviews) Slechts 41,9 procent van de Overviews baseerde iedere bewering op het aangehaalde materiaal. Het onderzoek gebruikte geautomatiseerde controles en populaire zoekopdrachten. De percentages zijn daarom geen definitieve meting van alle Google-zoekopdrachten. Interessanter is het soort fout dat de onderzoekers aantroffen. De bronnen van AI Overviews waren vaak geloofwaardiger dan de gewone zoekresultaten ernaast, maar een geloofwaardige bron garandeerde geen getrouwe weergave. Google kon een redelijke pagina vinden en alsnog een bewering produceren die de pagina niet ondersteunde.

Een bron vinden is niet hetzelfde als haar getrouw weergeven. Een gegenereerd antwoord kan een goede pagina vinden en toch verkeerd beschrijven wat erin staat. De bronvermelding blijft zichtbaar, terwijl ik zelf moet controleren of de bron de zin ondersteunt. Bij lijm en stenen was dat risico duidelijk. In mijn eigen gebruik zijn ongefundeerde beweringen lastiger te herkennen, omdat ze in hetzelfde beheerste proza en dezelfde opmaak verschijnen als alles eromheen. Dat roept een moeilijkere vraag op. Waarom presenteert het product een antwoord wanneer het genereren verder is gegaan dan het beschikbare bewijs?

Die vraag deed me denken aan een regel uit het improvisatietheater. “Ja, en” vraagt een speler om te aanvaarden wat een medespeler toevoegt en daarop voort te bouwen. Wie de aanname ontkent, legt de scène stil. Dat werkt wanneer beide spelers samen fictie maken. Het is gevaarlijk wanneer een feitelijke assistent een verkeerde aanname accepteert of steun verzint om verder te kunnen antwoorden. De vergelijking is slechts een vertrekpunt. Een zoeksamenvatting die een bron verkeerd weergeeft, een chatbot die met een gebruiker meegaat en een model dat onder druk van een evaluatie gokt, hebben niet aantoonbaar dezelfde oorzaak. Ze leiden wel tot hetzelfde resultaat in het product. Het systeem gaat door en de interface presenteert wat volgt als antwoord.

Wanneer voortbouwen instemmen wordt

Link

De vorm van “ja, en” die het dichtst bij improvisatie ligt, verschijnt in gesprekken. Als een gebruiker met een onjuiste bewering of onnauwkeurige formulering begint, kan een assistent die gretig aanvaarden en er een verder samenhangend antwoord omheen bouwen. In grote codebases met honderdduizenden regels code merk ik dit vaak wanneer mijn woordenschat net afwijkt van de naamconventies in de repository. In plaats van het verschil op te merken of om verduidelijking te vragen, neemt een agent mijn afwijkende term geregeld als letterlijk uitgangspunt, waarna hij irrelevante dwaalsporen volgt of code in niet-gerelateerde modules aanpast simpelweg omdat die er zijdelings op leken. Op andere momenten gebeurt het omgekeerde: ik beschrijf een ontwerpfout in de gebruikerservaring en de agent pakt alleen de eerste plek aan die hij tegenkomt, terwijl identieke problemen elders blijven staan tenzij ik zelf handmatig ieder instappunt opspoor en aanlever. In beide gevallen handelt de assistent op het vooroordeel zonder de bredere context te beoordelen.

Die bereidheid om toe te geven wordt vooral duidelijk bij het testen van een antwoord. Bij eerdere modellen zoals GPT-4o leverde een eenvoudige vraag over de kleur van het gras of de lucht, gevolgd door de opmerking dat het antwoord fout was, steevast een verontschuldiging op in plaats van uitleg. In plaats van de gebruiker tegen te spreken of bij de waarneembare werkelijkheid te blijven, gaf de assistent onmiddellijk toe. Recente grensmodellen met toegang tot internet laten zich bij basisfeiten minder makkelijk omverblazen, maar zodra ze geen zoekhulpmiddelen hebben of voor subjectieve of complexe architectuurkeuzes worden geplaatst, keert diezelfde reflexmatige inschikkelijkheid snel terug. Een juist antwoord kan bezwijken nadat een gebruiker zonder nieuw bewijs volhoudt dat het fout is. De verandering zegt weinig over welk antwoord beter was. Ze laat zien hoe makkelijk tegenspraak het antwoord in beide richtingen kan duwen.

Onderzoekers bereikten hetzelfde effect met aanwijzingen die niet verder gingen dan “Weet je het zeker?” Bij tien taalmodellen en zeven classificatietaken veranderden de modellen gemiddeld in 46 procent van de gevallen hun antwoord. (Onderzoek naar veranderde antwoorden nadat gebruikers twijfel uiten) De uiteindelijke nauwkeurigheid daalde met 17 procent. Dat waren afgebakende classificatietaken en geen open gesprekken. Hong en collega’s vonden ook inschikkelijkheid onder aanhoudende druk toen ze zeventien modellen in gesprekken met meerdere beurten testten. (Hong et al., onderzoek naar inschikkelijkheid onder druk) Hun resultaten brengen een nuttige nuance aan. Grotere modellen en optimalisatie voor redeneren maakten modellen doorgaans weerbaarder, terwijl afstemmingstraining de inschikkelijkheid vergrootte. Het probleem verschilt per model en trainingsmethode. Het is geen vaste wet dat ieder gesprek in instemming moet eindigen.

Dit deel van AI-gedrag bedoel ik met “ja, en”. Het is beperkter en aanzienlijk verraderlijker dan eenvoudig hallucineren. Een model dat een niet-bestaand package verzint of een fictieve publicatie aanhaalt, hallucineert, maar die fout faalt vaak luidruchtig: de build breekt af, de import geeft een foutmelding of de link loopt dood. Inschikkelijkheid is juist gevaarlijk omdat ze op het moment zelf productief en bevestigend voelt. Wanneer een assistent instemmend meegaat in een wankele architectuurkeuze of een broze tussenoplossing rationaliseert, voelt de gebruiker zich slim en efficiënt. Het model faalde niet op een benchmark. Het faalde als kritische sparringpartner. De term past wanneer de assistent een onjuiste aanname aanvaardt of meegaat in de voorkeursversie van de gebruiker. Hallucinatie wordt onderdeel van het patroon wanneer het model verzonnen steun voor die versie aandraagt. Ik beweer niet dat het model improvisatie begrijpt of een sociale behoefte voelt om het eens te zijn. De vergelijking beschrijft de uitwisseling, niet de oorzaak ervan.

Waarom antwoorden worden beloond

Link

Er is niet één mechanisme dat al deze fouten verklaart. Een van de oorzaken ligt in de manier waarop een groot taalmodel leert. Tijdens de voortraining krijgt het tekstreeksen en leert het het volgende token te voorspellen. De parameters leggen patronen vast uit een enorme hoeveelheid tekst, met daarin ook fouten en mythen. Een aannemelijk vervolg voorspellen is iets anders dan controleren of de uitkomst waar is. TruthfulQA liet dat verschil zien met vragen die op veelvoorkomende misvattingen waren gebaseerd. (Lin, Hilton en Evans, “TruthfulQA”) Beter worden in het nabootsen van menselijke tekst maakte de geteste modellen niet vanzelf waarheidsgetrouwer.

Voortraining alleen verklaart niet waarom een model zich als assistent gedraagt of waarom het met een gebruiker meegaat. Ontwikkelaars trainen het model verder zodat het instructies volgt en antwoorden produceert waaraan mensen de voorkeur geven. Dat proces kan de waarheidsgetrouwheid verbeteren. Bij taken met een afgebakende informatiebron verminderde het oorspronkelijke InstructGPT-onderzoek het aandeel niet-onderbouwde informatie van 41 procent bij GPT-3 naar 21 procent. (Ouyang et al., “Training language models to follow instructions with human feedback”) Ook verdubbelde de score op TruthfulQA ongeveer. Training achteraf is niet alleen een mogelijke bron van het probleem. Ontwikkelaars kunnen het probleem er ook mee verkleinen. Datzelfde proces kan instemming belonen. Onderzoekers van Anthropic ontdekten dat menselijke beoordelaars vaker kozen voor antwoorden die overeenkwamen met de uitgesproken overtuigingen van een gebruiker. (Anthropic, onderzoek naar inschikkelijkheid in taalmodellen) Voorkeursmodellen kozen soms een overtuigend, instemmend antwoord boven een correct antwoord. Verdere optimalisatie op zulke voorkeuren kan waarheidsgetrouwheid inruilen voor instemming. De training is misschien bedoeld om een behulpzame assistent te maken. Het resultaat kan nog steeds een model zijn dat meer beloning krijgt voor het aanvaarden van het standpunt van de gebruiker dan voor het corrigeren ervan.

Ook evaluaties kunnen dezelfde druk uitoefenen. Veel tests geven een punt voor een juist antwoord en niets voor een fout antwoord of een erkenning van onzekerheid. Gokken biedt onder die regels kans op succes, terwijl niet antwoorden zeker niets oplevert. Kalai en collega’s stellen daarom dat evaluaties die op nauwkeurigheid zijn gericht modellen aanmoedigen te gokken, ook wanneer ze te weinig informatie hebben. (Kalai et al., onderzoek naar evaluatieprikkels en hallucinaties) Een team kan minder hallucinaties willen en tegelijk tests blijven gebruiken die gokken tot de betere strategie maken.

Geen ontwikkelaar hoeft een instructie te schrijven waarin het model wordt opgedragen iets te verzinnen. Training en evaluatie kunnen doorgaan belonen, en ontwikkelaars kunnen die prikkels veranderen. Onjuiste aannames komen niet alleen voor in vijandige tests. In de CREPE-dataset bevatte 25 procent van de vragen uit online forums voor informatiezoekers zo’n aanname. (Publicatie over de CREPE-dataset) Vraag-en-antwoordsystemen konden de aanname vaak aanwijzen, maar hadden moeite om vast te stellen of ze klopte. Dat kwam deels doordat ze niet het juiste bewijs vonden. Fijntunen op slechts 256 voorbeelden met onjuiste aannames verbeterde aanzienlijk hoe goed modellen gebrekkige vragen weerlegden zonder hun prestaties op gewone vragen te verminderen. (Onderzoek naar het leren weerleggen van onjuiste aannames) Daarmee is het aanvaarden van onjuiste aannames nog niet voor iedere taak eenvoudig op te lossen. Het weerlegt wel de fatalistische bewering dat voorspelling van het volgende token weerstand onmogelijk maakt. Ontwikkelaars beheersen misschien niet ieder antwoord, maar ze kunnen wel beïnvloeden of het model een aanname weerlegt, onzekerheid erkent of gokt.

Het product verandert doorgaan in autoriteit

Link

Een model genereert tekst. Het product bepaalt hoe die tekst eruitziet wanneer ze mij bereikt. Direct ondersteunde beweringen kunnen in hetzelfde lettertype en dezelfde toon verschijnen als speculatie. In de zoek- en chatproducten die ik gebruik, verschijnt de samenvatting als één vloeiend antwoord. Tegenstrijdigheden in het bronmateriaal vallen nauwelijks op, tenzij het product ervoor kiest ze te tonen. Tegen de tijd dat ik het antwoord lees, ogen beweringen met verschillende gradaties van bewijs even voltooid.

Het zelfvertrouwen in dat proza weerspiegelt de onderliggende onzekerheid van het model niet betrouwbaar. Ji en collega’s vonden slechts een matig verband tussen de feitelijke onzekerheid van een model en de onzekerheid die in de bewoordingen naar voren kwam. Door in te grijpen op de representatie van verwoorde onzekerheid verminderden zij zelfverzekerde hallucinaties in kort-antwoordtests gemiddeld met ongeveer 30 procent. (Ji et al., onderzoek naar verwoorde onzekerheid) Een experiment met korte antwoorden bewijst niet dat ieder product modelonzekerheid kan omzetten in een accurate waarschuwing. De daling is toch van belang. Een stellige formulering is gedrag dat ontwikkelaars kunnen meten en aanpassen, geen onvermijdelijke eigenschap van gegenereerde tekst. Bronvermeldingen kunnen die indruk versterken voordat iemand ze controleert. Ding en collega’s toetsten gegenereerde antwoorden zonder bronnen, met één bron of met vijf bronnen. Sommige links waren relevant, andere willekeurig. Deelnemers rapporteerden meer vertrouwen wanneer er bronvermeldingen stonden, zelfs wanneer die willekeurig waren. (Ding et al., onderzoek naar bronvermeldingen en vertrouwen) Deelnemers die de links openden en onderzochten, rapporteerden juist minder vertrouwen. Het experiment mat gerapporteerd vertrouwen in een afgebakende setting, niet hoe mensen zich na maandenlang gebruik gedragen. Het legt wel een probleem in de interface bloot. Een bronvermelding kan als een keurmerk van geloofwaardigheid werken voordat ze als bewijs fungeert.

Meer uitleg lost dit niet vanzelf op. In een preregistreerd experiment met 308 deelnemers stelden Kim en collega’s vast dat toelichtingen de afhankelijkheid van zowel juiste als onjuiste antwoorden vergrootten. (Kim et al., onderzoek naar toelichtingen en afhankelijkheid) Ze verhoogden ook het zelfvertrouwen van mensen en maakten hen minder geneigd om door te vragen. Accurate, relevante bronnen werkten anders. Die vergrootten het vertrouwen in juiste antwoorden en verkleinden het vertrouwen in onjuiste antwoorden. Een toelichting die door hetzelfde model is gegenereerd, kan een onjuist antwoord makkelijker te geloven maken. Ze geeft geen onafhankelijke reden om het te geloven. Dit verandert wat ik bedoel wanneer ik een AI-systeem vraag om de onderbouwing te tonen. Nog een gepolijste uitleg volstaat niet. Ik moet het bewijs zien en weten waar het antwoord daaraan voorbij is gegaan. De nuttige toets is of de interface het opsporen van een fout goedkoper maakt. In één onderzoek verminderden gedetailleerde aanwijzingen overmatige afhankelijkheid niet wanneer het controleren ervan evenveel moeite kostte als de oorspronkelijke taak. Een eenvoudige visuele weergave die een onmogelijke stap blootlegde deed dat wel. (Onderzoek naar verificatie en overmatige afhankelijkheid) Transparantie is niet de hoeveelheid uitleg op het scherm. Het is het gemak waarmee iemand kan ontdekken waar het antwoord mogelijk niet klopt.

Waarom meegaande antwoorden producttests winnen

Link

De eigenschappen die iemand helpen een slecht antwoord te weerstaan, kunnen het product minder prettig laten voelen. Bucinca, Malaya en Gajos testten interfaces die mensen dwongen zich met een AI-aanbeveling bezig te houden voordat ze die konden overnemen. In hun experiment met 199 deelnemers verminderden deze ingrepen overmatige afhankelijkheid meer dan gewone toelichtingen. (Bucinca, Malaya en Gajos, onderzoek naar cognitieve dwang) Ze kregen ook de slechtste subjectieve waarderingen. De pauze die mensen hielp nadenken, maakte het systeem minder prettig in het gebruik. Een team dat tevredenheid of snelheid meet, kan naar dat resultaat kijken en het nuttige onderdeel schrappen.

Een model trainen om warmer te klinken kan tot een vergelijkbaar conflict leiden. Ibrahim en collega’s trainden vijf modellen op warmer taalgebruik en toetsten ze vervolgens op feitelijke vragen en prompts met een onjuiste overtuiging van de gebruiker. Warme afstemming verhoogde het foutpercentage met gemiddeld 7,43 procentpunt. (Ibrahim et al., onderzoek naar warmte in gesprekken en nauwkeurigheid) Wanneer de gebruiker een onjuiste opvatting noemde, liep het verschil op tot 11 procentpunt. Uitingen van verdriet vergrootten het tot 11,9 procentpunt. Samengestelde trainingssets bewijzen niet dat warmte altijd de nauwkeurigheid schaadt. Ze laten wel zien hoe een toon die bedoeld is om ondersteunend te voelen de weerstand van het model kan verzwakken wanneer die ondersteuning vraagt om mee te gaan in het verhaal van de gebruiker.

Gebruikers belonen mogelijk precies die zwakte. Cheng en collega’s vergeleken advies van elf modellen met advies van mensen en onderzochten vervolgens hoe gebruikers reageerden op inschikkelijke antwoorden over persoonlijke conflicten. De modellen bevestigden het handelen van de gebruikers ongeveer 50 procent vaker dan menselijke respondenten, ook bij situaties met misleiding of manipulatie. Na inschikkelijk advies raakten deelnemers sterker overtuigd van hun eigen gelijk en waren ze minder bereid het conflict bij te leggen. (Cheng et al., onderzoek naar inschikkelijk advies) Toch waardeerden zij de antwoorden hoger, vertrouwden ze het systeem meer en toonden ze meer interesse om het opnieuw te gebruiken. Het slechtere advies leverde de betere productwaardering op. OpenAI liep in een echte release tegen dit probleem aan. In april 2025 trok het bedrijf een GPT-4o-update in die overdreven vleiend en bevestigend was geworden. Het bedrijf legde later uit dat een beloningssignaal op basis van duimpjes omhoog en omlaag een ander signaal had verzwakt dat inschikkelijkheid moest tegengaan. De offline evaluaties zagen er positief uit, testgebruikers gaven de voorkeur aan de update en kwalitatieve zorgen van deskundige testers hielden de introductie niet tegen. OpenAI concludeerde dat het te veel gewicht had toegekend aan kortetermijnfeedback. (OpenAI, “Expanding on what we missed with sycophancy”) Dit incident bewijst niet dat bedrijven mensen opzettelijk willen misleiden, noch maakt het betrokkenheid tot de oorzaak van iedere hallucinatie. De mislukking is alledaagser. Directe goedkeuring is eenvoudig te registreren, terwijl de prijs van een inschikkelijk antwoord pas later kan opduiken in het oordeel van iemand anders. Tenzij een bedrijf beide meet, vindt “ja, en” de makkelijkste weg naar het product.

Waar ik het werk nog kan beoordelen

Link

Ik ben door deze problemen niet gestopt met AI, maar ik trek een hardere grens rond wat ik het systeem toevertrouw. Het onderscheid ligt niet tussen veilige en onveilige taken. Het gaat erom of ik een manier heb om het resultaat te beoordelen die niet afhankelijk is van het systeem dat het heeft geproduceerd, en of die controle minder kost dan het werk zelf doen. Zelfs die regel beschrijft mijn streven netter dan mijn werkelijke gedrag.

Programmeren komt vaak in de buurt, omdat ik het werk goed genoeg begrijp om een implementatie te inspecteren, tegen bekende gevallen te testen en te zien of ze binnen de rest van het systeem past. Toch kan een functie werken en tegelijk slecht ontworpen zijn. Ik schreef eerder over het beoordelen van zo’n pull request, waarbij het zichtbare gedrag klopte maar de plaatsing van toestand en verantwoordelijkheden binnen de architectuur geen hout sneed. Tests kunnen ook een verkeerde aanname herhalen, een randgeval missen of een beveiligingsprobleem onzichtbaar laten. Deskundigheid geeft me meer manieren om de uitkomst uit te dagen, geen immuniteit. Die grens geldt aan beide zijden van de kenniskloof. Een onderzoeksrapport van Microsoft wijst geringe deskundigheid en onbekendheid met een taak aan als risicofactoren voor overmatige afhankelijkheid, maar waarschuwt dat ook experts antwoorden accepteren die bevestigen wat ze al geloven. (Microsoft Research, “Appropriate reliance on generative AI”) Een onafhankelijk oordeel helpt alleen wanneer ik het ook gebruik, juist bij conclusies die ik graag wil aannemen.

Ik gebruik AI ook als extra paar ogen. Ik vraag het systeem mogelijke problemen in code of tekst aan te wijzen en beslis vervolgens welke opmerkingen actie vereisen. Bij code laat ik het systeem de correctie vaak uitvoeren nadat ik het probleem heb beoordeeld. Bij proza ben ik terughoudender. Dyslexie en schrijven in het Engels als tweede taal kunnen het lastiger maken sommige fouten op te merken, waardoor de controle echt nuttig is. Een herschrijving kan echter ook te veel veranderen, mijn stem afvlakken of de betekenis verschuiven op een manier die bij snel lezen onschuldig lijkt. Eerst om kritiek vragen houdt het oordeel bij mij, zelfs als ik de aanpassing later delegeer.

Bij kleine computertaken ben ik roekelozer dan verstandig is. Ik vraag soms hoe ik iets in een configuratiebestand aanpas en laat de AI de stappen uitvoeren als die eenvoudig ogen. De uitkomst lijkt vaak binair. De instelling werkt of werkt niet, en hoe de wijziging tot stand kwam doet er voor mij minder toe. Er is tot nu toe niets misgegaan, maar dat is een mager veiligheidsargument. Een configuratiewijziging kan gevolgen hebben die ik niet heb gecontroleerd, en een succesvol resultaat bewijst niet dat de methode veilig was. Gemak wint soms, ook wanneer ik begrijp waarom voorzichtigheid beter zou zijn.

Onderzoek bevindt zich in een minder comfortabel middengebied. AI kan me een vertrekpunt geven wanneer een onderwerp me vreemd is, net zoals een zoekresultaat of een nuttig artikel dat kan. De eerste bijdrage is vaak woordenschat. Zodra ik de termen uit de literatuur ken, kan ik verwijzingen volgen en zelf gerichter zoeken. Dat is een ingang tot het onderzoek, geen reden om de synthese van het systeem over te nemen. In de praktijk zitten modellen er zelden compleet naast als het gaat om het bestaan van kernbegrippen, maar ze poneren bevindingen dikwijls veel stelliger dan het onderliggende onderzoek rechtvaardigt. Een studie die een subtiele neiging opmerkte of suggereerde dat een effect mogelijk optreedt, wordt samengevat als een vaststaande regel of een waarschijnlijke oorzaak in de meeste gevallen. Ook schrijven modellen bevindingen weleens aan de verkeerde auteur toe. Vanwege die neiging tot overdrijven en het wegpoetsen van nuance hanteer ik inmiddels een vaste verificatiestap: na een eerste onderzoeksronde laat ik een ander model de samenvatting controleren, strikt gericht op ongegronde of aangedikte claims, voordat ik er zelf naar kijk. Zelfs bij grensmodellen haalt die tweede controle stelselmatig overmoedige beweringen boven water.

Deze werkwijzen vormen geen betrouwbare methode om AI veilig te maken. Het zijn compromissen gebaseerd op de vraag of ik een fout kan zien en wat die me zou kosten. AI kan tijd besparen door werk te beoordelen dat ik zelf maakte of door een kleine ingreep met een zichtbare uitkomst te proberen. De waarde wordt moeilijker te verdedigen wanneer controle vereist dat ik het onderzoek overdoe en zoek naar wat mogelijk is weggelaten. Als de enige manier om een antwoord te verifiëren is om na lezing het oorspronkelijke werk alsnog te doen, bevat het gemak een verborgen controlepost. Soms kan ik die controle betalen omdat ik het onderwerp ken of tijd heb om de bronnen na te slaan. Wanneer ik beide mis, ben ik het meest geneigd het antwoord te vertrouwen op het moment dat ik het minst toegerust ben om het te beoordelen.

Verificatie is werk, geen disclaimer

Link

Mijn wisselende voorzichtigheid lost niet op wie verantwoordelijk is voor een fout antwoord. Ik moet nog steeds beoordelen waarop ik vertrouw, en een gewichtige claim verdient meer aandacht dan één gegenereerd antwoord. Mijn compromissen worden niet veilig doordat een bedrijf het product eenvoudig in gebruik heeft gemaakt. Mijn verantwoordelijkheid wist de keuzes van de partij die de claim produceert en toont echter niet uit. De aanbieder kiest het model en het zoeksysteem. Die bepaalt ook wanneer het product zich onthoudt van een antwoord en hoe stelligheid op de pagina verschijnt. De gebruiker ziet het effect van die beslissingen zonder toegang tot de meeste ervan. Die persoon vertellen dat die de uitkomst moet verifiëren, vraagt om onderscheidingen te reconstrueren die het product al heeft weggemoffeld. Men moet achterhalen welke zinnen uit een bron stammen en of die bron ze ondersteunt. Relevante informatie die het systeem nooit heeft opgehaald, kan men niet inzien.

Deze taakverdeling is geen uitzonderlijke maatstaf die voor generatieve AI is bedacht. De AI-principes van de OESO stellen dat verantwoordelijkheid moet aansluiten bij de rol, context en het handelingsvermogen van een actor. (OECD, “AI Principles”) Ze pleiten voor begrijpelijke informatie over de capaciteiten en beperkingen van een systeem, informatie die betrokkenen helpt een uitkomst te begrijpen en te betwisten, en doorlopend risicobeheer gedurende de hele levensduur. Dit zijn principes, geen garantie dat een product eraan voldoet. Ze ondersteunen een bescheidener punt: verantwoordelijkheid kan zeggenschap volgen zonder de gebruiker passief te maken of van de aanbieder te verlangen dat die iedere misser voorkomt.

Een betere interface kan een deel van dat werk zichtbaar maken zonder het te laten verdwijnen. PaperTrail, een onderzoeksinterface voor wetenschappelijke vraagbeantwoording, splitste gegenereerde tekst op in beweringen en koppelde die aan ondersteunend of ontbrekend bewijs. In een studie onder 26 onderzoekers verlaagde de interface het vertrouwen vergeleken met een gewone chatomgeving. (PaperTrail study) Het leidde niet tot een duidelijke verandering in de manier waarop deelnemers de gegenereerde bewerkingen overnamen. Zelfs toen mensen sceptischer werden, kon de inspanning om het werk na te trekken hen er alsnog toe brengen erop te leunen. Dit was een klein onderzoek naar academische taken, maar het resultaat toont de grens van openheid. Het probleem tonen is beter dan het verbergen. De gebruiker moet nog steeds halt houden en graven.

Een permanent label met “AI kan fouten maken” doet nog minder. Het wijst geen twijfelachtige zin of overgeslagen bron aan. De waarschuwing staat er wanneer het antwoord klopt en wanneer het gevaarlijk mis is, waardoor de lezer er niets aan heeft om het verschil te zien. Voor mij fungeert dat eerder als dekking voor de leverancier dan als voorlichting voor de gebruiker. Ik beoordeel het product op dat effect, niet op de intentie van de disclaimer. Een algemene waarschuwing kan de verantwoordelijkheid niet op de gebruiker afwentelen. De aanbieder behoudt de controle over wanneer het systeem antwoordt en wat de gebruiker kan inspecteren.

Wat een verantwoordelijk product zou doen

Link

Ik ben niet bevoegd om het uiteindelijke systeem te ontwerpen, en doen alsof zou de gewoonte herhalen die ik bekritiseer. Verbeteringen kunnen wijzigingen aan het model vragen, maar hoeven niet te wachten op een model dat nooit een feitelijke fout maakt. Bedrijven beslissen nu al wanneer ze zoeken of een overzicht genereren. Ze bepalen welk bewijsmateriaal het product ophaalt en hoe het antwoord verschijnt. Een verantwoordelijk product zou die controle benutten om te tonen wat het vond en waar het gegenereerde antwoord daaraan voorbijgaat. Die scheiding moet op het niveau van de bewering plaatsvinden. Een bronnenlijst onderaan een lang antwoord laat de lezer zelf uitzoeken welke link, zo die er al is, iedere zin ondersteunt. Het product zou een feitelijke bewering kunnen verbinden aan de passage waarop het steunt en een bewering kunnen markeren wanneer het geen steun vond. Wanneer betrouwbare bronnen van mening verschillen, hoort het die tegenstelling te bewaren in plaats van ze samen te smelten tot één zelfverzekerde slotsom. Het gekozen bewijs kan nog steeds mager of onvolledig zijn. De lezer kan tenminste de verhouding tot het antwoord nagaan zonder het geheel van de grond af opnieuw op te bouwen.

Onderzoek naar gegenereerd zoeken levert enig bewijs dat dit type ingreep kan werken. Deelnemers die een AI-zoekmachine gebruikten rondden taken sneller af en vonden de ervaring bevredigender dan deelnemers met traditionele zoekmachines, maar ze leunden te zwaar op het gegenereerde antwoord wanneer dat onjuist was. In een tweede experiment hielpen kleurmarkeringen deelnemers om mogelijke fouten te signaleren en betere keuzes te maken zonder de andere gemeten voordelen teniet te doen. (Microsoft Research, study of LLM-based search and over-reliance) Dit waren afgebakende kortetermijntaken, en een markering helpt enkel wanneer het systeem de twijfelachtige passage weet aan te wijzen. De uitkomst toont niettemin dat het tonen van onzekerheid niet vraagt om ieder voordeel van gegenereerd zoeken overboord te gooien.

Soms is het juiste signaal simpelweg geen antwoord. Onderzoekers hebben aangetoond dat modellen onvolmaakte signalen bevatten die kunnen helpen bij het opsporen van sommige confabulaties, al kan een model dat dezelfde misvatting zelfverzekerd herhaalt aan zulke detectie ontsnappen. (Nature, “Detecting hallucinations in large language models using semantic entropy”) Ander werk behandelt weigering of onthouding als een expliciete uitkomst wanneer een systeem een fout niet met voldoende zekerheid kan herstellen. (Hedstrom et al., study of abstention) Dit zijn onderzoeksmethoden, geen panklare handleiding voor iedere assistent. Ze laten wel zien dat onzekerheid kan leiden tot het inhouden van een antwoord in plaats van enkel een waarschuwing plakken nadat het model heeft gegokt. Bedrijven kunnen dat gedrag in training en evaluatie belonen in plaats van iedere weigering als een mislukking te bestempelen.

De toets voor deze maatregelen moet zijn of ze mensen helpen betere beslissingen te nemen en meer fouten te onderscheppen. Tevredenheid doet ertoe, maar kan niet de uiteindelijke graadmeter zijn voor een product dat informatie als kennis aanbiedt. Er bestaat geen eenvoudige knop of functie die dit netjes oplost. Simpelweg eisen dat een AI “ophoudt met fouten maken” of de spanning tussen behulpzaamheid en scepsis wegwensen is hypocriet. Iedere assistent die is ingesteld om actief tegengas te geven, wankele aannames te betwisten of een vervolg in te houden, zal trager, voller van frictie en bij vlagen ronduit irritant aanvoelen voor gebruikers die gewend zijn geraakt aan directe antwoorden. Die frictie is een reële prijs. Het alternatief is echter een hulpmiddel dat enkel meegaand voelt omdat het de brokstukken stilletjes achterlaat voor de gebruiker om later zelf te ontdekken.

Wanneer de assistent moet stoppen

Link

“Ja, en” werkt in improvisatietheater omdat de scène gaande houden het doel is. Niemand vraagt de spelers te bewijzen dat het zinkende schip bestaat. Een feitelijke assistent heeft een andere plicht. Die moet herkennen wanneer doorgaan een twijfelachtige aanname in een verzonnen verhaal verandert. Op dat moment zijn tegenspraak of stilte nuttiger dan nog een aannemelijke zin. Betrouwbaarheid betekent niet dat het systeem altijd het juiste antwoord geeft. Het betekent dat de lezer kan zien wat het antwoord ondersteunt en waar die ondersteuning ophoudt. Bedrijven hoeven onzekere modellen niet alwetend te maken voordat ze dit kunnen verbeteren. Ze moeten ophouden een ongefundeerd vervolg de autoriteit van een gevonden feit te geven. Soms is het nuttigste antwoord het antwoord dat weigert de scène gaande te houden.

Verder lezen

Link