Waarom AI slechter wordt in lange chats
Door Chatday Editorial Team ·
De eerste tien minuten zijn geweldig. De AI begrijpt wat je wilt, de antwoorden zijn scherp, en je denkt dat je eindelijk een echte werkpartner hebt gevonden.
Dan, ergens rond bericht dertig, gaat het schuiven. Hij vergeet een regel die je aan het begin stelde. Hij geeft je iets terug dat je al had afgewezen. Je corrigeert, hij biedt excuses aan, en twee antwoorden later maakt hij dezelfde fout.
Het ligt niet aan jouw geduld, en het model heeft geen slechte dag. Lange gesprekken worden echt slechter, het gebeurt bij elk model op de markt, en onderzoekers hebben inmiddels gemeten hoeveel.
Wat er in een lang gesprek met AI-antwoorden gebeurt
Onderzoekers van Microsoft en Salesforce deden een experiment dat makkelijk uit te leggen is. Ze namen taken die een model normaal prima aankan, zoals een stukje code schrijven of een vraag beantwoorden uit meerdere documenten, en stelden ze op twee manieren.
In de eerste versie kwam het hele verzoek in één compleet bericht. In de tweede werd exact dezelfde informatie druppelsgewijs over meerdere beurten gegeven, zoals een echt mens praat: een vage openingsvraag, dan een detail, dan een correctie, dan nog een detail.
Zelfde model, zelfde informatie, zelfde einddoel. Alleen de manier van aanleveren verschilde.
Over meer dan 200.000 gesimuleerde gesprekken en zes soorten taken deden alle geteste topmodellen het duidelijk slechter in de opgeknipte versie. De gemiddelde daling was 39%. Het werk verscheen in mei 2025 en werd in april als mondelinge presentatie gegeven op ICLR 2026, een van de belangrijkste conferenties in het vakgebied.
Interessanter is hoe het misgaat. De modellen werden niet minder kundig. Ze werden minder betrouwbaar, en dat is een ander en vervelender probleem. Stel dezelfde opgeknipte vraag tien keer aan hetzelfde model en de kwaliteit varieert veel meer dan bij één bericht.
De reden laat zich goed voorstellen. Als je eerste bericht vaag is, wacht het model niet op duidelijkheid. Het vult de gaten stilletjes met een gok, legt zich daarop vast en begint een antwoord te bouwen dat daarop rust. Was de gok fout, dan erft alles daarna de fout. De onderzoekers zagen dat een model dat vroeg in een gesprek verkeerd afslaat, meestal de weg niet meer terugvindt, zelfs niet als je het direct corrigeert.
Waarom meer geheugen lange chats niet redt
De voor de hand liggende tegenwerping: modellen hebben tegenwoordig een enorm geheugen. Sommige lezen een miljoen woorden in één keer. Een chat van vijftig berichten zou niets moeten voorstellen.
Dat klopt voor capaciteit en klopt niet voor kwaliteit, en in dat gat zit het hele verhaal. Wil je het volledige plaatje van dat geheugen, dan legden we apart uit wat een contextvenster eigenlijk is. Kort gezegd: het is de hoeveelheid tekst die het model voor zich kan houden terwijl het antwoordt.
Tekst voor je hebben is niet hetzelfde als hem goed gebruiken. Een onderzoeksteam van Chroma testte in juli 2025 18 toonaangevende modellen en vond bij allemaal hetzelfde patroon. De nauwkeurigheid daalde naarmate de invoer langer werd, en ze daalde ruim voordat de aangeprezen limiet in zicht kwam. Een model dat technisch een miljoen woorden aankan, kan bij vijftigduizend al merkbaar slechter zijn.
Twee details uit dat werk springen eruit omdat ze tegen de intuïtie ingaan:
- Eén irrelevante passage is al genoeg. Eén afleidend blok tekst toevoegen, geen honderd, verlaagde de nauwkeurigheid al meetbaar.
- Netjes geordende tekst kan slechter zijn dan een gehusselde stapel. Modellen scoorden hoger als het omringende materiaal door elkaar stond dan wanneer het logisch geordend was.
Er is ook een ouder, vaak herhaald resultaat dat veel dagelijkse frustratie verklaart. Een door Stanford geleid onderzoek liet in 2023 zien dat modellen informatie helemaal aan het begin of helemaal aan het eind van een lange invoer het beste vinden, en die in het midden veel slechter. Jouw zorgvuldige instructie uit bericht acht ligt nu midden in de stapel. Dat is de slechtst denkbare plek.
Zet die twee naast elkaar en het beeld klopt. Jouw lange chat is geen net dossier dat de AI raadpleegt. Het is een groeiende stapel tekst waarin jouw belangrijke regel concurreert met veertig berichten bijzaken, doodlopende sporen en correcties die je allang achter je hebt gelaten.
De AI-labs weten het, en bouwden een omweg
Dit is geen randklacht. De bedrijven documenteren het zelf.
De ontwikkelaarsdocumentatie van Anthropic beschrijft een functie genaamd compaction, die oudere delen van een gesprek automatisch samenvat zodra het lang wordt. De opgegeven reden is onomwonden: «naarmate een gesprek groeit, gaat de antwoordkwaliteit achteruit», dus het oude materiaal wordt vervangen door een korte samenvatting.
Lees dat nog eens, want daar zit het bruikbare deel. De officiële oplossing voor een lang gesprek is het grootste deel ervan weggooien en een samenvatting bewaren. Precies dat kun je met de hand doen, gratis, in elke chat-app, zonder te wachten op een functie die het voor je doet.
Wat te doen als een chat begint af te dwalen
Dit is de praktische vertaling. Koppel het symptoom aan wat er echt gebeurt.
| Wat je merkt | Wat er speelt | Wat je doet |
|---|---|---|
| Hij vergeet een regel van het begin | De instructie ligt midden in een lange chat | Herhaal de regel in je nieuwste bericht, niet als geheugensteun maar als de instructie |
| Hij herhaalt een voorstel dat je afwees | De afgewezen versie staat nog in de geschiedenis en telt nog als context | Start een nieuwe chat en beschrijf alleen wat je wilt, nooit wat je al uitsloot |
| Antwoorden worden vager en algemener | Te veel concurrerend materiaal in het venster | Vat de stand van zaken samen in één bericht en ga daarvandaan verder |
| Hij maakt dezelfde fout na correcties | Hij legde zich vroeg vast op een verkeerde aanname | Verlaat de draad. Een correctie weegt zelden zwaarder dan het gesprek eronder |
| Hij zit er vol overtuiging naast met feiten | Ander probleem, los van de lengte | Zie waarom AI zelfverzekerd dingen verzint |
En vijf gewoontes die het meeste hiervan voorkomen:
- Zet het hele verzoek vooraan. De sterkste uitkomst van dit onderzoek is dat één compleet bericht dezelfde informatie in stukjes verslaat. Besteed die extra dertig seconden aan de volledige vraag.
- Herstart in plaats van te discussiëren. Als een chat misgaat, kost een nieuwe je niets. Plak er alleen de goede stukken in.
- Schrijf je eigen samenvatting aan het eind van een lange sessie. Vraag de AI om een korte opsomming van de genomen besluiten, controleer die, open een nieuwe chat en plak hem als eerste bericht.
- Houd onderwerpen in aparte chats. Eén draad voor het werkproject, een andere voor de vakantie. Door elkaar zet je afleiding in allebei.
- Wissel van model als er eentje vastloopt. Een ander model weet niets van je vorige mislukte gesprek. Het komt fris binnen, en het zal het vaak op nuttige manieren oneens zijn met het eerste, wat we bekeken in waarom AI-modellen verschillende antwoorden geven.
Die laatste is de goedkoopste truc van allemaal, en degene die mensen overslaan omdat ze maar één AI-app open hebben.
Waar dit advies tekortschiet
Een paar eerlijke kanttekeningen, want de oplossing werkt niet overal.
Opnieuw beginnen kost echt iets. Als je een uur hebt besteed aan het aanleren van de toon van je nieuwsbrief, doet weggooien pijn, en een samenvatting vangt nooit alles. Bewaar in dat geval een korte, herbruikbare briefing in een notitie op je computer en plak die in elke nieuwe chat. Je houdt het bruikbare deel en laat de rommel liggen.
Het onderzoek testte de modellen ook tegen gesimuleerde gebruikers die een script volgden, niet tegen het rommelige heen en weer van een echt mens dat een verkeerde afslag kan herkennen en stoppen. Wie oplet en de fout bij bericht drie ziet, doet het beter dan deze cijfers suggereren. Dat pleit ervoor de vroege antwoorden goed te lezen, als corrigeren nog bijna niets kost.
En sommige klussen vragen echt om één lange draad, zoals je door een groot document werken dat je niet kunt samenvatten zonder de kern te verliezen. Een model gemaakt voor lange documenten, zoals Claude Opus 4.7, gaat daar beter mee om dan de meeste, maar het haalt het probleem niet weg. Houd voor die klussen de draad aan en herhaal je kerninstructie om de paar berichten, zodat die dicht bij het eind van de stapel blijft, waar het model het scherpst kijkt.
Kort samengevat
Lange AI-gesprekken mislukken niet omdat de machine moe wordt. Ze mislukken omdat het model vroeg een stille aanname deed, daar alles op bouwde, en jouw beste instructie vervolgens begroef midden in een stapel tekst die het niet gelijkmatig leest.
Als je dat weet, liggen de gewoontes voor de hand. Zeg het in één keer. Begin opnieuw als het afdwaalt. Bewaar je briefing ergens waar je hem opnieuw kunt plakken. En als een model in een lus blijft hangen, stop met discussiëren en geef dezelfde vraag aan een ander.