Modellen vergelijken Beeldmodellen vergelijken AI-tools Modellen AI-beeldmodellen AI-nieuws Zoeken Gratis proberen
Uitleg 8 min leestijd

Waarom AI slechter wordt in lange chats

Door Chatday Editorial Team ·

aiuitleghoe-het-werktchatgeheugen
Waarom AI slechter wordt in lange chats

De eerste tien minuten zijn geweldig. De AI begrijpt wat je wilt, de antwoorden zijn scherp, en je denkt dat je eindelijk een echte werkpartner hebt gevonden.

Dan, ergens rond bericht dertig, gaat het schuiven. Hij vergeet een regel die je aan het begin stelde. Hij geeft je iets terug dat je al had afgewezen. Je corrigeert, hij biedt excuses aan, en twee antwoorden later maakt hij dezelfde fout.

Het ligt niet aan jouw geduld, en het model heeft geen slechte dag. Lange gesprekken worden echt slechter, het gebeurt bij elk model op de markt, en onderzoekers hebben inmiddels gemeten hoeveel.

Wat er in een lang gesprek met AI-antwoorden gebeurt

Onderzoekers van Microsoft en Salesforce deden een experiment dat makkelijk uit te leggen is. Ze namen taken die een model normaal prima aankan, zoals een stukje code schrijven of een vraag beantwoorden uit meerdere documenten, en stelden ze op twee manieren.

In de eerste versie kwam het hele verzoek in één compleet bericht. In de tweede werd exact dezelfde informatie druppelsgewijs over meerdere beurten gegeven, zoals een echt mens praat: een vage openingsvraag, dan een detail, dan een correctie, dan nog een detail.

Zelfde model, zelfde informatie, zelfde einddoel. Alleen de manier van aanleveren verschilde.

Over meer dan 200.000 gesimuleerde gesprekken en zes soorten taken deden alle geteste topmodellen het duidelijk slechter in de opgeknipte versie. De gemiddelde daling was 39%. Het werk verscheen in mei 2025 en werd in april als mondelinge presentatie gegeven op ICLR 2026, een van de belangrijkste conferenties in het vakgebied.

Interessanter is hoe het misgaat. De modellen werden niet minder kundig. Ze werden minder betrouwbaar, en dat is een ander en vervelender probleem. Stel dezelfde opgeknipte vraag tien keer aan hetzelfde model en de kwaliteit varieert veel meer dan bij één bericht.

De reden laat zich goed voorstellen. Als je eerste bericht vaag is, wacht het model niet op duidelijkheid. Het vult de gaten stilletjes met een gok, legt zich daarop vast en begint een antwoord te bouwen dat daarop rust. Was de gok fout, dan erft alles daarna de fout. De onderzoekers zagen dat een model dat vroeg in een gesprek verkeerd afslaat, meestal de weg niet meer terugvindt, zelfs niet als je het direct corrigeert.

Waarom meer geheugen lange chats niet redt

De voor de hand liggende tegenwerping: modellen hebben tegenwoordig een enorm geheugen. Sommige lezen een miljoen woorden in één keer. Een chat van vijftig berichten zou niets moeten voorstellen.

Dat klopt voor capaciteit en klopt niet voor kwaliteit, en in dat gat zit het hele verhaal. Wil je het volledige plaatje van dat geheugen, dan legden we apart uit wat een contextvenster eigenlijk is. Kort gezegd: het is de hoeveelheid tekst die het model voor zich kan houden terwijl het antwoordt.

Tekst voor je hebben is niet hetzelfde als hem goed gebruiken. Een onderzoeksteam van Chroma testte in juli 2025 18 toonaangevende modellen en vond bij allemaal hetzelfde patroon. De nauwkeurigheid daalde naarmate de invoer langer werd, en ze daalde ruim voordat de aangeprezen limiet in zicht kwam. Een model dat technisch een miljoen woorden aankan, kan bij vijftigduizend al merkbaar slechter zijn.

Twee details uit dat werk springen eruit omdat ze tegen de intuïtie ingaan:

  • Eén irrelevante passage is al genoeg. Eén afleidend blok tekst toevoegen, geen honderd, verlaagde de nauwkeurigheid al meetbaar.
  • Netjes geordende tekst kan slechter zijn dan een gehusselde stapel. Modellen scoorden hoger als het omringende materiaal door elkaar stond dan wanneer het logisch geordend was.

Er is ook een ouder, vaak herhaald resultaat dat veel dagelijkse frustratie verklaart. Een door Stanford geleid onderzoek liet in 2023 zien dat modellen informatie helemaal aan het begin of helemaal aan het eind van een lange invoer het beste vinden, en die in het midden veel slechter. Jouw zorgvuldige instructie uit bericht acht ligt nu midden in de stapel. Dat is de slechtst denkbare plek.

Zet die twee naast elkaar en het beeld klopt. Jouw lange chat is geen net dossier dat de AI raadpleegt. Het is een groeiende stapel tekst waarin jouw belangrijke regel concurreert met veertig berichten bijzaken, doodlopende sporen en correcties die je allang achter je hebt gelaten.

De AI-labs weten het, en bouwden een omweg

Dit is geen randklacht. De bedrijven documenteren het zelf.

De ontwikkelaarsdocumentatie van Anthropic beschrijft een functie genaamd compaction, die oudere delen van een gesprek automatisch samenvat zodra het lang wordt. De opgegeven reden is onomwonden: «naarmate een gesprek groeit, gaat de antwoordkwaliteit achteruit», dus het oude materiaal wordt vervangen door een korte samenvatting.

Lees dat nog eens, want daar zit het bruikbare deel. De officiële oplossing voor een lang gesprek is het grootste deel ervan weggooien en een samenvatting bewaren. Precies dat kun je met de hand doen, gratis, in elke chat-app, zonder te wachten op een functie die het voor je doet.

Wat te doen als een chat begint af te dwalen

Dit is de praktische vertaling. Koppel het symptoom aan wat er echt gebeurt.

Wat je merktWat er speeltWat je doet
Hij vergeet een regel van het beginDe instructie ligt midden in een lange chatHerhaal de regel in je nieuwste bericht, niet als geheugensteun maar als de instructie
Hij herhaalt een voorstel dat je afweesDe afgewezen versie staat nog in de geschiedenis en telt nog als contextStart een nieuwe chat en beschrijf alleen wat je wilt, nooit wat je al uitsloot
Antwoorden worden vager en algemenerTe veel concurrerend materiaal in het vensterVat de stand van zaken samen in één bericht en ga daarvandaan verder
Hij maakt dezelfde fout na correctiesHij legde zich vroeg vast op een verkeerde aannameVerlaat de draad. Een correctie weegt zelden zwaarder dan het gesprek eronder
Hij zit er vol overtuiging naast met feitenAnder probleem, los van de lengteZie waarom AI zelfverzekerd dingen verzint

En vijf gewoontes die het meeste hiervan voorkomen:

  1. Zet het hele verzoek vooraan. De sterkste uitkomst van dit onderzoek is dat één compleet bericht dezelfde informatie in stukjes verslaat. Besteed die extra dertig seconden aan de volledige vraag.
  2. Herstart in plaats van te discussiëren. Als een chat misgaat, kost een nieuwe je niets. Plak er alleen de goede stukken in.
  3. Schrijf je eigen samenvatting aan het eind van een lange sessie. Vraag de AI om een korte opsomming van de genomen besluiten, controleer die, open een nieuwe chat en plak hem als eerste bericht.
  4. Houd onderwerpen in aparte chats. Eén draad voor het werkproject, een andere voor de vakantie. Door elkaar zet je afleiding in allebei.
  5. Wissel van model als er eentje vastloopt. Een ander model weet niets van je vorige mislukte gesprek. Het komt fris binnen, en het zal het vaak op nuttige manieren oneens zijn met het eerste, wat we bekeken in waarom AI-modellen verschillende antwoorden geven.

Die laatste is de goedkoopste truc van allemaal, en degene die mensen overslaan omdat ze maar één AI-app open hebben.

Waar dit advies tekortschiet

Een paar eerlijke kanttekeningen, want de oplossing werkt niet overal.

Opnieuw beginnen kost echt iets. Als je een uur hebt besteed aan het aanleren van de toon van je nieuwsbrief, doet weggooien pijn, en een samenvatting vangt nooit alles. Bewaar in dat geval een korte, herbruikbare briefing in een notitie op je computer en plak die in elke nieuwe chat. Je houdt het bruikbare deel en laat de rommel liggen.

Het onderzoek testte de modellen ook tegen gesimuleerde gebruikers die een script volgden, niet tegen het rommelige heen en weer van een echt mens dat een verkeerde afslag kan herkennen en stoppen. Wie oplet en de fout bij bericht drie ziet, doet het beter dan deze cijfers suggereren. Dat pleit ervoor de vroege antwoorden goed te lezen, als corrigeren nog bijna niets kost.

En sommige klussen vragen echt om één lange draad, zoals je door een groot document werken dat je niet kunt samenvatten zonder de kern te verliezen. Een model gemaakt voor lange documenten, zoals Claude Opus 4.7, gaat daar beter mee om dan de meeste, maar het haalt het probleem niet weg. Houd voor die klussen de draad aan en herhaal je kerninstructie om de paar berichten, zodat die dicht bij het eind van de stapel blijft, waar het model het scherpst kijkt.

Er is geen vast getal, want het hangt af van hoeveel van het gesprek echt nuttig is. Een beter signaal dan het aantal berichten is het gedrag: zodra hij een instructie vergeet of iets herhaalt dat je afwees, helpt de draad je niet meer.
Je verliest het gesprek. Wat de app bewaart als opgeslagen geheugen of profiel blijft staan. De veilige gewoonte is een eigen korte briefing in een notitie te houden en die in het eerste bericht van elke nieuwe chat te plakken.
Ze werken eraan. Sommige producten vatten oudere delen van een gesprek al automatisch samen, precies de truc die je met de hand kunt doen. De onderliggende neiging om zich vroeg vast te leggen op een aanname is niet opgelost, dus de gewoonte blijft nuttig.
Niet vanzelf. Tests uit 2025 vonden dalende nauwkeurigheid ruim voor de aangeprezen limieten. Een groter venster betekent dat de AI meer tekst aanneemt, niet dat hij alles even goed gebruikt.
Plak een samenvatting, geen transcript. Alles kopiëren maakt precies het probleem opnieuw waaraan je wilde ontsnappen, inclusief de verkeerde afslagen en de afgewezen ideeën.
Vaak wel. Een ander model draagt de eerdere verkeerde aanname niet mee en benadert het probleem anders. Het is het snelste wat je kunt proberen als een model in een lus blijft hangen.

Kort samengevat

Lange AI-gesprekken mislukken niet omdat de machine moe wordt. Ze mislukken omdat het model vroeg een stille aanname deed, daar alles op bouwde, en jouw beste instructie vervolgens begroef midden in een stapel tekst die het niet gelijkmatig leest.

Als je dat weet, liggen de gewoontes voor de hand. Zeg het in één keer. Begin opnieuw als het afdwaalt. Bewaar je briefing ergens waar je hem opnieuw kunt plakken. En als een model in een lus blijft hangen, stop met discussiëren en geef dezelfde vraag aan een ander.