Derfor blir KI dårligere i lange chatter
Av Chatday Editorial Team ·
De første ti minuttene er strålende. KI-en skjønner hva du vil, svarene treffer, og du tenker at du endelig har funnet en ordentlig arbeidspartner.
Så, et sted rundt melding tretti, begynner det å skli. Den glemmer en regel du satte i starten. Den leverer tilbake noe du allerede har forkastet. Du retter, den beklager, og to svar senere gjør den samme feil igjen.
Det handler ikke om tålmodigheten din, og modellen har ingen dårlig dag. Lange samtaler blir faktisk dårligere, det skjer med alle modeller på markedet, og forskere har nå målt hvor mye.
Hva som skjer med KI-svarene i en lang samtale
Forskere ved Microsoft og Salesforce gjorde et forsøk som er lett å beskrive. De tok oppgaver en modell vanligvis håndterer fint, som å skrive litt kode eller svare på et spørsmål ut fra flere dokumenter, og ba om dem på to måter.
I den første versjonen kom hele forespørselen i én komplett melding. I den andre ble nøyaktig samme informasjon sluppet ut litt om gangen over flere runder, slik en ekte person snakker: et vagt åpningsspørsmål, så en detalj, så en rettelse, så enda en detalj.
Samme modell, samme informasjon, samme sluttmål. Det eneste som endret seg var leveringen.
På tvers av mer enn 200 000 simulerte samtaler og seks typer oppgaver gjorde alle testede toppmodeller det tydelig dårligere i den oppdelte versjonen. Det gjennomsnittlige fallet var 39%. Arbeidet ble publisert i mai 2025 og lagt fram som muntlig innlegg på ICLR 2026, en av fagfeltets viktigste konferanser, i april.
Mer interessant er hvordan det svikter. Modellene ble ikke mindre dyktige. De ble mindre pålitelige, som er et annet og mer irriterende problem. Still samme oppdelte spørsmål ti ganger til samme modell, og kvaliteten spriker langt mer enn den ville gjort i én melding.
Grunnen er lett å se for seg. Når den første meldingen din er vag, venter ikke modellen på oppklaring. Den fyller hullene stille med en gjetning, låser seg til den, og begynner å lage et svar bygget oppå. Var gjetningen feil, arver alt som følger feilen. Forskerne fant at når en modell først svinger feil tidlig i en samtale, finner den sjelden veien tilbake, selv når du retter den direkte.
Hvorfor større minne ikke redder lange chatter
Den åpenbare innvendingen er at modeller nå har enorme minner. Noen leser en million ord om gangen. En chat på femti meldinger burde være ingenting.
Det stemmer om kapasitet og stemmer ikke om kvalitet, og hele historien ligger i gapet mellom dem. Vil du ha hele bildet av hvordan det minnet virker, har vi forklart separat hva et kontekstvindu egentlig er. Kort sagt: det er mengden tekst modellen kan ha foran seg mens den svarer.
Å ha tekst foran seg er ikke det samme som å bruke den godt. Et forskerteam hos Chroma testet 18 ledende modeller i juli 2025 og fant samme mønster i alle. Treffsikkerheten falt etter hvert som inndataene ble lengre, og den falt lenge før den annonserte grensen. En modell som teknisk tar imot en million ord, kan allerede ved femti tusen svare merkbart dårligere.
To detaljer fra arbeidet skiller seg ut fordi de går mot intuisjonen:
- Ett irrelevant avsnitt er nok til å skade. Å legge til én forstyrrende tekstbit, ikke hundre, senket treffsikkerheten målbart.
- Ryddig ordnet tekst kan være verre enn en blandet haug. Modellene skåret høyere når materialet rundt var stokket om enn når det var logisk ordnet.
Det finnes også et eldre og godt bekreftet funn som forklarer mye av den daglige frustrasjonen. En Stanford-ledet studie viste i 2023 at modeller er best til å finne informasjon helt i starten eller helt i slutten av en lang inndata, og langt dårligere midt inni. Den nøye formulerte instruksjonen din fra melding åtte ligger nå midt i haugen. Det er det verst tenkelige stedet.
Legg de to sammen, og bildet henger på greip. Den lange chatten din er ikke et ryddig arkiv KI-en slår opp i. Den er en voksende haug tekst der den viktige linjen din konkurrerer med førti meldinger småprat, blindveier og rettelser du for lengst har forlatt.
KI-laboratoriene vet det, og har bygget en omvei
Dette er ingen randbemerkning. Selskapene dokumenterer det selv.
Utviklerdokumentasjonen til Anthropic beskriver en funksjon kalt compaction, som automatisk oppsummerer eldre deler av en samtale når den blir lang. Begrunnelsen er direkte: «når en samtale vokser, blir svarkvaliteten dårligere», så det gamle materialet erstattes med et kort sammendrag.
Les det en gang til, for der ligger det nyttige. Den offisielle løsningen på en lang samtale er å kaste det meste av den og beholde et sammendrag. Nøyaktig det samme kan du gjøre for hånd, gratis, i hvilken som helst chat-app, uten å vente på en funksjon som gjør det for deg.
Hva du gjør når en chat begynner å drive
Her er den praktiske oversettelsen. Koble symptomet til det som faktisk skjer.
| Det du merker | Hva som skjer | Hva du gjør |
|---|---|---|
| Den glemmer en regel du satte tidlig | Instruksjonen ligger midt i en lang chat | Gjenta regelen i den nyeste meldingen din, ikke som påminnelse men som instruksjonen |
| Den gjentar et forslag du forkastet | Den forkastede versjonen står fortsatt i historikken og teller fortsatt som kontekst | Start en ny chat og beskriv bare det du vil ha, aldri det du allerede har utelukket |
| Svarene blir vagere og mer generiske | For mye konkurrerende materiale i vinduet | Oppsummer situasjonen i én melding og fortsett derfra |
| Den gjør samme feil etter rettelser | Den låste seg tidlig til en feil antagelse | Forlat tråden. En rettelse veier sjelden tyngre enn samtalen den hviler på |
| Den tar selvsikkert feil om fakta | Et annet problem, uavhengig av lengden | Se hvorfor KI selvsikkert finner på ting |
Og fem vaner som forebygger det meste av dette:
- Legg fram hele forespørselen med én gang. Det sterkeste funnet i forskningen er at én komplett melding slår den samme informasjonen levert i biter. Bruk de tretti ekstra sekundene på å skrive hele spørsmålet.
- Start på nytt i stedet for å krangle. Når en chat sporer av, koster en ny deg ingenting. Lim inn bare de gode bitene.
- Skriv ditt eget sammendrag etter en lang økt. Be KI-en om en kort oppsummering av beslutningene, sjekk den, åpne en ny chat og lim den inn som første melding.
- Hold temaer i separate chatter. Én tråd for jobbprosjektet, en annen for ferien. Blandet legger du forstyrrelser i begge.
- Bytt modell når en står fast. En annen modell aner ikke at forrige samtale gikk dårlig. Den møter problemet rent, og den vil ofte være uenig med den første på nyttige måter, noe vi så på i hvorfor KI-modeller gir ulike svar.
Den siste er det billigste trikset av alle, og det folk hopper over fordi de bare har én KI-app åpen.
Der dette rådet kommer til kort
Noen ærlige forbehold, for løsningen passer ikke overalt.
Å begynne på nytt koster noe reelt. Har du brukt en time på å lære en KI tonen i nyhetsbrevet ditt, gjør det vondt å kaste det, og et sammendrag fanger aldri alt. Hold da en kort gjenbrukbar beskrivelse i et notat på maskinen og lim den inn i hver nye chat. Du beholder den nyttige delen og slipper rotet.
Studien testet også modellene mot simulerte brukere som fulgte et manus, ikke mot den rotete fram og tilbake med en ekte person som klarer å oppdage en feil avstikker og stoppe den. Den som følger med og fanger feilen i melding tre, gjør det bedre enn tallene antyder. Det taler for å lese de tidlige svarene nøye, mens en rettelse fortsatt koster nesten ingenting.
Og noen oppgaver krever virkelig én lang tråd, som å arbeide seg gjennom et stort dokument du ikke kan oppsummere uten å miste poenget. En modell laget for lange dokumenter, som Claude Opus 4.7, håndterer det bedre enn de fleste, men den fjerner ikke problemet. Behold tråden for slike oppgaver, og gjenta kjerneinstruksjonen din med noen meldingers mellomrom, så den ligger nær slutten av haugen, der modellen ser nøyest etter.
Kort fortalt
Lange KI-samtaler svikter ikke fordi maskinen blir sliten. De svikter fordi modellen gjorde en stille antagelse tidlig, bygget alt oppå den, og så begravde den beste instruksjonen din midt i en haug tekst som den ikke leser jevnt.
Når du vet det, gir vanene seg selv. Si alt på en gang. Begynn på nytt når det driver av. Ha beskrivelsen din et sted du kan lime den inn igjen. Og når en modell henger fast i en sløyfe, slutt å krangle med den og gi det samme spørsmålet til en annen.