Sammenlign modeller Sammenlign bildemodeller AI-verktøy Modeller AI-bildemodeller AI-nyheter Søk Prøv gratis
Forklaring 8 min lesing

Derfor blir KI dårligere i lange chatter

Av Chatday Editorial Team ·

kiforklartslik-fungerer-detchathukommelse
Derfor blir KI dårligere i lange chatter

De første ti minuttene er strålende. KI-en skjønner hva du vil, svarene treffer, og du tenker at du endelig har funnet en ordentlig arbeidspartner.

Så, et sted rundt melding tretti, begynner det å skli. Den glemmer en regel du satte i starten. Den leverer tilbake noe du allerede har forkastet. Du retter, den beklager, og to svar senere gjør den samme feil igjen.

Det handler ikke om tålmodigheten din, og modellen har ingen dårlig dag. Lange samtaler blir faktisk dårligere, det skjer med alle modeller på markedet, og forskere har nå målt hvor mye.

Hva som skjer med KI-svarene i en lang samtale

Forskere ved Microsoft og Salesforce gjorde et forsøk som er lett å beskrive. De tok oppgaver en modell vanligvis håndterer fint, som å skrive litt kode eller svare på et spørsmål ut fra flere dokumenter, og ba om dem på to måter.

I den første versjonen kom hele forespørselen i én komplett melding. I den andre ble nøyaktig samme informasjon sluppet ut litt om gangen over flere runder, slik en ekte person snakker: et vagt åpningsspørsmål, så en detalj, så en rettelse, så enda en detalj.

Samme modell, samme informasjon, samme sluttmål. Det eneste som endret seg var leveringen.

På tvers av mer enn 200 000 simulerte samtaler og seks typer oppgaver gjorde alle testede toppmodeller det tydelig dårligere i den oppdelte versjonen. Det gjennomsnittlige fallet var 39%. Arbeidet ble publisert i mai 2025 og lagt fram som muntlig innlegg på ICLR 2026, en av fagfeltets viktigste konferanser, i april.

Mer interessant er hvordan det svikter. Modellene ble ikke mindre dyktige. De ble mindre pålitelige, som er et annet og mer irriterende problem. Still samme oppdelte spørsmål ti ganger til samme modell, og kvaliteten spriker langt mer enn den ville gjort i én melding.

Grunnen er lett å se for seg. Når den første meldingen din er vag, venter ikke modellen på oppklaring. Den fyller hullene stille med en gjetning, låser seg til den, og begynner å lage et svar bygget oppå. Var gjetningen feil, arver alt som følger feilen. Forskerne fant at når en modell først svinger feil tidlig i en samtale, finner den sjelden veien tilbake, selv når du retter den direkte.

Hvorfor større minne ikke redder lange chatter

Den åpenbare innvendingen er at modeller nå har enorme minner. Noen leser en million ord om gangen. En chat på femti meldinger burde være ingenting.

Det stemmer om kapasitet og stemmer ikke om kvalitet, og hele historien ligger i gapet mellom dem. Vil du ha hele bildet av hvordan det minnet virker, har vi forklart separat hva et kontekstvindu egentlig er. Kort sagt: det er mengden tekst modellen kan ha foran seg mens den svarer.

Å ha tekst foran seg er ikke det samme som å bruke den godt. Et forskerteam hos Chroma testet 18 ledende modeller i juli 2025 og fant samme mønster i alle. Treffsikkerheten falt etter hvert som inndataene ble lengre, og den falt lenge før den annonserte grensen. En modell som teknisk tar imot en million ord, kan allerede ved femti tusen svare merkbart dårligere.

To detaljer fra arbeidet skiller seg ut fordi de går mot intuisjonen:

  • Ett irrelevant avsnitt er nok til å skade. Å legge til én forstyrrende tekstbit, ikke hundre, senket treffsikkerheten målbart.
  • Ryddig ordnet tekst kan være verre enn en blandet haug. Modellene skåret høyere når materialet rundt var stokket om enn når det var logisk ordnet.

Det finnes også et eldre og godt bekreftet funn som forklarer mye av den daglige frustrasjonen. En Stanford-ledet studie viste i 2023 at modeller er best til å finne informasjon helt i starten eller helt i slutten av en lang inndata, og langt dårligere midt inni. Den nøye formulerte instruksjonen din fra melding åtte ligger nå midt i haugen. Det er det verst tenkelige stedet.

Legg de to sammen, og bildet henger på greip. Den lange chatten din er ikke et ryddig arkiv KI-en slår opp i. Den er en voksende haug tekst der den viktige linjen din konkurrerer med førti meldinger småprat, blindveier og rettelser du for lengst har forlatt.

KI-laboratoriene vet det, og har bygget en omvei

Dette er ingen randbemerkning. Selskapene dokumenterer det selv.

Utviklerdokumentasjonen til Anthropic beskriver en funksjon kalt compaction, som automatisk oppsummerer eldre deler av en samtale når den blir lang. Begrunnelsen er direkte: «når en samtale vokser, blir svarkvaliteten dårligere», så det gamle materialet erstattes med et kort sammendrag.

Les det en gang til, for der ligger det nyttige. Den offisielle løsningen på en lang samtale er å kaste det meste av den og beholde et sammendrag. Nøyaktig det samme kan du gjøre for hånd, gratis, i hvilken som helst chat-app, uten å vente på en funksjon som gjør det for deg.

Hva du gjør når en chat begynner å drive

Her er den praktiske oversettelsen. Koble symptomet til det som faktisk skjer.

Det du merkerHva som skjerHva du gjør
Den glemmer en regel du satte tidligInstruksjonen ligger midt i en lang chatGjenta regelen i den nyeste meldingen din, ikke som påminnelse men som instruksjonen
Den gjentar et forslag du forkastetDen forkastede versjonen står fortsatt i historikken og teller fortsatt som kontekstStart en ny chat og beskriv bare det du vil ha, aldri det du allerede har utelukket
Svarene blir vagere og mer generiskeFor mye konkurrerende materiale i vinduetOppsummer situasjonen i én melding og fortsett derfra
Den gjør samme feil etter rettelserDen låste seg tidlig til en feil antagelseForlat tråden. En rettelse veier sjelden tyngre enn samtalen den hviler på
Den tar selvsikkert feil om faktaEt annet problem, uavhengig av lengdenSe hvorfor KI selvsikkert finner på ting

Og fem vaner som forebygger det meste av dette:

  1. Legg fram hele forespørselen med én gang. Det sterkeste funnet i forskningen er at én komplett melding slår den samme informasjonen levert i biter. Bruk de tretti ekstra sekundene på å skrive hele spørsmålet.
  2. Start på nytt i stedet for å krangle. Når en chat sporer av, koster en ny deg ingenting. Lim inn bare de gode bitene.
  3. Skriv ditt eget sammendrag etter en lang økt. Be KI-en om en kort oppsummering av beslutningene, sjekk den, åpne en ny chat og lim den inn som første melding.
  4. Hold temaer i separate chatter. Én tråd for jobbprosjektet, en annen for ferien. Blandet legger du forstyrrelser i begge.
  5. Bytt modell når en står fast. En annen modell aner ikke at forrige samtale gikk dårlig. Den møter problemet rent, og den vil ofte være uenig med den første på nyttige måter, noe vi så på i hvorfor KI-modeller gir ulike svar.

Den siste er det billigste trikset av alle, og det folk hopper over fordi de bare har én KI-app åpen.

Der dette rådet kommer til kort

Noen ærlige forbehold, for løsningen passer ikke overalt.

Å begynne på nytt koster noe reelt. Har du brukt en time på å lære en KI tonen i nyhetsbrevet ditt, gjør det vondt å kaste det, og et sammendrag fanger aldri alt. Hold da en kort gjenbrukbar beskrivelse i et notat på maskinen og lim den inn i hver nye chat. Du beholder den nyttige delen og slipper rotet.

Studien testet også modellene mot simulerte brukere som fulgte et manus, ikke mot den rotete fram og tilbake med en ekte person som klarer å oppdage en feil avstikker og stoppe den. Den som følger med og fanger feilen i melding tre, gjør det bedre enn tallene antyder. Det taler for å lese de tidlige svarene nøye, mens en rettelse fortsatt koster nesten ingenting.

Og noen oppgaver krever virkelig én lang tråd, som å arbeide seg gjennom et stort dokument du ikke kan oppsummere uten å miste poenget. En modell laget for lange dokumenter, som Claude Opus 4.7, håndterer det bedre enn de fleste, men den fjerner ikke problemet. Behold tråden for slike oppgaver, og gjenta kjerneinstruksjonen din med noen meldingers mellomrom, så den ligger nær slutten av haugen, der modellen ser nøyest etter.

Det finnes ikke noe fast tall, fordi det kommer an på hvor mye av samtalen som faktisk er nyttig. Et bedre signal enn antall meldinger er oppførselen: i det øyeblikket den glemmer en instruksjon eller gjentar noe du forkastet, har tråden sluttet å hjelpe deg.
Du mister samtalen. Det appen lagrer som minne eller profil, blir værende. Den trygge vanen er å ha en egen kort beskrivelse i et notat og lime den inn i første melding i hver nye chat.
De jobber med det. Noen produkter oppsummerer allerede eldre deler av en samtale automatisk, altså samme triks som du kan gjøre for hånd. Den underliggende tendensen til å låse seg tidlig til en antagelse er ikke løst, så vanen er fortsatt verdt å ha.
Ikke alene. Tester fra 2025 fant fallende treffsikkerhet lenge før de annonserte grensene. Et større vindu betyr at KI-en tar imot mer tekst, ikke at den bruker alt like godt.
Lim inn et sammendrag, ikke referatet. Å kopiere inn alt gjenskaper nøyaktig problemet du prøvde å komme unna, inkludert feilsvingene og de forkastede ideene.
Ofte ja. En annen modell drar ikke med seg den tidligere feilgjetningen og går løs på problemet på en annen måte. Det er det raskeste å prøve når én modell henger fast i en sløyfe.

Kort fortalt

Lange KI-samtaler svikter ikke fordi maskinen blir sliten. De svikter fordi modellen gjorde en stille antagelse tidlig, bygget alt oppå den, og så begravde den beste instruksjonen din midt i en haug tekst som den ikke leser jevnt.

Når du vet det, gir vanene seg selv. Si alt på en gang. Begynn på nytt når det driver av. Ha beskrivelsen din et sted du kan lime den inn igjen. Og når en modell henger fast i en sløyfe, slutt å krangle med den og gi det samme spørsmålet til en annen.