Därför blir AI sämre i långa chattar
Av Chatday Editorial Team ·
De första tio minuterna är fantastiska. AI:n förstår vad du vill, svaren sitter, och du tänker att du äntligen har hittat en riktig arbetspartner.
Sedan, någonstans kring meddelande trettio, börjar det glida. Den glömmer en regel du satte i början. Den lämnar tillbaka något du redan sagt nej till. Du rättar, den ber om ursäkt, och två svar senare gör den om samma fel.
Det handlar inte om ditt tålamod, och modellen har ingen dålig dag. Långa samtal blir faktiskt sämre, det händer varje modell på marknaden, och forskare har nu mätt hur mycket.
Vad som händer med AI-svaren i ett långt samtal
Forskare på Microsoft och Salesforce gjorde ett experiment som är lätt att beskriva. De tog uppgifter som en modell normalt klarar bra, som att skriva lite kod eller svara på en fråga utifrån flera dokument, och bad om dem på två sätt.
I den första versionen kom hela frågan i ett enda komplett meddelande. I den andra släpptes exakt samma information ut bit för bit över flera turer, så som en riktig människa pratar: en vag inledande fråga, sedan en detalj, sedan en rättelse, sedan ännu en detalj.
Samma modell, samma information, samma slutmål. Det enda som skilde var leveransen.
Över mer än 200 000 simulerade samtal och sex sorters uppgifter presterade alla testade toppmodeller betydligt sämre i den uppdelade versionen. Det genomsnittliga tappet var 39%. Arbetet publicerades i maj 2025 och presenterades muntligt på ICLR 2026, en av fältets viktigaste konferenser, i april.
Mer intressant är hur det går fel. Modellerna blev inte mindre kompetenta. De blev mindre pålitliga, vilket är ett annat och mer irriterande problem. Ställ samma uppdelade fråga tio gånger till samma modell och kvaliteten varierar mycket mer än den skulle göra i ett enda meddelande.
Skälet är lätt att se framför sig. När ditt första meddelande är vagt väntar modellen inte på ett förtydligande. Den fyller tyst luckorna med en gissning, låser fast sig vid den och börjar producera ett svar byggt ovanpå. Var gissningen fel ärver allt som följer felet. Forskarna såg att när en modell väl svänger fel tidigt i ett samtal hittar den sällan tillbaka, inte ens när du rättar den rakt ut.
Varför större minne inte räddar långa chattar
Den självklara invändningen är att modeller numera har enorma minnen. Vissa läser en miljon ord på en gång. En chatt på femtio meddelanden borde vara ingenting.
Det stämmer om kapacitet och stämmer inte om kvalitet, och hela historien ligger i glappet däremellan. Vill du ha hela bilden av hur det minnet fungerar har vi separat förklarat vad ett kontextfönster egentligen är. Kort sagt: det är mängden text modellen kan ha framför sig medan den svarar.
Att ha text framför sig är inte samma sak som att använda den väl. Ett forskarlag på Chroma testade 18 ledande modeller i juli 2025 och hittade samma mönster i alla. Träffsäkerheten sjönk när indata blev längre, och den sjönk långt före den utlovade gränsen. En modell som tekniskt tar emot en miljon ord kan redan vid femtiotusen svara märkbart sämre.
Två detaljer från arbetet sticker ut för att de går emot intuitionen:
- Ett enda irrelevant stycke räcker för att skada. Att lägga till ett enda distraherande textblock, inte hundra, sänkte träffsäkerheten mätbart.
- Prydligt ordnad text kan vara sämre än en blandad hög. Modellerna fick högre resultat när materialet runtomkring var ihopblandat än när det var logiskt ordnat.
Det finns också ett äldre och väl bekräftat resultat som förklarar mycket av den dagliga irritationen. En Stanfordledd studie visade 2023 att modeller är bäst på att hitta information allra först eller allra sist i en lång indata, och betydligt sämre i mitten. Din genomtänkta instruktion från meddelande åtta ligger nu mitt i högen. Det är sämsta tänkbara plats.
Lägg ihop de två och bilden klarnar. Din långa chatt är ingen prydlig akt som AI:n slår upp. Den är en växande hög text där din viktiga rad konkurrerar med fyrtio meddelanden av småprat, återvändsgränder och rättelser du redan lämnat bakom dig.
AI-labben vet om det, och har byggt en genväg
Det här är ingen randanmärkning. Företagen dokumenterar det själva.
Anthropics utvecklardokumentation beskriver en funktion som heter compaction, som automatiskt sammanfattar äldre delar av ett samtal när det blir långt. Det angivna skälet är rakt: »när ett samtal växer försämras svarskvaliteten«, alltså ersätts det gamla materialet med en kort sammanfattning.
Läs det igen, för där ligger det användbara. Den officiella lösningen på ett långt samtal är att kasta det mesta av det och behålla en sammanfattning. Du kan göra exakt samma sak för hand, gratis, i vilken chattapp som helst, utan att vänta på en funktion som gör det åt dig.
Vad du gör när en chatt börjar driva
Här är den praktiska översättningen. Koppla symptomet till vad som faktiskt pågår.
| Vad du märker | Vad som pågår | Vad du gör |
|---|---|---|
| Den glömmer en regel du satte tidigt | Instruktionen ligger mitt i en lång chatt | Upprepa regeln i ditt senaste meddelande, inte som påminnelse utan som instruktionen |
| Den upprepar ett förslag du sagt nej till | Den avvisade versionen finns kvar i historiken och räknas fortfarande som sammanhang | Starta en ny chatt och beskriv bara vad du vill ha, aldrig det du redan valt bort |
| Svaren blir vagare och mer generiska | För mycket konkurrerande material i fönstret | Sammanfatta läget i ett meddelande och fortsätt därifrån |
| Den gör om samma fel efter rättelser | Den låste fast sig tidigt vid en felaktig gissning | Överge tråden. En rättelse väger sällan tyngre än samtalet den vilar på |
| Den har självsäkert fel om fakta | Ett annat problem, oberoende av längden | Se varför AI självsäkert hittar på saker |
Och fem vanor som förebygger det mesta från början:
- Lägg fram hela frågan direkt. Det starkaste resultatet i forskningen är att ett komplett meddelande slår samma information levererad i bitar. Lägg de trettio extra sekunderna på att skriva hela frågan.
- Starta om i stället för att bråka. När en chatt spårar ur kostar en ny ingenting. Klistra bara in de bra bitarna.
- Skriv din egen sammanfattning efter en lång session. Be AI:n om en kort genomgång av besluten, kontrollera den, öppna en ny chatt och klistra in den som första meddelande.
- Håll olika ämnen i olika chattar. En tråd för jobbprojektet, en annan för semestern. Blandat lägger du distraktion i båda.
- Byt modell när en kör fast. En annan modell har ingen aning om att ditt förra samtal gick dåligt. Den möter problemet rent, och den håller ofta inte med den första på användbara sätt, vilket vi tittade på i varför AI-modeller ger olika svar.
Det sista är det billigaste tricket av alla, och det folk hoppar över för att de bara har en AI-app öppen.
Där rådet inte räcker till
Några ärliga reservationer, för lösningen passar inte överallt.
Att börja om kostar på riktigt. Har du lagt en timme på att lära en AI tonen i ditt nyhetsbrev gör det ont att slänga bort det, och en sammanfattning fångar aldrig allt. Håll då en kort återanvändbar beskrivning i en anteckning på datorn och klistra in den i varje ny chatt. Du behåller den användbara delen och släpper röran.
Studien testade också modellerna mot simulerade användare som följde ett manus, inte mot det röriga fram och tillbaka som en riktig person klarar, någon som märker en felsväng och stoppar den. Den som är uppmärksam och fångar felet i meddelande tre klarar sig bättre än siffrorna antyder. Det är ett argument för att läsa de tidiga svaren noga, medan en rättelse fortfarande kostar nästan ingenting.
Och vissa uppgifter kräver verkligen en enda lång tråd, som att arbeta sig igenom ett stort dokument du inte kan sammanfatta utan att tappa poängen. En modell byggd för långa dokument, som Claude Opus 4.7, klarar det bättre än de flesta, men den tar inte bort problemet. Behåll då tråden och upprepa din huvudinstruktion med några meddelandens mellanrum, så att den ligger nära slutet av högen, där modellen tittar noggrannast.
Kort sagt
Långa AI-samtal misslyckas inte för att maskinen blir trött. De misslyckas för att modellen gjorde ett tyst antagande tidigt, byggde allt ovanpå det, och sedan begravde din bästa instruktion mitt i en hög text som den inte läser jämnt.
När du vet det blir vanorna självklara. Säg allt på en gång. Börja om när det driver. Håll din beskrivning någonstans där du kan klistra in den igen. Och när en modell fastnat i en slinga, sluta bråka med den och ge samma fråga till en annan.