Jämför modeller Jämför bildmodeller AI-verktyg Modeller AI-bildmodeller AI-nyheter Sök Prova gratis
Förklaring 8 min läsning

Därför blir AI sämre i långa chattar

Av Chatday Editorial Team ·

aiforklaringsa-funkar-detchattminne
Därför blir AI sämre i långa chattar

De första tio minuterna är fantastiska. AI:n förstår vad du vill, svaren sitter, och du tänker att du äntligen har hittat en riktig arbetspartner.

Sedan, någonstans kring meddelande trettio, börjar det glida. Den glömmer en regel du satte i början. Den lämnar tillbaka något du redan sagt nej till. Du rättar, den ber om ursäkt, och två svar senare gör den om samma fel.

Det handlar inte om ditt tålamod, och modellen har ingen dålig dag. Långa samtal blir faktiskt sämre, det händer varje modell på marknaden, och forskare har nu mätt hur mycket.

Vad som händer med AI-svaren i ett långt samtal

Forskare på Microsoft och Salesforce gjorde ett experiment som är lätt att beskriva. De tog uppgifter som en modell normalt klarar bra, som att skriva lite kod eller svara på en fråga utifrån flera dokument, och bad om dem på två sätt.

I den första versionen kom hela frågan i ett enda komplett meddelande. I den andra släpptes exakt samma information ut bit för bit över flera turer, så som en riktig människa pratar: en vag inledande fråga, sedan en detalj, sedan en rättelse, sedan ännu en detalj.

Samma modell, samma information, samma slutmål. Det enda som skilde var leveransen.

Över mer än 200 000 simulerade samtal och sex sorters uppgifter presterade alla testade toppmodeller betydligt sämre i den uppdelade versionen. Det genomsnittliga tappet var 39%. Arbetet publicerades i maj 2025 och presenterades muntligt på ICLR 2026, en av fältets viktigaste konferenser, i april.

Mer intressant är hur det går fel. Modellerna blev inte mindre kompetenta. De blev mindre pålitliga, vilket är ett annat och mer irriterande problem. Ställ samma uppdelade fråga tio gånger till samma modell och kvaliteten varierar mycket mer än den skulle göra i ett enda meddelande.

Skälet är lätt att se framför sig. När ditt första meddelande är vagt väntar modellen inte på ett förtydligande. Den fyller tyst luckorna med en gissning, låser fast sig vid den och börjar producera ett svar byggt ovanpå. Var gissningen fel ärver allt som följer felet. Forskarna såg att när en modell väl svänger fel tidigt i ett samtal hittar den sällan tillbaka, inte ens när du rättar den rakt ut.

Varför större minne inte räddar långa chattar

Den självklara invändningen är att modeller numera har enorma minnen. Vissa läser en miljon ord på en gång. En chatt på femtio meddelanden borde vara ingenting.

Det stämmer om kapacitet och stämmer inte om kvalitet, och hela historien ligger i glappet däremellan. Vill du ha hela bilden av hur det minnet fungerar har vi separat förklarat vad ett kontextfönster egentligen är. Kort sagt: det är mängden text modellen kan ha framför sig medan den svarar.

Att ha text framför sig är inte samma sak som att använda den väl. Ett forskarlag på Chroma testade 18 ledande modeller i juli 2025 och hittade samma mönster i alla. Träffsäkerheten sjönk när indata blev längre, och den sjönk långt före den utlovade gränsen. En modell som tekniskt tar emot en miljon ord kan redan vid femtiotusen svara märkbart sämre.

Två detaljer från arbetet sticker ut för att de går emot intuitionen:

  • Ett enda irrelevant stycke räcker för att skada. Att lägga till ett enda distraherande textblock, inte hundra, sänkte träffsäkerheten mätbart.
  • Prydligt ordnad text kan vara sämre än en blandad hög. Modellerna fick högre resultat när materialet runtomkring var ihopblandat än när det var logiskt ordnat.

Det finns också ett äldre och väl bekräftat resultat som förklarar mycket av den dagliga irritationen. En Stanfordledd studie visade 2023 att modeller är bäst på att hitta information allra först eller allra sist i en lång indata, och betydligt sämre i mitten. Din genomtänkta instruktion från meddelande åtta ligger nu mitt i högen. Det är sämsta tänkbara plats.

Lägg ihop de två och bilden klarnar. Din långa chatt är ingen prydlig akt som AI:n slår upp. Den är en växande hög text där din viktiga rad konkurrerar med fyrtio meddelanden av småprat, återvändsgränder och rättelser du redan lämnat bakom dig.

AI-labben vet om det, och har byggt en genväg

Det här är ingen randanmärkning. Företagen dokumenterar det själva.

Anthropics utvecklardokumentation beskriver en funktion som heter compaction, som automatiskt sammanfattar äldre delar av ett samtal när det blir långt. Det angivna skälet är rakt: »när ett samtal växer försämras svarskvaliteten«, alltså ersätts det gamla materialet med en kort sammanfattning.

Läs det igen, för där ligger det användbara. Den officiella lösningen på ett långt samtal är att kasta det mesta av det och behålla en sammanfattning. Du kan göra exakt samma sak för hand, gratis, i vilken chattapp som helst, utan att vänta på en funktion som gör det åt dig.

Vad du gör när en chatt börjar driva

Här är den praktiska översättningen. Koppla symptomet till vad som faktiskt pågår.

Vad du märkerVad som pågårVad du gör
Den glömmer en regel du satte tidigtInstruktionen ligger mitt i en lång chattUpprepa regeln i ditt senaste meddelande, inte som påminnelse utan som instruktionen
Den upprepar ett förslag du sagt nej tillDen avvisade versionen finns kvar i historiken och räknas fortfarande som sammanhangStarta en ny chatt och beskriv bara vad du vill ha, aldrig det du redan valt bort
Svaren blir vagare och mer generiskaFör mycket konkurrerande material i fönstretSammanfatta läget i ett meddelande och fortsätt därifrån
Den gör om samma fel efter rättelserDen låste fast sig tidigt vid en felaktig gissningÖverge tråden. En rättelse väger sällan tyngre än samtalet den vilar på
Den har självsäkert fel om faktaEtt annat problem, oberoende av längdenSe varför AI självsäkert hittar på saker

Och fem vanor som förebygger det mesta från början:

  1. Lägg fram hela frågan direkt. Det starkaste resultatet i forskningen är att ett komplett meddelande slår samma information levererad i bitar. Lägg de trettio extra sekunderna på att skriva hela frågan.
  2. Starta om i stället för att bråka. När en chatt spårar ur kostar en ny ingenting. Klistra bara in de bra bitarna.
  3. Skriv din egen sammanfattning efter en lång session. Be AI:n om en kort genomgång av besluten, kontrollera den, öppna en ny chatt och klistra in den som första meddelande.
  4. Håll olika ämnen i olika chattar. En tråd för jobbprojektet, en annan för semestern. Blandat lägger du distraktion i båda.
  5. Byt modell när en kör fast. En annan modell har ingen aning om att ditt förra samtal gick dåligt. Den möter problemet rent, och den håller ofta inte med den första på användbara sätt, vilket vi tittade på i varför AI-modeller ger olika svar.

Det sista är det billigaste tricket av alla, och det folk hoppar över för att de bara har en AI-app öppen.

Där rådet inte räcker till

Några ärliga reservationer, för lösningen passar inte överallt.

Att börja om kostar på riktigt. Har du lagt en timme på att lära en AI tonen i ditt nyhetsbrev gör det ont att slänga bort det, och en sammanfattning fångar aldrig allt. Håll då en kort återanvändbar beskrivning i en anteckning på datorn och klistra in den i varje ny chatt. Du behåller den användbara delen och släpper röran.

Studien testade också modellerna mot simulerade användare som följde ett manus, inte mot det röriga fram och tillbaka som en riktig person klarar, någon som märker en felsväng och stoppar den. Den som är uppmärksam och fångar felet i meddelande tre klarar sig bättre än siffrorna antyder. Det är ett argument för att läsa de tidiga svaren noga, medan en rättelse fortfarande kostar nästan ingenting.

Och vissa uppgifter kräver verkligen en enda lång tråd, som att arbeta sig igenom ett stort dokument du inte kan sammanfatta utan att tappa poängen. En modell byggd för långa dokument, som Claude Opus 4.7, klarar det bättre än de flesta, men den tar inte bort problemet. Behåll då tråden och upprepa din huvudinstruktion med några meddelandens mellanrum, så att den ligger nära slutet av högen, där modellen tittar noggrannast.

Det finns inget fast antal, för det beror på hur mycket av samtalet som faktiskt är användbart. En bättre signal än antalet meddelanden är beteendet: i samma stund som den glömmer en instruktion eller upprepar något du sagt nej till har tråden slutat hjälpa dig.
Samtalet försvinner. Det appen sparar som minne eller profil finns kvar. Den säkra vanan är att ha en egen kort beskrivning i en anteckning och klistra in den i första meddelandet i varje ny chatt.
De arbetar på det. Vissa produkter sammanfattar redan äldre delar av ett samtal automatiskt, alltså samma trick som du kan göra för hand. Den underliggande tendensen att låsa fast sig tidigt vid en gissning är inte löst, så vanan är fortfarande värd att ha.
Inte på egen hand. Tester från 2025 hittade sjunkande träffsäkerhet långt före de utlovade gränserna. Ett större fönster betyder att AI:n tar emot mer text, inte att den använder allt lika bra.
Klistra in en sammanfattning, inte utskriften. Att kopiera in allt återskapar precis det problem du försökte komma undan, inklusive felsvängarna och de bortvalda idéerna.
Ofta ja. En annan modell bär inte med sig den tidigare felaktiga gissningen och angriper problemet på ett annat sätt. Det är det snabbaste att testa när en modell fastnat i en slinga.

Kort sagt

Långa AI-samtal misslyckas inte för att maskinen blir trött. De misslyckas för att modellen gjorde ett tyst antagande tidigt, byggde allt ovanpå det, och sedan begravde din bästa instruktion mitt i en hög text som den inte läser jämnt.

När du vet det blir vanorna självklara. Säg allt på en gång. Börja om när det driver. Håll din beskrivning någonstans där du kan klistra in den igen. Och när en modell fastnat i en slinga, sluta bråka med den och ge samma fråga till en annan.