Por qué la IA empeora en chats largos
Por Chatday Editorial Team ·
Los primeros diez minutos son geniales. La IA entiende lo que quieres, las respuestas son precisas y crees que has encontrado un compañero de trabajo de verdad.
Y entonces, hacia el mensaje treinta, empieza a fallar. Se olvida de una regla que pusiste al principio. Te devuelve algo que ya habías rechazado. Se lo corriges, se disculpa y dos respuestas después comete el mismo error.
No es que se te esté acabando la paciencia, ni que el modelo tenga un mal día. Las conversaciones largas empeoran de verdad, le pasa a todos los modelos del mercado y los investigadores ya han medido cuánto.
Qué le pasa a las respuestas de la IA en una conversación larga
Unos investigadores de Microsoft y Salesforce hicieron un experimento fácil de contar. Cogieron tareas que un modelo resuelve sin problema, como escribir un poco de código o responder a una pregunta a partir de varios documentos, y las pidieron de dos maneras.
En la primera versión, toda la petición llegaba en un único mensaje completo. En la segunda, la misma información se iba soltando a lo largo de varios turnos, tal como habla una persona real: una petición inicial vaga, luego un detalle, luego una corrección, luego otro detalle.
Mismo modelo, misma información, mismo objetivo final. Lo único que cambiaba era la forma de entregarla.
En más de 200.000 conversaciones simuladas y seis tipos de tarea, todos los modelos punteros analizados lo hicieron bastante peor en la versión repartida. La caída media fue del 39%. El trabajo se publicó en mayo de 2025 y se presentó como ponencia oral en ICLR 2026, uno de los congresos de referencia del campo, en abril.
Lo más interesante es cómo falla. Los modelos no se volvieron menos capaces. Se volvieron menos fiables, que es un problema distinto y más molesto. Haz la misma pregunta repartida en varios turnos diez veces al mismo modelo y la calidad varía mucho más de lo que variaría en un solo mensaje.
El motivo es fácil de imaginar. Cuando tu primer mensaje es vago, el modelo no espera a que lo aclares. Rellena los huecos con una suposición, se compromete con ella y empieza a producir una respuesta construida encima. Si la suposición era falsa, todo lo que viene después hereda el error. Los investigadores vieron que, cuando un modelo coge el camino equivocado al principio de una conversación, ya no suele volver al correcto, ni siquiera cuando se lo corriges directamente.
Por qué más memoria no arregla los chats largos
La objeción obvia es que los modelos ya tienen memorias enormes. Algunos leen un millón de palabras de golpe. Un chat de cincuenta mensajes no debería ser nada.
Eso es cierto en cuanto a capacidad y falso en cuanto a calidad, y la distancia entre esas dos cosas es toda la historia. Si quieres el panorama completo de cómo funciona esa memoria, te contamos aparte qué es en realidad la ventana de contexto de una IA. En resumen: es la cantidad de texto que el modelo puede tener delante mientras responde.
Tener el texto delante no es lo mismo que usarlo bien. Un equipo de investigación de Chroma probó 18 modelos líderes en julio de 2025 y encontró el mismo patrón en todos. La precisión bajaba a medida que crecía la entrada, y bajaba mucho antes de acercarse al límite anunciado. Un modelo que acepta un millón de palabras sobre el papel ya puede responder claramente peor con cincuenta mil.
Dos detalles de ese trabajo llaman la atención porque van contra la intuición:
- Basta un fragmento irrelevante para hacer daño. Añadir un solo bloque de texto que distraía, no cien, ya bajaba la precisión de forma medible.
- Un texto bien ordenado puede ser peor que un montón desordenado. Los modelos puntuaban más alto cuando el material de alrededor estaba mezclado que cuando estaba ordenado con lógica.
Hay además un hallazgo más antiguo y muy replicado que explica buena parte de la frustración diaria. Un estudio liderado por Stanford en 2023 demostró que los modelos detectan mucho mejor la información situada justo al principio o justo al final de una entrada larga, y bastante peor la que está en el medio. Tu instrucción cuidadosa del mensaje ocho está ahora enterrada en el medio del montón. Es el peor sitio posible.
Junta las dos cosas y el cuadro cuadra. Tu chat largo no es un expediente ordenado que la IA consulta. Es un montón de texto que crece, donde tu línea importante compite con cuarenta mensajes de conversación menor, callejones sin salida y correcciones que ya has dejado atrás.
Los laboratorios de IA lo saben, y han construido un apaño
Esto no es una queja de minorías. Lo documentan las propias empresas.
La documentación para desarrolladores de Anthropic describe una función llamada compaction, que resume automáticamente las partes más antiguas de una conversación cuando se alarga. El motivo que dan es directo: «a medida que crece una conversación, la calidad de las respuestas se degrada», así que el material viejo se sustituye por un resumen corto.
Léelo otra vez, porque ahí está lo útil. El arreglo oficial para una conversación larga es tirar casi toda y quedarse con un resumen. Tú puedes hacer exactamente lo mismo a mano, gratis, en cualquier aplicación de chat, y no hace falta que esperes a que una función lo haga por ti.
Qué hacer cuando un chat empieza a irse
Esta es la traducción práctica. Identifica el síntoma y lo que está pasando por debajo.
| Lo que notas | Qué está pasando | Qué hacer |
|---|---|---|
| Se olvida de una regla que pusiste al principio | La instrucción está enterrada en el medio de un chat largo | Repite la regla en tu mensaje más reciente, no como recordatorio sino como la instrucción |
| Repite una propuesta que ya rechazaste | La versión rechazada sigue en el historial y sigue contando como contexto | Abre un chat nuevo y describe solo lo que quieres, nunca lo que ya descartaste |
| Las respuestas se vuelven más vagas y genéricas | Demasiado material compitiendo dentro de la ventana | Resume en un mensaje cómo está el asunto y sigue desde ahí |
| Repite el mismo error después de corregirlo | Se comprometió pronto con una suposición falsa | Abandona el hilo. Una corrección rara vez pesa más que la conversación sobre la que se apoya |
| Se equivoca con datos con mucha seguridad | Es otro problema, no la longitud de la conversación | Mira por qué la IA se inventa cosas con total seguridad |
Y cinco hábitos que evitan casi todo esto desde el principio:
- Suelta la petición entera al principio. El hallazgo más sólido de esta investigación es que un mensaje completo gana a la misma información repartida en trozos. Dedica treinta segundos más a escribir la petición completa.
- Reinicia en vez de discutir. Cuando un chat se tuerce, abrir uno nuevo no te cuesta nada. Pega dentro solo las partes buenas.
- Escribe tu propio resumen al final de una sesión larga. Pide a la IA un resumen corto de las decisiones tomadas, revísalo, abre un chat nuevo y pégalo como primer mensaje.
- Separa los temas en chats distintos. Un hilo para el proyecto de trabajo y otro para el viaje. Mezclarlos mete distracciones en los dos.
- Cambia de modelo cuando uno se atasque. Un modelo distinto no tiene ni idea de que tu última conversación fue mal. Llega limpio al problema, y a menudo discrepará del primero de formas útiles, algo que vimos en por qué los modelos de IA dan respuestas distintas.
Ese último es el truco más barato de todos, y el que más gente se salta porque solo tiene abierta una aplicación de IA.
Dónde se queda corto este consejo
Unas cuantas advertencias honestas, porque el arreglo no vale para todo.
Empezar de cero tiene un coste real. Si has pasado una hora enseñando a una IA el tono de tu boletín, tirarlo duele, y un resumen nunca lo captura todo. En ese caso, guarda un informe corto y reutilizable en una nota de tu ordenador y pégalo en cada chat nuevo. Te quedas con la parte útil y sueltas el ruido.
La investigación también probó los modelos con usuarios simulados que seguían un guion, no con el ir y venir desordenado de una persona real capaz de detectar un desvío y frenarlo. Alguien atento que pilla el error en el mensaje tres lo hará mejor que lo que sugieren estas cifras. Es un argumento para leer con calma las primeras respuestas, cuando corregir todavía no cuesta casi nada.
Y algunos trabajos necesitan de verdad un hilo largo, como avanzar por un documento grande que no puedes resumir sin perder lo importante. Un modelo pensado para documentos largos, como Claude Opus 4.7, lo lleva mejor que la mayoría, pero no elimina el problema. Para esos casos, mantén el hilo y repite tu instrucción principal cada pocos mensajes, para que se quede cerca del final del montón, que es donde el modelo mira con más atención.
En resumen
Las conversaciones largas con IA no fallan porque la máquina se canse. Fallan porque el modelo hizo una suposición silenciosa al principio, construyó todo encima y luego enterró tu mejor instrucción en el medio de un montón de texto que no lee por igual.
Cuando sabes eso, los hábitos son evidentes. Dilo todo de una vez. Empieza de cero cuando se desvíe. Ten tu informe en algún sitio donde puedas volver a pegarlo. Y cuando un modelo se quede atascado en bucle, deja de discutir con él y pásale la misma pregunta a otro.