Почему ИИ хуже отвечает в долгих чатах
Автор Chatday Editorial Team ·
Первые десять минут проходят отлично. ИИ понимает, чего вы хотите, ответы точные, и кажется, что вы наконец нашли настоящего рабочего напарника.
Потом, где-то к тридцатому сообщению, всё начинает сыпаться. Он забывает правило, которое вы задали в начале. Возвращает то, что вы уже отклонили. Вы поправляете, он извиняется, а через два ответа повторяет ту же ошибку.
Дело не в вашем терпении, и у модели нет плохого дня. Длинные разговоры действительно портятся, это происходит с каждой моделью на рынке, и исследователи уже измерили насколько.
Что происходит с ответами ИИ в длинном разговоре
Исследователи из Microsoft и Salesforce поставили эксперимент, который легко описать. Они взяли задачи, с которыми модель обычно справляется, например написать немного кода или ответить на вопрос по нескольким документам, и попросили их двумя способами.
В первом варианте весь запрос приходил одним полным сообщением. Во втором ровно та же информация выдавалась по капле в несколько ходов, как говорит живой человек: расплывчатая первая просьба, потом деталь, потом поправка, потом ещё деталь.
Та же модель, та же информация, та же конечная цель. Менялась только подача.
На более чем 200 000 смоделированных разговоров и шести типах задач все проверенные ведущие модели показали заметно худший результат в варианте с подачей по частям. Среднее падение составило 39%. Работа вышла в мае 2025 года, а в апреле была представлена устным докладом на ICLR 2026, одной из главных конференций в этой области.
Интереснее то, как они ошибаются. Модели не стали менее способными. Они стали менее надёжными, а это другая и более неприятная проблема. Задайте одной и той же модели один и тот же разбитый на части вопрос десять раз, и разброс качества будет куда шире, чем при одном сообщении.
Причину легко представить. Когда ваше первое сообщение расплывчато, модель не ждёт уточнений. Она молча заполняет пробелы догадкой, закрепляется на ней и начинает выстраивать ответ поверх. Если догадка была неверной, всё дальнейшее наследует ошибку. Исследователи обнаружили, что если модель свернула не туда в начале разговора, обратно она обычно уже не возвращается, даже когда вы поправляете её напрямую.
Почему больший объём памяти не спасает длинные чаты
Очевидное возражение: у моделей теперь огромная память. Некоторые читают миллион слов за раз. Чат из пятидесяти сообщений вроде бы вообще ничто.
Это верно про объём и неверно про качество, и вся суть в разрыве между ними. Если хотите полную картину того, как эта память устроена, мы отдельно разобрали, что такое контекстное окно на самом деле. Коротко: это объём текста, который модель может держать перед собой, пока отвечает.
Держать текст перед собой не то же самое, что хорошо им пользоваться. Исследовательская группа Chroma проверила 18 ведущих моделей в июле 2025 года и нашла у всех одну и ту же картину. Точность падала по мере роста входных данных, и падала задолго до заявленного предела. Модель, которая формально принимает миллион слов, уже на пятидесяти тысячах может отвечать заметно хуже.
Две детали этой работы выделяются, потому что противоречат интуиции:
- Хватает одного лишнего фрагмента. Добавление одного отвлекающего куска текста, а не сотни, уже измеримо снижало точность.
- Аккуратно упорядоченный текст может быть хуже перемешанной кучи. Модели показывали лучший результат, когда окружающий материал был перемешан, а не выстроен логично.
Есть и более раннее, многократно подтверждённое наблюдение, объясняющее немалую часть повседневного раздражения. Исследование под руководством Стэнфорда в 2023 году показало, что модели лучше всего замечают информацию в самом начале или в самом конце длинного ввода и заметно хуже находят её в середине. Ваша тщательно сформулированная инструкция из восьмого сообщения теперь погребена в середине кучи. Это худшее из возможных мест.
Сложите два наблюдения, и картина сходится. Ваш длинный чат это не аккуратное дело, к которому ИИ обращается. Это растущая куча текста, где ваша важная строка конкурирует с сорока сообщениями болтовни, тупиков и поправок, о которых вы давно забыли.
Лаборатории ИИ это знают и построили обходной путь
Это не претензия с обочины. Компании документируют это сами.
Документация Anthropic для разработчиков описывает функцию compaction, которая автоматически сворачивает старые части разговора, когда он становится длинным. Причина названа прямо: «по мере роста разговора качество ответов ухудшается», поэтому старый материал заменяется коротким пересказом.
Перечитайте эту фразу, потому что в ней и есть польза. Официальное лекарство от длинного разговора это выбросить большую его часть и оставить резюме. Ровно то же самое вы можете сделать вручную, бесплатно, в любом приложении для чата, не дожидаясь функции, которая сделает это за вас.
Что делать, когда чат начинает уводить в сторону
Вот практический перевод. Сопоставьте симптом с тем, что происходит на самом деле.
| Что вы замечаете | Что происходит | Что делать |
|---|---|---|
| Забывает правило, заданное в начале | Инструкция погребена в середине длинного чата | Повторите правило в самом новом сообщении, не как напоминание, а как инструкцию |
| Повторяет предложение, которое вы отклонили | Отклонённый вариант остался в истории и по-прежнему считается контекстом | Откройте новый чат и опишите только то, что хотите, никогда то, что уже исключили |
| Ответы становятся расплывчатыми и общими | Слишком много конкурирующего материала в окне | Опишите текущее положение дел одним сообщением и продолжайте с него |
| Повторяет ту же ошибку после поправок | Он рано закрепился на неверной догадке | Бросьте ветку. Поправка редко перевешивает разговор, на котором лежит |
| Уверенно ошибается в фактах | Это другая проблема, не связанная с длиной | См. почему ИИ уверенно выдумывает |
И пять привычек, которые предотвращают почти всё это заранее:
- Выкладывайте весь запрос сразу. Самый твёрдый вывод этого исследования в том, что одно полное сообщение выигрывает у той же информации, поданной кусками. Потратьте лишние тридцать секунд на полный текст просьбы.
- Начинайте заново вместо спора. Когда чат пошёл не туда, новый не стоит вам ничего. Перенесите в него только удачные части.
- Пишите собственное резюме в конце долгой сессии. Попросите у ИИ короткую сводку принятых решений, проверьте её, откройте новый чат и вставьте первым сообщением.
- Держите разные темы в разных чатах. Одна ветка под рабочий проект, другая под отпуск. Смешение добавляет помех в обе.
- Меняйте модель, когда одна застряла. Другая модель понятия не имеет, что прошлый разговор не задался. Она подходит к задаче начисто и часто расходится с первой полезным образом, о чём мы писали в тексте почему модели ИИ дают разные ответы.
Последний приём самый дешёвый из всех, и его чаще всего пропускают, потому что открыто лишь одно приложение с ИИ.
Где этот совет не работает
Несколько честных оговорок, потому что средство подходит не всегда.
Начинать с нуля стоит дорого. Если вы час учили ИИ тону вашей рассылки, выбрасывать это больно, а резюме никогда не передаёт всё. В таком случае держите короткий многоразовый бриф в заметке на компьютере и вставляйте его в каждый новый чат. Полезное остаётся, лишнее уходит.
Исследование также проверяло модели на смоделированных пользователях, действовавших по сценарию, а не на беспорядочном обмене репликами с живым человеком, который способен заметить неверный поворот и остановить его. Внимательный человек, поймавший ошибку в третьем сообщении, справится лучше, чем предполагают эти цифры. Это довод в пользу того, чтобы внимательно читать ранние ответы, пока поправка почти ничего не стоит.
И некоторые задачи действительно требуют одной длинной ветки, например разбор большого документа, который нельзя сократить без потери сути. Модель, созданная для длинных документов, такая как Claude Opus 4.7, справляется с этим лучше многих, но проблему не снимает. Для таких задач сохраняйте ветку и повторяйте ключевую инструкцию каждые несколько сообщений, чтобы она держалась ближе к концу кучи, куда модель смотрит внимательнее всего.
Коротко
Длинные разговоры с ИИ срываются не потому, что машина устаёт. Они срываются потому, что модель рано сделала молчаливое допущение, построила на нём всё остальное, а затем похоронила вашу лучшую инструкцию в середине кучи текста, которую читает неравномерно.
Когда вы это знаете, привычки очевидны. Говорите всё сразу. Начинайте заново, когда разговор уводит. Держите свой бриф там, откуда его можно вставить снова. А когда модель зациклилась, перестаньте с ней спорить и отдайте тот же вопрос другой.