Знакомая история: первую неделю агент отвечает точно и быстро, а через месяц тупит, путается и отвечает общими словами. Дело почти всегда не в модели, а в том, как устроена память.
Почему длинный разговор делает агента хуже
У любой модели есть окно контекста — сколько текста она видит за один раз. Один бесконечный диалог это окно постепенно забивает: туда попадают и важные договорённости, и случайные реплики месячной давности. Важное тонет в шуме, ответы становятся общими.
Второй эффект — деньги и время. Каждый ход модель перечитывает всё окно целиком. Разговор на четыреста тысяч токенов означает, что за простое «сколько времени» вы платите как за серьёзную задачу, и ждёте соответственно.
Как это чинится
- Разговор рвётся по расписанию или при заполнении окна, а не тянется неделями.
- Перед разрывом собирается короткая сводка: о чём шла речь и к чему пришли. Она переезжает в новый разговор вместо всей истории.
- Долговременные факты уходят в файлы памяти: кто есть кто, какие правила, какие решения приняты. Это не история чата, а знание.
- В новый разговор вкладываются не все файлы целиком, а только куски, относящиеся к текущей задаче.
Что даёт последний пункт
Это самая недооценённая часть. Если вкладывать всю память в каждый запуск, агент снова упирается в тот же потолок, только теперь его забивает не болтовня, а собственные записи. Отбор по релевантности снимает эту проблему: в контекст попадает то, что нужно сейчас.
Как понять, что у вас именно эта болезнь
Признаки простые: ответы стали медленнее, агент переспрашивает то, что знал, и начинает отвечать обтекаемо там, где раньше отвечал конкретно. Если это ваш случай — лечится не сменой модели, а разрывом разговора и нормальной памятью.
