Как устроено

Почему агент забывает и как это чинится

Контекст не резиновый, и разговор на неделю превращает умного агента в тупого. Как устроена долговременная память и что она меняет.

Почему агент забывает и как это чинится
Фото: CC0 1.0 · источник

Знакомая история: первую неделю агент отвечает точно и быстро, а через месяц тупит, путается и отвечает общими словами. Дело почти всегда не в модели, а в том, как устроена память.

Почему длинный разговор делает агента хуже

У любой модели есть окно контекста — сколько текста она видит за один раз. Один бесконечный диалог это окно постепенно забивает: туда попадают и важные договорённости, и случайные реплики месячной давности. Важное тонет в шуме, ответы становятся общими.

Второй эффект — деньги и время. Каждый ход модель перечитывает всё окно целиком. Разговор на четыреста тысяч токенов означает, что за простое «сколько времени» вы платите как за серьёзную задачу, и ждёте соответственно.

Как это чинится

  • Разговор рвётся по расписанию или при заполнении окна, а не тянется неделями.
  • Перед разрывом собирается короткая сводка: о чём шла речь и к чему пришли. Она переезжает в новый разговор вместо всей истории.
  • Долговременные факты уходят в файлы памяти: кто есть кто, какие правила, какие решения приняты. Это не история чата, а знание.
  • В новый разговор вкладываются не все файлы целиком, а только куски, относящиеся к текущей задаче.

Что даёт последний пункт

Это самая недооценённая часть. Если вкладывать всю память в каждый запуск, агент снова упирается в тот же потолок, только теперь его забивает не болтовня, а собственные записи. Отбор по релевантности снимает эту проблему: в контекст попадает то, что нужно сейчас.

Как понять, что у вас именно эта болезнь

Признаки простые: ответы стали медленнее, агент переспрашивает то, что знал, и начинает отвечать обтекаемо там, где раньше отвечал конкретно. Если это ваш случай — лечится не сменой модели, а разрывом разговора и нормальной памятью.