August 8

Память без памяти

Почему человек помнит вчерашний разговор лучше, чем языковая модель, знающая половину интернета

Представьте странного собеседника. Он способен объяснить устройство гиппокампа, восстановить ход Пелопоннесской войны, написать SQL-запрос и сравнить Канта с Витгенштейном — но вдруг не помнит важную мысль, которую вы вместе сформулировали несколько недель назад. А вы помните. Причём иногда почти мгновенно.

Это не парадокс и не просто «недостаток памяти у LLM». Мы называем одним словом память несколько совершенно разных механизмов. У человека есть рабочая, эпизодическая, семантическая и процедурная память; новые события могут быстро записываться, затем консолидироваться, связываться с прежним опытом и всплывать по частичному намёку. У современной LLM тоже есть несколько функциональных аналогов: знания в параметрах, текущий контекст, внешние хранилища и retrieval/RAG, а иногда — системы долговременной персональной памяти. Но эти механизмы соединены совсем не так, как в мозге. [1]

Главный вывод исследования таков: человек обладает маленькой рабочей памятью, но удивительно развитой системой превращения собственной жизни в сеть воспоминаний; LLM обладает гигантской семантической компетенцией и огромной рабочей поверхностью, но её личная биография обычно находится не внутри самой модели, а где-то рядом с ней — если вообще хранится. Поэтому вопрос «у кого больше память?» почти бессмысленен. Правильнее спрашивать: что хранится, как долго, насколько быстро находится, насколько точно воспроизводится и изменяет ли одно новое событие всю дальнейшую систему поведения?

Не одна память, а целый архипелаг

Начнём с человека. Когнитивная нейробиология давно отказалась от идеи памяти как единого склада. Рабочая память удерживает и обрабатывает небольшое количество информации, необходимой прямо сейчас. В разных теориях её устройство описывается по-разному; известная оценка Коуэна — около четырёх «чанков» в фокусе внимания при определённых экспериментальных условиях — именно поэтому её нельзя превращать в универсальное число вроде «у человека четыре ячейки RAM». Чанк может быть цифрой, словом или сложным смысловым блоком, а стратегия и предварительные знания резко меняют эффективную ёмкость. [2]

За ней начинается другой мир. Эпизодическая память позволяет вспоминать конкретные события с их временным и пространственным контекстом: не просто «Париж находится во Франции», а «я стоял у этого кафе в Париже под дождём». Семантическая память хранит обобщённые знания, отвязанные от конкретного эпизода. А процедурные и другие недекларативные системы участвуют в навыках и привычках — например, в действиях, которые человек способен выполнять, не проговаривая правила сознательно. Эти формы памяти опираются на частично различные мозговые системы и имеют разные свойства. [3]

У LLM архипелаг другой.

Её параметры — это самый близкий аналог огромного фонда общих знаний и навыков. Во время обучения веса нейронной сети изменяются так, чтобы она всё лучше предсказывала продолжения последовательностей. В результате факты, языковые закономерности, стили, структуры рассуждений и многочисленные статистические связи оказываются имплицитно закодированы в весах. Но это не база данных с записью Париж → столица → Франция. Исследования механистической интерпретируемости действительно обнаруживают причинно важные вычислительные участки, связанные с извлечением некоторых фактических ассоциаций, однако знание модели в целом нельзя понимать как каталог отдельных карточек. [4]

Её контекст — совсем другой тип памяти: информация, доступная во время текущего вычисления. Transformer с помощью механизма attention строит представления токенов с учётом других токенов контекста. Но наличие текста в разрешённом контекстном окне ещё не означает идеального доступа к каждому его фрагменту. В классическом исследовании Lost in the Middle обнаружилось, что многие модели легче используют важную информацию в начале и конце длинного контекста, чем в его середине. Иными словами, ёмкость контекста и эффективная доступность информации — разные величины. [5]

Здесь появляется первый полезный образ.

Человеческая рабочая память — маленький письменный стол перед огромной библиотекой. LLM-контекст — огромный письменный стол, на который можно вывалить сотни документов, но библиотекарь не гарантирует, что в нужную секунду заметит именно абзац на сто семьдесят третьей странице.

Поэтому сравнивать человеческую память и LLM в гигабайтах — всё равно что сравнивать библиотеку и город по килограммам.

Гораздо честнее использовать семь осей: объём, длительность, вероятность извлечения, точность, ассоциативность, обучение от единичного события и персонализацию. И по каждой оси победитель будет разным.

Как человек и машина достают прошлое

Самое поразительное различие обнаруживается не при хранении, а при извлечении.

Человеку достаточно запаха, имени или половины фразы, чтобы внезапно открылся целый эпизод. Гиппокамп и связанные с ним системы способны связывать элементы опыта и восстанавливать более целостное представление по частичным признакам; современные данные связывают эпизодическое вспоминание с восстановлением временного и семантического контекста и с реактивацией ранее сформированных представлений. [6]

Это память как паутина: потянули за одну нитку — задрожала целая область сети.

LLM без внешней памяти устроена иначе. Её прошлый разговор не обязан оставлять новый след в параметрах вообще. Классическое in-context learning как раз интересно тем, что модель способна адаптировать поведение к примерам из промпта без изменения весов. Когда контекст исчезает, такая адаптация сама по себе не превращается в новую постоянную параметрическую память. [7]

Это даёт второй образ: разговор с обычной LLM похож на спектакль на сцене. Пока декорации стоят, актёр прекрасно знает, в каком замке происходит действие. Убрали декорации — сам актёр от этого не перестроил свой мозг.

У человека событие, напротив, способно начать долговременную жизнь почти мгновенно. Влиятельная теория complementary learning systems описывает разделение труда между быстро обучающейся гиппокампальной системой и более медленным обучением в неокортексе: первая позволяет быстро фиксировать отдельные события, а последующее повторное воспроизведение и консолидация помогают интегрировать их с более общими знаниями, не разрушая уже приобретённую структуру. Сон и офлайн-реактивация считаются важной частью этого процесса, хотя конкретные версии теории системной консолидации и долгосрочная роль гиппокампа продолжают обсуждаться. [8]

Третий образ поэтому особенно удачен: гиппокамп похож на репортёра, который быстро записывает сегодняшнее происшествие, а неокортекс — на редакцию энциклопедии, которая ночью решает, какую часть репортажа превратить в общее знание.

Но цена этого великолепного механизма — отсутствие идеальной копии прошлого. Человеческое эпизодическое воспоминание является реконструктивным: при воспроизведении мозг собирает прошлое из сохранённых деталей, контекста и существующих схем. Исследования показывают систематические искажения и тенденцию к более смысловому, «gist-like» представлению воспоминаний со временем. [9]

Отсюда четвёртый образ: человеческая память — не видеокамера, а реставратор старой фрески. Она прекрасно восстанавливает сюжет, но иногда дорисовывает кусок неба.

И именно здесь распространённая фраза «LLM помнит дословно лучше человека» требует поправки. Из параметров LLM вовсе не гарантирует дословное воспроизведение: генерация реконструирует вероятное продолжение. Зато если исходный документ реально находится в контексте или извлечён из внешнего хранилища, цифровая система может передать нужный фрагмент с точностью, недоступной обычной человеческой эпизодической памяти. Это преимущество не столько «мозга LLM», сколько комбинации модель + цифровой носитель. [10]

Библиотекарь, архив и геологические пласты

Именно поэтому инженеры всё чаще строят вокруг LLM то, чего самой модели не хватает.

RAG — retrieval-augmented generation — добавляет внешнюю непараметрическую память. В классической работе Льюиса и коллег генератор сочетался с поиском по внешнему индексу документов: запрос вызывает несколько релевантных фрагментов, которые затем поступают модели как дополнительный контекст. Внешнюю базу можно обновить без полного переобучения модели — одно из фундаментальных преимуществ такого разделения. [11]

Это пятый образ: RAG — библиотекарь с карточным каталогом. LLM не обязана носить всю библиотеку в голове; достаточно правильно сформулировать запрос, чтобы библиотекарь принёс нужную книгу на рабочий стол.

Но тут возникает новая точка отказа: библиотекарь может принести не ту книгу. Поэтому огромный архив сам по себе не создаёт хорошей памяти. Необходимо правильно решить, что записывать, как индексировать, что считать похожим, сколько фрагментов извлекать и какие из них помещать в ограниченный контекст. Исследования long-context моделей и retrieval-систем как раз показывают, что доступность информации зависит и от качества поиска, и от того, как модель использует найденный материал. [12]

Отсюда шестой образ: контекстное окно — не череп модели, а таможенный пункт. За границей может лежать бесконечный архив; думать модель непосредственно может только над тем, что прошло через пропускной пункт и оказалось по эту сторону шлагбаума.

Системы вроде MemGPT сделали эту идею явной, предложив иерархию памяти по аналогии с виртуальной памятью операционных систем: ограниченный активный контекст и более крупные внешние хранилища, между которыми информация перемещается по мере необходимости. MemoryBank и последующие работы исследовали долговременное хранение историй взаимодействия и пользовательской информации. Это уже значительно ближе к тому, что субъективно ожидает человек от постоянного собеседника. [13]

А fine-tuning решает совсем другую задачу. Он изменяет параметры модели. Это скорее не «положить заметку в архив», а переделать дорожную сеть города, чтобы определённые маршруты стали естественнее. Именно поэтому fine-tuning плохо подходит для записи тысяч быстро меняющихся бытовых фактов вроде «пользователь сейчас проектирует дачу»: обновление весов намного тяжелее внешней записи, а последовательное обучение сталкивается с проблемой сохранения прежних знаний — catastrophic forgetting остаётся важной темой continual learning. [14]

Самая неожиданная перекличка появилась совсем недавно. В опубликованной в 2026 году работе Eleanor Spens и Neil Burgess предложена вычислительная модель взаимодействия гиппокампа и неокортекса, которую авторы прямо трактуют как compressive retrieval-augmented generation: эпизоды компактно кодируются, реактивируются для обучения генеративной «семантической» системы, а при решении задач релевантные эпизоды извлекаются в рабочую память. Это не доказательство того, что мозг буквально является RAG-системой, а теоретическая модель, но сам факт сближения двух исследовательских языков чрезвычайно показателен. [15]

Почему вы всё-таки помните лучше: несколько неочевидных выводов

Первый инсайт: проблема LLM часто не в забывании, а в отсутствии записи. Человек после важного разговора может сформировать новый эпизодический след. У модели же сообщение могло повлиять на текущий ответ, не изменив параметры и не попав ни в какое постоянное хранилище. [16]

Второй: «лежит в контексте» не равно «находится в фокусе». Сотни страниц доступного материала теоретически превосходят человеческую рабочую память, но релевантная деталь всё равно может оказаться функционально потеряна среди остальных. [17]

Третий: человек хранит меньше деталей, но больше адресов к ним. Контекст места, времени, личности, цели и предыдущих событий образует множество путей извлечения эпизода. Именно связь содержания с контекстом является центральной для многих современных моделей эпизодической памяти. [18]

Четвёртый: забывание — иногда не дефект, а компрессия. Человеческое воспоминание со временем может терять конкретные детали и становиться более семантическим. Тем самым вчерашний эпизод превращается в правило о мире. Это хуже для судебной стенограммы, но полезно для обобщения. [19]

Пятый: у человека чрезвычайно сильная персонализация «по умолчанию». Каждый новый эпизод относится к одному и тому же непрерывному существу — вам. У LLM «знания мира» и «история именно этого пользователя» архитектурно могут находиться в совершенно разных местах: первые — в весах, вторая — во внешней памяти продукта. [20]

Шестой: одно событие для человека и one-shot prompt для модели — не одно и то же. Человек способен быстро сформировать долговременную эпизодическую память; LLM способна чрезвычайно быстро изменить поведение по одному примеру в контексте, но без записи или изменения параметров эффект может закончиться вместе с контекстом. [21]

Седьмой: цифровая машина превосходит человека в дословности только там, где существует цифровой оригинал. Когда модель имеет доступ к документу, электронный текст не «тускнеет». Когда она отвечает лишь из параметрической памяти, такой гарантии нет. Поэтому для точной цитаты нужен источник, а не просьба модели «вспомнить». [22]

Восьмой: идеальная персональная LLM, вероятно, должна быть не одной нейросетью, а системой памяти. Исследования уже движутся к комбинации быстрых и медленных уровней: параметры для устойчивых закономерностей, контекст для настоящего момента, retrieval для прошлого и отдельные механизмы консолидации и обновления. Именно это удивительным образом сближает инженерные архитектуры с идеей complementary learning systems в нейробиологии. Это сравнение является аналогией, а не утверждением биологической идентичности. [23]

Как перестать ощущать, что LLM всё время теряет память

Практическое следствие довольно радикально: не относитесь к длинному чату как к надёжной долговременной памяти. История разговора полезна, но длинный контекст одновременно увеличивает количество доступной информации и усложняет выбор релевантного. Для долгих проектов лучше иметь отдельно поддерживаемое компактное «состояние проекта»: цели, решения, термины, ограничения, незакрытые вопросы и несколько ключевых фактов о пользователе. Это следует из результатов по long-context retrieval и из самой логики многоуровневых memory-систем. [24]

Второе правило: разделяйте рабочий стол и архив. Текущая задача, несколько необходимых документов и последние решения должны находиться непосредственно в контексте. Старая переписка, справочные материалы и предыдущие проекты лучше работают как поисковое хранилище, из которого извлекаются релевантные куски. Именно это разделение лежит в основе RAG и memory-augmented архитектур. [25]

Третье: периодически делайте консолидацию разговора. Не просто «краткое резюме последних ста сообщений», а документ вида: что мы теперь считаем истинным; какие решения приняты; какие определения установлены; что изменилось; что ещё открыто. Это инженерный аналог — очень грубый — превращения деталей эпизода в устойчивую смысловую структуру. Исследования человеческой памяти показывают, что консолидация связана именно с трансформацией и интеграцией воспоминаний, а не с побитовым архивированием прошлого. [26]

Четвёртое: критически важную информацию возвращайте ближе к месту принятия решения. Фраза «мы это уже обсуждали восемьдесят тысяч токенов назад» психологически естественна для человека, но архитектурно не гарантирует надёжного извлечения моделью. Для важных ограничений повторение — не избыточность, а управление вниманием. [17]

И пятое: различайте команды «учти сейчас», «запомни надолго» и «измени своё поведение вообще». Для LLM это три технически разные операции: контекст, запись во внешнюю persistent memory и обучение/настройка модели. У человека они настолько тесно переплетены, что нам кажется естественным произнести одну фразу — «запомни». Для машины именно здесь и скрывается большая часть недоразумения. [27]

Куда всё это ведёт

Возможно, мы сейчас находимся в любопытной точке истории AI. Первое поколение больших языковых моделей поражало прежде всего тем, сколько они знают. Следующий рубеж, похоже, состоит не только в увеличении количества параметров или длины контекста, а в способности правильно организовать собственное прошлое: решить, что стоит сохранить, что забыть, что обобщить, что восстановить дословно и какое старое событие необходимо вызвать именно сейчас. Исследования внешней памяти, retrieval, continual learning и новых memory architectures уже движутся в эту сторону. [28]

И здесь человек неожиданно перестаёт выглядеть существом с жалкими «четырьмя слотами рабочей памяти».

У человека действительно крошечный стол. Но за его спиной стоит странная библиотека, которую он строил всю жизнь. Книги в ней переписывают сами себя. Некоторые страницы исчезают. Некоторые события превращаются в правила. Любимая песня открывает дверь в комнату двадцатилетней давности. Одно слово вызывает человека, человек — улицу, улица — запах, запах — целую эпоху.

У LLM всё наоборот. Перед ней может лежать стол невероятного размера. За стеной — энциклопедия, превосходящая знания почти любого отдельного человека. К архиву можно приставить молниеносного библиотекаря. Но чтобы эта система стала похожа на человеческую память, недостаточно сделать стол ещё длиннее.

Ей нужна биография.

И, возможно, важнейший будущий скачок персонального искусственного интеллекта произойдёт не тогда, когда модель сможет прочитать ещё миллион токенов, а когда она научится делать то, что мозг делает каждую ночь и каждый следующий день: превращать поток событий в собственное организованное прошлое — и вовремя понимать, какая его часть нужна сейчас. Современные модели гиппокампально-неокортикального взаимодействия и инженерные работы по долговременной памяти делают эту параллель всё менее метафорической, хотя биологический мозг и Transformer остаются принципиально разными системами. [29]