EnglishРусский Map

Memoryfields - память агента как формат файлов

title
Memoryfields - память агента как формат файлов
type
summary
summary
Портативный формат памяти агентов от Кэла Патерсона: Markdown-страницы и индекс SQLite в zip - структура данных, а не конвейер
tags
ai-agents, memory, pkm, rag
created
2026-09-14
updated
2026-09-14
lang
ru
translation_of
memoryfields
source_updated
2026-09-14
translated
2026-09-14
translator
lllm/antigravity/gemini-3.7-flash-medium

В эссе за август 2026 года Кэл Патерсон предлагает memoryfields - портативный формат файлов для памяти агентов - и утверждает, что большинство систем памяти разочаровывают именно потому, что относятся к памяти как к процессу, тогда как её лучше представлять в виде данных agent-memory-as-a-file-format. Патерсон - автор формата и разрабатывает для него инструментарий, поэтому статья служит одновременно манифестом и релизом; он просит сообщество отрецензировать спецификацию.

Претензии к существующим системам

Он делит существующие системы памяти на три категории, каждая из которых плоха по-своему. Системы, привязанные к конкретной платформе (harness-locked), обычно создаются лабораторией, предоставляющей доступ к среде исполнения: они разбирают историю диалогов и в итоге хранят воспоминания преимущественно о самом пользователе, хотя информация об окружающем мире куда полезнее. Переусложнённые системы требуют громоздкой инфраструктуры - он приводит в пример решение, которому нужны pgvector, графовая база данных Neo4j и отдельная LLM только для того, чтобы решить, что именно стоит запомнить. Всё это трудно разворачивать и поддерживать, а кроме того, по его утверждению, это сбивает сами модели с толку. "Высокомодернистские" системы навязывают идеализированную рациональную структуру - обычно граф, иногда логические пропозиции, - что вырывает факты из контекста и оставляет агенту список выхолощенных утверждений, лишённых первоначального смысла. Объединяет их отношение к памяти как к многостадийному конвейеру. Патерсон цитирует Брукса о таблицах и блок-схемах, подчёркивая, что первичными должны быть данные.

Формат

Memoryfield представляет собой каталог (в каноническом виде упакованный в zip-архив) с Markdown-страницами, у каждой из которых может быть опциональный YAML frontmatter, плюс один опциональный файл SQLite с векторным индексом для семантического поиска. Вот и всё. Архитектура опирается на четыре решения:

Проза вместо чанков и извлечённых фактов. Конвейеры RAG сложны, поскольку пытаются сделать существующие человеческие документы (объёмные PDF и тому подобное) понятными агенту. Память устроена иначе: в момент формирования мысль возникает у агента, который уже умеет писать связным текстом. Следовательно, агент должен записывать воспоминание напрямую в Markdown, без разбивки на чанки, обогащения и повторного реферирования. Единственное ограничение - страница должна помещаться в один векторный эмбеддинг: мягкий лимит составляет около 8 КБ (примерно 1300 слов), что, как он считает, в любом случае полезно для лаконичности. Если нужны подробности, просто добавляются новые страницы.

Семантический переход вместо обхода графа. Он называет вики в стиле Карпатого главным предшественником, но отвергает их ключевой механизм. Обход гипертекстового графа знаний агентом работает медленно: чтобы добраться до информации на глубине в N ссылок, требуется N+1 последовательных вызовов инструментов, каждый с паузой в несколько секунд. Кроме того, это ненадёжно, поскольку агент оценивает релевантность только по тексту ссылок или заголовкам страниц. Это вынуждает оформлять метаданные каждой страницы в броском SEO-стиле и обесценивает попутные отступления и контекстные детали, которые и придают корпусу ценность. Семантический поиск по содержимому страниц заменяет обход графа: один вызов на поиск, один вызов на параллельное чтение всех найденных страниц - не более двух вызовов инструментов независимо от глубины залегания информации.

Больше модели, меньше механизмов. Перегруженные механизмами системы заставляют агента блуждать по лабиринту интерфейсов: крупный API забивает контекст схемой openapi.json, узкий API сковывает возможности, а чужой API редко точно подходит под текущую задачу. Будучи просто форматом файлов, memoryfields позволяет агентам самим изобретать шаблоны доступа: он наблюдал, как агенты применяли perl для сквозного поиска с заменой по всему корпусу или вставляли CSV прямо в текст заметки, чтобы позже опрашивать её через SQLite. Минимализм механизмов также означает, что формат масштабируется вместе с прогрессом моделей: модели исторически отлично владеют bash, Markdown и SQLite, поскольку те присутствовали в обучающих выборках. Поэтому они "понимают" memoryfield так, как никогда не поймут изолированный вызов внутри конвейера памяти, и по мере развития моделей начинают формулировать воспоминания всё лучше.

Открытость, взаимозаменяемость, независимость от транспорта. По мере роста коллекция воспоминаний приобретает ценность, и привязка к вендору нежелательна. Поэтому формат описан в спецификации в стиле RFC и нейтрален к месту хранения: локальные файлы, S3, GitHub, HTTP. Сам автор использует Syncthing для личных пространств памяти и S3 для совместных. Статическая форма в виде zip-архива также позволяет провести аудит чужого набора данных и зафиксировать его через sha256sum.

Возражения, на которые он отвечает

Не тот же ли это RAG? В широком современном смысле - да, но здесь нет привычной для RAG обвязки: нет разбивки на чанки, нет переранжирования (re-ranking), нет гибридного поиска, и, в отличие от большинства RAG-систем, в эту память можно как читать, так и писать. Отвечая на вопрос об устаревании эмбеддингов, он защищает выбор nomic-embed-text-v1.5 как компактного (270 МБ), работающего на CPU и широко распространённого варианта по умолчанию, хотя спецификация допускает и другие модели. По поводу качества памяти он утверждает, что популярный страх "забить память мусором" по большей части необоснован: нерелевантные страницы семантический поиск попросту не выдаст. Единственный практический совет здесь - добавлять цитаты и ссылки (в идеале URL), чтобы при последующих обращениях память можно было подкрепить или проверить факты. В вопросах безопасности он категоричен: нельзя делить контекстное окно - в том числе через файлы памяти - с теми, кому вы не доверяете. Именно поэтому существует формат статического zip-архива, который можно проверить вручную, а надёжного способа отличить безвредный промпт от вредоносного у агентов по-прежнему нет.

Место концепции в этой базе знаний

Эта база знаний сама представляет собой вики в стиле Карпатого, а memoryfields прямо критикует механизм, на котором они работают, - обход графа. Это противоречие лучше зафиксировать, а не сглаживать. На практике база уже обходит его претензию: инструмент warren обеспечивает семантический и полнотекстовый поиск по страницам (hybrid-search, agentic-search), поэтому работающий здесь агент переходит к нужным страницам по содержимому, а не блуждает по wikilink'ам, что в точности соответствует второму проектному решению Патерсона. Аргументы в пользу страниц как единиц хранения и связного текста сходятся с llm-wiki-as-agent-memory, где Markdown отстаивается перед векторными хранилищами с позиций проверяемости и переносимости. В терминах agent-memory-components memoryfields даёт конкретный ответ на вопрос хранения (store), перекладывая нагрузку на извлечение (extractor): чтобы сформировать воспоминание в виде страницы, агент должен написать полноценный связный текст.

В чём подход Патерсона расходится с практикой этой базы, так это в отношении к графу. В этой вики wikilink'и и каталоги поддерживаются намеренно, а страницы-сироты и перекрёстные ссылки служат индикаторами связности и порядка. Memoryfields же полностью отказывается от ссылок как способа навигации и полагается исключительно на индекс эмбеддингов. Замечание Патерсона о том, что нерелевантные воспоминания тратят лишь место на диске и не влияют на качество, противоположно принятой здесь дисциплине memory-conflict-detection, где противоречия между страницами выявляются и устраняются, а не оставляются в расчёте на то, что поиск обойдёт их стороной.

Полезным примером для сравнения служит proposition-identity-memory-tool. Весь тезис Патерсона строится на том, что память не должна содержать механизмов логического вывода: "чем меньше жёстких механизмов мы помещаем между агентом и этими данными, тем лучше". В упомянутом же эссе описан личный опыт попытки построить такую надстройку - автоматическое обнаружение противоречий в сохранённых воспоминаниях - и столкновения с нерешённой 130-летней логико-философской проблемой. Обе позиции сходятся в том, что память - это данные, но расходятся в том, насколько среда вокруг неё должна пытаться рассуждать: Патерсон сводит эти попытки почти к нулю, а эссе про пропасть показывает, к чему приводит стремление взвалить на систему слишком много. Третью позицию занимает memorizing-session-transcripts - отрицательный результат, доказывающий, что для пишущих код агентов с нормальной гигиеной коммитов и документации идея извлечения старого контекста даёт нулевую отдачу независимо от формата.