PRO-LONG 给长期 Agent 的启示:别先摘要历史,先把轨迹变成可编程证据
解读 PRO-LONG 的 programmatic memory:对每次观察、动作和结果做结构化追加,再让 coding agent 用 grep/Python 按需查询。本文拆解它为何在 ARC-AGI-3 上有效、哪些结论不能直接外推,并给出面向研究与研发 Agent 的日志协议、查询预算、验证闭环和一周实验方案。
Archive
按发布时间倒序整理的 AI 记忆系统研究笔记。
解读 PRO-LONG 的 programmatic memory:对每次观察、动作和结果做结构化追加,再让 coding agent 用 grep/Python 按需查询。本文拆解它为何在 ARC-AGI-3 上有效、哪些结论不能直接外推,并给出面向研究与研发 Agent 的日志协议、查询预算、验证闭环和一周实验方案。
面向研究、运营与研发自动化的 Agent Memory 设计:把短期上下文、可验证任务账本、可恢复检查点和可遗忘知识分开管理。本文给出状态机、数据模型、写入门槛、SOP、评测与回滚方案,解决定时 Agent 重复执行、误把旧结论当事实和失败后无法安全续跑的问题。
基于 GitHub Issues 新增的 rationale、confidence 和 approvals 控制,本文设计一套可落地的 Issue Agent 工作流:用意图对象、状态机、最小权限与人工原因码,让自动分流可审计、可回滚,而不是把自动标签当作安全治理。
基于 GitHub Copilot Code Review 近期的工程复盘,本文给出一套面向 PR 审查的 AI Native 工作流:从 diff 问题编译、受限检索、证据卡片到人工裁决、指标与回滚。重点不是让 Agent 多提评论,而是让每条评论可复核、可拒绝、可度量。
结合 GitHub Agentic Workflows 与 Aspire 团队的公开实践,拆解一个从产品 PR 合并到跨仓库文档草案、SME 审核和可回滚发布的 AI Native 工作流:分支解析、证据包、最小权限、安全输出、状态机、成本和一周试点方案。
SciForge 把科研 Agent 的输出拆成会话级 Evidence DAG、目标级 Project DAG、只读审计侧链与发布门。本文据此设计一套可复制的 AI Native 研究证据协议,覆盖多模态输入、运行溯源、人工审核、回滚和一周验证计划。
以 Strix 的开源实现为参照,拆解一个可落地的多 Agent 白盒扫描器:从代码索引、可达性与数据流,到 Agent 图编排、证据契约、低误报门控、沙箱验证、状态机和 CI 增量扫描。
MemPoison 与 Bad Memory 共同暴露了一个常被忽略的缺口:当前会话拒绝恶意指令,不代表持久状态已恢复安全。本文把记忆投毒治理拆成写入、检索、消费、隔离、修复与跨会话验收,并给出可落地的数据模型、状态机和回归协议。
项目 README、依赖清单和 Makefile 正在成为代码 Agent 的执行入口。本文复核一项跨四种 Agent harness 的安装期供应链研究,并给出从安装意图解析、来源与版本验证、隔离执行到凭据落盘的前置安全门。
PM-Bench 把长期记忆从“能否回忆过去”推进到“能否在正确未来状态执行意图”。本文复核其公开场景与 64 条轨迹,并给出适用于企业 Agent 的意图状态机、选择性监控架构、执行门和评测协议。
SherAgent 的生产实践表明,SOC 调查自动化的关键不是让 LLM 直接判断告警,而是用受约束查询、语义剪枝、调查树和显式失败终态,在日志缺失与依赖爆炸之间建立可审计的 query-filter-backtracking 控制环。
FARMA 和 GhostWriter 把记忆投毒从污染事实条目推进到污染推理历史和个人助理工作状态。生产 Agent 不能把历史 reasoning、decision log 和经验摘要默认当成可信证据,而要在写入、检索、行动前同时做来源绑定、推理痕迹完整性检查和高风险动作授权。
ContextNest 把 Agent 可消费知识做成带版本、审批、完整性校验和审计轨迹的上下文资产。本文拆解它与 RAG 的边界,并给出一套一周内可验证的 AI Native 团队知识库治理方案。
SKILL.md smells 论文和 Anthropic Agent Skills 文档给出同一个工程信号:AI Native 团队不能把技能文件当成一次性提示词,而要把它们纳入设计、评审、测试、发布和回滚流程。本文给出一套一周内可试跑的 Agent Skill 质量门。
ContextSniper 和 Deterministic Anchoring 给出同一个工程信号:AI Native 代码修复工作流的瓶颈不是上下文窗口不够大,而是证据选择、结构锚点、输出过滤和验证闭环没有产品化。本文给出一套一周内可试跑的代码 Agent 证据包工作流。
A-TMA 把 ghost memory 定义为长期记忆里的状态协调失败:旧事实、当前事实和过渡事实同时存在,但在检索和回答时被混成一类。本文拆解 bank、retrieval、QA 三层诊断,并给出一套状态感知记忆工程方案。
AgentFlow 和 IAL-Scan 给出同一个工程信号:Agent 安全扫描不能只枚举工具和 prompt,而要恢复 agent、tool、memory、handoff、policy 和循环边界之间的依赖图。本文拆解 ADG/ALDG 的机制,并给出一条发布前 Agent 静态审计门。
MemSyco-Bench 把长期记忆评测从“是否取回相关记忆”推进到“取回后该不该影响当前判断”。本文拆解记忆诱导谄媚的五类任务、作者报告结果,并给出一套记忆准入与使用角色仲裁层的工程方案。
ACE 把长程 Agent 的上下文管理从一次性截断/摘要推进到可逆编排:原始轨迹和压缩抽象分层保存,每一步按当前任务状态把历史步骤渲染成 raw、abstract 或 drop。本文拆解它对生产 Agent memory runtime 的工程启发、数据模型、失败模式和验证方案。
两篇 2026 年科学工作流与人机协作研究给出同一个工程信号:AI Native 研究工作流的核心不是让 Agent 自主写完实验,而是把自然语言问题转成可验证规格、确定性 DAG、人审 gate、运行证据和失败回滚。本文拆解一套一周内可试跑的研究工作流 harness。
CLAWAUDIT 把本地 LLM Agent 的 prompt builder、tool dispatcher、skill loader、memory writer、network client 和 permission gate 定义为新的静态审计边界。本文拆解它的五类运行时边界、Semgrep/CodeQL 双后端评测、语义盲区,以及一条可落地的 Agent runtime SAST 流程。
TMA-NM / MEM-INV-Bench 把 Agent 记忆投毒的防御焦点从内容检测和 lineage 追踪推进到 write-time origin binding:每条记忆在写入时就要绑定来源权威,并且只能通过独立可信主体背书提升权限。工程上这意味着 memory store 要像安全子系统,而不只是向量库。
Autoformalization of Agent Instructions into Policy-as-Code、out-of-band prompt injection defense 评估和 MCP description-code inconsistency 测量共同指向一个工程判断:高权限 Agent 的安全边界不能只写在 system prompt 里,而要落到可验证 schema、策略代码、运行时参考监控器和自适应评估流水线。
Semgrep Guardian、Codex MCP/Hook 文档与 agentic coding 工具依赖选择研究共同指向一个工程判断:AI 写代码的安全控制不能只等 CI 扫描,而要在 Agent 写文件、引入依赖、调用工具和提交 PR 的每一跳留下可验证的安全反馈。
arXiv:2606.24775 和 MemoryData 把长期记忆从单一检索模块拆成表示存储、抽取、检索路由和维护四层。工程上真正该落地的不是再换一个向量库,而是给每层建立变更门禁、回放评测、成本账本和失效回滚。
M-Files Custom Agents 的公开 beta 暴露了一个更普遍的 AI Native 问题:文档 Agent 不应停在检索和摘要,而要把读取、判断、属性更新、路由、人工复核和审计证据做成可回滚的工作流。
Agent Audit、CodeBadger、CodeQL model packs 与 Semgrep Custom Workflows 共同指向一个工程判断:Agent 安全不能只靠提示词防护,而要把工具代码、MCP 配置、身份权限、记忆/上下文和 CI 证据做成可审计的发布关口。
OpenRath 把多 Agent 工作流里的对话、工具调用、沙箱、分支、记忆和证据统一到 Session 运行时值。本文用研究发布和代码审查场景拆解一套可复制的 AI Native 工作流:状态模型、Agent 分工、权限边界、执行 SOP、质量指标、成本估算、失败回滚和一周验证计划。
MaaS 把协作 Agent 的记忆访问从“检索到什么就给什么”改成按 owner、requester、recipient、task 和 purpose 做目的绑定调解。本文拆解 withhold / abstract / reveal 三态机制,并给出记忆调用网关、策略模型、审计记录、失败模式和一周验证计划。
OpenAnt 把仓库级漏洞发现拆成可达性裁剪、LLM 语义检测、对抗式验证和容器动态验证。本文从授权白盒扫描角度拆解一条 verified finding pipeline:候选、证据、反证、复现、报告放行、人工审核和可验证指标。
LLM 接入 SAT/SMT、CodeQL、Joern 和漏洞验证器后,机器可验证结论仍可能在自然语言叙述阶段被提示注入或上下文污染翻转。本文从 narration gap 拆解一条授权白盒扫描流水线:verdict artifact、证据锁定、叙述校验、人工复核和可验证指标。
企业 Agent 的难点不是把模型接进流程,而是把操作包络、审批暂停、权限边界、可观测性和失败复盘做成可执行控制面。本文用高影响工单处理工作流拆解 AI Native 落地方案:原流程、Agent 分工、状态流转、发布门、指标、成本和回滚。
MemGym 把长期记忆评测从多轮聊天扩展到检索、代码、Web 导航和工具对话;2606.06448 则提醒我们,记忆系统还要按 construction、retrieval、generation 的生命周期成本评估。本文给出一套 memory-isolated scoring 与 lifecycle profiling 结合的工程评测协议。
TokenPilot 在 2026-06-15 提出一个很实用的工程提醒:长程 Agent 不能只按 token 数做上下文压缩,还要保护 prompt/KV cache 的前缀连续性。本文拆解 cache-aware context management 的机制、数据结构、上线方案、失败模式和可验证指标。
Work IQ API 在 2026-06-16 GA,把企业知识、工具、工作区和权限治理包装成 Agent 可用的上下文层。本文用产品反馈周报工作流拆解 AI Native 落地方案:原流程、Agent 分工、数据边界、SOP、质量指标、成本账本和回滚策略。
SMSR、MemVenom 和长期记忆安全综述把 Agent 记忆安全推到可验证治理阶段:生产系统不能只做 prompt filter,而要把来源签名、随机化检索、证书复算、回滚和工具调用审计放进同一条验收链。
Agent 编排不是让一个大模型直接接管安全运营,而是把 triage、证据收集、静态分析、威胁情报、检测工程、修复验证和人工审批组织成有状态、有权限边界、可回放的安全工作流。本文给出一套面向 SOC 与白盒扫描的工程方案。
Infini Memory 把长期 Agent 记忆从孤立片段和向量召回,推进到可维护的主题文档库。工程上,Topic Document 的价值不只是可读 Markdown,而是把写入缓冲、证据聚合、事实修订、局部检索和审计元数据放进同一个维护单元。
arXiv:2606.06054 MemGate 把个人 Agent 的长期记忆检索定义为信任边界。工程上,记忆读路径不能只按相似度把候选片段塞进上下文,而要在检索和注入之间增加任务条件准入、来源权威、作用域隔离和工具副作用绑定。
arXiv:2606.06448 把 Agent memory 从结构设计推进到系统工作负载表征:写入构建、检索、生成各自承担不同成本。生产系统需要用 phase-aware profiling、容量治理、调度策略和收益指标证明记忆层不是更贵的上下文。
arXiv:2606.04329 把 Agent 记忆投毒从零散案例整理成写入通道、结构性漏洞和 ASR/RSR 评测问题。工程上真正该落地的是记忆写入面的资产清单、来源权威、写后审计和跨会话回归测试。
arXiv:2605.30159 提出用 Belief Entropy 给长程 Agent 的递归记忆摘要做中间奖励:问题不只是摘要能否变短,而是每一步摘要后,Agent 对任务状态、缺口信息和后续动作的信念是否更清楚。
从 arXiv:2606.02461 AgentCL 看,Agent 长期记忆评测不应只停留在长对话召回、环境问答或抗干扰测试,还要测前序任务经验能否在后续任务中被稳定复用,以及何时会造成负迁移。
从 arXiv:2606.03895 Agent libOS 看,长期运行 Agent 的风险不只在 prompt、工具描述或扫描规则里,而在调度、对象记忆、权限授予、人类审批、恢复和审计这些运行时原语能否成为真正的授权边界。
从 arXiv:2605.28009 MemGuard 看,长期记忆的可靠性问题不只来自检索召回不足,也来自把稳定事实、情景事件和操作规则混成同一种证据。生产 Agent 记忆层需要类型边界、关系图、查询路由和可审计的组合策略。
从 arXiv:2605.25092 AgentIR 看,长期对话记忆的读路径不是普通向量检索:索引会持续增长,查询类型会在会话内漂移,dense 通道并不总值得运行。生产 Agent 记忆层应该把检索策略、时间分区、延迟预算、来源治理和写入状态分开设计。
从 arXiv:2605.24462 的 Certified Traces、AgentSecBench、Agent-BOM 和当前 Agent SDK/Bedrock 工程接口看,安全 Agent 的关键不是让模型解释得更像人,而是让每次工具调用、白盒扫描、修复和部署动作在执行前携带可检查的权限、来源、证据和回放条件。
arXiv:2605.24657 把软件开发对话里的级联压缩和 LoRA 式权重合并放到同一评测里:压缩循环会快速丢失程序性纠错和项目事实,而权重合并保留更多知识。但这不意味着所有记忆都应该写进模型,真正的问题是如何在上下文、外部记忆和可回滚适配器之间划边界。
从 MemPoison 和 MemMorph 看,Agent 记忆攻击正在从“把恶意内容写进长期记忆”推进到“让恶意内容通过抽取、重写、检索和工具推理链条”。生产系统需要把记忆写入、来源权威、检索召回和工具授权放进同一套评测。
从 SuperBrain、Claude Code hooks、claude-mem 和 Memory-R2 看,长期记忆系统的难点正在从存储迁移到工作上下文注入:什么时候取、取多少、凭什么取、如何阻止旧记忆污染当前任务。
从 Persistent AI Agents in Academic Research 看,长期记忆 Agent 的评估对象不该只是单轮回答、RAG 命中率或 token 成本,而应扩展到人-代理-文件-工具-计划任务-治理规则组成的持久化环境。
从 Useful Memories Become Faulty When Continuously Updated by LLMs 看,自动把成功轨迹持续压缩成文字经验,可能让 Agent 从有用记忆退化到错误记忆;长期记忆系统需要把 consolidation 当成可验证、可回滚、可门控的写操作,而不是无条件后台任务。
LongMINT 把长期记忆评测推到多目标干扰、事实修订和跨片段聚合推理场景;结合 MedMemoryBench 的 memory saturation,可以看到生产 Agent 记忆的核心风险不是容量不足,而是旧事实、新事实、噪声和多任务目标互相污染。
本文把 Agent、Code Property Graph、Low False Positive Control Layer、规则引擎、数据流分析和验证沙箱合成一个白盒扫描器方案:不是让大模型直接猜漏洞,而是让它围绕代码图、低误报控制、证据链和 PoC 验证来工作。
TMLR 2026-05-17 接收的 ZipAct 把 agent 的交互历史压缩成 Goal、World、Constraint 三类结构化状态,让动作生成只看当前状态表和最新观察。它提醒我们,长任务记忆的关键不只是存储更多历史,而是把可执行状态、负反馈和约束持续更新到一个可验证的工作记忆里。
LinkedIn 的 Hierarchical Long-Term Semantic Memory 和 Cognitive Memory Agent 把 agent memory 从“多存一些聊天历史”推进到生产个性化基础设施:schema-aligned 语义树、多视图记忆、身份作用域检索、近线增量更新、可观测来源和端到端质量指标。它的启发是,企业 agent 的长期记忆首先是业务边界、隐私隔离和延迟预算问题,其次才是向量检索问题。
LongMemEval-V2 把长期记忆问题从用户聊天历史推进到 web/enterprise agent 的环境经验:静态状态、动态变化、工作流、局部陷阱和前提意识。它提醒我们,生产记忆系统不能只追求 RAG 召回分数,还要证明经验能被压缩、检索、使用,并在延迟成本内帮助 agent 像资深同事一样工作。
OpenAI Agents SDK 的 sandbox memory 文档和 AgentMemory 近期连续修复显示,coding agent 的长期记忆不再只是 RAG 或偏好存储,而是涉及文件化状态、渐进披露、隔离布局、召回正确性、部署持久化、上下文预算和观测面的运行时系统。
PlugMem、gbrain-evals、MemPalace 和 Mem0 等近期材料显示,agent memory 的公开评测正在进入高分密集区;真正重要的问题不再只是 R@5 或 accuracy,而是数据划分、调参污染、成本账本、可复现脚本和生产迁移边界。
5 月上旬的 Trojan Hippo、MAGE 和 Opal 等研究说明,长期记忆不只是个性化能力,也是跨会话攻击面、隐私泄露面和防护状态本身;生产系统必须把记忆写入、来源、工具权限和遗忘纳入同一个安全模型。
MongoDB 在 2026-05-08 为 LangGraph.js 长期记忆发布一等支持,意味着短期 checkpoint、长期 store、语义检索和自动 embedding 正在进入应用数据库;但这解决的是运行时和存储边界,不等于解决记忆写入、作用域、遗忘和个性化误用。
从 2026-05-06 的 MemAgents workshop 回顾和 ICLR/OpenReview 论文线索看,AI agent memory 的关键问题正在从“要不要长期记忆”转向写入、压缩、召回、利用和评测瓶颈的可诊断化。
从 arXiv:2604.27003 和 elfmem 看,外部记忆并不会自动解决持续学习;它只是把灾难性遗忘从参数更新搬到检索、表示、评分衰减和经验复用策略里。
从 arXiv:2604.23069 ContextWeaver 看,工具型 LLM agent 的记忆不只是在历史里检索相似片段,而是要保留当前行动真正依赖的早期证据、决策和执行反馈。
从 2026-05-02 的 agent memory 产品面讨论、ChatGPT Project-only memory、Claude 个性化功能和 Mem0/Cloudflare 的工程材料看,生产级记忆系统必须先定义用户、项目、任务和运行审计的边界,再谈向量库、图谱和长上下文。
从 arXiv:2604.15877 看,长期记忆、技能和规则不是三个孤立模块,而是同一条经验压缩轴上的不同粒度;真正缺失的是跨层晋升、降级和生命周期治理。
从 NousResearch/hermes-agent 的官方文档和源码看,Hermes 的记忆系统由小容量常驻记忆、SQLite/FTS5 会话检索、外部记忆提供商和技能系统组成;它和 OpenClaw 的差异不在口号,而在事实源、召回路径、晋升机制和治理边界。
从 2026-04-28 的 agentic-db 发布和 n8n Memori 社区节点看,长期记忆正在向数据库、工作流和托管平台下沉;真正要评估的是写入治理、召回路径、遗忘机制和可观测性。
系统介绍 Obsidian 的主要能力、实际使用流程、底层技术和 AI 工作流接法:Markdown vault、双向链接、Properties、Search、Canvas、Bases、CodeMirror、插件 API 与同步加密。