Agent 拒绝一次还不够:记忆投毒需要状态修复与跨会话验收
MemPoison 与 Bad Memory 共同暴露了一个常被忽略的缺口:当前会话拒绝恶意指令,不代表持久状态已恢复安全。本文把记忆投毒治理拆成写入、检索、消费、隔离、修复与跨会话验收,并给出可落地的数据模型、状态机和回归协议。
Tag
MemPoison 与 Bad Memory 共同暴露了一个常被忽略的缺口:当前会话拒绝恶意指令,不代表持久状态已恢复安全。本文把记忆投毒治理拆成写入、检索、消费、隔离、修复与跨会话验收,并给出可落地的数据模型、状态机和回归协议。
FARMA 和 GhostWriter 把记忆投毒从污染事实条目推进到污染推理历史和个人助理工作状态。生产 Agent 不能把历史 reasoning、decision log 和经验摘要默认当成可信证据,而要在写入、检索、行动前同时做来源绑定、推理痕迹完整性检查和高风险动作授权。
TMA-NM / MEM-INV-Bench 把 Agent 记忆投毒的防御焦点从内容检测和 lineage 追踪推进到 write-time origin binding:每条记忆在写入时就要绑定来源权威,并且只能通过独立可信主体背书提升权限。工程上这意味着 memory store 要像安全子系统,而不只是向量库。
SMSR、MemVenom 和长期记忆安全综述把 Agent 记忆安全推到可验证治理阶段:生产系统不能只做 prompt filter,而要把来源签名、随机化检索、证书复算、回滚和工具调用审计放进同一条验收链。
arXiv:2606.04329 把 Agent 记忆投毒从零散案例整理成写入通道、结构性漏洞和 ASR/RSR 评测问题。工程上真正该落地的是记忆写入面的资产清单、来源权威、写后审计和跨会话回归测试。
从 MemPoison 和 MemMorph 看,Agent 记忆攻击正在从“把恶意内容写进长期记忆”推进到“让恶意内容通过抽取、重写、检索和工具推理链条”。生产系统需要把记忆写入、来源权威、检索召回和工具授权放进同一套评测。