PRO-LONG 给长期 Agent 的启示:别先摘要历史,先把轨迹变成可编程证据
解读 PRO-LONG 的 programmatic memory:对每次观察、动作和结果做结构化追加,再让 coding agent 用 grep/Python 按需查询。本文拆解它为何在 ARC-AGI-3 上有效、哪些结论不能直接外推,并给出面向研究与研发 Agent 的日志协议、查询预算、验证闭环和一周实验方案。
Research Notes
这里不追热点口号,只拆解能落到工程里的技术问题:Agent Memory、AI Native 工作流,以及白盒扫描、代码图、静态分析和安全自动化。
episodic: events + traces semantic: facts + abstractions retrieval: relevance + freshness forgetting: decay + conflict checks 解读 PRO-LONG 的 programmatic memory:对每次观察、动作和结果做结构化追加,再让 coding agent 用 grep/Python 按需查询。本文拆解它为何在 ARC-AGI-3 上有效、哪些结论不能直接外推,并给出面向研究与研发 Agent 的日志协议、查询预算、验证闭环和一周实验方案。
面向研究、运营与研发自动化的 Agent Memory 设计:把短期上下文、可验证任务账本、可恢复检查点和可遗忘知识分开管理。本文给出状态机、数据模型、写入门槛、SOP、评测与回滚方案,解决定时 Agent 重复执行、误把旧结论当事实和失败后无法安全续跑的问题。
基于 GitHub Issues 新增的 rationale、confidence 和 approvals 控制,本文设计一套可落地的 Issue Agent 工作流:用意图对象、状态机、最小权限与人工原因码,让自动分流可审计、可回滚,而不是把自动标签当作安全治理。
Research Standard
Focus Areas