PRO-LONG 给长期 Agent 的启示:别先摘要历史,先把轨迹变成可编程证据
解读 PRO-LONG 的 programmatic memory:对每次观察、动作和结果做结构化追加,再让 coding agent 用 grep/Python 按需查询。本文拆解它为何在 ARC-AGI-3 上有效、哪些结论不能直接外推,并给出面向研究与研发 Agent 的日志协议、查询预算、验证闭环和一周实验方案。
Tag
解读 PRO-LONG 的 programmatic memory:对每次观察、动作和结果做结构化追加,再让 coding agent 用 grep/Python 按需查询。本文拆解它为何在 ARC-AGI-3 上有效、哪些结论不能直接外推,并给出面向研究与研发 Agent 的日志协议、查询预算、验证闭环和一周实验方案。
基于 GitHub Copilot Code Review 近期的工程复盘,本文给出一套面向 PR 审查的 AI Native 工作流:从 diff 问题编译、受限检索、证据卡片到人工裁决、指标与回滚。重点不是让 Agent 多提评论,而是让每条评论可复核、可拒绝、可度量。
ContextSniper 和 Deterministic Anchoring 给出同一个工程信号:AI Native 代码修复工作流的瓶颈不是上下文窗口不够大,而是证据选择、结构锚点、输出过滤和验证闭环没有产品化。本文给出一套一周内可试跑的代码 Agent 证据包工作流。
OpenAI Agents SDK 的 sandbox memory 文档和 AgentMemory 近期连续修复显示,coding agent 的长期记忆不再只是 RAG 或偏好存储,而是涉及文件化状态、渐进披露、隔离布局、召回正确性、部署持久化、上下文预算和观测面的运行时系统。