Tag

#coding agents

论文解读

PRO-LONG 给长期 Agent 的启示:别先摘要历史,先把轨迹变成可编程证据

解读 PRO-LONG 的 programmatic memory:对每次观察、动作和结果做结构化追加,再让 coding agent 用 grep/Python 按需查询。本文拆解它为何在 ARC-AGI-3 上有效、哪些结论不能直接外推,并给出面向研究与研发 Agent 的日志协议、查询预算、验证闭环和一周实验方案。

AI Native 实践

代码审查 Agent 不该浏览整个仓库:用 diff 问题、证据预算和验证闭环收敛审查

基于 GitHub Copilot Code Review 近期的工程复盘,本文给出一套面向 PR 审查的 AI Native 工作流:从 diff 问题编译、受限检索、证据卡片到人工裁决、指标与回滚。重点不是让 Agent 多提评论,而是让每条评论可复核、可拒绝、可度量。

AI Native 实践

代码 Agent 要先收敛证据包,而不是读完整仓库

ContextSniper 和 Deterministic Anchoring 给出同一个工程信号:AI Native 代码修复工作流的瓶颈不是上下文窗口不够大,而是证据选择、结构锚点、输出过滤和验证闭环没有产品化。本文给出一套一周内可试跑的代码 Agent 证据包工作流。

工程分析

从记住到可运行:Coding Agent 记忆系统正在变成运行时可靠性问题

OpenAI Agents SDK 的 sandbox memory 文档和 AgentMemory 近期连续修复显示,coding agent 的长期记忆不再只是 RAG 或偏好存储,而是涉及文件化状态、渐进披露、隔离布局、召回正确性、部署持久化、上下文预算和观测面的运行时系统。