Tag

#reproducibility

AI Native 实践

别让研究 Agent 用一句“已复现”结案:把论文计算 Claim 做成可验证目标

基于 Paper-replication 的 target-level workflow,本文给出一条 AI Native 论文复现流程:从论文主张拆分、方法重建、运行溯源、claim-specific 验收,到报告覆盖检查与人工发布门,避免把生成了相似图表误判为复现成功。

论文解读

PRO-LONG 给长期 Agent 的启示:别先摘要历史,先把轨迹变成可编程证据

解读 PRO-LONG 的 programmatic memory:对每次观察、动作和结果做结构化追加,再让 coding agent 用 grep/Python 按需查询。本文拆解它为何在 ARC-AGI-3 上有效、哪些结论不能直接外推,并给出面向研究与研发 Agent 的日志协议、查询预算、验证闭环和一周实验方案。

工程架构

定时 Agent 的记忆不是历史聊天:用任务账本、检查点和只读恢复避免重复与陈旧行动

面向研究、运营与研发自动化的 Agent Memory 设计:把短期上下文、可验证任务账本、可恢复检查点和可遗忘知识分开管理。本文给出状态机、数据模型、写入门槛、SOP、评测与回滚方案,解决定时 Agent 重复执行、误把旧结论当事实和失败后无法安全续跑的问题。

AI Native 实践

研究型 Agent 应该先产出规格,而不是直接替你做实验

两篇 2026 年科学工作流与人机协作研究给出同一个工程信号:AI Native 研究工作流的核心不是让 Agent 自主写完实验,而是把自然语言问题转成可验证规格、确定性 DAG、人审 gate、运行证据和失败回滚。本文拆解一套一周内可试跑的研究工作流 harness。