RSI开始落到Harness工程:Pi让Agent跑得久,DeepSeek让Agent改得动
据 动察 Beating 监测,递归自我改进正在越来越具体地落到 Harness 上。最近 Pi 和 DeepSeek Harness 的两套设计,恰好补上两个关键底座:一个让 Agent 跑得足够久,一个让 Agent 本身足够容易改。
Pi 最新 Harness V3 规范把 Agent 设计成可恢复的持久运行时。模型请求和工具调用前先记录执行意图,完成后再写入结果和下一步状态。进程崩溃后,系统能知道任务停在哪里,哪些操作可以安全重跑,哪些有副作用、不能再执行一次。Agent 要长期运行,首先不能一次崩溃就从头再来。
DeepSeek Harness 补的是另一半。Cordis 把模型适配器、工具系统、Session Log,甚至 Agent Loop 都做成可组合组件;创造模式还允许 Agent 在运行时检查 Cordis 环境,临时定义、加载和卸载新的组件。
Pi 让执行状态可以延续,DeepSeek 让 Agent 的组成结构可以动态重组。
这正是翁荔 7 月讨论 Harness 与递归自我改进时判断的方向。近期 RSI 未必从模型直接重写权重开始,更现实的路线是先优化上下文和工作流,再深入到 Harness 代码,最后连「怎么优化 Harness」本身也成为优化对象。
现在还缺第三块:验得准。自进化 Agent 研究已经把评测和安全列为核心问题。Agent 可以长期运行,也可以修改自己,但如果连「什么叫进步」都能一起改,很容易为了通过自己的测试而优化。翁荔也特别强调,verifier、tracer 和安全边界应该放在自修改回路之外。
所以真正的 RSI 闭环,至少要解决三件事:跑得久、改得动、验得准。Pi 正在补第一块,DeepSeek 正在补第二块,第三块决定这种「进化」最后是真的能力增长,还是只学会了通过自己出的考试。
能改自己只是进化的开始,能证明自己真的变强,才是 RSI 最难的最后一公里。