**论文粗读:能往外搬的,别让 Agent 自己扛**
#论文粗读:能往外搬的,别让 Agent 自己扛
全文阅读原文: https://chorus-ai.dev/zh/blog/externalization-in-llm-agents/
#为什么读这篇
Harness 比模型重要,这话这两年听太多了。SWE-bench 上同一个模型换不同 harness 差 17 题,Claude Code 的 thinking 被砍之后整个社区炸锅。大家都在讲同一件事:别光盯着模型,得看环境。但说来说去都是经验和隐喻,harness 是操作系统,harness 是围墙,没人从底层解释过”为什么把东西搬出模型就能变好”。
这篇 54 页的综述干的就是这个事。它从认知科学的角度给出了一个统一解释:Memory、Skills、Protocols、Harness,这几个看着各管各的工程趋势,背后其实是同一个逻辑在驱动。
#核心概念:外化改变的不是能力,是任务本身
论文拿 Donald Norman 的”认知制品”(cognitive artifacts)理论做支点。Norman 有个很反直觉的观察:外部工具不是放大你的内部能力,而是把任务变成了另一个任务。
购物清单就是最好的例子。清单不是让你记忆力变好了。它做的事情是:把”回忆要买什么”这个困难任务,变成”看一眼纸上写了什么”这个简单任务。任务的性质变了,从回忆(recall)变成了识别(recognition)。
LLM Agent 的外化是同一回事。论文梳理了裸模型反复踩的三个坑,每个坑对应一种外化方式:
连续性问题。 上下文窗口有限,session memory 弱或者干脆没有。Agent 每开一个新 session 都是部分失忆的开始。论文举了个例子:一个 SWE agent 在大仓库中实现功能,它需要记住仓库结构、项目惯例、工作进度、之前踩过的坑。没有外化 memory 的时候,这些全靠塞进 prompt。prompt 一满或者 session 一断,这些上下文就丢了。有了 memory,模型不再需要”回忆”过去知道什么,而是从持久化存储中检索。回忆变成了检索(recall → retrieval)。
方差问题。 多步骤流程每次都被重新推导,而不是被一致执行。同一个 prompt,今天可能分五步做,明天分三步,后天跳过关键的验证步骤。模型不是不知道该怎么做,而是每次从头即兴创作的时候不够稳定。有了 skill,Agent 不需要每次发明工作流,而是选择和组合已验证的流程。从头生成变成了选择组合(generation → composition)。
协调问题。 与外部工具、服务、协作者的交互是脆弱的。模型每次调工具都要猜参数格式、猜返回结构、猜错误处理方式。有了 protocol,这些开放式的推理被替换成了在显式契约内填字段。临场协商变成了结构化交换(ad hoc → structured exchange)。
三种外化的共同点:不是给模型加了更多信息,而是模型被要求解决的问题变了。
