Harrison Chase 赞同一种工程化表述:在模型保持不变时,Agent 的改进往往来自运行时 harness,而不是模型本身。他列出的干预位置都在工具边界附近,包括传入什么上下文、何时提供工具、如何从失败中恢复,以及事后测量什么;并说明其团队正用 deepagents 承载编排逻辑、用 LangSmith 负责测量,围绕二者构建改进闭环。
英文原帖(节选)与中文翻译
I like this framing a lot: agent improvement is harness improvement, not model improvement. The interesting interventions are often at the tool boundary.
我很认同这种表述:Agent 的改进是 harness 的改进,而不是模型的改进。有价值的干预往往发生在工具边界。
引用论文的实验范围
原帖引用论文《Beyond Prompts: Measuring and Optimizing LLM Tool-Agent Harnesses》。论文把固定模型下的多轮工具 Agent 优化定义为受资源预算约束的 harness 选择问题,搜索范围包含提示词与工具边界中间件,不任意改写 Agent 的执行逻辑。
论文提出的报告指标包括:
- 留出集平均提升;
- 最差条件下的提升;
- 结果可重复性;
- 有记录的成本诊断;
- RelLift95(B):在预算 B 下,对所选 harness 留出集增益的保守估计。
作者用 prompt-only 与 prompt-plus-middleware 优化器实例化该协议,其中 PRISM 会聚类失败,并将修复路由到提示词、工具边界中间件或二者联合的编辑空间,再进行 Pareto 搜索。论文摘要报告:在 BFCL multi-round、tau2-Retail 和 tau2-Telecom 上,PRISM 的留出集平均提升分别为 14.2、14.9 和 10.1 个百分点,三项基准的经验 RelLift95 均为正;消融实验将主要增益归因于失败表面路由和编辑模式约束。
论文同时提醒:部分搜索过程偶尔能找到较大提升,却可能选择脆弱的更新,因此应把所选 harness 的可靠性与平均留出集提升一起报告。
论文:[2609.05736] Beyond Prompts: Measuring and Optimizing LLM Tool-Agent Harnesses