这篇文章面向大学阶段的技术学习者和大模型应用开发工程师,作者结合自己的学习与项目经历,梳理了 Agent 应用开发中的核心概念、学习顺序和实践重点。

三个核心概念

Agent Loop

Agent Loop 是运行核心:用户给出任务,模型输出指令,工具执行并返回结果,模型继续判断下一步,直到任务结束。学习应用开发时,应先理解这一循环如何驱动工具调用、状态变化和任务终止。

Context Engineering

当系统提示词和基本工具结构逐渐稳定后,决定 Agent 是否有效的关键转向动态上下文。上下文通常包括用户记忆、会话历史、当前输入、系统提示词和工具定义。长程运行会产生漂移、污染、干扰与冲突,因此需要压缩、文件存储与检索、上下文编排和渐进式披露等管理方法。

作者把 RAG 和知识图谱视为补充“背景信息”的重要手段:当用户没有完整提供任务背景时,工具系统需要动态检索相关信息,再将其组织进模型可用的上下文。

Harness Engineering

Harness Engineering 为 Agent 构建运行空间,组织能力结构、协作机制与反馈闭环。它不仅用于约束模型,也用于提供模型原本不具备的环境能力。作者认为,面对复杂且不可预先穷举的环境时,固定工作流容易失效,运行空间需要能够持续调整。

推荐的学习顺序

  1. 先掌握传统软件开发基础、LLM API 请求方式与基本工具调用。
  2. 学习 Agent Loop,理解模型、工具和执行结果之间的循环。
  3. 学习上下文工程,包括 RAG、知识图谱、记忆、压缩、检索与渐进式加载。
  4. 研究 Harness 的工具结构、协作机制、反馈闭环和运行安全。
  5. 尽早引入 Agent 评估,用数据集而不是主观体验确定能力边界和迭代方向。
  6. 在单 Agent 稳定后再探索多智能体;作者认为单智能体加一个 SubAgent 已经能覆盖许多任务,而更复杂的多智能体会显著增加上下文管理和协作难度。

Agent 评估

作者建议把评估作为构建 Agent 的早期步骤。一个评估任务通常包含环境、指令、Agent(或 Harness)、解决方案、执行轨迹、评估器、测试代码与产物;多个任务组成数据集。指标应由评估目标决定,例如检查最终结果是否正确,或观察 Agent 的推理与执行质量。

文中提到可先了解 Harbor 一类评估框架,再研究 Deep-SWE、Terminal-Bench、GAIA2、BaxBench 和 WorkBuddy Bench 等数据集,并根据 Harness 所服务的领域选择任务。

作者的实践路径

作者最初从批量调用大模型 API 生成内容入门,随后学习 LangChain、检索器、向量数据库、嵌入模型、工具定义和链式调用;之后通过 LangGraph、RAG 与多维表格完成团队 Agent 项目。

随着 Coding Agent 发展,作者进一步研究 Claude Code、Gemini CLI、OpenCode 等框架,关注本地搜索工具、上下文压缩、Skill、工具定义和指令结构。项目从固定工作流迭代到多智能体与自定义工具,学习重点也转向多智能体协作、上下文管理、Agent 评估和 Harness 自进化。

实践原则

  • 保持务实,优先寻找简单而有效的方案。
  • 结合执行日志观察上下文设计缺陷和 Harness 运行漏洞。
  • 在 Agent-first 开发中先完成人工设计与计划,再让 Agent 执行,并通过自动化验收和人工验证收尾。
  • 保留对项目架构的整体理解;需要时再深入工具参数、判断逻辑和返回值。
  • 把值得复盘的设计思路和排障经验沉淀为学习文档,避免长期无脑使用不理解的 Skill 或工作流而削弱自身能力。
  • 不放弃传统软件工程与底层技术,它们仍是设计、审查和驾驭 Agent 系统的基础。

学习资源方向

作者推荐优先阅读 Anthropic 的工程与研究文章、Claude 团队博客、Cursor 团队博客、Lilian Weng 的技术博客、Claude Code 文档,以及 Pi 的文档和源码;这些资料分别覆盖模型应用工程、Agent 工具、上下文管理与运行空间设计。

原作者:WakeUp-Jin
原帖:https://linux.do/t/topic/2896420