跳到主要内容

常见问题 FAQ:Agent Loop Engineering

七天实战

多数问题可在实现最小 Runtime 后对照 Trace 自答;子站:loop-engineering.chenxiaoshivivid.top。概念底座见 入门介绍

分类索引

类别问题编号
概念边界Q1–Q5
设计与选型Q6–Q12
调试与事故Q13–Q20
成本与性能Q21–Q25
与其它专题关系Q26–Q30

概念边界

Q1:Loop Engineering 是不是就是控制理论 / PID?

不是。 本站 Loop Engineering 指 Agent 循环工程:ReAct、Plan–Execute、Reflection、Evaluator–Optimizer、多 Agent 编排、记忆写回、迭代预算与停止条件。控制论可作隐喻(反馈、饱和、振荡),但教学核心对齐 Harness / Hermes / DeepSeek Harness 语境下的 运行时迭代,不是用 Bode 图整定 LLM。

Q2:和 Agent Harness Engineering 什么关系?

Harness 保证单次工具调用的安全、Session、插件与沙箱;Loop 保证多轮迭代的收敛与经济性。公式:Agent ≈ Model × Harness × Loop。先有 Harness 再深化 Loop,顺序与本站课程一致。

Q3:和 AutoGPT「自主 Agent」有何不同?

早期自主 Agent 常默认无限环、弱验收、弱观测。本系列强调:显式预算、外部验收、失败模式编号、权限分离。自主不是目标,可控的半自主才是。

Q4:开环 Agent 还有存在价值吗?

有。一次性生成、无副作用、可人工验收的场景,开环更便宜。价值在于当你需要 根据环境反馈改策略 时再上闭环,并用开环做基线对照。

Q5:为什么文档不再以温控 PID 为主线?

子站历史实验仍可建立「反馈直觉」,但文档站校正受众:工程师要交付的是 Agent 产品。隐喻保留在 最佳实践 健康映射表。


设计与选型

Q6:何时上 Plan–Execute 而不是纯 ReAct?

当步骤较多、需要中途重规划、或各步工具集不同。纯 ReAct 在长任务上易丢全局目标。见 开发指南

Q7:Reflection 会不会浪费钱?

会,若无 schema 化问题列表或 max_reflect。只对「质量敏感且难自动测」的产物开 1 轮;能单测的优先 Evaluator 脚本。

Q8:LLM-as-Judge 可靠吗?

中等可靠,易被讨好。生产组合:规则/测试为主,Judge 为辅,定期人工抽检;优化器进程不可改 Judge 提示中的金标。

Q9:多 Agent 是不是一定更强?

否。角色重叠、无工件 handoff、无全局预算时往往更弱(L08)。默认单环 + 好工具;权限必须隔离时再拆。

Q10:停止条件能否只写在 System Prompt?

不能当唯一手段。Prompt 可提示模型「完成就停」,但 StopJudge 必须在代码里 读验收与预算。否则必现假完成。

Q11:fingerprint 的粒度怎么选?

太粗:误杀探索;太细:死环漏网。实践:tool_name + 规范化 args;对搜索类可对 query 做规范化;对写文件可用「路径+补丁哈希」。

Q12:要不要一开始用 LangGraph?

学习期手写循环;出现检查点、复杂分支、多人维护图时再引入。无论框架,Budget/Stop 逻辑尽量自控。


调试与事故

Q13:模型一直重复同一搜索怎么办?

查 Trace 是否缺 fingerprint;Observation 是否未告知「已搜过」;是否把失败当成功。触发 L02 停止并注入「更换关键词」策略或 Replan。

Q14:步数没用完就胡言乱语?

高度疑似 L04 上下文中毒。检查 Observation 长度、是否回灌了整页 HTML。启用压缩与每 K 步折叠。

Q15:测试变绿但生产仍挂?

L11 影子成功:验收环境与生产不一致。任务卡标注环境,验收命令必须指向等价数据与配置。

Q16:Agent 改了测试用例怎么办?

权限事故。写工具白名单排除测试断言文件;Reviewer/Eval 只读;CI 检测测试目录 diff 则失败。

Q17:多 Agent 开会不干活?

查 handoff 是否缺 artifact_refs;是否允许自由讨论拓扑;是否缺 handoff TTL。改为流水线并强制产物。

Q18:人审队列堵死任务?

预置超时策略:等待过久 → 安全降级(取消副作用)或转人工工单,而不是死等。对应 L12。

Q19:如何证明某次成功不是偶然?

黄金任务集回归 + 固定种子工具 mock;看成功率区间,而非单次 Demo 录屏。

Q20:Trace 太大存不起?

失败全量、成功采样;字段截断;对象存储分级。但 stop_reason 与花费指标必须进短表以便告警。


成本与性能

Q21:怎样降低 cost_per_success?

模型分级、缓存只读工具、早停、压缩 Observation、避免无验收的「加轮数」。看板同时盯成功率和花费。

Q22:并行 tool_calls 一定更快吗?

只读并行通常更快;写并行可能冲突导致更多重试,总成本上升。默认:读并写串。

Q23:小模型跑 Loop 可行吗?

执行环可以;规划/反思可用强模型。接口保持同一 Action schema,避免两套解析。

Q24:温度参数怎么调?

次要。先固定停止与工具描述。探索性调研可略升温度;修测试类任务偏低。不要用温度替代预算。

Q25:如何设组织级费用帽?

在 Harness 或网关层按 API Key/租户计量;Loop 启动前预留预算;触顶拒绝新环并告警。CI Agent 必须单独帽。


与其它专题关系

Q26:和 Memory Engineering 如何分工?

Memory 管记什么、如何检索;Loop 管 何时写回、写回门禁、读入冲突优先级。无门禁的写回是 L09。

Q27:和 MCP 文档什么关系?

MCP 提供工具协议;Loop 编排调用次数与停止。见 MCP 入门 与本系列 GitHub 导读

Q28:Hermes 的 ReAct+ 还要再学一遍吗?

Hermes 侧重推理模式与工具描述;本系列侧重 Runtime 工程(预算、指纹、评测隔离)。建议都读,重点不同。

Q29:DSH 能否替代 Loop Runtime?

不能替代。DSH 提供宿主能力;你仍需 StopJudge/Budget/拓扑。可以在 DSH Session 上挂载你的 Runtime。

Q30:子站课表和文档不一致怎么办?

以文档站 Agent Loop 定义为准;子站实验作反馈直觉。学习路径按 从零到一 执行。


速查:症状 → 失败模式

症状ID
空转续聊L01
同参死环L02
计划来回翻L03
长上下文后崩溃L04
自称完成未达标L05
改测试或讨好分L06
token 先爆L07
多角色互踢L08
错记忆复用L09
重试打爆依赖L10

补充问答(实操高频)

Q31:Checkpoint 恢复后工具副作用会不会重放?

若步骤无幂等键,会。实践:写操作带 idempotency_key;恢复时跳过已成功的副作用步,或先查询外部状态再决定。

Q32:如何向非技术同事解释 Loop?

「机器人按检查清单做事,每做一步对照清单,超次数就停下来找人。」避免讲控制论。

Q33:成功停止和预算停止如何做产品文案?

成功:展示产物链接。预算:说明「已尝试 N 步」,给「放宽预算 / 改目标 / 转人工」三按钮,而不是只报错。

Q34:同一租户并发多个 Loop 如何隔离?

Session ID 隔离消息与预算;工具沙箱按租户;全局费率限制防吵闹邻居。

Q35:是否应该把 max_steps 暴露给终端用户?

高级用户可调上限(有组织硬顶);普通用户给预设档(快速/标准/彻底),避免每人乱填 999。

仍有问题?带 脱敏 Trace 对照 开发指南 复现后再提问——可观测性优先于猜测。


案例短答

Q36:调研 Agent 写得很长但全是套话,算成功吗?

若验收只有字数:算技术成功、产品失败。应加「必须含可点击来源 / 仓库路径 / API 名」等硬规则,或抽样人工分。

Q37:Plan 第一步就错,后面会不会全错?

会。所以要 Replan 触发器与 max_replan,并允许用户在 UI 编辑计划后继续——人在环上改计划,比盲目执行更省钱。

Q38:能否用另一个 Agent 专门「监督」主环?

可以,但是监督者必须是 只读评测器,且有自己的小预算。两个可写 Agent 互监容易演变成辩论俱乐部(L08)。

Q39:本地 Ollama 与云 API 混用注意什么?

统一 Action 规范化层;分别计量 token(本地可按字符近似);不要假设本地模型会遵守同一停止话术——更要靠代码 StopJudge。

Q40:如何教新人第一周就不上无限环?

结对写任务卡;Code Review 拒绝无 max_steps 的 PR;用 从零到一 Day2 作业作为入职必过。