首页 / 文章 / AI Agent入门

AI Agent入门实践:规划、工具调用与可控自动化

工程实践 · 约3800字 · 预计阅读16分钟 · 更新于2026年4月

本文目录
  1. Agent不是「更会聊天」
  2. 最小架构:模型+工具+状态机
  3. 适合与不适合的场景
  4. 可靠性设计:权限、预算、人工闸门
  5. 评测怎么做
  6. 从聊天机器人升级的路径

Agent被宣传成能自主完成多步骤任务的智能体。工程上更务实的定义是:由大模型负责理解与规划,由确定性工具执行查询/计算/写操作,由业务规则限制行动边界。离开工具与边界,所谓Agent只是多轮聊天。

一、Agent不是「更会聊天」

聊天机器人:单轮或短多轮生成文本。Agent:可能拆解子目标、选择工具、根据结果继续下一步,直到满足停止条件。能力上限往往不在模型,而在工具质量和状态管理。

二、最小架构:模型+工具+状态机

  1. 感知:用户目标、上下文、权限身份。
  2. 规划:模型提出下一步(调用哪个工具/直接回答/询问澄清)。
  3. 执行:服务端校验参数与权限后执行工具。
  4. 观察:把工具结果回填给模型。
  5. 停止:成功、失败、超时、步数耗尽或转人工。

用显式状态机(或工作流引擎)约束循环,比「让模型自由循环直到觉得完成」更可控。步数上限、总Token预算、工具白名单必须写死。

工具鉴权必须在服务端完成。模型说「我是管理员」没有任何效力。

三、适合与不适合的场景

更适合更谨慎
内部工单查询与草稿回复自动对外下单/转账
多系统信息汇总报告无人值守改生产配置
代码仓库内辅助重构建议直接合并并发布
带人工确认的运营流程高风险法律/医疗结论

四、可靠性设计

  • 权限最小化:只暴露完成任务所需的只读接口;写操作需二次确认。
  • 预算:单任务最大步数、最大费用(配合成本估算)。
  • 可观测:记录每步工具名、参数摘要、耗时与结果码,便于复盘。
  • 降级:工具失败时返回已收集信息,而不是假装成功。
  • 提示注入:工具返回内容视为不可信,防止间接注入(见Prompt工程)。

五、评测怎么做

准备任务剧本:给定目标与模拟工具响应,断言Agent是否调用正确工具、是否越权、是否在步数内结束。比「主观看对话好不好」更接近生产风险。线上再跟踪:任务完成率、人工接管率、平均步数与费用。

六、从聊天机器人升级的路径

  1. 先把高频意图做成「单工具调用」(不是完整Agent)。
  2. 稳定后再允许两到三步编排。
  3. 最后才对低风险内部场景放开有限自主循环。

不要跳过第一阶段。多数业务价值来自「可靠调用一个对的API」,而不是「看起来很智能的长链路」。

延伸:RAG可作Agent的只读知识工具;治理见风险治理;运维见LLMOps