AI×金融知识站
–

kp-023 · Agent 概览:工具调用与多步金融任务

前沿 模块:大模型落地 预计 30 分钟 更新 2026-10-02

一句话定义

Agent 是"大模型+规划+工具调用+记忆"的组合体,能自主分解任务并多步执行——本知识点为概览级介绍:讲清 Agent 的构成、ReAct 式工作循环、金融任务的典型形态,以及为什么金融场景必须给 Agent 套上人审闸门。

为什么重要

RAG 解决"答得准",Agent 挑战"办得成"——把多个原子能力(检索、计算、查询接口、文档生成)串成端到端任务,是当前大模型应用的前沿方向,也是争议最大的方向。金融是 Agent 价值与风险都最极端的领域:一份尽调初稿自动化的收益巨大,但一次越权的资金操作或一条未经核实就写入报告的结论,代价同样巨大。理解 Agent 的正确姿势是"能力清单+风险清单"双清单:知道它能串什么,更知道哪里必须断开交给人类。

前置知识

kp-021(RAG 是 Agent 最常用的工具之一)、kp-022(工具调用与结构化输出的机制基础)。

直观类比

RAG 像一位只开卷答题的顾问,Agent 则像一名能自己动手的实习生:接到任务先列计划(规划),然后翻资料(检索工具)、按计算器(计算工具)、查内部系统(接口工具),边做边调整思路(推理-行动循环),最后交作业。但实习生会把事办砸——所以成熟的公司都规定:实习生可以起草,签字必须主管来(人审闸门),动钱动章的柜子实习生没有钥匙(权限边界)。

核心概念

  • 四组件:LLM(推理与决策中枢)、规划(任务分解与反思:把"完成某公司尽调初稿"拆成子任务序列)、工具(函数调用暴露的能力:检索、指标计算、工商查询接口、文档生成)、记忆(任务内状态与跨任务知识,前者是上下文管理,后者是向量库/知识库)。
  • ReAct 循环:Reason(推理当前该做什么)→ Act(调用工具)→ Observe(观察返回结果)→ 循环至收敛;相对一次性生成的优势是能依据中间结果修正路径。
  • 工具设计原则:工具粒度适中(太细则规划负担重,太粗则黑盒化)、输入输出 Schema 明确(kp-022 的结构化输出)、每个工具独立鉴权与审计。
  • 金融任务形态:尽调初稿(工商→财报→诉讼/舆情→风险清单→草稿)、合规检查辅助(制度比对→差异清单)、投研素材汇编(多源检索→证据包)——共同特征是多步、可分解、有明确验收物,但最终判断留给人类。
  • 人审闸门与权限设计:只读工具开放、写操作分级(草稿可写、对外文件必须人签)、资金与客户操作不进 Agent 工具集;关键节点强制暂停等待人类确认。
  • 评测方式:端到端任务成功率、步数/成本效率、中间产物抽检、失败模式分类(检索失败/规划错误/工具误用/幻觉)——Agent 评测比单轮问答复杂一个量级。

原理与机制

为什么 Agent 能执行多步任务而单次生成不能:任务长度超过上下文与一次性推理的可靠性上限,ReAct 循环把长任务切成"短推理+工具验证"的小步,每步以工具返回的事实替代模型的想象,误差不再累积而是被外部事实不断校正。为什么金融场景必须人审闸门:Agent 的错误是级联的——第一步检索污染会传导到最后草稿,且自主循环会放大初始错误(越走越偏);金融输出的责任主体是人(署名、合规、诉讼),因此闸门不是效率妥协而是责任结构的必然。为什么权限边界是硬边界:Agent 的自主性以工具集为物理上限,"规则上禁止"不如"工具集里没有"可靠——资金操作类接口根本不暴露给 Agent,是从架构上消灭越权可能性。

图示

任务: "完成某公司尽调初稿"
  ↓ 规划: [工商核查 → 财报解析 → 涉诉/舆情 → 图谱关联 → 草稿]
┌──────── ReAct 循环 ────────┐
│ Reason: 下一步做什么         │
│ Act:    调用工具(检索/接口)  │
│ Observe: 结果入上下文(事实)  │
│ 反思: 结果异常→改路径        │
└────────────────────────────┘
  ↓ 闸门① 中间产物抽检(人)
  ↓ 草稿生成(标注"AI 初稿")
  ↓ 闸门② 人工审定签发
边界: 资金/客户操作接口不进工具集; 写操作分级鉴权

实例或案例

一个尽调初稿 Agent 的运行日志(教学化描述):输入"对 X 公司出尽调风险清单初稿"。Agent 规划五步;执行中工商接口返回的股东名与知识图谱实体对齐失败(名称变更未同步),Agent 反思后改用统一社会信用代码重查,对齐成功;财报解析工具输出三表指标后,它发现经营现金流与净利润严重背离,自主追加一步"检索该公司公告中的解释",把免责性说明原文引用进清单;最后生成草稿,每条风险挂证据链接。闸门①人工抽检发现一处:Agent 把一家同名小公司的涉诉记录并入了清单(实体对齐残留错误)——人工剔除后在闸门②由分析师定稿。整个案例展示了 Agent 的真实形态:效率显著、错误仍在、闸门必需。

常见误区

  • 误区一:Agent 越自主越先进。 自主性必须与任务风险等级匹配;金融对外输出的任务,自主循环的范围、步数上限与人审节点都应显式设计,"全自动"是营销话术不是工程标准。
  • 误区二:Agent 能力=模型能力。 Agent 的上限常被工具质量卡死(检索脏、接口不稳、Schema 含糊),工程重心在工具与评测而非换更大的模型。
  • 误区三:金融场景可以直接全自动跑通。 级联错误+责任归属决定了人审闸门与权限硬边界是结构性必需(见 kp-024 与 kp-026)。

自测题

  1. Agent 四组件与 ReAct 循环各是什么?

答案要点:LLM/规划/工具/记忆;Reason→Act→Observe 循环,用工具事实校正推理路径。

  1. 为什么金融 Agent 的权限边界要用"工具集不暴露"而非"提示词里禁止"?

答案要点:工具集是自主性的物理上限,提示约束可被绕过;架构级排除才是可靠边界。

  1. Agent 评测与单轮问答评测的差异?

答案要点:端到端成功率+效率+中间产物抽检+失败模式归因,复杂度高一个量级。

公式或模型

本节不适用:Agent 是系统架构概念,无单一核心公式;其组件所用技术(检索相似度、结构化校验)分别见 kp-021、kp-022。

与其他知识点的关系

kp-021/kp-022 是 Agent 最常用的两类工具层;kp-024 的红线设计决定 Agent 可做与禁做的任务域;kp-009 的人机分工原则是 Agent 闸门设计的思想来源;kp-026 要求 Agent 类应用纳入模型风险管理框架。

延伸阅读

  • Yao et al.(2023):"ReAct"——推理与行动结合的代表论文。
  • Schick et al.(2023):"Toolformer"——模型自学调用工具的早期工作。