AI×金融知识站
–

kp-009 · 智能投研工作流:从数据到研究结论的管线

核心 模块:智能投研 预计 25 分钟 更新 2026-10-02

一句话定义

智能投研工作流把采集、清洗、抽取、检索、分析、写作与复核组织成一条可复现的管线,核心设计原则是"AI 提素材与假设、人做判断与签发",本知识点给出管线的完整形态与分工边界。

为什么重要

前几个知识点分别解决了单项能力(抽取、财报、舆情、图谱),但单项能力的堆叠不等于可用系统——投研产出的本质是有署名责任的判断,任何环节的幻觉或口径错误都会污染最终结论。工作流视角回答的是集成问题:各能力以什么顺序衔接、在哪些点插入校验与人工闸门、错误如何回溯、知识如何沉淀。它也是评估市面"智能投研产品"的最佳框架:凡是讲不清人工闸门与可复现性的产品,都不具备生产资格。

前置知识

kp-005、kp-006、kp-007(管线各段的单项能力)。

直观类比

投研管线像中央厨房:洗菜切配(清洗与抽取)可以高度自动化,配菜备料(检索与证据汇编)半自动,掌勺(分析判断)必须是持证厨师,出菜前的品控(复核签发)是最后一道闸门。中央厨房的卫生规范(留痕、批次、可追溯)对应研究流程的可复现要求——同一份原材料必须能做出同一道菜。

核心概念

  • 管线七段:数据采集 → 清洗与标准化 → 结构化(抽取/指标/图谱)→ 证据检索(关键词+向量混合)→ 分析与假设生成 → 报告草稿生成 → 人工复核与签发。每段有独立的输入输出契约与失败处理。
  • 人机分工原则:AI 负责"广度与速度"(全量阅读、交叉比对、格式化产出),人负责"判断与责任"(假设取舍、结论签发、对外署名)。可委托的是劳动,不可委托的是判断。
  • 证据链与可溯源:报告草稿中每个事实性陈述须挂接证据(原文片段、表格数值、图谱边),复核即沿证据链抽验;这是对 kp-024 幻觉问题的流程级防护。
  • 可复现性:同一时间点、同一数据版本、同一模型版本能重产出一致结果——需要数据快照、提示词与模型版本管理(类似代码的版本控制)。
  • 工具链分层:数据终端与行情源、文档处理服务、检索与向量库、LLM 网关(统一鉴权、审计、成本计量)、评测集与回归测试、知识库(公司池、模板库、历史报告)。

原理与机制

为什么"全自动写研报"不可交付:研报的产出物是对外署名的研究观点,法律与合规上责任主体是人;且投资判断依赖不可完全编码的语境(管理层可信度、政策风向),LLM 只能压缩阅读成本、不能承担判断责任。为什么必须建评测集:管线任何一段(换模型、改提示词、换数据源)的改动都可能让下游退化,只有固定的"金标样本+自动评分"(如抽取 F1、引用准确率、数字一致性)才能守住质量底线——这与软件的回归测试同构。为什么复核要沿证据链抽验而非通读:LLM 生成的错误集中在事实性陈述(数字、日期、主体),人工通读对这类错误命中率低,按证据链逐项核对是更高杠杆的质检方式。

图示

[采集] 行情/公告/研报/舆情/图谱
   ↓ 清洗·标准化(口径/时点)
[结构化] 抽取 · 指标 · 事件 · 图谱
   ↓
[检索] 关键词 + 向量混合 → 证据包(带来源)
   ↓
[分析] 假设生成(多方案并列) ── 人工闸门①: 取舍
   ↓
[写作] 模板+LLM 草稿(每句挂证据)
   ↓
[复核] 证据链抽验 + 数字一致性 ── 人工闸门②: 签发
   ↓ 归档(数据快照/提示词版本/模型版本)
[沉淀] 评测集迭代 · 模板库 · 公司池

实例或案例

一份行业深度报告的 AI 辅助生产:分析师确定研究问题后,管线两小时内完成行业 200 份年报的财务指标抽取、近三年 5000 条公告的事件结构化、政策文本的要点汇编,并生成带证据引用的初稿框架;分析师在闸门①筛选出三条值得展开的假设,随后按证据链复核初稿中的 47 处数字(发现 2 处来自旧版数据,已修正),在闸门②修改结论并签发。全程约一天半,同等质量纯人工约需一周。效率提升来自"广度自动化",而观点与责任始终在人——这是当前技术条件下人机分工的稳态。

常见误区

  • 误区一:把 AI 生成的草稿当研报交付。 缺少证据链与人工签发的草稿在合规与质量上都不可交付;AI 产出物在流程中的身份是"素材"而非"成果"。
  • 误区二:只建管线不建评测集。 没有回归测试的管线在每次模型或提示词更新后质量不可知,退化是静默发生的。
  • 误区三:认为自动化等于取消复核。 复核从"通读全文"变为"证据链抽验",工作量下降但不可归零;抽验比例应随错误率数据动态调整。

自测题

  1. 管线七段是什么?两道人工闸门各把守什么?

答案要点:采集/清洗/结构化/检索/分析/写作/复核;闸门①假设取舍、闸门②结论签发。

  1. 可复现性需要管理哪些版本?

答案要点:数据快照、提示词版本、模型版本,三者共同决定产出,缺一不可复现。

  1. 为什么复核要按证据链抽验?

答案要点:LLM 错误集中在事实性陈述,逐项核对证据比通读更能命中错误,质检杠杆更高。

公式或模型

本节不适用:工作流为流程集成知识点,涉及的度量指标(抽取 F1、引用准确率)已在 kp-005、kp-021 中定义。

与其他知识点的关系

kp-005/006/007/008 是管线各段的单点能力;kp-021 的 RAG 是"证据检索"段的架构展开;kp-024 是复核闸门的风险设计依据;kp-026 要求整条管线纳入模型风险管理。

延伸阅读

  • CFA Institute 关于 AI 与投资管理的研究报告系列:投研人机分工的行业视角。
  • 《Advances in Financial Machine Learning》Marcos López de Prado:金融数据科学的流程纪律。