AI×金融知识站
–

kp-005 · 研报抽取:文档解析、信息抽取与摘要

核心 模块:智能投研 预计 25 分钟 更新 2026-10-02

一句话定义

研报抽取是把券商研报、公告等非结构化文档自动转化为结构化数据与摘要的技术链路,包含文档解析、信息抽取与摘要生成三个环节,是智能投研的地基工程。

为什么重要

投研人员每年面对数以十万计的研报与公告,阅读是最大时间成本;而大模型时代"文档进、结论出"的想象,恰恰卡在最不性感的一环——解析。PDF 双栏排版、表格跨页、图表嵌入文字,会让"复制粘贴"得到乱序文本,下游模型再强也输在脏输入上。掌握本知识点,能判断一份"智能研报系统"方案的工程含金量:是演示级(只处理干净文本)还是生产级(处理真实版式),并能读懂抽取质量报告里的指标含义。

前置知识

kp-002(时点数据与文本噪声概念)。

直观类比

研报抽取像拆快递再入库:解析是拆包装(把 PDF 拆成带位置信息的元素),抽取是把商品登记造册(公司、指标、评级各归其位),摘要是写一张货品便签(几十字说清这箱是什么)。任何一步把商品压坏了或登记错行,后续的检索与分析都会错。

核心概念

  • 文档解析(document parsing):版面分析(layout analysis,识别标题/正文/表格/图/脚注区域)、阅读顺序还原(双栏 PDF 按栏读而非按行读)、表格结构识别(还原行列与合并单元格)、公式与脚注处理。
  • 信息抽取(information extraction):命名实体识别(NER——公司、人名、指标名)、关系抽取("目标价—公司—机构"三元组)、事件抽取(评级上调、盈利预告、高管变动)、数值归一化("3.5 亿"→350000000,注意单位与币种)。
  • 摘要生成(summarization):抽取式摘要(摘原句,忠实但生硬)与生成式摘要(改写,流畅但有幻觉风险);LLM 时代的典型方案是"分段要点+全文摘要"两级生成,并要求引用原文位置。
  • 评测指标:抽取用精确率(Precision,抽出的对不对)、召回率(Recall,该抽的漏没漏)、F1;摘要用 ROUGE(与参考摘要重叠度,仅作粗筛)加人工忠实性评审(数字是否与原文一致)。

原理与机制

方法演进四阶段:规则模板(正则+词典,准但脆,版式一改就崩)→ 统计机器学习(CRF 做 NER,需人工特征)→ 预训练模型(BERT 微调做 NER/分类,标注需求降至千级)→ LLM(少样本提示直接抽取,标注成本再降,但引入幻觉与成本问题,需结构化输出校验)。生产系统的现实形态是混合管线:解析层用专门的版面模型(规则+视觉模型兜底),抽取层 LLM 主力+规则硬校验(数值必须能在原文找到出处),摘要层生成后过忠实性检查(关键数字逐项比对原文)。为什么数值校验如此重要:研报的核心价值在数字,而 LLM 最容易错的恰是数字(抄错、算错、编造),因此"每个数字可溯源到原文片段"是生产级系统的硬验收项。

公式或模型

Precision = 抽对的数量 / 抽出的总数量
Recall = 抽对的数量 / 应抽的总数量
F1 = 2PR / (P + R)
ROUGE-N:生成摘要与参考摘要的 n-gram 重叠率(仅作粗筛)

图示

PDF/Word ─→ 版面分析 ─→ 阅读顺序还原 ─→ 表格识别
                                        │
                    结构化文本(带坐标/来源页码)
                                        │
        ┌───────────────┼───────────────┐
      NER/关系/事件抽取   数值归一化      LLM 摘要生成
        └───────────────┼───────────────┘
                 校验层(数字溯源/schema 校验)
                        │
              结构化库 + 摘要库 → 投研检索

实例或案例

某券商研究所的研报结构化系统处理一份 30 页深度报告:解析层识别出双栏正文、6 张跨页表格与 40 余个脚注,按栏还原阅读顺序;抽取层输出"公司—评级—目标价—核心假设"结构化记录,其中"目标价 58.60 元"经溯源校验确认出自第 2 页表格而非摘要段;摘要层生成 3 段式要点并附原文定位。上线后分析师检索"某公司历次评级调整及目标价变化"从人工翻查约 40 分钟降到秒级,但系统明确标注"AI 摘要,分析师签发前须人工复核"——抽取可自动化,判断与署名仍归人。

常见误区

  • 误区一:PDF 转文本等于解析完成。 丢掉版面与表格结构的纯文本会破坏语义(表格行错乱、双栏串行),下游模型基于错误输入无法修复。
  • 误区二:ROUGE 高代表摘要可靠。 ROUGE 只度量与参考摘要的词面重叠,不能发现数字编造;生产验收必须加数字溯源与人工忠实性评审。
  • 误区三:抽取准确率 95% 可以直接用。 要看错误分布:如果把"上调"抽成"下调"这类方向性错误率哪怕 2%,进入下游信号也会造成实质误导;验收要看分项错误类型而非总 F1。

自测题

  1. 研报抽取的三个环节是什么?各自的关键难点?

答案要点:解析(版面/双栏/表格)、抽取(NER/关系/事件/数值归一)、摘要(忠实性与幻觉控制)。

  1. 为什么"数字溯源"是生产级系统的硬验收项?

答案要点:研报价值在数字且 LLM 易在数字上出错,每个数字须可回溯到原文片段才能进入下游。

  1. 抽取式与生成式摘要的取舍是什么?

答案要点:抽取式忠实但生硬;生成式流畅但有幻觉风险,需配引用与忠实性校验。

与其他知识点的关系

kp-006 是研报抽取的近邻场景(对象换成财报,多了三表勾稽约束);kp-009 把本知识点嵌入完整投研管线;kp-021 的 RAG 检索质量直接依赖本知识点的解析与结构化质量;kp-024 的幻觉防护为摘要环节提供红线设计。

延伸阅读

  • 《Speech and Language Processing》Jurafsky & Martin:NER、关系抽取与摘要的系统教材。
  • LayoutLMv3 论文(Xu et al.,2022):文档版面与文本联合建模的代表工作。