kp-005 · 研报抽取:文档解析、信息抽取与摘要
一句话定义
研报抽取是把券商研报、公告等非结构化文档自动转化为结构化数据与摘要的技术链路,包含文档解析、信息抽取与摘要生成三个环节,是智能投研的地基工程。
为什么重要
投研人员每年面对数以十万计的研报与公告,阅读是最大时间成本;而大模型时代"文档进、结论出"的想象,恰恰卡在最不性感的一环——解析。PDF 双栏排版、表格跨页、图表嵌入文字,会让"复制粘贴"得到乱序文本,下游模型再强也输在脏输入上。掌握本知识点,能判断一份"智能研报系统"方案的工程含金量:是演示级(只处理干净文本)还是生产级(处理真实版式),并能读懂抽取质量报告里的指标含义。
前置知识
kp-002(时点数据与文本噪声概念)。
直观类比
研报抽取像拆快递再入库:解析是拆包装(把 PDF 拆成带位置信息的元素),抽取是把商品登记造册(公司、指标、评级各归其位),摘要是写一张货品便签(几十字说清这箱是什么)。任何一步把商品压坏了或登记错行,后续的检索与分析都会错。
核心概念
- 文档解析(document parsing):版面分析(layout analysis,识别标题/正文/表格/图/脚注区域)、阅读顺序还原(双栏 PDF 按栏读而非按行读)、表格结构识别(还原行列与合并单元格)、公式与脚注处理。
- 信息抽取(information extraction):命名实体识别(NER——公司、人名、指标名)、关系抽取("目标价—公司—机构"三元组)、事件抽取(评级上调、盈利预告、高管变动)、数值归一化("3.5 亿"→350000000,注意单位与币种)。
- 摘要生成(summarization):抽取式摘要(摘原句,忠实但生硬)与生成式摘要(改写,流畅但有幻觉风险);LLM 时代的典型方案是"分段要点+全文摘要"两级生成,并要求引用原文位置。
- 评测指标:抽取用精确率(Precision,抽出的对不对)、召回率(Recall,该抽的漏没漏)、F1;摘要用 ROUGE(与参考摘要重叠度,仅作粗筛)加人工忠实性评审(数字是否与原文一致)。
原理与机制
方法演进四阶段:规则模板(正则+词典,准但脆,版式一改就崩)→ 统计机器学习(CRF 做 NER,需人工特征)→ 预训练模型(BERT 微调做 NER/分类,标注需求降至千级)→ LLM(少样本提示直接抽取,标注成本再降,但引入幻觉与成本问题,需结构化输出校验)。生产系统的现实形态是混合管线:解析层用专门的版面模型(规则+视觉模型兜底),抽取层 LLM 主力+规则硬校验(数值必须能在原文找到出处),摘要层生成后过忠实性检查(关键数字逐项比对原文)。为什么数值校验如此重要:研报的核心价值在数字,而 LLM 最容易错的恰是数字(抄错、算错、编造),因此"每个数字可溯源到原文片段"是生产级系统的硬验收项。
公式或模型
图示
PDF/Word ─→ 版面分析 ─→ 阅读顺序还原 ─→ 表格识别
│
结构化文本(带坐标/来源页码)
│
┌───────────────┼───────────────┐
NER/关系/事件抽取 数值归一化 LLM 摘要生成
└───────────────┼───────────────┘
校验层(数字溯源/schema 校验)
│
结构化库 + 摘要库 → 投研检索
实例或案例
某券商研究所的研报结构化系统处理一份 30 页深度报告:解析层识别出双栏正文、6 张跨页表格与 40 余个脚注,按栏还原阅读顺序;抽取层输出"公司—评级—目标价—核心假设"结构化记录,其中"目标价 58.60 元"经溯源校验确认出自第 2 页表格而非摘要段;摘要层生成 3 段式要点并附原文定位。上线后分析师检索"某公司历次评级调整及目标价变化"从人工翻查约 40 分钟降到秒级,但系统明确标注"AI 摘要,分析师签发前须人工复核"——抽取可自动化,判断与署名仍归人。
常见误区
- 误区一:PDF 转文本等于解析完成。 丢掉版面与表格结构的纯文本会破坏语义(表格行错乱、双栏串行),下游模型基于错误输入无法修复。
- 误区二:ROUGE 高代表摘要可靠。 ROUGE 只度量与参考摘要的词面重叠,不能发现数字编造;生产验收必须加数字溯源与人工忠实性评审。
- 误区三:抽取准确率 95% 可以直接用。 要看错误分布:如果把"上调"抽成"下调"这类方向性错误率哪怕 2%,进入下游信号也会造成实质误导;验收要看分项错误类型而非总 F1。
自测题
- 研报抽取的三个环节是什么?各自的关键难点?
答案要点:解析(版面/双栏/表格)、抽取(NER/关系/事件/数值归一)、摘要(忠实性与幻觉控制)。
- 为什么"数字溯源"是生产级系统的硬验收项?
答案要点:研报价值在数字且 LLM 易在数字上出错,每个数字须可回溯到原文片段才能进入下游。
- 抽取式与生成式摘要的取舍是什么?
答案要点:抽取式忠实但生硬;生成式流畅但有幻觉风险,需配引用与忠实性校验。
与其他知识点的关系
kp-006 是研报抽取的近邻场景(对象换成财报,多了三表勾稽约束);kp-009 把本知识点嵌入完整投研管线;kp-021 的 RAG 检索质量直接依赖本知识点的解析与结构化质量;kp-024 的幻觉防护为摘要环节提供红线设计。
延伸阅读
- 《Speech and Language Processing》Jurafsky & Martin:NER、关系抽取与摘要的系统教材。
- LayoutLMv3 论文(Xu et al.,2022):文档版面与文本联合建模的代表工作。