英文题目:FinCall-Surprise: A Large Scale Multi-modal Benchmark for Earning Surprise Prediction
会议身份:
conference:acl:2026:conference-paper-id:2026.acl-long.610
✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。
标签:#基准测试 #数据集 #基准设计 #语音 #音频分类
评分:6.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准
👥 作者与机构
- Dong Shu:机构信息未能从会议 PDF 纯文本可靠映射
- Yanguang Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Huopu Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Mengnan Du:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为季度电话会议的文字转录、完整语音录音与配套演示幻灯片,输出为下一季度每股收益相对一致预期的正向或负向意外,难点在于需跨季度前瞻预测且真实分布中正样本占优导致多数类偏置。在方法链上,首先按季度报告期对齐三模态并筛选大规模美股电话会议形成2688个完整样本,其次以标准化意外盈余阈值0.50生成二分类标签并剔除微小意外样本,该标签输出进入统一指令评测。然后针对文本长度与多模态差异设计截断加算子分段摘要与模态定制提示,使26个单模态与多模态大模型在同一协议下生成可解析的正负标签。与已有收费纯文本或不完全开源资源相比,其关键机制差异在于提供可公开获取的逐词对齐多模态同步证据,从而可检验语调与视觉信号的增益与失效。在FinCall-Surprise基准下,音频文本模型Qwen-2.5-7B的准确率为0.84,高于通用文本模型Qwen-2.5-14B的0.80。上述结论适用边界受限于2019年至2021年美国市场与显著意外样本,对小盘股与连续幅度预测尚未验证。全部基线评测的硬件为单张80GB显存的NVIDIA A100 SXM4,推理开销仅以半精度加载官方默认配置完成。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
投资者真正要猜的是什么,为什么电话会值得研究?
输入是本篇论文的全文证据与两张官方原图,目标是让刚进入语音或音频方向的研究生能复述该基准的构造与评测方法,必须保留的信息包括数据规模与年份分布、3 模态对齐方式、标签计算规则、输入预处理与评测指标,输出是 1 篇可核对的技术解读。
盈利超预期预测要回答的是下一季度实际每股收益是否会显著偏离分析师一致预期,白话说就是财报公布前猜超预期还是低于预期。猜对有直接交易价值,猜错则对应股价方向性风险,所以这是一个高风险二分类任务。电话会之所以值得研究,是因为它同时包含管理层陈述和与分析师问答,前者给出业绩解释与前瞻指引,后者通过追问暴露管理层信心与业务细节。
初学者容易把这个任务简化为把转录文本丢给大语言模型做情感分类。论文强调人类分析师不只看说了什么,还听怎么说,并看幻灯片上的数字与图表。语气迟疑、语速变化、被引用的收入拆分表,都可能改变对同一句话的理解。这就引出本文的学习依赖:先理解预测目标与标签来源,再看 3 模态如何采集对齐,再看长文本与多图音频如何被截断送入模型,最后才谈准确率与宏平均指标为何会讲出相反的故事。
同任务、同输入的已有路线卡在哪里?
在同输入同目标这条线上,早期方法用线性回归和逻辑回归处理财务报表变量,之后支持向量机、随机森林和梯度提升能同时处理上 100 个财务变量,再之后循环神经网络引入非结构化文本。近期大语言模型路线把电话会转录、新闻和研报喂给模型抽取情绪与前瞻陈述,做法是文本提示加分类输出。按论文梳理,这条线的瓶颈不是模型变大,而是数据集停留在单模态文本,声音和幻灯片信号没有被系统纳入训练与评测。
在数据集这条线上,金融问答、股票预测、欺诈检测和情绪分析已有不少开源数据,但盈利超预期方向长期依赖收费商业库与付费接口。已有电话会转录数据集要么不完全开源,要么只有文本。同期多模态金融数据集开始出现,但多聚焦图表理解或事实核查,不是为季度盈利方向预测设计的事件级 3 模态对齐数据。
因此本文的定位不是提出新模型结构,而是补一个缺失的运行阶段资源:同一场电话会同时有逐词转录、完整音频和当次引用幻灯片,并配好下一季度盈利方向标签。这样后续工作才能在相同事件上比较纯文本、图文与音频 3 种输入,而不是用不同来源的数据拼凑结论。
预测目标如何从连续偏离变成二分类标签?
一个样本对应一家公司 1 次季度电话会,输入是该时点可获得的电话会内容,目标是约 3 个月后该季度实际每股收益相对一致预期的方向。论文说明输入转录与目标盈利事件之间平均间隔约 3 个月,这意味着模型不能靠记忆财报数字作答,必须从管理层表述与问答中推断未来业绩走向。
标签不是人工主观标注,而是来自外部数据库的报告每股收益与分析师预测。做法是取电话会后一个月内最新有效预测的均值作为一致预期,再用预测标准差做标准化,得到标准化未预期盈余。阈值取正负 0.5,大于 0.5 记为正类,小于负 0.5 记为负类,中间绝对值较小的样本直接丢弃,因为这类微小偏离通常市场反应弱且可能受盈余管理干扰。
盈利超预期 × 标准化未预期盈余: 盈利超预期分工是给出预测目标:下季度实际每股收益是否显著高于或低于分析师一致预期;标准化未预期盈余分工是给出可计算的操作定义,用报告每股收益减去估计均值再除以估计标准差来消除分歧度影响;二者搭配的原因是市场反应更看方向而非连续数值大小,组合意义是把连续的盈余偏离转化为阈值过滤后的二分类标签供模型学习和评测。
举例说明只是帮助理解的例子:若某公司报告每股收益高于一致预期较多且分析师分歧不大,标准化值会较大,超过阈值则落入正类;若低于预期较多则落入负类。论文强调市场反应更多看方向而非精确幅度,所以把连续值二值化是刻意选择,不是信息丢失的疏忽。初学者复述时要说清三点:一致预期取电话会后可修正的预测、标准化分母是预测标准差、中间带被排除。
从选公司到三模态对齐,全流程先走一遍
全流程可以沿一个样本走一遍:先确定这家公司是否进入候选池,再为它的某次季度电话会分别抓文本、音频和幻灯片,最后按季度报告期把三者对到同一事件并打上盈利方向标签。公司池限定为美国上市且规模与流动性足够大的公司,文本主要从公司官网抓取,转录保留操作员、高管和分析师的说话人标识,音频同样从官网抓取并用外部平台做标识同步,幻灯片从新闻与公司网站等多源收集。跨源一致性靠季度报告期对齐加电话会标题交叉核对完成。
下图是理解该流程最直接的依据,阅读时先看左右两大虚线框的分工,再看中间同步关系。
看图路径: 1. 先从左侧公司池框沿箭头走到右侧网络爬取节点,确认主路径是先选公司再采三模态;2. 再看中间三个外部参照源与同步箭头的连接方式,区分主数据源与对齐用参照;3. 最后对照右侧三个产物框,确认每场电话会都应有文本、音频和幻灯片三路输出
论文图 1。原论文 Figure 1:“Overview of our data construction pipeline, which consists of two stages: (a) Firm Collection (left): We select large, publicly traded US firms based on market capitalization (>…”。
该图左侧虚线框是公司收集,给出全部美国上市公司经市值与交易量筛选后的候选范围,并用常见大公司图标示意不是只收小公司。右侧大框是数据收集,从网络爬取节点分出 3 路,分别经外部参照源到达音频、文本转录与幻灯片产物。图中明确画出同步箭头,含义是文本日期与音频标识、幻灯片归属需要互相校准,而不是各自独立下载就能直接配对。
右侧文本示例保留了操作员、高管和分析师 3 类发言,右侧产物同时出现声波图与多页图表缩略图,直观表达每场电话会都要求 3 种模态齐备。这种设计把构造责任放在事件对齐上,后续任何模态缺失的样本都不应视为完整基准样本。
三种模态各自提供什么表示,标签公式如何计算?
文本模态的表示是带说话人标识的逐词转录,平均每场约 8600 词,结构固定为操作员开场与收尾、高管陈述业绩与展望、分析师提问深挖。音频模态是全程录音,平均约 3700 秒,与文本是同一语言内容的不同载体,额外携带语气与停顿。视觉模态是当次引用的演示幻灯片,平均约 27 页,原文件为演示文档格式,评测时需转成图像。
文本转录 × 音频记录: 文本转录分工是保留说了什么的逐词内容,包括操作员、高管和分析师的发言与问答结构;音频记录分工是保留怎么说的副语言信号,如语气、节奏和迟疑;二者搭配的原因是人类分析师同时依赖语义和发声信心判断,组合意义是在同一场电话会事件上对齐两种来源,让基准能检验只看文字的模型是否漏掉了声音中的不确定性。
演示幻灯片 × 视觉语言模型: 演示幻灯片分工是提供被高管引用的图表、数字和结构化上下文,弥补口头引用图表时文字不完整的问题;视觉语言模型分工是同时接受转录文本和幻灯片图像并做联合推理;二者搭配的原因是电话会讨论经常指向第几页的收入拆分或指引表,组合意义是考查模型能否把图像中的财务证据与文本论述对应起来再做预测。
标签计算先解释符号:报告每股收益是实际公布值,估计均值是分析师预测均值,估计标准差是分析师分歧程度。计算目标是得到消除分歧量纲后的偏离程度,再用阈值做二分类。原文给出的核心计算如下,符号含义见上文,阈值取 0.5。
\[ES = EPSreported −Avg(EPSestimated)\]该公式的输入来自外部盈利数据库而非电话会本身,监督来源独立于模型输入文本,这避免了用输入直接构造标签的泄漏问题。公式只定义连续偏离,离散化与丢弃中间带的规则在正文另行说明。复述时不要把公式说成模型结构,它是数据标注规则,不是神经网络前向计算。
本研究训练了什么,没有训练又实际做了哪些计算?
本研究没有训练新的盈利预测模型,26 个基线模型全部沿用官方配置加载推理,精度设为半精度以节省显存,未改其他默认参数。因此该节没有梯度更新、优化器步骤或参数冻结与解冻的对照,论文也未报告训练损失曲线。若把直接加载推理误认为本研究做了微调,会错误归因性能来源。
实际发生的计算是数据构造与评测输入准备。文本侧因为最小上下文窗口只有约 30,000 词元,统一把输入上限设为 3.1 万并预留指令空间,约 20% 转录超限。对超限文本采用按说话人分块的保守迭代压缩:先切出操作员、高管和分析师块,优先压缩程序性最强的操作员块,每压缩一块重算总词元数,低于阈值立即停止,若仍超限再动高管块最后才动分析师块。压缩工具用轻量可靠的摘要模型,词元计数用公开分词库,原全文仍会发布以支持更大上下文模型。
下图把该压缩过程画得很具体,阅读时重点看谁先被压缩以及何时停止。
看图路径: 1. 先看左侧示例面板中三种说话人颜色块与底部输出标签的对应关系;2. 再沿右侧操作员长块到短块的替换箭头,确认优先压缩的是哪类发言;3. 最后看底部停止或继续的判断条,确认迭代何时停止
论文图 2。原论文 Figure 2:“Illustration of our summarization pipeline.”。
该图左侧是数据示例,输入是多轮说话人交替的长文本,输出是正或负的盈利方向标签。右侧是压缩流水线,长文本先按说话人分组为长块,再经模型变成短块并替换回原文。底部判断条写明若总词元数小于等于上限则停止,否则继续,右侧竖箭头强调这是迭代过程。像素可见操作员块最先进入压缩分支,高管与分析师块排在后面,含义是尽量保留财务实质讨论。这种安排的理由在正文明确写出:操作员多为开场收尾的程序性对话,信息损失最小。
图文侧把每页幻灯片转成图像并随机抽三页内容页,首尾标题与致谢页被排除;音频侧故意不给转录文本,以隔离模型对声音信号的理解能力。
评测比较了谁,输入与指标条件是否一致?
比较对象共 26 个模型,分 4 组:通用纯文本组、金融微调纯文本组、图文组、音频组。通用组处理纯文本,金融组是在金融语料上微调过的文本模型,图文组同时看幻灯片图像与文本,音频组只听音频不看文本以检验声音推理。这种分组让读者能区分增益来自更大参数、领域微调还是新增模态。实现条件统一为单卡大显存、官方默认配置加半精度加载,保证跨模型可复现。
提示结构跨模态保持可比:都要求模型先给一两句理由再按固定格式输出正或负,格式解析失败计为错误,因为指令遵循被视为能力的一部分。文本输入拼接为指令加转录加答案格式,图文输入为图像加指令加转录加答案格式,音频输入为音频加指令加答案格式。指标同时报告准确率与宏平均精确率、召回率、F1,方向都是越高越好,但后三者在正负类上等权,可防止多数类主导结论。
准确率 × 宏平均 F1: 准确率分工是统计所有样本中猜对的比例,直观但在正负不平衡时会被多数类主导;宏平均 F1 分工是对正类和负类分别算精确率召回率再平均,让少数负类与多数正类权重相等;二者搭配的原因是真实盈利数据天然正多负少,组合意义是用准确率看表面可用性、用宏平均指标揭穿只猜正类也能得高分的假象。
下表整理数据规模与评测资源条件,阅读问题是基准有多大、输入要处理多长、运行在什么硬件上。表前已说明比较维度与公平条件,表中数字保留原文写法。
| 条件 | 指标 | 2019 | 2020 | 2021 |
|---|---|---|---|---|
| 电话会场次 | 样本数 | 919 | 704 | 1065 |
| 全基准规模 | 样本数 | 2688 | 2688 | 2688 |
| 文本长度 | 平均词数 | 8600 | 8600 | 8600 |
| 幻灯片 | 平均页数 | 27 | 27 | 27 |
表后解释需要强调代价与边界:规模大且 3 模态齐备是优势,但年份分布不均且文本平均长度接近大模型上下文上限,意味着约 20% 样本必须经过摘要压缩,压缩本身可能抹掉问答细节。硬件条件是单卡运行,半精度主要影响速度与显存而非任务定义。公司筛选限定大市值高流动性,结论外推到小公司时需谨慎,因为小公司电话会结构与分析师覆盖可能不同。
高准确率为何是假象,谁的预测更平衡?
主结果要回答的第一个问题是准确率能不能信。论文报告 26 个模型中有 15 个准确率超过 70%,若只看准确率会以为任务已被解决。但数据天然偏向正类,多数模型偏向猜正类,宏平均精确率召回率与 F1 多在五成五以下。年份越往后正类比例越高,2021 年正类占比最高,此时只猜正类也能把准确率推高,但精确率召回率并不跟涨,说明提升来自分布偏移而非推理变强。
第二个问题是闭源模型为何准确率反而低。图文组中闭源系列最高准确率约 0.69,低于部分开源模型的 0.82,但其宏平均精确率与召回率几乎每年最高。人工检查发现开源模型多默认输出正类,闭源模型正负分布更平衡,避开了多数类偏置。论文把这种低准确率高平衡性解读为更稳健的财务推理倾向,而不是能力更差。初学者要记住数值相同不是同一指标的证据,准确率与宏平均 F1 不能互相替代。
通用文本模型 × 金融微调模型: 通用文本模型分工是检验大规模预训练保留的通用语言理解和指令遵循能力;金融微调模型分工是检验在金融语料上继续训练是否带来领域增益;二者搭配的原因是要分离领域知识与基础能力退化的影响,组合意义是解释为何部分金融微调模型准确率反而极低:领域适配可能以牺牲格式遵循和通顺生成为代价。
下表聚焦可运行策略之间的关键数字对比,比较问题是在相同事件上加图像或音频是否稳定提升,指标方向都是越高越好,但需同时看准确率与平衡性。
| 条件 | 指标 | 通用文本 14B | 图文 7B | 音频 7B | 未胜出项 |
|---|---|---|---|---|---|
| 整体 | 准确率 | 0.80 | 0.82 | 0.84 | 金融微调 12% |
| 整体 | 超 70% 模型数 | 15 | 15 | 15 | 金融微调 10% |
| 趋势 | 多模态增益 | 基线 | 小幅提升 | 小幅提升 | 部分图文音频下降 |
| 平衡性 | 宏平均 F1 | 约 0.50 | 约 0.48 | 约 0.47 | 多数低于 0.55 |
| 闭源 | 准确率 | 未参评 | 0.69 | 未参评 | 准确率低但更平衡 |
表后解释要同时讲收益与反例:同系列中小参数多模态模型超过大参数纯文本模型,支持视觉与听觉能提供文本之外的互补信号。但反例同样重要,更大图文模型在部分系列上从 0.78 掉到 0.58,音频组中个别模型只有 0.54 与 0.34,说明新增模态也可能引入噪声。金融微调组中 2 个模型整体准确率仅 10% 左右,未胜出且存在格式不遵循与生成退化,不能因为名字带金融就默认更强。
拿掉文本或只加三页幻灯片会发生什么?
论文没有传统消融训练,但 3 组输入设计本身构成模态对照:纯文本是基线,图文是在文本上加三页幻灯片,音频是拿掉文本只留声音。测的是新增或移除信息通道后预测是否变化,条件是同一批电话会事件与同一提示要求,只是输入形态不同。
结果显示图文与音频都不是稳定增益。在同系列比较中,加图像或换成音频带来 2 到 4 个百分点的准确率上升,但跨系列看图文大模型反而大幅下降,音频组方差极大。这支持一个有限结论:互补信号存在,但当前多模态模型缺乏稳健跨模态财务理解,文本与图像音频未能有效融合。幻灯片只随机抽三页且排除首尾页,信息本就不全;音频不给文本则完全依赖语音理解,对长达 1 小时的电话会是极难任务。
失败分析进一步拆开金融微调模型的 3 种表现:倾向猜负类、未按指定格式输出、生成重复或不通顺句子。论文推测过度在狭窄金融数据上微调可能损伤通用语言与指令遵循能力。复述时要用报告与推测的措辞区分:格式失败与低分是直接报告,微调损伤通用能力是论文给出的可能解释而非已验证因果。未评测的边界包括不用摘要的更大上下文模型、不抽样而用全册幻灯片、不转文字的长音频切分策略,这些都留给后续工作。
类别不平衡与采样截断带来哪些明确限制?
第一个限制是类别天然不平衡。正类显著多于负类是真实市场分布,基准保留它是为求真实,但评测必须同时看宏平均指标,否则会奖励只猜正类的偷懒策略。论文明确建议后续若用于训练,可考虑上采样、下采样或现代平衡策略,但本文评测阶段未做平衡处理,结论是在不平衡分布下得到的。
第二个限制是输入截断与采样。文本超限要压缩且优先动操作员块,虽保守但仍可能损失细节;幻灯片只抽三页,图表证据不完整;音频时长平均 1 小时,现有音频语言模型能否稳定处理长程财务论述仍存疑。这些预处理是为适配当前模型上下文与图像数量上限,不是任务本身的要求。
第 3 个限制是时间与公司范围。数据覆盖 2019 到 2021 年,大市值高流动性美国公司为主,跨年份分布变化大,2021 年更不平衡。把结论推广到其他年份、其他市场或小公司前,需要补验证。缺失证据不是技术错误,没有测量的延迟、成本与误判代价不应被承诺为已改善。
要复现基准,先准备什么,再跑什么?
先准备数据与标签口径:按公司市值大于 10 亿美元、日均交易量大于 5000 万美元筛选公司池,为每季度电话会收集官网转录与音频、多源幻灯片,再按季度报告期与标题对到同一事件。标签需从外部盈利库取报告每股收益与电话会后一个月内最新预测,用均值与标准差算标准化偏离,阈值正负 0.5 过滤中间带。转录保留说话人标识,幻灯片保留原文件,音频保留全程文件。
再准备评测输入:文本统一留 31,000 词元上限并预留指令空间,超限按操作员、高管、分析师顺序迭代压缩并重算词元;幻灯片每页转图像后随机抽三页内容页;音频单独送入不配文本。提示要求模型输出一两句理由加固定格式的正或负,解析失败计错。模型加载用官方默认配置加半精度,硬件参考为单卡大显存。指标同时算准确率与宏平均精确率召回率 F1,分年份与总体汇报。
关于可用性必须谨慎表述:论文正文给出开源仓库链接,但本次收到的资源状态没有完成可达性验证,因此不能声称代码、模型或数据当前已公开可下载。复现前应先确认链接本次是否可达,再核对发布内容是否包含元数据与转录、标签划分、评测脚本、对齐产物与预处理代码。若链接不可用,应报告具体缺项而不是假设数据已拿到。
何时值得尝试这个基准,还需补哪项验证?
当研究问题是长电话会中的财务推理、声音信心信号利用或图表与文本联合证据时,这个基准值得尝试,因为它把三者在事件级对齐好了,且标签来自独立盈利数据库而非主观标注。当问题只是短文本情绪分类或只需要最新财报数字时,不必用这么重的基准。
复述方法时抓住三句话:用阈值化标准化偏离定义方向并丢弃微小偏离,用季度与标题双重对齐保证 3 模态同属一场电话会,用截断与抽样把长输入装进当前模型。评价结果时抓住两组对照:准确率与宏平均 F1 必须一起看,开源高准确率多来自猜正类,闭源低准确率反而更平衡;同系列小多模态模型小幅超过大纯文本模型,但跨系列多模态经常退化。
还需补的验证包括平衡采样后的稳健性、全册幻灯片与更大上下文下的表现、长音频切分与转录辅助策略的对比,以及跨年份与跨市值外推。只有补了这些,才能判断多模态增益是真实财务理解还是特定预处理与分布下的偶然现象。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

