英文题目:Earnings25: A Comprehensive 500-Hour Speech Benchmark for Finance

会议身份:conference:interspeech:2026:conference-paper-id:jiang26f_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#基准设计 #长音频处理 #语音 #语音识别

评分:8.1/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前25% | 文档类型:数据集与基准

👥 作者与机构

  • Denglin Jiang:机构信息未能从会议 PDF 纯文本可靠映射
  • Haoran Zhou:机构信息未能从会议 PDF 纯文本可靠映射
  • Anshul Wadhawan:机构信息未能从会议 PDF 纯文本可靠映射
  • Brendan Fahy:机构信息未能从会议 PDF 纯文本可靠映射
  • Vinay Ramesh:机构信息未能从会议 PDF 纯文本可靠映射
  • David Weisberg:机构信息未能从会议 PDF 纯文本可靠映射
  • Dmitriy Derkachevskiy:机构信息未能从会议 PDF 纯文本可靠映射
  • Helen Sheehan:机构信息未能从会议 PDF 纯文本可靠映射
  • Srivas Prasad:机构信息未能从会议 PDF 纯文本可靠映射
  • Michele Franceschini:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该基准输入为英语财报电话会议长音频,输出为转写文本及说话人角色与行业分层评估,难点在于财报术语密集、数字表达多变、准备稿与问答自发语音交织并伴随快速轮转与重叠。构建链条分为四步:先按地域与行业对全量通话做分层抽样以兼顾自然分布与均衡覆盖,再用联结时序分类模型做强制对齐得到词级时间戳,接着按时长约束贪心聚合为评估单元并做内容过滤去操作员套话,最后附加说话人、行业与公司元数据形成可复现划分。与SPGISpeech偏训练语料和Earnings-21/22缺行业均衡及角色标注相比,该工作把长程上下文保留与长尾术语暴露统一在一个可复用协议中。在testset-full基准下,Parakeet-tdt-0.6b-v2的WER为0.10837,低于Whisper-large-v2的WER 0.14039。结论仅适用于英语美国公司主导的财报场景,未验证多语言、强口音与高重叠问答下的外推能力。生物技术等长尾行业的误差显著偏高,其跨语种泛化有效性尚未验证且受限于英语财报场景。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

🧭 深度解读

输入是什么:财报电话会议为何难转写?

本解读的输入是论文原文提供的英文财报电话会议基准描述,目标是让刚进入语音领域的研究生能复述该基准如何构造、如何评分、在什么条件下得到基线结果。必须保留的信息包括两个测试集的规模与采样范围、对齐与切分动作、4 个词错误率变体的定义、基线模型与解码配置、以及数据获取方式与许可限制。输出是 1 篇按学习依赖展开的技术说明,不做超出原文的性能承诺。

财报电话会议,英文为 earnings calls,是上市公司每季度向分析师与投资者通报业绩并回答提问的电话会议录音。它的难点首先在说话方式上混合了两种形态:高管照稿宣读的准备性陈述,以及分析师临时提问与高管即兴回答的自发问答,中间伴随快速轮转、口头迟疑和问答环节的重叠。自动语音识别,英文为 automatic speech recognition,缩写为 ASR,任务是把连续语音波形转成词序列。通用模型在朗读或日常对话上表现较好,但在这类录音上会遇到金融缩写、公司与产品名、密集数字表达、电话压缩与背景噪声,以及来自不同国家高管的英语口音。论文把这种训练与测试分布不一致称为领域失配,并指出它是主要误差来源。

财报电话会议 × 自动语音识别: 财报电话会议负责提供输入,特点是脚本化陈述加自发问答交替、金融术语与数字密集、轮转快且有重叠;自动语音识别负责把该输入转成文字并接受词错误率检验,二者搭配的理由是通用语音数据缺少这类结构化口语,组合意义是只有在真实财报录音上测量才能暴露领域失配。

从一个样本的角度看,输入是一段约 1 小时的英文会议录音,包含操作员固定话术、高管陈述、多名分析师轮流提问。理想输出是带说话人切分与时间戳的文字记录,并附带行业、公司与角色元数据。评价不只看整篇转对多少词,还要能按角色与行业拆分误差,找出被平均指标掩盖的长尾失败。这就是后续要讲均衡采样与角色标注的原因。

已有路线解决了什么,还缺什么?

要理解新基准的位置,需要按相同输入、相同目标、相同监督与相同运行阶段对照已有工作。第一条路线是会话与会议语音基准,例如 Switchboard、CallHome 和 AMI。它们同样处理快速轮转、迟疑与重叠,输入也是多人对话录音。但论文指出,它们缺少金融术语、密集数字与财报特有的结构化流程,因此不能替代金融领域的测量。把会议基准的结论直接搬到财报上,会低估术语与数字带来的误差。

第二条路线是金融语音资源。SPGISpeech 在 2021 年发布并在 2025 年扩展,提供超过 5000 小时专业转写的财报音频,但论文将其定位为训练语料:划分中测试集约 2000 小时,规模过大,不适合受控、可复现的基准评测。Earnings-21 与 Earnings-22 则更接近开放评测,带有对齐文本与口音国家元数据,其中 Earnings-22 提供约 160 小时全球长音频。但论文报告了两个缺口:一是缺少行业均衡采样,高频行业主导平均指标,低频行业的问题被稀释;二是缺少说话人角色、行业分类与公司标识等结构化元数据,难以做细粒度误差分析与说话人感知评测。

对照的结论是:同为财报输入、同为识别目标时,Earnings25 的差异不在单纯扩大时长,而在补上均衡采样与元数据两块短板。它同时保留长音频的真实上下文,并用小而均衡的切片放大长尾。这种定位决定了后文的方法不是训练新模型,而是构造评测集并固定评分流程。

要测的具体问题是什么?

论文要测的问题可以表述为:在真实财报电话会议条件下,当前代表性语音识别系统在总体词错误率之外,是否在不同行业、不同说话人角色与不同通话结构下保持稳健。输入是英文财报录音,输出是文字假设,监督来源是人工参考转写及其对齐。运行阶段是测试阶段评测,不包含训练新声学模型。

举一个教学例子帮助理解,但例子中的数字仅为示意,不代表论文数据:假设某系统在高频的公用事业通话上错误很少,但在低频的生物技术通话上把专业术语连续转错,若按自然分布加权平均,总体错误率仍可能显得不高。例子说明平均数会掩盖分布偏斜,这正是论文要用均衡切片揭示的现象。论文明确指出,总体指标是按行业频率加权的,高产量且重复度高的行业会拉低总体平均,而按行业不加权观察时会突出更难的领域。

因此,问题包含 3 个可检验的子问题。第一,自然分布的长音频上基线能达到多少。第二,强制每个行业同等出现的均衡切片上是否更差,差多少。第三,术语密集的子行业是否显著偏离平均。这些问题直接对应后文的两个测试集与分行业示例表。

全景:两个测试集如何分工?

方法的全景是从超过 2100 通 2025 年美国财报电话中抽样,先做词级强制对齐,再聚合成评测单元,最终形成两个互补测试集。第一个测试集名为 testset-full,包含 498 小时完整英文标准普尔 500 成分股公司 2025 年第四季度财报通话,约 500 通完整录音,保留完整对话上下文,典型时长约 1 小时。第二个测试集名为 testset-segmented,是从 2025 年第一季度至第四季度超过 2000 通美国财报电话中有意抽出的 46 小时评测集,共 290 个片段,每个行业恰好一段,每段 5 至 10 分钟,用于均衡覆盖。

长音频评测 × 分段评测: 长音频评测负责保留约 1 小时完整通话的上下文、轮转与跨说话人动态,检验长时跟踪能力;分段评测负责提供 5 至 10 分钟、每行业一段的紧凑单元,检验术语覆盖广度,二者搭配的理由是单一形态无法同时兼顾真实性与可控成本,组合意义是用 498 小时与 46 小时互补支撑系统性分析。

两个集合都提供对齐文本与结构化元数据,包括说话人切分、行业分类与公司标识,保留真实轮转与跨说话人动态。地理设计上也有分工:全量集覆盖 12 个国家,以美国公司为主,占比 93.8%,同时包含欧洲、亚洲等地的英语口音与不同录音条件;均衡切片则限定为美国公司,以减少口音变异,提供受控的语言条件。全量集用于研究口音稳健性与长时结构,均衡集用于在一致条件下比较行业术语难度。

沿一个样本走完全流程有助于建立整体感。输入是一通完整财报录音,先重采样为 16 千赫兹波形,用连接时序分类模型计算帧级后验并做维特比对齐得到词边界,再把连续语音块贪心累积为 5 至 10 分钟的块,经过滤与留白后抽出音频片段。输出是该片段的音频、文字、词时间戳、说话人标签与行业标签。下一节将拆开对齐与切分的具体计算。

对齐如何从波形得到词时间戳?

对齐环节的输入是 16 千赫兹波形与参考文本的子词序列,目标是恢复每个词的起止时间。论文采用基于连接时序分类的强制对齐,英文为 Connectionist Temporal Classification,缩写为 CTC,用 NVIDIA NeMo 工具包中的 CTC 模型实现。CTC 定义了一种序列级目标,对输入声学帧与输出标签序列之间所有单调对齐求和,输出每帧在子词与空白符号上的后验概率。这些后验被用来在参考文本与音频之间搜索最可能的对齐路径。

具体动作按论文列出的 4 步执行。第一步把音频重采样为 16 千赫兹 WAV 格式。第二步计算帧级 CTC 对数概率。第三步在音频帧与参考词元之间做维特比解码,找回 CTC 格中最可能的路径。第 4 步从对齐后的词元聚合成词边界。为了缓解尾部静音或低置信区域带来的对齐误差,论文施加最大词时长约束为 0.5 秒,并在抽取音频前在块边界各加 0.2 秒固定填充,以缓解对齐抖动。

连接时序分类 × 强制对齐: 连接时序分类负责给出每帧相对子词与空白符号的后验概率并允许单调对齐搜索,强制对齐负责在已知参考文本条件下用维特比路径找回词边界,二者搭配的理由是对齐需要不依赖人工时间戳的声学模型打分,组合意义是得到可用于切分 5 至 10 分钟评测单元的词级时间戳。

需要提醒初学者:这里的 CTC 模型不是本研究新训练的识别器,而是作为已有工具被调用来打分与对齐。论文没有报告该对齐模型的训练数据、更新状态或对齐误差率,因此不能从方法名推定对齐完全无误。后续的内容过滤与说话人标签辅助切分,部分就是为了减少低质量对齐对评测的影响。

抽样与切分如何保证均衡且不切断说话?

抽样环节要同时解决代表性与均衡性。论文描述了一个 2 阶段可复现流程。第一阶段过滤,只保留目标日期范围内的美国公司通话。第二阶段按行业分类做不等比例分层抽样,英文为 stratified sampling:先按行业分组,再每组抽固定数量,保证低频行业与高频行业获得同等表示,不让高频行业主导。当行业组数超过目标评测规模时,再做 1 次随机选择。所有抽样步骤都设置随机种子以保证可复现。

切分环节的输入是上一步得到的词级时间戳,目标是得到时长受控且不破坏对话的评测块。做法是把连续语音段贪心累积为非重叠块,先累积到最小时长,再在不超过最大阈值的前提下继续扩展,时长范围例如 5 至 10 分钟。随后做基于内容的过滤,去除合并文本中含有操作员固定话术或非语音标记的候选块,再每通电话均匀随机抽一块,避免单个通话过度表示。

分层抽样 × 行业均衡: 分层抽样负责先按行业分组再每组固定抽取,避免高频行业淹没评测;行业均衡负责要求最终每个行业恰好出现 1 次,使长尾术语获得同等曝光,二者搭配的理由是自然分布本身是偏斜的,组合意义是用 46 小时小集合放大低频行业的识别难度。

一个关键细节是说话人边界保护。论文用说话人标签进一步切分,确保块边界不从说话人轮次中间切断。这样得到的文本具有可靠 timing,适合分段识别、说话人感知分析与下游处理。最终均衡集覆盖 290 个不同行业类别,每个行业一段,包含从 3D 打印机、成人夜总会到风力涡轮机、有线电信设备等广泛子领域。这种设计是有意放大长尾,而不是反映自然频率。

本研究训练了什么,没有训练什么?

本研究没有训练新的声学模型或语言模型,training 一节在此承担的是构造与调用流程的说明职责。论文明确评测的是现成检查点:OpenAI Whisper 的 base、medium、large-v2,以及 NVIDIA 的 parakeet-tdt-0.6b-v2 预训练检查点,不使用外部语言模型。Whisper 解码从固定模型配置加载选项,设置固定随机种子并使用确定性解码设置,语言设为英语,不使用可选的关键词提示或增强词。Parakeet-TDT 使用贪心 transducer 解码,同样不加外部语言模型。

因此不存在梯度路径、参数冻结与更新、优化器步骤等训练要素。论文未报告任何新模型的损失函数、学习率、训练轮数或硬件预算,也不能把无训练理解为确定性求解:即使设置了种子与确定性解码,系统输出的确定性仍取决于框架、硬件与解码实现,原文只说明了为可复现所做的种子与配置记录动作。

真实的计算集中在语料构造一侧:CTC 后验计算、维特比对齐、词边界聚合、贪心块构造、内容过滤与随机抽样。实验脚本设置 PYTHONHASHSEED 为 2025,抽样与切分使用固定随机种子 2025,并记录每次运行的完整解码配置。复现时应把重点放在还原这些构造与推理配置,而不是寻找训练超参数。

评测条件如何固定:数据、指标与解码?

实验条件按数据、协议、指标三部分固定。数据上,全量集是 498 小时 2025 年第四季度标准普尔 500 完整通话,原始采样率 11 至 44.1 千赫兹,音频格式为 MP3;均衡集是 46 小时 2025 年全年美国通话切片,采样率 16 千赫兹,音频格式为 WAV。地理上全量集覆盖 12 国,美国占 93.8%,其余包括爱尔兰 8 通、英国 6 通、印度 5 通、瑞士 4 通等;均衡集仅含美国公司。行业上全量集跨 284 个类别,自然分布偏斜,均衡集跨 290 个类别,每类一段。

词错误率 × 文本归一化: 词错误率负责统计替换、删除、插入相对参考词数的比例,方向是越低越好;文本归一化负责先统一大小写、标点与英文数字写法再计分,分工是区分纯识别错与格式差异,搭配理由是金融文本标点数字多,组合意义是同时报告原始与归一化 4 种变体以判断误差来源。

指标上论文报告 4 个一致变体:WER 为原始词错误率,WER-N 为经 NeMo 归一化后的错误率,WER-nc-np 为小写并去除标点后的错误率,WER-N-nc-np 为同时做 NeMo 归一化、小写与去标点后的错误率。归一化变体对参考与假设施加相同的 NeMo 英文文本归一化。方向都是越低越好。解码条件上一节已述,关键是无外部语言模型、无关键词提示,便于跨模型公平比较。

为便于核对总体规模与形态,下表整理两个测试集的关键属性,数字与单位均来自原文连续表述,裸值不擅自添加百分号,时长保留原文写法。

表后需要说明比较的公平性与代价。全量集的优势是真实长上下文与口音多样性,代价是评测成本高且平均数易被高频行业拉低。均衡集的优势是 46 小时即可覆盖 290 个行业,成本更可控且能暴露长尾,代价是限定美国公司与 5 至 10 分钟切片,不能代表全球口音与整通电话的长时现象。两者互补,不能只用其一代替另一方的结论。

主结果:谁更准,均衡集为何更难?

主结果要回答 3 个问题:测什么,与谁比,条件是否一致。测的是两个测试集上的 4 个词错误率变体;比较对象是实际可运行的 4 个检查点,即 Whisper-base、Whisper-medium、Whisper-large-v2 和 Parakeet-TDT-0.6B-V2;条件一致指都不加外部语言模型,Whisper 固定英语与确定性解码,Parakeet 用贪心解码。指标方向越低越好。

论文报告显示,跨模型看均衡集的表现略差于全量集,尽管其音频更短。论文将此归因于行业分层的影响:全量集服从行业的自然频率分布,均衡集强制同等行业表示,增加了长尾术语的曝光。换句话说,时长更短并不意味着更容易,分布的偏斜程度改变了难度。Parakeet-TDT-0.6B-V2 在两个集合上均为最低错误率的一组,Whisper 随规模增大而改善,但 large-v2 相对 medium 的增益小于 base 到 medium 的增益。

下表以可运行策略的实际报告为核心,整理基线对比的要点与分行业示例的含义,数值表述保留原文的百分比写法,不自行换算相对提升。

来源证据量化值一量化值二量化值三量化值四
来源句二15.315.4%——
来源句四4498h46h—

表后解释主要收益与具体代价。收益是 Parakeet 在总体上显著低于 Whisper 基线,且 4 个归一化变体趋势一致,说明优势不只来自标点大小写格式。代价与反例是:即使最强的总体基线,在术语密集领域仍明显偏离平均。论文以示例子行业说明,生物技术与制药的词错误率在 15.3 至 15.4% 区间,高于全量集总体 10.8% 的水平;原油天然气勘探与医疗保健软件等示例则相对较低。这支持总体平均会掩盖领域差异的判断,但需注意该分行业示例每子行业仅基于 2 至 3 通电话,属于说明性子集,不是全面行业排名,不能推广为所有生物医药通话都最难。

来源证据量化值一量化值二量化值三量化值四
来源句一2021202567
来源句二202514290
来源句三510——
来源句四22006369376;12;2023;2304.06795

该表把来源中的主结果数值按原文证据句整理,数值和方向只适用于当前验证条件,不能外推到其他数据。

换一种计分或换一个子集,结论还成立吗?

论文没有提供传统意义上的模型消融,例如去掉某模块后性能如何变化,因此本节承担的是评分变体与数据子集的对照分析。第一个对照是同一模型在 4 种词错误率变体下的变化。原始 WER 最高,经 NeMo 归一化后略降,小写去标点后大幅下降,两者叠加后最低。这一模式在全量与均衡集上都出现,说明标点、大小写与文本格式对原始误差有可观贡献,但归一化后模型间的排序并未反转。初学者应区分百分点与相对百分比:例如从原始到去标点的下降是百分点下降,不能表述为相对改善了多少百分比,除非按原文重新计算。

第二个对照是同一模型在全量与均衡集之间的变化。尽管均衡集总时长仅为全量的约十分之一,其错误率反而略高。这反驳了更短就更容易的直觉,支持分布效应大于时长效应的解释。但限制是两个集合在时间范围与地理上并不完全对齐:全量集为 2025 年第四季度全球成分股,均衡集为 2025 年全年美国公司,因此差异同时包含行业均衡、时间跨度与口音控制三重因素,不能全部归因于行业一项。

第 3 个对照是总体与示例子行业之间的变化。总体最低的 Parakeet 在生物技术与制药示例上仍高出总体约 4 个百分点以上,而在其他示例子行业上接近或低于总体。这说明总体趋势不等于每组都成立。在复现时,若只报告总体而不做分行业拆分,就会重复论文所批评的用平均掩盖长尾的做法。

边界在哪里:口音、语言与未测量的量?

论文用专门章节承认,Earnings25 聚焦英语财报电话,主要反映美国公司语音。虽然全量集包含 12 国英语通话,能研究口音稳健性,但均衡集为受控评价而限定美国公司,减少了口音变异。将基准扩展到更广国家与语言的多语言财报数据,仍是未来方向。因此,不能把在该基准上的结论直接推广到非英语财报或全球口音分布。

未测量的量同样需要明确。论文报告了识别准确性与可复现基线,但未测量误判率之外的延迟、实时因子、推理开销、训练资源或部署成本。总体词错误率更低不等于延迟更低或成本更低,训练资源、推理开销、输出帧率与实际延迟应分别讨论。论文也没有提供说话人归属与 diarization 的定量基线,尽管提供了支持这类分析的元数据,相关能力属于待验证,不应承诺已改善。

另一个边界是许可与合规。文本、标注、元数据、评测划分与对齐按知识共享署名 4.0 国际许可发布,但重分发的音频仍受原始内容提供方条款约束,使用者需自行确保合规。这意味着代码或文本开放不等于音频可无限制使用,复现前需先确认 Zenodo 获取与本地使用条件。

下表进一步固定地理与行业覆盖的边界条件,帮助判断何时该用全量集、何时该用均衡集。

来源证据量化值一量化值二量化值三量化值四
来源句二202514290
来源句三202514290
来源句四500———

表后总结适用条件。若要研究口音与长时上下文,应选全量集并接受 498 小时的评测成本;若要在可控成本下比较行业术语难度,应选均衡集并接受仅美国、仅切片的限制。若要做角色感知分析,需利用操作员、高管、分析师的说话风格差异,但需注意论文未给出该维度的基线数字,相关结论需要自行补充验证,不能引用总体词错误率代替。

复现先做什么:获取、解码与评分?

复现的第一步是获取数据与确认可用性。根据资源状态证据,数据集通过 Zenodo 地址发布,当前可用,状态码为 200,对应地址为https://doi.org/10.5281/zenodo.18762168。获取后应核对两个测试集的音频格式与采样率:全量集为 MP3 原始采样,均衡集为 16 千赫兹 WAV;同时核对转写、标注、元数据、评测划分与对齐是否完整。许可上文本与元数据为 CC BY 4.0,音频需遵守原始提供方条款。

第二步是还原基线推理。Whisper 需加载固定模型配置,设置固定随机种子,使用确定性解码,语言设为英语,不加关键词提示或增强词。Parakeet-TDT 使用 nvidia/parakeet-tdt-0.6b-v2 预训练检查点,贪心 transducer 解码,不加外部语言模型。任何额外语言模型或提示词都会破坏与原文的可比性。

第三步是还原评分。需实现 4 个变体:原始、NeMo 归一化、小写去标点、NeMo 归一化加小写去标点,且归一化必须对参考与假设施加相同的 NeMo 英文文本归一化。抽样与切分复现需设置固定种子 2025 与 PYTHONHASHSEED 为 2025,并记录完整解码配置。论文还披露写作中生成式 AI 仅用于语言润色,未用于生成实验结果与结论,这部分不影响技术复现,但有助于判断文本来源。

还需补的验证包括:自行实现 CTC 对齐后检查 0.5 秒最大词时长与 0.2 秒边界填充的影响,检验内容过滤是否误删有效语音,以及在均衡集上按行业分别计分以确认长尾效应是否在本地环境重现。若环境缺少大算力,可先从 46 小时均衡集起步,再扩展到 498 小时全量集。

何时值得尝试这个基准?

综合以上证据,当研究目标是金融领域语音识别的稳健性而非通用朗读准确性时,该基准值得尝试。具体包括 3 种情形:一是需要报告除总体词错误率之外的行业与角色拆分;二是需要用小成本暴露长尾术语问题,46 小时 290 行业的设计比自然分布更敏感;三是需要长音频上下文与口音多样性,498 小时全量集保留了整通电话结构。

不适合的情形同样明确:需要多语言评测、需要延迟与成本联合优化、或需要说话人分离的定量基线时,原文没有提供对应证据,需自行补充测量,不能引用总体词错误率代替。常见误解是把均衡集更难误读为切分本身导致退化,原文的解释是行业表示变化增加了长尾曝光,且时间与地理条件并不完全对齐,因此应表述为分布效应支持而非证明因果。另一个误解是把无外部语言模型的最强基线当作可部署最优,原文的基线是可运行策略的对照,不包含搜索最优或事后最优,实际部署仍需评估解码与后处理的影响。

收束到可执行建议:先用均衡集复现 4 个评分变体与分行业示例的差距,再用全量集检验长时与口音条件下的稳定性,最后补上延迟、成本与角色维度的测量,才能形成对金融语音系统完整且可核对的判断。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总