词错率好看却漏掉关键信息:口音对话中实体与填充词如何被找回
针对印度、印尼和拉美口音的英语学习对话,该工作用启发式富实体选数据加分区 LoRA 双输出微调 Qwen2.5-Omni-3B,把实体召回做到 80-85% 区间并把填充词保留到 76-86% 区间,代价是依赖银标准转写参考与每个区域独立适配器。
针对印度、印尼和拉美口音的英语学习对话,该工作用启发式富实体选数据加分区 LoRA 双输出微调 Qwen2.5-Omni-3B,把实体召回做到 80-85% 区间并把填充词保留到 76-86% 区间,代价是依赖银标准转写参考与每个区域独立适配器。
针对掩码型语音增强在域偏移下掩码双峰性退化的问题,BLINC 冻结模型并用直方图匹配把预测掩码重映射到由含噪信号盲特征决定的双峰目标分布,在几乎不增加耗时的条件下提升了感知质量,但以信号级指标下降和无法修复排序错误为代价。
论文把带侧支亥姆霍兹腔的通气耳道建模为二端口传输问题,导出音频带预算只由总腔体积与通孔面积之比决定,再用危害加权注水分配证明低频选择在通气类中接近无效而中高频匹配设计可达十二分贝,代价是每 1 分贝言语代价约换 1.3 分贝防护。
论文用分组留出的方向消融检验语音有害请求的拒绝边际,发现 Qwen2.5-Omni 在 L16 处消融使边际下降约 7.10 而投影器处仅约 0.013,代价是良恶提示的措辞差异使该方向只能读作拒绝相关而非纯粹有害性。
针对 Yemba 等低资源语言声学表示难学的问题,该工作用异构图把声学节点和语言节点放在同一张图里做消息传递,并在 Google Commands 缩减集和 Yemba 孤立词数据上用 SVM 和聚类指标验证跨模态表示优于 MFCC 基线和单模态 GCN,但推理依赖预训练声学模型且未做到句子级。
针对低资源下语音文本对齐需要大编码器和大量平行数据的问题,该文把词级对齐建模为异构图上的链路预测,用 GraphSAGE 消息传递把固定文本表示传给语音节点,在 TIMIT 和 Yemba 上以轻量图训练达到可比 SAMU-XLSR 的富集与检索效果,代价是跨模态检索仍受初始声学质量制约且句子级与下游任务未验证。
SEABED 针对印尼语、泰语和马来语真实语音构造必须听音频才能推理的问答,用准确率加推理接地审计测六个音频大模型,最好的 Gemini 3.5 Flash 也只答对约一半,且区域模型的正确回答中多达四分之一缺少音频依据。
Vox-Infinity 沿轮数与每轮时长拉长语音历史并以最早证据到提问的跨度分组,在七个语音语言模型上报告随证据变远准确率下降的近因效应,以及文本历史保语义而音频历史保韵律的互补代价。
针对 ASR 基座模型持续适配中的灾难性遗忘,CGaLore 用旧任务 KFAC 曲率先过滤当前梯度再选 GaLore 低秩基,在 L2-Arctic 与 CGN 两组实验上取得最优平均词错误率,代价是需少量旧任务语音估计曲率并增加基更新时的计算。
该研究用四种语音基础模型嵌入加四种浅层分类器做健康对照、轻度、重度三分类,在意大利语、英语、哥伦比亚西班牙语之间做零样本与每类 49 个目标片段的 k 样本适配,发现 k 样本一致提升目标语言 F1 且源语言基本稳定,但重度与轻度边界和预处理线索损失仍是主要代价。
GenTraceBench 把同一 TTS 谱系内预训练与 SFT、DPO、GRPO 适配后的配对检查点固定文本和说话人重合成来测取证稳定性,报告显示 RL 对齐平均归因变化小而部分 SFT 与预训练数据更换带来大幅漂移,且多样本注册只能缓解方差型漂移而不能纠正均值偏移。
针对带噪语音中浊音谐波易被抹掉且 PESQ 不可微的问题,HAMMER 用时间-频率并行注意力-Mamba 加自相关前馈建模周期性,并用软化 PESQ 加可微 LLR 直接优化,在 VoiceBank+DEMAND 上报告 3.69 PESQ 和 4.41 COVL,推理时对比度拉伸可到 3.79 PESQ 但背景分随之下降。
论文把多模态交互中的用户需求理解定义为先判存在再补全意图的上下文推理任务,用 2078 个合成与真人实录场景和五维指标测 14 个原生模型,最强系统在需上下文的关键信息上仅恢复 44.7% 且误触发普遍超过 50%,而给定标准需求标注能显著改善下游回复。
该文用 1000 组英文转写偏好标注比较词错率、字错率与多配置语义指标,发现词错率与人判断一致度最低而最优语义距离略优但未显著超过字错率,因此主张默认报告字错率并辅以语义指标。
论文研究给定话题标题查询在语音转写中预测连续句子区间的问题,用冻结语音识别编码器状态做句子级声学表示并与文本嵌入融合,在两个主数据集上以轻量定位器验证严格边界指标的提升,同时报告自发会议上增益有限的代价。
论文以波兰语为重心研究数字归一化对词错误率的影响,方法是统一把逐字数字转成阿拉伯数字再评测,最强证据是议会数据上逐字与数字文本间差异大于 2% 并可归零,主要代价是归一器覆盖不全且会改变分母权重。
该文把合成语音归属从闭集分类改写为音频对自然语言描述的跨模态检索,用冻结双编码器加小投影头在 MLAAD v9 上实现未见模型 58.4% 模型级 MRR,代价是闭集精度低于专用分类器且通用架构易混淆。
Voice-Light 研究全双工级联语音交互中的轮次判断与重叠处理,用共享流式识别编码器的因果适配器加可逆混合控制器与私有推测生成,在 1673 个静音候选的锁定测试中学习策略仅获 12.53% 召回而保留混合控制器,在 36 轮真机麦克风案例中取得 758 毫秒中位响应但以 800 毫秒超时兜底。
针对自发语音中疾病效应被语言音系差异掩盖的问题,CL-DAF 在英孟 272 维公共声学空间中用符号秩二列效应与语言不变分数筛选出 26 个方向一致特征,使英译孟与孟译英 AUC 分别达到 0.825 和 0.722,而代价是需要双语标签估计对齐且目标全参与选择时会高估约 0.04 到 0.09。
针对全双工语音模型工具调用弱的问题,论文用前端判何时委派、后端做多轮工具调用再预填回前端复述的办法,在单轮调用召回 92%-97% 与多域语音代理任务上取得可比效果,代价是打断率偏高与合成数据带来的识别与暂停处理退化。