不重训也能定位合成语音毛刺:XSQ-AST 把质量分投影到音素与时间上
XSQ-AST 用冻结的 SQ-AST 做多维度打分、用 WhisperX 做音素对齐、用显著性加核密度估计定位时间毛刺,40 人听音验证显示 Rollout 等方法与听众标注呈中等相关且 AUC 高于随机,但不同伪影类型最优方法不同且存在未评测边界。
XSQ-AST 用冻结的 SQ-AST 做多维度打分、用 WhisperX 做音素对齐、用显著性加核密度估计定位时间毛刺,40 人听音验证显示 Rollout 等方法与听众标注呈中等相关且 AUC 高于随机,但不同伪影类型最优方法不同且存在未评测边界。
该研究用同一套自然对白与九种增强和锚点条件比较年轻正常听力组与四个年长听力组的绝对质量评分,报告年长组系统间可分差异收缩而整体水平随听阈加重下移,最强证据是核心增强两两对比点数范围的缩小与条件平均分差,代价是输出信噪比较高且助听模式高度简化。
针对直播带货语音合成中流畅度、语调、情感和直播感需要分维度评价的问题,论文先把 Gemini 的成对判断蒸馏为开源的 Live-ProsodyJudge,再用去掉总体结论、按维度掩码与分段归因的 Decoupled 版本解决维度塌缩,十次平衡顺序采样的 LPJ 在四个主测试集点准确率高于单次 Gemini 调用,而 D-LPJ 的混合维度一致率达到 …
针对波斯语缺少大规模高保真语音数据的问题,PersianVox 用声学轮次感知的韵律切分与 CTC/RNN-T 双自动语音识别一致过滤从网络音频构造语料,最强证据是 SCOREQ 在 564 句人工平均意见分上皮尔逊相关达 0.6658 优于 DNSMOS 且修复后 SCOREQ 均值从 3.04 升至 4.03,代价是从 6179.66 小时原料仅保留 …
针对非侵入式 MOS 预测中语音基础模型层利用不稳定的问题,论文在 10 个骨干与 4 个数据集上对比末层探测、最优单层、朴素加权融合与全量微调,并评估逐层适配器校准后聚合的冻结骨干方案,最强证据是 Wav2BERT A+M 在四库平均上达到话语级 0.388/0.749 与系统级 0.052/0.932,代价是仍需为每个层训练独立适配器与回归头且最优深度随 …
论文用六个语料的成对偏好任务检验无参考语音质量分,发现有瑕疵时接近人类上限而双干净时跌到随机,最强证据是干净端单分数与时长基线持平,而域内校准复合与等权复合分别在评测和奖励端缓解但仍远离上限。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
VoiceMOS 2026 把语音评估拆成增强语音的绝对分与比较分、情感合成的自然度与情绪匹配、编解码合成的说话人与口音相似度 3 类任务,用 18 支队伍的提交显示多数队伍超过基线,而比较分与口音相似度仍最难,优胜系统普遍用预训练特征加听众建模加集成换取排序一致性。
针对自己声音堵塞效应个体差异大、难以重复呈现的问题,该工作用大耳罩物理去除空气传导再经实时滤波重放,并在人工头上验证了对多档堵塞增益与插入损失组合的独立仿真能力,代价是低频仍有残余上限与约 6.5 ms 系统延迟。
该研究以法语合成语音为对象,用强制对齐加共振峰提取得到元音空间面积、元音内离散和元音间距离三类指标,并在系统层用斯皮尔曼相关对照平均意见分,最强证据是元音间高度对比/a-i/与/i-E/在 F1 上显著相关而多边形面积不显著,代价是离散指标整体偏弱且结论限于单语料单说话人风格。
该研究用 31 名普通话母语者的成对更 distinct 判断任务,检验含非法调音节与合法但非词音节的声音对是否被判为更不 distinct,最强证据是 S1 至 S4 中非法与非词对的判断率显著低于全合法全词对,而 S5 与 S6 的分歧显示声学细节会介入,代价是仅用判断率与反应时、未测自然语流与个体词频效应。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
论文把问题定为普通话有声书语境下语音表达是否贴合叙事意图,提出规划器与评判器分离的 CEAEval-M,并报告在人工测试集上线性相关 0.72 与 70.80% 准确率,其代价是依赖人工标注语境与多阶段训练。
论文把语音质量评估从跨库不可比的平均意见分回归改为库内偏好比较,用 55333 对训练偏好的 MOS-Pref 统一训练三类奖励模型,最强标量模型整体准确率达 80.04%,而 MOS 感知的生成式奖励模型在小分差上进一步提升,代价是生成式路径仍弱于标量排序且依赖偏好标注质量。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
针对无参考语音翻译质量估计在文档内排序的评价方式,论文把 580M 参数的 CometKiwi-22 改为文档内成对排序加权 MSE 微调,在开发集上达到平均 35.2% 的 per-source Kendall τ,相对 34.6% 基线小幅提升,代价是只用英德和英中数据且未利用音频信号。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
该文针对语音进语音出对话只用单轮语义奖励的问题,用四路独立偏好数据加单 DPO 目标联合训练,在保持轮次与块级解码兼容的同时,以语义与声学指标的联合提升为证据,代价是情感与可懂度之间出现轻微竞争。
论文把自然语言质检需求编译为依赖感知的有向无环工作流并调用 24 个音频与文本核查工具,在专家一致率 80-90% 的条件下把人工成本时间压到 20% 以下,代价是规划器选型与幻觉和运行时的权衡。