论文解读

四人餐馆对话要听清谁:CHiME-9 ECHI 在眼镜与助听器上做因果多说话人抽取

论文研究餐馆噪声下四人对话的同伴语音抽取,选择带说话人注册的目标说话人抽取与因果约束,用听音转写正确率与 P.835 质量分证明头部系统相对基线有实质提升,而客观指标与听感排名不一致且保留噪声与保真度不可兼得。

 · 约 17 分钟 · 8300 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-24

共分析 62 篇语音/AI 论文

 · 约 112 分钟 · 55814 字 阅读 →
论文解读

混响下高阶缺失难定解:把上采样做成条件生成的取舍

该文把一阶到三阶上采样定义为给定低阶信号生成缺失高阶通道的条件分布,用流匹配与得分扩散同骨干对比,在混响语音上流匹配信号与听感占优但参数与采样代价明显更大。

 · 更新于 2026-09-24 · 约 17 分钟 · 8343 字 阅读 →
论文解读

误识别还是抽象化:置信度不足时声音识别该输出什么

论文把声音事件识别的输出从单一确定标签改为类别加置信度加拟声词描述,用冻结编码器加可训练投影器与分类器实现分类与检索联合训练,在 31 类子集上保持分类能力,并在约 85% 准确率的模拟不确定条件下用大模型评价与 310 人听评显示拟声输出更有助于环境理解,代价是拟声不匹配会损害自然度。

 · 更新于 2026-09-24 · 约 20 分钟 · 9637 字 阅读 →
论文解读

原型挤在一处时,零样本换声为何更难泛化到没见过的说话人

论文研究角间隔 ECAPA-TDNN 分类器原型在单位超球面上的集中与有效维度坍缩问题,用铰链式 Riesz 对数能量与参与率最大化两项直接作用于原型的正则改善覆盖,并在 Fast-VGAN 零样本换声上以 WER 从 6.54% 到 5.97%、相似度从 0.65 到 0.69、UTMOSv2 从 2.47 到 2.70 为证据显示鲁棒性提升,而说话人识别 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10639 字 阅读 →
论文解读

不重训也能定位合成语音毛刺:XSQ-AST 把质量分投影到音素与时间上

XSQ-AST 用冻结的 SQ-AST 做多维度打分、用 WhisperX 做音素对齐、用显著性加核密度估计定位时间毛刺,40 人听音验证显示 Rollout 等方法与听众标注呈中等相关且 AUC 高于随机,但不同伪影类型最优方法不同且存在未评测边界。

 · 更新于 2026-09-24 · 约 17 分钟 · 8513 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-23

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 77 分钟 · 38502 字 阅读 →
论文解读

先看听者再说话:用回应前一秒表情规划下一句怎么说

针对对话语音只看文本历史会漏掉听者即时非言语线索的问题,用回应前 1 秒听者人脸时序做显式回应规划,在严格双人 MELD 协议上时序模型宏平均 F1 和 VAD 一致性略高于纯文本而准确率基本不变,合成阶段仅证明可端到端连通而未改善可懂度。

 · 更新于 2026-09-24 · 约 18 分钟 · 8603 字 阅读 →
论文解读

词错率低不等于意思对:用人偏好重测 WER、CER 与语义指标

该文用 1000 组英文转写偏好标注比较词错率、字错率与多配置语义指标,发现词错率与人判断一致度最低而最优语义距离略优但未显著超过字错率,因此主张默认报告字错率并辅以语义指标。

 · 更新于 2026-09-24 · 约 16 分钟 · 7928 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-21

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 51 分钟 · 25432 字 阅读 →
论文解读

年轻听众能分开的增强差别,为何在年长听众组平均中变平

该研究用同一套自然对白与九种增强和锚点条件比较年轻正常听力组与四个年长听力组的绝对质量评分,报告年长组系统间可分差异收缩而整体水平随听阈加重下移,最强证据是核心增强两两对比点数范围的缩小与条件平均分差,代价是输出信噪比较高且助听模式高度简化。

 · 更新于 2026-09-24 · 约 17 分钟 · 8277 字 阅读 →
论文解读

已知录音、未知变速:谐波打击分离如何在 Python 里做到逐帧可变速实时播放

论文把已知录音的谐波打击分离放在离线预处理、把相位声码器与叠加相加放在逐帧可变速的实时合成,并用预计算频谱查表把总运行时间降低约一半,代价是更小的预计算跳长需要更多预计算与内存。

 · 更新于 2026-09-24 · 约 18 分钟 · 8540 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-18

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 67 分钟 · 33126 字 阅读 →
论文解读

不录音也能装上读音开关:用模型自己的声音教它读重音

针对端到端语音合成读错生僻词和日语声调的问题,该文用常见词的自身合成做教师来蒸馏读音与声调控制通道,在 Sarashina2.2 上未见词声调实现率达 0.89 且自然度非劣效,代价是相对纯假名低 0.069-0.091 及跨骨干迁移时声调与自然度不完全保持。

 · 更新于 2026-09-24 · 约 15 分钟 · 7184 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-17

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 53 分钟 · 26180 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

语序错了、语调错了,为什么匈牙利听者还觉得可以:窄焦点的语境补偿

该研究用窄焦点语境下的四种语序×语调组合做合适度评级,检验韵律能否独立标记动词后窄焦点以及窄焦点语序是否必须配典型语调,最强证据是典型窄焦点得分最高但三类错配仍可接受且与基线无显著差异,代价是丰富词汇语境可能掩盖了线索在信息不足时的真实权重。

 · 更新于 2026-09-24 · 约 23 分钟 · 11122 字 阅读 →
论文解读

唇部收缩多少与感觉费力多少:构音努力自评的测量方法与个体差异

该研究用唇圆展无发声收缩加视觉反馈与视觉模拟量表测量主观构音努力,35 人队列平均呈二次关系而个体函数形态与任务执行差异大,代价是孤立口面动作与仅用表面肌电表征生理努力限制了向连续言语的直接推广。

 · 更新于 2026-09-24 · 约 22 分钟 · 10712 字 阅读 →