每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

普通话里听谁更突出:快速韵律转写一致性为何偏低

该研究用 146 句普通话 TED 演讲做听辨式显著词标注,发现 65 名母语者的两两一致性平均 Kappa 仅 0.251,提示在声调语言中基于声音显著性的短促判断并不稳定。

 · 更新于 2026-09-24 · 约 19 分钟 · 9324 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

时长不只决定贴多少次:用受控微分方程让音素表示随时间演化

针对重复扩展使时长只改变出现位置而不改变表示取值的问题,该文把音素加时间通道作控制路径并用神经向量场求解受控微分方程产生连续隐状态,在情感语音上以单层每步一音素取得宏观 Spearman 排序相关 0.53 高于微调基线 0.08,但绝对校准与感知质量仍随情绪和分辨率变化。

 · 更新于 2026-09-24 · 约 16 分钟 · 7997 字 阅读 →
论文解读

听得出却标不对:当信任线索遇上部分合成语音的人耳定位实验

该研究用 20 条真、全合成与部分合成语音的 0.2 秒窗口定位任务检验 47 名母语听者,显示话语类型决定检出与质量评分而三种信任线索无主效应,全合成在多数投票下 0/5 正确且人群辨别力接近机遇。

 · 更新于 2026-09-24 · 约 20 分钟 · 9567 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

当嵌入模型说变好了而听众说没有:VoiceFX 的补救与验证落差

该研究用劣化加补救的可控流程检验能否以对比语言音频预训练相似度估计人声录音质量并推荐处理,最强证据是强档降噪在噪声与混响上大幅提升对比语言音频预训练相似度却被听众打低分,而去轰头与去闷处理得到听众正向评价,代价是嵌入指标与人耳判断并不一致。

 · 更新于 2026-09-24 · 约 18 分钟 · 8587 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-12

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 79 分钟 · 39128 字 阅读 →