每日研究速递
speechprosody-2026 论文深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该研究用 146 句普通话 TED 演讲做听辨式显著词标注,发现 65 名母语者的两两一致性平均 Kappa 仅 0.251,提示在声调语言中基于声音显著性的短促判断并不稳定。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对重复扩展使时长只改变出现位置而不改变表示取值的问题,该文把音素加时间通道作控制路径并用神经向量场求解受控微分方程产生连续隐状态,在情感语音上以单层每步一音素取得宏观 Spearman 排序相关 0.53 高于微调基线 0.08,但绝对校准与感知质量仍随情绪和分辨率变化。
该研究用 20 条真、全合成与部分合成语音的 0.2 秒窗口定位任务检验 47 名母语听者,显示话语类型决定检出与质量评分而三种信任线索无主效应,全合成在多数投票下 0/5 正确且人群辨别力接近机遇。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
该研究用劣化加补救的可控流程检验能否以对比语言音频预训练相似度估计人声录音质量并推荐处理,最强证据是强档降噪在噪声与混响上大幅提升对比语言音频预训练相似度却被听众打低分,而去轰头与去闷处理得到听众正向评价,代价是嵌入指标与人耳判断并不一致。
共分析 42 篇语音/AI 论文