每日研究速递

语音/音乐/音频论文速递 2026-09-25

共分析 75 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 132 分钟 · 66120 字 阅读 →
论文解读

不换模型换前端:儿童语音的时间包络与可学习归一化如何补上 Whisper

针对儿童语音声学变异大而 Whisper 固定对数梅尔前端丢失连续包络结构的问题,该文用时域子带希尔伯特包络加可学习逐通道能量归一化替换前端,在相同 Whisper-small 微调下把 MyST 清洗测试集词错误率从 13.16% 降到 11.08%,代价是删除错误小幅上升且低频保留原因仍待验证。

 · 更新于 2026-10-01 · 约 17 分钟 · 8261 字 阅读 →
论文解读

只听一句不够:用前面二十多秒对话为当前语音补上情绪走向

针对单句语音情绪识别忽略对话连续性的问题,论文提出只用前文音频做均值池化增强的 ACERT 模块,在 IEMOCAP 上以 25 秒前文将无上下文基线从 68.38% 提高到 79.08%,代价是情绪快速翻转的多人对话如 MELD 几乎无增益。

 · 更新于 2026-10-01 · 约 18 分钟 · 8938 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-24

共分析 62 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 112 分钟 · 55814 字 阅读 →
论文解读

俳句的停顿为何难念:HaikuS2S 用两段微调把 5-7-5 念出节奏

针对用户语音输入后用英语俳句语音回应的任务,HaikuS2S 采用自动语音识别加大型语言模型加语音合成的级联路线,配合通用诗歌与自录俳句两段微调,最强证据是俳句微调后音高对齐与可懂度改善,而代价是会话自然度评分下降与小规模录音带来的泛化限制。

 · 更新于 2026-10-01 · 约 26 分钟 · 12802 字 阅读 →
论文解读

长尾之下适度再平衡:平方根采样为何优于自然与均匀采样

针对 16 类非言语发声联合转写任务,该工作用跨数据集标签归一加平方根采样后接均匀微调,在官方评测得到 63.86 分排名第四,代价是第二阶段在本地验证集上从 66.25 分回落到 58.91 分且多数类别 F1 下降。

 · 更新于 2026-10-01 · 约 18 分钟 · 8547 字 阅读 →
论文解读

残留说话人属性聚成可链接性:用针孔损失微调已训好的匿名框架

针对解耦不彻底导致内容与韵律流残留说话人可链接性的问题,该文在冻结说话人编码器下用针孔损失微调内容编码器、韵律编码器与波形生成器,探测显示学习型韵律泄漏明显下降而词错误率与情感召回仅小幅波动。

 · 更新于 2026-10-01 · 约 21 分钟 · 10284 字 阅读 →
论文解读

不等整句到齐就开口:双轨延迟如何换来可控的首包文本规范化

针对级联对话中上游大模型流式输出与下游语音合成之间的非标准词歧义,StreamTN 用基于 Qwen3-0.6B 的双轨延迟架构做增量规范化,在 4 帧延迟下报告 Micro-F1 为 0.8937 并以 213 ms 的首包延迟换取流式可用性,代价是复杂数理化表达式仍明显更差且更大延迟才能继续提升精度。

 · 更新于 2026-10-01 · 约 19 分钟 · 9265 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-23

共分析 42 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 77 分钟 · 38502 字 阅读 →
论文解读

只给一次提醒意图,让音频大模型自己决定何时开口:中断与静默建模

论文把连续音频监护形式化为四态打断或静默决策,用两个特殊词嵌入解码,在 ESC-50 上报告 99.6% 中断 F1 与 100.0% 去重召回,在未训练的 Epic-Sounds 上保持 96.7% 起始召回,代价是嘈杂域静默召回仅 10.1% 与平均 3.5 秒流式延迟。

 · 更新于 2026-10-01 · 约 18 分钟 · 8551 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-21

共分析 26 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 51 分钟 · 25432 字 阅读 →
论文解读

去掉提示词文本:用合成同说话人提示做微调的跨语言克隆

针对推理时拿不到参考音频文本的跨语言克隆问题,该文用预训练 F5-TTS 合成同说话人提示做监督微调并配合静音鲁棒语速预测器,在 LibriSpeech-PC 上 WER 为 2.014% 且相似度提升,代价是自然度小幅下降。

 · 更新于 2026-10-01 · 约 21 分钟 · 10077 字 阅读 →
论文解读

语音问答记住了不该记的事实:切断声学理解与隐私记忆的四种遗忘路径

论文在语音问答大音频语言模型上对比梯度上升、任务算术与两种拒答对齐遗忘方法,报告在中度记忆检查点上可把隐私泄露率降低约 80% 且非隐私问答基本保持,但压到接近零泄露时非隐私准确率必然明显下滑。

 · 更新于 2026-10-01 · 约 20 分钟 · 9634 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-16

共分析 59 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 104 分钟 · 52022 字 阅读 →
会议总览

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-10-01 · 约 238 分钟 · 118878 字 阅读 →
会议总览

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-10-01 · 约 360 分钟 · 180081 字 阅读 →
论文解读

音素串能否替代专家打分:17 个法语预训练模型的域内精度与病理跨域对照

该文把 17 个 Wav2vec 2.0、HuBERT 和 Whisper 模型统一微调为法语 35 音素识别器,先在 Common Voice 健康语音上建立基线,再冻结模型到 111 例 C2SI 病理语音上测跨域衰减与临床相关,最强证据是 Wav2vec 2.0 以 6,2% 错误率领先且错误率与人工评分高达 0,88 和 0,91 相关,但最低错误率 …

 · 更新于 2026-10-01 · 约 16 分钟 · 7862 字 阅读 →
论文解读

预训练语言越多越好吗:语音基础模型做音频伪造检测的对照解读

该研究把单语和多语语音基础模型放在同一微调与分类流程下比较伪造检测,报告显示多语模型在域内和野外数据上更稳健,但超大规模参数并未带来系统性增益且单语模型在未知压缩与信道下退化明显。

 · 更新于 2026-10-01 · 约 17 分钟 · 8445 字 阅读 →
论文解读

用长语境找韵律:从 YouTube 检索到 wav2vec2 二选一的韵律最小对基准

论文用长字符串检索条件化短串韵律以免除逐条标注,构建四个韵律最小对基准并微调 wav2vec2-base 做二选一分类,在各自验证集上报告均超 90% 但存在音频重复导致偏高估计的代价。

 · 更新于 2026-10-01 · 约 20 分钟 · 9555 字 阅读 →
论文解读

不改模型也能治啸叫:用啸叫与降噪混合数据微调语音增强网络

该工作把预训练实时语音增强网络用离线合成啸叫样本加原始降噪数据联合微调,报告显示 60% 啸叫加 40% 降噪配比在在线啸叫抑制上明显提升而降噪 PESQ 仅从 2.564 降到 2.556,代价是 75% 高啸叫配比时 PESQ 降到 2.47 且 SDR 从 17.62 降到 16.79。

 · 更新于 2026-10-01 · 约 20 分钟 · 9690 字 阅读 →