论文解读

从音频到可弹指法:手部分离与指法标注为何必须联合建模

该文把钢琴音频转录后的音符序列当作手与手指联合标注问题,用双向卡尔曼加分手隐马尔可夫的合成模型与四元三元语言模型在 PIG 上分别达到 90.8% 手部分离与 56.6% 联合准确率,而端到端管线召回降至 65.7% 与 37.0%,代价是统计模型仍受古典数据与合成音频评估限制。

 · 约 18 分钟 · 8586 字 阅读 →
论文解读

不看配对样本,如何学到从退化到干净的随机输运

SE-MSB 用扩散薛定谔桥在干净与退化语音分布之间学习双向随机输运,并以端到端 Mamba 波形模型实现,在去混响与混合退化上报告可比拟配对方法的效果,同时保持少步采样与低计算量。

 · 更新于 2026-09-25 · 约 18 分钟 · 8882 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 238 分钟 · 118878 字 阅读 →
论文解读

不用录音棚如何得到可控的管乐四重奏:ChoraleWind 的规则表情与物理建模链路

针对管乐谱到音频缺少可控可复现数据的问题,论文用 311 首四部圣咏的 MEI 编码加规则表情模型加物理建模合成构建对齐的多轨数据,最强证据是 86 小时隔离音轨与 640000 种组合的完全对齐标注,代价是合成音色不及真实录音且不追求数据驱动最优音质。

 · 更新于 2026-09-25 · 约 21 分钟 · 10332 字 阅读 →
论文解读

跳过转写直接做摘要:用句子向量把多语言语音送进法语摘要器

该研究把长语音切成片段并编码为与法语句向量对齐的语音片段向量,直接送入改造后的法语编码器解码器生成法语摘要,在呼叫中心对话和小规模跨语言合成语音上报告了与级联和音频大模型对照的可核对结果,但大模型对照为零样本且跨语言语音为合成。

 · 更新于 2026-09-25 · 约 19 分钟 · 9459 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 247 分钟 · 123292 字 阅读 →
论文解读

把不可微的维特比变成可微模块:线性链条件随机场如何嵌入端到端流程

该文把线性链条件随机场中的硬维特比解码换成温度控制的软最大值近似得到可微模块 dCRF,并在双声部干扰下的音高类别估计中显示 Toeplitz 约束的 dCRF-T 接近双向长短期记忆网络精度但参数少得多,而全参数 dCRF 提升有限。

 · 更新于 2026-09-25 · 约 17 分钟 · 8360 字 阅读 →
论文解读

可微拨弦:当频谱损失推不动起音时刻,参数损失与外部检测器如何分工

该研究用可微扩展 Karplus-Strong 做事件级声音匹配,证明时域拉格朗日插值梯度可用且无时间混叠,揭示频谱损失无法给出多事件起音方向梯度,仅用合成参数损失能学到音高音色与起音但难泛化,真机上外部检测器加音频损失最稳,而谐波加噪声基线多数重建指标更高。

 · 更新于 2026-09-25 · 约 21 分钟 · 10131 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 433 分钟 · 216709 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 80 分钟 · 39666 字 阅读 →
论文解读

借英语占位撬动马普敦贡语翻译:冻结大模型只练一个小适配器

针对马普敦贡语到西班牙语的极低资源语音翻译,论文冻结 Canary-1B-v2 并只训练约 589k 参数的线性适配器、用英语源语言占位实现翻译方向劫持,开发集上时长过滤版本取得 1.56 的词错率和 3.7 的 BLEU,测试集上过滤版本取得 0.82 的 BLEU 和 14.31 的 chrF2++,代价是仍存在重复解码和极低的绝对分数。

 · 更新于 2026-09-25 · 约 25 分钟 · 12472 字 阅读 →
论文解读

不转写直接听:用慢思考强化学习把诈骗电话的声音细节留下来

针对转写文本丢失语气与环境线索且难以拆解分层话术的问题,SAFE-QAQ 用端到端音频大模型加三阶段规则奖励强化学习做慢思考推理,在 TeleAntiFraud-Bench 上以 SAFE-LS 取得场景 84.64、欺诈 89.61、类型 88.23 的加权 F1,代价是仍依赖单一数据集且实时版类型精度有所下降。

 · 更新于 2026-09-25 · 约 21 分钟 · 10285 字 阅读 →
论文解读

不只收一个 WAV:把浏览器采集与变换留证的录音系统

VocalCap 把一次浏览器录音拆成原生对象、客户端无损 WAV 与服务端规范 WAV 三份互补文件并全程留证,在确定性破坏测试、39 例试点复检与 Chromium/WebKit 双端到端中验证了采集与变换契约,但声学校准、可用性与生物标志物有效性仍需独立研究。

 · 更新于 2026-09-25 · 约 19 分钟 · 9021 字 阅读 →
论文解读

压住衰减曲线才能压住房间:375 bps 下的 RIR 神经压缩

论文把 RIR 压缩从通用音频重建转向房间结构约束,用 EnCodec 单码本加 EDC 与局部能量加混响语音监督,在 375 bps 上把 T60 误差降到 1.14 s、ViSQOL 做到 4.11,但 46.875 bps 时容量明显不够。

 · 更新于 2026-09-25 · 约 19 分钟 · 9031 字 阅读 →
论文解读

不看未来也能补高频:StreamWSR 的因果波形超分

StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。

 · 更新于 2026-09-25 · 约 17 分钟 · 8454 字 阅读 →
论文解读

同一停靠点听见两种世界:ARFT 把超声与射频钉在同一坐标上

声源定位 | 6.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11176 字 阅读 →
论文解读

耳塞在震动什么:骨导语音的低频直线与单轴传感器的容差

语音增强 | 6.3/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10402 字 阅读 →
论文解读

单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡

语音编码 | 8.3/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12427 字 阅读 →