论文解读

集中改四秒不等于识别器给全曲:MIDI-SAG 和弦条件传播的配对校准

在固定音轨、种子、上下文与评分窗下,中央 4 秒三全音破坏比完整 CNN-CRF 回放引发更大的伴奏特征偏移,而同时匹配改变支撑与关系构成的合成画像最接近回放响应,但它只缩小条件响应距离,不代表音质提升。

 · 更新于 2026-09-25 · 约 16 分钟 · 7968 字 阅读 →
论文解读

连续编码表示上的分块解码:在一次前向与逐帧之间调节增强代价

论文把语音增强放在连续神经音频编解码表示上做掩码自回归建模,用同一 Conformer 和同一训练比较不同解码策略,在 Libri1Mix 上以 10 步取得介于非自回归与因果自回归之间的质量与算力,并以可听度指标接近非自回归基线。

 · 更新于 2026-09-25 · 约 18 分钟 · 8929 字 阅读 →
论文解读

生成用短时谱、判别用对数谱:DSME 为何把预测与判别分开

DSME 用短时傅里叶谱显式生成幅值与相位、用恒 Q 谱作八度分段判别并加入色度损失,在独奏音乐的三类仿真退化中改善多数客观指标;主观偏好仅在混合失真任务上优于三个基线,该任务的 FAD 仍劣于 MP-SENet。

 · 更新于 2026-09-25 · 约 19 分钟 · 9394 字 阅读 →
论文解读

打开混响黑盒:从 Schroeder 结构到可核对的分析与移植路径

论文以 Schroeder 历史混响为案例,主张用开放架构重建 comb 与 all-pass 组合,通过 Csound 脉冲响应分析与 par/seq 重建验证理解过程,代价是遇到效率限制而把 C 编译 opcode 留作后续工作。

 · 更新于 2026-09-25 · 约 18 分钟 · 8648 字 阅读 →
论文解读

并行相加代替串行求余:PACodec 如何用小码本做低码率语音编码

PACodec 用并行加性量化,在 LibriTTS 1.4 kbps 与 VCTK 4.2 kbps 上取得接近较高码率基线的客观表现;主观 ABX 仅在 LibriTTS 上进行,对多数 2 kbps 基线未检出显著偏好差异,并非等效证明,分支解耦也仍只是消融显示的潜力。

 · 更新于 2026-09-25 · 约 19 分钟 · 9436 字 阅读 →
论文解读

说话人一换就失准:用更强的判别器逼编码器减少说话人线索

针对未见说话人上情感识别易受说话人差异干扰的问题,论文用 wav2vec 2.0 做编码器、ECAPA-TDNN 做说话人判别器并以熵最大化做对抗,在 IEMOCAP 测试集报告 60.63% UA,代价是交替训练更复杂且存在原文内部数字不一致与未验证的跨库边界。

 · 更新于 2026-09-25 · 约 17 分钟 · 8271 字 阅读 →
论文解读

不看未来也能补高频:StreamWSR 的因果波形超分

StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。

 · 更新于 2026-09-25 · 约 17 分钟 · 8454 字 阅读 →
论文解读

耦合失真下不换模型而换管线:StrixAE 用智能体调度专家模型

针对噪声混响多人交叠耦合且需求因人而异的问题,StrixAE 用多模态大模型做控制器调度专家工具链,经 AcoustBench 思维链微调与音频感知强化学习后,在真实盲测多项感知指标上超过多数开源基线,但感知质量优化仍慢且依赖外部工具。

 · 更新于 2026-09-25 · 约 22 分钟 · 10852 字 阅读 →
论文解读

十六种方言同一套音频:辨别与转写为何难同步提升

该挑战用同一批十六类方言音频同时考辨别与转写,统一基线仅 53.62% 辨别准确率与 18.10% 转写错误率,最强受限系统做到 83.19% 与 11.08%,而困难方言与混淆方向显示两任务相关但不可互相替代。

 · 更新于 2026-09-25 · 约 20 分钟 · 9576 字 阅读 →
论文解读

失配时只听一条语音:用干净先验把增强输出推向高密度区

针对训练与测试噪声失配导致的增强残留噪声,该文用冻结的自回归干净先验对单条测试语音做 KL 散度自适应,在 DNS 等四组数据上主要提升背景抑制,但需早停且初始已干净时收益很小。

 · 更新于 2026-09-25 · 约 19 分钟 · 9429 字 阅读 →
论文解读

从听见一个词到认出一个词:LibriBrain100 如何把词分类与跨人泛化变成可比的竞赛

论文把脑磁图听语音解码推进到固定 50 词分类,用深度单人赛道冲极限、用广度多人赛道考少量数据适应,以竞赛词表平衡前十准确率为主要标尺并配双词表与互信息,同时代价是评估只覆盖固定词表而非开放词汇转写。

 · 更新于 2026-09-25 · 约 20 分钟 · 9708 字 阅读 →
论文解读

注意力三角:当音频-视频边把鹦鹉的话转给海盗

论文研究文本到音频视频联合生成中的语义泄漏与声源归属错误,提出只在推理时对文本-视频、文本-音频、音频-视频三条交叉注意力边加偏置的转向方法,在 100 个挑战提示上把 Qwen 声源归属分从 0.1216 提高到 0.1349,代价是约 2.5 倍推理开销。

 · 更新于 2026-09-25 · 约 19 分钟 · 9171 字 阅读 →
论文解读

真假混在一起时:让大模型先分轨再判真伪的 ToolDF

针对一段音频里同时含真实与伪造、跨时间与跨声源的混合真实性检测,ToolDF 用音频大模型做编排器按结构调用分离与四个领域专家并执行早失败汇总,在复合类型上取得最高的 C-Avg. 81.89,代价是依赖外部工具的可靠性。

 · 更新于 2026-09-25 · 约 15 分钟 · 7181 字 阅读 →
论文解读

合成之前先对账:说话计划能否证明 delivery 真用了源记录

论文把合成前 delivery 决策做成带源引用的结构化说话计划,用确定性校验器检查引用合法性与单线索局部性,在 32 种子 100 例 full100 对照中去掉源记录使引用必需分数下降 0.488,而 7B 局部性修复在源键留出下恢复槽位准确率与局部性。

 · 更新于 2026-09-25 · 约 20 分钟 · 9581 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-04

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 40 分钟 · 19562 字 阅读 →
论文解读

百分之百的正确,也可能只说出了百分之五:语音脑机接口需要一把共同的尺子

语音识别 | 7.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11347 字 阅读 →
论文解读

同一停靠点听见两种世界:ARFT 把超声与射频钉在同一坐标上

声源定位 | 6.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11176 字 阅读 →
论文解读

听错了才是听懂了?当大音频模型遇上人类幻听

音频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10268 字 阅读 →
论文解读

别让音频去写作,让它来验货:AVERT 对口语状态跟踪的裁决式修正

语音识别 | 7.6/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10921 字 阅读 →
论文解读

一个人、一套配方、七种适配器:重度构音障碍识别该押注哪种微调

语音识别 | 5.9/10

 · 更新于 2026-09-25 · 约 22 分钟 · 11018 字 阅读 →