论文解读

不重训也能定位合成语音毛刺:XSQ-AST 把质量分投影到音素与时间上

XSQ-AST 用冻结的 SQ-AST 做多维度打分、用 WhisperX 做音素对齐、用显著性加核密度估计定位时间毛刺,40 人听音验证显示 Rollout 等方法与听众标注呈中等相关且 AUC 高于随机,但不同伪影类型最优方法不同且存在未评测边界。

 · 更新于 2026-09-25 · 约 17 分钟 · 8513 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-23

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 77 分钟 · 38502 字 阅读 →
论文解读

共享一块做精修:ADER 用早停深度与单专家适配省掉冗余迭代

针对固定深度对所有语音做同样多次精修的浪费,ADER 用共享 TS-Transformer 块循环精修并以深度控制器硬早停加每步单专家残差适配,在 VCTK-DEMAND 上以平均 2.15 次迭代达到 WB-PESQ 3.37,代价是相对固定 3 步共享块仍有约 2.6% 的感知质量下降。

 · 更新于 2026-09-25 · 约 17 分钟 · 8386 字 阅读 →
论文解读

快推理不等于能对话:AVTR-1 把双人音频、连续渲染与延迟调度做进同一系统

AVTR-1 用 153M 参数的双音频条件流匹配模型生成头部与表情动作,再用常开的渲染与调度循环把外部语音智能体的可变语音片段变成同步音视频,并用延迟分解与 R-DGG 验证了可交互性与说话人依赖,代价是仍依赖外部语音智能体与固定的窗口节拍。

 · 更新于 2026-09-25 · 约 18 分钟 · 8808 字 阅读 →
论文解读

耳朵只认内容、方向另学一路:Bearings 把声场与声学拆开预训练

针对单通道自监督音频编码器空间盲的问题,Bearings 用掩码重建方向场与双尺度扩散度学习可复用的声场嵌入,冻结拼接后在两个 SELD 数据集上把位置相关 F 值从 4 以下提升到 40 以上,代价是仍需轻量融合头训练且部分指标未超越联合训练模型。

 · 更新于 2026-09-25 · 约 19 分钟 · 9168 字 阅读 →
论文解读

词错率好看却漏掉关键信息:口音对话中实体与填充词如何被找回

针对印度、印尼和拉美口音的英语学习对话,该工作用启发式富实体选数据加分区 LoRA 双输出微调 Qwen2.5-Omni-3B,把实体召回做到 80-85% 区间并把填充词保留到 76-86% 区间,代价是依赖银标准转写参考与每个区域独立适配器。

 · 更新于 2026-09-25 · 约 19 分钟 · 9498 字 阅读 →
论文解读

不碰权重只改掩码:BLINC 用盲估计双峰分布做免训练校准

针对掩码型语音增强在域偏移下掩码双峰性退化的问题,BLINC 冻结模型并用直方图匹配把预测掩码重映射到由含噪信号盲特征决定的双峰目标分布,在几乎不增加耗时的条件下提升了感知质量,但以信号级指标下降和无法修复排序错误为代价。

 · 更新于 2026-09-25 · 约 15 分钟 · 7245 字 阅读 →
论文解读

通气耳塞的因果预算:体积除以孔径决定能省下多少分贝

论文把带侧支亥姆霍兹腔的通气耳道建模为二端口传输问题,导出音频带预算只由总腔体积与通孔面积之比决定,再用危害加权注水分配证明低频选择在通气类中接近无效而中高频匹配设计可达十二分贝,代价是每 1 分贝言语代价约换 1.3 分贝防护。

 · 更新于 2026-09-25 · 约 18 分钟 · 8786 字 阅读 →
论文解读

能解码不等于在用:语音拒绝的因果落点在文本主干的中后段

论文用分组留出的方向消融检验语音有害请求的拒绝边际,发现 Qwen2.5-Omni 在 L16 处消融使边际下降约 7.10 而投影器处仅约 0.013,代价是良恶提示的措辞差异使该方向只能读作拒绝相关而非纯粹有害性。

 · 更新于 2026-09-25 · 约 19 分钟 · 9116 字 阅读 →
论文解读

先想好怎么说,再开口说:COT-TTS 把对话历史变成可检查的说话计划

COT-TTS 研究给定历史对话音频、固定目标文本和参考音色时如何先显式推理说话方式再合成语音,最强证据是 0.6B/1.7B 端到端模型在时长一致性和人评上接近 34-39B 级联基线,代价是可编辑推理大幅改动时会降低客观音质并引入推理与语音错位风险。

 · 更新于 2026-09-25 · 约 21 分钟 · 10461 字 阅读 →
论文解读

从干净音素到真实唇读错误:用三阶段课程让重建模型适应噪声

针对音素到文本重建训练用干净音素而推理遇到视觉识别错误的问题,论文提出从合成扰动到多域再到目标域伪标签的三阶段渐进训练 PECT,在 LRS2 上把 HP-VSR-FiLMFuse(L4) 从 23.3% 降到 22.2%,代价是需要五折训练视觉前端生成伪标签且仍受限于第一阶段音素质量。

 · 更新于 2026-09-25 · 约 19 分钟 · 9118 字 阅读 →
论文解读

离散还是连续:语义约束决定音频理解上限

该文用统一指令微调框架比较连续特征与离散口令在语音声音音乐理解任务上的表现,显示语义约束与多域预训练决定效果而扩大语言模型不能弥补前端信息损失,代价是连续特征训练更慢而重建型编码保真高但理解弱。

 · 更新于 2026-09-25 · 约 22 分钟 · 10552 字 阅读 →
论文解读

先锁定结论语义再推理:SPARE 如何把长思维链拉回音频

针对显式思维链导致注意力偏离音频的推理落差,SPARE 在推理起点插入寄存器令牌并用结论语义做余弦对齐,在 SALMONN 13B 上把 MMAU 提升到 58.03%、MMAR 提升到 40.32%,代价是微调阶段增加一个训练期对齐分支而推理零新增开销。

 · 更新于 2026-09-25 · 约 18 分钟 · 8867 字 阅读 →
论文解读

声音不够时让文字来帮忙:用异构图把语言知识传给语音表示

针对 Yemba 等低资源语言声学表示难学的问题,该工作用异构图把声学节点和语言节点放在同一张图里做消息传递,并在 Google Commands 缩减集和 Yemba 孤立词数据上用 SVM 和聚类指标验证跨模态表示优于 MFCC 基线和单模态 GCN,但推理依赖预训练声学模型且未做到句子级。

 · 更新于 2026-09-25 · 约 18 分钟 · 8920 字 阅读 →
论文解读

把旋转和镜像写进网络:EquiSELD 如何用标量加向量做等变声事件定位与检测

针对一阶 Ambisonics 在旋转与镜像下方向变化而声源不变的问题,EquiSELD 用不变标量与等变强度向量双流加等变注意力实现严格 O(3) 等变,在 TAU2021 上以 0.40 的综合分超过基线并以约 19 倍更少训练耗时超过已有等变网络,但在 STARSS23 真实场景上优势收窄且仍受类别覆盖与仰角先验限制。

 · 更新于 2026-09-25 · 约 19 分钟 · 9164 字 阅读 →
论文解读

唱歌头比说话头难在哪:Hi-Singers 用 170 小时野外数据补节奏与表情缺口

针对说话数据训练的模型在唱歌时出现节奏漂移和表情受限的问题,论文用三阶段过滤构建 29500 余段野外唱歌头数据,并在 Hallo 等架构上验证了唇同步与节奏对齐的提升,但高强度筛选只保留约 6.9% 原料且依赖人工打分融合。

 · 更新于 2026-09-25 · 约 18 分钟 · 8748 字 阅读 →
论文解读

听到不等于能定位:把不可靠的音频监督放在辅助通道的开放词汇音视定位

针对文本查询的音视事件时间定位,论文提出按边界可靠性分配教师监督位置的 OV-OrthKD,在 OV-AVEBench 上达到 0.816 片段 AP 且未见类 F1@0.5 提升 3.4 个百分点,代价是角色固定且仅做局部权重验证。

 · 更新于 2026-09-25 · 约 21 分钟 · 10058 字 阅读 →
论文解读

复刻缺全流程代码的乐器分离模型:性能差距与能量代价从何而来

该文复刻频带切分循环网络用于人声贝斯鼓与其他四轨分离,在公开数据集上补齐预处理与训练细节并对比多种设计,结果显示大模型与替代增强可缩小与原报告的差距,但耐心延长与全项目试错带来数十倍于单次训练的能量开销。

 · 更新于 2026-09-25 · 约 23 分钟 · 11196 字 阅读 →
论文解读

把对齐做成链路预测:异构图如何把文本知识搬进语音词表示

针对低资源下语音文本对齐需要大编码器和大量平行数据的问题,该文把词级对齐建模为异构图上的链路预测,用 GraphSAGE 消息传递把固定文本表示传给语音节点,在 TIMIT 和 Yemba 上以轻量图训练达到可比 SAMU-XLSR 的富集与检索效果,代价是跨模态检索仍受初始声学质量制约且句子级与下游任务未验证。

 · 更新于 2026-09-25 · 约 18 分钟 · 8776 字 阅读 →
论文解读

参数减三成而精度不掉:低秩频率卷积把噪声范围调对再谈边缘实时

针对单帧变 Q 输入的单音高估计,论文把频率轴空洞卷积拆成秩 9 瓶颈使参数从 17787 降到 11397 且三库精度持平,并证明训练噪声下限从 +6.02 dB 压到 -20 dB 能把 -20 dB 处 RPA50 从 2.44 提到 22.41,代价是干净集掉 0.35 点,自研 C 内核以 83 kB 在四款 CPU 上快于 …

 · 更新于 2026-09-25 · 约 19 分钟 · 9110 字 阅读 →