论文解读

一句之内换情绪又变语速:不训练模型只改推理时条件访问

针对一句内多情绪与多语速控制问题,TED-TTS 选择冻结预训练自回归语音合成模型、只在推理时重组条件可见性与终止控制,消融表显示完整方案在过渡平滑与说话人一致性上优于去掉对齐或局部调速的变体,但局部加速仍带来实时因子上升的代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10249 字 阅读 →
论文解读

平滑偏置之下:用模糊视图逼出瞬态证据的解码修正

针对统一大音频语言模型偏向平滑上下文而漏掉短暂声学线索的问题,论文提出只在推理时对比原始与时域模糊音频的对数几率并做门控稀疏修正,在 MMAU 上 Qwen2.5-Omni 平均达 73.2%,代价是每样本多一次慢路径预填充前向与双路解码缓存。

 · 更新于 2026-09-24 · 约 16 分钟 · 7528 字 阅读 →
论文解读

离线大模型不重训怎么做同传:停顿切分加等待策略的测试时适配

论文把同时语音翻译拆成停顿切分与离线多模态大模型增量翻译,用等待块数与每轮生成上限控制延迟,在开发集上以五折交叉验证显示优于级联基线,但大模型推理开销与误差累积仍是代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 8000 字 阅读 →
论文解读

不用真值也能改口音和噪声错误:以音频文本对齐奖励做测试时强化适应

针对 Whisper 类模型在噪声与口音下置信度不可靠的问题,论文用可学习解码器提示加温度采样产生候选并以 CLAP 音频文本相似度做奖励做单样本强化更新,在 LibriSpeech 加噪与 L2-Arctic 上把平均词错误率降到 28.64% 与 28.21%,代价是每次推理需多轮采样打分并在样本后恢复参数。

 · 更新于 2026-09-24 · 约 18 分钟 · 8818 字 阅读 →
论文解读

联合分支不可全信:用冲突量与可干预性重配解码权重

针对全模态大模型中音频视觉联合预测不可靠融合的问题,论文提出免训练的冲突感知解码 CAD,用潜在冲突量与任务空间可干预性决定是否把联合分支权重转给单模态分支,在 Qwen2.5-Omni-7B 上把 CMM 整体准确率提到 85.0% 与 AVHBench 提到 84.1%,代价是每步要跑四个分支并依赖人工阈值。

 · 更新于 2026-09-24 · 约 20 分钟 · 9605 字 阅读 →
论文解读

用 125k 探针在 VAE 潜空间里拨动音高:扩散音乐生成的可控性不在自回归独占

针对 Stable Audio Open 的 VAE 潜空间可解码音高类别这一可验证性质,论文用冻结的微型卷积探针在去噪后 40% 窗口内以 RMS 归一化梯度轻推潜变量,在 27 次配对试验中将旋律一致性从 0.112 提升至 0.274 且未报告音质代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8971 字 阅读 →
论文解读

无语音却有文本:用门控低秩投影在解码器表示层抑制 Whisper 幻觉

针对 Whisper 在无语音输入上生成流畅幻觉文本的问题,论文用无语音校准集估计解码器幻觉子空间并在推理时做低秩投影以提升无语音概率,门控版本在保留语音识别的同时把非语音幻觉率大幅降低。

 · 更新于 2026-09-24 · 约 19 分钟 · 9291 字 阅读 →
论文解读

失配时只听一条语音:用干净先验把增强输出推向高密度区

针对训练与测试噪声失配导致的增强残留噪声,该文用冻结的自回归干净先验对单条测试语音做 KL 散度自适应,在 DNS 等四组数据上主要提升背景抑制,但需早停且初始已干净时收益很小。

 · 更新于 2026-09-24 · 约 19 分钟 · 9429 字 阅读 →
论文解读

EM-KalmanNet: Learned Expectation-Maximization for Adaptive Tracking in Partially Known, Block-Wise Time-Varying State-Space Models

声源定位 | 8.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5988 字 阅读 →
论文解读

Mitigating Over-Suppression in Speech Enhancement via Inference-Time Rethink-and-Refine Correction Module

语音增强 | 6.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5718 字 阅读 →
论文解读

SCoPE: Training-Free Audio-Visual Event Perception via Sparse Cross-Modal Prior Exchange

音视频理解 | 7.1/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7118 字 阅读 →
论文解读

Music Restoration via Latent Operator Optimization and Diffusion Model Priors

音频修复 | 7.0/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6911 字 阅读 →
论文解读

Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation

语音合成 | 7.8/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6646 字 阅读 →
论文解读

Experience-Calibrated Contrastive Decoding for Mitigating Hallucinations in LM-Based Text-to-Speech

语音合成 | 7.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5978 字 阅读 →
论文解读

UOT-IR: Structured Routing of High-Polyphony Symbolic Music into Fixed-Budget Representations

音乐理解 | 5.5/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7767 字 阅读 →
论文解读

Few-Shot Open-Set Audio Classification via Transductive Prototype Refinement and Class Logit Enhancement

音频分类 | 6.8/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7590 字 阅读 →
论文解读

Voice Memory for Agentic Speech Recognition

语音识别 | 8.2/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8134 字 阅读 →
论文解读

Probing Speaker Identity Sensitivity in Audio Deepfake Detectors

语音伪造检测 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6060 字 阅读 →
论文解读

Where Speech Enhancement Hurts Recognition: An Inference Time Polar Projection Diagnosis

语音识别 | 6.7/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9645 字 阅读 →
论文解读

Training-Free Model Selection and Domain-Aware Score Calibration for First-Shot Anomalous Sound Detection

音频事件检测 | 7.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7682 字 阅读 →