论文解读

从直接配音到导演-演员磨合:用检索增强补情感功课的配音模型

针对仅对目标语句做跨模态建模导致情感表达不足的问题,论文用多模态参考片段库加情感相似检索与渐进图融合来模拟导演给素材、演员逐步内化的流程,在 V2C-Animation 上把情感准确率做到 47.21%,代价是需要维护检索库并做三阶段图编码。

 · 更新于 2026-09-24 · 约 19 分钟 · 9141 字 阅读 →
论文解读

分数之外保留证据:可审计决策记录如何改进语音伪造检测的复核

在 ASVspoof 5 Track 1 的 4,080 条匹配子集上,用被动分数、键控探针、检索与说话人轮廓四路证据组成可审计记录并做晚期校准,使检索增强的固定融合从 15.84% 降至 11.91% EER、校准后达 8.43% EER 并在 33.75% 复核预算下覆盖 82.85% 错误,但最强被动 WavLM 仍为 6.71% EER。

 · 更新于 2026-09-24 · 约 20 分钟 · 9747 字 阅读 →
论文解读

语音上下文不能只存文字:用有界编排同时管住说什么、怎么说和何时打断

llmovoice 把语音交互的上下文拆成语义、副语言与环境三状态,用 VoicePage/VoiceThread 组织记忆并在预算内投影到上下文窗口,再让服务模型联合推理生成运行时指令,在丢包下把误打断率从 46.0% 降至 0.9%、每轮成本最高降低 24.9 倍,代价是编排调用时约 790 ms 的额外决策延迟与摘要压缩带来的细节丢失。

 · 更新于 2026-09-24 · 约 25 分钟 · 12248 字 阅读 →
论文解读

检索增强让高层意图变低层声学:用锚点保检索、用描述做转向的标题投毒

针对检索增强的文本到音乐生成中用检索到的标题改写用户高层提示的依赖,论文提出保留高层锚点并注入低层声学描述的双层标题投毒,使投毒后生成音频与攻击目标类别的 CLAP 相似度从 0.21-0.28 提升到 0.41-0.48,同时与原始用户问题的相似度维持在约 0.30 附近。

 · 更新于 2026-09-24 · 约 21 分钟 · 10208 字 阅读 →
论文解读

Bypassing Direct Reconstruction: Speech Detection from MEG via Large-Scale Audio Retrieval

语音活动检测 | 7.0/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9877 字 阅读 →
论文解读

A Decomposed Retrieval-Edit-Rerank Framework for Chord Generation

A Decomposed Retrieval-Edit-Rerank Framework for Chord Generation

 · 更新于 2026-09-24 · 约 15 分钟 · 7086 字 阅读 →
论文解读

Unified Multi-Modal Interactive and Reactive 3D Motion Generation via Rectified Flow

动作生成 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4802 字 阅读 →
论文解读

Feedback-Driven Retrieval-Augmented Audio Generation with Large Audio Language Models

音频生成 | 6.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5723 字 阅读 →
论文解读

Language-Infused Retrieval-Augmented CTC with Adaptive Soft-Hard Gating for Robust Code-Switching ASR

语音识别 | 8.0/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3170 字 阅读 →
论文解读

Mispronunciation Detection and Diagnosis Without Model Training: A Retrieval-Based Approach

语音评估 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4234 字 阅读 →
论文解读

ICLAD: In-Context Learning with Comparison-Guidance for Audio Deepfake Detection

本文针对音频深度伪造检测模型在真实场景(in-the-wild)中泛化能力差的核心问题,提出了一种名为ICLAD的全新范式。该框架利用音频语言模型(ALM)的上下文学习能力,实现了无需训练的快速适应。其核心是创新的**成对比较推理**策略:在离线阶段,引导ALM为每个样本同时生成“真实”和“伪造”的

 · 更新于 2026-09-24 · 约 13 分钟 · 6206 字 阅读 →