论文解读

Predictive Directional Selective Fixed-Filter Active Noise Control for Moving Sources via a Convolutional Recurrent Neural Network

声源定位 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3941 字 阅读 →
论文解读

RTCFake: Speech Deepfake Detection in Real-Time Communication

语音伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4522 字 阅读 →
论文解读

Dilated CNNs for Periodic Signal Processing: A Low-Complexity Approach

语音增强 | 6.5/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2311 字 阅读 →
论文解读

Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge

语音对话系统 | 6.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3206 字 阅读 →
论文解读

Sema: Semantic Transport for Real-Time Multimodal Agents

实时处理 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4888 字 阅读 →
论文解读

Before the Mic: Physical-Layer Voiceprint Anonymization with Acoustic Metamaterials

这篇论文针对在公共场景(如会议、演讲)中,不可信录音设备可能导致声纹泄露且事后无法补救的问题,提出了EchoMask——首个基于声学超材料的物理层实时声纹匿名化系统。其核心方法是在声音到达麦克风前,通过精心设计的被动声学结构对特定低频段(300-700Hz)进行选择性干扰,该频段对说话人识别至关重要

 · 更新于 2026-09-25 · 约 9 分钟 · 4040 字 阅读 →
论文解读

Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model

1. **要解决什么问题**:现有基于生成模型(如扩散模型、自回归模型)的目标说话人提取(TSE)方法依赖全局上下文,难以直接用于实时流式场景,强行适配会导致性能严重下降。 2. **方法核心是什么**:提出首个面向流式TSE的自回归(AR)框架,核心是“分块交错拼接范式”。该范式将混合语音分块

 · 更新于 2026-09-25 · 约 11 分钟 · 5046 字 阅读 →
论文解读

BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps

本文针对符号音乐生成中主流的事件序列(event-based)tokenization方法隐含处理时间规律、导致模型需额外学习时间网格的问题,提出了一种名为**BEAT**的新型网格化tokenization框架。其核心思想是将音乐在时间上均匀离散化为“拍”(beat)作为基本单位,将每拍内每个音高

 · 更新于 2026-09-25 · 约 10 分钟 · 4791 字 阅读 →
论文解读

MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models

这篇论文旨在解决当前全双工语音语言模型(FD-SLMs)评测体系的一个关键缺陷:缺乏对多轮、连续对话能力的系统性评估。现有基准多关注单轮交互或特定对话特性(如打断),忽略了模型在多轮语境下维持指令遵循、安全等核心能力的一致性。为此,作者提出了**MTR-DuplexBench**,一个全新的多轮全双

 · 更新于 2026-09-25 · 约 9 分钟 · 4354 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-22

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 44 分钟 · 21691 字 阅读 →
论文解读

Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency

这篇论文针对当前全双工语音代理评估缺乏真实性(依赖合成语音)和任务简单性(单步调用)的问题,提出了**Full-Duplex-Bench-v3 (FDB-v3)** 基准。该基准的核心创新在于使用**100条真实人类录音**(含五种不流畅性注释),在四个任务域中设计了需要**多步API链式调用**的

 · 更新于 2026-09-25 · 约 8 分钟 · 3607 字 阅读 →
论文解读

MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models

本文旨在解决全双工语音语言模型(如Moshi)事实性不足的核心问题,同时不牺牲其高交互性。**问题**:全双工模型能实时打断和回应,但因训练数据规模远小于文本,其知识储备和事实准确性较弱。**方法**:提出了MoshiRAG,一个模块化框架。它在Moshi模型中引入一个特殊的``检索触发令

 · 更新于 2026-09-25 · 约 12 分钟 · 5609 字 阅读 →
论文解读

An Ultra-Low Latency, End-to-End Streaming Speech Synthesis Architecture via Block-Wise Generation and Depth-Wise Codec Decoding

这篇论文旨在解决实时交互式语音合成中**推理延迟高**与**声学质量(尤其是高频细节)易受损**的核心矛盾。传统流水线依赖计算密集的神经声码器进行波形重建,且基于连续回归的声学模型易导致频谱过平滑。为

 · 更新于 2026-09-25 · 约 10 分钟 · 4673 字 阅读 →
论文解读

Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models

本文旨在解决全双工语音对话模型(SDMs)实现类人交互的核心挑战。现有自动化评估指标流于表面(如统计行为或预测时机准确率),无法为强化学习提供可靠的奖励信号,而人工评估成本高昂且难以扩展。为此,作者提

 · 更新于 2026-09-25 · 约 12 分钟 · 5601 字 阅读 →
论文解读

Four Decades of Digital Waveguides

这篇论文旨在全面回顾数字波导物理建模技术自诞生以来四十年的发展历程、核心应用与最新进展。它要解决的核心问题是,如何在保证物理模拟准确性的同时,实现声波传播模拟的高效计算,以满足实时音频处理(如虚拟乐器

 · 更新于 2026-09-25 · 约 8 分钟 · 3950 字 阅读 →