论文解读

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

本文旨在解决大型音频语言模型在复杂音频场景中因感知错误导致的推理失败问题。受听觉场景分析启发,作者提出了一个感知接地的混合推理框架。首先,他们构建了一个名为PAQA的新数据集,通过层次化解耦策略(区分

 · 更新于 2026-09-18 · 约 13 分钟 · 6065 字 阅读 →
论文解读

Listening Deepfake Detection: A New Perspective Beyond Speaking-Centric Forgery Analysis

本文首次提出了“聆听深度伪造检测”这一新任务,旨在识别视频中人物在倾听状态下(非说话时)的伪造反应,弥补了现有研究主要集中于“说话”场景的不足。为解决此任务数据稀缺的问题,作者构建了首个专门数据集Li

 · 更新于 2026-09-18 · 约 9 分钟 · 4253 字 阅读 →
论文解读

MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models

本文提出了MoshiRAG,这是首个集成检索增强生成功能的全双工语音语言模型。**要解决的问题**是全双工语音模型在保持实时交互性的同时,事实准确性不足的挑战。**核心方法**是基于Moshi模型,设

 · 更新于 2026-09-18 · 约 11 分钟 · 5300 字 阅读 →
论文解读

On the Distillation Loss Functions of Speech VAE for Unified Reconstruction, Understanding, and Generation

本文针对现有语音变分自编码器(VAE)在统一语音重建、理解和生成任务上表现不平衡的问题(尤其是理解能力差),系统性地研究了蒸馏损失函数的设计空间。作者探索了三种将自监督学习(SSL)模型知识蒸馏到VA

 · 更新于 2026-09-18 · 约 10 分钟 · 4890 字 阅读 →
论文解读

ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks

这篇论文旨在解决当前语音深度伪造检测(SDD)系统在面对富有表现力和情感的合成语音攻击时泛化能力不足的核心问题。现有方法过度依赖伪造数据,容易学习数据集特定的伪影,而非自然语音的可迁移特征。为此,作者

 · 更新于 2026-09-18 · 约 10 分钟 · 4935 字 阅读 →
论文解读

Room compensation for loudspeaker reproduction using a supporting source

本文针对传统房间补偿技术仅能修正频谱(音色)而无法控制空间感知(如距离感)的局限,提出了一种创新的补偿方法。该方法通过引入一个延迟的、经过频谱滤波的辅助扬声器,选择性地向房间的混响声场中添加能量,从而

 · 更新于 2026-09-18 · 约 8 分钟 · 3648 字 阅读 →
论文解读

Sky-Ear: An Unmanned Aerial Vehicle-Enabled Victim Sound Detection and Localization System

本文针对无人机搜救任务中视觉系统受遮蔽、能耗高的问题,提出了一个名为“Sky-Ear”的音频驱动受害者检测与定位系统。核心方法是设计了一个基于环形麦克风阵列的两阶段处理框架:在“哨兵阶段”,系统利用单

 · 更新于 2026-09-18 · 约 13 分钟 · 6117 字 阅读 →
论文解读

SpeakerRPL v2: Robust Open-set Speaker Identification through Enhanced Few-shot Foundation Tuning and Model Fusion

本文旨在解决开放集说话人识别中的鲁棒性问题,即系统在仅有少量目标说话人注册样本的情况下,需同时准确识别已知说话人并可靠拒识未知说话人。作者在先前SpeakerRPL V1框架基础上提出了三项关键改进:

 · 更新于 2026-09-18 · 约 10 分钟 · 4758 字 阅读 →
论文解读

SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding

本文旨在解决大型音频语言模型在**细粒度音频事件时间定位**上的不足。现有模型因训练数据缺乏精确时间戳、基准测试过于简单,导致在长音频中定位短暂事件(“大海捞针”)时表现不可靠。为此,作者提出了**S

 · 更新于 2026-09-18 · 约 11 分钟 · 5348 字 阅读 →
论文解读

StreamMark: A Deep Learning-Based Semi-Fragile Audio Watermarking for Proactive Deepfake Detection

本文针对生成式AI带来的音频深度伪造威胁,提出了一种名为StreamMark的主动防御框架。该框架是一种基于深度学习的半脆弱音频水印系统,其核心创新在于重新定义了水印的目标:不是追求对所有变换的绝对鲁

 · 更新于 2026-09-18 · 约 9 分钟 · 4375 字 阅读 →
论文解读

TokenSE: a Mamba-based discrete token speech enhancement framework for cochlear implants

本文针对人工耳蜗用户在噪声和混响环境下语音理解困难的问题,提出了一种名为TokenSE的语音增强框架。该框架的核心创新在于将语音增强任务从传统的时频域或波形域转换到神经音频编解码器的离散令牌空间中进行

 · 更新于 2026-09-18 · 约 8 分钟 · 3634 字 阅读 →
论文解读

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

本文针对现有音视频(AV)生成模型中存在的运动不真实、声音与运动事件不同步、声音强度与运动强度不匹配等问题,提出了Tora3框架。其核心创新在于**将物体轨迹视为连接视觉与听觉模态的共享运动学先验**

 · 更新于 2026-09-18 · 约 12 分钟 · 5774 字 阅读 →
论文解读

Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt

这篇论文旨在解决大型音频语言模型(LALM)在细粒度时间感知(如精确定位声音事件的起止时间)上的不足。作者提出了**TimePro-RL**框架,其核心是两步走策略:首先,提出**音频侧时间提示(AS

 · 更新于 2026-09-18 · 约 10 分钟 · 4592 字 阅读 →
论文解读

Transformer Based Machine Fault Detection From Audio Input

本文旨在探讨基于Transformer的架构在机器故障音频检测任务上相对于传统卷积神经网络(CNN)的潜在优势。**要解决的问题**是传统CNN在处理频谱图时固有的局部性和平移不变性等归纳偏置,可能并

 · 更新于 2026-09-18 · 约 6 分钟 · 2593 字 阅读 →
论文解读

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations

这篇论文旨在解决通用语音增强(USE)中生成模型面临的“高感知质量”与“低内容幻觉”难以兼得的核心矛盾。作者提出了UniPASE框架,它扩展了其先前的低幻觉PASE模型,以处理包括噪声、混响、丢包、风

 · 更新于 2026-09-18 · 约 14 分钟 · 6902 字 阅读 →
论文解读

VoxEffects: A Speech-Oriented Audio Effects Dataset and Benchmark

本文旨在解决语音处理中一个基础但被忽视的问题:如何系统化地识别语音音频所经过的后期处理效果及其参数。现实中,语音几乎都经过了降噪、压缩等效果处理,但现有数据集缺乏此类精确标注,阻碍了相关研究。为此,作

 · 更新于 2026-09-18 · 约 10 分钟 · 4743 字 阅读 →
论文解读

VoxSafeBench: Not Just What Is Said, but Who, How, and Where

这篇论文旨在解决一个关键问题:当语音大模型(SLM)进入多用户共享环境时,仅基于文本内容的安全对齐策略是不足的,说话人身份、副语言特征和声学场景等音频上下文信息会根本性地改变请求的性质。为此,作者提出

 · 更新于 2026-09-18 · 约 10 分钟 · 4584 字 阅读 →
论文解读

WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training

这篇论文旨在解决端到端语音对话模型在智能(IQ)和表达力(EQ)上难以同时提升的核心挑战。作者发现,直接对混合文本-语音序列应用统一的偏好优化(如DPO、GRPO)会导致问题:稀疏的偏好信号被淹没在密

 · 更新于 2026-09-18 · 约 11 分钟 · 5245 字 阅读 →
论文解读

Who is Speaking or Who is Depressed? A Controlled Study of Speaker Leakage in Speech-Based Depression Detection

这篇论文的核心贡献在于系统性地揭示并量化了语音抑郁症检测模型中普遍存在的“说话人身份泄露”问题。作者指出,当前许多报告高准确率的模型,其性能可能严重依赖于对说话人身份(声纹)的记忆,而非对抑郁相关声学

 · 更新于 2026-09-18 · 约 11 分钟 · 5416 字 阅读 →
论文解读

Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization

这篇论文深入探讨了在端到端音频语言模型中,将视觉信息融入音频分词器时普遍存在的“理解提升但重建质量下降”的核心矛盾。作者通过系统性实验,揭示了三个关键发现:融合位置(在量化前还是量化后)至关重要;在离

 · 更新于 2026-09-18 · 约 10 分钟 · 4838 字 阅读 →