论文解读

Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models

本文旨在解决非侵入式语音质量评估在标注数据有限场景下的性能瓶颈。作者提出了GatherMOS框架,其核心是将大语言模型(如GPT-5)作为一个元评估器,通过精心设计的文本提示,融合多类异构信号:包括手

 · 更新于 2026-09-25 · 约 10 分钟 · 4519 字 阅读 →
论文解读

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

本文旨在解决大型音频语言模型在复杂音频场景中因感知错误导致的推理失败问题。受听觉场景分析启发,作者提出了一个感知接地的混合推理框架。首先,他们构建了一个名为PAQA的新数据集,通过层次化解耦策略(区分

 · 更新于 2026-09-25 · 约 13 分钟 · 6065 字 阅读 →
论文解读

On the Distillation Loss Functions of Speech VAE for Unified Reconstruction, Understanding, and Generation

本文针对现有语音变分自编码器(VAE)在统一语音重建、理解和生成任务上表现不平衡的问题(尤其是理解能力差),系统性地研究了蒸馏损失函数的设计空间。作者探索了三种将自监督学习(SSL)模型知识蒸馏到VA

 · 更新于 2026-09-25 · 约 10 分钟 · 4890 字 阅读 →
论文解读

SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding

本文旨在解决大型音频语言模型在**细粒度音频事件时间定位**上的不足。现有模型因训练数据缺乏精确时间戳、基准测试过于简单,导致在长音频中定位短暂事件(“大海捞针”)时表现不可靠。为此,作者提出了**S

 · 更新于 2026-09-25 · 约 11 分钟 · 5348 字 阅读 →
论文解读

Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt

这篇论文旨在解决大型音频语言模型(LALM)在细粒度时间感知(如精确定位声音事件的起止时间)上的不足。作者提出了**TimePro-RL**框架,其核心是两步走策略:首先,提出**音频侧时间提示(AS

 · 更新于 2026-09-25 · 约 10 分钟 · 4592 字 阅读 →
论文解读

Transformer Based Machine Fault Detection From Audio Input

本文旨在探讨基于Transformer的架构在机器故障音频检测任务上相对于传统卷积神经网络(CNN)的潜在优势。**要解决的问题**是传统CNN在处理频谱图时固有的局部性和平移不变性等归纳偏置,可能并

 · 更新于 2026-09-25 · 约 6 分钟 · 2593 字 阅读 →
论文解读

VoxEffects: A Speech-Oriented Audio Effects Dataset and Benchmark

本文旨在解决语音处理中一个基础但被忽视的问题:如何系统化地识别语音音频所经过的后期处理效果及其参数。现实中,语音几乎都经过了降噪、压缩等效果处理,但现有数据集缺乏此类精确标注,阻碍了相关研究。为此,作

 · 更新于 2026-09-25 · 约 10 分钟 · 4743 字 阅读 →
论文解读

VoxSafeBench: Not Just What Is Said, but Who, How, and Where

这篇论文旨在解决一个关键问题:当语音大模型(SLM)进入多用户共享环境时,仅基于文本内容的安全对齐策略是不足的,说话人身份、副语言特征和声学场景等音频上下文信息会根本性地改变请求的性质。为此,作者提出

 · 更新于 2026-09-25 · 约 10 分钟 · 4584 字 阅读 →
论文解读

Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization

这篇论文深入探讨了在端到端音频语言模型中,将视觉信息融入音频分词器时普遍存在的“理解提升但重建质量下降”的核心矛盾。作者通过系统性实验,揭示了三个关键发现:融合位置(在量化前还是量化后)至关重要;在离

 · 更新于 2026-09-25 · 约 10 分钟 · 4838 字 阅读 →