论文解读

Towards Blind Data Cleaning: A Case Study in Music Source Separation

音乐信息检索 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4929 字 阅读 →
论文解读

Towards Lightweight Adaptation of Speech Enhancement Models in Real-World Environments

语音增强 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4520 字 阅读 →
论文解读

Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER

语音识别 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4930 字 阅读 →
论文解读

Training Flow Matching Models with Reliable Labels via Self-Purification

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4189 字 阅读 →
论文解读

Transferable Audio Lottery Tickets: Gradient Accumulation for Extreme Sparsity

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3873 字 阅读 →
论文解读

Two-Stage Language Model Framework for Acoustic Echo Cancellation

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4401 字 阅读 →
论文解读

UMV: A Mixture-Of-Experts Vision Transformer with Multi-Spectrogram Fusion for Underwater Ship Noise Classification

音频分类 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4212 字 阅读 →
论文解读

UNet-Based Fusion and Exponential Moving Average Adaptation for Noise-Robust Speaker Recognition

说话人验证 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5394 字 阅读 →
论文解读

Unseen but Not Unknown: Using Dataset Concealment to Robustly Evaluate Speech Quality Estimation Models

语音质量评估 | 8.3/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4293 字 阅读 →
论文解读

Voting-Based Pitch Estimation with Temporal and Frequential Alignment and Correlation Aware Selection

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5178 字 阅读 →
论文解读

Wave-Trainer-Fit: Neural Vocoder With Trainable Prior And Fixed-Point Iteration Towards High-Quality Speech Generation From SSL Features

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5135 字 阅读 →
论文解读

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4322 字 阅读 →
论文解读

When Voice Matters: A Controlled Study of Audio LLM Behavior in Clinical Decision-Making

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3980 字 阅读 →
论文解读

RAS: a Reliability Oriented Metric for Automatic Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4410 字 阅读 →
论文解读

Robust Audio-Text Retrieval via Cross-Modal Attention and Hybrid Loss

音频检索 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4499 字 阅读 →
论文解读

Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5316 字 阅读 →
论文解读

"This Wasn't Made for Me": Recentering User Experience and Emotional Impact in the Evaluation of ASR Bias

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1997 字 阅读 →
论文解读

Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4532 字 阅读 →
论文解读

Before the Mic: Physical-Layer Voiceprint Anonymization with Acoustic Metamaterials

这篇论文针对在公共场景(如会议、演讲)中,不可信录音设备可能导致声纹泄露且事后无法补救的问题,提出了EchoMask——首个基于声学超材料的物理层实时声纹匿名化系统。其核心方法是在声音到达麦克风前,通过精心设计的被动声学结构对特定低频段(300-700Hz)进行选择性干扰,该频段对说话人识别至关重要

 · 更新于 2026-09-25 · 约 9 分钟 · 4040 字 阅读 →
论文解读

Enhancing Speaker Verification with Whispered Speech via Post-Processing

1. **问题**:耳语语音因缺乏声带振动,其声学特征与正常语音差异显著,导致现有的说话人验证系统性能严重下降。这在用户为保护隐私而低语、或因疾病无法正常发声等实际场景中构成挑战。 2. **方法核心**:在预训练的说话人验证骨干网络(ReDimNet-B6)之上,添加一个轻量级的编码器-解码器结构

 · 更新于 2026-09-25 · 约 10 分钟 · 4925 字 阅读 →