论文解读

Speaker-Invariant Representation Learning for Spoofing Detection via Gradient Reversal and A Variational Information Bottleneck

对抗训练 | 7.1/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5633 字 阅读 →
论文解读

Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)

语音识别 | 8.2/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6640 字 阅读 →
论文解读

TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints

多模态模型 | 6.4/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6186 字 阅读 →
论文解读

TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech

语音合成 | 8.2/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6310 字 阅读 →
论文解读

What Makes Synthetic Speech Sound Sarcastic? A Prosody-Controlled Perception Study

语音合成 | 7.5/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5055 字 阅读 →
论文解读

Your U-Net Dereverberation Model is Secretly an RIR Encoder

对比学习 | 8.3/10

 · 更新于 2026-09-09 · 约 9 分钟 · 4101 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-09

共分析 48 篇语音/AI 论文

 · 更新于 2026-09-09 · 约 141 分钟 · 70154 字 阅读 →
论文解读

A Large-Scale Per-Speaker Analysis of Re-identification Risk in Speech Anonymization

语音匿名化 | 7.1/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5018 字 阅读 →
论文解读

Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition

语音情感识别 | 7.8/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5285 字 阅读 →
论文解读

Assessing True Generalisability of Audio-Visual Speech Recognisers

语音识别 | 9.5/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6841 字 阅读 →
论文解读

Audio Imitator: Controlling Timbre and Tempo in Video2Audio Synthesis with Audio Reference

音频生成 | 6/10

 · 更新于 2026-09-09 · 约 29 分钟 · 14265 字 阅读 →
论文解读

Audio-Oscar: A Multi-Agent System for Complex Audio Scene Generation, Orchestration, and Refinement

音频生成 | 9.9/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5926 字 阅读 →
论文解读

Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models

语音合成 | 9.2/10

 · 更新于 2026-09-09 · 约 26 分钟 · 12718 字 阅读 →
论文解读

BiEAR: A Human Auditory-Inspired Adaptive Binaural Front-end for Multi-Speaker Localisation and Distance Estimation

声源定位 | 8.5/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7142 字 阅读 →
论文解读

Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition

语音识别 | 7.1/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5503 字 阅读 →
论文解读

DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast

扩散模型 | 7.5/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6540 字 阅读 →
论文解读

dots.tts Technical Report

语音合成 | 9/10

 · 更新于 2026-09-09 · 约 7 分钟 · 3032 字 阅读 →
论文解读

Entropy as a Structural Prior: How a Log-Barrier on DiT Belief Space Drives Musical Diversity and Development

音乐生成 | 4.2/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7818 字 阅读 →
论文解读

FIGMA: Towards FIne-Grained Music retrievAl

对比学习 | 7.2/10

 · 更新于 2026-09-09 · 约 10 分钟 · 4878 字 阅读 →
论文解读

FSC-Net: Integrating Fast Fourier Convolutions and Progressive Learning for Speech Bandwidth Extension

音频质量评估 | 6.4/10

 · 更新于 2026-09-09 · 约 20 分钟 · 9847 字 阅读 →