论文解读

Aligning MusicLLM with Emotion using Instruction Tuning and Feedback-Driven Alignment

音乐情感识别 | 4.9/10

 · 更新于 2026-09-07 · 约 21 分钟 · 10281 字 阅读 →
论文解读

Audio--Image Alignment as a Continued-Pretraining Stage Improves Low-Resource ASR

语音识别 | 6.2/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6034 字 阅读 →
论文解读

Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement

语音增强 | 8.1/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4879 字 阅读 →
论文解读

Autoencoder based optimized SSL representations: Complexity Minimization and improved Dysarthric ASR

语音识别 | 5.5/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4861 字 阅读 →
论文解读

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

多模态模型 | 8.4/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6088 字 阅读 →
论文解读

BanglaFake: Constructing and Evaluating a Specialized Bengali Deepfake Audio Dataset

音频深度伪造检测 | 9/10

 · 更新于 2026-09-07 · 约 9 分钟 · 4225 字 阅读 →
论文解读

Beyond U-Net: A Latent-Representation-Aligned Skip-Free Backbone for Flow-Matching Speech Enhancement

语音增强 | 6.6/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6019 字 阅读 →
论文解读

Breaking Shortcut Learning for Cross-Trial EEG-Guided Target Speech Extraction via Two-Stage Training

对比学习 | 8.6/10

 · 更新于 2026-09-07 · 约 12 分钟 · 5745 字 阅读 →
论文解读

CN-NewsTTS Bench: a target-level automatic benchmark for raw-input Chinese news TTS pronunciation

语音合成 | 9.2/10

 · 更新于 2026-09-07 · 约 18 分钟 · 8986 字 阅读 →
论文解读

Comparative Reasoning: Making an Audio Language Model Better at Comparing Emotions

语音情感识别 | 7.5/10

 · 更新于 2026-09-07 · 约 14 分钟 · 6591 字 阅读 →
论文解读

Data Scale, Not Latency, Shapes Cross-Lingual Encoder Transfer in Streaming ASR

语音识别 | 9/10

 · 更新于 2026-09-07 · 约 14 分钟 · 6751 字 阅读 →
论文解读

Digital Revival: Acoustic Documentation and Digital Reactivation of Historical Woodwind Instruments

音乐生成 | 5.3/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5086 字 阅读 →
论文解读

DTT-BSR+: A Generative-Regression Cascade for Music Source Restoration

生成对抗网络 | 8/10

 · 更新于 2026-09-07 · 约 12 分钟 · 5749 字 阅读 →
论文解读

Evaluation of Headrest-Integrated Loudspeakers for Enhanced Spatial Audio Immersion in Automotive Cabins

Evaluation of Headrest-Integrated Loudspeakers for Enhanced Spatial Audio Immersion in Automotive Cabins

 · 更新于 2026-09-07 · 约 22 分钟 · 10532 字 阅读 →
论文解读

Heterogeneous 2D/1D Signal Representation Fusion for Underwater Acoustic Modulation Recognition Under Distribution Shift

Heterogeneous 2D/1D Signal Representation Fusion for Underwater Acoustic Modulation Recognition Under Distribution Shift

 · 更新于 2026-09-07 · 约 14 分钟 · 6620 字 阅读 →
论文解读

It's Complicated: On the Design and Evaluation of AI-Powered AAC Interfaces

大语言模型 | 5.5/10

 · 更新于 2026-09-07 · 约 8 分钟 · 3638 字 阅读 →
论文解读

Joint Learning of Covariance Estimation and White Noise Gain for Robust MVDR Beamforming

语音增强 | 5.8/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4629 字 阅读 →
论文解读

Layer-wise Probing of wav2vec 2.0 and Whisper for Consonant Cluster Reduction in African American English

语音识别 | 9.5/10

 · 更新于 2026-09-07 · 约 9 分钟 · 4433 字 阅读 →
论文解读

Measuring User's Mental Models of Speech Translation in Human-AI Collaboration

语音翻译 | 6.6/10

 · 更新于 2026-09-07 · 约 9 分钟 · 4502 字 阅读 →
论文解读

Neuromorphic Speech Enhancement with Dual-Branch Spiking Neural Networks

语音增强 | 7.0/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5146 字 阅读 →