论文解读

Anomalous Sound Detection Meets Noise-Aware Self-Supervised Learning

音频事件检测 | 7.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6649 字 阅读 →
论文解读

Band-Count Dense Modal Estimation with Fixed-Frequency Differentiable Resonator Refinement

音频理解 | 5.6/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5290 字 阅读 →
论文解读

Beyond One-Size-Fits-All: Personalized and Culturally Adaptive Emotional TTS via Interactive Optimization of Individual Emotion Perception Spaces

语音合成 | 5.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6366 字 阅读 →
论文解读

Calliphony: A Calligraphy-Driven Interface for Real-Time Generative Music Performance

音乐生成 | 5.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6487 字 阅读 →
论文解读

CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis

自回归模型 | 7.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6968 字 阅读 →
论文解读

Cross-cultural evaluation of taste-sound correspondences in AI-generated music

音乐理解 | 7.5/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9448 字 阅读 →
论文解读

DDSynth-RL: Audio Synthesizer Inversion via Discrete Diffusion with Reinforcement Learning

音频生成 | 7.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6266 字 阅读 →
论文解读

Deep Learning-Based Active Trim Panels for Enhanced Aircraft Interior Noise Control

多任务学习 | 5.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5342 字 阅读 →
论文解读

dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model

语音编辑 | 7.4/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7954 字 阅读 →
论文解读

Echo-Aware Modulation for Compact-Latent Frequency-Time Modeling in Lightweight Acoustic Echo Cancellation

语音增强 | 6.3/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7552 字 阅读 →
论文解读

Efficient Audio Enhancement with a Differentiable Psychoacoustic Loss

音频超分辨 | 8.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6540 字 阅读 →
论文解读

Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning

音视频问答 | 4.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5952 字 阅读 →
论文解读

Geometric Cross-Modal Token Selection for Latency-Constrained Multimodal Token Communication

音视频问答 | 6.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5761 字 阅读 →
论文解读

GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model

语音合成 | 8.0/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8648 字 阅读 →
论文解读

Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation

音频理解 | 6.8/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8957 字 阅读 →
论文解读

Language-Specialized Multi-Teacher On-Policy Distillation for Multilingual LLM-Based ASR

语音识别 | 6.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6440 字 阅读 →
论文解读

Latent Softmax for Data-Efficient Phoneme-Based Multilingual ASR Across Tonal and Non-Tonal Languages

语音识别 | 6.3/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5826 字 阅读 →
论文解读

Learning Music Style for Piano Arrangement Through Cross-Modal Bootstrapping

音乐生成 | 6.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7244 字 阅读 →
论文解读

MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation

歌唱生成 | 6.1/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6210 字 阅读 →
论文解读

MEMS Microphones as Ultrasonic Transducers: Nonlinear Electrostatic Actuation and a Parametric Array Prototype

音频生成 | 5.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5133 字 阅读 →