论文解读

Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra

音乐生成 | 8.7/10

 · 更新于 2026-09-06 · 约 3 分钟 · 1221 字 阅读 →
论文解读

Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling

空间音频 | 7.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6054 字 阅读 →
论文解读

Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

语音交互 | 6.6/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6124 字 阅读 →
论文解读

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

空间音频 | 7.9/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5435 字 阅读 →
论文解读

Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding

音频理解 | 7.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6380 字 阅读 →
论文解读

EM-KalmanNet: Learned Expectation-Maximization for Adaptive Tracking in Partially Known, Block-Wise Time-Varying State-Space Models

声源定位 | 8.8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5988 字 阅读 →
论文解读

EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis

语音合成 | 9.6/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5401 字 阅读 →
论文解读

EXAM²: Extending Audio Understanding in Multilingual and Multimodal Analysis

音频理解 | 8.7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5452 字 阅读 →
论文解读

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

音频理解 | 8.7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6164 字 阅读 →
论文解读

From local kernels to global form: modeling the emergence of musical content

音乐理解 | 8.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5260 字 阅读 →
论文解读

Investigating voiced and unvoiced regions of speech for audio deepfake detection

语音伪造检测 | 6.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6842 字 阅读 →
论文解读

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

音视频理解 | 9.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6559 字 阅读 →
论文解读

Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts

音频理解 | 8.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6093 字 阅读 →
论文解读

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

音频质量评估 | 7.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6318 字 阅读 →
论文解读

On the Robustness of Audio Deepfake Detection under Audio Watermarking

音频伪造检测 | 7.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5950 字 阅读 →
论文解读

One Timeline, Many Renderings: A Wolfram Language Paclet for heterogeneous musical output

音乐生成 | 7.0/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7660 字 阅读 →
论文解读

Preference Optimization for Non-Verbal Vocalization Synthesis

语音合成 | 7.1/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6013 字 阅读 →
论文解读

REDnet: Recursive Encoder and Decoder for Speech Separation under Unknown Number of Speakers and Variable Number of Microphones

语音分离 | 8.2/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5941 字 阅读 →
论文解读

Relative Time Intervals Representation for Word-level Timestamping with Masked Training

语音识别 | 8.6/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6295 字 阅读 →
论文解读

SonarLLM: A Native Sonar--Optical Multimodal Large Language Model for Underwater Perception

音频理解 | 8.0/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7258 字 阅读 →