论文解读

ARENA: Automated Red-Teaming for Large Audio Language Models

音频理解 | 6.5/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7088 字 阅读 →
论文解读

AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization

音频编码 | 3.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6965 字 阅读 →
论文解读

Cached LLM Probability Retrieval for Speech Recognition

语音识别 | 6.1/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7301 字 阅读 →
论文解读

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

音视频语音合成 | 7.3/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6606 字 阅读 →
论文解读

CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection

音视频理解 | 7.2/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8197 字 阅读 →
论文解读

Contrastive Learning with Variational Regularization for Multi-Session EEG-to-Speech Decoding

语音合成 | 5.9/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6339 字 阅读 →
论文解读

Distinguishing AI-Generated Music from Edited Audio as a Hard-Negative Robustness Task

音频伪造检测 | 5.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7071 字 阅读 →
论文解读

DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

语音合成 | 6.1/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6343 字 阅读 →
论文解读

Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails

音频事件检测 | 6.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5752 字 阅读 →
论文解读

Feedforward Active Speech Suppression Based on Time Series Prediction of Speech Signals Using Neural Networks

语音增强 | 5.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5815 字 阅读 →
论文解读

Geometry-adaptive Ambisonic encoding for sparse microphone arrays of variable topology using physics-informed diffusion

空间音频 | 6.2/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8580 字 阅读 →
论文解读

How Fragile Is Your Watermark? Training-Free Structural Removal of Neural Audio Watermarks

音频水印 | 7.6/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7533 字 阅读 →
论文解读

Impulse Response Estimation via Laguerre-Fourier Expansion

音频理解 | 6.8/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9364 字 阅读 →
论文解读

INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval

音频检索 | 7.9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6787 字 阅读 →
论文解读

Iterative Self-Learning for Expressive Text-to-Speech Synthesis

语音合成 | 6.1/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7178 字 阅读 →
论文解读

Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization

音频理解 | 6.8/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7525 字 阅读 →
论文解读

Moving Horizon Estimation for Underwater Target Tracking Based on Time-Difference-of-Arrival Measurements

声源定位 | 6.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5318 字 阅读 →
论文解读

Multi-Granularity Sentiment Integration for LLM-Based Multimodal Sentiment Analysis

音视频理解 | 6.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6485 字 阅读 →
论文解读

Multi-Modal Generative Fuzzy System: Fuzzy Inference Guided Large Model Interactive Question Answering Framework

音视频问答 | 5.9/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5449 字 阅读 →
论文解读

Navigating Speech Enhancement for Real-Time MRI: A Systematic Assessment of Signal Quality, Source Preservation, and Downstream Tasks

语音增强 | 5.7/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8798 字 阅读 →