论文解读

DAVSS: Distilled Audio-Visual State Space Models

音视频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5722 字 阅读 →
论文解读

Fourier is Frontier: Frequency-Aware Autoencoding for High-Fidelity Music Reconstruction

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5015 字 阅读 →
论文解读

Geometric Iterative Retrieval for Neural Audio Codec Resynthesis

音频编码 | 7.6/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5287 字 阅读 →
论文解读

Low-Power, Neuromorphic, Acoustic Anomaly Detection for Persistent Machine Monitoring

音频分类 | 7.3/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5052 字 阅读 →
论文解读

Mitigating Spectral Bias in Neural Operators for Underwater Transmission Loss Prediction

音频理解 | 7.3/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4170 字 阅读 →
论文解读

X2Streaming-TTS: Causal Token-Level Text-to-Speech from Streaming Text with Speech-State Inheritance

语音合成 | 7.9/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4444 字 阅读 →
论文解读

Cached LLM Probability Retrieval for Speech Recognition

语音识别 | 6.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7301 字 阅读 →
论文解读

ParaJSCC: A Parameterized Framework for Reusable Multimodal Joint Source-Channel Coding

音频编码 | 6.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6157 字 阅读 →
论文解读

Xemo-Talker: Unlock Emotions Explicitly for Audio-Driven Talking Portrait Synthesis

音视频生成 | 6.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8252 字 阅读 →
论文解读

Alignment Drift in Single-Model Speculative Decoding for ASR: Mechanism, Correction, and Cost

语音识别 | 7.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6965 字 阅读 →
论文解读

Edge Phoneme Recognition for Children's Speech through Age-Aware Training

语音识别 | 6.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6776 字 阅读 →
论文解读

BAMU: Bitstream-Aware Marginal-Utility Allocation for Frozen Pretrained Neural Speech Codecs

语音编码 | 7.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6455 字 阅读 →
论文解读

Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

模型剪枝 | 8.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7856 字 阅读 →
论文解读

omni-macos: On-Device Omni-Modal Search on Apple Silicon

音频检索 | 7.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6772 字 阅读 →
论文解读

SCoPE: Training-Free Audio-Visual Event Perception via Sparse Cross-Modal Prior Exchange

音视频理解 | 7.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7118 字 阅读 →
论文解读

VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

音频理解 | 7.7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6697 字 阅读 →
论文解读

Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement

语音增强 | 6.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5920 字 阅读 →
论文解读

PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads

音视频生成 | 5.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5522 字 阅读 →
论文解读

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition

语音识别 | 6.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5685 字 阅读 →
论文解读

faster-enhancer.c: A Dependency-Free int8 Runtime for Streaming Speech Enhancement on Commodity CPUs

语音增强 | 8.7/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7387 字 阅读 →