论文解读

不抄答案抄思路:把蒸馏钉在量化器之前

语音识别 | 6.9/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9723 字 阅读 →
论文解读

压住房间的尾音:375bps 里留住混响的衰减骨架

音频编码 | 6.6/10

 · 更新于 2026-09-06 · 约 24 分钟 · 11622 字 阅读 →
论文解读

开耳助听器里漏进来的噪声,为何要让扬声器自己去抵消?

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 27 分钟 · 13172 字 阅读 →
论文解读

1500 个音频 token 真的都需要吗?用等间隔抽样戳破 Whisper 的时域冗余

语音识别 | 7.2/10

 · 更新于 2026-09-06 · 约 21 分钟 · 10278 字 阅读 →
论文解读

把教师的回声残差教给小模型:AEC 蒸馏到底补回了什么

回声消除 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4423 字 阅读 →
论文解读

A Regularized Block Diagonal RLS Algorithm for Acoustic Echo Cancellation

回声消除 | 7.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5120 字 阅读 →
论文解读

PolyChirp: Multi-Species Birdsong Classification Using TinyML on Low-Power Acoustic Sensors

音频分类 | 10.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4900 字 阅读 →
论文解读

sanoTTS: The Smallest Real-Time Neural TTS on a General-Purpose Microcontroller

语音合成 | 10.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4848 字 阅读 →
论文解读

SlimDiffuSE: Towards Efficient Diffusion-Based Speech Enhancement using Slimmable Networks

语音增强 | 7.6/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4594 字 阅读 →
论文解读

μNet: Ultra-Low-Memory and Low-Complexity Speech Enhancement for Embedded Digital Signal Processors

语音增强 | 8.3/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5258 字 阅读 →
论文解读

DAVSS: Distilled Audio-Visual State Space Models

音视频理解 | 6.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5722 字 阅读 →
论文解读

AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization

音频编码 | 3.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6965 字 阅读 →
论文解读

RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation

语音增强 | 6.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6600 字 阅读 →
论文解读

Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

模型剪枝 | 8.4/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7856 字 阅读 →
论文解读

omni-macos: On-Device Omni-Modal Search on Apple Silicon

音频检索 | 7.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6772 字 阅读 →
论文解读

VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

音频理解 | 7.7/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6697 字 阅读 →
论文解读

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

音视频理解 | 7.7/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8473 字 阅读 →
论文解读

AMRD: Adaptive Multi-Teacher Relational Distillation for Lightweight Speech Emotion Recognition

语音情感识别 | 5.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5579 字 阅读 →
论文解读

faster-enhancer.c: A Dependency-Free int8 Runtime for Streaming Speech Enhancement on Commodity CPUs

语音增强 | 8.7/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7387 字 阅读 →
论文解读

OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

音视频问答 | 7.0/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9455 字 阅读 →