论文解读

OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

音视频问答 | 8.3/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8316 字 阅读 →
论文解读

VAD to the Bone: Ultra-Tiny Speech Activity Detection for Edge Deployment

语音活动检测 | 7.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6296 字 阅读 →
论文解读

Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs

语音合成 | 7.6/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6369 字 阅读 →
论文解读

VibeVoice-ASR-BitNet Technical Report

语音识别 | 7.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6193 字 阅读 →
论文解读

Scalable Keyword Spotting via Modular Network Expansion

语音唤醒 | 7.1/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7687 字 阅读 →
论文解读

Ultra-Compact CNN Architectures for Tropical Bird Audio Detection on Microcontrollers

音频事件检测 | 9.3/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7444 字 阅读 →
论文解读

Staged Depth-Pruning Distillation of a Flow-Matching Text-to-Speech Teacher: A Compact Hindi Speech Synthesizer

语音合成 | 7.9/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8461 字 阅读 →
论文解读

Efficient Audio-Visual Event Recognition via Knowledge Distillation and Dynamic INT8 Quantization of a Hybrid Cross-Attention Network

音视频理解 | 5.8/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5753 字 阅读 →
论文解读

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

语音情感识别 | 7.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6817 字 阅读 →
论文解读

CoFi-Lite: Pushing the Limits of Ultra-Lightweight Speech Enhancement

语音增强 | 7.3/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6153 字 阅读 →
论文解读

LightMem-Ego: Your AI Memory for Everyday Life

流式处理 | 5.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5925 字 阅读 →
论文解读

WaveNet-Style Guitar Amplifier Model Pruning for Real-Time iOS Deployment

音频生成 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5705 字 阅读 →
论文解读

Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-Efficient Bengali ASR

语音识别 | 8.8/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9313 字 阅读 →
论文解读

A Quantized Native Runtime for On-Device Semantic Audio Generation

音乐生成 | 8.4/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7893 字 阅读 →
论文解读

It Takes Few to TANGO: A Quantized Distributed Model for Binaural Speech Enhancement

语音增强 | 6.5/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9170 字 阅读 →
论文解读

It Takes Few to TANGO: A Quantized Distributed Model for Binaural Speech Enhancement

语音增强 | 6.3/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7309 字 阅读 →
论文解读

Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

语音识别 | 7/10

 · 更新于 2026-09-06 · 约 20 分钟 · 9935 字 阅读 →
论文解读

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

音视频问答 | 5.9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6882 字 阅读 →
论文解读

EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs

音视频理解 | 6.3/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6514 字 阅读 →
论文解读

IVQ: Structured and Lightweight Vector Quantization via Binary Hierarchical Composition Inspired by \(\textit{IChing}\)

音频编码 | 8.2/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7794 字 阅读 →