论文解读

WaveNet-Style Guitar Amplifier Model Pruning for Real-Time iOS Deployment

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5705 字 阅读 →
论文解读

Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-Efficient Bengali ASR

语音识别 | 8.8/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9313 字 阅读 →
论文解读

A Quantized Native Runtime for On-Device Semantic Audio Generation

音乐生成 | 8.4/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7893 字 阅读 →
论文解读

It Takes Few to TANGO: A Quantized Distributed Model for Binaural Speech Enhancement

语音增强 | 6.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9170 字 阅读 →
论文解读

It Takes Few to TANGO: A Quantized Distributed Model for Binaural Speech Enhancement

语音增强 | 6.3/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7309 字 阅读 →
论文解读

Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

语音识别 | 7/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9935 字 阅读 →
论文解读

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

音视频问答 | 5.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6882 字 阅读 →
论文解读

EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs

音视频理解 | 6.3/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6514 字 阅读 →
论文解读

IVQ: Structured and Lightweight Vector Quantization via Binary Hierarchical Composition Inspired by \(\textit{IChing}\)

音频编码 | 8.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7794 字 阅读 →
论文解读

LightAVSeg: Lightweight Audio-Visual Segmentation

模型压缩 | 6.3/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8803 字 阅读 →
论文解读

OmniFit: Bridging Modalities via Layer-Adaptive Token Compression for Omnimodal Large Language Models

音视频理解 | 6.3/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8099 字 阅读 →
论文解读

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

音视频问答 | 7.1/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7537 字 阅读 →
论文解读

Quaternion Self-Attention with Shared Scores

语音增强 | 6.3/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10452 字 阅读 →
论文解读

RT-Tango: Real-Time Distributed Binaural Speech Enhancement for Low-Power Hearing Aid Devices

语音增强 | 5.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6468 字 阅读 →
论文解读

AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6668 字 阅读 →
论文解读

FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6790 字 阅读 →
论文解读

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

多模态模型 | 8.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6088 字 阅读 →
论文解读

Neuromorphic Speech Enhancement with Dual-Branch Spiking Neural Networks

语音增强 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5146 字 阅读 →
论文解读

CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models

语音识别 | 8.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5368 字 阅读 →
论文解读

Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5153 字 阅读 →