论文解读

LightAVSeg: Lightweight Audio-Visual Segmentation

模型压缩 | 6.3/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8803 字 阅读 →
论文解读

OmniFit: Bridging Modalities via Layer-Adaptive Token Compression for Omnimodal Large Language Models

音视频理解 | 6.3/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8099 字 阅读 →
论文解读

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

音视频问答 | 7.1/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7537 字 阅读 →
论文解读

Quaternion Self-Attention with Shared Scores

语音增强 | 6.3/10

 · 更新于 2026-09-06 · 约 21 分钟 · 10452 字 阅读 →
论文解读

RT-Tango: Real-Time Distributed Binaural Speech Enhancement for Low-Power Hearing Aid Devices

语音增强 | 5.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6468 字 阅读 →
论文解读

AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

语音合成 | 6.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6668 字 阅读 →
论文解读

FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model

语音合成 | 7.2/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6790 字 阅读 →
论文解读

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

多模态模型 | 8.4/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6088 字 阅读 →
论文解读

Neuromorphic Speech Enhancement with Dual-Branch Spiking Neural Networks

语音增强 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5146 字 阅读 →
论文解读

CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models

语音识别 | 8.9/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5368 字 阅读 →
论文解读

Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior

语音识别 | 7.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5153 字 阅读 →
论文解读

FlowFake: Liquid Networks for Audio Deepfake Detection

模型压缩 | 8.5/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6691 字 阅读 →
论文解读

Hybrid Diffusion Transformer for Instruction-Guided Audio Editing via Rectified Flow

Transformer | 7.6/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5452 字 阅读 →
论文解读

CraBERT: Efficient Phoneme Encoder Pre-Training via Cascade Fusion of Subword Representations for Text-to-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5796 字 阅读 →
论文解读

Probing Low Frame Rate Degradation in Neural Audio Codecs

语音生成 | 8.6/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5018 字 阅读 →
论文解读

Efficiency-Performance Trade-offs in Neural Speaker Diarization via Structured Pruning and Low-Bit Quantization

说话人日志 | 5.1/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6022 字 阅读 →
论文解读

Positional Encoding in the Context of Memristor-Based Analog Computation for Automatic Speech Recognition

语音识别 | 8/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4178 字 阅读 →
论文解读

Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment

语音合成 | 9.7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6236 字 阅读 →
论文解读

Massive Open-Vocabulary Keyword Spotting

语音识别 | 9.8/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5180 字 阅读 →
论文解读

SpAArSIST: Sparsified AASIST for Efficient and Reliable Anti-Spoofing

模型压缩 | 7.7/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5272 字 阅读 →