论文解读

CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries

音频检索 | 8.5/10

 · 更新于 2026-09-14 · 约 8 分钟 · 3821 字 阅读 →
论文解读

CCST: Cross-Modal and Consistency-Aware Self-Training for Source-Free Unsupervised Domain Adaptation in Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-14 · 约 13 分钟 · 6342 字 阅读 →
论文解读

Chunk-Wise Attention Transducers for Fast and Accurate Streaming Speech-to-Text

语音识别 | 7.5/10

 · 更新于 2026-09-14 · 约 10 分钟 · 4722 字 阅读 →
论文解读

Chunkwise Aligners for Streaming Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-14 · 约 9 分钟 · 4405 字 阅读 →
论文解读

Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources

音频场景理解 | 7.5/10

 · 更新于 2026-09-14 · 约 9 分钟 · 4177 字 阅读 →
论文解读

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

基准测试 | 7.0/10

 · 更新于 2026-09-14 · 约 8 分钟 · 3824 字 阅读 →
论文解读

Clue2Emo: A Brain-Inspired Framework for Open-Vocabulary Multimodal Emotion Recognition

语音情感识别 | 8.5/10

 · 更新于 2026-09-14 · 约 12 分钟 · 6003 字 阅读 →
论文解读

CMSA-Mamba: Hierarchical State Space Modeling for Audio-Based Depression Detection

语音生物标志物 | 7.0/10

 · 更新于 2026-09-14 · 约 9 分钟 · 4290 字 阅读 →
论文解读

Co-Initialization of Control Filter and Secondary Path via Meta-Learning for Active Noise Control

音频安全 | 7.5/10

 · 更新于 2026-09-14 · 约 11 分钟 · 5076 字 阅读 →
论文解读

CodecSlime: Temporal Redundancy Compression of Neural Speech Codec via Dynamic Frame Rate

语音编码 | 7.5/10

 · 更新于 2026-09-14 · 约 12 分钟 · 5581 字 阅读 →
论文解读

CodeSep: Low-Bitrate Codec-Driven Speech Separation with Base-Token Disentanglement and Auxiliary-Token Serial Prediction

语音分离 | 7.5/10

 · 更新于 2026-09-14 · 约 13 分钟 · 6108 字 阅读 →
论文解读

Combining Multi-Order Attention and Multi-Resolution Discriminator for High-Fidelity Neural Vocoder

语音合成 | 6.5/10

 · 更新于 2026-09-14 · 约 13 分钟 · 6236 字 阅读 →
论文解读

Combining SSL Speech Features, Contextual Transformers and Mamba Models for Realistic Audio Spoofing Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-14 · 约 9 分钟 · 4304 字 阅读 →
论文解读

Compression meets Sampling: LZ78-SPA for Efficient Symbolic Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-14 · 约 12 分钟 · 5902 字 阅读 →
论文解读

CompSpoof: A Dataset and Joint Learning Framework for Component-Level Audio Anti-Spoofing Countermeasures

音频深度伪造检测 | 7.0/10

 · 更新于 2026-09-14 · 约 11 分钟 · 5184 字 阅读 →
论文解读

Condition-Invariant fMRI decoding of speech intelligibility with deep state space model

神经解码 | 7.0/10

 · 更新于 2026-09-14 · 约 9 分钟 · 4075 字 阅读 →
论文解读

Conditional Diffusion Models for Mental Health-Preserving Voice Conversion

语音转换 | 8.0/10

 · 更新于 2026-09-14 · 约 10 分钟 · 4927 字 阅读 →
论文解读

Confidence-Based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens

语音增强 | 6.5/10

 · 更新于 2026-09-14 · 约 10 分钟 · 4790 字 阅读 →
论文解读

Confidence-Guided Error Correction for Disordered Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-14 · 约 10 分钟 · 4863 字 阅读 →
论文解读

Connecting Layer-Wise Representation of Wavlm with Spectro-Temporal Modulation on Speaker Verification

说话人验证 | 6.0/10

 · 更新于 2026-09-14 · 约 9 分钟 · 4366 字 阅读 →