论文解读

AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling

音频编码 | 7.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8374 字 阅读 →
论文解读

Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs

语音编辑 | 6.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5409 字 阅读 →
论文解读

Mitigating Multimodal Inconsistency via Cognitive Dual-Pathway Reasoning for Intent Recognition

意图识别 | 7.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9463 字 阅读 →
论文解读

Anisotropic Modality Align

Anisotropic Modality Align

 · 更新于 2026-09-25 · 约 16 分钟 · 7980 字 阅读 →
论文解读

Zero-Shot Imagined Speech Decoding via Imagined-to-Listened MEG Mapping

Zero-Shot Imagined Speech Decoding via Imagined-to-Listened MEG Mapping

 · 更新于 2026-09-25 · 约 13 分钟 · 6248 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-11

共分析 12 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 41 分钟 · 20158 字 阅读 →
论文解读

Modality-Aware Contrastive and Uncertainty-Regularized Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7828 字 阅读 →
论文解读

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization

音频编码 | 7.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6791 字 阅读 →
论文解读

PHALAR: Phasors for Learned Musical Audio Representations

音乐信息检索 | 8.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6876 字 阅读 →
论文解读

SEI-SHIELD: Robust Specific Emitter Identification Under Label Noise Via Self-Supervised Filtering and Iterative Rescue

信号处理 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6041 字 阅读 →
论文解读

Contrastive Regularization for Accent-Robust ASR

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3952 字 阅读 →
论文解读

DECKER: Domain-invariant Embedding for Cross-Keyboard Extraction and Recognition

音频安全 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5862 字 阅读 →
论文解读

PHALAR: Phasors for Learned Musical Audio Representations

音乐信息检索 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5654 字 阅读 →
论文解读

ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval

音频检索 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5435 字 阅读 →
论文解读

Toward Structural Multimodal Representations: Specialization, Selection, and Sparsification via Mixture-of-Experts

多模态模型 | 7.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6070 字 阅读 →
论文解读

MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4252 字 阅读 →
论文解读

Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time

多模态幻觉缓解 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5400 字 阅读 →
论文解读

Multi-Axis Speech Similarity via Factor-Partitioned Embeddings

音频检索 | 6.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4834 字 阅读 →
论文解读

PC-MNet: Dual-Level Congruity Modeling for Multimodal Sarcasm Detection via Polarity-Modulated Attention

多模态讽刺检测 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6125 字 阅读 →
论文解读

Beyond Instance-Level Alignment: Dual-Level Optimal Transport for Audio-Text Retrieval

音频检索 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4524 字 阅读 →