论文解读

RCAL: Reinforced Cross-Modal Alignment for Multimodal Sentiment Analysis with Sparse Visual Frames

多模态模型 | 8.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4562 字 阅读 →
论文解读

Reading Between the Waves: Robust Topic Segmentation Using Inter-Sentence Audio Features

音频分类 | 7.0/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5113 字 阅读 →
论文解读

Real-Time Streaming MEL Vocoding with Generative Flow Matching

语音合成 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4120 字 阅读 →
论文解读

Reasoning Driven Captions to Assist Noise Robust Speech Emotion Recognition

语音情感识别 | 7.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4690 字 阅读 →
论文解读

ReCoM: Realistic Co-Speech Motion Generation with Recurrent Embedded Transformer

音频生成 | 7.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4275 字 阅读 →
论文解读

Reconstruction of Spherical Sound Source Radiation Characteristics with Graph Signal Processing

空间音频 | 7.5/10

 · 更新于 2026-09-16 · 约 7 分钟 · 3232 字 阅读 →
论文解读

Recovering Performance in Speech Emotion Recognition from Discrete Tokens Via Multi-Layer Fusion and Paralinguistic Feature Integration

语音情感识别 | 6.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4949 字 阅读 →
论文解读

Reducing Prompt Sensitivity in LLM-Based Speech Recognition Through Learnable Projection

语音识别 | 7.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4818 字 阅读 →
论文解读

Reference Microphone Selection for Guided Source Separation Based on The Normalized L-P Norm

语音增强 | 7.0/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3975 字 阅读 →
论文解读

Reference-Aware SFM Layers for Intrusive Intelligibility Prediction

语音评估 | 7.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4990 字 阅读 →
论文解读

Refgen: Reference-Guided Synthetic Data Generation for Anomalous Sound Detection

音频事件检测 | 7.5/10

 · 更新于 2026-09-16 · 约 8 分钟 · 3682 字 阅读 →
论文解读

Regularized Inverse Filter Design for Rigid Spherical Microphone Array Processing: Laplace- And Time-Domain Representations

空间音频 | 8.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4068 字 阅读 →
论文解读

Relative Time Intervals Representation For Word-Level Timestamping With Masked Training

语音识别 | 8.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4823 字 阅读 →
论文解读

Reliable AI via Age-Balanced Validation: Fair Model Selection for Parkinson’s Detection from Voice

语音生物标志物 | 7.5/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4513 字 阅读 →
论文解读

Representation-Based Data Quality Audits for Audio

数据集 | 7.5/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4054 字 阅读 →
论文解读

Representation-Diverse Self-Supervision for Cross-Domain Bioacoustic Learning in Low-Resource Settings

生物声学 | 7.0/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5415 字 阅读 →
论文解读

Residual Tokens Enhance Masked Autoencoders for Speech Modeling

语音合成 | 7.0/10

 · 更新于 2026-09-16 · 约 11 分钟 · 5021 字 阅读 →
论文解读

Respire-Mamba C-UNet: Consistency-Trained Autoencoder for High-Fidelity Respiratory Sound Compression

音频压缩 | 7.0/10

 · 更新于 2026-09-16 · 约 9 分钟 · 4022 字 阅读 →
论文解读

Rethinking Entity Disambiguation in Complex Modalities

实体消歧 | 8.0/10

 · 更新于 2026-09-16 · 约 10 分钟 · 4884 字 阅读 →
论文解读

Rethinking Music Captioning with Music Metadata LLMS

音乐理解 | 7.0/10

 · 更新于 2026-09-16 · 约 12 分钟 · 5562 字 阅读 →