论文解读

Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?

模型评估 | 6.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4504 字 阅读 →
论文解读

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3824 字 阅读 →
论文解读

Combining Multi-Order Attention and Multi-Resolution Discriminator for High-Fidelity Neural Vocoder

语音合成 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6236 字 阅读 →
论文解读

Content Leakage in Librispeech and its Impact on the Privacy Evaluation of Speaker Anonymization

语音匿名化 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3586 字 阅读 →
论文解读

Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation

生成模型 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5619 字 阅读 →
论文解读

DISSR: Disentangling Speech Representation for Degradation-Prior Guided Cross-Domain Speech Restoration

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5058 字 阅读 →
论文解读

Do Bias Benchmarks Generalise? Evidence from Voice-Based Evaluation of Gender Bias in Speechllms

模型评估 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4695 字 阅读 →
论文解读

Do Speech LLMs Learn Crossmodal Embedding Spaces?

音频检索 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4063 字 阅读 →
论文解读

Do You Hear What I Mean? Quantifying the Instruction-Perception GAP in Instruction-Guided Expressive Text-to-Speech Systems

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4453 字 阅读 →
论文解读

DSRMS-TransUnet: A Decentralized Non-Shifted Transunet for Shallow Water Acoustic Source Range Estimation

声源定位 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4613 字 阅读 →
论文解读

Efficient Audio-Visual Inference Via Token Clustering And Modality Fusion

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4866 字 阅读 →
论文解读

Enhancing Speech Intelligibility Prediction for Hearing Aids with Complementary Speech Foundation Model Representations

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3521 字 阅读 →
论文解读

Evaluating Bias in Spoken Dialogue LLMs for Real-World Decisions and Recommendations

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3876 字 阅读 →
论文解读

Evaluating Compositional Structure in Audio Representations

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4315 字 阅读 →
论文解读

Evaluating Disentangled Representations for Controllable Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 4005 字 阅读 →
论文解读

Evaluating Emotion Recognition in Spoken Language Models on Emotionally Incongruent Speech

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3322 字 阅读 →
论文解读

Evaluating High-Resolution Piano Sustain Pedal Depth Estimation with Musically Informed Metrics

音乐信息检索 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4473 字 阅读 →
论文解读

Evaluating Pretrained Speech Embedding Systems for Dysarthria Detection Across Heterogenous Datasets

语音生物标志物 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3927 字 阅读 →
论文解读

Exploring How Audio Effects Alter Emotion with Foundation Models

音乐理解 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4321 字 阅读 →
论文解读

Fine-Grained Frame Modeling in Multi-Head Self-Attention for Speech Deepfake Detection

语音伪造检测 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4097 字 阅读 →