论文解读

Mitigating Language Prior-Induced Hallucinations via Bi-Level Contrastive Decoding

多模态模型 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3934 字 阅读 →
论文解读

Mixture-of-Experts Based Soft-Label Learning for Multi-Label Speech Emotion Recognition

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4604 字 阅读 →
论文解读

MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4488 字 阅读 →
论文解读

MR-FlowDPO: Multi-Reward Direct Preference Optimization for Flow-Matching Text-to-Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5357 字 阅读 →
论文解读

Multi-Layer Attentive Probing Improves Transfer of Audio Representations for Bioacoustics

生物声学 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4488 字 阅读 →
论文解读

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

多模态模型 | 8.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6861 字 阅读 →
论文解读

Optimizing Speech Language Models for Acoustic Consistency

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4747 字 阅读 →
论文解读

Perceptual Quality Assessment for Stylized Talking Heads

模型评估 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4192 字 阅读 →
论文解读

Pianoroll-Event: A Novel Score Representation for Symbolic Music

音乐生成 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4100 字 阅读 →
论文解读

Probing Whisper for Dysarthric Speech in Detection and Assessment

语音生物标志物 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3926 字 阅读 →
论文解读

PSP: An Interpretable Per-Dimension Accent Benchmark for Indic Text-to-Speech

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5099 字 阅读 →
论文解读

Qastanet: A DNN-Based Quality Metric for Spatial Audio

空间音频 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4668 字 阅读 →
论文解读

RAS: a Reliability Oriented Metric for Automatic Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4136 字 阅读 →
论文解读

Reference-Aware SFM Layers for Intrusive Intelligibility Prediction

语音评估 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4990 字 阅读 →
论文解读

Reliable AI via Age-Balanced Validation: Fair Model Selection for Parkinson’s Detection from Voice

语音生物标志物 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4513 字 阅读 →
论文解读

RHO-PERFECT: Correlation Ceiling for Subjective Evaluation Datasets

模型评估 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4357 字 阅读 →
论文解读

Scalable Evaluation for Audio Identification Via Synthetic Latent Fingerprint Generation

音频检索 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3896 字 阅读 →
论文解读

Segmentwise Pruning in Audio-Language Models

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4222 字 阅读 →
论文解读

SFM-TTS: Lightweight and Rapid Speech Synthesis with Flexible Shortcut Flow Matching

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5280 字 阅读 →
论文解读

Sing What You Fit: A Perception-Based Dataset and Benchmark for Vocal-Song Suitability Analysis

音乐信息检索 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 5002 字 阅读 →