论文解读

SingMOS-Pro: An Comprehensive Benchmark For Singing Quality Assessment

歌唱语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3984 字 阅读 →
论文解读

SP-MCQA: Evaluating Intelligibility of TTS Beyond the Word Level

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4202 字 阅读 →
论文解读

SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4626 字 阅读 →
论文解读

SPAM: Style Prompt Adherence Metric for Prompt-Based TTS

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4628 字 阅读 →
论文解读

Sparse Autoencoders Make Audio Foundation Models More Explainable

模型评估 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4339 字 阅读 →
论文解读

Speech Quality-Based Localization of Low-Quality Speech and Text-to-Speech Synthesis Artefacts

语音质量评估 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4591 字 阅读 →
论文解读

Step-Audio-R1.5 Technical Report

语音对话系统 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4640 字 阅读 →
论文解读

Streamingbench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3905 字 阅读 →
论文解读

StyleBench: Evaluating Speech Language Models on Conversational Speaking Style Control

基准测试 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4238 字 阅读 →
论文解读

SwitchCodec: Adaptive Residual-Expert Sparse Quantization for High-Fidelity Neural Audio Coding

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5387 字 阅读 →
论文解读

Symphony Rendering: Midi and Composer-Conditioned Auto Orchestration with Flow-Matching Transformers

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5626 字 阅读 →
论文解读

Synthetic yet Striking? Assessing Vocal Charisma in TTS via Perceptual and Algorithmic Measures

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4258 字 阅读 →
论文解读

TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics

音频问答 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3624 字 阅读 →
论文解读

Test-Time Scaling for Auditory Cognition in Audio Language Models

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4888 字 阅读 →
论文解读

The 3rd Clarity Prediction Challenge: A Machine Learning Challenge for Hearing aid Speech Intelligibility Prediction

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3264 字 阅读 →
论文解读

The Muse Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMs

音乐理解 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3655 字 阅读 →
论文解读

The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models

基准测试 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3637 字 阅读 →
论文解读

Towards Evaluating Generative Audio: Insights from Neural Audio Codec Embedding Distances

模型评估 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4500 字 阅读 →
论文解读

Towards Robust Dysarthric Speech Recognition: LLM-Agent Post-ASR Correction Beyond WER

语音识别 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4930 字 阅读 →
论文解读

Triad: Tri-Head with Auxiliary Duplicating Permutation Invariant Training for Multi-Task Sound Event Localization and Detection

音频事件检测 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4020 字 阅读 →