论文解读

A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

语音质量评估 | 8.7/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9401 字 阅读 →
论文解读

Best-of-N TTS Evaluation is Confounded by ASR Family Alignment

语音质量评估 | 6.7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6832 字 阅读 →
论文解读

Best-of-N TTS Evaluation is Confounded by ASR Family Alignment

语音合成 | 8.7/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9056 字 阅读 →
论文解读

Inverse-designed meta processing units for multi-task near-field photonic computing

音频理解 | 6.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6789 字 阅读 →
论文解读

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

多模态模型 | 6.9/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6518 字 阅读 →
论文解读

On the Role of Conversational Timing in Synthetic Training Data for ASR

语音识别 | 6.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6828 字 阅读 →
论文解读

InsideSSL: Understanding Self-Supervised Speech Representations using a Model-Centric Perspective

语音属性识别 | 7.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7432 字 阅读 →
论文解读

CaReCoS: A Spectrogram based Visual Benchmark for Cardiac, Respiratory and Cough Sounds

音频理解 | 6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7796 字 阅读 →
论文解读

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models

语音交互 | 8.9/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7382 字 阅读 →
论文解读

FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors

语音伪造检测 | 6.8/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6644 字 阅读 →
论文解读

Real-World Unsupervised Models Generalize to Predict Brain Responses to Out-of-Distribution Stimuli

模型评估 | 6.9/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9530 字 阅读 →
论文解读

TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue

语音交互 | 7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5205 字 阅读 →
论文解读

ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

音频理解 | 7.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8254 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-02

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 49 分钟 · 24050 字 阅读 →
论文解读

Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation

语音合成 | 7.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7931 字 阅读 →
论文解读

Underwater Source Detection and Classification for Signal-based Surveillance: Audio Dataset Curation and Cross-Domain Evaluation

数据集 | 7.8/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4494 字 阅读 →
论文解读

RedVox: Safety and Fairness Gaps in Speech Models Across Languages

基准测试 | 6.8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4946 字 阅读 →
论文解读

BCoughBench: Benchmarking Respiratory Acoustic Foundation Models Under Body-Coupled Wearable Sensor Conditions

基准测试 | 6.7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6270 字 阅读 →
论文解读

From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5630 字 阅读 →
论文解读

Evaluating Dynamic Range Compressor Models Using Control-Voltage Measurements: an Approach and Dataset

模型评估 | 7.8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 5005 字 阅读 →