论文解读

VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation

语音情感识别 | 8.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5385 字 阅读 →
论文解读

VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models

模型评估 | 9.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5353 字 阅读 →
论文解读

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

音频检索 | 8.0/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4709 字 阅读 →
论文解读

WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables

基准测试 | 8.0/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4547 字 阅读 →
论文解读

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

音频问答 | 7.0/10

 · 更新于 2026-09-11 · 约 8 分钟 · 3728 字 阅读 →
论文解读

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

基准测试 | 7.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4010 字 阅读 →
论文解读

YuE: Scaling Open Foundation Models for Long-Form Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-11 · 约 14 分钟 · 6983 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-04

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-11 · 约 50 分钟 · 24971 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-03

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-11 · 约 41 分钟 · 20229 字 阅读 →
论文解读

A Brain-Inspired Gating Mechanism Unlocks Robust Computation in Spiking Neural Networks

音频分类 | 7.0/10

 · 更新于 2026-09-11 · 约 12 分钟 · 5996 字 阅读 →
论文解读

A cross-species neural foundation model for end-to-end speech decoding

语音识别 | 8.0/10

 · 更新于 2026-09-11 · 约 12 分钟 · 5641 字 阅读 →
论文解读

A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers

生成模型 | 6.5/10

 · 更新于 2026-09-11 · 约 8 分钟 · 3762 字 阅读 →
论文解读

AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer

音频生成 | 7.5/10

 · 更新于 2026-09-11 · 约 12 分钟 · 5530 字 阅读 →
论文解读

AlignSep: Temporally-Aligned Video-Queried Sound Separation with Flow Matching

语音分离 | 8.0/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5425 字 阅读 →
论文解读

AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR

语音识别 | 6.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4107 字 阅读 →
论文解读

Are Deep Speech Denoising Models Robust to Adversarial Noise?

语音增强 | 7.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4051 字 阅读 →
论文解读

AudioTrust: Benchmarking The Multifaceted Trustworthiness of Audio Large Language Models

模型评估 | 8.5/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4581 字 阅读 →
论文解读

AudioX: A Unified Framework for Anything-to-Audio Generation

音频生成 | 7.5/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4936 字 阅读 →
论文解读

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

面部动画生成 | 8.0/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5435 字 阅读 →
论文解读

Aurelius: Relation Aware Text-to-Audio Generation At Scale

音频生成 | 8.0/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4737 字 阅读 →