论文解读

VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation

语音情感识别 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5385 字 阅读 →
论文解读

VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models

模型评估 | 9.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5353 字 阅读 →
论文解读

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

音频检索 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4709 字 阅读 →
论文解读

WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables

基准测试 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4547 字 阅读 →
论文解读

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

音频问答 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3728 字 阅读 →
论文解读

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models

基准测试 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4010 字 阅读 →
论文解读

YuE: Scaling Open Foundation Models for Long-Form Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6983 字 阅读 →
论文解读

A Brain-Inspired Gating Mechanism Unlocks Robust Computation in Spiking Neural Networks

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5996 字 阅读 →
论文解读

A cross-species neural foundation model for end-to-end speech decoding

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5641 字 阅读 →
论文解读

A Hidden Semantic Bottleneck in Conditional Embeddings of Diffusion Transformers

生成模型 | 6.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3762 字 阅读 →
论文解读

AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5530 字 阅读 →
论文解读

AlignSep: Temporally-Aligned Video-Queried Sound Separation with Flow Matching

语音分离 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5425 字 阅读 →
论文解读

Are Deep Speech Denoising Models Robust to Adversarial Noise?

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4051 字 阅读 →
论文解读

AudioTrust: Benchmarking The Multifaceted Trustworthiness of Audio Large Language Models

模型评估 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4581 字 阅读 →
论文解读

AudioX: A Unified Framework for Anything-to-Audio Generation

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4936 字 阅读 →
论文解读

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

面部动画生成 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5435 字 阅读 →
论文解读

Aurelius: Relation Aware Text-to-Audio Generation At Scale

音频生成 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4737 字 阅读 →
论文解读

Automatic Stage Lighting Control: Is it a Rule-Driven Process or Generative Task?

音乐生成 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5357 字 阅读 →
论文解读

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4542 字 阅读 →
论文解读

AVEX: What Matters for Animal Vocalization Encoding

生物声学 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4577 字 阅读 →