论文解读

Phylogenetic signal in marine mammal and bird vocalizations captured by audio foundation models: the limited benefit of domain-specific pretraining

音频理解 | 7.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6153 字 阅读 →
论文解读

Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs

语音识别 | 7.3/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8554 字 阅读 →
论文解读

Goodbye Equal Error Rate, Hello Local Information Disclosure: Evaluating Voice Anonymisation against 1-to-N Linkage Threats

语音转换 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6152 字 阅读 →
论文解读

Towards Digital Preservation of Efik: TTS for a Low-Resource African Language

语音合成 | 4/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6353 字 阅读 →
论文解读

\(\tau\)-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains

语音交互 | 9.1/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8721 字 阅读 →
论文解读

BFCL Audio: An Audio Function Calling Evaluation for Large Language Models

语音交互 | 7.7/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7260 字 阅读 →
论文解读

A Geometric Perspective on Composable Emotion Steering in Text-to-Speech Models

语音合成 | 6.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6328 字 阅读 →
论文解读

Automatic Detection of Stress from Speech in the Trier Social Stress Test

语音情感识别 | 7.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7439 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-02

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 49 分钟 · 24050 字 阅读 →
论文解读

Generative Modeling of Bach-Style Symbolic Music: A Comparative Study of Autoregressive, Latent-Variable, and Adversarial Approaches

音乐生成 | 5.7/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4808 字 阅读 →
论文解读

Assessing the Impact of Noise and Speech Enhancement on the Intelligibility of Speech Codecs

模型评估 | 7.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4862 字 阅读 →
论文解读

Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI

模型评估 | 7.5/10

 · 更新于 2026-09-24 · 约 4 分钟 · 1964 字 阅读 →
论文解读

AVEX: What Matters for Animal Vocalization Encoding

生物声学 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5485 字 阅读 →
会议任务专题

ICLR 2026 - 模型比较

共 1 篇 ICLR 2026 模型比较 方向论文

 · 更新于 2026-09-24 · 约 3 分钟 · 1125 字 阅读 →
论文解读

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

模型比较 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4240 字 阅读 →
论文解读

Transformer-based End-to-End Control Filter Generation for Active Noise Control

主动噪声控制 | 7.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6089 字 阅读 →
论文解读

Flow2GAN: Hybrid Flow Matching and GAN with Multi-Resolution Network for Few-step High-Fidelity Audio Generation

音频生成 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4234 字 阅读 →
论文解读

MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark

语音问答 | 8.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4249 字 阅读 →
论文解读

WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

基准测试 | 8.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4207 字 阅读 →
论文解读

BioSEN: A Bio-Acoustic Signal Enhancement Network for Animal Vocalizations

生物声学 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5221 字 阅读 →