论文解读

The 2026 ACII Dyadic Conversations (DaiKon) Workshop & Challenge

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5598 字 阅读 →
论文解读

Toward Fair Speech Technologies: A Comprehensive Survey of Bias and Fairness in Speech AI

模型评估 | 7.5/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1964 字 阅读 →
论文解读

Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5251 字 阅读 →
论文解读

CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition

语音识别 | 9.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4230 字 阅读 →
论文解读

FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates

语音合成 | 9.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5627 字 阅读 →
论文解读

FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions

语音合成 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5075 字 阅读 →
论文解读

LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation

说话人验证 | 8.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7232 字 阅读 →
论文解读

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

基准测试 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4323 字 阅读 →
论文解读

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

语音翻译 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4966 字 阅读 →
论文解读

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4222 字 阅读 →
论文解读

SumRA: Parameter Efficient Fine-tuning with Singular Value Decomposition and Summed Orthogonal Basis

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5875 字 阅读 →
论文解读

SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization

音频检索 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4249 字 阅读 →
论文解读

Tell me Habibi, is it Real or Fake?

音视频深度伪造检测 | 8.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3642 字 阅读 →
论文解读

TTSDS2: Resources and Benchmark for Evaluating Human-Quality Text to Speech Systems

语音合成评估 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4384 字 阅读 →
论文解读

UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice

语音翻译 | 8.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4434 字 阅读 →
论文解读

VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation

语音情感识别 | 8.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5385 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-04

共分析 14 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 50 分钟 · 24971 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-03

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 41 分钟 · 20229 字 阅读 →
论文解读

AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4107 字 阅读 →
论文解读

CTC-DRO: Robust Optimization for Reducing Language Disparities in Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4981 字 阅读 →