论文解读

Designed Vocalizations Dataset: Sound-Designed Human and Animal Voices for Non-human Voice Conversion

语音转换 | 7.9/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5983 字 阅读 →
论文解读

DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages

语音识别 | 8.1/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7224 字 阅读 →
论文解读

Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs

语音合成 | 7.6/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6369 字 阅读 →
论文解读

From Read Speech to Spoken Digits: A Task-Specific Evaluation of Speech Privacy With Informed Attackers

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9074 字 阅读 →
论文解读

Improving the performance of an ASV system using hybrid speech features

说话人验证 | 5.0/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6562 字 阅读 →
论文解读

Instruct-FD: Can Your Full-Duplex Speech System Follow Turn-Taking Instructions?

语音交互 | 7.2/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6484 字 阅读 →
论文解读

Investigating Codec-Internal Latent Audio Watermarking for Neural Codec Robustness

音频水印 | 6.4/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7234 字 阅读 →
论文解读

OPOD: On-Policy Omni Distillation

多模态模型 | 7.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6936 字 阅读 →
论文解读

Phonetic forced alignment for low-resource language varieties: Model training and evaluation on Chengdu Mandarin

语音识别 | 6.2/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7221 字 阅读 →
论文解读

Safeguards for Speech2Speech LLM-Assistants: A Case Study in Automotive Applications

语音交互 | 6.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4430 字 阅读 →
论文解读

SCoPE: Shift-Aware Speaker-Conditioned Priors for Emotion Recognition in Conversations

语音情感识别 | 6.0/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7064 字 阅读 →
论文解读

TF-MossFormer: Integrating Convolution Gated Local-Global Attentions for Enhanced Time-Frequency Domain Monaural Speech Separation

语音分离 | 6.3/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5695 字 阅读 →
论文解读

Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models

语音情感识别 | 7.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6446 字 阅读 →
论文解读

Toward Interpretable Speech Deepfake Detection using Artifact-Specific Experts and Calibrated Detection Scores

语音伪造检测 | 7.0/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8363 字 阅读 →
论文解读

VibeVoice-ASR-BitNet Technical Report

语音识别 | 7.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6193 字 阅读 →
论文解读

Word meaning co-determines vowel-inherent spectral change. A corpus-based investigation of conversational Mandarin

语音属性识别 | 5.9/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7278 字 阅读 →
论文解读

X^3-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

音频理解 | 7.1/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8383 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-24

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 57 分钟 · 28385 字 阅读 →
论文解读

A Diagnostic Evaluation Framework for AI-Generated Cover Songs Using Music-Theoretic and Acoustic Features

音频质量评估 | 8.0/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7289 字 阅读 →
论文解读

Audio-Zero: Label-Free Self-Evolution for Fine-Grained Audio Reasoning

音频理解 | 6.8/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7635 字 阅读 →