论文解读

Task Vector in TTS: Toward Emotionally Expressive Dialectal Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4678 字 阅读 →
论文解读

TASU: Text-only Alignment for Speech Understanding

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4344 字 阅读 →
论文解读

Thinking While Listening: Simple Test Time Scaling for Audio Classification

音频分类 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4620 字 阅读 →
论文解读

VoxMorph: Scalable Zero-Shot Voice Identity Morphing via Disentangled Embeddings

语音克隆 | 9.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5242 字 阅读 →
论文解读

VoXtream: Full-Stream Text-To-Speech With Extremely Low Latency

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6227 字 阅读 →
论文解读

WavLink: Compact Audio–Text Embeddings with a Global Whisper Token

音频检索 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4681 字 阅读 →
论文解读

Why Do Speech Language Models Fail to Generate Semantically Coherent Outputs? A Modality Evolving Perspective

语音生成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4296 字 阅读 →
论文解读

ZSV2C-MLLM: Zero-Shot Visual Voice Cloning Via Multimodal Large Language Models

语音克隆 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4244 字 阅读 →
论文解读

MAGIC-TTS: Fine-Grained Controllable Speech Synthesis with Explicit Local Duration and Pause Control

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4497 字 阅读 →
论文解读

Beyond Acoustic Sparsity and Linguistic Bias: A Prompt-Free Paradigm for Mispronunciation Detection and Diagnosis

发音错误检测 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6458 字 阅读 →
论文解读

MAGIC-TTS: Fine-Grained Controllable Speech Synthesis with Explicit Local Duration and Pause Control

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3859 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-25

共分析 2 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 6 分钟 · 2986 字 阅读 →
论文解读

MAGIC-TTS: Fine-Grained Controllable Speech Synthesis with Explicit Local Duration and Pause Control

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4902 字 阅读 →
论文解读

X-VC: Zero-shot Streaming Voice Conversion in Codec Space

1. **问题**:零样本语音转换需要同时实现高质量的说话人特征迁移和低延迟的流式推理,这是一个尚未很好解决的挑战。 2. **方法核心**:提出X-VC系统,在预训练的SAC语音编解码器的潜在空间中进行一步转换。核心是一个双条件声学转换器,它联合处理源语音的编解码器潜在表示和目标参考语音的帧级梅尔

 · 更新于 2026-09-25 · 约 9 分钟 · 4441 字 阅读 →
论文解读

ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis

本文针对现有语音合成系统在生成角色驱动、情感丰富的语音时难以同时保持角色身份一致性和情感表达准确性的问题,提出了ATRIE框架。其核心是**Persona-Prosody Dual-Track (P2-DT) 架构**,将语音生成解耦为静态的**音色轨道**(通过标量量化保持身份锚点)和动态的**韵

 · 更新于 2026-09-25 · 约 11 分钟 · 5414 字 阅读 →
论文解读

AST: Adaptive, Seamless, and Training-Free Precise Speech Editing

本文针对现有语音编辑方法依赖任务特定训练、未编辑区域时间一致性差的问题,提出了AST(Adaptive, Seamless, and Training-free),一种基于预训练AM-FM(自回归-流匹配)范式TTS模型的精确语音编辑框架。AST首先通过逆Euler ODE求解器将原始语音反演至潜空

 · 更新于 2026-09-25 · 约 13 分钟 · 6468 字 阅读 →
论文解读

Generalizable Audio-Visual Navigation via Binaural Difference Attention and Action Transition Prediction

本文旨在解决音频-视觉导航(AVN)智能体在未见环境和未闻声音类别下泛化能力差的核心问题。作者指出,现有方法性能下降主要源于两个因素:一是音频表征混淆了语义与空间信息,导致对未闻声��定位不准;二是强化学习策略过拟合于训练环境的动态和布局。为此,本文提出了一个名为BDATP的即插即用框架。在感知层面

 · 更新于 2026-09-25 · 约 11 分钟 · 5221 字 阅读 →
论文解读

Hierarchical Codec Diffusion for Video-to-Speech Generation

本论文针对 Video-to-Speech(VTS)生成中视觉-语音模态信息不对称的问题,提出现有方法忽略了语音从粗粒度语义到细粒度韵律的层次结构,导致视觉条件无法与语音表示精准对齐。为此,作者提出 HiCoDiT(Hierarchical Codec Diffusion Transformer),

 · 更新于 2026-09-25 · 约 12 分钟 · 5676 字 阅读 →
论文解读

Adaptive Test-Time Scaling for Zero-Shot Respiratory Audio Classification

本文旨在解决零样本呼吸音频分类中“一刀切”的推理计算浪费问题。为此,提出了TRIAGE框架,这是一个三层自适应推理管道:第一层(Tier-L)进行快速的标签-文本相似度匹配;若置信度不足则升级至第二层

 · 更新于 2026-09-25 · 约 11 分钟 · 5023 字 阅读 →
论文解读

X-VC: Zero-shot Streaming Voice Conversion in Codec Space

这篇论文旨在解决零样本语音转换中**高保真说话人迁移**与**低延迟流式推理**难以兼得的核心挑战。作者提出了**X-VC**系统,其核心创新在于**在预训练神经编解码器(SAC)的潜在空间中进行一步

 · 更新于 2026-09-25 · 约 10 分钟 · 4920 字 阅读 →