论文解读

VividTalker: A Modular Framework for Expressive 3D Talking Avatars with Controllable Gaze and Blink

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5244 字 阅读 →
论文解读

VoxMorph: Scalable Zero-Shot Voice Identity Morphing via Disentangled Embeddings

语音克隆 | 9.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5242 字 阅读 →
论文解读

VoXtream: Full-Stream Text-To-Speech With Extremely Low Latency

语音合成 | 8.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6227 字 阅读 →
论文解读

Wave-Trainer-Fit: Neural Vocoder With Trainable Prior And Fixed-Point Iteration Towards High-Quality Speech Generation From SSL Features

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5135 字 阅读 →
论文解读

Wavenext 2: Convnext-Based Fast Neural Vocoders with Residual Denoising and Sub-Modeling for Gan And Diffusion Models

语音合成 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4717 字 阅读 →
论文解读

When Voice Matters: A Controlled Study of Audio LLM Behavior in Clinical Decision-Making

模型评估 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3980 字 阅读 →
论文解读

ZSV2C-MLLM: Zero-Shot Visual Voice Cloning Via Multimodal Large Language Models

语音克隆 | 6.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4244 字 阅读 →
论文解读

MAGIC-TTS: Fine-Grained Controllable Speech Synthesis with Explicit Local Duration and Pause Control

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4497 字 阅读 →
论文解读

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6055 字 阅读 →
论文解读

TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis

语音质量评估 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5555 字 阅读 →
论文解读

UniSonate: A Unified Model for Speech, Music, and Sound Effect Generation with Text Instructions

音频生成 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5972 字 阅读 →
论文解读

MAGIC-TTS: Fine-Grained Controllable Speech Synthesis with Explicit Local Duration and Pause Control

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3859 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-25

共分析 2 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 6 分钟 · 2986 字 阅读 →
论文解读

ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6680 字 阅读 →
论文解读

MAGIC-TTS: Fine-Grained Controllable Speech Synthesis with Explicit Local Duration and Pause Control

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4902 字 阅读 →
论文解读

Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3910 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

这篇论文介绍了Qwen3.5-Omni,一个支持文本、图像、音频和音频-视频输入的全模态大语言模型。为解决现有模型在实时交互、跨模态推理和工具使用上的不足,其核心方法是采用“Thinker-Talker”架构,并引入混合专家(MoE)设计以提升效率。与前代相比,主要创新在于:1)模型规模扩展至数千亿

 · 更新于 2026-09-25 · 约 10 分钟 · 4857 字 阅读 →
论文解读

SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation

1. **问题**:现有大型音频语言模型在副语言(如情绪、语气、音色)生成与理解能力上的评估存在特征覆盖不全、评估方法主观且不可扩展的问题。 2. **方法**:提出了SpeechParaling-Bench,一个包含1000余个中英平行语音查询、覆盖超过100个细粒度副语言特征的综合基准。基准

 · 更新于 2026-09-25 · 约 7 分钟 · 3464 字 阅读 →
论文解读

Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation

1. **问题**:现有基于离散token的TTS模型,其“粗到细”的生成范式主要体现在从语义token到声学token的转换,而对语音固有的时间动态(temporal dynamics)缺乏显式建模。 2. **方法核心**:提出Chain-of-Details (CoD)框架,将语音生成分解为多

 · 更新于 2026-09-25 · 约 9 分钟 · 4367 字 阅读 →
论文解读

ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis

本文针对现有语音合成系统在生成角色驱动、情感丰富的语音时难以同时保持角色身份一致性和情感表达准确性的问题,提出了ATRIE框架。其核心是**Persona-Prosody Dual-Track (P2-DT) 架构**,将语音生成解耦为静态的**音色轨道**(通过标量量化保持身份锚点)和动态的**韵

 · 更新于 2026-09-25 · 约 11 分钟 · 5414 字 阅读 →