每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

换词不换声:直接剪贴与编解码器重建哪条路更自然

该研究以保留原说话人听感为前提替换语音中的敏感词,对比直接波形剪贴与经神经编解码器重建的插入路径以及克隆嗓音与合成语境的选择,用自然度、可懂度和信号质量自动指标报告编解码器路径更优,其中自然度倾向于带原句嵌入的编解码器与克隆嗓音,而信号质量倾向于通用嗓音与孤立词合成。

 · 更新于 2026-09-24 · 约 18 分钟 · 8616 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

带底噪也要无缝改口:先分离再压残留噪声的语音编辑

针对带环境噪声的插入与替换编辑问题,SeamlessEdit 选择先用分离模型分出人声与噪声、再用稀疏贝叶斯与滤波压残留噪声并做语境精修,在 EARS-WHAM 上把插入自然度做到 3.78 而基线 VoiceCraft 仅 2.93,代价是仍需依赖现成分离与编辑模型且对女声高频与重叠说话人保留残留问题。

 · 更新于 2026-09-24 · 约 17 分钟 · 8091 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
论文解读

先定位错在哪、再只改错段:多层次评估器如何稳住零样本语音合成

针对零样本语音合成中误读、可听噪声与异常停顿导致的不稳定问题,论文用能同时输出错误时间范围、转写文本与整句质量分的 Vox-Evaluator 做局部遮罩重改与细粒度偏好优化,在 Seed-TTS 上把 F5-TTS 的字错率从 1.73% 降到 1.42%,代价是最多两轮迭代改写与偏好训练过久后奖励饱和回落。

 · 更新于 2026-09-24 · 约 18 分钟 · 8984 字 阅读 →
论文解读

AuK 用一条指令接口统一生成与编辑:语义条件与声学潜变量如何分工

AuK 用自然语言指令加可选音频统一五类语音任务,以多模态大语言模型语义条件、联合训练的音频变分自编码器声学潜变量和混合整流流 Transformer 为核心,在约 3.03 billion 指令音频实例与 1.95 million 小时监督上经生成预热、联合预训练、编辑偏好优化与生成强化学习取得零样本与指令合成及通用编辑的领先结果,并以 4 步无分类器自由 …

 · 更新于 2026-09-24 · 约 27 分钟 · 13283 字 阅读 →
论文解读

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

音频理解 | 8.7/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6164 字 阅读 →
论文解读

FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations

语音合成 | 9.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4189 字 阅读 →
论文解读

VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation

语音合成 | 6.8/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9642 字 阅读 →
论文解读

Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing

语音编辑 | 7.3/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6259 字 阅读 →
论文解读

dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model

语音编辑 | 7.4/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7954 字 阅读 →
论文解读

UniSAE: Unified Speech Attribute Editing on Speaker, Emotion and Low-Level Content via Discrete Phonetic Posteriorgram Modelling

语音合成 | 7.3/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2255 字 阅读 →
论文解读

RIVET: Robust Idempotent Voice Attribute Editing

语音转换 | 8/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4451 字 阅读 →
论文解读

MMAE: A Massive Multitask Audio Editing Benchmark

语音编辑 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4396 字 阅读 →
论文解读

SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing

语音编辑 | 8.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6662 字 阅读 →
论文解读

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

语音编辑 | 7.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7769 字 阅读 →
论文解读

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

语音合成 | 8/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6277 字 阅读 →
论文解读

SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing

语音编辑 | 8.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6408 字 阅读 →
论文解读

Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs

语音编辑 | 6.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5409 字 阅读 →