Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis

📄 不数拍子也能合唱:对齐无关的配音与双人对话合成 英文题目:Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis 一句话:用 mT5 交叉注意力隐式对齐替代强制对齐与时长预测,结合 48 kHz DAC-VAE 隐变量流匹配统一单双通道生成,在内部配音基准可分享性提升约 0.40、短对话人类相似度 4.53 接近真人 4.62,代价是依赖闭源数据与多候选重排序。 标签:#语音合成 | #流匹配 | #语音克隆 评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Sanyuan Chen:FAIR at Meta Min-Jae Hwang:FAIR at Meta Sho Inoue:FAIR at Meta Anna Sun:FAIR at Meta Bokai Yu:FAIR at Meta David Kant:FAIR at Meta Dongmin Hyun:FAIR at Meta Dorian Desblancs:FAIR at Meta Gregory Antonovsky:FAIR at Meta Oleg Repin:FAIR at Meta Peng-Jen Chen:FAIR at Meta Xutai Ma:FAIR at Meta Zehai Tu:FAIR at Meta Juan Pino:FAIR at Meta Wei-Ning Hsu:FAIR at Meta 💬 毒舌点评 把对齐无关文本接口、48 kHz低码率隐变量扩散与单双通道统一建模做成可落地的配音加全双工对话大系统,工程链条完整。短板是全程依赖内部数据与内部基线且无外部可验证产物,情绪与长对话评估多靠自动指标与自建主观量表,说服力打了折扣。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 839 words

Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech

📄 一句里换一种口音:用帧级掩码把全局引导切开 英文题目:Phrase-Localized Language-Contrastive Guidance: Training-Free Localized Accent Control for Code-Switching Text-to-Speech 一句话:针对句内码本切换中嵌入短语被载体口音同化的泄露问题,论文在离散扩散 TTS 的推理时用自注意力探测得到短语掩码并以独立尺度 λ 做语言对比引导,在 1200 条 12 方向合成语料上将嵌入短语语言准确率从 0.233 提至 0.518,代价是 UTMOS 轻度下降与需回退到 eager 注意力的 2.26 倍推理开销。 标签:#语音合成 | #扩散模型 | #语音克隆 | #多语言 | #零样本 评分:8.2/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.4/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Che Hyun Lee:Department of Electrical and Computer Engineering, Seoul National University Sangkwon Park:Department of Electrical and Computer Engineering, Seoul National University Donghun Kang:Department of Electrical and Computer Engineering, Seoul National University Dongwook Lee:Interdisciplinary Program in Artificial Intelligence, Seoul National University Youngho Cho:机构信息未在 arXiv HTML 中可靠披露 Heeseung Kim:机构信息未在 arXiv HTML 中可靠披露 Sungroh Yoon:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把全局分类器无关引导 Classifier-Free Guidance (CFG) 拆成帧级可控的语言对比引导,并用模型自注意力自举定位短语边界,实现了无训练的句内口音解耦,思路干净且与离散扩散的迭代去噪天然互补。短板是核心证据完全绑定在 OmniVoice 单一骨干和合成文本上,对自回归架构、真实自发码本切换及长时韵律连贯性的外推缺乏严格验证,推理侧需退回 eager 注意力导致的 2.26 倍开销也削弱了即插即用的说服力。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1693 words

Sequential Trajectories and Simultaneous Blending: Multi-Emotion Modeling for Instruction-Following TTS

📄 一句里装不下两种心情:HybridEmo 如何让 TTS 先走完轨迹再调好混合 英文题目:Sequential Trajectories and Simultaneous Blending: Multi-Emotion Modeling for Instruction-Following TTS 一句话:针对指令跟随 TTS 中多情感的时序演变与并发共存难题,HybridEmo 用有监督微调初始化再以样本感知路由的 GRPO 分别优化轨迹一致性与混合密度奖励,在 MultiEmo-Test 上提升轨迹正确性与混合强度且保持 WER 在 2% 以内,代价是奖励与评估同源且切分与锚点仍依赖近似假设。 标签:#语音合成 #强化学习 #语音克隆 #后训练 评分:7.5/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yan Zhou:机构信息未在 arXiv HTML 中可靠披露 Yun Hong:机构信息未在 arXiv HTML 中可靠披露 Yang Feng:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把多情感控制拆成时序轨迹与并发混合两类任务,并为其定制可区分的奖励路由与混合密度打分,问题定义清晰且奖励设计有针对性。短板是轨迹分段依赖文本长度等比切分、混合奖励依赖离线合成锚点与 emotion2vec 判别器,评估高度耦合于同一判别空间且人工偏好样本仅 80 次判断,证据闭环感偏重。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1500 words

Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care

📄 Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care 标签:#语音合成 #扩散模型 #数据集 #语音克隆 #低资源 7.6/10 | 创新 1.1/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 0.6/1.5 ✅ 7.6/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #语音合成 | #扩散模型 | #数据集 #语音克隆 | arxiv 👥 作者与机构 第一作者:Kawshik Kumar Paul(Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET)) 通讯作者:正文未明确标注 作者列表:Kawshik Kumar Paul、Md. Nafiul Alam Fuji(机构:Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET)) ...

2026-08-25 · 更新于 2026-09-04 · 2 min · 426 words

Does Listening Matter? Backchanneling and Nodding in AI Clone

📄 Does Listening Matter? Backchanneling and Nodding in AI Clone 标签:#语音交互 #多模态模型 #音视频交互 #语音克隆 5.2/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 📝 5.2/10 | 后50% | 文档类型:应用研究 | 评分置信度:中 | #语音交互 | #多模态模型 | #音视频交互 #语音克隆 | arxiv 👥 作者与机构 Koji Inoue、Kazushi Kato、Tatsuya Kawahara 来自京都大学(Kyoto University),Shunichi Kasahara 来自索尼计算机科学实验室(Sony Computer Science Laboratories)。通信地址为京都大学社会智能信息学实验室。该工作被 ICMI 2026 的 Late-Breaking Results(LBR)短文轨道接收,属于初步性成果展示。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 360 words

Aslema at NADI 2026: Augmentation through Fewshot for SLU

📄 Aslema at NADI 2026: Augmentation through Fewshot for SLU 标签:#语音交互 #语音大模型 #多语言 #语音克隆 8.0/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.0/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:中 | #语音交互 | #语音大模型 | #多语言 #语音克隆 | arxiv 👥 作者与机构 第一作者:Tajwaar Shafiq(机构未说明) 通讯作者:未说明 作者列表:Tajwaar Shafiq、Hunzalah Hassan Bhatti、Shammur Absar Chowdhury、Firoj Alam(机构信息未在当前正文中完整说明) 💡 毒舌点评 这是扎实的比赛参赛报告,但实验设计与正式评测之间存在结构性错位:消融集中在开发集,盲测只评估最终配置,每个增强环节的独立贡献无从确认;训练与开发集只有 23 个标签而盲测是 60 标签开放集,已知类准确率与开放意图拒识混在同一分数里。合成增强只在 30B 模型上完整验证,小模型能否受益未知;三模型投票过滤了文本问题却没有母语者逐条听审,克隆语音的方言自然度仍存疑。 ...

2026-08-20 · 更新于 2026-09-04 · 3 min · 552 words

FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations

📄 FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations 标签:#语音合成 #语音克隆 #语音编辑 #生成模型 #多语言 9.0/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 🔥 9.0/10 | 前10% | 文档类型:方法研究 | 评分置信度:高 | #语音合成 | #生成模型 | #语音克隆 #语音编辑 | arxiv 👥 作者与机构 第一作者:Feiyu Shen(小红书) 作者团队:Kun Xie、Yichen Wu、Ziqi Dai、Yichen Han、Junjie Li 等;机构为小红书及合作团队。 💡 毒舌点评 这项工作抓住了连续语音表征的关键矛盾:既想保留声学细节,又想借助文本 LLM 的指令能力。RedAE 的语义教师设计确实漂亮,公开模型和多任务评测也很完整;但“简单”并不等于没有工程代价,训练 tokenizer、LLM-DiT 和多种编辑评测的成本很高,开放域音色、长文本和极端方言仍需要独立验证。此外还有几处需要追问:连续自回归表示在长文本与多说话人混合场景下的误差累积没有系统报告;多语言覆盖有限,粤语的高字符错误率被归因于 Whisper-large-v3 的识别能力上限而非方法本身;训练数据许可与商业使用边界也语焉不详——这些对想落地的团队都是关键信息。 ...

2026-08-19 · 更新于 2026-09-04 · 6 min · 1193 words

A survey of AI-generated voices and their detection

📄 A survey of AI-generated voices and their detection 标签:#语音伪造检测 #语音大模型 #语音合成 #语音克隆 #自监督学习 6.1/10 | 创新 1/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.9/1.5 ✅ 6.1/10 | 前50% | 文档类型:综述 | 评分置信度:中 | #语音伪造检测 | #语音大模型 | #语音合成 #语音克隆 | arxiv 👥 作者与机构 第一作者:Chengzhe Sun(纽约州立大学布法罗分校计算机科学与工程系) 通讯作者:Siwei Lyu(纽约州立大学布法罗分校计算机科学与工程系) 作者列表:Chengzhe Sun(纽约州立大学布法罗分校计算机科学与工程系)、Tianle Yang(纽约州立大学布法罗分校语言学系)、Siwei Lyu(纽约州立大学布法罗分校计算机科学与工程系) 💡 毒舌点评 这是一篇把语音学/生理学视角拉进音频深伪检测的综述,方向上比单纯罗列模型更有洞察力。但作为“survey”,它没有可复现的检索协议,更像是作者熟悉工作的地图;参考文献管理有明显瑕疵,XTTS 出现两条高度重合条目。没有代码、权重或统一 benchmark,对工程实践者而言只能是导览,不是工具箱。 ...

2026-08-18 · 更新于 2026-09-04 · 2 min · 310 words

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

📄 Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer 标签:#语音克隆 #扩散模型 #音视频生成 6.4/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音克隆 | #扩散模型 | #音视频生成 | arxiv 👥 作者与机构 第一作者:Ivan Mikheev(Kandinsky Lab, Moscow, Russia) 通讯作者:Ivan Mikheev(Kandinsky Lab, Moscow, Russia)、Viacheslav Vasilev(Kandinsky Lab, Moscow, Russia) 作者列表:Ivan Mikheev(Kandinsky Lab, Moscow, Russia)、Viacheslav Vasilev(Kandinsky Lab, Moscow, Russia)、Anna Dmitrienko(Kandinsky Lab, Moscow, Russia)、Alexey Letunovskiy(Kandinsky Lab, Moscow, Russia)、Ivan Kirillov(Kandinsky Lab, Moscow, Russia)、Kirill Chernyshev(Kandinsky Lab, Moscow, Russia)、Denis Dimitrov(Kandinsky Lab, Moscow, Russia) 💡 毒舌点评 这项工作用“prepend 参考 latents + 单个零初始化 FiLM 层”这种轻量改造,在 5B T2AV 模型上把说话人相似度做到三个验证网络全榜第一,证明了大模型先验对声音克隆的价值;但论文的 WER/CER 明显高于专用 TTS(如 k6a_5b WER 5.76% vs. Qwen3-TTS 0.6B 的 0.81%),而且没有放出代码、权重或可下载模型,开源与复现贡献几乎为零。 ...

2026-08-18 · 更新于 2026-09-04 · 6 min · 1100 words

VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation

📄 VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation 标签:#语音合成 #流匹配 #语音编辑 #语音克隆 6.8/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #语音合成 | #流匹配 | #语音编辑 #语音克隆 | arxiv 👥 作者与机构 第一作者:Jiarui Hai(Johns Hopkins University;实习于 Adobe Research) 通讯作者:未明确标注 作者列表:Jiarui Hai(Johns Hopkins University;实习于 Adobe Research)、Karan Thakkar(Johns Hopkins University)、Ke Chen(Adobe Research)、Yunyun Wang(Adobe Research)、Jiaqi Su(Adobe Research)、Rithesh Kumar(Adobe Research)、Mounya Elhilali(Johns Hopkins University)、Zeyu Jin(Adobe Research) 💡 毒舌点评 亮点:把 TTV 的"character voice"场景推进到了非人声角色,DSP + 生成式仿真的混合数据思路确实补上了以往数据分布的关键缺口,且统一生成/克隆/编辑三任务在一个 MM-DiT 内的做法对工程落地有实际价值。短板:token-level AdaLN 本质上是 diffusion forcing 思路在音频多条件建模中的迁移,3D-RoPE 也只是位置编码的结构化扩展,方法新颖性更多在组合而非原理层面;核心公式缺失、架构细节依赖 demo page,读起来更像一份重型系统报告而非严格方法论文。 ...

2026-08-17 · 更新于 2026-09-04 · 7 min · 1362 words