Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis

📄 不数拍子也能合唱:对齐无关的配音与双人对话合成 英文题目:Alignment-Free Text-Audiobox for Voice Dubbing and Full-Duplex Dialogue Synthesis 一句话:用 mT5 交叉注意力隐式对齐替代强制对齐与时长预测,结合 48 kHz DAC-VAE 隐变量流匹配统一单双通道生成,在内部配音基准可分享性提升约 0.40、短对话人类相似度 4.53 接近真人 4.62,代价是依赖闭源数据与多候选重排序。 标签:#语音合成 | #流匹配 | #语音克隆 评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Sanyuan Chen:FAIR at Meta Min-Jae Hwang:FAIR at Meta Sho Inoue:FAIR at Meta Anna Sun:FAIR at Meta Bokai Yu:FAIR at Meta David Kant:FAIR at Meta Dongmin Hyun:FAIR at Meta Dorian Desblancs:FAIR at Meta Gregory Antonovsky:FAIR at Meta Oleg Repin:FAIR at Meta Peng-Jen Chen:FAIR at Meta Xutai Ma:FAIR at Meta Zehai Tu:FAIR at Meta Juan Pino:FAIR at Meta Wei-Ning Hsu:FAIR at Meta 💬 毒舌点评 把对齐无关文本接口、48 kHz低码率隐变量扩散与单双通道统一建模做成可落地的配音加全双工对话大系统,工程链条完整。短板是全程依赖内部数据与内部基线且无外部可验证产物,情绪与长对话评估多靠自动指标与自建主观量表,说服力打了折扣。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 839 words

Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction

📄 导演喊“再来一条”时,机器如何既不变声又听懂弦外之音 英文题目:Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction 一句话:为解决同一脚本下相对化重读三元组稀缺问题,该文用印象可控合成造风格对再由大语言模型反推导演语言,并在冻结骨干嵌入空间以流匹配学习增量,主证据是伪数据与真人数据组合在保住音色的同时提升方向跟随,代价是伪数据韵律偏保守且评估部分同源。 标签:#语音合成 | #流匹配 | #大语言模型 评分:6.8/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Kenichi Fujita:机构信息未在 arXiv HTML 中可靠披露 Yusuke Ijima:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点是用印象可控合成加相对差分生成方向文本,把难以采集的导演式重读三元组做成了可扩展流水线。短板是伪数据韵律变化幅度明显弱于真人表演,导致伪数据模型偏保守,而对齐度评估又与构造用估计器同源,可信度打了折扣。 📌 核心摘要 本文研究方向跟随语音合成(direction-following TTS),即在保持说话人身份和文本内容不变的前提下,根据自然语言表演方向(direction)对参考 utterance 做相对化风格修改。核心机制是先用印象可控零样本合成模型生成风格差异对,再用印象估计器计算相对印象差并交由大语言模型(large language model,LLM)撰写导演式方向文本,从而构造伪三元组(pre-mod utterance,伪方向,post-mod utterance)。风格修改本身通过固定骨干合成模型之上的方向条件风格精修器(direction-conditioned style refiner)实现,该精修器在语音嵌入空间中学习从修改前嵌入到修改后嵌入的增量映射。与绝对风格标注和直接文本提示语音合成(text-prompted TTS)的区别在于建模相对变换而非绝对风格。主实验显示组合伪数据与真实录制数据的 Full 配置在已见说话人上主观说话人相似度(SMOS)达到 3.35,同时主观对齐度(AlignMOS)达到 3.22,兼顾了稳定性和表现力。实际意义是为导演式重读和可控表演合成提供了可扩展的数据范式。主要边界是伪数据表现力保守且评估部分依赖同源估计器,跨语言和开放方向泛化仍待验证。 ...

2026-09-03 · 更新于 2026-09-04 · 4 min · 814 words

The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation

📄 剧本写好了时间,音画却演错了拍子:用路由把时间还给剧本 英文题目:The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation 一句话:针对联合音视频生成中音画互相同步却共同偏离剧本时间的问题,论文用时长归一化的加性时间路由把镜头与对白区间送进双分支交叉注意力,在 200 个剧本上把镜头边界误差从 1.11 秒降到 0.042 秒、对白准时率提到 84.1%,代价是评测仍锁在短剧对白域且零开源。 标签:#音视频生成 | #流匹配 | #参数高效微调 | #多模态模型 评分:7.5/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yichen Liu:机构信息未在 arXiv HTML 中可靠披露 Quanwei Zhang:机构信息未在 arXiv HTML 中可靠披露 Haozhe Wang:机构信息未在 arXiv HTML 中可靠披露 Donghao Zhou:机构信息未在 arXiv HTML 中可靠披露 Xiaojie Li:机构信息未在 arXiv HTML 中可靠披露 Yang Shi:机构信息未在 arXiv HTML 中可靠披露 Jiaming Liu:机构信息未在 arXiv HTML 中可靠披露 Ruihua Huang:机构信息未在 arXiv HTML 中可靠披露 Yingtian Zou:机构信息未在 arXiv HTML 中可靠披露 Daquan Zhou:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把剧本时间从文本字符串里拽出来做成双模态注意力偏置,治好了音画很同步但集体演错时间的毛病,匹配算子对照也算体面。硬伤是全套数据、训练、评测都锁在自家短剧闭环里,基线文本带时间本就不公平,检测器既当教练又当裁判,还零开源,离可复现的剧本驱动标准差一口气。 ...

2026-09-03 · 更新于 2026-09-04 · 5 min · 905 words

Decoupled Latent Flow Matching for Few-Step Joint Vocal-Accompaniment Separation

📄 在一条潜流里同时生成两条音轨:解耦语义与声学后的少步分离 英文题目:Decoupled Latent Flow Matching for Few-Step Joint Vocal-Accompaniment Separation 一句话:为解决人声与伴奏强相关且长音频迭代采样昂贵的问题,论文在冻结 VAE 的潜空间用联合流匹配同时生成双源,并以分离编码器-速度解码器解耦与潜空间 Flow2GAN 将 20 步压缩至 1-4 步,人声感知质量提升但伴奏增益有限且距 VAE 上限仍有差距。 标签:#音乐源分离 #流匹配 #生成对抗网络 #变分自编码器 评分:5.3/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Lishi Zuo:机构信息未在 arXiv HTML 中可靠披露 Youzhi Tu:机构信息未在 arXiv HTML 中可靠披露 Lu Yi:机构信息未在 arXiv HTML 中可靠披露 Zezhong Jin:机构信息未在 arXiv HTML 中可靠披露 Chongxin Gan:机构信息未在 arXiv HTML 中可靠披露 Man-Wai Mak:机构信息未在 arXiv HTML 中可靠披露 KongAik Lee:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把语义-声学解耦与潜空间 Flow2GAN 结合做联合双源生成,动机自洽且潜判别器比波形域多判别器更轻量。硬伤是评测仅用从训练集切出的 50 段 20 秒留出片段、未与 Demucs/Open-Unmix 等判别式强基线对比、未做跨数据集与主观听感验证,且生成质量距 VAE 重构上限仍有约 0.35 ViSQOL 差距,少步增益呈现明显的人声偏向。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1426 words

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

📄 7B 做原生音画同步:用门控与路由把对齐做轻,而不是把参数做大 英文题目:DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution 一句话:DreamX-Creator 以首帧与文本为条件让音视频双流联合去噪,用门控跨模态注意力与模态感知强化学习在 Verse-Bench 上以 VQ 与 DeSync 对抗大模型,并用自回归 1 步蒸馏把 2K 精修压到每块一次去噪,代价是音频美学与跨模态语义仍落后于 22B 与 33B 系统。 标签:#扩散模型 #流匹配 #强化学习 #知识蒸馏 评分:5.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jiashu Zhu:机构信息未在 arXiv HTML 中可靠披露 Yanhao Zheng:机构信息未在 arXiv HTML 中可靠披露 Ruitian Tian:机构信息未在 arXiv HTML 中可靠披露 Rujing Dang:机构信息未在 arXiv HTML 中可靠披露 Shen Zhang:机构信息未在 arXiv HTML 中可靠披露 Bingze Song:机构信息未在 arXiv HTML 中可靠披露 Jiachen Lei:机构信息未在 arXiv HTML 中可靠披露 Ruimin Lin:机构信息未在 arXiv HTML 中可靠披露 Jiahong Wu:机构信息未在 arXiv HTML 中可靠披露 Xiangxiang Chu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 以 7B 紧凑双流加门控跨模态注意力实现首帧条件原生音视频联合去噪,并配齐数据系统、RL 后训练与自回归 1 步 2K 精修的工程链路,开放权重定位清晰。硬伤是自家表格直接证伪全面领先叙事:音频美学与跨模态语义被 22B LTX-2.3 与 33B MiniMax-H3 全面压制,Verse-Bench 无显著性检验、无门控/奖励路由/蒸馏消融,所谓 democratizing 仍停留在承诺开源而非可验证交付。 ...

2026-09-01 · 更新于 2026-09-04 · 10 min · 1929 words

Scaling phoneme-based TTS augmentation for ASR: A unified pipeline and controlled study

📄 合成语音越多越好吗?在音素层面重新称量文本的价值 英文题目:Scaling phoneme-based TTS augmentation for ASR: A unified pipeline and controlled study 一句话:面对合成语音增广效果不稳定的难题,论文用统一的音素接口把多语言 TTS 与 ASR 增广串成可控流水线,并用真实标签的音素频率筛选文本,在 13 个测试集中的 9 个上超越随机选择,最大相对词错误率降低 19.3%,代价是增益高度依赖语言与域且部分设置并未带来提升。 标签:#语音识别 #流匹配 #语音合成 #多语言 #低资源 评分:6.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Zhen Wang:机构信息未在 arXiv HTML 中可靠披露 TianRui Wu:机构信息未在 arXiv HTML 中可靠披露 RongQi Han:机构信息未在 arXiv HTML 中可靠披露 Hao Wu:机构信息未在 arXiv HTML 中可靠披露 Wei Liang:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用统一的音素(phoneme)接口把多语言文本到语音(Text-to-Speech, TTS)与自动语音识别(Automatic Speech Recognition, ASR)增广流水线跑通,并在4语言13个测试集上做了受控的规模与筛选对比,工程完整度值得肯定;短板是核心贡献PFGS本质是对训练集音素频率的加权复读,理论新颖性有限,且关键的TTS质量、阿拉伯语候选文本不公开等问题让可复现性和外推说服力大打折扣。 ...

2026-08-29 · 更新于 2026-09-04 · 4 min · 805 words

Vagdhenu: A Vrutta (Meter) Aware Shloka-to-Chant (TTS) System for Sanskrit

📄 梵颂为何难唱:当吟诵的旋律不在文本里 英文题目:Vagdhenu: A Vrutta (Meter) Aware Shloka-to-Chant (TTS) System for Sanskrit 一句话:为把梵语诗节准确唱出来,Vāgdhenu 放弃在文本侧学习韵律,转而用韵律精确匹配的参考音频去“填充”流匹配模型,并在约 5 小时单人数据上首次完整唱对卷舌送气等密集辅音丛,代价是韵律只能靠参考模板克隆而无法自由设计。 标签:#语音合成 #流匹配 #低资源 #多语言 评分:7.9/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.5/1.5 | 可复现 0.4/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Prathosh A P:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把梵颂吟诵这个低资源高规约任务做成可交付流水线并用 Kannada 路由、韵律感知参考检索和半参考规则解决真实卡点,负结果剖析比多数正结果更有价值;短板是评估仅为单人专家非盲测且 MOS 跨代不可比,所谓韵律感知本质是参考检索而非可控生成,声学骨干与声码器均为现成组件复用,架构创新有限。 📌 核心摘要 本文解决梵语韵律诗节(śloka)到吟诵(parāyaṇa chant)的高保真语音合成问题,目标是保持长元音、尾随 visarga、卷舌与送气对立及密集辅音丛的正确发音并尊重诗律(vṛtta)结构。系统 Vāgdhenu 以现成流匹配(Flow Matching)语音合成骨干(Chen et al. 2024; AI4Bharat 2024,约 337M 参数的扩散变换器 DiT)与大规模对抗声码器 BigVGAN-v2(Lee et al. 2023)为基础,构建脚本感知前端、韵律感知的参考选择机制与面向源文本校验的质量控制栈。核心机制差异在于放弃文本侧韵律条件,转为通过精确匹配参考音频的韵律模板进行上下文填充式克隆,并通过 Kannada 文字路由规避 Devanagari 在指示模型中的固有元音删除问题。最能支撑结论的证据是同一单说话人数据上四代架构的演进中,流匹配骨干以约 5 小时微调在专家平均意见分(Mean Opinion Score, MOS)上达到约 4.6 分并首次完整渲染含卷舌送气在内的辅音丛,而此前三代 StyleTTS2(约 3.0 至 4.2)、VITS2、Matcha-TTS(约 4.2 至 4.3)均触及天花板。该系统已落地两个大规模部署(Mahābhārata Tātparya Nirṇaya 5183 诗节约 17.5 小时视频语料;Śrīmad Bhāgavatam 约 18000 诗节音频应用)并开源前端、推理与训练代码、模型权重与吟诵数据集。局限在于缺乏多听者盲测与置信区间,韵律可设计性在当前自填充骨干上被证明不可达,且评估依赖非可比的专家估计。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 950 words

EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis

📄 EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis 标签:#语音合成 #流匹配 #生成模型 #可解释性 9.6/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 9.6/10 | 前10% | 文档类型:方法研究 | 评分置信度:高 | #语音合成 | #流匹配 | #生成模型 #可解释性 | arxiv 👥 作者与机构 第一作者:Tianchi Liu(LIGHTSPEED) 通讯作者:Tianchi Liu;Zeyang Song 作者列表:Tianchi Liu、Zeyang Song、Tianrui Wang、Zhipeng Li、Chenglin Xu、Yiwen Guo(机构:LIGHTSPEED;National University of Singapore;Nanyang Technological University;Independent Researcher) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 708 words

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

📄 FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation 标签:#统一音频模型 #流匹配 #音频理解 #语音合成 #语音编辑 8.7/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.7/10 | 前25% | 文档类型:模型报告 | 评分置信度:高 | #音频理解 | #流匹配 | #统一音频模型 #语音合成 | arxiv 👥 作者与机构 第一作者:Junjie Li(Xiaohongshu(正文仅给出统一机构行,未逐作者映射)) 通讯作者:Fenglong Xie(正文脚注给出通讯邮箱) 作者列表:Junjie Li、Xuelong Geng、Kun Xie、Feiyu Shen、Yichen Wu、Ziqi Dai、Yichen Han、Yan Jia、Kai Huang、Junjie Chen、Yixuan Li、Manzhen Wei、Fenglong Xie、Lei Xie、Xu Tang、Yao Hu(机构:Xiaohongshu) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 742 words

FlowSep 2: Self-Supervised Flow Matching for Language-Queried Audio Source Separation

📄 FlowSep 2: Self-Supervised Flow Matching for Language-Queried Audio Source Separation 标签:#音频分离 #流匹配 #生成模型 #自监督学习 9.0/10 | 创新 1.9/2 | 严谨 1.5/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.5/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 9.0/10 | 前10% | 文档类型:方法研究 | 评分置信度:中 | #音频分离 | #流匹配 | #生成模型 #自监督学习 | arxiv 👥 作者与机构 第一作者:Yi Yuan(University of Surrey,英国) 通讯作者:正文未明确标注 作者列表:Yi Yuan、Xubo Liu、Haohe Liu、Xiyuan Kang、Mark D. Plumbley、Wenwu Wang(机构:University of Surrey,英国;Meta Superintelligence Labs,美国;King’s College London,英国) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 493 words