A Geometric Perspective on Composable Emotion Steering in Text-to-Speech Models

📄 A Geometric Perspective on Composable Emotion Steering in Text-to-Speech Models #语音合成 #模型比较 6.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.6/10 | 前50% | #语音合成 | #模型比较 | arxiv 👥 作者与机构 第一作者:Siyi Wang(未说明) 通讯作者:未说明 作者列表:Siyi Wang(未说明)、James Bailey(未说明)、Ting Dang(未说明) 💡 毒舌点评 这篇文章用局部本征维度和线性探测画了一幅漂亮的表征几何地图,把 SLM 和 CFM 在情感空间里的家底翻了个底朝天,视角新颖、逻辑自洽。但故事在高潮处戛然而止——联合引导的干扰分析全凭定性推测,连个消融实验或简单的解耦尝试都没有,好比侦探指出了嫌疑人却没拿出决定性证据;更致命的是,完全没有和标签调控、提示工程等低成本外部方法碰一碰,让“引导到底好在哪”成了悬案。 📌 核心摘要 要解决的问题:在混合情感语音合成中,自回归语音语言模型(SLM)和条件流匹配解码器(CFM)作为激活引导位点时,其表征几何特性如何系统性地影响情感引导的可控性与语音质量,此前缺乏比较研究。 方法核心:利用线性探测评估情感类别在激活空间中的线性可分离性及其跨说话人泛化能力;引入局部本征维度(LID)与 \(\Delta\text{LID}\) 指标刻画情感子空间的几何结构;随后在 CosyVoice2 的 SLM 和 CFM 上执行单点及联合激活引导,评估混合情感合成的质量与比例控制。 与已有方法相比的新处:首次从表征几何角度对比 SLM 和 CFM 作为引导位点,揭示了两者在情感解耦、说话人泛化、子空间维度上的本质差异,为引导位点的选择提供了量化几何依据;发现联合引导会引入相互干扰而非互补增益,并进行了初步归因。 主要实验结果:SLM 单点引导在比例控制指标(\(\rho\)、H-Rt)上显著优于 CFM,且几乎不损失说话人相似度;CFM 引导虽能提升情感强度,但严重损害说话人相似度。联合引导虽能进一步提升情感强度(TEP),却导致比例控制精度和语音质量的下降。关键数据见下表。 Data Config E-SIM↑ TEP↑ ρ↑ H-Rt↑ S-SIM↑ WER↓ CREMA-D No-steer .743 .065 – – .871 1.07 CFM α=1.0 .767 .097 .098 .691 .858 0.76 CFM α=2.0 .786 .160 .193 .717 .807 0.79 SLM α=3.0 .762 .100 .166 .709 .872 1.01 SLM α=5.0 .779 .149 .209 .724 .870 0.78 Joint α=1.0 .767 .131 .112 .695 .859 1.02 Joint α=2.0 .787 .163 .176 .711 .808 1.06 IEMOCAP No-steer .903 .197 – – .888 6.70 CFM α=1.0 .910 .218 .138 .729 .885 6.08 CFM α=2.0 .909 .272 .117 .721 .844 6.15 SLM α=3.0 .911 .228 .186 .744 .891 5.86 SLM α=5.0 .915 .253 .215 .755 .890 6.27 Joint α=1.0 .912 .237 .193 .746 .884 6.05 Joint α=2.0 .911 .274 .170 .737 .845 6.29 实际意义:为混合情感 TTS 系统选择引导位点提供了明确的几何判据:SLM 因其独立、低维的情感子空间,是精确比例控制的首选;CFM 因说话人-情感纠缠,单独��导需谨慎。对联合引导的警告也为多站点控制策略设计提供了有价值的参考。 主要局限性:未与基于标签或提示的外部情感控制方法对比,无法确立激活引导的独特优势;联合引导的归因分析仅停留在现象描述和定性推测,缺乏消融实验或解耦补偿策略;几何分析对该模型的依赖性未在其他混合 TTS 架构上验证。 🔗 开源详情 代码:未提及 模型权重:未提及 数据集:ESD(https://github.com/HLTSingapore/Emotional-Speech-Data);CREMA-D(https://github.com/CheyneyComputerScience/CREMA-D);RAVDESS(https://zenodo.org/record/1188976);IEMOCAP(https://sail.usc.edu/iemocap/) Demo:未提及 复现材料:未提及 文中引用的开源项目: CosyVoice2(https://github.com/FunAudioLLM/CosyVoice) Qwen2.5(https://github.com/QwenLM/Qwen2.5) Emotion2Vec(https://github.com/ddlBoJack/emotion2vec) WavLM(https://github.com/microsoft/unilm/tree/master/wavlm) Whisper(https://github.com/openai/whisper) 激活引导方法:引用了 Wang et al. (2026) 和 Xie et al. (2025),但未提供具体代码链接。 🏗️ 方法概述和架构 该论文采用“先分析几何,后验证引导”的两阶段研究框架,旨在建立表征几何特性与下游引导可控性之间的映射关系。整体流程围绕 CosyVoice2 这一典型的混合 TTS 架构展开,该架构包含一个自回归的语音语言模型(SLM)和一个条件流匹配解码器(CFM)。研究首先对两个模块的激活空间进行探查,然后将从中提取的情感方向向量注入到对应模块,以合成混合情感语音,并评估效果。 ...

2026-07-02 · 更新于 2026-07-24 · 3 min · 596 words

AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

📄 AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation #多模态模型 #语音合成 #自回归模型 #模型压缩 6.5/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前25% | #语音合成 | #模型压缩 | #多模态模型 #自回归模型 | arxiv 👥 作者与机构 作者:Kien T. Pham, I Chieh Chen, Qifeng Chen, Long Chen (通讯作者)。 机构:香港科技大学(The Hong Kong University of Science and Technology)。 ...

2026-07-01 · 更新于 2026-07-24 · 2 min · 380 words

FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model

📄 FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model #自监督学习 #语音合成 #语音识别 #模型压缩 7.2/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0.8/1.5 | 复现 0.4/0.5 | 工程 0.5/1.5 ✅ 7.2/10 | 前25% | #语音合成 | #自监督学习 | #语音识别 #模型压缩 | arxiv 👥 作者与机构 本文由香港中文大学(深圳)和字节跳动联合完成。作者为:Jiaqi Li, Chaoren Wang, Xiaohai Tian, Mingjie Chen, Xinyu Liang, Xu Li, Yufan Lin, Junwen Qiu, Jun Zhang, Lu Lu, Haizhou Li, Zhizheng Wu。其中,通讯作者为jiaqili3@link.cuhk.edu.cn和wuzhizheng@cuhk.edu.cn。 ...

2026-07-01 · 更新于 2026-07-24 · 2 min · 324 words

Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation

📄 Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation #语音合成 #模型评估 7.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.7/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 ✅ 7.2/10 | 前25% | #语音合成 | #模型评估 | arxiv 👥 作者与机构 Dominika Woszczyk (Iconic, United Kingdom) Andreas Triantafyllopoulos (Technische Universität München, Germany) Jura Miniota (KTH Royal Institute of Technology, Sweden) Éva Székely (KTH Royal Institute of Technology, Sweden) Bjoern Schuller (Imperial College London, United Kingdom) ...

2026-07-01 · 更新于 2026-07-24 · 2 min · 327 words

LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish

📄 LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish #语音合成 #语音识别 #自监督学习 #低资源 #基准测试 7.5/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | #语音合成 | #自监督学习 | #语音识别 #低资源 | arxiv 👥 作者与机构 Nina Hosseini-Kivanani Sandipana Dowerah 💡 毒舌点评 这篇论文好在选题切中要害——低资源语言+表达性语音+真实场景数据,确实是块缺肉的骨头。LuxEmo语料库的构建和公开(附带采样链接)是实打实的贡献,工作流描述也算清楚。但“严苛审稿人”视角下,槽点不少:语料库就4位主播,还来自同一个青年节目,说能代表“卢森堡语”有点勉强,作者自己也承认了,但评审意见应更尖锐地指出这直接限制了论文声称的“系统性评估”的普适性上限。情绪分布那“0.5%的愤怒”简直是个事故级数据倾斜,论文仅在结论提一句,审稿人应该追问这如何影响了模型训练与评估的有效性,以及基准测试结论在多大程度上是“可泛化的”。评估方面,20人主观听测且无显著性检验,置信区间大幅重叠,这个“基准”的排名可靠性打个大问号。论文反复强调代码混合是挑战,但分析部分却没拿出任何细粒度的分析(比如混合段vs纯语种段的WER对比),这属于典型的“提了但没分析”,深度不足。另外,像情绪检测分类器的训练数据、置信度阈值选取这些影响复现的关键细节一笔带过,不够“严谨”。总的来说,是一篇合格的资源发布和基准测试论文,但离顶会要求的深度分析和严谨论证还有距离,其影响力主要局限在资源本身,而非方法论或深刻洞察。 📌 核心摘要 本文介绍了LuxEmo,一个用于卢森堡语的表达性语音语料库和TTS基准测试集。该语料库包含从RTL青年广播档案中通过半自动工作流提取的21小时自发语音,标注了语言、说话人身份和四种情绪(中性、快乐、悲伤、愤怒)。作者在LuxEmo上评估了五种TTS系统,涵盖跨语言迁移、多语言支持和卢森堡语适配等方案。主要发现包括:没有单一TTS系统在所有评估维度(音频质量、可懂度、韵律、说话人相似度、情感自然度)上最优;目标语言适配在部分指标上有效但非全面;基于ASR的客观可懂度与人类主观感知的自然度、情感表现存在差异。论文同时指出了语料库在说话人覆盖、情绪分布均衡性以及评估统计显著性方面的局限性。 🔗 开源详情 代码:论文中未提供代码链接。 模型权重:论文中未提供模型权重链接。 数据集:LuxEmo语料库。论文中未提供公开获取链接,但提供了语料库采样链接:https://anonymous.4open.science/r/LuxEmo_Sample-445F/。 Demo:论文中未提及。 复现材料:论文中未提供完整的训练配置、检查点或附录,但提及了数据划分使用的固定随机种子为42。 论文中引用的开源项目:论文中提及了以下项目,但未提供具体链接。 DeepFilterNet [32] NISQA v2.0 [24] DNSMOS [30] LuxASR [9, 26, 35] Wav2Vec2-based mms-lid-4017 model [27] Whisper [28] SpeechBrain ECAPA-TDNN [29] pYIN [21] Sequitur G2P (用于LuxEmo): https://github.com/PeterGilles/sequitur-g2p German gruut (用于EmoDB比较): https://github.com/sequitur-g2p/sequitur-g2p 🏗️ 方法概述和架构 本文的方法可分为两大核心部分:LuxEmo语料库构建和TTS基准测试评估。 ...

2026-07-01 · 更新于 2026-07-24 · 2 min · 376 words

SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation

📄 SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation #语音合成 #扩散模型 7.5/10 ✅ 7.5/10 | 前25% | #语音合成 | #扩散模型 | arxiv 👥 作者与机构 作者:Juncheng Ma, Yuxuan Du, Yanan Sun, Zhening Xing, Changlin Li, Zhenyu Tang, Bo Li, Peng-Tao Jiang, Li Yuan, Daquan Zhou, Yonghong Tian 机构:北京大学深圳研究生院,上海人工智能实验室,腾讯混元,vivo 💡 毒舌点评 这工作方向挺实在,但读下来感觉“非对称性”这个点子虽然合理,可有点被过度包装了。说白了不就是知道人脸动背景不动,音频信号得一直算嘛?方法上,那个空间掩码探查和模态解耦的思路在同类工作里不算新鲜,亮点主要在于把缓存选择建模成动态规划,这算是个不错的工程优化。不过,论文自我标榜为“首个”针对DiT音频动画的缓存方法,这“首创性”的宣称值得商榷,毕竟核心思想(缓存稳定特征、跳过计算)在很多领域都有应用。实验上,在两个特定模型上刷点确实不错,但缺乏对不同掩码质量、不同音频复杂度的鲁棒性分析,结论显得有点过于乐观。最大的问题是,方法高度依赖预训练模型(HunyuanVideo-Avatar, Wan-S2V)的内部结构和现有掩码,通用性和可迁移性存疑。开源方面,只给了基础模型链接,自己的代码没放,这对顶会论文来说是扣分项。 📌 核心摘要 本文提出SyncCache,一种针对基于扩散Transformer (DiT) 的音频驱动肖像动画的训练无关推理加速方法。核心思想是识别并利用任务固有的两种非对称性:空间上,高频动态(人脸、唇部)集中于前景,低频静态背景稳定;模态上,音频块轻量但控制高频同步信号,视觉DiT块计算密集。方法包含三个组件:1)空间非对称探测:利用人类掩码加权第一层输出的误差,对人脸区域变化更敏感,以决定何时刷新缓存;2)模态解耦缓存:在完整计算步骤中缓存视觉块间的稳定残差,在复用步骤中跳过视觉块计算但持续计算音频块;3)内存自适应最优选择:通过一个连续缓存比率σ控制缓存容量,并使用动态规划离线确定在给定σ下最优的缓存边界子集,以最小化残差的时间不稳定性,实现零在线开销的内存自适应。实验在两个主流模型和公开数据集上进行,结果表明SyncCache在大幅降低延迟(最高4.12倍加速)的同时,能保持甚至略微提升生成质量和唇形同步精度,显著优于现有缓存方法。 🔗 开源详情 代码:论文未提供 SyncCache 自身实现代码的明确链接。 模型权重:论文使用了两个开源模型进行评估,其权重可从官方仓库获取: HunyuanVideo-Avatar: https://github.com/Tencent-Hunyuan/HunyuanVideo-Avatar Wan-S2V: https://github.com/Wan-Video/Wan2.1 数据集:评估数据集为 EMTD Dataset。论文未提供该数据集的直接获取链接。根据描述,该数据集“主要由单人说话和半身人视频组成”。 Demo:论文未提及在线演示链接。 复现材料:论文未提供详细的训练配置、检查点或完整附录。报告了关键实验设置(如使用8块A800 GPU、FlashAttention、FSDP配置、人类掩码权重\(\omega=2\)等)。 论文中引用的开源项目:包括Diffusion Transformers (DiT)、HunyuanVideo、Wan2.1、FlashAttention、Hallo3、FantasyTalking、Hallo、OmniAvatar、EchoMimic、TeaCache、MagCache、TaylorSeer、HiCache、EasyCache、DeltaDiT、ClusCa、SpeCa、CGCache、FoRA、OmniCache等。 🏗️ 方法概述和架构 SyncCache的框架如图3所示,旨在通过解耦空间和模态的非对称动力学来加速基于DiT的音频驱动肖像动画推理。其核心流程可分为三个相互关联的组件: ...

2026-07-01 · 更新于 2026-07-24 · 2 min · 420 words

UniSAE: Unified Speech Attribute Editing on Speaker, Emotion and Low-Level Content via Discrete Phonetic Posteriorgram Modelling

📄 UniSAE: Unified Speech Attribute Editing on Speaker, Emotion and Low-Level Content via Discrete Phonetic Posteriorgram Modelling #语音合成 #语音编辑 #扩散模型 #数据增强 7.3/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.8/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.3/10 | 前50% | #语音合成 | #数据增强 | #语音编辑 #扩散模型 | arxiv 👥 作者与机构 第一作者 Chuanbo Zhu 与合作者 Wuyou Zhou, Rongxiu Zhong, Shilei Zhang, Kun Qian 来自上海交通大学。通讯作者 Yike Guo 与 Wei Xue 同样来自上海交通大学,并关联北京通用人工智能研究院(BigAI)。 ...

2026-07-01 · 更新于 2026-07-24 · 1 min · 143 words

DialogPII: A multilingual dataset of synthetic dialog transcripts to detect personal information

📄 DialogPII: A multilingual dataset of synthetic dialog transcripts to detect personal information #数据集 #语音合成 #语音识别 8.9/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.9/1.5 🔥 8.9/10 | 前25% | #语音识别 | #数据集 | #语音合成 | arxiv 👥 作者与机构 作者:Roland Roller, Vera Czehmann, Derya Erman, Luke Flanagan, Ibrahim Baroud, Frédéric Blain, Viviana Cotik, Eletta Giusto, Akhil Juneja, Mariana Neves, Maria Słowińska, Christine Hovhannisyan, Aaron Louis Eidt, Lisa Raithel, Sebastian Möller, Maija Poikela. 机构:德国人工智能研究中心 (DFKI)、柏林工业大学、柏林健康研究所 (BIH)、蒂尔堡大学、布宜诺斯艾利斯大学、独立研究员、德国联邦风险评估研究所 (BfR)。 ...

2026-06-30 · 更新于 2026-07-24 · 7 min · 1334 words

FacePlex: Full-Duplex Joint Speech-Facial Motion Generation for Conversational Avatars

📄 FacePlex: Full-Duplex Joint Speech-Facial Motion Generation for Conversational Avatars #语音合成 7.8/10 | 创新 1.6/2 | 严谨 1.1/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.8/10 | 前25% | #语音合成 | #语音合成 | arxiv 👥 作者与机构 Habin Lim, Jae-Ho Lee, Hah Min Lew (Korea University), Ji-Su Kang (Klleon), Gyeong-Moon Park (Korea University) 💡 毒舌点评 这篇工作确实填补了一个关键空白:将“全双工语音生成”和“联合面部动画”这两个平行研究流合并到一个流式框架中。Rolling Flow Matching和Rolling Cross-Attention的提法有一定新意,试图解决流式条件下多模态对齐的难题。然而,这篇论文的“统一框架”严重依赖于PersonaPlex和UniLS这两个未开源的外部模型作为主干和教师,其方法的独立性和通用性存疑。实验评估完全局限于FLAME参数空间,离生成逼真的、可用于实际部署的对话头像还有很长的路要走。论文在定义问题和系统设计上花费了大量笔墨,但核心的运动生成模块相对简单,更像一个精巧的工程适配器而非深刻的算法创新。此外,缺乏开源代码和模型严重削弱了其可复现性和对社区的实际贡献。 📌 核心摘要 本文首次形式化定义了“全双工联合语音-面部运动生成”任务,即系统需要在每个时间步同时生成语音和同步的面部运动。为此,作者提出了FacePlex框架,将PersonaPlex语音模型与一个运动生成器耦合。其核心组件包括:1) Rolling Flow Matching (RFM),通过维护一个具有不同去噪阶段的运动队列,实现连续的流式运动生成;2) Rolling Cross-Attention (RCA),使运动队列与语音隐藏状态队列同步滚动,从而让每个运动片段在去噪生命周期内能关注到一段滑动的语音上下文窗口(约±240ms)。实验表明,FacePlex在保持全双工语音交互能力(如打断、反馈)的同时,其生成的面部运动在唇形同步和运动保真度上优于现有的音频驱动离线模型。 ...

2026-06-30 · 更新于 2026-07-24 · 3 min · 524 words

SIMAX: A Scalable and Interpretable Framework for Multi-Fidelity and Annotated Clinician-Patient Dialogue Simulation

📄 SIMAX: A Scalable and Interpretable Framework for Multi-Fidelity and Annotated Clinician-Patient Dialogue Simulation #语音合成 #数据增强 6.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.4/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 6.6/10 | 后50% | #语音合成 | #数据增强 | arxiv 👥 作者与机构 Zhuhan Bao1†, Rui Yang2,3†, Bohao Yang4, Zhiyi Liu1, Sicheng Shu1, Ruio Heerschap1,5, Le Li6, Doris Yang7, Elisabeth Bond1, Haoyuan Wang8,9, Nicoleta Economou-Zavlanos1, Joshua M. Biro10, Matthew McDermott11, Nan Liu1,2,3,15,16, Anand Chowdhury17, Kai Sun14, Kathryn Pollak12,13, Ed Hammond18, Chuan Hong1,19* 1 Department of Biostatistics and Bioinformatics, Duke University School of Medicine, Durham, NC, USA 2 Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School, Singapore, Singapore 3 Centre for Biomedical Data Science, Duke-NUS Medical School, Singapore, Singapore 4 Department of Statistical Science, Duke University, Durham, NC, USA 5 Leiden University Medical Centre, Leiden, The Netherlands 6 Department of Mathematics, University of Texas at Austin, Austin, USA 7 Department of Internal Medicine, Yale School of Medicine, New Haven, CT, USA 8 Department of Biostatistics, Epidemiology and Informatics, Perelman School of Medicine, University of Pennsylvania, Philadelphia, PA, USA 9 The Graduate Group in Applied Mathematics and Computational Science, School of Arts and Sciences, University of Pennsylvania, Philadelphia, PA, USA 10 Medstar Health National Center for Human Factors in Healthcare, Washington, DC, USA 11 Department of Biomedical Informatics, Columbia University, New York, NY, USA 12 Cancer Prevention and Control, Duke Cancer Institute, Durham, NC, USA 13 Department of Population Health Sciences, Duke University School of Medicine, Durham, NC, USA 14 Division of Rheumatology and Immunology, Duke University School of Medicine, Durham, NC, USA 15 Pre-hospital and Emergency Research Centre, Health Services Research and Population Health, Duke-NUS Medical School, Singapore, Singapore 16 NUS Artificial Intelligence Institute, National University of Singapore, Singapore, Singapore 17 Division of Pulmonary, Allergy and Critical Care Medicine, Duke University School of Medicine, Durham, NC, USA 18 Duke Center for Health Informatics, Durham, NC, USA 19 Duke Clinical Research Institute, Durham, NC, USA ...

2026-06-30 · 更新于 2026-07-24 · 3 min · 501 words