Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation

📄 别再让大模型把“3.45 美元”直接念出来:用 40 个可解释特征把文本对齐到可朗读 英文题目:Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation 一句话:论文把 TTS 友好文本生成定义为偏好对齐问题,用仅 40 个权重的可解释特征线性奖励 FaRM 替代数十亿参数黑盒奖励模型,在仅 10 个样本时仍保持稳定,并在启发式、TTS→ASR 往返与人工听感三重验证下取得最均衡的友好度与有用性权衡,代价是输出偏长且目前仅验证英语双域单引擎。 标签:#语音合成 | #强化学习 | #语音交互 | #大语言模型 | #数据集 评分:7.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Thibaut Thonet:机构信息未在 arXiv HTML 中可靠披露 Jos Rozen:机构信息未在 arXiv HTML 中可靠披露 Laurent Besacier:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把语音合成(Text-to-Speech,TTS)友好文本生成显式定义为可度量的偏好对齐问题,并用可解释特征线性奖励替代黑盒奖励模型,在仅 10 个样本的低数据 regime 下仍能维持稳定提升,工程链路完整且验证了廉价启发式与昂贵链路及人工听感的一致性。短板是数据集均为合成或半合成且仅覆盖英语咖啡点单与菜谱两域,启发式权重与 TTS→ASR 链路均高度依赖单一引擎与正则设计,输出偏长问题仅做单点权重干预,外推到真实多引擎、多语言部署的可信度不足。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1309 words

TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models

📄 掐点说话:TimeSteer 把联合音视频扩散模型的隐式时间搬到明处 英文题目:TimeSteer: Inference-Time Speech Scheduling in Joint Audio-Visual Diffusion Models 一句话:针对联合音视频扩散模型只管说什么不管何时说的问题,TimeSteer 在推理时用时序敏感注意力头定位源区间并用分区读图在预测干净隐空间搬运内容,在 SpeechShift 上将 HR0.2 提升 2 倍以上而 WER 与画质几乎不掉,代价仅为每步一次无梯度前向。 标签:#音视频生成 | #扩散模型 | #语音合成 | #多模态模型 评分:7.2/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Chao Zhou:机构信息未在 arXiv HTML 中可靠披露 Yiling Chen:机构信息未在 arXiv HTML 中可靠披露 Qi Chu:机构信息未在 arXiv HTML 中可靠披露 Tao Gong:机构信息未在 arXiv HTML 中可靠披露 Nenghai Yu:机构信息未在 arXiv HTML 中可靠披露 Tianyi We:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把联合音视频扩散模型中隐含的时序结构显式化为可编辑的目标到源读图映射,无需训练即可把语音精确塞进任意区间,思路干净且在 LTX-2 与 daVinci-MagiHuman 两个异构骨干上均有效。短板是所有证据仍困在 5 秒短片段与 8 步蒸馏采样器内,对长时多轮对话、真实语速自然度以及口型同步的人工主观评估几乎空白,承诺开源的 SpeechShift 与代码尚未兑现也削弱了可验证性。 ...

2026-09-02 · 更新于 2026-09-04 · 9 min · 1803 words

Audio-Driven Adversarial Defense for 3D Talking Face Generation with totally Visual Fidelity Preservation

📄 不改脸只改声:把保护藏进人耳听不见的掩蔽阴影 英文题目:Audio-Driven Adversarial Defense for 3D Talking Face Generation with totally Visual Fidelity Preservation 一句话:针对单目视频重建的 3D 肖像可被任意语音驱动滥用的风险,该工作把防御从视觉像素转向音频信号,用心理声学掩蔽约束的频域扰动诱导渲染嘴型坍缩,在 11 个身份的小规模评测中以更低的音频感知距离实现与视觉防御相当的口型破坏,但压缩与重采样的鲁棒性与主观听感仍待实测补足。 标签:#语音合成 #鲁棒性 #模型评估 评分:4.3/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.6/1.5 | 清晰度 0.5/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Rui-Qing Sun:Beijing Institute of Technology, Haidian Qu, Beijing Shi, China Chen-Hao Cui:Beijing Institute of Technology, Haidian Qu, Beijing Shi, China Hui-Yang Zhao:Beijing Institute of Technology, Haidian Qu, Beijing Shi, China Tian Lan:Beijing Institute of Technology, Haidian Qu, Beijing Shi, China Zhijing Wu:Beijing Institute of Technology, Haidian Qu, Beijing Shi, China Xian-Ling Mao:Beijing Institute of Technology, Haidian Qu, Beijing Shi, China 💬 毒舌点评 把视觉域主动防御搬到音频域并用心理声学掩蔽做不可感知约束的切入点值得肯定,算是对3D场口型驱动滥用风险的模态级回应。但论文充斥2018会议信息与2608 arXiv编号矛盾、DOI占位符、QQ邮箱与多处乱码,实验仅在11个身份的HDTF子集上对比2个基线且无方差与显著性检验,声称的MP3/AAC与重采样后信道鲁棒性、主观听感验证均未提供实测,关键超参数与优化细节大量缺失,视觉完全保真的主张缺乏可复现支撑。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1083 words

Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction

📄 从一次性生成到先诊断再重做:LoopTTS 如何让语音大模型当韵律医生 英文题目:Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction 一句话:针对自回归语音合成中重音错位与停顿失当等局部韵律缺陷,LoopTTS 用 Filter-Judge-Refiner 三级离线闭环让 AudioLLM 先打分再开处方,并以约 42K 对比弱标签训练 Refiner 做指令引导重合成,在被判低分的约 7.9% 样本上把 MOS 从 3.2 左右拉回 4.1 以上,代价是仅对疑似缺陷样本生效且依赖闭源 AudioLLM 的弱标签质量。 标签:#语音合成 #自回归模型 #语音大模型 #指令微调 评分:7.0/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Zeyang Song:National University of Singapore;Tencent Tianchi Liu:LIGHTSPEED Tianrui Wang:Nanyang Technological University Chenglin Xu:LIGHTSPEED Steven Y. Guo:Independent Researcher Haizhou Li:The Chinese University of Hong Kong, Shenzhen;Shenzhen Loop Area Institute 💬 毒舌点评 把 AudioLLM 从只会打分的裁判升级为能下处方的韵律医生,用约 42K 对比弱标签让 Refiner 学会听懂“重读这个词、在这里停顿”的指令,闭环思路在离线质检场景很务实。短板是闭环只在被 Judge 判为低分的约 7.9% 样本上生效,全量增益被大量已通过样本稀释,且 Gemini 标注的弱标签 F1 仅 0.673/0.532 却直接当真值训练,天花板明显受限于闭源模型的稳定性、成本与漂移风险。 ...

2026-09-01 · 更新于 2026-09-04 · 10 min · 1982 words

Sequential Trajectories and Simultaneous Blending: Multi-Emotion Modeling for Instruction-Following TTS

📄 一句里装不下两种心情:HybridEmo 如何让 TTS 先走完轨迹再调好混合 英文题目:Sequential Trajectories and Simultaneous Blending: Multi-Emotion Modeling for Instruction-Following TTS 一句话:针对指令跟随 TTS 中多情感的时序演变与并发共存难题,HybridEmo 用有监督微调初始化再以样本感知路由的 GRPO 分别优化轨迹一致性与混合密度奖励,在 MultiEmo-Test 上提升轨迹正确性与混合强度且保持 WER 在 2% 以内,代价是奖励与评估同源且切分与锚点仍依赖近似假设。 标签:#语音合成 #强化学习 #语音克隆 #后训练 评分:7.5/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yan Zhou:机构信息未在 arXiv HTML 中可靠披露 Yun Hong:机构信息未在 arXiv HTML 中可靠披露 Yang Feng:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把多情感控制拆成时序轨迹与并发混合两类任务,并为其定制可区分的奖励路由与混合密度打分,问题定义清晰且奖励设计有针对性。短板是轨迹分段依赖文本长度等比切分、混合奖励依赖离线合成锚点与 emotion2vec 判别器,评估高度耦合于同一判别空间且人工偏好样本仅 80 次判断,证据闭环感偏重。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1500 words

When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models

📄 主观分数能当奖励吗?当感知预测器遇上可懂度硬约束 英文题目:When Does Predictor-Based RL Align with Human Perception? A Study of Subjective Rewards in Codec-Based Speech Language Models 一句话:论文用 CER 三区硬约束的 GRPO 检验 AnimeScore、UTMOS、Likability 等主观预测器能否作为强化学习奖励,发现机器分数都能涨但只有部分能让人听出来,且同门奖励的 Best-of-8 已接近策略优化的效果。 标签:#语音合成 #强化学习 #语音质量评估 #零样本 评分:7.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Joonyong Park:Spellbrush Jerry Li:Spellbrush 💬 毒舌点评 亮点在于把主观奖励当作预测器—轴—基座三元组来解剖,并用 CER 分区与 Best-of-8 对照把策略优化的幻觉打回原形,诊断框架比单纯刷分更有价值。短板是每轴仅 50 句、单基座 Llasa-1B-Multilingual 的小样本证据却要支撑通用筛选启发式,且 Likability 等关键结论依赖事后分箱解释,统计功效与外推性都偏薄。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1502 words

When Vocal Tone and Literal Meaning Diverge: An Acoustic-Semantic Incongruity Study for Large Audio-Language Models

📄 当声音在笑、文字在哭:大音频语言模型为何听不见讽刺 英文题目:When Vocal Tone and Literal Meaning Diverge: An Acoustic-Semantic Incongruity Study for Large Audio-Language Models 一句话:针对大音频语言模型重文字轻声音、在讽刺等声学-语义矛盾语音上失灵的问题,论文用 IndexTTS2 音色克隆合成 77,559 条矛盾可控的 CREMA-ASIS 数据,通过双任务评测与层级线性探测定位语义主导,并以秩为 4 的 rsLoRA 微调将双条件准确率从约 20% 提升至 68% 且保持转写能力。 标签:#语音情感识别 #参数高效微调 #语音合成 #数据集 #多模态模型 评分:8.1/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yu-Wen Chen:The Fu Foundation School of Engineering and Applied Science, Columbia University, USA William Ho:The Fu Foundation School of Engineering and Applied Science, Columbia University, USA Maxim Topaz:School of Nursing, Columbia University, USA Zoran Kostic:The Fu Foundation School of Engineering and Applied Science, Columbia University, USA Julia Hirschberg:The Fu Foundation School of Engineering and Applied Science, Columbia University, USA 💬 毒舌点评 用 IndexTTS2 的音色克隆把声学情绪与语义情感正交解耦,补上了大音频语言模型(Large Audio-Language Model,LALM)评测中最缺的矛盾样本,并以层级线性探测将语义主导从现象描述推进到表征定位,诊断清晰。代价是数据仍基于 CREMA-D 的夸张表演语音与合成语音,真实自发情绪与细粒度情绪的泛化存疑;基座模型在矛盾样本上双条件准确率仅 15.3% 至 32.0%,问题暴露充分但解法仅停留在秩为 4 的秩稳定 LoRA(rank-stabilized LoRA,rsLoRA)小规模微调,工程增益明显而方法学突破有限。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1610 words

Letters hide the truth from our eyes: English homophones have meaningfully different phonetic realizations

📄 同音不同形,真的同音吗?当语义在频谱里留下指纹 英文题目:Letters hide the truth from our eyes: English homophones have meaningfully different phonetic realizations 一句话:论文追问英语异形同音词是否真正同音,用时间归一化的梅尔频谱与 GPT-2 上下文嵌入做双向线性映射,证明词义能在时频形状上留下可泛化的痕迹,而代价是结论仍被单一新闻语域和 35 对样本所束缚。 标签:#语音识别 #大语言模型 #可解释性 #语音合成 评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Yu-Hsiang Tseng:University of Tübingen, Germany Mirjam T. C. Ernestus:Radboud University, the Netherlands Louis F. M. ten Bosch:Radboud University, the Netherlands R. Harald Baayen:University of Tübingen, Germany 💬 毒舌点评 亮点在于用时间归一化梅尔频谱与上下文嵌入的线性映射直接挑战音位抽象层的经典假设,证据链从判别到生成再到去时长控制相当完整。短板是全部结论绑在美国电视新闻这一单一正式语域和35对异形同音词上,且完全依赖GPT-2文本嵌入代理语义,对说话人、韵律和对齐误差的混淆控制仍显单薄。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 897 words

Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models

📄 说出来就变了味:当语音不再是文本的透明通道 英文题目:Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models 一句话:为检验语音与文本是否在视觉接地判断上保持一致,论文构建了 10150 组英阿双语图文声平行对比三元组并用条件指标 CI 揭示语音会系统性放大判别碎片化,且该不稳定在阿拉伯语和带噪语音下更严重。 标签:#音视频问答 #多模态模型 #语音合成 #多语言 #基准测试 评分:8.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5 👥 作者与机构 Basel Mousi:机构信息未在 arXiv HTML 中可靠披露 Fahim Dalvi:机构信息未在 arXiv HTML 中可靠披露 Shammur Chowdhury:机构信息未在 arXiv HTML 中可靠披露 Firoj Alam:机构信息未在 arXiv HTML 中可靠披露 Nadir Durrani:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用三元组条件指标 Contrastive Instability(对比不稳定性,CI)撕开了聚合准确率的遮羞布,直观证明语音不是中性通道,尤其在阿拉伯语上会系统性放大不一致。短板是全程依赖机器翻译与 XTTS-v2 合成语音构建跨模态平行数据,却未做真实人声与真实环境录音对照,且仅测 4 个 Qwen/Phi 模型,结论外推到“多模态基座模型”略显单薄。 ...

2026-08-29 · 更新于 2026-09-04 · 4 min · 754 words

Scaling phoneme-based TTS augmentation for ASR: A unified pipeline and controlled study

📄 合成语音越多越好吗?在音素层面重新称量文本的价值 英文题目:Scaling phoneme-based TTS augmentation for ASR: A unified pipeline and controlled study 一句话:面对合成语音增广效果不稳定的难题,论文用统一的音素接口把多语言 TTS 与 ASR 增广串成可控流水线,并用真实标签的音素频率筛选文本,在 13 个测试集中的 9 个上超越随机选择,最大相对词错误率降低 19.3%,代价是增益高度依赖语言与域且部分设置并未带来提升。 标签:#语音识别 #流匹配 #语音合成 #多语言 #低资源 评分:6.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Zhen Wang:机构信息未在 arXiv HTML 中可靠披露 TianRui Wu:机构信息未在 arXiv HTML 中可靠披露 RongQi Han:机构信息未在 arXiv HTML 中可靠披露 Hao Wu:机构信息未在 arXiv HTML 中可靠披露 Wei Liang:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用统一的音素(phoneme)接口把多语言文本到语音(Text-to-Speech, TTS)与自动语音识别(Automatic Speech Recognition, ASR)增广流水线跑通,并在4语言13个测试集上做了受控的规模与筛选对比,工程完整度值得肯定;短板是核心贡献PFGS本质是对训练集音素频率的加权复读,理论新颖性有限,且关键的TTS质量、阿拉伯语候选文本不公开等问题让可复现性和外推说服力大打折扣。 ...

2026-08-29 · 更新于 2026-09-04 · 4 min · 805 words