先松开参考音频的束缚,再用旋钮调风格:ReStyle-TTS 的相对连续控制
针对零样本合成过度继承参考风格的问题,ReStyle-TTS 用解耦引导降低参考依赖、用正交融合的风格 LoRA 做连续相对调节,并用音色一致性优化补回音色,代价是新风格仍需收集数据再训 LoRA。
针对零样本合成过度继承参考风格的问题,ReStyle-TTS 用解耦引导降低参考依赖、用正交融合的风格 LoRA 做连续相对调节,并用音色一致性优化补回音色,代价是新风格仍需收集数据再训 LoRA。
针对流式语音大模型边听边推理容易出错且不能回滚重说的问题,RetroThinker 用三阶段事后反思微调让 Moshi 在文本内心独白中自验自改,在 TTS 版 GSM8K 上以相近延迟取得 11 个百分点的绝对准确率提升,代价是反思会先拉长推理链,需再用 Early Reasoning 和 LengthDPO 压回延迟。
针对实时通信中未知增强与编解码耦合失真问题,论文用真机穿越七个主流平台构建约 600 小时配对数据并提出音素引导一致性学习,在离线与在线混合评估上把平均等错率降到 5.81%,代价是对极端噪声与激进非线性失真仍有差距。
针对语音到语音模型只测语义、不测说话方式的问题,S2S-Arena 用四级交互协议与 1243 条语音查询做 1001 次语音内成对比较,最强证据是工业模型全面领先而学术模型在高难度表达层落后 300 分以上,代价是合成语音分布与短轮交互的局限。
针对单路编码器难以同时保语义和保音质的问题,SAC 把冻结语义流与可训练声学流分开量化再融合解码,在 LibriSpeech 重建与 ARCH 语义探测上取得低词错误率和高自然度,但低码率下音色相似度仍有代价。
该文以 WavLM 为骨干研究说话人日志,报告加权多层目标、10k 小时数据规模、Large 容量与 Conformer 切块调优带来可复现的 DER 下降,但 100k 小时与剪枝收益趋平且标注噪声限制可测改进。
针对多轮多语言对话选择题中文本先验掩盖听觉依赖的问题,该工作用事件级切分加语义与声学双分支合成 359825 题,再把文本可答的弱题用于监督微调、必须听音频的强题用于 GSPO 强化学习,以 90.92% 的终测准确率为证据,代价是依赖大模型判断与多阶段验证流水线。
该研究固定 Qwen2-Audio-7B-Instruct 做受限英译中语音翻译,只对 gate_proj、up_proj 和 down_proj 做有损量化加无损 Zstandard 压缩,本地 416 条对比中 q3 加 Zstd 以 0.7767 的 COMET 最接近 0.7792 的基线而体积降到 10.312 GB,q2 加 Zstd 以 …
针对流式语音对话必须在文本生成前给出情绪条件的问题,Self-EmoQ 用话语级马尔可夫决策过程加模仿奖励与普鲁契克理论奖励学习情绪规划器,四个对话数据集上报告了情绪排序与回复质量的提升,代价是依赖大模型打分与离散情绪集合。
针对整段临床对话只有一个会话级标签且病理性表现稀疏不均匀的问题,该工作用会话级聚合、片段级伪标签与帧级一致性三层联合的纯音频半监督框架学习,在中英文抑郁与阿尔茨海默数据上以极少标注逼近全监督,并以消融与伪标签演化分析揭示收益与代价。
该研究把冻结的语音编码器、投影器和大语言模型连成三阶段流水线,用多头分类器探测说话人属性在各阶段的可恢复性,并用频谱对抗掩蔽选择性压制目标属性,最强证据是编码器端说话人标识准确率从 0.51 降到 0.01 而词错误率几乎不变,代价是越抽象的表示越难控且情感属性跨数据集不稳定。
SHANKS 针对等说完再思考导致无法中途打断和工具延迟的问题,采用固定时长语音分块交替生成未说出思考,在数学打断与旅行工具对话中提前完成推理和调用,但提前行动伴随成功率下降需与听完再调用组合使用。
论文在 AASIST 最后隐层加 Top-K 稀疏约束,用 ASVspoof5 验证检测性能与按攻击类型度量的解耦度,最强证据是 D=320、k=20 时测试集 EER 为 23.36% 且单样本约 95% 维度为零,代价是需放大隐层并舍弃难检攻击后解耦结论才成立。
把文本解码器的 DiscoGP 搬到 HuBERT 与 Wav2Vec 2.0 上做分类电路发现,用冻结与随机对照验证预训练计算的作用,并以砍掉 QKV 残差把边发现显存从四次降到三次,代价是部分任务仍需保留 MLP 残差与早停。
该文在 MPS 和 SpeechOcean 儿童朗读数据上比较 VTLN 加移调、McAdams 系数与神经编解码 NACLM,报告 VTLN 在 α=1.2 加负半音移调时隐私与可懂度韵律保持最均衡,而 NACLM 隐私最强但词错误率和韵律失真代价最大。
针对多语说话人带来的身份偏置问题,该工作用说话人门控动态加权同说话人与跨说话人两个神经 PLDA 语言专家,在盲测上报告验证等错误率 19.13% 与识别宏平均准确率 78.94%,代价是两阶段数据复用导致开发集显著乐观。
论文以多轮对话中同一说话人是否保持声学一致为问题,用检测、定位、判别三任务与 1818 个人审实例检验 12 个大音频语言模型与 6 种嵌入基线,最强证据是判别可达 81.5% 而检测仅 64.7% 且加文本上下文后不一致检出崩塌,代价是绝对判断阈值不稳与文本压过声学。
针对现代语音整体质量高但损伤只出现在局部而难定位难分类的问题,该工作用部分混合生成帧级伪标签并加帧级监督对比损失训练双头帧级模型,在域内与域外混合数据上把嵌入检测做到交集面积 0.91 左右,代价是多重并发损伤下类型纯度下降且干净帧取舍需在检测稳定与聚类纯度间权衡。
IWSLT 2026 围绕离线、低资源、压缩、字幕、同传、语音生成与质量估计组织十个赛道,用统一数据条件、自动指标加听音频人工打分检验级联与端到端路线,最强证据是压缩后 4 比特模型与全精度接近、额外上下文平均提升 2.75 个 COMET 点,而语音质量估计在片段级仍远低于人工一致性。
针对医疗语音数据稀缺与问诊能力缺失问题,论文用 405k 文本注入知识再用 198k 合成语音做模态重对齐,在多轮问诊与单轮问答上报告最优分数,代价是仍以普通话合成为主且只验证文本语音两种模态。