说话很准、唱歌就失灵:用三路特征混合守住语音又学会歌声
针对语音训练的伪造检测器在歌声上失效的问题,论文用对数梅尔谱、MFCC 与 Wav2Vec2 三专家加门控融合与 50/50 语音歌声联合微调,在 CtrSVDD 上报告 1.82% 等错误率并在 ASVspoof 2019 上保持 0.38%,代价是多分支推理开销与 SingFake 野外数据上仍高达 44.20%。
针对语音训练的伪造检测器在歌声上失效的问题,论文用对数梅尔谱、MFCC 与 Wav2Vec2 三专家加门控融合与 50/50 语音歌声联合微调,在 CtrSVDD 上报告 1.82% 等错误率并在 ASVspoof 2019 上保持 0.38%,代价是多分支推理开销与 SingFake 野外数据上仍高达 44.20%。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对文本角色扮演忽略语音自发性和人物声音一致性的问题,ActorMind 用眼耳脑口四智能体的现成推理流程组织语音合成,在 Friends 第一季构建的 7653 句基准上以 RP-MOS 取得平均 3.56 分的报告结果,但其评估依赖小规模主观打分且未训练模型参数。
针对连续西班牙语静音发音重建中说话人发音差异大且数据少的问题,论文提出每轮按音素平均误差自适应调整帧级损失权重的方法,在肌电和唇读两种模态上以字符错误率为主要证据显示多数说话人可懂度提升,但增益随预训练增强而减小且呈说话人依赖。
该文把攻击溯源做成验证问题,用自监督前端加角度间隔与混合正则训练与训练集完全隔离的嵌入器,在分布内用少样本后端取胜而在分布外用零样本余弦取胜,但两类等错率仍在 13% 至 30% 量级。
AEQ-Bench 用 1,885 个音频加文本实例把共情拆成生成回应与判断回应 2 类任务,用相同话语换语境和相同语境换语调 2 种对照进行测试,报告显示带音频输出的模型在自然度与语音表达上占优,而细粒度韵律自动评估仍不可靠,代价是依赖人工核验与粗粒度量表。
Affectron 针对开放场景下非言语发声数据少且无对齐监督的问题,用解耦小语料上的情感驱动匹配与情感感知路由构造增广样本并微调 VoiceCraft 主干,报告显示非言语真实感与多样性提升而口语自然度基本保持,代价是重叠语音未建模且依赖伪标签与小规模干净语料。
该工作以音频为唯一证据检验蕴含、一致、合理、口音漂移与口音克制五类推理,报告显示生成式模型优于对比式模型但普遍过度蕴含,而转写加推理的级联系统在医疗蕴含上取得更高宏平均 F1 并伴随明显的模型偏向代价。
论文把声纹伪造检测的跨库崩溃拆成捷径依赖与域偏移两类失败,用有向图加受控声学干预证明非语音结构是主捷径,而针对性增强能解耦但要付出域内代价。
SRE24 音频轨围绕电话与视频伴音、变长注册与短测试、多语言与多人语音组织说话人确认试验,分析报告三段注册优于单段长注册、电话匹配优于视频伴音匹配、短测试与多人测试明显更难,而放宽训练数据的改善大于多系统融合的改善。
针对方言阿拉伯语数据分散与标注不一致问题,Arab Voices 用统一转写与元数据对齐 31 个数据集并以方言度与音频质量代理做可比刻画,在 14 个方言零样本评测中显示现代模型仍困难而多模态大模型相对更稳,代价是音频质量代理与人感并不完全一致且部分低资源方言仍缺乏数据。
该研究复核一篇中库尔德语语音合成公开释放,问题是论文、模型卡与文件三者是否一致,方法是逐项比对配置、评测与许可,最强证据是三系统合成分为 4.08、4.01、4.06 且与各自录音质量同序,主要代价是测试集未标记、识别器兼做转写与评分以及禁改许可限制了公开修正。
针对音频与文本交替出现的多轮上下文检索,论文构造统一 ATIR 基准并训练带音频令牌选择器的双编码器 ATIR-Qwen-3B,报告平均 78.86% Recall@1 和 85.09% nDCG@5,最强对照下仍保留打乱交织结构即下降的反证,代价是两阶段微调与选择器阈值调节。
针对大音频语言模型越狱评测只做文本转语音的问题,该工作先建 1495 条 10 类音频基线集,再用语义一致约束加贝叶斯优化组合时域频域混合扰动生成更强攻击,并在 7 个模型上报告攻击成功率等五项指标显示微小保义扰动仍显著降低安全性,同时以严格拒绝换可用性为代价。
该研究把多轮语音交互拆成记忆、指令、一致性和语音改口四个轴,用 452 段无脚本真人录音和 1712 条原子细则做固定上下文评测,报告最高模型仅 54.65% 通过率且语音改口最难,同时付出长音频一致性下降与声音线索记忆明显弱于语义记忆的代价。
针对聚类式说话人日志把多人同时说话和背景语音误并入单说话人簇的问题,论文用多说话人态与背景态增广 HMM 状态空间并引入外部说话人切换点约束,在 DoPaCo 无重叠上相对基线降低约 55% 说话人错误率,代价是默认非重叠输出在重叠区漏检较高,需外接重叠检测才可做重叠感知输出。
论文把 CosFace 证明为 Q-Margin 在 α 趋于 1 时的特例,并用大小模型与大小数据对照说明稀疏在小数据与大模型微调中有用,但小模型在大规模训练后易出现梯度饥饿。
论文把自动语音识别为中心的监督视为感知弱的原因,用转写、副语言、非语言事件三部分的结构化统一音频模式组织监督,在保持推理的同时把 MMSU 感知从 44.8% 提升到 55.7%,代价是需要多阶段对齐与合成标注的质量控制。
论文把音频章节切分从句子序列搬到时间轴上,对比文本加声学特征、纯音频 AudioSeg 与多模态大模型,报告 AudioSeg 在 YTSeg 上显著领先而停顿是最有效的手工特征,同时揭示长音频与多说话人下的衰减与评估不可比问题。