论文解读

把证据运到情绪空间再验算:BiCFlow-MER 的条件输运识别

针对音频文本情绪证据被说话风格与词汇内容纠缠且两模态可能冲突的问题,BiCFlow-MER 用解耦后的冲突感知条件把样本输运到 64 维情绪端点再做前后向几何打分,在 IEMOCAP 与 MELD 及零样本 CASE 上报告最好值,代价是三阶段流程与多模块超参数。

 · 约 20 分钟 · 9794 字 阅读 →
论文解读

不是越不像越好:把遗忘相似度锚定到陌生人水平的说话人遗忘

针对零样本语音合成中退出说话人仍可被画廊检索重新识别的问题,GUARD 在冻结主干上用门控加逐层激活 steering 并以生成后奖励把遗忘相似度推向人群冒名者水平,在 CosyVoice2 上把遗忘相似度从 0.541 降到 0.103、150 人画廊重识别从 73.5% 降到 0.5%,代价是保留集与可懂度基本不变但新增门控与奖励调参依赖。

 · 约 18 分钟 · 8712 字 阅读 →
论文解读

先学发音再学音色:用合成语音开路、真人语音纠偏的低资源适配

针对缅甸语和老挝语缺少人工标注配对数据的问题,该研究先用固定音色合成语音建立文本到语音的对应,再用真人录音加双识别器一致性加权恢复目标音色控制,证据显示内容准确率得到保持而相似度被拉回,但逆序训练仍在发音准确率上占优且一致性只是不可靠程度的代理指标。

 · 约 18 分钟 · 8807 字 阅读 →
论文解读

从全脸到嘴部:ROAM-ASD 用联合自注意力应对开放世界的说话人检测

针对野外遮挡噪声下说话人易误判问题,ROAM-ASD 联合音频、全脸与嘴部三流并用联合自注意力加模态丢弃融合,在五个基准上取得 98.8%、87.9% 等 mAP,代价是需要人脸跟踪与嘴部关键点定位。

 · 约 20 分钟 · 9534 字 阅读 →
论文解读

原型挤在一处时,零样本换声为何更难泛化到没见过的说话人

论文研究角间隔 ECAPA-TDNN 分类器原型在单位超球面上的集中与有效维度坍缩问题,用铰链式 Riesz 对数能量与参与率最大化两项直接作用于原型的正则改善覆盖,并在 Fast-VGAN 零样本换声上以 WER 从 6.54% 到 5.97%、相似度从 0.65 到 0.69、UTMOSv2 从 2.47 到 2.70 为证据显示鲁棒性提升,而说话人识别 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10639 字 阅读 →
论文解读

先锁定结论语义再推理:SPARE 如何把长思维链拉回音频

针对显式思维链导致注意力偏离音频的推理落差,SPARE 在推理起点插入寄存器令牌并用结论语义做余弦对齐,在 SALMONN 13B 上把 MMAU 提升到 58.03%、MMAR 提升到 40.32%,代价是微调阶段增加一个训练期对齐分支而推理零新增开销。

 · 更新于 2026-09-24 · 约 18 分钟 · 8867 字 阅读 →
论文解读

听到不等于能定位:把不可靠的音频监督放在辅助通道的开放词汇音视定位

针对文本查询的音视事件时间定位,论文提出按边界可靠性分配教师监督位置的 OV-OrthKD,在 OV-AVEBench 上达到 0.816 片段 AP 且未见类 F1@0.5 提升 3.4 个百分点,代价是角色固定且仅做局部权重验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10058 字 阅读 →
论文解读

把声纹溯源改成查字典:在音频文本共享空间里检索没见过的合成系统

该文把合成语音归属从闭集分类改写为音频对自然语言描述的跨模态检索,用冻结双编码器加小投影头在 MLAAD v9 上实现未见模型 58.4% 模型级 MRR,代价是闭集精度低于专用分类器且通用架构易混淆。

 · 更新于 2026-09-24 · 约 19 分钟 · 9492 字 阅读 →
论文解读

强音频压住弱情绪时:EMODY Flow 用辅助分类器找回情绪可控性

EMODY Flow 复用冻结 Qwen-3 Omni Talker 的 Mimi 音频嵌入驱动两个并行 DiT 流匹配模型分别生成身体与面部动作,在 BEAT2 上以 FGD 0.302 报告手势质量最优,并以 FGD 升至 0.362 的小幅代价换取身体动作的情绪可分性。

 · 更新于 2026-09-24 · 约 22 分钟 · 10738 字 阅读 →
论文解读

去掉提示词文本:用合成同说话人提示做微调的跨语言克隆

针对推理时拿不到参考音频文本的跨语言克隆问题,该文用预训练 F5-TTS 合成同说话人提示做监督微调并配合静音鲁棒语速预测器,在 LibriSpeech-PC 上 WER 为 2.014% 且相似度提升,代价是自然度小幅下降。

 · 更新于 2026-09-24 · 约 21 分钟 · 10077 字 阅读 →
论文解读

去掉语言方向:用残差做未见语言的音频伪造检测

针对训练中完全没有目标语言的跨语言伪造检测,该文用源语言真话拟合从连续语种表征到语音表征的岭映射并取残差,在六语六骨干上报告平均 9–17% 相对收益,远距离迁移收益更大,但近距离个别组合出现反例。

 · 更新于 2026-09-24 · 约 18 分钟 · 8787 字 阅读 →
论文解读

长语音越说越飘、难句反复打转:DiTAR+ 用扩张视野与分层遮蔽稳住自回归扩散

针对连续隐变量自回归扩散在长句和难句上的发音错误与语义幻觉,DiTAR+ 用扩张上下文采样扩大历史视野、用分层声学遮蔽先对齐语义再渲染声学,在 ZH-Hard 上把词错误率从 12.478% 降到 9.893%,在 25 到 35 秒长句上把说话人相似度从 0.741 提升到 0.759,同时词错误率从 2.778% 降到 2.173%,代价是质量主观分相对 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9543 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

把对话、主动发起与非言语表达压进一个提示驱动策略:基于 LLM 的工作流能否替代分离式规则

该研究把主动规划、口头对话与非言语通信统一为一个零样本提示驱动的 LLM 代理工作流,并在 Pepper 机器人上与基于规则的多策略基线对比,主动性离线重放占优而用户体验总体接近,但推理延迟与样本不均衡仍是主要代价。

 · 更新于 2026-09-24 · 约 17 分钟 · 8085 字 阅读 →
论文解读

不是打绝对分,而是估计变化量:同人同文本的相对声音印象

论文把任务定为估计第二句相对第一句在九个反义维度上的印象差向量,对比可解释声学特征、自监督表示与多模态大模型三条路线,报告自监督表示在复杂印象上更稳,而多模态大模型零样本不可靠,代价是单女声优与同文本的强受控条件。

 · 更新于 2026-09-24 · 约 21 分钟 · 10305 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
论文解读

先调语言模型还是先调声学解码器:法语德语适配的部件级取舍

该研究以 CosyVoice2 为骨干解决法语和德语零样本段落合成可懂度低的问题,选择只微调文本语音语言模型加流解码器并冻结声码器,最强证据是在 250 小时法语和 500 小时德语下相对词错误率下降 83 到 91%,代价是微调声码器会损害可懂度且超量加长数据会因复杂度多样性失配使词错误率回升。

 · 更新于 2026-09-24 · 约 16 分钟 · 7925 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

未见声音总被判成熟悉声音:用属性生成补数据,再用分布检测先分流

针对广义零样本声事件分类中未见类被大量判为已见类的问题,论文用属性条件 GAN 生成未见类隐特征训练分类器,再以类级分布外检测做分流与概率融合,在 RWCP-SSD 上把调和平均从 36.2 提高到 78.7,代价是类级检测器数量与阈值调节成本增加。

 · 更新于 2026-09-24 · 约 15 分钟 · 7495 字 阅读 →