把证据运到情绪空间再验算:BiCFlow-MER 的条件输运识别
针对音频文本情绪证据被说话风格与词汇内容纠缠且两模态可能冲突的问题,BiCFlow-MER 用解耦后的冲突感知条件把样本输运到 64 维情绪端点再做前后向几何打分,在 IEMOCAP 与 MELD 及零样本 CASE 上报告最好值,代价是三阶段流程与多模块超参数。
针对音频文本情绪证据被说话风格与词汇内容纠缠且两模态可能冲突的问题,BiCFlow-MER 用解耦后的冲突感知条件把样本输运到 64 维情绪端点再做前后向几何打分,在 IEMOCAP 与 MELD 及零样本 CASE 上报告最好值,代价是三阶段流程与多模块超参数。
针对零样本语音合成中退出说话人仍可被画廊检索重新识别的问题,GUARD 在冻结主干上用门控加逐层激活 steering 并以生成后奖励把遗忘相似度推向人群冒名者水平,在 CosyVoice2 上把遗忘相似度从 0.541 降到 0.103、150 人画廊重识别从 73.5% 降到 0.5%,代价是保留集与可懂度基本不变但新增门控与奖励调参依赖。
针对缅甸语和老挝语缺少人工标注配对数据的问题,该研究先用固定音色合成语音建立文本到语音的对应,再用真人录音加双识别器一致性加权恢复目标音色控制,证据显示内容准确率得到保持而相似度被拉回,但逆序训练仍在发音准确率上占优且一致性只是不可靠程度的代理指标。
针对野外遮挡噪声下说话人易误判问题,ROAM-ASD 联合音频、全脸与嘴部三流并用联合自注意力加模态丢弃融合,在五个基准上取得 98.8%、87.9% 等 mAP,代价是需要人脸跟踪与嘴部关键点定位。
论文研究角间隔 ECAPA-TDNN 分类器原型在单位超球面上的集中与有效维度坍缩问题,用铰链式 Riesz 对数能量与参与率最大化两项直接作用于原型的正则改善覆盖,并在 Fast-VGAN 零样本换声上以 WER 从 6.54% 到 5.97%、相似度从 0.65 到 0.69、UTMOSv2 从 2.47 到 2.70 为证据显示鲁棒性提升,而说话人识别 …
针对显式思维链导致注意力偏离音频的推理落差,SPARE 在推理起点插入寄存器令牌并用结论语义做余弦对齐,在 SALMONN 13B 上把 MMAU 提升到 58.03%、MMAR 提升到 40.32%,代价是微调阶段增加一个训练期对齐分支而推理零新增开销。
针对文本查询的音视事件时间定位,论文提出按边界可靠性分配教师监督位置的 OV-OrthKD,在 OV-AVEBench 上达到 0.816 片段 AP 且未见类 F1@0.5 提升 3.4 个百分点,代价是角色固定且仅做局部权重验证。
该文把合成语音归属从闭集分类改写为音频对自然语言描述的跨模态检索,用冻结双编码器加小投影头在 MLAAD v9 上实现未见模型 58.4% 模型级 MRR,代价是闭集精度低于专用分类器且通用架构易混淆。
EMODY Flow 复用冻结 Qwen-3 Omni Talker 的 Mimi 音频嵌入驱动两个并行 DiT 流匹配模型分别生成身体与面部动作,在 BEAT2 上以 FGD 0.302 报告手势质量最优,并以 FGD 升至 0.362 的小幅代价换取身体动作的情绪可分性。
针对推理时拿不到参考音频文本的跨语言克隆问题,该文用预训练 F5-TTS 合成同说话人提示做监督微调并配合静音鲁棒语速预测器,在 LibriSpeech-PC 上 WER 为 2.014% 且相似度提升,代价是自然度小幅下降。
针对训练中完全没有目标语言的跨语言伪造检测,该文用源语言真话拟合从连续语种表征到语音表征的岭映射并取残差,在六语六骨干上报告平均 9–17% 相对收益,远距离迁移收益更大,但近距离个别组合出现反例。
针对连续隐变量自回归扩散在长句和难句上的发音错误与语义幻觉,DiTAR+ 用扩张上下文采样扩大历史视野、用分层声学遮蔽先对齐语义再渲染声学,在 ZH-Hard 上把词错误率从 12.478% 降到 9.893%,在 25 到 35 秒长句上把说话人相似度从 0.741 提升到 0.759,同时词错误率从 2.778% 降到 2.173%,代价是质量主观分相对 …
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该研究把主动规划、口头对话与非言语通信统一为一个零样本提示驱动的 LLM 代理工作流,并在 Pepper 机器人上与基于规则的多策略基线对比,主动性离线重放占优而用户体验总体接近,但推理延迟与样本不均衡仍是主要代价。
论文把任务定为估计第二句相对第一句在九个反义维度上的印象差向量,对比可解释声学特征、自监督表示与多模态大模型三条路线,报告自监督表示在复杂印象上更稳,而多模态大模型零样本不可靠,代价是单女声优与同文本的强受控条件。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
该研究以 CosyVoice2 为骨干解决法语和德语零样本段落合成可懂度低的问题,选择只微调文本语音语言模型加流解码器并冻结声码器,最强证据是在 250 小时法语和 500 小时德语下相对词错误率下降 83 到 91%,代价是微调声码器会损害可懂度且超量加长数据会因复杂度多样性失配使词错误率回升。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对广义零样本声事件分类中未见类被大量判为已见类的问题,论文用属性条件 GAN 生成未见类隐特征训练分类器,再以类级分布外检测做分流与概率融合,在 RWCP-SSD 上把调和平均从 36.2 提高到 78.7,代价是类级检测器数量与阈值调节成本增加。