先标出不流利词,再让大模型学会不说:三语语音纠错的对比调优
针对印地语、孟加拉语、马拉地语语音转写中填充词与重复修复残留问题,论文用 MuRIL 词级标记引导指令微调并以对比损失惩罚复现不流利词,在人工校对与真实口语两类测试上取得一致提升,但真实集规模小且仅验证 3B 量级模型。
针对印地语、孟加拉语、马拉地语语音转写中填充词与重复修复残留问题,论文用 MuRIL 词级标记引导指令微调并以对比损失惩罚复现不流利词,在人工校对与真实口语两类测试上取得一致提升,但真实集规模小且仅验证 3B 量级模型。
针对单向量语音嵌入把内容与说话人混在一起的问题,该工作用共享声学编码器加分轴线性投影头做因子分区嵌入,并用带符号加权余弦实现可控检索,最强证据是跨语料库语义检索在加入说话人辅助任务后从近随机恢复到上限,而代价是纯语义蒸馏会坍缩且梯度反转与降维会破坏负权重几何。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
OEA 用冻结多模态大模型加 LoRA 统一编码文本与音频,在文本到音频上与 M2D-CLAP 接近,在文本到文本与硬负例排除上明显占优,代价是更大的显存与离线音频编码开销。
针对呼吸音频编码与临床文本编码语义不兼容的问题,RespiraMFM 采用先对比训练投影器再冻结做指令微调的两阶段结构,在九个呼吸疾病任务上报告了监督平均 AUROC 0.823 与零样本平均 AUROC 0.738,代价是依赖症状元数据质量且小病种评测样本较少。
SLAP 针对语音中人口学、嗓音质量与健康属性难以零样本推断的问题,选择用大语言模型把异构元数据转写为自然语言描述再与语音做对比学习,最强证据是 38 个二分类任务上零样本平均 F1 达到 62.9%,代价是预训练数据仍不均衡且小测试集任务波动大。
针对现代语音整体质量高但损伤只出现在局部而难定位难分类的问题,该工作用部分混合生成帧级伪标签并加帧级监督对比损失训练双头帧级模型,在域内与域外混合数据上把嵌入检测做到交集面积 0.91 左右,代价是多重并发损伤下类型纯度下降且干净帧取舍需在检测稳定与聚类纯度间权衡。
针对粗粒度标注刻画不了语速情感韵律时变的问题,论文用直接听音频写细粒度描述的 FCaps 数据与分两阶段做全局加细粒度对比学习的 CLSP 模型,在检索与人评一致性上报告更强证据,代价是仅英文与大规模算力依赖。
共收录 1 篇 aistats-2026 会议论文的 Reader 深度解读
该工作把长片搞笑片段抽取拆成镜头检测、视觉加文本的场景合并、笑声加长文本幽默判断加不当内容过滤与排序四步,用 MovieNet-SSeg 指导的三元组预训练和 10 句 ColBERT 在 OVSD 上提升 18.3% 的 AP、在 MHD 上达到 0.834 的 F1,代价是预告片快切下场景结尾准确率下降与文本分支目前只支持英文。
DialoGen 针对双人对话手势同时生成问题,用权重共享的双路扩散加互交互估计保持同步,用监督对比学习的身份解耦风格引导保留个人风格,在 TWH 上报告了 FDg 1.18 与 FDk 2.33 的主结果,代价是仍依赖长风格样本与对话语音内容特征。
论文指出当前音频-视觉分割模型依赖视觉显著性而忽视音频,用 AVSBench-Robust 的正负音频对照和分类器引导的相似度学习把单源 G-mIoU 做到 87.672 并把负样本误激活压到近零,代价是正样本分割分数略有回落。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对音频频谱 token 远多于文本导致多模态 MoE 路由崩塌的问题,CoPRIME 用对比学习加 ELBO 路由与熵正则做音频文本对齐,在 MOSEI 和 IEMOCAP 零样本与少样本情绪任务上超过稠密与 LIMoE 式基线,代价是引入对比加 ELBO 加四个辅助损失共六项损失与两个权重的调参负担。
针对全局视觉条件丢失局部发声细节的问题,SS2A 用检测与跨模态翻译感知多模态声源,经单声源对比流形解歧义再用注意力混合生成,论文报告其在图像到音频的相关性与多源配比上占优,代价是依赖检测质量与预训练生成器且需单源数据训练。
论文研究给定旋律灵感与段落标签生成结构化乐段的问题,用结构三元组数据与双实例对比优化让小模型在结构契合上大幅超过直接提示与常规微调,但代价是依赖 POP909 流行乐标注与多轮构造流程且未建模整曲跨段发展。
针对自然混合音频直接生成图像会丢失多源语义的问题,MACS 采用先用 UNet 分离再用解耦交叉注意力生成图像的两阶段路线,在 LLP-multi 等多任务上报告了多项指标领先,但分离数固定与文本标签依赖仍是主要代价与边界。
针对语音内容音色情感纠缠与控制粗糙问题,MF-Speech 用三流编码器提纯离散因子再用动态融合与分层风格归一化组合生成,在多因子组合任务上报告 WER 为 4.67% 与 SECS 为 0.5685,但重建自然度与部分解耦指标仍有代价与边界。
针对只有音乐输入而缺乏动机控制的问题,MotivDance 用文本生成关键姿态作动机、自适应定位到音乐节拍再做扩散补间,在 AIST++ 稀疏关键帧上取得 FIDk 64.36 与关键帧误差 0.1211,但无关键帧时节拍对齐仍弱于部分基线。
针对情感、性别、年龄、语言等多副语言任务互相干扰的问题,ParaMETA 用共享 META 正则加任务独立子空间与原型对齐同时做分类与可控合成,最强证据是 LSTM 等骨干上 12/16 个骨干-任务组合最优与性别操控 100% 准确,代价是 META 正则增益不稳定且语言操控几乎无效。