编号保住谁是谁:PolyAudio 用交错上下文做五段内跨音频对证
论文针对需综合多个独立音频才能作答的多音频推理问题,选择在 Audio Flamingo 3 上做交错多音频指令微调,最强证据是 PolyAudio-Bench 上从 32.9% 提升到 73.5%,代价是依赖合成管线构造数据并把组合范围限制在最多 5 段。
论文针对需综合多个独立音频才能作答的多音频推理问题,选择在 Audio Flamingo 3 上做交错多音频指令微调,最强证据是 PolyAudio-Bench 上从 32.9% 提升到 73.5%,代价是依赖合成管线构造数据并把组合范围限制在最多 5 段。
POWSM 用同一注意力编码器解码器结构统一完成音素识别、语音识别、带音频的字转音与音转字四项任务,在未见语言上取得可比最优的音素错误率,但多任务对域内识别的增益并不稳定且仍偏向高资源语言。
PRiSM 把音素实现识别拆成转写准确与转写探针加表示探针两类下游使用来考,证据显示多语言覆盖与编码器加 CTC 更稳定而专用模型仍领先大音频语言模型,但以声学保真与任务依赖为代价。
该文以声门源波形为输入、声学韵律聚类为自监督目标、说话人归一化与对抗说话人损失为解耦手段,在音高重建与 ToBI 事件检测上超过 HuBERT-base 与原始韵律基线,并以说话人识别准确率大幅下降为代价证明了解耦效果。
论文用极简听觉测试 DeafTest 和 4555 题的音画推理基准 AV-Odyssey 证明低级听觉感知与高级音画推理高度相关,最强证据是两者准确率的 Pearson 相关达 0.945,而代价是当前模型在计数、响度与音高上仍接近随机猜测。
论文把低资源多语言情绪识别重写为有标签非言语发声到无标签言语的无监督迁移,用 NOVA-ARC 在庞加莱球中做韵律离散化、强度校准和原型最优传输,最强证据是 APD 非言语到言语适配下多目标持续领先,而代价是依赖双曲码本与传输超参数的联合稳定。
论文针对音频大模型会无意收录并回答旁观者语音的问题,提出只听主说话人的选择性听觉任务与 SH-Bench 评测和 SE 统一指标,并用旁观者隐私微调 BPFT 在保持主说话人理解的同时学会拒答,最强证据是微调后选择模式下旁观者准确率与 SE 大幅超过 Gemini 2.5 Pro,代价是主说话人准确率轻微波动且仅覆盖单主说话人场景。
针对无目标域标注时伪标签存在系统性口音偏置的问题,论文在源域用同起点真标签模型减伪标签模型得到修正向量并加到目标域伪标签模型上,在 AFRISPEECH-200 十个口音上把 Whisper TINY 平均 WER 从 89.3 降到 57.7,代价是需要有标注源域和调缩放系数 λ。
针对十种非洲低资源语言的转写任务,PUMA 用冻结的 wav2vec 2.0 特征加可训练的通用语言投影与语言令牌和 CTC 训练,在同时训练平均词错误率 0.314 上报告优于 MMS 的 0.419 和 Whisper-large 的 0.339,代价是零样本下仍落后于 7B 量级系统且阿拉伯语等难语言更依赖语言令牌。
论文研究如何用极小子集替代上万条音频评测并对齐真人语音助手体验,用 50 条达到 0.93 以上基准相关、用 100 条回归达到 0.978 人类偏好相关,代价是仅 7 个模型的人评与英语对话场景限制。
针对文本、音频、视觉在噪声与缺失连续变化时情感分析退化的问题,论文用连续可靠度谱统一三种退化协议并提出以偶然不确定性驱动路由的 QA-MoE,在 CMU-MOSI 等基准上保持领先,代价是需要谱感知的数据增强与双分支不确定性建模。
针对中文多轮语音任务对话缺乏真实口语评测的问题,RealTalk-CN 用 5400 段真人录音与不流利标注和跨模态切换任务,测出槽填充比意图分类更怕口语化,而流水线与端到端各有胜负且老年与方言口音存在可测差距。
针对尖叫哭喊等高唤醒合成中保字准就会丢情感、追情感就会念糊的矛盾,论文提出只改推理的情感矫正噪声先验与似然逆引导,在不重训下把 F5-TTS 词错率从 4.41% 降到 2.53% 并提升情感分,但纯度与截断仍需折中且不适用于非迭代架构。
针对呼吸音频编码与临床文本编码语义不兼容的问题,RespiraMFM 采用先对比训练投影器再冻结做指令微调的两阶段结构,在九个呼吸疾病任务上报告了监督平均 AUROC 0.823 与零样本平均 AUROC 0.738,代价是依赖症状元数据质量且小病种评测样本较少。
针对零样本合成过度继承参考风格的问题,ReStyle-TTS 用解耦引导降低参考依赖、用正交融合的风格 LoRA 做连续相对调节,并用音色一致性优化补回音色,代价是新风格仍需收集数据再训 LoRA。
针对推理时音频或视觉缺失的音视问答,论文提出先检索真实特征再做上下文净化的 R2ScP 路线,报告在 Music-AVQA 平均 71.54% 与 AVQA 平均 76.35% 的准确率,代价是对检索库质量敏感且只处理推理阶段缺失。
该文以聚合 10.7M 字幕的 CaptionStew 为试验床,在冻结编码器条件下比较对比学习与字幕生成两种目标,发现在判别任务上对比更数据高效而生成式随规模追赶更快,但有监督初始化的增益随规模衰减且声音事件检测出现反向扩展。
论文把自然语言质检需求编译为依赖感知的有向无环工作流并调用 24 个音频与文本核查工具,在专家一致率 80-90% 的条件下把人工成本时间压到 20% 以下,代价是规划器选型与幻觉和运行时的权衡。
针对连续音视频流中被动问答与主动触发难以统一的问题,ROMA 用一秒多模态单元加分块时间位置编码与独立说话头做对齐与时机判断,在主动提醒与实时解说上报告最优并保持被动问答竞争力,代价是每秒决策粒度和有限上下文。
针对非口语与极少口语自闭症个体的多标签沟通理解问题,论文用教师模型按照护者标注生成动作与功能描述并微调开源学生模型,在动作与功能分类上接近闭源教师模型,但绝对准确率仍不高且依赖小规模特定综合征队列。