开放回答也要逐句打分:OpenEnded 用人工测试集约束伪标签训练
针对开放回答口语缺少准确度、流利度、韵律逐句标注的问题,OpenEnded 用 1000 条三人标注测试集加 6109 条训练与 2673 条开发伪标签支撑评估,并以冻结骨干加三头评分的 VoxPA 为更强基线,但伪标签偏向中间分且低分常与无语音绑定。
针对开放回答口语缺少准确度、流利度、韵律逐句标注的问题,OpenEnded 用 1000 条三人标注测试集加 6109 条训练与 2673 条开发伪标签支撑评估,并以冻结骨干加三头评分的 VoxPA 为更强基线,但伪标签偏向中间分且低分常与无语音绑定。
针对未见伪造攻击泛化难的问题,CRAF 以 SSL 为主、ALLM 为高层引导做残差感知融合,在 ASVspoof 5 上 Kimi-Audio 配置报告评估 EER 为 5.96% 与 minDCF 为 0.1192,但攻击间差异与门控依赖仍是代价。
论文研究长音频中分散证据的定位与整合问题,采用离线结构化元数据加按需音频片段的混合检索智能体路线,最强证据是混合检索加多模态证据比单模态平均答案准确率提高约 10 个百分点、理由准确率提高约 6 个百分点,代价是声学任务仍需灵活选择证据模态且答案正确会高估真实 grounding 能力。
论文报告六说话人描述任务基线低于随机猜测,用 100 个头的注意力对数偏置把输出转向目标到 90% 以上,而纯文本任务选出的头可原样迁移,但饱和强度下增益多来自提示与汇点且随机对照本身波动极大。
StepAudio 3 Realtime 针对实时语音交互中深度推理与低延迟的矛盾,用听-说-想-做循环组织感知、双工话轮管理、边说边想与异步工具调用,在 MMSU 90.6、全双工 98.9 等报告结果上保持领先,但多轮约束保持与零售工具任务仍有明显短板。
针对音频多模态大模型自由描述中每个词缺乏时频依据的问题,STAG 用词条件内部激活做时间定位、用频带遮挡做频谱定位再做可分融合,在四个时序标注基准上取得最佳事件定位,并在反事实删除中以目标置信下降和事件消失支持其忠实性,代价是可分假设与缺少频率真值。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对音频文本对少、少样本适配易过拟合的问题,MUKA 用 Pengi 细粒度相似与 CLAP 全局相似的乘积核做免训练的核岭回归适配,在 11 个音频数据集 16 样本设置下平均准确率达到 80.90%,但在部分数据集上仍不敌线性探测且依赖超参数迁移。
论文在五个语音情绪数据集上零样本评测 Qwen2-Audio 并用多组多类公平指标审计,发现其总体预测分布较均衡但总体准确率平等性差距大,且解码温度超过 0.7 会同时损害准确率与公平性。
针对基座会话与增量会话都只有极少标注音频的全少样本类增量音频分类问题,TAPE 冻结 CLAP 音频编码器并学习任务适配投影与推理期低熵原型演化,在三套音频任务上报告平均准确率与性能下降率的同步改善,代价是每类需维护推理期优先队列并按会话重置原型。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该工作以音频为唯一证据检验蕴含、一致、合理、口音漂移与口音克制五类推理,报告显示生成式模型优于对比式模型但普遍过度蕴含,而转写加推理的级联系统在医疗蕴含上取得更高宏平均 F1 并伴随明显的模型偏向代价。
针对大音频语言模型在事件遗漏、身份误判、时序关系与定量时间四类细粒度推理上依赖语言先验的问题,论文以共享音频问题池同时构造偏好对齐数据与诊断基准并用直接偏好优化对齐 Qwen2.5-Omni-7B,报告在诊断集上定量与关系错误率大幅下降并在公开基准上小幅提升,代价是依赖字幕代理、人工筛选与自动裁判误差等条件约束。
该文用每幕重采样的九任务诊断音频任务学习,显示最强模型在非语音模式绑定上可学、但在时长测量与多规则组合上崩溃,而代价是人工构造任务与小样本精确匹配评估的生态距离。
论文把自动语音识别为中心的监督视为感知弱的原因,用转写、副语言、非语言事件三部分的结构化统一音频模式组织监督,在保持推理的同时把 MMSU 感知从 44.8% 提升到 55.7%,代价是需要多阶段对齐与合成标注的质量控制。
论文用固定文字、只改声音的合成对照测音频语言模型能否把可听症状用于分诊,最强证据是高风险声音配安心文字时多数模型仍跟文字走,而代价是大量平局与无效输出且声学敏感度随疾病和模型剧烈波动。
针对语音条件推理弱于语义等价文本条件推理的问题,CORD 用同一模型内文本分支做教师并沿音频采样轨迹做标记级加权反向 KL 与序列级裁判奖励 GRPO 优化,在仅 8 万条合成数学训练样本下把两 backbone 的平均模态差距缩小约四成,但训练域集中数学且未报告延迟与人工误判率等代价。
针对 Qwen2-Audio-7B 语音翻译压缩到 4 GB 磁盘的问题,Diet-KIT 用 HQQ 分组量化打底、嵌入低比特加敏感度选层补足、AWQ 校准收尾,在 ACL 60/60 上以 3.98 GB 取得 en→de COMET 74.4、en→zh 77.1,代价是全模型统一 3 比特会使 BLEU 与 COMET 断崖式下跌。