词级定位而非句级知道:WESR 把笑声哭声放回词的位置
针对非言语事件只知有无、不知在词何处的问题,论文以 21 类离散与连续事件的词级转写为目标,用位置感知的评测解耦词错与事件错,并以 1700+ 小时弱标注训练得到强基线,在保持词错误率基本稳定的代价下把宏平均 F1 做到 38.0%。
针对非言语事件只知有无、不知在词何处的问题,论文以 21 类离散与连续事件的词级转写为目标,用位置感知的评测解耦词错与事件错,并以 1700+ 小时弱标注训练得到强基线,在保持词错误率基本稳定的代价下把宏平均 F1 做到 38.0%。
针对跨文化理解所需的野外视频多语转写问题,论文用易复用的 Whisper 与 WhisperX 流水线加字幕挖掘与重切分,报告七语平均约 30% 错误经数十至二百小时微调降至约 21.7%,代价是幻觉插入与字幕参考不完美及发布受限。
针对双人自发对话需要同时保证可懂度与正确分声道轮转的问题,ZipVoice-Dialog 在单人流匹配基础上引入单人预训练到对话微调的课程与说话轮次嵌入,最强证据是 6.8k 小时 OpenDialog 与对比基线上的可懂度和轮转精度提升,代价是仍集中于双人单声道且表达力受小模型限制。
该研究把文化敏感提问译成 10 种语言再合成 1315 小时语音来考 12 个大音频语言模型,报告 MERaLiON 相关性最高也未过 0.5,而 LTU 等模型的零有害只是因为答非所问。
针对教师情感的表演性与教学情境依赖问题,该研究构造 14,938 条四模态 T-MED 数据集并提出以音频为中心的非对称注意力模型 AAM-TSA,在 T-MED 上报告加权准确率 86.84% 与加权 F1 值 86.37%,代价是依赖视频转文本描述与教学信息输入且未公开可验证代码数据链接。
针对混合声中只定位目标声源的问题,该研究用跨实例图像做语义提示,先做语义对齐再做多频带空间对齐,在 VGGSound-SSL 上报告平均绝对误差 16.59 度、准确率 71.29%,代价是依赖合成空间音频与人工核验的提示池。
该文把埃及阿拉伯语 CHILDES 的国际音标转写为全带符 CODA 正字法并加上引理与核心词性,得到约 2.6 万词例的语料,并在形态消歧与语音识别上给出基线,代价是语料规模小且 GPT-4o 初转写准确率低、需大量人工校对。
该研究用 10982 词、84932 条语义维度标注检验多模态大模型能否从发音形式推断意义,发现模型在多数维度上超过 0.50 基线并在深层更关注标志性音素,但与人类的维度分布仍有明显差距。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
EgoEMS 针对院前急救中多成员协同与强流程性难以建模的问题,用 233 次模拟试验同步采集第一视角视频、音频、手表惯性与按压真值并标注 67 类关键步骤,基准显示监督变换器在分类达 62.3% 而零样本大模型仍明显落后,代价是模拟与真实出警之间仍有分布差距。
针对全局视觉条件丢失局部发声细节的问题,SS2A 用检测与跨模态翻译感知多模态声源,经单声源对比流形解歧义再用注意力混合生成,论文报告其在图像到音频的相关性与多源配比上占优,代价是依赖检测质量与预训练生成器且需单源数据训练。
论文研究给定旋律灵感与段落标签生成结构化乐段的问题,用结构三元组数据与双实例对比优化让小模型在结构契合上大幅超过直接提示与常规微调,但代价是依赖 POP909 流行乐标注与多轮构造流程且未建模整曲跨段发展。
针对无法使用音频、只能做纯文本后编辑且错误稀疏的韩语咨询对话,论文用真实呼叫数据构建 DasanCallDial 并提出先检测后纠错的 DCSC,主证据是 pkoT5 版本把平衡词错误率指标值从 14.67 降到 13.30,把错误句词错误率指标值从 29.35 降到 26.27,代价是检测门仍会漏检且纠错器对部分已送入错误保持保守。
针对大音频语言模型时间定位不准、长音频难以端到端理解的问题,TimeAudio 用时间标记加绝对时间编码加分段令牌合并,并在 FTAR 时间任务数据上微调,在密集描述、定位与时间线摘要上报告了定位精度的提升,但密集描述的文本多样性仍有代价与边界。
该研究把多方桌游对话切成保持或让渡的 2 分类问题,用文本加音频加语义手势的混合专家模型求解,最强证据是 3 模态融合在语义监督下取得更高的宏平均 F1,代价是标注一致性中等且领域局限于游戏对话。
论文把音乐诱发绘画评估定义为直接预测感知一致性分数,用音乐调制视觉的 MPJudge 结合回归与偏好优化学习,在自建专家标注集上报告 SRCC 0.86 与 MAE 0.04,代价是更大的绘画编码器与对专家标注的依赖。
针对生成式语音修复中似然目标与听感偏好错位及单指标奖励作弊问题,论文用四维一致投票构造约 8 万偏好对并做 DPO 对齐,在 AR、掩码生成与流匹配三范式上报告了一致的客观与主观增益,代价是依赖自动指标代理与同范式数据更有效。
针对俄语尚无多模态基准的问题,论文用统一技能分类、块式提示、双指标评分与防泄漏机制构建 18 任务基准,最强证据是全覆盖全模态模型的 Total Score 达到 0.5 且提示 формулировка显著改变分数,代价是专家题人类基线仍低且音频视频能力明显弱于图像。
针对转录标签缺少声学起止时间的问题,该研究用统一 26 类分类体系加四阶段自动时间戳管线构造大规模监督,并用非自回归槽填充模型联合预测词边界与事件边界,在 NVV-TimeBench 上报告 Micro F1 71.0% 与 Macro mMAE 59.6 ms,但短促低能量类别仍明显更难。
针对全模态大模型忽略视听证据与视频音频互相对不齐的问题,OmniDPO 用文本偏好对与加噪模态偏好对做条件偏好优化,在 Qwen2.5-Omni 与 MiniCPM-o-2.6 上降低幻觉并提升推理,但仍受基座视觉能力限制。