长音频不是更长,而是条件更多:MuLA-Bench 如何分离语言、证据与操作
MuLA-Bench 用 5038 个开放问题检验 16 语言长音频理解,发现语言难度随领域和任务变化、声学证据差距随操作变化、找对事件不等于对准时钟,而代价是声学单元稀疏不均且长尾结论受限。
MuLA-Bench 用 5038 个开放问题检验 16 语言长音频理解,发现语言难度随领域和任务变化、声学证据差距随操作变化、找对事件不等于对准时钟,而代价是声学单元稀疏不均且长尾结论受限。
Vox-Infinity 沿轮数与每轮时长拉长语音历史并以最早证据到提问的跨度分组,在七个语音语言模型上报告随证据变远准确率下降的近因效应,以及文本历史保语义而音频历史保韵律的互补代价。
论文研究给定话题标题查询在语音转写中预测连续句子区间的问题,用冻结语音识别编码器状态做句子级声学表示并与文本嵌入融合,在两个主数据集上以轻量定位器验证严格边界指标的提升,同时报告自发会议上增益有限的代价。
针对长语音强制对齐的二次方内存与时间瓶颈,论文用分治原地计算的赫希伯格维特比算法保证结果不变,再用随机游走先验加转写精度界做剪枝,三小时音频在单核中央处理器上以兆字节级内存完成对齐,剪枝后进一步提速但依赖精度假设。
针对 5 分钟以上医患对话直接生成 SOAP 病历的问题,论文用统一端到端架构比较 3B 轻量与 30B 重量模型,报告四阶段训练把 Concept F1 从零样本的 0.26 和 0.18 分别推到 0.4082 和 0.5167,并以级联基线为对照说明直接优化的收益与容量代价。
针对音频时刻检索中提议级置信度缺少全局竞争的问题,该文用半马尔可夫条件随机场对全部分割归一化并以片段边缘后验排序,在 CASTELLA 上报告 41.15% R1@0.7 和 34.68% mAP,代价是需做前向后向推理与非极大值抑制并保留双分支联合训练。
针对自回归语音模型在长提示下跳过与幻觉导致的最坏词错率飙升,论文提出只在检测到失败时回滚并临时加硬注意力掩码的 LACI,用 10 种子最坏值在 1500 词以上把 35.2% 降到 3.4%,代价是需要保留对齐头与设置重试上限。
论文研究长音频中分散证据的定位与整合问题,采用离线结构化元数据加按需音频片段的混合检索智能体路线,最强证据是混合检索加多模态证据比单模态平均答案准确率提高约 10 个百分点、理由准确率提高约 6 个百分点,代价是声学任务仍需灵活选择证据模态且答案正确会高估真实 grounding 能力。
针对同一录音中多组高度重叠对话的转写与分组问题,该工作用视觉门控的目标说话人长时解码做转写、用大模型话题相似度做分组,在开发集上报告约 33.7% 词错误率和 0.97 聚类 F1,但长时视觉缺失填充与模拟数据域失配仍是主要代价。
共收录 14 篇 chime-2026 会议论文的 Reader 深度解读
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
音频时刻检索要求在数分钟录音中按自由文本返回起止时间,基线用 MS-CLAP 加 QD-DETR 在开发测试集上 Recall1@0.7 为 13.56%,前三名以更强特征与检测网络加分数校准或多分辨率集成达到 48.59%,代价是更复杂的特征组合与后处理。
Solstice 以 40 分钟双人长形式回答如何在 NIME 中抵抗演示逻辑,用压力感应 Floors、增强低音提琴 Theresa 与卷积虚拟声学 CAVIAR 等稳定乐器加临时物件在 CCRMA 舞台上经一周排练形成关系性聆听结构,代价是强场地依赖与难以直接移植。
针对长时叙事音频的时间连贯与组合推理难题,AudioStory 用大语言模型做分段规划加扩散模型逐段合成,在自建 AudioStory-10K 上以显式推理和语义加残差双桥接实现更强的指令遵循,但多段拼接与长时一致性仍受训练数据和评估条件的限制。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
针对只用 8 秒短片段训练却要在数十秒到 5 分钟长视频上生成对齐音频的问题,论文用非因果 Mamba-2 替换位置编码依赖并以分层压缩加时间与多模态路由做对齐,在 UnAV100 与 LongVale 长测上取得分布与同步优势,代价是阈值与压缩结构需要仔细选择。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该研究把任务定为无监督异常定位以减少人工听音时间,只用风声训练两层 LIF 脉冲网络并结合重构与发放统计打分,在稀疏合成集上报告 83% 召回与 80% 时间缩减,代价是 F1 偏低且对短密事件与未见底噪仍不稳定。
针对 2-30 分钟长录音只给整段有无鲸叫标签的问题,论文用双流多示例学习以注意力权重同时做包分类与实例定位,在 300-1800 秒上报告 F1 为 0.88-0.91 而强监督 CNN 基线降至 0.19-0.64,代价是长包下定位精度因注意力稀释而下降。
针对长时连续语音到语音同传难以复现评测的问题,论文用目标端语音识别加强制对齐恢复词级时间戳、再用句嵌入对齐切分到源语句组的方法,在约 10 分钟与约 45 秒两类语音上验证可行,并报告延迟随输入变长而累积的主要代价。