TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models

📄 会听不会定时:当大音频模型在 20 分钟里找不到那 2.7 秒 英文题目:TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models 一句话:TAG-Bench 把时序音频定位从 30 秒单区间拉到 20 分钟一对多枚举,用 1750 条人工校验问答与并集 IoU/计数/格式三层度量揭示即使最强的 FireRedAudio 也仅 31.2 mIoU 且所有模型计数准确率不过 13.2% 的系统性短板。 标签:#音频理解 | #音频大模型 | #音频事件检测 | #基准测试 | #长音频处理 评分:6.9/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yuhang Dai:机构信息未在 arXiv HTML 中可靠披露 Xin Shu:机构信息未在 arXiv HTML 中可靠披露 Zengxi Li:机构信息未在 arXiv HTML 中可靠披露 Lei Xie:机构信息未在 arXiv HTML 中可靠披露 Xiangang Li:机构信息未在 arXiv HTML 中可靠披露 Jianwei Yu:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把音频时序定位从 30 秒短片段与单区间检测拉到 20 分钟长音频与一对多枚举的真实痛点,并用 21 个系统的统一自由文本评测撕开了当前大音频语言模型连时间都说不清的遮羞布;短板是所有结论都建立在规则解析的混合度量上,数据与评测代码承诺尚未兑现,且 1750 条查询在 8 个子集上的诊断粒度与统计效力仍显单薄。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1668 words

Context-Aware Interleaved Batching for WhisperX

📄 在并行与记忆之间找缝隙:WhisperX 如何既跑得快又记得住 英文题目:Context-Aware Interleaved Batching for WhisperX 一句话:面对长音频转写中并行速度与跨段上下文不可兼得的矛盾,论文用 VAD 固定声学边界并以轮询交错批处理恢复 224 词元滚动上下文,在 Earnings-21 上以 8.4 倍于串行 Whisper 的速度将 WER 降至 8.2%、专有名词分数提至 79.3%,代价是首批重转的一次额外前向与小规模评测的不确定性。 标签:#语音识别 #语音大模型 #长音频处理 #高效推理 #医疗音频 评分:7.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Carlos Bain:机构信息未在 arXiv HTML 中可靠披露 Max Bain:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用语音活动检测(Voice Activity Detection,VAD)外置边界加流间轮询批处理把 Whisper 的 224 词元历史条件从串行枷锁里解放出来,思路巧妙且可直接插进任意分段式流水线。问题在于评测仅靠 15 条 Earnings-21 与 6 条自建 MedicalLessons,基于 GPT-5.1 的 LPS 与 Pn 均无人工一致性校准,8.4 倍加速背后首批重转的额外前向与 N≤B 时退化为近串行的代价也被轻描淡写。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1342 words

VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction

📄 语音助手的记忆为什么要分脑:VoiceMem 用 134 ms 换来 top-5 的长期理解 英文题目:VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction 一句话:VoiceMem 的可证伪主张是:只要把事实路由和情感归因分工为 2 个可交联状态,并把候选缩减提前到用户说话期间,实时语音助手就能以 top-5 记忆预算取得更高的离线检索分数,而代价与真实端到端可靠性仍须另测。 标签:#语音交互 #大语言模型 #流式处理 #长音频处理 评分:6.6/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.8/1.5 💬 毒舌点评 VoiceMem 最有价值之处是把 top-5 这个真实输入预算当成设计约束:schema—entity 路由先缩小候选池,右脑把人格与情绪指向拆开保存,再把 searching 塞进 VAD 的沉默窗口。跨 3 个后端迁移和移除 upper-layer index 后的 4 组掉分,使上层组织不只是双脑比喻。 冷水也该泼在关键处:134 ms 只是 dense dual-brain retrieval,而非完整电话式对话延迟;ChatMem-Bench 的标注流程推迟到后续报告。人格系统最危险的错误归因、记忆删除与隐私控制没有量化,本文证明的是离线候选池更密,不是安全可靠的长期陪伴已经完成。 ...

2026-08-27 · 更新于 2026-09-04 · 4 min · 759 words

CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning

📄 CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning 标签:#空间音频 #对比学习 #音频检索 #多通道 #长音频处理 7.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 7.9/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #空间音频 | #对比学习 | #音频检索 #多通道 | arxiv 👥 作者与机构 第一作者:Peiwei Ren(Xi’an Jiaotong Liverpool University, China) 通讯作者:Peiwei Ren;Jinbo Hu;Fang Kang;Shan Liang;Yin Cao 作者列表:Peiwei Ren、Jinbo Hu、Fang Kang、Shan Liang、Yin Cao(机构:Xi’an Jiaotong Liverpool University, China;MiLM Plus, Xiaomi Inc., China;Center for Machine Vision and Signal Analysis, University of Oulu, Finland;Institute of Acoustics, Chinese Academy of Sciences) ...

2026-08-26 · 更新于 2026-09-04 · 3 min · 618 words

Don't Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding

📄 Don’t Just Listen, Try Planning: Graph-based Retrieval-Generation Agent for Long-form Audio Meeting Understanding 标签:#音频理解 #长音频处理 #图神经网络 #音频检索 #会议转录 7.8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.7/1 | 影响 1.3/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 ✅ 7.8/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频理解 | #图神经网络 | #长音频处理 #音频检索 | arxiv 👥 作者与机构 第一作者:Quanwei Tang(School of Computer Science & Technology, NLP Lab, Soochow University, China) 通讯作者:Dong Zhang 作者列表:Quanwei Tang、Dong Zhang、Shoushan Li、Guodong Zhou(机构:School of Computer Science & Technology, NLP Lab, Soochow University, China;Jiangsu Key Lab of Language Computing, Suzhou) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 770 words

Relative Time Intervals Representation for Word-level Timestamping with Masked Training

📄 Relative Time Intervals Representation for Word-level Timestamping with Masked Training 标签:#语音识别 #语音大模型 #LoRA #鲁棒性 #长音频处理 8.6/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.9/1.5 🔥 8.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #语音识别 | #语音大模型 | #LoRA #鲁棒性 | arxiv 👥 作者与机构 第一作者:Quanwei Tang(Soochow University) 通讯作者:Dong Zhang(dzhang@suda.edu.cn) 作者列表:Quanwei Tang、Zhiyu Tang、Xu Li、Dong Zhang、Shoushan Li、Guodong Zhou(机构:Soochow University;University of Queenland(原文拼写);AISpeech Ltd;Jiangsu Key Lab of Language Computing) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 785 words

DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios

📄 DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios 标签:#语音识别 #语音大模型 #说话人日志 #强化学习 #长音频处理 7.3/10 | 创新 1.7/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #语音大模型 | #说话人日志 #强化学习 | arxiv 👥 作者与机构 第一作者:Bingshen Mu(Audio, Speech and Language Processing Group (ASLP@NPU), School of Computer Science, Northwestern Polytechnical University, Xi’an, China) 通讯作者:正文未明确标注 作者列表:Bingshen Mu、Xian Shi、Xiong Wang、Zhifang Guo、Ting He、Xize Cheng、Yu Xi、Jin Xu、Lei Xie(机构:Audio, Speech and Language Processing Group (ASLP@NPU), School of Computer Science, Northwestern Polytechnical University, Xi’an, China;Independent Researcher) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 451 words

EchoWM: Open and Enterable Omnimodal World Models

📄 EchoWM: Open and Enterable Omnimodal World Models 标签:#音视频生成 #多模态模型 #音视频交互 #长音频处理 10.0/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 10.0/10 | 前10% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频生成 | #多模态模型 | #音视频交互 #长音频处理 | arxiv 👥 作者与机构 第一作者:Songchun Zhang(正文列出 HKUST、PKU、Joy Future Academy, JD 等九家机构,但全文提取未保留作者编号映射) 通讯作者:正文未明确标注 作者列表:Songchun Zhang、Yaowei Li、Junhao Zhuang、Weiyang Jin、Haoyu Wang、Xin Lu、Yilang Sun、Shiyi Zhang、Haoran Li、Xiaoxiao Ma、Yuming Li、Yijun Liu、Yaofeng Su、Yanwen Ma、Haoyu Wu、Zihan Su、Yue Ma、Lvmin Zhang、Haoyang Huang、Zeyue Xue、Anyi Rao、Nan Duan(机构:HKUST、PKU、Joy Future Academy, JD、HKU、THU、USTC、FDU、Beihang University、Stanford University) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 449 words

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

📄 Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds 标签:#音视频生成 #知识蒸馏 #多模态模型 #长音频处理 8.9/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.4/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.9/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频生成 | #知识蒸馏 | #多模态模型 #长音频处理 | arxiv 👥 作者与机构 第一作者:Nan Duan(Joy Future Academy, JD) 通讯作者:正文未明确标注 作者列表:Nan Duan、Haoyang Huang、Weiyang Jin、Haoran Li、Yaowei Li、Yuming Li、Yijun Liu、Xin Lu、Xiaoxiao Ma、Yanwen Ma、Yaofeng Su、Yilang Sun、Haoyu Wang、Zeyue Xue、Songchun Zhang、Junhao Zhuang(机构:Joy Future Academy, JD) ...

2026-08-25 · 更新于 2026-09-04 · 2 min · 419 words

WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs

📄 WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs 标签:#语音交互 #语音大模型 #高效推理 #长音频处理 9.4/10 | 创新 1.9/2 | 严谨 1.5/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.4/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 1.4/1.5 🔥 9.4/10 | 前10% | 文档类型:方法研究 | 评分置信度:中 | #语音交互 | #语音大模型 | #高效推理 #长音频处理 | arxiv 👥 作者与机构 第一作者:Yiming Yao(Xiamen University,School of Informatics;闽台非物质文化遗产数字化保护与智能处理重点实验室) 通讯作者:Jinsong Su 作者列表:Yiming Yao、Chenyang Lyu、Xuanfan Ni、Longyue Wang、Weihua Luo、Yazheng Yang、Jinsong Su(机构:Alibaba Group;Xiamen University,School of Informatics;闽台非物质文化遗产数字化保护与智能处理重点实验室) ...

2026-08-25 · 更新于 2026-09-04 · 4 min · 721 words