论文解读

长音频不是更长,而是条件更多:MuLA-Bench 如何分离语言、证据与操作

MuLA-Bench 用 5038 个开放问题检验 16 语言长音频理解,发现语言难度随领域和任务变化、声学证据差距随操作变化、找对事件不等于对准时钟,而代价是声学单元稀疏不均且长尾结论受限。

 · 更新于 2026-09-24 · 约 24 分钟 · 11910 字 阅读 →
论文解读

证据越远越难用:Vox-Infinity 按所需历史时长检验语音长上下文

Vox-Infinity 沿轮数与每轮时长拉长语音历史并以最早证据到提问的跨度分组,在七个语音语言模型上报告随证据变远准确率下降的近因效应,以及文本历史保语义而音频历史保韵律的互补代价。

 · 更新于 2026-09-24 · 约 15 分钟 · 7278 字 阅读 →
论文解读

复用语音识别编码器状态做查询条件话题定位:文本之外补边界信息

论文研究给定话题标题查询在语音转写中预测连续句子区间的问题,用冻结语音识别编码器状态做句子级声学表示并与文本嵌入融合,在两个主数据集上以轻量定位器验证严格边界指标的提升,同时报告自发会议上增益有限的代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8527 字 阅读 →
论文解读

把二次方的强制对齐压进终端设备:原地计算与可解释剪枝

针对长语音强制对齐的二次方内存与时间瓶颈,论文用分治原地计算的赫希伯格维特比算法保证结果不变,再用随机游走先验加转写精度界做剪枝,三小时音频在单核中央处理器上以兆字节级内存完成对齐,剪枝后进一步提速但依赖精度假设。

 · 更新于 2026-09-24 · 约 19 分钟 · 9476 字 阅读 →
论文解读

长音频直接写病历:端到端 SOAP 生成的轻重模型对照

针对 5 分钟以上医患对话直接生成 SOAP 病历的问题,论文用统一端到端架构比较 3B 轻量与 30B 重量模型,报告四阶段训练把 Concept F1 从零样本的 0.26 和 0.18 分别推到 0.4082 和 0.5167,并以级联基线为对照说明直接优化的收益与容量代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9599 字 阅读 →
论文解读

不用固定槽打分:对整条时间线做全局归一化后再检索音频时刻

针对音频时刻检索中提议级置信度缺少全局竞争的问题,该文用半马尔可夫条件随机场对全部分割归一化并以片段边缘后验排序,在 CASTELLA 上报告 41.15% R1@0.7 和 34.68% mAP,代价是需做前向后向推理与非极大值抑制并保留双分支联合训练。

 · 更新于 2026-09-24 · 约 16 分钟 · 7786 字 阅读 →
论文解读

长文本朗读为何跳字胡言:用对齐头检测回滚的局部约束推理

针对自回归语音模型在长提示下跳过与幻觉导致的最坏词错率飙升,论文提出只在检测到失败时回滚并临时加硬注意力掩码的 LACI,用 10 种子最坏值在 1500 词以上把 35.2% 降到 3.4%,代价是需要保留对齐头与设置重试上限。

 · 更新于 2026-09-24 · 约 17 分钟 · 8071 字 阅读 →
论文解读

长音频先检索再作答:混合检索与双模态证据如何分工

论文研究长音频中分散证据的定位与整合问题,采用离线结构化元数据加按需音频片段的混合检索智能体路线,最强证据是混合检索加多模态证据比单模态平均答案准确率提高约 10 个百分点、理由准确率提高约 6 个百分点,代价是声学任务仍需灵活选择证据模态且答案正确会高估真实 grounding 能力。

 · 更新于 2026-09-24 · 约 19 分钟 · 9406 字 阅读 →
论文解读

重叠对话先听清谁再分清哪一桌:长时视听目标说话人识别加语义聚类

针对同一录音中多组高度重叠对话的转写与分组问题,该工作用视觉门控的目标说话人长时解码做转写、用大模型话题相似度做分组,在开发集上报告约 33.7% 词错误率和 0.97 聚类 F1,但长时视觉缺失填充与模拟数据域失配仍是主要代价。

 · 更新于 2026-09-24 · 约 16 分钟 · 7990 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

长音频里按文字找片段:对齐要准,时间也要准

音频时刻检索要求在数分钟录音中按自由文本返回起止时间,基线用 MS-CLAP 加 QD-DETR 在开发测试集上 Recall1@0.7 为 13.56%,前三名以更强特征与检测网络加分数校准或多分辨率集成达到 48.59%,代价是更复杂的特征组合与后处理。

 · 更新于 2026-09-24 · 约 19 分钟 · 9399 字 阅读 →
论文解读

不展示乐器而是与乐器共处:Solstice 如何让空间与声学成为演奏者

Solstice 以 40 分钟双人长形式回答如何在 NIME 中抵抗演示逻辑,用压力感应 Floors、增强低音提琴 Theresa 与卷积虚拟声学 CAVIAR 等稳定乐器加临时物件在 CCRMA 舞台上经一周排练形成关系性聆听结构,代价是强场地依赖与难以直接移植。

 · 更新于 2026-09-24 · 约 19 分钟 · 9301 字 阅读 →
论文解读

长叙事音频为何要先分段推理再逐段生成:AudioStory 的分工与衔接

针对长时叙事音频的时间连贯与组合推理难题,AudioStory 用大语言模型做分段规划加扩散模型逐段合成,在自建 AudioStory-10K 上以显式推理和语义加残差双桥接实现更强的指令遵循,但多段拼接与长时一致性仍受训练数据和评估条件的限制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8736 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
论文解读

短训长测:用分层路由与非因果 Mamba 做长视频配音

针对只用 8 秒短片段训练却要在数十秒到 5 分钟长视频上生成对齐音频的问题,论文用非因果 Mamba-2 替换位置编码依赖并以分层压缩加时间与多模态路由做对齐,在 UnAV100 与 LongVale 长测上取得分布与同步优势,代价是阈值与压缩结构需要仔细选择。

 · 更新于 2026-09-24 · 约 18 分钟 · 8949 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

只学风声、不学兽鸣:用脉冲网络把长时生物声学录音先筛一遍

该研究把任务定为无监督异常定位以减少人工听音时间,只用风声训练两层 LIF 脉冲网络并结合重构与发放统计打分,在稀疏合成集上报告 83% 召回与 80% 时间缩减,代价是 F1 偏低且对短密事件与未见底噪仍不稳定。

 · 更新于 2026-09-24 · 约 16 分钟 · 7920 字 阅读 →
论文解读

只给整段录音一句话标签,如何同时学会判断与定位鲸叫

针对 2-30 分钟长录音只给整段有无鲸叫标签的问题,论文用双流多示例学习以注意力权重同时做包分类与实例定位,在 300-1800 秒上报告 F1 为 0.88-0.91 而强监督 CNN 基线降至 0.19-0.64,代价是长包下定位精度因注意力稀释而下降。

 · 更新于 2026-09-24 · 约 17 分钟 · 8201 字 阅读 →
论文解读

长语音同传评测为何卡在切句与时间戳:一条可复现的三段式流水线

针对长时连续语音到语音同传难以复现评测的问题,论文用目标端语音识别加强制对齐恢复词级时间戳、再用句嵌入对齐切分到源语句组的方法,在约 10 分钟与约 45 秒两类语音上验证可行,并报告延迟随输入变长而累积的主要代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10263 字 阅读 →