论文解读

不重编音频也能验声:复用编码器状态删掉无据事件提及

针对大音频语言模型在字幕中提到输入中不存在声音事件的问题,REVE 复用目标模型已算出的编码器帧状态做两尺度验证,在 AudioSet 上开发集召回约束下删掉 92.9% 无据提及,只增加 3.38M 参数和 0.57 ms 完整验证延迟。

 · 约 16 分钟 · 7925 字 阅读 →
论文解读

听到不等于能定位:把不可靠的音频监督放在辅助通道的开放词汇音视定位

针对文本查询的音视事件时间定位,论文提出按边界可靠性分配教师监督位置的 OV-OrthKD,在 OV-AVEBench 上达到 0.816 片段 AP 且未见类 F1@0.5 提升 3.4 个百分点,代价是角色固定且仅做局部权重验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10058 字 阅读 →
论文解读

先分证据再定修复模式:稀疏、突发与密集专家的时序路由

该研究把黑胶损伤检测做成修复导向的 5 类时序路由,用稀疏、突发、密集 3 路专家证据加分层路由器与验证集选定的维特比转移惩罚,在 597 段合成基准上达到 0.730 的 5 类宏 F1,主要增益来自时序解码而非分层本身,且混合类仍最难。

 · 更新于 2026-09-24 · 约 21 分钟 · 10120 字 阅读 →
论文解读

数闭合而不是数峰:西班牙语颤音两种计数单位为何得出相反性别结论

该研究用先定位中频能量谷再验证释放的闭合计数器替代包络峰计数,在六个语料库 356 名说话人 3560 个合格颤音上得到中位数 2 个闭合、约 36 毫秒间隔,语境效应稳健而性别效应消失,代价是只描述成形良好的浊音周期性颤音且缺乏人工逐点基准。

 · 更新于 2026-09-24 · 约 16 分钟 · 7976 字 阅读 →
论文解读

不让大模型直接说时间戳:用冻结语义加帧级定位做声音事件接地

针对大音频语言模型时间定位不准的问题,论文冻结大模型只取查询语义表示并外挂帧级定位模型,在多个接地基准上提高严格阈下召回与平均交并比,并在推理阶段把定位结果作为外部时间证据回填给大模型。

 · 更新于 2026-09-24 · 约 18 分钟 · 8776 字 阅读 →
论文解读

只标一个单日单点,靠无标注声音把时频框撑到新天新点:MAST 的三段做法

针对标注少且跨天跨点易失效的动物声音时频框检测,MAST 用域内掩码预训练加适配检测器再加两阶段自训练,在雨林和鸟类两域的分布外评测上提升 F1 与 mAP,代价是第二轮后域内精度波动与更大计算量。

 · 更新于 2026-09-24 · 约 19 分钟 · 9151 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

对不准音高时如何跟谱:用演奏法识别补齐对齐式跟谱

针对混合音乐中扩展长笛技法难以只靠音高对齐跟谱的问题,论文把 Antescofo 的对齐机与轻量识别器 ipt~做松耦合混合切换,在 11 类技法上报告宏 F1 为 93.4%±0.1,但混合跟谱以增加延迟为代价换取跨演奏的稳定性。

 · 更新于 2026-09-24 · 约 24 分钟 · 11734 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

什么算错?把背诵转写差异分成错误、修正与可接受形式

该工作把古兰经背诵 ASR 转写与标准文本的差异标注为带位置的类型化事件,用可执行评分器同时考核标签与跨度,并报告朴素差分、生产组件适配与编码智能体试点的对照与代价。

 · 更新于 2026-09-24 · 约 17 分钟 · 8221 字 阅读 →
论文解读

软硬难两全:用可缝合的柔性基板把压电鼓点穿在身上

针对身体打击乐需要压电传感器稳定安装又需要服装柔软贴身的矛盾,该研究用消费级三维打印柔性聚氨酯基板加背部嵌入式处理的方法制作马甲与手套,并在 2025 年两场公开演出中验证了可穿戴演奏的稳定性,其代价是以定性使用验证代替受控定量评估且声学映射完全开放给艺术家二次完成。

 · 更新于 2026-09-24 · 约 19 分钟 · 9106 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

只做整段分类的模型,能否用积分梯度找回声音何时出现

论文用带精确起止时间的合成复调音频检验片段级分类器的事后积分梯度时间定位能力,最强证据是积分梯度达到平均交并比 0.39 与帧级 F1 值 0.52,接近弱监督帧级模型,但峰值定位一致性代价明显。

 · 更新于 2026-09-24 · 约 15 分钟 · 7240 字 阅读 →
论文解读

只给整段真假标签,如何找回伪造片段的起止时间

问题是弱监督时间伪造定位中训练只做整段二分类而推理要输出边界,方法选择两阶段分类回归加隐属性分解与时序图精炼,最强证据是在两个基准上平均 mAP 分别提升约 8% 和 4%,代价是定位阶段引入约 45M 回归参数与伪标签噪声管理。

 · 更新于 2026-09-24 · 约 20 分钟 · 9981 字 阅读 →
论文解读

不对称伪造下为何要先估一致性再分配计算:IaMSB 的三段桥

针对音视频单侧与异步伪造在对称融合中互相污染边界的问题,IaMSB 用粗桥提候选、见证桥估一致性并分配步数与事件数、精炼桥做步数可调融合,在 LAV-DF 上 AP@0.95 达到 55.92、AV-Deepfake1M 上 AP@0.95 达到 23.01,代价是需要维护跨模态耦合统计与两级步数预算。

 · 更新于 2026-09-24 · 约 21 分钟 · 10450 字 阅读 →
论文解读

何时才该移动声音对象:SEND 把混音师的克制听感做成双流事件检测

论文把沉浸式混音中的对象移动形式化为音乐空间事件检测,用目标与背景双流加 Spec-TNT 与 TCN 和 CTGI 门控预测帧级移动概率,在 1000 个专业工程上报告 Frame-F1 为 0.7675 和 Event-IoU 为 0.6305,代价是仍有零星抖动且只预测何时动而不生成连续三维轨迹。

 · 更新于 2026-09-24 · 约 18 分钟 · 8695 字 阅读 →
论文解读

只给整段录音一句话标签,如何同时学会判断与定位鲸叫

针对 2-30 分钟长录音只给整段有无鲸叫标签的问题,论文用双流多示例学习以注意力权重同时做包分类与实例定位,在 300-1800 秒上报告 F1 为 0.88-0.91 而强监督 CNN 基线降至 0.19-0.64,代价是长包下定位精度因注意力稀释而下降。

 · 更新于 2026-09-24 · 约 17 分钟 · 8201 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →