不重编音频也能验声:复用编码器状态删掉无据事件提及
针对大音频语言模型在字幕中提到输入中不存在声音事件的问题,REVE 复用目标模型已算出的编码器帧状态做两尺度验证,在 AudioSet 上开发集召回约束下删掉 92.9% 无据提及,只增加 3.38M 参数和 0.57 ms 完整验证延迟。
针对大音频语言模型在字幕中提到输入中不存在声音事件的问题,REVE 复用目标模型已算出的编码器帧状态做两尺度验证,在 AudioSet 上开发集召回约束下删掉 92.9% 无据提及,只增加 3.38M 参数和 0.57 ms 完整验证延迟。
针对文本查询的音视事件时间定位,论文提出按边界可靠性分配教师监督位置的 OV-OrthKD,在 OV-AVEBench 上达到 0.816 片段 AP 且未见类 F1@0.5 提升 3.4 个百分点,代价是角色固定且仅做局部权重验证。
该研究把黑胶损伤检测做成修复导向的 5 类时序路由,用稀疏、突发、密集 3 路专家证据加分层路由器与验证集选定的维特比转移惩罚,在 597 段合成基准上达到 0.730 的 5 类宏 F1,主要增益来自时序解码而非分层本身,且混合类仍最难。
该研究用先定位中频能量谷再验证释放的闭合计数器替代包络峰计数,在六个语料库 356 名说话人 3560 个合格颤音上得到中位数 2 个闭合、约 36 毫秒间隔,语境效应稳健而性别效应消失,代价是只描述成形良好的浊音周期性颤音且缺乏人工逐点基准。
针对大音频语言模型时间定位不准的问题,论文冻结大模型只取查询语义表示并外挂帧级定位模型,在多个接地基准上提高严格阈下召回与平均交并比,并在推理阶段把定位结果作为外部时间证据回填给大模型。
针对标注少且跨天跨点易失效的动物声音时频框检测,MAST 用域内掩码预训练加适配检测器再加两阶段自训练,在雨林和鸟类两域的分布外评测上提升 F1 与 mAP,代价是第二轮后域内精度波动与更大计算量。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
针对混合音乐中扩展长笛技法难以只靠音高对齐跟谱的问题,论文把 Antescofo 的对齐机与轻量识别器 ipt~做松耦合混合切换,在 11 类技法上报告宏 F1 为 93.4%±0.1,但混合跟谱以增加延迟为代价换取跨演奏的稳定性。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
该工作把古兰经背诵 ASR 转写与标准文本的差异标注为带位置的类型化事件,用可执行评分器同时考核标签与跨度,并报告朴素差分、生产组件适配与编码智能体试点的对照与代价。
针对身体打击乐需要压电传感器稳定安装又需要服装柔软贴身的矛盾,该研究用消费级三维打印柔性聚氨酯基板加背部嵌入式处理的方法制作马甲与手套,并在 2025 年两场公开演出中验证了可穿戴演奏的稳定性,其代价是以定性使用验证代替受控定量评估且声学映射完全开放给艺术家二次完成。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
论文用带精确起止时间的合成复调音频检验片段级分类器的事后积分梯度时间定位能力,最强证据是积分梯度达到平均交并比 0.39 与帧级 F1 值 0.52,接近弱监督帧级模型,但峰值定位一致性代价明显。
问题是弱监督时间伪造定位中训练只做整段二分类而推理要输出边界,方法选择两阶段分类回归加隐属性分解与时序图精炼,最强证据是在两个基准上平均 mAP 分别提升约 8% 和 4%,代价是定位阶段引入约 45M 回归参数与伪标签噪声管理。
针对音视频单侧与异步伪造在对称融合中互相污染边界的问题,IaMSB 用粗桥提候选、见证桥估一致性并分配步数与事件数、精炼桥做步数可调融合,在 LAV-DF 上 AP@0.95 达到 55.92、AV-Deepfake1M 上 AP@0.95 达到 23.01,代价是需要维护跨模态耦合统计与两级步数预算。
论文把沉浸式混音中的对象移动形式化为音乐空间事件检测,用目标与背景双流加 Spec-TNT 与 TCN 和 CTGI 门控预测帧级移动概率,在 1000 个专业工程上报告 Frame-F1 为 0.7675 和 Event-IoU 为 0.6305,代价是仍有零星抖动且只预测何时动而不生成连续三维轨迹。
针对 2-30 分钟长录音只给整段有无鲸叫标签的问题,论文用双流多示例学习以注意力权重同时做包分类与实例定位,在 300-1800 秒上报告 F1 为 0.88-0.91 而强监督 CNN 基线降至 0.19-0.64,代价是长包下定位精度因注意力稀释而下降。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读