每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

只靠同曲更相似会学偏:用三种信号处理相似度把乐器相似表示拉回跨曲

针对按乐器算跨曲相似时仅用曲内三元组会学到重复线索的问题,该工作在预训练中按 1:1 混入曲内相似与三种信号处理相似度构造跨曲三元组,再用少量 ABX 偏好微调,并在 Slakh 四种乐器上用感知一致率验证,最强的 LocalTS+FPs 组合在 Clean 与 Cascade 下都提升了乐器平均分,但不同乐器最优线索不同且分离误差会改变行为。

 · 更新于 2026-09-24 · 约 18 分钟 · 8609 字 阅读 →
论文解读

先问该听谁再解码:用自评估权重压住跨模态幻觉的 MAD

针对音视频大模型中一个模态错误污染另一模态描述的跨模态幻觉,MAD 用免训练的两步流程先让模型自评问题需要音频、视频还是两者,再用权重调节四路对比解码,在 CMM 和 AVHBench 上提升 VideoLLaMA2-AV 与 Qwen2.5-Omni 的准确率,代价是每步需计算多组 logits 且依赖模型自身判断的可靠性。

 · 更新于 2026-09-24 · 约 18 分钟 · 8746 字 阅读 →
论文解读

不只绑一个锚点:用合成字幕把音频视频文本一起对齐

论文用两阶段合成字幕数据引擎和覆盖八到十组跨模态对的对比学习训练 PEAV,在零样本声音音乐语音视频检索分类上取得最强证据,但代价是 92M 加 32M 数据与大音频编码器和长视频推理成本。

 · 更新于 2026-09-24 · 约 19 分钟 · 9367 字 阅读 →
论文解读

把重建和对齐分开做:教师引导的双路径如何减少语义噪声

针对对比掩码自编码中随机可见块污染全局表示的问题,TG-DP 把重建与对比拆成两条掩码不同的前向路径并用全量教师做蒸馏与引导掩码,在 AudioSet 检索上把 R@1 从 35.2% 提升到 37.4% 和从 27.9% 提升到 37.1%,代价是每轮预训练时间从 730 s 增加到 1045 s 且推理前需丢弃教师分支。

 · 更新于 2026-09-24 · 约 19 分钟 · 9205 字 阅读 →
论文解读

固定提示接不住声音:SOUPLE 用图像条件化学上下文重建音频视觉对应

针对 CLIP 固定提示 a photo of a 与音频嵌入 token 语义脱节的问题,SOUPLE 用图像特征经 Meta-net 生成的可学习上下文替代固定词,在 VGGSound-144K 训练下提升 VGG-SS 与 SoundNet-Flickr 定位与 AVSBench 单源分割,但在无类别监督的多源 MS3 上出现过分割代价。

 · 更新于 2026-09-24 · 约 17 分钟 · 8138 字 阅读 →
论文解读

短录音对不准:用电网频率做时间戳时相似度函数为何是瓶颈

针对短于两分钟与低信噪比录音中相关系数与归一化错位难以区分对齐与错位片段的问题,该工作用时域卷积编码器学习三谐波潜在表示并与原始相关分数线性融合做检索式时间戳估计,在跨电网训练与测试下把全部长度成功率从 77.63% 提升到 85.63%,短录音从 55.14% 提升到 73.14%,代价是仍依赖短时傅里叶提取与十五秒容差判定且长录音增益收窄。

 · 更新于 2026-09-24 · 约 18 分钟 · 8700 字 阅读 →
论文解读

移动脑电跨被试解码注意说话人:对比学习为何比只重建包络更稳

该研究用三模型对比学习加包络重建做跨被试听觉注意解码,在 24 人移动脑电三种自然范式上 2 秒窗 61.4% 到 30 秒窗 79.1%,代价是依赖 5 秒训练窗与多特征音频编码且短窗绝对精度仍有限。

 · 更新于 2026-09-24 · 约 20 分钟 · 9769 字 阅读 →
论文解读

既要对齐时间又要能重建细节:SyncStream 在隐空间统一判别与生成

针对音视频时间同步被忽视且掩码自编码重建模糊的问题,SyncStream 用隐空间对比掩码自编码学紧凑对齐表示再用条件流匹配精修隐变量,在 VGGSound 上把分类准确率从 38.40% 提升到 49.14% 并降低音频重建误差,代价是两阶段训练与解码器深度需要权衡。

 · 更新于 2026-09-24 · 约 27 分钟 · 13232 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

训练没见过的攻击怎么验:把声纹验证搬到深度伪造溯源

该文把攻击溯源做成验证问题,用自监督前端加角度间隔与混合正则训练与训练集完全隔离的嵌入器,在分布内用少样本后端取胜而在分布外用零样本余弦取胜,但两类等错率仍在 13% 至 30% 量级。

 · 更新于 2026-09-24 · 约 23 分钟 · 11067 字 阅读 →
论文解读

交替听与读才能检准:ATIR 把音频文本交织序列当作一等检索对象

针对音频与文本交替出现的多轮上下文检索,论文构造统一 ATIR 基准并训练带音频令牌选择器的双编码器 ATIR-Qwen-3B,报告平均 78.86% Recall@1 和 85.09% nDCG@5,最强对照下仍保留打乱交织结构即下降的反证,代价是两阶段微调与选择器阈值调节。

 · 更新于 2026-09-24 · 约 22 分钟 · 10817 字 阅读 →
论文解读

只学顺序不学分值:比较器损失如何得到可跨库的语音严重度分数

针对神经退行性疾病语音监测中临床量表噪声大与小数据难复用的问题,论文提出只要求预测分数服从样本间排序的比较器损失,在仅用自报三级标签训练的条件下得到与 ALSFRS-R 等未见标注相关的严重度分数,其代价是分数绝对值无标定且对录音条件偏移敏感。

 · 更新于 2026-09-24 · 约 16 分钟 · 7819 字 阅读 →
论文解读

把整条基频轮廓看成整体:首尔韩语重音短语声调的对比学习分类

针对首尔韩语重音短语连续基频难以对应离散声调类别的问题,论文用双分支有监督对比学习整条轮廓的整体形状,在 10093 个短语上达到准确率 77.75% 与宏 F1 值 51.54%,代价是稀有类别与长低平尾音仍易混淆。

 · 更新于 2026-09-24 · 约 21 分钟 · 10382 字 阅读 →
论文解读

文本为主、音频为辅:用情绪轮约束距离的多模态对话情绪识别

针对文本与音频信息量不等且离散分类忽略情绪远近的问题,EMART 以文本为主做音频参照融合,并用情绪轮角度约束对比学习,在 IEMOCAP 和 MELD 上报告了可复核的准确率与 F1 提升,但未引入视觉且依赖音频编码器选择。

 · 更新于 2026-09-24 · 约 17 分钟 · 8394 字 阅读 →
论文解读

先把长语音变短再回答:用类文本表示搭桥的端到端语音检索器 CLSR

针对长语音问答中大音频语言模型难以直接处理十几分钟以上上下文的问题,论文提出先把语音转成类文本表示再做对比检索的 CLSR,用四个数据集的召回对照和长文问答的抽取验证支撑该路线,并以联合训练三项损失与冻结文本编码器为代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9797 字 阅读 →
论文解读

长描述后半段为何失效:FIGMA 以全局加帧级双视角找回速度与和弦

针对包含速度调性和弦的细粒度音乐检索,FIGMA 冻结 MuQ 与 E5 双编码器只训练投影头并联合全局与帧级对比损失,在 MusicBench 与 FMACaps-Eval 上报告最高 73.3% 相对提升,代价是依赖自动特征提取与单句客观描述的构造流程。

 · 更新于 2026-09-24 · 约 17 分钟 · 8216 字 阅读 →
论文解读

片段描述与帧标注无法直接同训时如何统一:FineLAP 以解耦适配与双流损失实现粗细对齐

针对片段级描述数据量大但无时间信息与帧级短语标注稀少难同训的问题,FineLAP 用全局与细粒度解耦音频适配器加片段与帧双流 Sigmoid 损失同训,在 AudioCaps 检索 R@1 取得 45.7 与 62.5 并在四组声音事件检测上领先,代价是固定 10 秒输入与合成数据分布偏差仍待验证。

 · 更新于 2026-09-24 · 约 19 分钟 · 9048 字 阅读 →
论文解读

回归标签太粗、增强又破坏融合:用潜在情感分组做测试时自监督

针对多模态情感回归在测试时分布偏移下的适配问题,GMEL 用 vMF 混合建模潜在情感分组提供自监督,并用多尺度重 dropout 保持模态完整性,在三数据集五种跨域设置上报告平均 ACC 提升 2.53 个百分点、F1 提升 3.70 个百分点、MAE 降低 0.05,代价是需离线访问全部目标数据并估计分组数。

 · 更新于 2026-09-24 · 约 19 分钟 · 9488 字 阅读 →