dafx-2026 论文深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对单嵌入把声源与空间混在一起的问题,DISSE 在同一主干上接声源头与空间头并用弱配对监督对比学习,在保持在任务检索的同时把偏离任务检索压到接近零,但代价是依赖合成房间脉冲与因子标签且只冻结编码器训练投影头。
DyaDiT 针对双人对话中两路语音互相干扰和社会上下文缺失的问题,用正交化交叉注意力分离双路音频并以关系与人格为条件做扩散生成,在 Seamless Interaction 子集上报告了更低的 FD 和更高偏好度,但人格可控性仍受音频隐含线索干扰。
针对视频文本到音频中视觉压倒文本且缺少事件级可控定义的问题,论文提出事件中心分层控制任务、EchoFoley-6k 基准与免训练智能体 EchoVidia,最强证据是时间 0.72、音色 0.78、音量 0.75 可控性与人评指令遵循 3.80 同时领先基线,代价是依赖外部视频大模型与生成模块且需两速推理。
针对文本、视觉、音频三模态组合查询检索问题,OmniRet 用共享媒体重采样器压缩长媒体 token 序列提高效率、用注意力切片 Wasserstein 池化保留细粒度分布信息,在约 600 万对 30 个数据集训练下组合检索和音视频任务提升明显,而单向量压缩与有限主干仍是主要代价与边界。
EMMA 从视频、音频与图表时间序列联合反推显式参数、隐式动力学与坐标不变量,在 75 个 Delfys 视频与 rover、无人机及仿真图表上给出可仿真验证的参数,并以约 1.4 倍于基线的单轮耗时换取多参数与隐式建模能力。
针对视觉听觉情绪线索稀疏且时间不同步导致隐式融合稀释与纠缠的问题,EmoThinker 用结构化 token 选择提纯面部与声音证据并用 CoET 数据集做分步推理,在 DFEW 等基准上报告了最高分,但背景丢弃与长尾类别仍带来代价与不稳定。
针对文本主导、音频视觉被压制且噪声鲁棒性差的问题,EBMC 用解耦加补偿先增强弱模态、再用能量协调与样本级信任蒸馏拉平贡献,在 MOSI/MOSEI/IEMOCAP 上取得可复述的提升,代价是两阶段多损失联合调参与额外蒸馏计算。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对新房间仅给 1 至 8 条脉冲响应、深度与位姿时确定性方法无法表达声学不确定性的问题,FLAC 用潜空间流匹配加扩散变换器生成合理脉冲响应分布,并在 AcousticRooms 未见房间与真实 HAA 上以单样本超越 8 样本基线,但分布真实性与单步推理之间仍需权衡。
针对给定目标音色从预设库中找回最接近 DX7 预设的问题,论文用 SLAP 式音频参数联合嵌入加仿真调制信号流的 DX7-GNN 编码器,在未见拓扑上以 52.2% R@1 超过 Transformer 与 Highway 基线,代价是依赖算子交换增强与单音高单力度渲染条件。
FXplorer 针对离散预设难以覆盖连续音色变化的问题,用离线随机采样加 CLAP 与 AFx-Rep 双嵌入降维构建可试听二维地图,2 秒干声生成 100 个变体在 CPU 上约 36.95 秒,代价是无用户对照评估且跨效果链插值仍需手动重选端点。
针对声源定位中特征匹配缺少显式验证的问题,该研究用 Qwen2.5-Omni-7B 的提示工程实现生成-分析-精修三阶段零样本定位,在 MUSIC 与 VGGSound 单源和双源基准上报告了可比或更高的精度,代价是单样本约 4 秒的多轮推理开销。
该文把音乐风格迁移拆成视觉文本联合定风格与色度约束保旋律两件事,用无反演流直接搬运隐变量并以内层梯度拉回音高结构,代价是旋律锚定越强时目标风格贴合会轻微下降。
针对多声源视频中只生成文本指定声音的选择性视频到音频任务,SELVA 用文本调制的视频编码器加两阶段自监督混合训练实现目标声源分离生成,在 VGG-MONOAUDIO 上同时改善语义与时间对齐,但仍受训练数据噪声与细粒度文本理解限制。
论文把视听空间推理定义为超越语义匹配的定位与关系判断,用 SoundSpaces 2.0 渲染的全景图加双耳音频构造 100 万问答对并训练连接视觉与空间音频编码器的大语言模型,在语义错位与多同类目标场景上报告了双耳相对单耳的定向优势,但分类精度仍远低于 Oracle 且依赖仿真场景。
该文要解决固定映射跟不上舞者个体与动作质感变化的问题,选择把动作变分自编码器编码器与 RAVE 音频解码器冻结后只学一个轻量对齐层并由舞者二值反馈门控更新,探索性会话显示连续性动作的感知连贯性有所改善而重音与停顿仍常失配。
针对音视频单侧与异步伪造在对称融合中互相污染边界的问题,IaMSB 用粗桥提候选、见证桥估一致性并分配步数与事件数、精炼桥做步数可调融合,在 LAV-DF 上 AP@0.95 达到 55.92、AV-Deepfake1M 上 AP@0.95 达到 23.01,代价是需要维护跨模态耦合统计与两级步数预算。
该文在 AVEC2014 上用固定的两层感知机隔离融合设计的影响,以线性加权平均管模态可靠性、有序加权平均管特征显著性做向量保留式联合加权,在分类取得 85.7% 准确率与 0.88 的 AUC、回归取得 8.1 的均方根误差与 0.44 的一致性相关系数的同时,在 0 分贝强噪声下仍保持相对可控的退化,代价是可靠性打分依赖的信号质量指示与排序后权重构造细节 …
针对音视频问答中共享嵌入检索错位与单跳图证据太浅的问题,论文用三步多智能体构造多跳多模态知识图并以模态内检索加 GRASP 接地剪枝供给答案有用子图,在 AudioCaps-QA、VCGPT 和 VALOR 上一致提升但强依赖阈值与外部接地模型。