dafx-2026 论文深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对单嵌入把声源与空间混在一起的问题,DISSE 在同一主干上接声源头与空间头并用弱配对监督对比学习,在保持在任务检索的同时把偏离任务检索压到接近零,但代价是依赖合成房间脉冲与因子标签且只冻结编码器训练投影头。
该工作用 ALINX AC7020C 嵌入式 FPGA 加可菊花链的 8 通道 PCB 解决高密度空间音频的通道数与布线难题,已验证 64 扬声器稳定运行并给出向 256×3 通道扩展的时序与接口设计,但受限于 MAX98357A 约 3 W 功率与小型单元声学性能。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对固体共振物体声音恢复弱且染色重的问题,该工作用模态形状梯度与二阶模态传递函数建立多点双轴散斑位移到声源的前向模型并做正则优化反演,在鼓等多物体上比单点、平均与固定延迟融合更干净,但高频模态漏检仍是主要代价。
针对小型弦乐重奏近场麦克风串音问题,论文把去串音做成 P 进 P 出的多通道分离,并在训练时对输入与目标施加同一随机置换以强制通道置换等变,在未见房间布局和真实 URMP 录音上提升 SDR,但低频与未见乐器上的增益仍然有限。
针对空间语义分割同时要分离和分类而旧联合指标会把标签错配算成负分的问题,论文提出先做置换不变匹配再算分类的 CASA-SDR,并在受控交换与 DCASE 2025 系统上显示它能把差分离与标签交换区分开,代价是对删除与替换类错误不再区分。
针对声速变化导致离线测得脉冲响应失配、空间音频控制退化的问题,该文提出在多通道放音过程中只用单个观测麦克风逐帧最小化实测与参数化重放模型误差来估计声速,并在估计偏移超过阈值时用插值修正脉冲响应重算声区控制滤波器,仿真显示能跟踪声速并接近已知真实脉冲响应与已知声速插值的性能,代价是依赖均匀温度假设、已知参考脉冲响应和逐帧网格搜索计算。
针对固定通道神经音频编解码器换通道数就要换结构的问题,VCNAC 用分流卷积加统一量化瓶颈实现单套参数原生支持 1 通道、2 通道和 6 通道,在 7.9 kbit/s 量级取得与更高码率基线可比的主客观重建质量,代价是依赖合成环绕声训练且中置与后置通道客观指标仍偏低。
针对电子鼓多轨采样与录音的算力与成本问题,该工作用单块 Artix-7 实现 10 路鼓采样加 4 路外部输入、可变速率重采样、五种效果与以太网 16 轨录音,报告采样处理链约 1.33 ms 与 512 采样环形缓冲下无欠载过载,同时占用约一半逻辑资源并控制整机成本在 500 美元以下。
针对传统电吉他拾音位置在演奏时固定且混弦输出的问题,PolyMap 用 8 弦×8 位置共 64 个有源拾音胶囊在琴内数字化并经 MADI 输出,在 32 采样缓冲与 48 千赫兹条件下测得端到端 259 采样即 5.4 毫秒延迟,代价是拾音器主导的负 73 至负 67 分贝全刻度噪声与复杂的 64 通道后期混音负担。
CSPB 针对噪声混响与重叠语音的真实多人对话,用冻结上游加轻量下游的统一协议在四套数据上考识别日志与增强分离,报告显示多样数据加增强预训练的模型更稳健而波束形成与原生多通道带来一致增益,代价是原生多通道预训练数据远少且基准仍以编码器结构为主。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对双人对话中后通道、打断与重叠难以可控生成的问题,KABURI-TTS 以每说话人的音素光栅与由此导出的语音活动为条件在双通道上渲染对话语音,人在真实对话数据上的主观评测与语音活动统计显示其交互自然度与重叠频次优于强基线,但仍未达到真人对话上限且依赖外部光栅构造的质量。
声源定位 | 5.7/10
说话人日志 | 6.6/10
音乐源分离 | 7.7/10
空间音频 | 5.3/10
空间音频 | 7.6/10
空间音频 | 7.5/10