每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

把“是什么”和“在哪里”分开学:DISSE 用双头解开空间音频文本表示

针对单嵌入把声源与空间混在一起的问题,DISSE 在同一主干上接声源头与空间头并用弱配对监督对比学习,在保持在任务检索的同时把偏离任务检索压到接近零,但代价是依赖合成房间脉冲与因子标签且只冻结编码器训练投影头。

 · 更新于 2026-09-24 · 约 16 分钟 · 7778 字 阅读 →
论文解读

用一块 FPGA 带起 768 个喇叭:高密度扬声器阵列如何做小做模块化

该工作用 ALINX AC7020C 嵌入式 FPGA 加可菊花链的 8 通道 PCB 解决高密度空间音频的通道数与布线难题,已验证 64 扬声器稳定运行并给出向 256×3 通道扩展的时序与接口设计,但受限于 MAX98357A 约 3 W 功率与小型单元声学性能。

 · 更新于 2026-09-24 · 约 20 分钟 · 9561 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

鼓面共振强、单点信噪比低:用模态把多点双轴散斑位移对齐后再反推声音

针对固体共振物体声音恢复弱且染色重的问题,该工作用模态形状梯度与二阶模态传递函数建立多点双轴散斑位移到声源的前向模型并做正则优化反演,在鼓等多物体上比单点、平均与固定延迟融合更干净,但高频模态漏检仍是主要代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 10016 字 阅读 →
论文解读

近场麦克风串音:用输入通道随机置换逼模型学空间关系

针对小型弦乐重奏近场麦克风串音问题,论文把去串音做成 P 进 P 出的多通道分离,并在训练时对输入与目标施加同一随机置换以强制通道置换等变,在未见房间布局和真实 URMP 录音上提升 SDR,但低频与未见乐器上的增益仍然有限。

 · 更新于 2026-09-24 · 约 17 分钟 · 8178 字 阅读 →
论文解读

先按声音配对再看标签对错:把分离质量和分类错误分开算的 S5 评价

针对空间语义分割同时要分离和分类而旧联合指标会把标签错配算成负分的问题,论文提出先做置换不变匹配再算分类的 CASA-SDR,并在受控交换与 DCASE 2025 系统上显示它能把差分离与标签交换区分开,代价是对删除与替换类错误不再区分。

 · 更新于 2026-09-24 · 约 18 分钟 · 8825 字 阅读 →
论文解读

只用一个旁听麦克风,在放音中追踪声速再补偿声场控制

针对声速变化导致离线测得脉冲响应失配、空间音频控制退化的问题,该文提出在多通道放音过程中只用单个观测麦克风逐帧最小化实测与参数化重放模型误差来估计声速,并在估计偏移超过阈值时用插值修正脉冲响应重算声区控制滤波器,仿真显示能跟踪声速并接近已知真实脉冲响应与已知声速插值的性能,代价是依赖均匀温度假设、已知参考脉冲响应和逐帧网格搜索计算。

 · 更新于 2026-09-24 · 约 17 分钟 · 8335 字 阅读 →
论文解读

一套参数如何同时装下单声道、立体声和 5.1 环绕声

针对固定通道神经音频编解码器换通道数就要换结构的问题,VCNAC 用分流卷积加统一量化瓶颈实现单套参数原生支持 1 通道、2 通道和 6 通道,在 7.9 kbit/s 量级取得与更高码率基线可比的主客观重建质量,代价是依赖合成环绕声训练且中置与后置通道客观指标仍偏低。

 · 更新于 2026-09-24 · 约 17 分钟 · 8221 字 阅读 →
论文解读

用一块入门 FPGA 同时做鼓采样、效果器与 16 轨录音:并行与确定延迟如何压住成本

针对电子鼓多轨采样与录音的算力与成本问题,该工作用单块 Artix-7 实现 10 路鼓采样加 4 路外部输入、可变速率重采样、五种效果与以太网 16 轨录音,报告采样处理链约 1.33 ms 与 512 采样环形缓冲下无欠载过载,同时占用约一半逻辑资源并控制整机成本在 500 美元以下。

 · 更新于 2026-09-24 · 约 19 分钟 · 9248 字 阅读 →
论文解读

把拾音位置选择推迟到混音阶段:64 通道分弦多点吉他拾音系统

针对传统电吉他拾音位置在演奏时固定且混弦输出的问题,PolyMap 用 8 弦×8 位置共 64 个有源拾音胶囊在琴内数字化并经 MADI 输出,在 32 采样缓冲与 48 千赫兹条件下测得端到端 259 采样即 5.4 毫秒延迟,代价是拾音器主导的负 73 至负 67 分贝全刻度噪声与复杂的 64 通道后期混音负担。

 · 更新于 2026-09-24 · 约 18 分钟 · 8750 字 阅读 →
论文解读

真实多人对话考验语音自监督表示:CSPB 用单通道与多通道同测内容与说话人

CSPB 针对噪声混响与重叠语音的真实多人对话,用冻结上游加轻量下游的统一协议在四套数据上考识别日志与增强分离,报告显示多样数据加增强预训练的模型更稳健而波束形成与原生多通道带来一致增益,代价是原生多通道预训练数据远少且基准仍以编码器结构为主。

 · 更新于 2026-09-24 · 约 18 分钟 · 8710 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

用可控的音素光栅把重叠说出来:KABURI-TTS 如何做双通道对话合成

针对双人对话中后通道、打断与重叠难以可控生成的问题,KABURI-TTS 以每说话人的音素光栅与由此导出的语音活动为条件在双通道上渲染对话语音,人在真实对话数据上的主观评测与语音活动统计显示其交互自然度与重叠频次优于强基线,但仍未达到真人对话上限且依赖外部光栅构造的质量。

 · 更新于 2026-09-24 · 约 25 分钟 · 12192 字 阅读 →
论文解读

把 2M 维坐标压到一条曲线上:BOGE 如何用物理先验与贝叶斯优化校准水下柔性阵

声源定位 | 5.7/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12536 字 阅读 →
论文解读

当发言意愿也需要先验:用 Beta 倾向补全多通道日志的贝叶斯闭环

说话人日志 | 6.6/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11955 字 阅读 →
论文解读

把拾音器从琴上焊死的位置里解放出来:64 路沿弦采样如何把音色选择推迟到混音台

音乐源分离 | 7.7/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7164 字 阅读 →
论文解读

既要指向性,又要去混响:一次前向如何重建干净的虚拟方向麦克风

空间音频 | 5.3/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7955 字 阅读 →
论文解读

让声码器也理解方向:CSAVocoder 把空间线索留在最后一公里

空间音频 | 7.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4970 字 阅读 →
论文解读

Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling

空间音频 | 7.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6054 字 阅读 →