论文解读

先压缩时间再做全局融合:MambaVoice 的轻量视听歌声分离

针对多人演唱与密集伴奏下的目标歌声分离,MambaVoice 用对数分频音频编码加面部动作门控做条件,再以先 Mamba 后 Transformer 的混合主干建模,报告在 Acappella 未见未闻测试上以 16.2M 参数取得 14.18 dB SDR,并在 URSing 跨域与推理耗时上给出对照,代价是强干扰下仍略低于 VoViT 基线且主观评测样本 …

 · 约 18 分钟 · 8736 字 阅读 →
论文解读

不看配对样本,如何学到从退化到干净的随机输运

SE-MSB 用扩散薛定谔桥在干净与退化语音分布之间学习双向随机输运,并以端到端 Mamba 波形模型实现,在去混响与混合退化上报告可比拟配对方法的效果,同时保持少步采样与低计算量。

 · 约 18 分钟 · 8882 字 阅读 →
论文解读

固定窗长不够用:用探针状态让强化学习逐次决定听多久

针对反无人机音频定位中固定窗长在声学证据与时间对应延迟之间的矛盾,该工作用最小探针提取无标签声学状态并以 PPO 同时选择窗口长度与 Mamba 时间特征权重,在 MMAUD-V1 上以 0.23 s 平均窗口取得 0.30 m 误差与 0.136 s 延迟,代价是需要三阶段训练与跟踪反馈维持。

 · 更新于 2026-09-24 · 约 21 分钟 · 10282 字 阅读 →
论文解读

不用判别器猜分数:并行建模谐波与可微感知损失如何分工

针对带噪语音中浊音谐波易被抹掉且 PESQ 不可微的问题,HAMMER 用时间-频率并行注意力-Mamba 加自相关前馈建模周期性,并用软化 PESQ 加可微 LLR 直接优化,在 VoiceBank+DEMAND 上报告 3.69 PESQ 和 4.41 COVL,推理时对比度拉伸可到 3.79 PESQ 但背景分随之下降。

 · 更新于 2026-09-24 · 约 19 分钟 · 9261 字 阅读 →
论文解读

把四部和声写作变成层图上的最短路:局部谓词如何决定多项式可解性

论文把考试式四部数字低音配写形式化为相邻事件上的硬约束与局部代价问题,用完整和声状态的分层图与动态规划证明固定声部数下可行性与最小代价可多项式求解,并以二拍、四拍、八拍实例展示合法性、贪心失效与复现步骤。

 · 更新于 2026-09-24 · 约 20 分钟 · 9792 字 阅读 →
论文解读

用稀疏局部图约束跨模态对齐,再让 Mamba 管长时序的轻量音视增强

针对轻量音视语音增强中拼接缺乏结构、先验稠密注意力易错配的问题,SG-Mamba 用±3 帧稀疏异构图做局部内容自适应融合再交由单向 Mamba 建模全局时序,在 LRS3 噪声下取得 13.091 dB SI-SDR,代价为 5.3 M 参数和 3.45 G MACs。

 · 更新于 2026-09-24 · 约 18 分钟 · 8523 字 阅读 →
论文解读

短窗相关性太 noisy:用多尺度高斯混合稳住 HMM 发射分布

针对双人竞争听觉注意解码中短窗 Fisher-z 相关方差大、单尺度无监督 GMM 难分 attended 与 unattended 分量的问题,论文提出跨 8 种窗长共享均值、方差按 1/(N_L-1) 缩放的多尺度 GMM 联合估计 HMM 发射参数,在 72 分钟全量下 1 秒窗提升 1.82 个百分点、在 6 分钟数据下提升 8.32 个百分点,但数 …

 · 更新于 2026-09-24 · 约 21 分钟 · 10460 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

同一套因果 Mamba 核心如何兼顾 16 毫秒流式与高延迟离线增强

该文针对 CHiME-9 Task2 多通道助听增强的延迟与跨通道建模矛盾,采用延迟感知外壳加单向时间 Mamba 核心的解耦结构,在助听器开发集上因果配置以 1.36M 参数和 0.005 实时率超越官方基线,离线加深配置进一步提升指标但延迟增至秒级。

 · 更新于 2026-09-24 · 约 18 分钟 · 8549 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
论文解读

不学大语料也能变奏:把动机当轨迹、用可控噪声做表情完备的变体

针对大语料深度模型不适用个人作曲且只处理音高时值的问题,该文把带表情的动机表示为音程状态轨迹并以卡尔曼式随机偏离生成变体,用作曲家自己的选择在线调节方差与结构编辑概率,代价是只做单声部且无定量评测与用户研究。

 · 更新于 2026-09-24 · 约 20 分钟 · 9711 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

短训长测:用分层路由与非因果 Mamba 做长视频配音

针对只用 8 秒短片段训练却要在数十秒到 5 分钟长视频上生成对齐音频的问题,论文用非因果 Mamba-2 替换位置编码依赖并以分层压缩加时间与多模态路由做对齐,在 UnAV100 与 LongVale 长测上取得分布与同步优势,代价是阈值与压缩结构需要仔细选择。

 · 更新于 2026-09-24 · 约 18 分钟 · 8949 字 阅读 →
论文解读

不用逐个找峰也能建模琴桥导纳:用脉冲响应直接算出状态空间

论文把小提琴琴桥导纳看作有限维线性系统,用特征系统实现算法从实测脉冲响应直接做汉克尔矩阵奇异值分解得到降阶状态空间,并在六把小提琴上以时域频域与能量衰减三类误差对比两版模态拟合基线,代价是高阶近似与尚无听感实验。

 · 更新于 2026-09-24 · 约 19 分钟 · 9362 字 阅读 →
论文解读

看不见输入时如何算出物理参数:EMMA 的多模态反演

EMMA 从视频、音频与图表时间序列联合反推显式参数、隐式动力学与坐标不变量,在 75 个 Delfys 视频与 rover、无人机及仿真图表上给出可仿真验证的参数,并以约 1.4 倍于基线的单轮耗时换取多参数与隐式建模能力。

 · 更新于 2026-09-24 · 约 21 分钟 · 10430 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

只定位一次之后直接听麦克风:点神经元嵌入卡尔曼滤波做窄带混响跟踪

针对混响下窄带声源逐帧网格定位带来网格失配的问题,该文把点神经元声场前向模型嵌入卡尔曼滤波,只在首帧做定位、之后直接对麦克风声压做连续三维跟踪,单源在 800 到 1200 赫兹多轨迹上报告接近零误差并可扩展到三源,但代价是 95 到 119 个贴边界麦克风和受控仿真条件。

 · 更新于 2026-09-24 · 约 18 分钟 · 8862 字 阅读 →
论文解读

用一次二次规划代替迭代求解:残差驱动的变步长非线性电路仿真

该工作把非线性模拟音频电路的状态空间微分代数方程改写为单步等式约束二次规划,用线性化后的器件约束残差作为局部缺陷指示器驱动多速率自适应步长,在二极管削波器、共射放大器和考毕兹振荡器上以 SPICE 为基准验证了一致性,代价是在强非线性段需要降到约 200 ns 量级的最小步长。

 · 更新于 2026-09-24 · 约 17 分钟 · 8478 字 阅读 →
论文解读

把解码和平滑写进同一个概率模型:MSM 如何做到逐采样点的听觉注意解码

针对双说话人竞争下脑电信噪比低而窗级解码在分辨率与精度间折中问题,论文用马尔可夫切换模型把包络回归与注意状态转移联合建模并用 EM 逐采样点估计,在 KULeuven 数据上取得与 HMM 后处理相当的中位精度而中位切换检测延迟显著更短,代价是对初始化敏感且仍依赖线性回归假设。

 · 更新于 2026-09-24 · 约 17 分钟 · 8417 字 阅读 →