论文解读

把三处非线性压成一处:OCD 非对称削波的显式波数字建模

针对 Fulltone OCD v2 中 MOSFET 加锗二极管构成的非对称削波级难以实时求解的问题,论文把三个非线性合并为单个等效一端口并用分段线性函数显式映射,在 1 V、1 kHz 正弦和 96 kHz 采样下时域误差低至千分之量级,而显式方法实时比 0.14 约为迭代方法 3.12 的二十二分之一。

 · 更新于 2026-09-24 · 约 19 分钟 · 9303 字 阅读 →
论文解读

级联不拆相位、并行不抢状态:多级线性相位八度滤波器组的吞吐与能耗折中

该文不改滤波器设计,只把拉伸有限冲激响应级联做成块流加环形状态的串行基线,再用开放多处理任务流水线并行,在英伟达 Jetson Orin Nano 上以串行超每秒 118 万采样、6 线程加速超 4.5 倍为证据,代价是最小能耗点不在最高性能点。

 · 更新于 2026-09-24 · 约 18 分钟 · 8551 字 阅读 →
论文解读

把镜像计数折成格点体积:高维房间脉冲响应的几何卷积加速

针对矩形房间镜像声源数量随维度指数增长的问题,论文把距离计数归约为高斯圆格点计数并用几何卷积逐维递推,在整数坐标与全向反射等限定下把复杂度降为随维度线性的拟线性量级,代价是丢失方向性并需用缩放与插值补偿小距离误差。

 · 更新于 2026-09-24 · 约 20 分钟 · 9669 字 阅读 →
论文解读

用可微反馈延迟网络拟合实测房间脉冲响应:共享原型均衡如何省参数

该文把 16 通道反馈延迟网络做成端到端可微并用梯度下降拟合实测房间脉冲响应,在 9 个房间上以更少参数和更快训练达到更低混响时间误差,但训练延迟线可能引入可闻染色。

 · 更新于 2026-09-24 · 约 21 分钟 · 10125 字 阅读 →
论文解读

实数做幅度掩蔽、复数做残差修正:参数对齐下的混合语音增强

针对单通道语音增强中幅度与相位分工不同的问题,论文把实数分支的幅度掩蔽与复数分支的加性复数修正并联并在瓶颈处交换信息,在参数量对齐的卷积去噪自编码器与卷积循环网络上以短时客观可懂度、语音质量感知评估和尺度不变信号失真比为指标验证,并在乘加操作数上付出更少计算代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8723 字 阅读 →
论文解读

用极值点间距决定拼接长短的关键帧时间拉伸

该文把均匀波形约简为带时间戳的局部极值点并用其间距逐样本控制重叠相加的拼接时机与时长,在嵌入式算力下保住瞬态,代价是频谱对比度损失与三次样条谐波失真。

 · 更新于 2026-09-24 · 约 21 分钟 · 10422 字 阅读 →
论文解读

把大模型的回声控制能力压缩到小模型:知识蒸馏如何弥补轻量化损失

针对声学回声控制中深度模型计算量过大而直接缩小模型会明显掉性能的问题,论文用大教师指导小学生的知识蒸馏训练轻量 CGGN16,在双讲条件下保住近端语音并有效抑回声,代价是仍需先训练大教师且依赖仿真数据条件。

 · 更新于 2026-09-24 · 约 16 分钟 · 7581 字 阅读 →
论文解读

不用黑盒记频谱:用运动、相位与气流三组物理量做边缘端重放检测

该研究把 1 秒多通道语音转为时延轨迹、双耳相位与低频气流三组可解释特征再用 XGBoost 判真伪,在 D3 六通道上报告等错误率 17.8%,代价是仍需多通道阵列且在空旷与车载等未见环境下误差明显上升。

 · 更新于 2026-09-24 · 约 18 分钟 · 8656 字 阅读 →
论文解读

听音再剪视频:OmniZip 用音频保留率动态分配视频剪枝

针对全模态大模型音频加视频序列过长问题,OmniZip 用免训练的音频引导加交错时空压缩做推理时剪枝,最强证据是在 Qwen2.5-Omni 上保持接近满词元精度的同时实现 2.51-3.42×预填充加速与约 10G 显存下降,代价是剪枝率需按任务平衡且依赖音频编码器注意力。

 · 更新于 2026-09-24 · 约 21 分钟 · 10273 字 阅读 →
论文解读

一个模型压七种数据:OmniZip 以统一分词加稀疏路由做轻量无损压缩

针对单模态压缩器重复部署与大模型压缩器过重的问题,OmniZip 用统一可逆分词加双路模态路由的轻量序列模型预测概率再算术编码,在 16 个数据集上接近专用方法并在笔记本与手机上接近实时,代价是自然图像与基因等难例仍弱于专用大模型。

 · 更新于 2026-09-24 · 约 19 分钟 · 9291 字 阅读 →
论文解读

去掉运行时抽象的波数字电路仿真:用静态代码生成逼近理论下界

针对波数字滤波器实时仿真中面向对象抽象与冗余状态带来的开销,论文用描述语言加静态编译生成最小状态代码,在四类电路上以每样本周期数与指令数为证据逼近理论性能界,代价是拓扑必须在编译时固定并依赖热重载维持可修改性。

 · 更新于 2026-09-24 · 约 20 分钟 · 9917 字 阅读 →
论文解读

相位对不准就白做:用极坐标分开调幅度和相位的频域个人声区

针对听音者移动导致声传递函数变化时时域 FxLMS 加 RLS 在线建模计算重、重收敛慢的问题,论文提出频域极坐标 FxNLMS 加 NLMS 声路径跟踪与声对比度驱动变步长,在 10 扬声器仿真中把每帧计算量降低约 99.94% 并把移动后重收敛时间常数从 33.11 s 缩短到 3.71 s,代价是仍只在自由场白噪声仿真中验证且依赖多组 Sigmoid …

 · 更新于 2026-09-24 · 约 17 分钟 · 8126 字 阅读 →
论文解读

线性插值是瓶颈:用拉格朗日插值加切比雪夫逼近重做抗混叠积分

论文把抗导数抗混叠首步的线性插值换成二三阶拉格朗日插值,并用切比雪夫多项式逼近非线性使矩形与三角核积分可闭式计算,在 3192 Hz 正弦加 tanh 与硬削波实验中显著提升信噪比,代价是每样本多次非线性求值与离散余弦变换开销。

 · 更新于 2026-09-24 · 约 18 分钟 · 8620 字 阅读 →
论文解读

孤立很快不等于混音中不爆音:苹果芯片上神经音频推理的竞争实测

该研究在苹果 M3 上对比 BNNSGraph 等推理后端处理 LSTM、TCN、WaveNet 吉他音色模型的速度,核心证据是孤立实时系数很好但在真实混音回调下尾延迟爆表,而代价是平台绑定与状态实现差异需要逐项核对。

 · 更新于 2026-09-24 · 约 21 分钟 · 10348 字 阅读 →
论文解读

用一次二次规划代替迭代求解:残差驱动的变步长非线性电路仿真

该工作把非线性模拟音频电路的状态空间微分代数方程改写为单步等式约束二次规划,用线性化后的器件约束残差作为局部缺陷指示器驱动多速率自适应步长,在二极管削波器、共射放大器和考毕兹振荡器上以 SPICE 为基准验证了一致性,代价是在强非线性段需要降到约 200 ns 量级的最小步长。

 · 更新于 2026-09-24 · 约 17 分钟 · 8478 字 阅读 →
论文解读

循环脉冲网络不必全连接:用一维卷积加可学习轴突延迟做语音建模

针对循环脉冲网络中稠密循环矩阵参数平方增长的问题,该工作用核长为 3 的一维卷积替代全连接循环并保留每个神经元可学习的轴突延迟,在 SHD 上达到 91.51% 精度并把单层循环参数从 65792 降到 259,代价是在 SSC 上落后 DelRec 约 4 个百分点且 SSC 未做超参搜索。

 · 更新于 2026-09-24 · 约 19 分钟 · 9139 字 阅读 →
论文解读

切分学习传不动 ViT:用注意力先并批再剪令牌的双重压缩

针对切分学习中 ViT 中间激活传输开销大的问题,论文提出先按 CLS 注意力聚类合并样本再按簇质心保留 Top-k 令牌的 ADC,在固定通信预算下用更少样本和更短序列完成前后向,并在 DeiT-T/S 上以更低压缩比保持精度,代价是客户端约 5.1% 的 K-means 聚类开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8315 字 阅读 →
论文解读

小模型留不住背景声:用分块蒸馏把双分支个性化增强做进端侧

针对已知说话人提取任务,论文提出掩码加深滤波的 DualDF 并用逐块特征蒸馏把块数与隐层压缩,教师约 12 块 224 维、学生在 6 块 120 维等配置下仍保持目标音质,代价是背景抑制主要依赖掩码分支且轻量学生仍需教师监督。

 · 更新于 2026-09-24 · 约 15 分钟 · 7147 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →