论文解读

归一化丢掉响度线索:两阶段进化搜索先定形状再找回面密度

从单条脉冲响应反推平板混响六参数时,先用峰值归一化 CMA-ES 定五个形状参数再用无归一化三等分搜索定面密度,在 50 条验证脉冲上达到约 10 的负 14 次方量级中位误差,代价是第一阶段中位约 32.6 秒的逐条搜索耗时。

 · 更新于 2026-09-24 · 约 21 分钟 · 10419 字 阅读 →
论文解读

先数清有多少个模态,再去校准每个模态:密集板混响的计数优先估计

针对板混响脉冲响应中弱模态与重叠模态难以直接检出的问题,该研究先用回归器预测四个频带的模态数量以确定稠密网格基数,再固定频率对衰减与增益做有界可微校准,在两个仿真验证集上把本地挑战式误差相对官方默认峰值拾取降低约 66%,主要收益来自计数误差下降而衰减与增益仍是最大残差。

 · 更新于 2026-09-24 · 约 19 分钟 · 9465 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

在胶合板上听笔尖位置:小数据声源定位为何不用时延估计

针对 3 英尺胶合板表演面上接触式传声的各向异性与极小时延难题,该工作用四通道接触麦克风加短时频谱回归直接预测笔尖坐标,最强证据是 ResNet50 在全数据上平均 L1 误差 0.191 优于轻量 Transformer 的 0.225,代价是对板 orientation 与装配变化敏感且 R1/R3 误差显著升高。

 · 更新于 2026-09-24 · 约 17 分钟 · 8103 字 阅读 →
论文解读

CLAP 音频嵌入里藏着混响、响度和音高吗:用轻量探针检验线性与非线性编码

该文冻结 LAION-CLAP 音频编码器,用线性、两层 MLP 和核岭回归三种探针在五类数据上回归 RT60、LUFS、频谱质心与相对音高,最强证据是非线性探针在全部属性上可靠恢复,而线性探针仅对 RT60、LUFS 和相对音高有效,代价是频谱质心需要非线性流形且相对音高方向高度依赖领域。

 · 更新于 2026-09-24 · 约 20 分钟 · 9627 字 阅读 →
论文解读

线性看起来一样,失真后为何分叉:Moog 梯子滤波器非线性行为的同基准量化

以同一 SPICE 梯子电路为基准,用谐波、自振荡与大信号截止点偏移三类可复述测量,比较五种数字实现并在公共核心上做饱和器与位置消融,最强证据是分布式 1+4 级实现聚在频谱误差 0.04% 至 0.10% 而边界饱和的 JUCE 达 0.65%,代价是只覆盖静态与准静态条件且未做听感与硬件验证。

 · 更新于 2026-09-24 · 约 22 分钟 · 10677 字 阅读 →
论文解读

用一次二次规划代替迭代求解:残差驱动的变步长非线性电路仿真

该工作把非线性模拟音频电路的状态空间微分代数方程改写为单步等式约束二次规划,用线性化后的器件约束残差作为局部缺陷指示器驱动多速率自适应步长,在二极管削波器、共射放大器和考毕兹振荡器上以 SPICE 为基准验证了一致性,代价是在强非线性段需要降到约 200 ns 量级的最小步长。

 · 更新于 2026-09-24 · 约 17 分钟 · 8478 字 阅读 →
论文解读

扩数据反而退化:卷积后端与多语言前端在伪造语音检测中的域偏置对照

该研究用四种自监督前端搭配四种后端、在三种多语料组合与六个评测集上对照,报告显示 XLSR 搭配 ResNet 平均等错误率最低,加入外部语料让 ASVspoof 5 编解码子集等错误率走高而野外子集走低,约 8 小时西班牙语伪造音频让西班牙语评测大幅改善而中文评测维持原量级。

 · 更新于 2026-09-24 · 约 26 分钟 · 12607 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

更深更宽不一定更值:说话人确认中精度与能耗的拐点

该文在 VoxCeleb2 上系统改变 ResNet 的深度、宽度和阶段分布并用节点级传感器实测训练与推理能耗,显示超过 ResNet-101-D/ResNet-200-D 后精度增益迅速收窄而能耗陡增,中型与中间阶段集中结构取得更优的性能与环境折中。

 · 更新于 2026-09-24 · 约 17 分钟 · 8419 字 阅读 →
论文解读

跨语种克隆要在说得对与听得出是谁之间做取舍

该研究以英语参考音频为输入对比四种零样本跨语种克隆系统,报告了以 VoxCPM2 在阿拉伯语上同时取得 0.25 词错误率和 0.72 说话人相似度为代表的权衡证据,而代价是多数系统仍在可懂度与身份保留之间此消彼长且仅两套系统支持阿拉伯语。

 · 更新于 2026-09-24 · 约 18 分钟 · 8918 字 阅读 →
论文解读

数模态个数再估计参数:计数密度网络如何把板混响脉冲变成模态三元组

任务是从合成板混响位移脉冲响应中恢复未知个数的频率、衰减和增益三元组,方法用 1/20 倍频程计数密度加固定槽位回归同时估计总数与属性,在 100 条独立脉冲的对比集上两个神经估计器的总相对误差约为 0.32,低于最强经典基线的约 1.10,但增益误差仍是主要误差来源。

 · 更新于 2026-09-24 · 约 19 分钟 · 9053 字 阅读 →
论文解读

板混响能从声音倒推出物理参数吗:一次只用合成数据的参数估计挑战

该挑战用阻尼 Kirchhoff-Love 板仿真器生成全部脉冲响应,要求从波形倒推 6 个物理量或数千个模态三元组,结果是任务 A 可用大样本网络或大量正演搜索做到机器精度而任务 B 连模态增益都难以逐个恢复且频域复评会改变排名。

 · 更新于 2026-09-24 · 约 22 分钟 · 10993 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

少即是多:轮次结束主要靠声音和韵律,而非文本语义

论文用同一轻量三流分类器穷举声学、韵律、文本七种组合,发现声学加韵律在相同训练下取得最平衡的准确与延迟,而加入文本只增加抢话误报且不能提升性能。

 · 更新于 2026-09-24 · 约 17 分钟 · 8308 字 阅读 →
论文解读

音乐问答为何不能只靠通用多模态:密集音画下的时空与音乐先验设计

论文以音乐演出问答为对象,论证连续重叠音画与多尺度时间推理需要专门的输入处理与空间-时间结构,其证据是带时空设计的方法在三套基准上系统性领先,而代价是更复杂的分段选择与跨模态对齐及对音乐先验建模不足。

 · 更新于 2026-09-24 · 约 18 分钟 · 8569 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

看得见的峰才计数:峰残差估计把频率支撑、校准与高频补数分开处理

该研究只用未归一化脉冲响应估计模态频率、衰减与增益,用确定性峰残差前端定频率与行数、用不改频率行数的 MLP 只校准衰减增益、再用可选高频填充试探召回,官方 16 个文件主表 54785 行、增广表 71506 行,代价是高频插入行缺乏独立谱支撑且存在版本失配限制。

 · 更新于 2026-09-24 · 约 16 分钟 · 7989 字 阅读 →
论文解读

人设没崩在哪条路:把说什么和怎么说分开查的语音人设诊断

针对长程语音角色扮演中崩人设难定位的问题,论文提出把文本路由与音频路由投影到共享情感空间做分路由、按轮次诊断的 PED 框架,并在端到端与级联两种 3B 量级系统上揭示出可分性受限、文本向中性集中、双路由弱耦合等可复述的诊断信号。

 · 更新于 2026-09-24 · 约 20 分钟 · 9970 字 阅读 →