论文解读

看得见的峰才计数:峰残差估计把频率支撑、校准与高频补数分开处理

该研究只用未归一化脉冲响应估计模态频率、衰减与增益,用确定性峰残差前端定频率与行数、用不改频率行数的 MLP 只校准衰减增益、再用可选高频填充试探召回,官方 16 个文件主表 54785 行、增广表 71506 行,代价是高频插入行缺乏独立谱支撑且存在版本失配限制。

 · 更新于 2026-09-25 · 约 16 分钟 · 7989 字 阅读 →
论文解读

不靠模态先验,把波形表征和可算特征拼起来反推薄板参数

针对从位移脉冲响应反推六个可辨识薄板参数的任务,论文用预训练 CNN14 波形分支拼接 15 维物理启发特征做回归,在官方验证集上报告总体归一化均方误差 0.00362,代价是仍依赖合成数据与固定预处理条件。

 · 更新于 2026-09-25 · 约 17 分钟 · 8476 字 阅读 →
论文解读

把拾音位置选择推迟到混音阶段:64 通道分弦多点吉他拾音系统

针对传统电吉他拾音位置在演奏时固定且混弦输出的问题,PolyMap 用 8 弦×8 位置共 64 个有源拾音胶囊在琴内数字化并经 MADI 输出,在 32 采样缓冲与 48 千赫兹条件下测得端到端 259 采样即 5.4 毫秒延迟,代价是拾音器主导的负 73 至负 67 分贝全刻度噪声与复杂的 64 通道后期混音负担。

 · 更新于 2026-09-25 · 约 18 分钟 · 8750 字 阅读 →
论文解读

把中间表示留下来:离线可编辑的分析对象如何成为作曲控制器

该演示用同一录音走完七条离线分析—表示—渲染链,把音高轮廓、切分表与轨迹等中间物变成可检查的作曲控制器,代价是放弃实时并依赖预渲染与人工核对。

 · 更新于 2026-09-25 · 约 24 分钟 · 11789 字 阅读 →
论文解读

野外噪声下先收缩去噪再分类:Epanechnikov 贝叶斯小波与倒谱监督学习

针对自然声景高噪声鸟鸣分类问题,论文用 Epanechnikov 先验贝叶斯小波收缩显式规则去噪,再以倒谱加谱指数特征训练监督分类器,最强证据是 10 维特征下支持向量机与多项逻辑回归准确率达 0.94 量级,代价是高维增益递减且部分高阶特征无贡献。

 · 更新于 2026-09-25 · 约 19 分钟 · 9091 字 阅读 →
论文解读

脉冲宽度不变而音高可变:脉冲表如何合成管乐音色

该文以脉冲成形原理重访脉冲表合成,用按基频索引的单周期脉冲加时变低通、成形噪声与混响生成铜管音色,并以小号三八度与起振微调制案例说明表情来自三条控制曲线的联动,代价是脉冲与轮廓仍难从混响录音中稳健自动提取。

 · 更新于 2026-09-25 · 约 21 分钟 · 10417 字 阅读 →
论文解读

噪声不在波形里,而在嵌入的方向上:SEE 量化与 SEEN 中和

论文针对大音频语言模型在噪声下语义推理不稳定的问题,提出在模型内部嵌入空间度量噪声投影能量的 SEE 并用减去噪声子空间分量的 SEEN 做免训练缓解,最强证据是 SEE 与生成成功率呈约 0.98 负相关,而代价是需要对齐的干净与纯噪声标定数据且只能去除可分离干扰不能补回已丢失语义。

 · 更新于 2026-09-25 · 约 19 分钟 · 9190 字 阅读 →
论文解读

一次仿真、一次回归:用 372 维描述子把单条板混响脉冲反推回六个物理参数

该文针对单条未归一化板混响脉冲反推六维物理与观测参数的问题,用离线仿真训练的归一化树集成一次回归代替逐条迭代优化,在两组仿真验证集上把归一化均方误差降到约 0.012 并把默认粒子群的估计时间从 2252.59 秒降到 10.75 秒,代价是只给点估计且参数精度只在仿真匹配分布下成立。

 · 更新于 2026-09-25 · 约 20 分钟 · 9906 字 阅读 →
论文解读

儿童朗读评分要保住发音和韵律,匿名化就不能只追求藏住身份

该文在 MPS 和 SpeechOcean 儿童朗读数据上比较 VTLN 加移调、McAdams 系数与神经编解码 NACLM,报告 VTLN 在 α=1.2 加负半音移调时隐私与可懂度韵律保持最均衡,而 NACLM 隐私最强但词错误率和韵律失真代价最大。

 · 更新于 2026-09-25 · 约 20 分钟 · 9915 字 阅读 →
论文解读

先看清频谱能量再迭代:谱重力共振峰估计如何换取带时间的音素切分

针对端到端转写丢失时间信息的问题,该研究用谱重力初始化加截止时间限制的期望最大化估计每帧共振峰并做语音切分,在爱尔兰语、特威语和沃提克语上以零样本方式取得高同质性和可比的归一化互信息,但对鼻音和滑音等过渡音仍存在过切分代价。

 · 更新于 2026-09-25 · 约 21 分钟 · 10080 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-12

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 79 分钟 · 39128 字 阅读 →
论文解读

未知发射时刻下把被动定位留作 ToA:用边一致 ADMM 分给每个接收器算

针对未知发射时间的单声源被动定位,论文把问题保持为 ToA 最小二乘并联合估计位置与发射时刻,用基于边的分布式 ADMM 给出闭式局部更新,仿真显示严格停止阈值下其趋势接近集中式求解器与 CRLB 参考,但宽松阈值出现高位平台且收敛只对平滑近似证明。

 · 更新于 2026-09-25 · 约 21 分钟 · 10094 字 阅读 →
论文解读

把关键词藏起来还能无损找回来:IO-RAE 的可逆混淆

针对语音被人和自动语音识别系统窃听关键词的问题,论文用大语言模型选替换词加累积信号攻击做局部混淆、再用可逆信息隐藏嵌入扰动,在 LibriSpeech 上报告目标误导率 96.5% 与恢复音频 PESQ 4.45,代价是强扰动与可逆嵌入的存储开销和对齐依赖。

 · 更新于 2026-09-25 · 约 19 分钟 · 9092 字 阅读 →
论文解读

不加噪声也能留后门:用整体起伏的频率与响度曲线触发说话人识别

针对闭集说话人识别的投毒后门问题,论文用时域上的频率调制与幅度调制构造全局平滑触发,在中毒率 0.05 等条件下报告数字与物理场景的高攻击成功率,同时保持良性准确率下降有限,但干净标签等更难设置的性能明显走弱。

 · 更新于 2026-09-25 · 约 21 分钟 · 10473 字 阅读 →
论文解读

冻住一半时域滤波器:Orukeet 用拟合 Gabor 核约束多语识别器

Orukeet 把 Parakeet 编码器中拟合误差最小的 12,288 个时域卷积核替换为解析 Gabor 函数并冻结,再训练其余参数,在 FLEURS 混合词错率上从 11.01% 降到 9.85%,代价是希腊语等少数划分明显变差且最终调优依赖 LibriSpeech test-other。

 · 更新于 2026-09-25 · 约 18 分钟 · 8850 字 阅读 →
论文解读

看得见动、听得见位:Sonic4D 把单目视频变成可走动的视听 4D

Sonic4D 针对 4D 生成只有画面没有空间音频的问题,用单目视频生成动态场景与单声道音频、再定位声源三维轨迹并做房间脉冲响应卷积,在 STARSS23 子集上方位误差降到 18.6 度、用户偏好达 89.03%,代价是依赖多个预训练专家模型与室外场景近似为室内混响。

 · 更新于 2026-09-25 · 约 20 分钟 · 9861 字 阅读 →
论文解读

整段对话只换一句话:冻结检测器如何给出伪造时间戳

论文把多说话人对话中的手术式伪造注入形式化为时序定位问题,用冻结二分类器加滑窗与迟滞解码器实现零样本定位,在 180 段构造对话上以强骨干达到时序交并比 0.90 左右,但边界位移约 3.5 秒且短时域外生成器注入仍接近全漏检。

 · 更新于 2026-09-25 · 约 16 分钟 · 7725 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-11

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 69 分钟 · 34318 字 阅读 →
论文解读

记忆即变换:LETHE 用能量判别与随机扰动让混响参数自己走

LETHE 把 3×3 反馈延迟网络当作可被改写的房间,用五特征线性判别器对照初始声音 DNA、以单样本扰动更新十一个参数,45 组 180 秒对照显示只有生成器开启时 c22 才会演化,但稳定工作点偏离经典纳什均衡且扰动先验仍待剥离。

 · 更新于 2026-09-25 · 约 16 分钟 · 7985 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-08

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 72 分钟 · 35908 字 阅读 →