看得见的峰才计数:峰残差估计把频率支撑、校准与高频补数分开处理
该研究只用未归一化脉冲响应估计模态频率、衰减与增益,用确定性峰残差前端定频率与行数、用不改频率行数的 MLP 只校准衰减增益、再用可选高频填充试探召回,官方 16 个文件主表 54785 行、增广表 71506 行,代价是高频插入行缺乏独立谱支撑且存在版本失配限制。
该研究只用未归一化脉冲响应估计模态频率、衰减与增益,用确定性峰残差前端定频率与行数、用不改频率行数的 MLP 只校准衰减增益、再用可选高频填充试探召回,官方 16 个文件主表 54785 行、增广表 71506 行,代价是高频插入行缺乏独立谱支撑且存在版本失配限制。
针对从位移脉冲响应反推六个可辨识薄板参数的任务,论文用预训练 CNN14 波形分支拼接 15 维物理启发特征做回归,在官方验证集上报告总体归一化均方误差 0.00362,代价是仍依赖合成数据与固定预处理条件。
针对传统电吉他拾音位置在演奏时固定且混弦输出的问题,PolyMap 用 8 弦×8 位置共 64 个有源拾音胶囊在琴内数字化并经 MADI 输出,在 32 采样缓冲与 48 千赫兹条件下测得端到端 259 采样即 5.4 毫秒延迟,代价是拾音器主导的负 73 至负 67 分贝全刻度噪声与复杂的 64 通道后期混音负担。
该演示用同一录音走完七条离线分析—表示—渲染链,把音高轮廓、切分表与轨迹等中间物变成可检查的作曲控制器,代价是放弃实时并依赖预渲染与人工核对。
针对自然声景高噪声鸟鸣分类问题,论文用 Epanechnikov 先验贝叶斯小波收缩显式规则去噪,再以倒谱加谱指数特征训练监督分类器,最强证据是 10 维特征下支持向量机与多项逻辑回归准确率达 0.94 量级,代价是高维增益递减且部分高阶特征无贡献。
该文以脉冲成形原理重访脉冲表合成,用按基频索引的单周期脉冲加时变低通、成形噪声与混响生成铜管音色,并以小号三八度与起振微调制案例说明表情来自三条控制曲线的联动,代价是脉冲与轮廓仍难从混响录音中稳健自动提取。
论文针对大音频语言模型在噪声下语义推理不稳定的问题,提出在模型内部嵌入空间度量噪声投影能量的 SEE 并用减去噪声子空间分量的 SEEN 做免训练缓解,最强证据是 SEE 与生成成功率呈约 0.98 负相关,而代价是需要对齐的干净与纯噪声标定数据且只能去除可分离干扰不能补回已丢失语义。
该文针对单条未归一化板混响脉冲反推六维物理与观测参数的问题,用离线仿真训练的归一化树集成一次回归代替逐条迭代优化,在两组仿真验证集上把归一化均方误差降到约 0.012 并把默认粒子群的估计时间从 2252.59 秒降到 10.75 秒,代价是只给点估计且参数精度只在仿真匹配分布下成立。
该文在 MPS 和 SpeechOcean 儿童朗读数据上比较 VTLN 加移调、McAdams 系数与神经编解码 NACLM,报告 VTLN 在 α=1.2 加负半音移调时隐私与可懂度韵律保持最均衡,而 NACLM 隐私最强但词错误率和韵律失真代价最大。
针对端到端转写丢失时间信息的问题,该研究用谱重力初始化加截止时间限制的期望最大化估计每帧共振峰并做语音切分,在爱尔兰语、特威语和沃提克语上以零样本方式取得高同质性和可比的归一化互信息,但对鼻音和滑音等过渡音仍存在过切分代价。
共分析 42 篇语音/AI 论文
针对未知发射时间的单声源被动定位,论文把问题保持为 ToA 最小二乘并联合估计位置与发射时刻,用基于边的分布式 ADMM 给出闭式局部更新,仿真显示严格停止阈值下其趋势接近集中式求解器与 CRLB 参考,但宽松阈值出现高位平台且收敛只对平滑近似证明。
针对语音被人和自动语音识别系统窃听关键词的问题,论文用大语言模型选替换词加累积信号攻击做局部混淆、再用可逆信息隐藏嵌入扰动,在 LibriSpeech 上报告目标误导率 96.5% 与恢复音频 PESQ 4.45,代价是强扰动与可逆嵌入的存储开销和对齐依赖。
针对闭集说话人识别的投毒后门问题,论文用时域上的频率调制与幅度调制构造全局平滑触发,在中毒率 0.05 等条件下报告数字与物理场景的高攻击成功率,同时保持良性准确率下降有限,但干净标签等更难设置的性能明显走弱。
Orukeet 把 Parakeet 编码器中拟合误差最小的 12,288 个时域卷积核替换为解析 Gabor 函数并冻结,再训练其余参数,在 FLEURS 混合词错率上从 11.01% 降到 9.85%,代价是希腊语等少数划分明显变差且最终调优依赖 LibriSpeech test-other。
Sonic4D 针对 4D 生成只有画面没有空间音频的问题,用单目视频生成动态场景与单声道音频、再定位声源三维轨迹并做房间脉冲响应卷积,在 STARSS23 子集上方位误差降到 18.6 度、用户偏好达 89.03%,代价是依赖多个预训练专家模型与室外场景近似为室内混响。
论文把多说话人对话中的手术式伪造注入形式化为时序定位问题,用冻结二分类器加滑窗与迟滞解码器实现零样本定位,在 180 段构造对话上以强骨干达到时序交并比 0.90 左右,但边界位移约 3.5 秒且短时域外生成器注入仍接近全漏检。
共分析 38 篇语音/AI 论文
LETHE 把 3×3 反馈延迟网络当作可被改写的房间,用五特征线性判别器对照初始声音 DNA、以单样本扰动更新十一个参数,45 组 180 秒对照显示只有生成器开启时 c22 才会演化,但稳定工作点偏离经典纳什均衡且扰动先验仍待剥离。
共分析 38 篇语音/AI 论文