会议总览

ICLR 2026 语音/音频论文详细分析

共分析 133 篇 ICLR 2026 论文

 · 更新于 2026-09-24 · 约 406 分钟 · 203008 字 阅读 →
论文解读

用随时间指数增长的卷积造出方向相关的混响:从高斯噪声到球谐混响场

该文把固定脉冲与随样本指数加长的滤波器做时变卷积并扩展到球谐域,用近最小相位滤波器拟合由非平稳高斯过程采样的方向相关混响时间,以快速分治卷积从噪声或已有脉冲生成新的空间脉冲响应,代价是滤波器阶数不足时指数放大会放大拟合误差且长混响方向必须更平滑。

 · 更新于 2026-09-24 · 约 17 分钟 · 8440 字 阅读 →
论文解读

合成语音露出口音破绽:巴西葡萄牙语方言不一致如何成为可解释的鉴伪线索

论文针对巴西葡萄牙语合成语音口音稀释问题,用多语言音素识别加传统声学分析构建说话人级音系画像,仅在自然语音上拟合核密度估计即显示可分性,并在自建集与公开反欺骗集上验证了对大模型的增益与跨域泛化,但语音克隆场景下增益收窄且需要较多同说话人语句聚合。

 · 更新于 2026-09-24 · 约 17 分钟 · 8342 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-23

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 77 分钟 · 38502 字 阅读 →
论文解读

先分证据再定修复模式:稀疏、突发与密集专家的时序路由

该研究把黑胶损伤检测做成修复导向的 5 类时序路由,用稀疏、突发、密集 3 路专家证据加分层路由器与验证集选定的维特比转移惩罚,在 597 段合成基准上达到 0.730 的 5 类宏 F1,主要增益来自时序解码而非分层本身,且混合类仍最难。

 · 更新于 2026-09-24 · 约 21 分钟 · 10120 字 阅读 →
论文解读

把回声方向看成概率密度:球谐域切片 Wasserstein 如何搬运声源与反射

论文把空间房间脉冲响应的聚合回声方向建模为球谐非负密度,用平方和半定规划做极大似然估计与逆变换采样,再以球面切片 Wasserstein 位移插值直线路径上的声源与反射密度,实验显示 Wasserstein 插值在整条路径上切片距离最小,但代价是切片离散化与非负约束带来的两步优化。

 · 更新于 2026-09-24 · 约 18 分钟 · 9014 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-22

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 54 分钟 · 26987 字 阅读 →
论文解读

用圆环记时间:CircleMatch 以千级参数做关键词识别

CircleMatch 针对极小参数关键词识别,用分频带压缩编码加每类 5 个原型匹配,再以无参数圆环统计与有序路径分数汇总时序,在 GSC 与 MSWC 多词表上以约 1k-10k 参数取得可比精度,代价是大词表与大模型绝对精度仍占优且部分对比协议并不一致。

 · 更新于 2026-09-24 · 约 23 分钟 · 11158 字 阅读 →
论文解读

数闭合而不是数峰:西班牙语颤音两种计数单位为何得出相反性别结论

该研究用先定位中频能量谷再验证释放的闭合计数器替代包络峰计数,在六个语料库 356 名说话人 3560 个合格颤音上得到中位数 2 个闭合、约 36 毫秒间隔,语境效应稳健而性别效应消失,代价是只描述成形良好的浊音周期性颤音且缺乏人工逐点基准。

 · 更新于 2026-09-24 · 约 16 分钟 · 7976 字 阅读 →
论文解读

移动声源下镜像源如何配对:用部分最优传输做房间冲激响应插值

针对移动物理声源导致镜像源整体平移且部分可见性变化的问题,论文用部分最优传输恢复起点与终点镜像源集合的配对并做位移插值,在统计数据和镜像源仿真数据上均优于线性插值,而源信息代价在简洁性和精度上最实用。

 · 更新于 2026-09-24 · 约 22 分钟 · 10792 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-17

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 53 分钟 · 26180 字 阅读 →
论文解读

声源移动后镜像全变:用位移不变代价求最优传输重心

针对从已知声源镜像源点云插值新声源点云的问题,该文用物理位移等于镜像位移的不变性构造最优传输地面代价并求重心,交替估计关联与位置,在 3×4 米二维二阶反射仿真和 400 次蒙特卡洛下 One-PC 初始化最优,但近墙密集混叠与大扰动下误差放大且无实测验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8843 字 阅读 →
论文解读

混合不分离直接估计合成参数:扩散先验如何压住时间抖动

针对和声乐器混合的逐帧合成参数估计易出现时间抖动的问题,该文用乐谱条件扩散模型学习参数轨迹分布并以多尺度频谱重构误差引导逆扩散,在木管与弦乐合奏上改善了响度与音色特征并保留可复述的实验条件。

 · 更新于 2026-09-24 · 约 24 分钟 · 11741 字 阅读 →
论文解读

在时域里做混叠抵消:OLAC 如何对齐 MDCT 重叠实现无缝有损无损切换

针对无线音频需在有损与无损之间无断点切换的问题,OLAC 只做可逆时域混叠抵消加窗而不做整数 MDCT 变换,用前向线性预测与 Golomb-Rice 编码实现无损压缩,在 20 毫秒帧下平均压缩到 56.8%,代价是帧间预测被切断且随机访问需先解前一帧。

 · 更新于 2026-09-24 · 约 22 分钟 · 10600 字 阅读 →
论文解读

守住信息再做取舍:残差全速率加性 U-Net 的完全重构路由

论文把受约束加性 U-Net 等价为临界采样完全重构滤波器组,再用全速率残差路由把学习目标转为任务相关的取舍,在 TIMIT 上以相同识别器把测试音素错误率从 28.60±2.09% 降到 25.76±0.41%,代价是保留双路全分辨率表示带来的过完备冗余。

 · 更新于 2026-09-24 · 约 16 分钟 · 7882 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-16

共分析 59 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 104 分钟 · 52022 字 阅读 →
论文解读

把音高、能量和语速画在同一条线上:VIP2VIP 的三维韵律可视化管线

针对单看基频会把重音归因给音高的问题,该文选择在平滑后的基频线上同时编码瞬时强度与局部音节速率,并在意大利诗歌朗读上展示联合线索如何区分延续类边界,代价是颜色只表相对快慢且跨录音比较仍需归一化。

 · 更新于 2026-09-24 · 约 22 分钟 · 10629 字 阅读 →
论文解读

造循环器学信号处理:把录音、叠加与消咔哒声做成可跟做的课程

该文以在 Max、gen~ 与 RNBO 中逐步建造现场循环器为教学方法,让学生在录音播放、叠加与去咔哒声等真实音乐任务中学习缓冲与时序,课堂观察显示参与度和迁移能力提升,但 gen~ 与 RNBO 的转换仍受单学期时间与代码畏难情绪限制。

 · 更新于 2026-09-24 · 约 22 分钟 · 10835 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →