ICLR 2026 语音/音频论文详细分析
共分析 133 篇 ICLR 2026 论文
共分析 133 篇 ICLR 2026 论文
该文把固定脉冲与随样本指数加长的滤波器做时变卷积并扩展到球谐域,用近最小相位滤波器拟合由非平稳高斯过程采样的方向相关混响时间,以快速分治卷积从噪声或已有脉冲生成新的空间脉冲响应,代价是滤波器阶数不足时指数放大会放大拟合误差且长混响方向必须更平滑。
论文针对巴西葡萄牙语合成语音口音稀释问题,用多语言音素识别加传统声学分析构建说话人级音系画像,仅在自然语音上拟合核密度估计即显示可分性,并在自建集与公开反欺骗集上验证了对大模型的增益与跨域泛化,但语音克隆场景下增益收窄且需要较多同说话人语句聚合。
共分析 42 篇语音/AI 论文
该研究把黑胶损伤检测做成修复导向的 5 类时序路由,用稀疏、突发、密集 3 路专家证据加分层路由器与验证集选定的维特比转移惩罚,在 597 段合成基准上达到 0.730 的 5 类宏 F1,主要增益来自时序解码而非分层本身,且混合类仍最难。
论文把空间房间脉冲响应的聚合回声方向建模为球谐非负密度,用平方和半定规划做极大似然估计与逆变换采样,再以球面切片 Wasserstein 位移插值直线路径上的声源与反射密度,实验显示 Wasserstein 插值在整条路径上切片距离最小,但代价是切片离散化与非负约束带来的两步优化。
共分析 29 篇语音/AI 论文
CircleMatch 针对极小参数关键词识别,用分频带压缩编码加每类 5 个原型匹配,再以无参数圆环统计与有序路径分数汇总时序,在 GSC 与 MSWC 多词表上以约 1k-10k 参数取得可比精度,代价是大词表与大模型绝对精度仍占优且部分对比协议并不一致。
该研究用先定位中频能量谷再验证释放的闭合计数器替代包络峰计数,在六个语料库 356 名说话人 3560 个合格颤音上得到中位数 2 个闭合、约 36 毫秒间隔,语境效应稳健而性别效应消失,代价是只描述成形良好的浊音周期性颤音且缺乏人工逐点基准。
针对移动物理声源导致镜像源整体平移且部分可见性变化的问题,论文用部分最优传输恢复起点与终点镜像源集合的配对并做位移插值,在统计数据和镜像源仿真数据上均优于线性插值,而源信息代价在简洁性和精度上最实用。
共分析 29 篇语音/AI 论文
针对从已知声源镜像源点云插值新声源点云的问题,该文用物理位移等于镜像位移的不变性构造最优传输地面代价并求重心,交替估计关联与位置,在 3×4 米二维二阶反射仿真和 400 次蒙特卡洛下 One-PC 初始化最优,但近墙密集混叠与大扰动下误差放大且无实测验证。
针对和声乐器混合的逐帧合成参数估计易出现时间抖动的问题,该文用乐谱条件扩散模型学习参数轨迹分布并以多尺度频谱重构误差引导逆扩散,在木管与弦乐合奏上改善了响度与音色特征并保留可复述的实验条件。
针对无线音频需在有损与无损之间无断点切换的问题,OLAC 只做可逆时域混叠抵消加窗而不做整数 MDCT 变换,用前向线性预测与 Golomb-Rice 编码实现无损压缩,在 20 毫秒帧下平均压缩到 56.8%,代价是帧间预测被切断且随机访问需先解前一帧。
论文把受约束加性 U-Net 等价为临界采样完全重构滤波器组,再用全速率残差路由把学习目标转为任务相关的取舍,在 TIMIT 上以相同识别器把测试音素错误率从 28.60±2.09% 降到 25.76±0.41%,代价是保留双路全分辨率表示带来的过完备冗余。
共分析 59 篇语音/AI 论文
针对单看基频会把重音归因给音高的问题,该文选择在平滑后的基频线上同时编码瞬时强度与局部音节速率,并在意大利诗歌朗读上展示联合线索如何区分延续类边界,代价是颜色只表相对快慢且跨录音比较仍需归一化。
该文以在 Max、gen~ 与 RNBO 中逐步建造现场循环器为教学方法,让学生在录音播放、叠加与去咔哒声等真实音乐任务中学习缓冲与时序,课堂观察显示参与度和迁移能力提升,但 gen~ 与 RNBO 的转换仍受单学期时间与代码畏难情绪限制。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读