论文解读

把被遮住的频谱块合并掉:SpecAugment-Patch Merging 如何省算力

针对音频频谱变换器被 SpecAugment 零值块拖慢训练的问题,该文把掩码对齐到切块网格并只合并全零块,在 Balanced AudioSet 上 r 从 0 增至 100 时吞吐从 43.3 提至 49.3 samples/sec 而 mAP 维持 34.07 到 34.08,代价是可合并比例受掩码块数量上限约束。

 · 更新于 2026-09-24 · 约 21 分钟 · 10152 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

大模型造数据、小模型干活:库尔德语低资源语音识别的节俭路线

针对中库尔德语数据少且算力弱的问题,该研究先微调 Seamless 大模型生成伪标签再训练 31M 小模型,用 Asosoft 上 7.67 对比 8.18、Fleurs 上 22.46 对比 20.31 的词错误率说明小模型接近大模型,但 Fleurs 上仍有约 2 点差距且推理只在给定软硬件下测得 18 倍加速。

 · 更新于 2026-09-24 · 约 20 分钟 · 9546 字 阅读 →
论文解读

只有 32 小时班巴拉语数据时,把解码器对折而不砍掉

针对班巴拉语 32 小时监督数据的离线解码任务,BaldWhisper 先把 Whisper-base 解码器 6 层按相邻对加权融合为 3 层并做知识蒸馏,再把共享输入输出嵌入矩阵做秩 96 低秩分解加特征蒸馏,最终在保持基线约九成性能的同时把体积缩小约一半并把解码速度提高到两倍以上,代价是词错误率从基线水平上升数个百分点。

 · 更新于 2026-09-24 · 约 19 分钟 · 9131 字 阅读 →
论文解读

只漂移分布不对齐波形:DriftSE 为何要用语义加声学双潜空间做一步增强

DriftSE 把语音增强写成潜空间分布对齐问题,用冻结编码器的帧级漂移场在训练时牵引生成分布、推理时丢弃漂移只做一次前向,在四个数据集上以 1 次函数求值取得词错误率最优,但纯声学潜空间会出现幻觉而非配对训练会损失语义保真度。

 · 更新于 2026-09-24 · 约 21 分钟 · 10330 字 阅读 →
论文解读

把力度、角色与延迟一起改写:jam_bot 如何实现可接话的音乐对话

针对现场钢琴对话中缺力度、无明确轮次和输出延迟破坏节奏的问题,论文用四元组力度建模加 ggml 加速、脚踏开关标注的呼应微调与逐音符延迟补偿来回应,最强证据是逐音符补偿把节拍对齐中值提高到 0.7834 而无补偿仅 0.0678,代价是上下文能装的音符数从 341 降到 256 且风格仍局限于单人专家数据。

 · 更新于 2026-09-24 · 约 19 分钟 · 9184 字 阅读 →
论文解读

流式约束下自注意力退化为局部算子:去掉它为何词错误率几乎不变

该文在严格分块流式条件下检验 Conformer-Transducer 编码器中的自注意力,发现其退化为对角局部模式,进而用一维可变形卷积替换或直接删除自注意力,在 LibriSpeech 与 TEDLIUM-2 上保持词错误率基本不变并显著降低实时率与参数量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8799 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

先补幅度再造相位:PhaseGAN 用两套办法解耦声码器重建

针对梅尔谱缺相位信息导致相位一对多难学的问题,PhaseGAN 用插值加 ICCRN 先恢复幅度谱再用 R3-GAN 生成相位谱,在 LJSpeech 上报告 UTMOS 4.238 等最优感知指标,代价是两阶段分别训练且推理仍需 6.42G 量级计算。

 · 更新于 2026-09-24 · 约 16 分钟 · 7916 字 阅读 →
论文解读

装得进低功耗音频芯片的实时音乐分离:预算先行,深滤波补精度

针对嵌入式音频芯片同时卡住内存与单帧算力的问题,该研究用因果声谱分离主干加门控深滤波实现可部署分离,在芯片实测单帧 10.43 ms 内达到 4.70 dB cSDR,代价是比装不进芯片的最强基线低约 0.5 至 0.7 dB 且连续上下文训练不可省略。

 · 更新于 2026-09-24 · 约 21 分钟 · 10127 字 阅读 →
论文解读

不经过波形也能翻译语音令牌:TokenMapper 的同速率跨码本映射

TokenMapper 针对同有效帧率但码本结构不同的语音分词器做离散域直接翻译,在 GLM、Moshi、DualCodec 六个方向上把跨模型词错误率控制在接近原生重建 2.5-6.8 个百分点内,并以省去波形桥接换来 4.8-94.5% 的传输路径延迟下降,但多码本残差声学细节仍是主要代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9232 字 阅读 →
论文解读

把平均速度换成梅尔预测:少步数与有界上下文如何同进一个解码器

针对离散语音 token 到梅尔谱的低延迟合成问题,论文用梅尔空间重参数化的平均流把 2 到 3 步推理的声学目标直接化,并用层选择的分块掩码把每包计算限定在滑动窗内,代价是需要未来块的前视延迟和多步细化开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8291 字 阅读 →
论文解读

把非线性装进波数字滤波器:KAN 以更少参数逼近多二极管散射映射

该文在波数字滤波器框架下用神经网络显式逼近四端口非线性散射映射,对比多层感知机与柯尔莫哥洛夫-阿诺德网络,发现 KAN 以 40 对 148 个参数达到相近时域频域精度,但实时率从 1.31 升至 4.74。

 · 更新于 2026-09-24 · 约 19 分钟 · 9264 字 阅读 →
论文解读

集成显卡跑不动小模型、却能加速大卷积:Snapdragon 流式神经音频的实测边界

该工作在骁龙开发板上实测五种神经音频模型的中央处理器与集成图形处理器推理,问题是流式回调期限下集成显卡何时有效,选择是统一用高通推理栈对比最优中央处理器引擎,最强证据是二维卷积声码器在最小块上图形处理器已全面领先,主要代价是小模型与循环模型的调用开销反而拖慢并需要借用大缓冲换并行。

 · 更新于 2026-09-24 · 约 20 分钟 · 9555 字 阅读 →
论文解读

700 个等效源算不动时:用能量加权方向聚类保住早期反射

针对稀疏双耳房间脉冲响应重建后 700 个时域等效源带来双耳卷积负担的问题,论文提出能量加权方向 K 均值聚类把重建方向压缩到 30 个,ABX 显示与全分辨率难以区分,而按能量排序的基线在全部条件下均可被区分,代价是低能量但定位重要的源可能被合并且结论限于特定房间与早期反射条件。

 · 更新于 2026-09-24 · 约 14 分钟 · 6995 字 阅读 →
论文解读

高阶全通 warping 下 DCT 合成滤波器为何能用凸最小二乘做到完全重建

针对高阶全通变换 DCT 分析合成滤波器组相位与混叠失真难以同时补偿的问题,论文用凸最小二乘直接求解 FIR 合成子滤波器系数,以完全重建设计实现全局最优,并以混叠受限的近完全重建设计换取更好的合成滤波器频率选择性。

 · 更新于 2026-09-24 · 约 21 分钟 · 10396 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

不用逐个找峰也能建模琴桥导纳:用脉冲响应直接算出状态空间

论文把小提琴琴桥导纳看作有限维线性系统,用特征系统实现算法从实测脉冲响应直接做汉克尔矩阵奇异值分解得到降阶状态空间,并在六把小提琴上以时域频域与能量衰减三类误差对比两版模态拟合基线,代价是高阶近似与尚无听感实验。

 · 更新于 2026-09-24 · 约 19 分钟 · 9362 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →