论文解读

只看低频孤立共振:多分辨率谱图反推板混响物理参数

该研究把板混响脉冲响应转成多分辨率幅度谱图加相位通道后用 ResNet-18 回归七个原始物理参数,在 200 条 5 秒对照上把平均 NMSE 从基线 0.0605 降到 0.0058,代价是依赖下采样到 1470 Hz 的低频段与仿真分布。

 · 约 17 分钟 · 8434 字 阅读 →
论文解读

参数小不等于能跑:LiSenNet 在受限 NPU 上的算子与状态协同改造

针对 STM32N6 上 Neural-ART 只支持静态整数量化卷积图的问题,该研究把 LiSenNet 双路 GRU 瓶颈改为卷积频率混合加因果空洞时间卷积并配套可折叠归一化与有界激活,最终以 46.2k 参数实现板载 int8 PESQ 3.01 与每 16 ms 跳 4.83 ms 处理,代价是 154 KiB 的 25 个 FIFO 流状态。

 · 约 15 分钟 · 7324 字 阅读 →
论文解读

近满分不可信时怎么办:表示工程与录音级评估决定水下舰船分类能否部署

该研究以水下舰船被动声学分类为任务,用多时频与耳蜗表示加时间统计池化和紧凑卷积做分类,最强证据是录音级隔离的 DeepShip 上 157K 参数四层卷积测试宏 F1 为 0.7226 而 11.17M 参数 ResNet18 验证更低,代价是 ShipsEar 近满分结果不能视为未见录音泛化。

 · 约 17 分钟 · 8428 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-25

共分析 75 篇语音/AI 论文

 · 约 132 分钟 · 66120 字 阅读 →
论文解读

混合音乐里谁是合成的:用合成概率图加能量掩码定位目标声部

针对人声与合成声部混合后全局检测失效的问题,该工作用分频段局部检测构成合成概率图再与目标声部能量掩码联合判断单个声部真伪,在人声鼓组吉他上表现较强而在贝斯上受限于分离质量。

 · 更新于 2026-09-25 · 约 16 分钟 · 7943 字 阅读 →
论文解读

把水印藏进编解码器保留的潜变量方向:DeltaMark 对神经编解码重合成的鲁棒性

针对波形水印经神经编解码重合成后易失效的问题,论文用冻结 EnCodec 连续潜变量上的前馈加性扰动做 16 比特水印,在重复与低码率 EnCodec 重合成下退化更平缓,但端到端音质受限于编解码器载体本身。

 · 更新于 2026-09-25 · 约 20 分钟 · 9672 字 阅读 →
论文解读

长期照护肺炎听诊:X 线监督与三通道前胸协议的稳定判别

针对日本长期照护高龄有症状人群的六通道前胸数字听诊任务,论文用 X 线监督训练共享权重 ARP-N 卷积网络并在病人级重复交叉验证下比较临床诊断监督,最强证据是听诊单模态 XRAY 模型 F1 为.729、准确率为.783 而融合模型 AUC 为.791,代价是单中心 185 例与域漂移限制外推。

 · 更新于 2026-09-25 · 约 19 分钟 · 9465 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-24

共分析 62 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 112 分钟 · 55814 字 阅读 →
论文解读

不用对齐音素也能评节奏:包络变化率为何在低分段更稳

该研究把二语节奏评估做成流利度和韵律分数回归,用一维卷积直接从语音幅度包络及其一阶导数学生节奏特征,最强证据是包络导数模型在低流利度组误差显著低于时长模型,代价是韵律维度仍受语调混杂与低分样本稀少限制。

 · 更新于 2026-09-25 · 约 19 分钟 · 9051 字 阅读 →
论文解读

在只允许二维卷积的神经形态芯片上做音视融合:NAVIR 的分解与受限解码

针对工业噪声下纯音频识别崩溃的问题,NAVIR 用逐帧空间编码加时序卷积的分解结构适配 BrainChip AKD1000,在 GRID 噪声测试下量化融合模型取得未见说话人 14.0% 与重叠说话人 3.3% 词错率,代价是未见说话人纯唇读仍高达 35.3% 且音视模型在片上吞吐下降。

 · 更新于 2026-09-25 · 约 17 分钟 · 8497 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-23

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 77 分钟 · 38502 字 阅读 →
论文解读

一个因果音频到脑电模型如何同时复现脑干、皮层与双耳整合响应

该研究把双耳声波形直接映射为连续高采样率脑电,用约 250 小时异构数据训练一个因果编码器解码器,并在并行脑干响应、语音时间响应函数与双耳交互成分三类范式上复现了已知的形态与刺激依赖效应,但串行呈现幅值与部分响应幅度仍存在系统性偏差。

 · 更新于 2026-09-25 · 约 20 分钟 · 9805 字 阅读 →
论文解读

小容量不靠看得远:固定感受野与梅尔细节约束的紧凑合成

针对约 265K 参数的紧凑声学模型,论文用感受野对照证明超过 15 个音素的编码器上下文无一致收益,再用梅尔适配的梯度方差损失恢复细节,在同等预算下把 UTMOS 从 3.591 提升到 4.086,代价是大模型在可懂度和频谱失真上仍占优且结论限于 LJSpeech 自动指标。

 · 更新于 2026-09-25 · 约 21 分钟 · 10114 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-18

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 67 分钟 · 33126 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 360 分钟 · 180081 字 阅读 →
论文解读

把 ResNet 做大做宽之后,说话人验证的误差降了多少,能耗又涨了多少

该研究在 VoxCeleb2 上系统改变 ResNet 的深度、宽度和残差块分布并用机器级传感器实测训练能耗与碳排放,最强证据是 ResNet-419-D 相对 ResNet-200-D 仅把平均 EER 从 3.44% 降到 3.35% 却耗电约 4 倍达 895.67 kWh,而中等规模的 ResNet-50-D 及其向中间层集中块的变体以约 50 …

 · 更新于 2026-09-25 · 约 15 分钟 · 7451 字 阅读 →
论文解读

对不准音高时如何跟谱:用演奏法识别补齐对齐式跟谱

针对混合音乐中扩展长笛技法难以只靠音高对齐跟谱的问题,论文把 Antescofo 的对齐机与轻量识别器 ipt~做松耦合混合切换,在 11 类技法上报告宏 F1 为 93.4%±0.1,但混合跟谱以增加延迟为代价换取跨演奏的稳定性。

 · 更新于 2026-09-25 · 约 24 分钟 · 11734 字 阅读 →
论文解读

把手的极限写进网络:物理约束如何决定钢琴指法的可弹性

该文把钢琴指法当作带生物力学约束的序列标注问题,用卷积网络提局部键盘模式、双向长短期记忆网络建前后依赖并加注意力与前向规划,在钢琴指法数据集上报告通用匹配率约 82.6%、最高匹配率约 92.1%,代价是去掉物理约束后通用匹配率掉 11.4 个点且复调大跨度仍需人工把关。

 · 更新于 2026-09-25 · 约 19 分钟 · 9068 字 阅读 →