论文解读

把可懂度比较搬进声道:九维收缩变量为何能替掉上千维自监督特征

针对病理性语音可懂度评估需要准确且可解释的问题,ART-NAD 用说话人无关声学到发音反演得到的九通道准声道收缩变量替代 NAD 的 wav2vec2 特征做多变量 DTW,在 20 个参考音频协议上平均说话人级 Pearson 相关与 NAD-FA 持平而可定位到具体收缩通道,代价是反演模型只在英语 EMA 上训练导致非英语连贯语音出现差距。

 · 更新于 2026-09-24 · 约 21 分钟 · 10088 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-23

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 77 分钟 · 38502 字 阅读 →
论文解读

复刻缺全流程代码的乐器分离模型:性能差距与能量代价从何而来

该文复刻频带切分循环网络用于人声贝斯鼓与其他四轨分离,在公开数据集上补齐预处理与训练细节并对比多种设计,结果显示大模型与替代增强可缩小与原报告的差距,但耐心延长与全项目试错带来数十倍于单次训练的能量开销。

 · 更新于 2026-09-24 · 约 23 分钟 · 11196 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-22

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 54 分钟 · 26987 字 阅读 →
论文解读

不等电话挂断:只用通话级标签从原始语音做增量诈骗打分

论文把电话诈骗检测写成弱监督增量打分问题,用冻结语音编码器加有界窗口循环建模与聚合器实现每 2 秒更新,在受控英文合成基准上报告终局 ROC-AUC 约 0.9953,而消融显示循环上下文是主要贡献且全局模型终局数值更强。

 · 更新于 2026-09-24 · 约 18 分钟 · 8637 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-18

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 67 分钟 · 33126 字 阅读 →
论文解读

在实测参数的琴弦上学运弓:隐式摩擦、修正的最小弓压与监督天花板的可测边界

论文用隐式求解的有限差分弓弦模型复现亥姆霍兹运动并修正最小弓压定律为一次方依赖,再以等容量的门控循环控制器在扰动下领先前馈控制器,但证明其稳态调节不超过查表教师,只在教师失效处反超。

 · 更新于 2026-09-24 · 约 19 分钟 · 9432 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-16

共分析 59 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 104 分钟 · 52022 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

多通道子带切分与说话人调制的实时目标语音提取:MBSRNN 如何把空间线索装进 20 毫秒

针对助听设备的多通道目标说话人提取问题,MBSRNN 用 33 子带切分分别处理混合语音与注册语音并以 FiLM 交错 LSTM 注入说话人信息,在 CHiME-9 开发集流式条件下把 fwSNRseg 从基线约 2.2 提升到约 4.4 至 4.6,代价是约 53.1M 参数与处理一秒片段约 224.3 GMACs 运算量以及 STOI 未稳定提升。

 · 更新于 2026-09-24 · 约 18 分钟 · 8792 字 阅读 →
论文解读

在手术室里听出细微口吃:用 GRU 把脑刺激引起的言语障碍自动分成正常与异常

针对清醒脑肿瘤手术中电刺激引起的短暂构音障碍难以实时听辨的问题,论文提出录音去噪加 Whisper 切分加 MFCC 加 GRU 的二分类方法,在计数与 DO80 任务上报告约 90% 以上验证精度,但合并任务出现过拟合且异常样本仍偏少。

 · 更新于 2026-09-24 · 约 17 分钟 · 8478 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
论文解读

把手的极限写进网络:物理约束如何决定钢琴指法的可弹性

该文把钢琴指法当作带生物力学约束的序列标注问题,用卷积网络提局部键盘模式、双向长短期记忆网络建前后依赖并加注意力与前向规划,在钢琴指法数据集上报告通用匹配率约 82.6%、最高匹配率约 92.1%,代价是去掉物理约束后通用匹配率掉 11.4 个点且复调大跨度仍需人工把关。

 · 更新于 2026-09-24 · 约 19 分钟 · 9068 字 阅读 →
论文解读

把想象的手臂运动听见:用解码速度驱动颗粒合成的声音手势

该工作把已训练好的三维想象运动解码器的连续速度信号作为声音手势的控制源,用分层颗粒合成做实时可听化,报告了静息、起始与持续手势的可区分听感,但尚未做闭环听觉反馈下的受试者评估。

 · 更新于 2026-09-24 · 约 20 分钟 · 9776 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

让电脑跟指挥走:Ponticello 把电子声部绑到弹性拍点上

针对混合音乐中电子声部与乐队弹性速度难同步的问题,Ponticello 用摄像头加循环网络从指挥手势实时推断速度来拉伸电子演奏谱,其排练与音乐会验证显示可用但只解决时间协调且依赖训练覆盖的指挥风格。

 · 更新于 2026-09-24 · 约 21 分钟 · 10494 字 阅读 →
论文解读

把黑盒打开演奏:用网页可视化让 MDRNN 从工具变成应答伙伴

该研究为呼叫应答式演奏搭建了覆盖记录、组集、训练到表演的网页界面,用双路实时可视化暴露混合密度循环神经网络状态,5 人 40 分钟探索性研究显示系统可用性量表均值 62.50 分而视觉反馈清晰度达 4.0/5 分,代价是新手仍需面对模型训练的概念负担与小数据下生成质量不稳。

 · 更新于 2026-09-24 · 约 21 分钟 · 10458 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

正则约束下把深度换精度:深层条件 LSTM 与听觉滤波损失补回建模质量

针对可调旋钮的黑盒虚拟模拟在旋钮转动时出现噪声的问题,论文用深层拼接条件 LSTM 加谱范数或无穷范数正则与 32 通道 Gammatone 滤波损失,在三块效果器数据上把正则模型的精度追近无正则基线,同时把零输入下的控制噪声压到实用底噪以下,但同等规模下正则仍有小幅精度代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9047 字 阅读 →