论文解读

双声泛音靠声道形状算出来:可微波导怎样复制 sygyt

论文把 sygyt 双声复制写成从录音反推声道形状的可微优化问题,用带舌下第二声源和 B 样条声道的 Kelly-Lochbaum 波导在 20 段录音上把对数谱距离相对基线降低 30-38%,代价是每段仍需约 30 分钟离线优化且绝对误差仍在 9 分贝量级。

 · 更新于 2026-09-24 · 约 17 分钟 · 8472 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

不用改 vocoder 结构,只换条件特征:群延迟乘积谱能否替代梅尔谱

该文把群延迟乘积谱作为 Clarinet 神经声码器的条件特征,在英语与希腊语上与梅尔谱基线做可运行对照,主观 MOS 接近基线而客观 MCD 偏高、F0 周期性误差相当,关键代价是平滑系数 ρ 取值敏感。

 · 更新于 2026-09-24 · 约 16 分钟 · 7539 字 阅读 →
论文解读

声音太像说不出差别:用两阶段跨音频解码逼出可比的描述

针对无监督异常声音检测中正常与异常机器声高度相似、单条通用描述难以支撑差异总结的问题,论文提出推理时两阶段多样且判别性束搜索解码,用多条组内多样加跨音频互斥的描述供给大语言模型汇总,主观评估显示更具体可辨但未承诺延迟与误判改善。

 · 更新于 2026-09-24 · 约 19 分钟 · 9329 字 阅读 →
论文解读

在 24 平均律里学恰哈尕:PerFormer 如何把微分音、节拍位置和调式库存一起建模

针对波斯单声部微分音旋律生成问题,PerFormer 用位置—音高—时值事件序列加编解码 Transformer 与主音参考建模长程调式关系,在可调性准确率 90.18% 对 34.71% 和听感四项指标上超过一阶马尔可夫基线,代价是数据集仅 33 首原曲并集中于单一调式与 6/8 节拍且节奏有拉长简化倾向。

 · 更新于 2026-09-24 · 约 18 分钟 · 8535 字 阅读 →
论文解读

把弯音从左手搬到脚下:Robo-Bend 用琴头顶弦实现约 280 音分的物理推弦

Robo-Bend 针对电吉他推弦费力且依赖手指定位的问题,选择在琴头用舵机齿条直接顶弦并用脚踏控制,在 5 人对照中实现约 280 音分且与把位无关的稳定升高,代价是踏板行程与音高非线性导致瞄准困难与收敛变慢。

 · 更新于 2026-09-24 · 约 17 分钟 · 8440 字 阅读 →
论文解读

何时才该移动声音对象:SEND 把混音师的克制听感做成双流事件检测

论文把沉浸式混音中的对象移动形式化为音乐空间事件检测,用目标与背景双流加 Spec-TNT 与 TCN 和 CTGI 门控预测帧级移动概率,在 1000 个专业工程上报告 Frame-F1 为 0.7675 和 Event-IoU 为 0.6305,代价是仍有零星抖动且只预测何时动而不生成连续三维轨迹。

 · 更新于 2026-09-24 · 约 18 分钟 · 8695 字 阅读 →
论文解读

把听力筛查藏进播客静音里:间歇采集能省多少点击又保住多少精度

该研究把短暂宽带点击嵌入播客自然静音进行间歇采集与加权平均,在 1.5×播放约每分钟 102 次点击下取得平均约 5 dB 误差并把舒适度从 1.0×的低位提升到高位,代价是点击过少时误差底抬高。

 · 更新于 2026-09-24 · 约 19 分钟 · 9428 字 阅读 →
论文解读

喜欢的不一定最有效:标签与情绪类型如何塑造 AI 音乐感知

该研究用 152 人三组标签对照检验镇静与振奋两类情绪音乐,显示人作音乐被评更有效而偏好更偏向 AI,且误标驱动偏好,振奋高唤醒场景下人作优势更明显,代价是刺激仅 4 首且质性编码为单人。

 · 更新于 2026-09-24 · 约 17 分钟 · 8439 字 阅读 →
论文解读

帧内也会变化的乐音:用分布导数法估计多项式调幅调频正弦

针对乐器起振与调制在分析帧内非平稳的问题,该工作用分布导数法估计三阶多项式调幅调频正弦,在 39 个乐器声音上获得更高的信号残差比并在听感上接近原声,代价是峰选择不当仍是主要误差来源且频谱距离指标并不总是最优。

 · 更新于 2026-09-24 · 约 18 分钟 · 8998 字 阅读 →
论文解读

一个旋钮管住五种距离线索:把声源推远而不推散的耦合渲染器

该演示用归一化距离参数同时驱动增益、混响比、高频吸收、预延迟和低频补偿五种线索并保持互洽,在 18 人耳机测试中把三声源距离摆放误差从手动混音的 15.3 点降到 7.3 点,代价是 48 kHz 下双耳级开启时 CPU 峰值约 10.5% 与固定 10.7 ms 分区延迟。

 · 更新于 2026-09-24 · 约 19 分钟 · 9135 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

硬标签丢掉了多少情绪:用软输出重测匿名化后的情感保留

针对声音匿名化中情感保留被硬标签平均召回低估不确定性的问题,该研究把语音情感识别输出换成概率与对数值并比较原始与匿名化嵌入距离,用 23 人 MUSHRA 主观评分为准,发现概率向量欧氏距离与人耳判断高度相关且不再依赖真值标注,但属性预测表示仍弱于类别表示。

 · 更新于 2026-09-24 · 约 18 分钟 · 8763 字 阅读 →
论文解读

用已确认的块把下一步拽回来:锚定循环如何抑制长序列符号音乐的误差累积

针对长序列符号音乐自回归生成中误差累积导致结构漂移的问题,论文提出先预测块级语义再重建音符细节并用已生成块回嵌为锚的循环范式与分草图细化的层次框架,最强证据是预测特征与真值余弦距离平均降低 34.7% 且长序列主客观评价接近真值,代价是钢琴卷表示压缩可能丢失细微时值与目前主要面向钢琴。

 · 更新于 2026-09-24 · 约 18 分钟 · 8791 字 阅读 →
论文解读

听起来流利不等于可复用:三位朗读者的中库尔德语语音合成核查

该研究复核一篇中库尔德语语音合成公开释放,问题是论文、模型卡与文件三者是否一致,方法是逐项比对配置、评测与许可,最强证据是三系统合成分为 4.08、4.01、4.06 且与各自录音质量同序,主要代价是测试集未标记、识别器兼做转写与评分以及禁改许可限制了公开修正。

 · 更新于 2026-09-24 · 约 18 分钟 · 8871 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

全局平均为何听不见断裂:口语模型声学评估的局部重估

论文指出全局离散符号困惑度把长程语义波动平均进声学判断,提出窗口化与局部化加归一化以及基于真实续写的人评与嵌入裁判评估,并在 SALMon 上以相关性提升与 84.1% 人类差距闭合为证据,代价是依赖转折时刻标注与裁判选择。

 · 更新于 2026-09-24 · 约 17 分钟 · 8210 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-12

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 79 分钟 · 39128 字 阅读 →
论文解读

似然能学会音符,对不上人心:音乐生成的偏好对齐怎么做

本文要解决似然训练抓不住主观音乐审美的问题,对比训练时 RLHF 与 DPO 和推理时树搜索三条路线,最强证据是约 300000 对偏好训练的 MusicRL 与 CLAP 提升 29.4% 的推理对齐,主要代价是数据不公开与推理延迟。

 · 更新于 2026-09-24 · 约 18 分钟 · 8602 字 阅读 →