论文解读

混合音乐里谁是合成的:用合成概率图加能量掩码定位目标声部

针对人声与合成声部混合后全局检测失效的问题,该工作用分频段局部检测构成合成概率图再与目标声部能量掩码联合判断单个声部真伪,在人声鼓组吉他上表现较强而在贝斯上受限于分离质量。

 · 约 16 分钟 · 7943 字 阅读 →
论文解读

不换模型换前端:儿童语音的时间包络与可学习归一化如何补上 Whisper

针对儿童语音声学变异大而 Whisper 固定对数梅尔前端丢失连续包络结构的问题,该文用时域子带希尔伯特包络加可学习逐通道能量归一化替换前端,在相同 Whisper-small 微调下把 MyST 清洗测试集词错误率从 13.16% 降到 11.08%,代价是删除错误小幅上升且低频保留原因仍待验证。

 · 约 17 分钟 · 8261 字 阅读 →
论文解读

真人对话里多说话人提取为何变难:静音太多与注册语音对不上

针对真实四人对话中目标说话人长期静音与朗读式注册语音失配问题,该工作用随机 VAD 掩蔽损失把 STOI 从 0.55 提升到 0.60、fwSegSNR 从 4.35 提升到 5.12,代价是仍需保留部分静音训练并受注册相似度制约。

 · 约 18 分钟 · 8816 字 阅读 →
论文解读

已知录音、未知变速:谐波打击分离如何在 Python 里做到逐帧可变速实时播放

论文把已知录音的谐波打击分离放在离线预处理、把相位声码器与叠加相加放在逐帧可变速的实时合成,并用预计算频谱查表把总运行时间降低约一半,代价是更小的预计算跳长需要更多预计算与内存。

 · 更新于 2026-09-24 · 约 18 分钟 · 8540 字 阅读 →
论文解读

在多通道输出里做掩蔽:增强越强,残留干扰的空间感丢得越多吗

该文用理想比值掩蔽比较麦克风、波束形成器和 Ambisonics 三种域的增强,报告显示波束域语音质量最高而 Ambisonics 域更好地保留残留干扰的空间属性,且所有方法都保留目标声源定位线索,但以混响目标为期望才能保住混响。

 · 更新于 2026-09-24 · 约 15 分钟 · 7495 字 阅读 →
论文解读

不存更多指纹,只在查询时多算一步:POLARIS 的显著性地标与查询侧扩展

针对全局音高和速度不变的失真查询,POLARIS 用局部归一化显著性选地标、用 Delaunay 三角形组指纹、只在查询侧加两跳邻域指纹,在自建手机重录集上报告了可复述的流程与查询代价变化。

 · 更新于 2026-09-24 · 约 19 分钟 · 9405 字 阅读 →
论文解读

粗粒度保语义、细粒度保波形:DualSpecSE 为何要双路同时增强 Mel 与复谱

针对单做 Mel 需外接声码器而失真、单做复谱难学且伤识别的问题,DualSpecSE 用 Mel 分支保可识别成分、复谱分支保波形细节并以交互与融合连接,在 DNS2020 上 WB-PESQ 达 3.25、CHiME-4 波形输出 WER 降至 14.76%/13.21%,代价是双分支与多损失联合训练的复杂度。

 · 更新于 2026-09-24 · 约 18 分钟 · 8732 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

同室共奏更齐吗:用串音痕迹反推录音方式对合奏时值稳定性的影响

该研究以 391 首多轨录音为对象,用起音时间差与 Mel 谱相似度推断是否同室录音,报告有串音歌曲的时值波动中位数更低,但串音只是同室的非充分不必要指示且存在混淆。

 · 更新于 2026-09-24 · 约 23 分钟 · 11343 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

先压住佩戴者自己的声音,再找对话对象:CHiME-9 ECHI 三阶段提取解读

针对可穿戴多通道录音中佩戴者自干扰过强与注册音频失配问题,论文用佩戴者抑制加目标提取加后处理三阶段流水线,在开发集上多数客观指标超过官方基线,在测试集上以可懂度下降为代价换取目标语音质量与总体质量提升。

 · 更新于 2026-09-24 · 约 19 分钟 · 9229 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
论文解读

长短时间尺度对不齐:ALS 构音障碍中频谱流与语调短语起点的相位一致性下降

该研究以朗读语段检验频谱变化快尺度与语调短语慢尺度之间的跨尺度相干,发现 ALS 组在语调短语起点频率附近的成对相位一致性显著低于对照组,而语调短语起点频率本身及其变异性无组间差异,提示计划相对保留而启动执行环节受损,但样本小且仅为朗读。

 · 更新于 2026-09-24 · 约 24 分钟 · 11872 字 阅读 →
论文解读

不控参数而控过程:Hyponoia 把脑电状态变成作曲行为

Hyponoia 针对开放形式电声即兴中生理信号如何参与音乐形式的问题,用 Muse 2 四通道脑电加心率的闭环状态机把神经振荡映射为作曲过程,并在 4 人大小提琴与小号对比中显示声音实践专家有更丰富连贯的 theta 与 alpha 活动,代价是样本极小且阈值与伪迹处理未经充分验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10269 字 阅读 →
论文解读

发声时也在场的外激扫频:唇端阻抗分离如何同时拿下共振频率与带宽

针对发声谐波污染唇端扫频响应的问题,该研究用闭口校准加高阶小啁啾变换分离嗓音与扫频重建声道响应,在 90 赫兹到 1100 赫兹基频的/a/静态仿体上识别前四个共振并给出频率与带宽,代价是在共振一致与低基频处误差与分离难度明显增大。

 · 更新于 2026-09-24 · 约 19 分钟 · 9171 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

在机房里吹哨:把生成式 AI 的噪音与污染摆到台前的声音宣言

作者针对 2025 年 IEEE Big Data AI 音乐生成研讨会音乐比赛的浅层话语,用两人气鸣乐器在 GPU 机房的约一小时现场表演与录音构成抵抗行动,报告显示作品最终因赛后追加的 AI 方法与时长限制而落选,而代价是高参会费与规则不透明使抗议难以进入正式评审。

 · 更新于 2026-09-24 · 约 19 分钟 · 9209 字 阅读 →
论文解读

逐样本读相位、自调谐保幅度:跟踪共振器组的实时谱分析

针对实时低延迟高分辨率谱分析问题,论文用相邻样本相位差分估计瞬时频率并把估计值反馈为跟踪共振器的共振频率,以自调谐共振器组在无缓冲逐样本更新下输出每样本频率幅度列表,受控正弦与真实音乐谱图显示频率跟踪与幅度保持成立,代价是合成仍有瞬态拖尾与主导器切换相位不连续等初步局限。

 · 更新于 2026-09-24 · 约 21 分钟 · 10255 字 阅读 →
论文解读

每个词听到了哪里:把音频大模型的描述逐词钉回时频证据

针对音频多模态大模型自由描述中每个词缺乏时频依据的问题,STAG 用词条件内部激活做时间定位、用频带遮挡做频谱定位再做可分融合,在四个时序标注基准上取得最佳事件定位,并在反事实删除中以目标置信下降和事件消失支持其忠实性,代价是可分假设与缺少频率真值。

 · 更新于 2026-09-24 · 约 20 分钟 · 9987 字 阅读 →