每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

把 ResNet 做大做宽之后,说话人验证的误差降了多少,能耗又涨了多少

该研究在 VoxCeleb2 上系统改变 ResNet 的深度、宽度和残差块分布并用机器级传感器实测训练能耗与碳排放,最强证据是 ResNet-419-D 相对 ResNet-200-D 仅把平均 EER 从 3.44% 降到 3.35% 却耗电约 4 倍达 895.67 kWh,而中等规模的 ResNet-50-D 及其向中间层集中块的变体以约 50 …

 · 更新于 2026-09-24 · 约 15 分钟 · 7451 字 阅读 →
论文解读

自发性病理语音转写为何随严重程度分化:以 CER 为轴的多层次误差解读

该研究以 27 例唇口咽癌后自发对话语音检验 Whisper large 转写,发现字符错误率与感知严重度呈强负相关并以 50% 为界分出两组,重度组多层错误率平均高约 42.82%,其中词法与句法层代价最大而纯词性类别差异最小。

 · 更新于 2026-09-24 · 约 22 分钟 · 10522 字 阅读 →
论文解读

没有统一赢家:四类法语语音识别在自发与病理语音上的错法不同

该研究把转写词错率当作后续音素对齐的前置条件,在未见过的健康与病理法语数据上比较四类系统,最强证据是训练数据与评测风格越接近误差越低,而代价是没有任何模型在犹豫词和不同病理间保持稳定。

 · 更新于 2026-09-24 · 约 20 分钟 · 9757 字 阅读 →
论文解读

自动韵律切分能代替人工切分吗:巴西葡萄牙语自发语音合成的对照检验

该研究用同一批巴西葡萄牙语自发语音对比人工韵律切分、WhisperX 切分与随机森林韵律切分训练 FastSpeech2 的效果,最强证据是自动韵律切分的 F0 曲线走向接近人工切分,但 70% 合成核轮廓偏离自然语音且焦点位置更分散。

 · 更新于 2026-09-24 · 约 17 分钟 · 8341 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

神经音频编解码器能分清英语核语调吗:对 Mimi 的探针检验

论文用线性与非线性探针检验 Mimi 编码器输出与各码本是否保留八种英语核语调的区别,最强证据是 hhh 与 lll 等二分类可达约 90% 准确率,而五类聚类最高约 0.45 且远不及人类,代价是语调信息分散在多个码本且对重音不如对边界调敏感。

 · 更新于 2026-09-24 · 约 18 分钟 · 8922 字 阅读 →
论文解读

把一个辅音静音后单词还认得出来吗:用声学掩蔽给辅音贡献排序

该文用逐个辅音静音加孤立词识别的方法定义掩蔽致误识率来给辅音排序,最强证据是控制另一变量后频率与误识率负相关而功能负载正相关,代价是静音为上限式探针且只覆盖单个辅音与自动识别代理。

 · 更新于 2026-09-24 · 约 18 分钟 · 8763 字 阅读 →
论文解读

对齐很粗时更要扣准起音:把 Snapping 做成按音高的全局分配

针对乐谱与真实录音只有粗对齐时标注不够准的问题,该文把逐音符的起音修正做成按音高独立的二分图匹配,并在 MusicNet 训练、多数据集测试中报告了对贪心修正的一致提升,代价是窗口越大越依赖后验质量与一对一约束是否成立。

 · 更新于 2026-09-24 · 约 18 分钟 · 8558 字 阅读 →
论文解读

说话人向量记得是谁,却也记住了房间:噪声、混响与修复如何重塑嵌入空间

该研究以 LibriTTS 子集与 LibriTTS-R 对照比较 X-Vector 与 ECAPA-TDNN 在加噪、混响、加静音与神经声码器重建下的嵌入空间结构,报告 ECAPA-TDNN 更稳健但强混响与音频修复仍使类间可分性与最近说话人分类明显下降,而 X-Vector 对环境伪影更敏感。

 · 更新于 2026-09-24 · 约 17 分钟 · 8298 字 阅读 →
论文解读

不用存乐谱,只问时间:Uzulangs 把音乐模式写成时间的纯函数

论文把以 TidalCycles 为源头的现场编程家族改称为 Uzulangs,方法是用时间的纯函数加查询窗口表示模式,最强证据是查询、连接与可视化在多个语言中可复述,代价是放弃状态导致马尔可夫链等有状态写法很少被使用。

 · 更新于 2026-09-24 · 约 21 分钟 · 10215 字 阅读 →
论文解读

什么算错?把背诵转写差异分成错误、修正与可接受形式

该工作把古兰经背诵 ASR 转写与标准文本的差异标注为带位置的类型化事件,用可执行评分器同时考核标签与跨度,并报告朴素差分、生产组件适配与编码智能体试点的对照与代价。

 · 更新于 2026-09-24 · 约 17 分钟 · 8221 字 阅读 →
论文解读

参考引导的音效变体:用同一生产目标比较不同编辑能力的方法

论文把音效生产归纳为九项需求,用共享的参考到音频变体任务加原生能力分析比较五个异构基线,证据显示 AudioX 在保真与身份保持上最均衡而多样性、时序控制与局部修复各有所长且伴随效率与域外退化代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9663 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

压缩器建模该对准增益轨迹:用控制电压直接评价与训练的新数据集

论文指出波形误差是增益误差的带载波代理,易被次生效应淹没,用实测控制电压直接计算增益误差并训练灰盒模型后,直接监督在增益误差上明显优于波形代理,而波形指标对差异显著的模型给出相近分数,代价是需要同步采集控制电压并建设约 270 GB 的大规模数据集。

 · 更新于 2026-09-24 · 约 19 分钟 · 9395 字 阅读 →
论文解读

用音素识别度量声道形状合成:当逐点距离看不出时间稳定性时怎么办

该文把声道发音合成的评价转为发音特征上的音素识别问题,用同一识别器比较真实轮廓与三种合成轮廓的音素错误率,最强证据是加浊音编码后无模型合成达到 20.59 的错误率,代价是单说话人法语实时磁共振数据与缺声源信息的固有限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9554 字 阅读 →
论文解读

只做整段分类的模型,能否用积分梯度找回声音何时出现

论文用带精确起止时间的合成复调音频检验片段级分类器的事后积分梯度时间定位能力,最强证据是积分梯度达到平均交并比 0.39 与帧级 F1 值 0.52,接近弱监督帧级模型,但峰值定位一致性代价明显。

 · 更新于 2026-09-24 · 约 15 分钟 · 7240 字 阅读 →
论文解读

测试时不知道机器是谁:异常声音检测的身份依赖与隐式识别

论文把标准评测中已知机器身份的假设拿掉后联合评测,发现判别式模型退化最小而依赖机器专属分数的方法退化明显,且退化程度与隐式机器识别准确率相关,但局部密度归一化为例外显示识别准不是高检测性能的必要条件。

 · 更新于 2026-09-24 · 约 15 分钟 · 7352 字 阅读 →
论文解读

盲房间脉冲响应生成:用十指标框架看清滤波器与损失谁更有效

该研究针对盲房间脉冲响应生成评价分散、基线难复现的问题,在 11500 条房间脉冲响应的统一条件下对比滤波器组改进与多分辨率短时傅里叶变换加能量衰减浮雕联合损失改进,报告损失改进带来 41% 多分辨率短时傅里叶变换损失下降与 25% 峰相似度提升,但高频与低频最优窗口不同且固定 1 秒单通道仍是边界。

 · 更新于 2026-09-24 · 约 16 分钟 · 7673 字 阅读 →