古典符号混搭为何先对终止式再数对位错误
该研究以检索加规则检验做古典钢琴符号混搭,用 8 小节可控听辨分离和声、终止逻辑、动机可辨识度和织体四个因素,发现终止逻辑与可辨识度及复调并置更关键,代价是仅在短片段、均匀钢琴音色和小样本条件下成立。
该研究以检索加规则检验做古典钢琴符号混搭,用 8 小节可控听辨分离和声、终止逻辑、动机可辨识度和织体四个因素,发现终止逻辑与可辨识度及复调并置更关键,代价是仅在短片段、均匀钢琴音色和小样本条件下成立。
该研究用 Seed-VC 把健康对照的持续元音转换成癌与良性黏膜病变的嗄声并请专家做 GRBAS 与四级可信度评定,结果显示转换声不总被判为人工但仍可被感知且常规声学差值解释不了,提示先别直接拿去训练分类器。
针对自然语言到二维均衡参数的连续控制任务,论文用约 9 万次用户交互构建非参数偏好密度奖励面,先以 GRPO 做在线结构对齐再以 DPO 做峰值注入精修,在分布外概念上以 1.5B 模型达到与 GPT-4o mini 可比的听感,代价是混合管线对分组数敏感且仅适用于低维空间。
针对非专家用户难以编写 PsyToolkit 脚本的问题,DYE 用 R 与 Shiny 图形界面拼装强迫选择与李克特量表并生成可直接导入编译的代码与图片,代价是目前仅覆盖 PsyToolkit 有限子集且多元素需顺序呈现。
该研究以马赛市议会 10 名说话人各 5 段录音和 49 名听众的 5 级口音等级判断为证据,显示说话人均值从 1.33 到 4.10 呈近连续分布且重测相关 R²=0.98,而听众地域与态度变量均不显著,代价是 30 分钟在线测试流失率高且语音内容未做音系控制。
该研究用同一句 Molly mailed a melon 在四种问答语境下考验七个主流 TTS 能否做出正确且自然的韵律焦点,人类基线仍最稳,最强的 Gemini 也不均衡,而高自然度与高可辨度难以兼得。
该研究以同一短篇故事的真人朗读与两种开源合成语音对比疑问句尾音升降,发现较好的 Kokoro 在是非问句升调比例接近真人但在 Wh 问句大量误升,且两系统音高变化范围与自然度均低于真人。
该研究用 2 阶录制加 3 阶解码把 5 段自然声景放在实验室与博物馆的 16 只 Genelec 阵列上对比,报告显示存在感较稳而深度、包围感、清晰度与稳定性在混响展厅中下降,代价是房间与垂直阵列构形混在一起无法分离。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
本研究用 4 段签证面试自然语音和 129 名尼日利亚听者的匹配假装评分,检验 4 种核调型在话语延续、强调、尊重礼貌与文化得体上的概率性差异,最强证据是 RISE-FALL 相对 FALL-LOW 更可能被判为延续与得体,而 RISE-RISE 始终偏向不礼貌不得体,但效应是梯度而非范畴且高度依赖语境。
RenCon 2025 用线上预选加 48 小时 unseen 现场渲染考查乐谱到钢琴演奏的转换,9 套系统中规则系统与层次循环网络居前而人类基线 4.40 分仍明显领先,代价是力度校准与主观评价仍未标准化。
该研究用同一句话在 50%、100%、200%、400% 四档用力下比较“大声”与“有意念”两种外部提示,报告显示提示间声学与感知差异很小而档位间差异显著,但 400% 用力反而平均强度与音高范围下降,代价是自然度与清晰度的权衡仍未解开。
该研究用德语三档自然语速与其 PSOLA 时长对齐版本做清晰度评分与 A/B 偏好实验,证明全局语速强烈预测清晰度但重音、有声段保持与元音频谱保持贡献独立方差,而线性伸缩不能复原自然缩减的分布。
该研究比较有无知觉情绪中间约束的语音嵌入-购买意愿模型,用反向传播改写语音嵌入再做零样本合成,听评显示有约束语音在开放与封闭说话人上都显著提升购买意愿和愉悦感,但 arousal 未拉开差距且语速被推得过快时反而有害。
该个案以四组同音节五声调重复任务结合五位母语听辨与基频时长声学测量,显示总体听辨正确率仅 36.1% 且高调 T1 仅 6%,代价是单被试、无纵向干预对照,不能推广为群体规律。
共分析 27 篇语音/AI 论文
论文把音效生产归纳为九项需求,用共享的参考到音频变体任务加原生能力分析比较五个异构基线,证据显示 AudioX 在保真与身份保持上最均衡而多样性、时序控制与局部修复各有所长且伴随效率与域外退化代价。
针对稀疏双耳房间脉冲响应重建后 700 个时域等效源带来双耳卷积负担的问题,论文提出能量加权方向 K 均值聚类把重建方向压缩到 30 个,ABX 显示与全分辨率难以区分,而按能量排序的基线在全部条件下均可被区分,代价是低能量但定位重要的源可能被合并且结论限于特定房间与早期反射条件。
该研究比较声学氛围驱动与歌词语义驱动的背景视频选择,提出在约 14000 个音乐视频上对比学习音乐视频联合嵌入并用束搜索做全局非重叠选段,最强证据是主观评价中声学方法在整体不自然感和转场连续性上显著优于歌词方法,代价是剪辑节奏与歌词具体指涉仍存在错位。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读