论文解读

只调时长就能学会重读吗:EmphTTS 用强化学习对齐时长预测器

针对词级重读控制难的问题,EmphTTS 冻结已微调的 F5-TTS 主体、只用带重读定位奖励的 GRPO 优化时长预测器,在 TinyStress-15k 上取得 StressLM F1 0.75 的最佳客观重读效果,但整体可懂度和说话人相似度仍明显低于大规模基线。

 · 约 20 分钟 · 9899 字 阅读 →
论文解读

沉默与重叠都不是错:轮换时机要按说话人意图打分

论文针对固定窗口把延迟与重叠一律判错的问题,用六类意图后验与人类轮换偏移分布加权连续打分,在 9728 个回合上显示最强系统综合分 0.47 远低于人类 0.86 且与人评一致性更高,但代价是需要多标注者意图标注与分人群拟合的参考分布。

 · 约 20 分钟 · 9716 字 阅读 →
论文解读

不用对齐音素也能评节奏:包络变化率为何在低分段更稳

该研究把二语节奏评估做成流利度和韵律分数回归,用一维卷积直接从语音幅度包络及其一阶导数学生节奏特征,最强证据是包络导数模型在低流利度组误差显著低于时长模型,代价是韵律维度仍受语调混杂与低分样本稀少限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9051 字 阅读 →
论文解读

俳句的停顿为何难念:HaikuS2S 用两段微调把 5-7-5 念出节奏

针对用户语音输入后用英语俳句语音回应的任务,HaikuS2S 采用自动语音识别加大型语言模型加语音合成的级联路线,配合通用诗歌与自录俳句两段微调,最强证据是俳句微调后音高对齐与可懂度改善,而代价是会话自然度评分下降与小规模录音带来的泛化限制。

 · 更新于 2026-09-24 · 约 26 分钟 · 12802 字 阅读 →
论文解读

声调写不出来时,让词素先把语法说清楚:Morpho-VITS 的形态建模

针对卢旺达语正字法省略声调与音节时长导致端到端合成语调难的问题,该工作用词素编码器加音素到词素交叉编码器替换 VITS 文本编码,在 10 千句可懂度与 21 人主观评测上提升自然度与语调,但以 169M 词素参数与训练时长增加为代价且对未见词素敏感。

 · 更新于 2026-09-24 · 约 18 分钟 · 8926 字 阅读 →
论文解读

总体偏好裹挟维度打分:直播语音评测如何把四个韵律维度拆开判

针对直播带货语音合成中流畅度、语调、情感和直播感需要分维度评价的问题,论文先把 Gemini 的成对判断蒸馏为开源的 Live-ProsodyJudge,再用去掉总体结论、按维度掩码与分段归因的 Decoupled 版本解决维度塌缩,十次平衡顺序采样的 LPJ 在四个主测试集点准确率高于单次 Gemini 调用,而 D-LPJ 的混合维度一致率达到 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9797 字 阅读 →
论文解读

野外波斯语音不够用:用韵律完整切分与双模型互认造出 2400 小时语料

针对波斯语缺少大规模高保真语音数据的问题,PersianVox 用声学轮次感知的韵律切分与 CTC/RNN-T 双自动语音识别一致过滤从网络音频构造语料,最强证据是 SCOREQ 在 564 句人工平均意见分上皮尔逊相关达 0.6658 优于 DNSMOS 且修复后 SCOREQ 均值从 3.04 升至 4.03,代价是从 6179.66 小时原料仅保留 …

 · 更新于 2026-09-24 · 约 19 分钟 · 9295 字 阅读 →
论文解读

不录音也能装上读音开关:用模型自己的声音教它读重音

针对端到端语音合成读错生僻词和日语声调的问题,该文用常见词的自身合成做教师来蒸馏读音与声调控制通道,在 Sarashina2.2 上未见词声调实现率达 0.89 且自然度非劣效,代价是相对纯假名低 0.069-0.091 及跨骨干迁移时声调与自然度不完全保持。

 · 更新于 2026-09-24 · 约 15 分钟 · 7184 字 阅读 →
论文解读

说话人压过语言:卢森堡语与法语魅力韵律的方差从哪里来

论文用 10 名双语政客各 20 句卢森堡语加 20 句法语共 400 句和 41 个魅力相关声学韵律特征,以混合效应模型分离说话人与语言方差,发现说话人中位解释一半以上方差而语言中位仅占约 0.5%,语言差异集中在法语更高的 shimmer 与句末基频和卢森堡语更强的中频谱能量,但合成魅力指数无语言主效应。

 · 更新于 2026-09-24 · 约 20 分钟 · 9695 字 阅读 →
论文解读

元音管语言、辅音留个人:双语政治演讲的时间组织不对称

该研究以 10 名卢森堡政治人物各 20 句卢森堡语加 20 句法语共 400 句自发政治话语为对象,用 C/V 分段与成对变异等时长节律指标加配对 t 检验与方差分解,报告显示元音时长与语速主要随语言重组而辅音时序保留说话人特征,且未发现语言与性别交互。

 · 更新于 2026-09-24 · 约 15 分钟 · 7237 字 阅读 →
论文解读

答对不等于用对线索:CLASH 用配对语音审计讽刺检测的词与调依赖

口语讽刺检测难分词汇与韵律贡献,CLASH 用同一句话的四条件配对变换固定模型做反事实审计,最强证据是目标句 Qwen3-Omni 在时长平衡后词汇保留领先韵律保留 0.135 至 0.148 的 AUROC,代价是声学分数移动常不带来判别增益与二值判决变化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8980 字 阅读 →
论文解读

声调看不见的合成器:DunDun 给约鲁巴语 TTS 补一条声调轴

针对约鲁巴语 TTS 中字符错误率看不见声调错误的问题,论文提出只读输入变音符号作金标、只读基频作预测的 DunDun 指标,用压平基频与翻转答案键验证其声调敏感性,并显示微调主要降低字符错误率而声调早已接近母语锚点,代价是可用区间只到 0.596 且依赖可靠标调文本。

 · 更新于 2026-09-24 · 约 19 分钟 · 9392 字 阅读 →
论文解读

把音高、能量和语速画在同一条线上:VIP2VIP 的三维韵律可视化管线

针对单看基频会把重音归因给音高的问题,该文选择在平滑后的基频线上同时编码瞬时强度与局部音节速率,并在意大利诗歌朗读上展示联合线索如何区分延续类边界,代价是颜色只表相对快慢且跨录音比较仍需归一化。

 · 更新于 2026-09-24 · 约 22 分钟 · 10629 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

又快又要分清两级短语:Rapid-ToBI 只做分组判断的取舍

针对连续语音韵律短语标注耗时问题,论文提出依赖完整主流美式英语 ToBI 训练的加速分组标注法 Rapid-ToBI,报告双人三分类一致性 κ=.87 而 Wavelet 在中间短语处漏检 78.5%,代价是仍需受训标注员且仅在约十分钟奥巴马讲话上验证。

 · 更新于 2026-09-24 · 约 15 分钟 · 7468 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

疑问句里的重音为何变了形:人类会换声调策略,合成语音却只用陈述句一套

论文比较北美英语人类与 Parler-TTS 在陈述句和极性问句中实现对比性焦点的声学线索,发现人类按句型反转 F0 策略而合成语音跨句型高度一致,且在语速与强度上整体偏离人类,最强证据来自贝叶斯逻辑回归的 95% 可信区间方向差异,代价是强度在人类数据中受录音变异掩盖而未能复现经典效应。

 · 更新于 2026-09-24 · 约 20 分钟 · 9663 字 阅读 →
论文解读

“You Good?”靠什么区分陈述与疑问:F0 峰位置与眉毛峰时序的协同证据

该研究以非裔美国英语使用者产出的多义短语 you good 及单义对照句为材料,用 Praat 标 F0 峰位置与 OpenFace 加 findgest 标眉毛运动,检验句类与多义性对峰位、眉毛活动频率、抬眉分布与声手峰时序的影响,最强证据是句类显著决定 F0 峰落在第二词与眉峰相对更早,而疑问句并未带来更多眉毛活动或抬眉。

 · 更新于 2026-09-24 · 约 18 分钟 · 8866 字 阅读 →
论文解读

焦点抬高了整词,重音却只剩半边:雅美语焦点与重音的首次分离检验

该研究用三音节形容词、名词、动词在对比焦点、窄焦点及两种焦点后条件下的对照发音实验,显示焦点使第二、三音节元音的基频、时长和能量一致抬高,而所谓词末重音与倒数第二重音的音节间差异并不稳定,仅频谱倾斜等个别指标支持重音解释。

 · 更新于 2026-09-24 · 约 20 分钟 · 9595 字 阅读 →
论文解读

高音不在重音上时:阿美语疑问词与祈使句的声调重联分析

该研究以陈述句的词末重音为基线,比较撒奇莱雅与法兰澳阿美语的疑问词首与祈使句动后小品的高音位置,提出高音重联而非重音移位的统一解释,代价是仅依赖八位发音人的声学描写而未做统计检验与感知验证。

 · 更新于 2026-09-24 · 约 20 分钟 · 9608 字 阅读 →