论文解读

把人物引文单独切出来:以叙事切分做更可读的表现力语音合成

该文把有声书按叙述与人物直接引语切分并构建 LibriQuote,再用引文微调与从头训练检验自回归与流匹配两类语音合成基座的表现力与可懂度变化,主要代价是小数据从头训练会损失可懂度和域外泛化。

 · 更新于 2026-09-25 · 约 20 分钟 · 9568 字 阅读 →
论文解读

把整条基频轮廓看成整体:首尔韩语重音短语声调的对比学习分类

针对首尔韩语重音短语连续基频难以对应离散声调类别的问题,论文用双分支有监督对比学习整条轮廓的整体形状,在 10093 个短语上达到准确率 77.75% 与宏 F1 值 51.54%,代价是稀有类别与长低平尾音仍易混淆。

 · 更新于 2026-09-25 · 约 21 分钟 · 10382 字 阅读 →
论文解读

转录都对,为什么听起来还是不合适:语音交互的文化能力

该文把语音智能体的文化能力重新定义为事件限定的交互能力,用语音事件与交互契约约束韵律时机与参与管理,并以附录的事件卡与最小对诊断补足词错率与平均意见分测不到的得体性,代价是增加人工判断与规范界定负担且不提供新数据集验证。

 · 更新于 2026-09-25 · 约 18 分钟 · 8845 字 阅读 →
论文解读

留住语调、抹掉身份:用声门源与对抗损失学隐私韵律表示

该文以声门源波形为输入、声学韵律聚类为自监督目标、说话人归一化与对抗说话人损失为解耦手段,在音高重建与 ToBI 事件检测上超过 HuBERT-base 与原始韵律基线,并以说话人识别准确率大幅下降为代价证明了解耦效果。

 · 更新于 2026-09-25 · 约 16 分钟 · 7853 字 阅读 →
论文解读

用非言语笑声哭声做监督:韵律如何跨到多语言言语情绪识别

论文把低资源多语言情绪识别重写为有标签非言语发声到无标签言语的无监督迁移,用 NOVA-ARC 在庞加莱球中做韵律离散化、强度校准和原型最优传输,最强证据是 APD 非言语到言语适配下多目标持续领先,而代价是依赖双曲码本与传输超参数的联合稳定。

 · 更新于 2026-09-25 · 约 19 分钟 · 9179 字 阅读 →
论文解读

重音一变意思就变:语音模型为何听不出言外之意

论文针对句子重音改变语义这一被忽视的能力,提出 StressTest 基准与 Stress-17k 合成训练管线,微调得到的 StresSLM 在真实录音上显著超过现有语音模型,同时基本保留原有识别能力。

 · 更新于 2026-09-25 · 约 18 分钟 · 8705 字 阅读 →
论文解读

单句之内,声音比文字多说多少:讽刺、情感与疑问的信息分工

论文把讽刺、情感、是否疑问作为离散目标,用文本模型与语音模型分类器的交叉熵估计互信息,在单句无长上下文条件下报告讽刺和情感的音频信息比文本高出一个量级以上、疑问句仅约 2.4 倍,并以音频增量近似韵律独有信息,代价是韵律无独立模型且结论受标注与模型上界约束。

 · 更新于 2026-09-25 · 约 18 分钟 · 8661 字 阅读 →
论文解读

不抠嘴唇像素:用语速与情绪指令做对齐的电影配音

针对视觉特征预处理复杂且跨域易失效的问题,InstructDubber 用多模态大模型生成语速与情绪自然语言指令,再分别蒸馏时长线索与校准情绪分析以预测音素时长和韵律,在三个基准的域内与跨域零样本配音中报告了更稳的对齐,但部分时长指标仍有基线更优且推理依赖外部大模型。

 · 更新于 2026-09-25 · 约 19 分钟 · 9181 字 阅读 →
论文解读

从单人情绪标签转向多人声音互动场:耦合只在共同在场时出现

该文把情感计算的主单元从个人状态改为多人声音构成的互动场,用 WavLM 连续表征加零校准的格兰杰方向耦合检验,在 AMI 四人会议上显示微秒级重叠语音有约加 6.6 至加 7.4 个百分点的超额拒绝而独占语音趋近于零,代价是宏观尺度样本不足且只在 AMI 内验证。

 · 更新于 2026-09-25 · 约 18 分钟 · 8971 字 阅读 →
论文解读

浅正字法不等于无重音:用弱监督让 ByT5 在句子级学会菲律宾语重音

针对菲律宾语重音需靠句子上下文消歧但句子级音素标注稀缺的问题,该研究用 Wiktionary 词典加 LLM 辅助管线合成句子级弱监督数据微调 CharsiuG2P 初始化的 ByT5,在 1173 句人工校对集上把音素错误率从约 19.74% 降到约 0.54%、字符错误率降到约 2.50%,代价是 malumi 类与非标准词仍易错且大合成集增益主要体现在 …

 · 更新于 2026-09-25 · 约 16 分钟 · 7843 字 阅读 →