把人物引文单独切出来:以叙事切分做更可读的表现力语音合成
该文把有声书按叙述与人物直接引语切分并构建 LibriQuote,再用引文微调与从头训练检验自回归与流匹配两类语音合成基座的表现力与可懂度变化,主要代价是小数据从头训练会损失可懂度和域外泛化。
该文把有声书按叙述与人物直接引语切分并构建 LibriQuote,再用引文微调与从头训练检验自回归与流匹配两类语音合成基座的表现力与可懂度变化,主要代价是小数据从头训练会损失可懂度和域外泛化。
针对首尔韩语重音短语连续基频难以对应离散声调类别的问题,论文用双分支有监督对比学习整条轮廓的整体形状,在 10093 个短语上达到准确率 77.75% 与宏 F1 值 51.54%,代价是稀有类别与长低平尾音仍易混淆。
该文把语音智能体的文化能力重新定义为事件限定的交互能力,用语音事件与交互契约约束韵律时机与参与管理,并以附录的事件卡与最小对诊断补足词错率与平均意见分测不到的得体性,代价是增加人工判断与规范界定负担且不提供新数据集验证。
该文以声门源波形为输入、声学韵律聚类为自监督目标、说话人归一化与对抗说话人损失为解耦手段,在音高重建与 ToBI 事件检测上超过 HuBERT-base 与原始韵律基线,并以说话人识别准确率大幅下降为代价证明了解耦效果。
论文把低资源多语言情绪识别重写为有标签非言语发声到无标签言语的无监督迁移,用 NOVA-ARC 在庞加莱球中做韵律离散化、强度校准和原型最优传输,最强证据是 APD 非言语到言语适配下多目标持续领先,而代价是依赖双曲码本与传输超参数的联合稳定。
论文针对句子重音改变语义这一被忽视的能力,提出 StressTest 基准与 Stress-17k 合成训练管线,微调得到的 StresSLM 在真实录音上显著超过现有语音模型,同时基本保留原有识别能力。
论文把讽刺、情感、是否疑问作为离散目标,用文本模型与语音模型分类器的交叉熵估计互信息,在单句无长上下文条件下报告讽刺和情感的音频信息比文本高出一个量级以上、疑问句仅约 2.4 倍,并以音频增量近似韵律独有信息,代价是韵律无独立模型且结论受标注与模型上界约束。
针对视觉特征预处理复杂且跨域易失效的问题,InstructDubber 用多模态大模型生成语速与情绪自然语言指令,再分别蒸馏时长线索与校准情绪分析以预测音素时长和韵律,在三个基准的域内与跨域零样本配音中报告了更稳的对齐,但部分时长指标仍有基线更优且推理依赖外部大模型。
该文把情感计算的主单元从个人状态改为多人声音构成的互动场,用 WavLM 连续表征加零校准的格兰杰方向耦合检验,在 AMI 四人会议上显示微秒级重叠语音有约加 6.6 至加 7.4 个百分点的超额拒绝而独占语音趋近于零,代价是宏观尺度样本不足且只在 AMI 内验证。
针对菲律宾语重音需靠句子上下文消歧但句子级音素标注稀缺的问题,该研究用 Wiktionary 词典加 LLM 辅助管线合成句子级弱监督数据微调 CharsiuG2P 初始化的 ByT5,在 1173 句人工校对集上把音素错误率从约 19.74% 降到约 0.54%、字符错误率降到约 2.50%,代价是 malumi 类与非标准词仍易错且大合成集增益主要体现在 …