论文解读

把口音减掉而把人留下:口音类比引导如何跳出同一条权衡曲线

跨语言零样本合成中参考音频的源语言口音会泄漏到目标语音,本文用同一合成代理声音在两种语言下预测之差估计口音方向并在采样时减去,在 OmniVoice 等四个公开模型上实现等口音下更高的说话人相似度,代价是每步增加代理计算与每模型需小幅扫描去口音强度。

 · 约 16 分钟 · 7789 字 阅读 →
论文解读

基准分好看、个人用不好:韩语唇读在 OLKAVS 上拆开 wording、说话人与仰角

该文用英语预训练的视频 Conformer 在 OLKAVS 协议上把已见句式误差降到约 10% 上下,但人口普查显示个体误差从 1% 到 52% 不等,数分钟正面视频的低秩适配器能为高误差者挽回约 2 到 3 个点且可迁移到各视角,而嘴平面以上相机带来约 6 个点的固定加性损失。

 · 约 18 分钟 · 8564 字 阅读 →
论文解读

不改唇形只定静音时刻:用二值语音活动信号约束配音合成

该文用帧级二值语音活动掩码约束补画式语音合成以对齐源语言静音结构,在 mTEDx 上把帧对齐准确率从约 73% 提升到约 96%,而主观自然度无显著下降,代价是在翻译时长严重失配时出现可复述的删词、重复与重排。

 · 更新于 2026-09-25 · 约 19 分钟 · 9244 字 阅读 →
论文解读

音节不够一秒、标签只有十个:ToneCL 用保调增强做对比预训练

针对音节级声调标注缺数据、句子级数据切分噪声大的问题,ToneCL 用保持声调的增强做对比预训练再用每调 1 到 10 个样本微调,在六说话人普通话 10-shot 达到 91.6%,跨语言预训练仍达 91.0%,代价是自然连续语音与声门特征仍未解决。

 · 更新于 2026-09-25 · 约 18 分钟 · 8751 字 阅读 →
论文解读

跨语言帕金森严重程度分级:预训练语音嵌入能迁移什么,又在哪里混淆

该研究用四种语音基础模型嵌入加四种浅层分类器做健康对照、轻度、重度三分类,在意大利语、英语、哥伦比亚西班牙语之间做零样本与每类 49 个目标片段的 k 样本适配,发现 k 样本一致提升目标语言 F1 且源语言基本稳定,但重度与轻度边界和预处理线索损失仍是主要代价。

 · 更新于 2026-09-25 · 约 18 分钟 · 8858 字 阅读 →
论文解读

单语能分开慢阻肺,换语言就失灵:用疾病方向一致性筛出 26 个跨语言声学特征

针对自发语音中疾病效应被语言音系差异掩盖的问题,CL-DAF 在英孟 272 维公共声学空间中用符号秩二列效应与语言不变分数筛选出 26 个方向一致特征,使英译孟与孟译英 AUC 分别达到 0.825 和 0.722,而代价是需要双语标签估计对齐且目标全参与选择时会高估约 0.04 到 0.09。

 · 更新于 2026-09-25 · 约 19 分钟 · 9339 字 阅读 →
论文解读

去掉提示词文本:用合成同说话人提示做微调的跨语言克隆

针对推理时拿不到参考音频文本的跨语言克隆问题,该文用预训练 F5-TTS 合成同说话人提示做监督微调并配合静音鲁棒语速预测器,在 LibriSpeech-PC 上 WER 为 2.014% 且相似度提升,代价是自然度小幅下降。

 · 更新于 2026-09-25 · 约 21 分钟 · 10077 字 阅读 →
论文解读

语音大模型越靠近语言端病理线索为何越弱:编码器解码器与生成的分层核对

该工作在西班牙语德语捷克语帕金森语音上对比语音大模型的编码器表示解码器表示与零样本生成,报告编码器优于解码器而生成接近随机,并用样本自适应层聚合代替单层搜索,但跨语言绝对性能仍明显低于多语言混合训练。

 · 更新于 2026-09-25 · 约 19 分钟 · 9051 字 阅读 →
论文解读

去掉语言方向:用残差做未见语言的音频伪造检测

针对训练中完全没有目标语言的跨语言伪造检测,该文用源语言真话拟合从连续语种表征到语音表征的岭映射并取残差,在六语六骨干上报告平均 9–17% 相对收益,远距离迁移收益更大,但近距离个别组合出现反例。

 · 更新于 2026-09-25 · 约 18 分钟 · 8787 字 阅读 →
论文解读

冻住源语言适配器再叠一层:跨语言低资源适配为何选择串行堆叠

针对 Whisper 不支持的三种低资源语言,研究比较暖初始化、注意力融合与顺序适配器堆叠三种源适配器复用方式,最强证据是最近源上的顺序堆叠在全量数据上相对全量微调降低词错误率 5-8%,在一小时数据上降低 12-26%,代价是需先在约 120 小时源语言数据上训练并冻结源适配器。

 · 更新于 2026-09-25 · 约 18 分钟 · 8808 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 360 分钟 · 180081 字 阅读 →
论文解读

只有 1.5 小时录音时先冻住耳朵再改手写:Amchi Konkani 的迁移加词典修正

针对无正式书写系统的 Amchi Konkani 口语转写问题,论文用冻结编码器的 Marathi IndicConformer 只微调 CTC 解码层并叠加约 5000 词众包词典与约 80 条正则后处理,把词错误率从 35.1% 降到 21.3%,代价是仅在小规模故事集上验证且依赖人工维护的词典与规则。

 · 更新于 2026-09-25 · 约 20 分钟 · 9729 字 阅读 →
论文解读

自闭症儿童语音线索跨语言能通用吗:芬兰语、法语和斯洛伐克语的对照分类

该研究用可解释的韵律声学特征加树模型做说话人级自闭症与典型发育分类,芬兰语内准确率 0.84 而跨语迁移差异大,说明基频分布部分通用但谱特征依赖语言且录音条件不齐。

 · 更新于 2026-09-25 · 约 18 分钟 · 8536 字 阅读 →
论文解读

三语者法语节奏为何只在辅音间隔上偏离:六个指标的顺向与逆向迁移

该研究用朗读任务和六个节奏指标检验中英法三语者法语节奏,发现三语者法语元音指标与母语者无差异而辅音间隔指标受英语顺向干扰,同时母语汉语节奏出现系统性逆向重组,但样本小且仅限朗读短句。

 · 更新于 2026-09-25 · 约 19 分钟 · 9120 字 阅读 →
论文解读

母语方言里音高的分量不同,听第二语言重音的方式也会不同吗

该研究用西班牙语三音节词的基频、时长和强度重合成对照做 AX 辨别,检验庆尚与首尔韩语听者对音高线索的权重差异,最强证据是 PP>P 条件下含 F0 与不含 F0 操作诱发不同判断的差值在庆尚组更大,而 P>O 条件下无组间差异,代价是样本小且结论只限特定重音移动与任务。

 · 更新于 2026-09-25 · 约 23 分钟 · 11523 字 阅读 →
论文解读

强烈负情绪下高度熟练者也会漏出母语韵律:以音高范围为核心的证据

该研究让 19 名高熟练牙买加英语、卡斯蒂利亚西班牙语和南部标准英国英语说话人在中性、积极、消极条件下用英语做自发与半自发表达,测量语调短语时长、停顿时长、语速、发音速率和音高范围,发现只有消极高强度情绪带来可重复的组间交互且以音高范围变窄最突出,而发音速率不受情绪影响。

 · 更新于 2026-09-25 · 约 18 分钟 · 8865 字 阅读 →
论文解读

换一句语言就换一个人吗:法英双语对自动说话人识别相似度分数的系统性压低

该研究用 383 名法英双语人的朗读句和 VOCALISE 系统比较单语与双语条件下的似然比分数,发现双语比较显著压低相似度并削弱同一说话人优势,使同人跨语言分数向异人分数靠拢。

 · 更新于 2026-09-25 · 约 20 分钟 · 9630 字 阅读 →
论文解读

同一个 53 调形,为何低水平粤语者把普通话一声听宽了

论文用普通话 55 到 51 连续体上的辨认与区分任务检验粤语母语音系规则对跨语言声调感知的影响,最强证据是低普通话水平组边界左移变宽而高水平组接近北京对照组,代价是该结论依赖特定连续体与三组被试条件且未验证生产与泛化。

 · 更新于 2026-09-25 · 约 20 分钟 · 9965 字 阅读 →
论文解读

声调相似不等于线索相同:法语者辨北方越南语声调的基线与跨语言训练为何只快不准

本研究以五十名无法语外声调经验的法国人辨别四个北方越南语声调对为问题,用泰语、普通话、粤语相似对和法语对照做短时低变异训练,发现总体正确率和速度提升但组间无差异且难度顺序不变,代价是未能实现针对发声态线索的再加权。

 · 更新于 2026-09-25 · 约 18 分钟 · 8526 字 阅读 →