论文解读

英语向二十八语的反向补位:CVSS-X 以合成并行语音扩大翻译方向

CVSS-X 把同一批英语真人录音经机器翻译转写为二十八种目标语言文本再用多语合成配音,构造每语言约二十四万对的英到多语并行语音,同管线复测显示其合成可懂度可用但自然度低于只合成英语的 CVSS,代价是受制于翻译质量与众包录音瑕疵。

 · 更新于 2026-09-25 · 约 17 分钟 · 8477 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 360 分钟 · 180081 字 阅读 →
论文解读

只留韵律还能分出印地语和印度英语吗:边界线索的听辨与声学对照

该研究用去词汇化朗读检验双语听者仅凭韵律区分印地语和印度英语的能力,再对同一批话语的感知边界做基频、强度、时长和停顿的词级声学分析,最强证据是总体语言识别准确率为 63.5% 且印地语边界分类更依赖相对强度而英语更依赖时长,代价是朗读体、单一切分与小样本朗读者限制了推广。

 · 更新于 2026-09-25 · 约 29 分钟 · 14430 字 阅读 →
论文解读

自闭症儿童韵律不是单一偏离:跨芬兰语、法语、斯洛伐克语的音质与强度证据

该研究以芬兰语、法语、斯洛伐克语共 8212 个停顿间语段的 88 维 eGeMAPS 特征经主成分分析降维后用线性混合效应模型检验组别差异,最强跨语言证据是自闭症组整体强度变异更大、嗓音更清晰少气息、动态强度斜率与中心基频更低,代价是数据高度不平衡且法语单语建模无显著结果。

 · 更新于 2026-09-25 · 约 20 分钟 · 9568 字 阅读 →
论文解读

多语多设备之下帕金森构音障碍检测为何跨库就失效:冻结声学模型加多库训练的取舍

该研究以二分类检测特发性帕金森病的运动性言语障碍为问题,用冻结的 Wav2Vec 2.0 XLS-R 加 128 维多层注意力分类头做跨库评估,最强证据是三库联合训练在未见过的 MDVR-KCL 上达到 85.3% AUC 并避免单库模型的跨库崩塌,代价是对低 UPDRS 评分和 OFF-DOPA 条件的患者仍明显更难检出且结果受随机划分影响大。

 · 更新于 2026-09-25 · 约 19 分钟 · 9479 字 阅读 →
论文解读

把打断与背景声做成可听的监督:DuplexDrama 四阶段合成管线解读

DuplexDrama 针对全双工对话训练数据稀缺问题,用四阶段管线同时合成人设场景、三种全双工行为、表情语音与剧本对齐的声音事件,最强证据是相同语音加背景仅带来 UTMOSv2 与 NISQA 的可控下降,主要代价是全双工轮次占比仅 3.8% 且剧本合理性依赖 LLM 判断。

 · 更新于 2026-09-25 · 约 16 分钟 · 7540 字 阅读 →
论文解读

四到七岁听出喜怒哀惧:语言复杂度、目标情绪与双语经验如何分工

该研究用 40 个法语西班牙语非言语声音做四选一情绪识别,报告年龄越大识别越准、喜悦悲伤优于恐惧、非言语声优于句子、五岁双语儿童优于单语,但样本小且组间不均衡使语言效应只能算探索性发现。

 · 更新于 2026-09-25 · 约 21 分钟 · 10083 字 阅读 →
论文解读

预训练语言越多越好吗:语音基础模型做音频伪造检测的对照解读

该研究把单语和多语语音基础模型放在同一微调与分类流程下比较伪造检测,报告显示多语模型在域内和野外数据上更稳健,但超大规模参数并未带来系统性增益且单语模型在未知压缩与信道下退化明显。

 · 更新于 2026-09-25 · 约 17 分钟 · 8445 字 阅读 →
论文解读

不切音节、不标声调:用一整段 F0 变化分布刻画一门语言

该文把每门语言大量 F0 帧间差值 dF0 做成整体概率分布,用 Wasserstein 距离和最优传输比较 20 门语言,并在教学示例层面把经验分布解释为 Boltzmann 型动力系统,但未分解各峰的功能来源。

 · 更新于 2026-09-25 · 约 20 分钟 · 9586 字 阅读 →
论文解读

用同一套国际音标序列做语种识别:可解释的音位组合为何仍摆脱不了语言偏置

该研究把多语言音素识别器输出的国际音标序列接上单语种 n 元音位组合模型做闭集语种识别,在 FLEURS 上达到与近期声学系统可比的准确率,但音素识别错误率和解码对照显示该序列并非真正与语言无关。

 · 更新于 2026-09-25 · 约 21 分钟 · 10073 字 阅读 →
论文解读

语码切换遇上对比性焦点:基频是相互靠近还是切回后更夸张

该研究用英语为矩阵语、粤语为嵌入语的对比性焦点产出实验检验韵律层面的混合与超清晰化,报告切换词居中而切回后英语词出现类声调转折与更极端高低目标的主要证据与代价。

 · 更新于 2026-09-25 · 约 21 分钟 · 10173 字 阅读 →
论文解读

低码率单层量化加双路源语音条件:Kraken 如何让大模型直接说译文

针对大模型预测高码率语音 token 难、表达性数据难对齐的问题,Kraken 用 25 Hz 单层 VQ 低码率 token 加 LLM 与声码器双路源语音条件,在 150k 小时多任务数据上实现可复述的端到端语音到语音翻译,并在 FLEURS 与 CVSS 上保留说话人与韵律,代价是音频质量指标弱于用理想参考音色的大模型。

 · 更新于 2026-09-25 · 约 19 分钟 · 9381 字 阅读 →
论文解读

少资源语言先补数据质量:LELD 用混合转写把捷克语等三语 ASR 做上去

针对捷克语、爱沙尼亚语和希腊语自动语音识别性能落后问题,论文用统一预处理加三阶段混合转写构建每语 1500 小时转写语料,以独立 5 小时测试集上标准化词错误率降至 3.38%-5.54% 为证据,代价是高度依赖母语者校验与语言归一化且未公开可下载资源。

 · 更新于 2026-09-25 · 约 17 分钟 · 8083 字 阅读 →
论文解读

不用切分音节也能认词:连续韵律线索如何逐帧改写词竞争

论文用词即连续声学轨迹加听者线索权重的最小前馈模型复现英语首音队列、普通话声调分叉和意大利语重音延迟分化三类时程,代价是小词表演示且权重手工设定而非拟合人眼数据。

 · 更新于 2026-09-25 · 约 22 分钟 · 10791 字 阅读 →
论文解读

把一个辅音静音后单词还认得出来吗:用声学掩蔽给辅音贡献排序

该文用逐个辅音静音加孤立词识别的方法定义掩蔽致误识率来给辅音排序,最强证据是控制另一变量后频率与误识率负相关而功能负载正相关,代价是静音为上限式探针且只覆盖单个辅音与自动识别代理。

 · 更新于 2026-09-25 · 约 18 分钟 · 8763 字 阅读 →
论文解读

濒危遗产语还分得清三种问句吗:保加利亚犹太西班牙语的问句语调

以半自发话语补全任务比较 18 名保加利亚犹太西班牙语与保加利亚语双语者及 18 名单语者,报告是非问句多以高边界结尾、特指问句多低降、选择问句前升后降的分布,并显示双语者的保加利亚语更接近单语者但仍有 heritage 影响。

 · 更新于 2026-09-25 · 约 19 分钟 · 9501 字 阅读 →
论文解读

语言识别可解释了但判分还能用吗:BA-Lang 把嵌入变成可数属性

该研究把语种识别改写为二值语音属性上的独立伯努利似然,用二值自编码器加按频率估计的激活概率做闭集判分,在 FLEURS 上以 mms-lid-126 嵌入达到与 PLDA 相当的精度,同时保留按属性回看判分依据的能力,代价是在 ECAPA-TDNN 与未见语种上出现更明显的性能下降。

 · 更新于 2026-09-25 · 约 21 分钟 · 10511 字 阅读 →
论文解读

时间不变信息放在哪一层抽、用什么片段学:TiCodec 的 TIRE 拆解与 Dual-TIRE

论文把 TiCodec 的时间不变分支放在编码器不同深度和不同片段采样下逐项对照,发现第 2 层保波形细节、第 3 层保感知与说话人,再用双分支 Dual-TIRE 组合两者,代价是解码结构与训练约束更复杂且跨域增益并不覆盖全部指标。

 · 更新于 2026-09-25 · 约 17 分钟 · 8497 字 阅读 →
论文解读

保留高维语音表示,只用一层分类器:KAN 为何比全连接更省且更稳

该工作以 XLS-R 高维表示为输入,对比单层全连接与单层 KAN 后端,在 21LA 上把聚合 EER 从 2.38% 降到 1.07%,代价是后端参数从 2.05k 增至 22.54k 但仍远小于主流系统,且在 FoR 等个别集上 KAN 并未取胜。

 · 更新于 2026-09-25 · 约 18 分钟 · 8844 字 阅读 →