论文解读

粗粒度保语义、细粒度保波形:DualSpecSE 为何要双路同时增强 Mel 与复谱

针对单做 Mel 需外接声码器而失真、单做复谱难学且伤识别的问题,DualSpecSE 用 Mel 分支保可识别成分、复谱分支保波形细节并以交互与融合连接,在 DNS2020 上 WB-PESQ 达 3.25、CHiME-4 波形输出 WER 降至 14.76%/13.21%,代价是双分支与多损失联合训练的复杂度。

 · 更新于 2026-09-24 · 约 18 分钟 · 8732 字 阅读 →
论文解读

把大语言模型接到 Whisper 上,为什么朗读提升了、管制通话却没有?

该研究用不改 Whisper 结构的二次重排与浅融合接入 Mistral 7B,在 Common Voice 朗读上把词错误率从 15,28% 降到 14,18% 与 14,68%,而在 ATCO2 管制通话上最好只与 18,78% 基线统计等价,代价是权重过大时性能明显退化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8711 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

继承来的跟踪头:音频模型借用文本主干的位置机制选说话人

论文报告六说话人描述任务基线低于随机猜测,用 100 个头的注意力对数偏置把输出转向目标到 90% 以上,而纯文本任务选出的头可原样迁移,但饱和强度下增益多来自提示与汇点且随机对照本身波动极大。

 · 更新于 2026-09-24 · 约 22 分钟 · 10813 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

韵律特征省而可释,MFCCs 繁而自动:癌症相关认知损伤语音筛查的对照试点

该试点以 9 名乳腺癌幸存者和 13 名健康对照的叙事语音比较韵律特征与 MFCCs,用逻辑模型树加十折交叉验证报告 86% 对 82% 的准确率,代价是 MFCCs 需 11 个系数且临床可解释性不足。

 · 更新于 2026-09-24 · 约 18 分钟 · 8655 字 阅读 →
论文解读

跨采集条件仍能判准吗:用迭代对抗自训练把源域边界搬向目标域

针对单数据集训练的语音阿尔茨海默检测在换录音与采集条件后大幅掉点的问题,论文用三种表示能力的模型对比无监督域适应,并提出交替做对抗对齐与高置信伪标签自训练的 IAST,在 Lu 目标域上取得最强或并列最强跨域准确率,但源域精度有时轻微下降。

 · 更新于 2026-09-24 · 约 19 分钟 · 9191 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

边说边想:StepAudio 3 Realtime 如何协调听、说、想与做

StepAudio 3 Realtime 针对实时语音交互中深度推理与低延迟的矛盾,用听-说-想-做循环组织感知、双工话轮管理、边说边想与异步工具调用,在 MMSU 90.6、全双工 98.9 等报告结果上保持领先,但多轮约束保持与零售工具任务仍有明显短板。

 · 更新于 2026-09-24 · 约 24 分钟 · 11962 字 阅读 →
论文解读

在识别与切分之间加状态:用有序子音素与最优传输恢复帧级证据

针对发音评估既要认准音素又要定准边界的问题,该工作把每个音素展开为有序子音素状态并用最优时间传输做稠密单调训练,在朗读、自发与二语语音上改善切分并保持可比识别,主代价是更细帧率与更长拓扑会推高识别错误并需要权衡诊断增益。

 · 更新于 2026-09-24 · 约 23 分钟 · 11333 字 阅读 →
论文解读

比较分最难,口音比说话人难:VoiceMOS 2026 三赛道技术解读

VoiceMOS 2026 把语音评估拆成增强语音的绝对分与比较分、情感合成的自然度与情绪匹配、编解码合成的说话人与口音相似度 3 类任务,用 18 支队伍的提交显示多数队伍超过基线,而比较分与口音相似度仍最难,优胜系统普遍用预训练特征加听众建模加集成换取排序一致性。

 · 更新于 2026-09-24 · 约 18 分钟 · 8939 字 阅读 →
论文解读

疑问句里的重音为何变了形:人类会换声调策略,合成语音却只用陈述句一套

论文比较北美英语人类与 Parler-TTS 在陈述句和极性问句中实现对比性焦点的声学线索,发现人类按句型反转 F0 策略而合成语音跨句型高度一致,且在语速与强度上整体偏离人类,最强证据来自贝叶斯逻辑回归的 95% 可信区间方向差异,代价是强度在人类数据中受录音变异掩盖而未能复现经典效应。

 · 更新于 2026-09-24 · 约 20 分钟 · 9663 字 阅读 →
论文解读

法语浊唇阻塞音是变懒了还是正在音变:从/b/与/v/的近音化看弱化起点

该研究用 20 人会话语料手工标注 6961 个/b/和 10844 个/v/并做持阻段声学比较,发现元音间/b/约 21% 实现为近音、全位置/v/约 38% 为近音且词内位置弱化率最高,个体层面两音弱化率正相关 r=0.7,但词频效应仅在女性中显著,支持处于规约化减弱而非已完成音位重组阶段。

 · 更新于 2026-09-24 · 约 21 分钟 · 10217 字 阅读 →
论文解读

先消掉空气声、再用滤波器重放:可独立控制堵塞增益与插入损失的耳罩装置

针对自己声音堵塞效应个体差异大、难以重复呈现的问题,该工作用大耳罩物理去除空气传导再经实时滤波重放,并在人工头上验证了对多档堵塞增益与插入损失组合的独立仿真能力,代价是低频仍有残余上限与约 6.5 ms 系统延迟。

 · 更新于 2026-09-24 · 约 19 分钟 · 9394 字 阅读 →
论文解读

焦点抬高了整词,重音却只剩半边:雅美语焦点与重音的首次分离检验

该研究用三音节形容词、名词、动词在对比焦点、窄焦点及两种焦点后条件下的对照发音实验,显示焦点使第二、三音节元音的基频、时长和能量一致抬高,而所谓词末重音与倒数第二重音的音节间差异并不稳定,仅频谱倾斜等个别指标支持重音解释。

 · 更新于 2026-09-24 · 约 20 分钟 · 9595 字 阅读 →
论文解读

高音不在重音上时:阿美语疑问词与祈使句的声调重联分析

该研究以陈述句的词末重音为基线,比较撒奇莱雅与法兰澳阿美语的疑问词首与祈使句动后小品的高音位置,提出高音重联而非重音移位的统一解释,代价是仅依赖八位发音人的声学描写而未做统计检验与感知验证。

 · 更新于 2026-09-24 · 约 20 分钟 · 9608 字 阅读 →
论文解读

先压住佩戴者自己的声音,再找对话对象:CHiME-9 ECHI 三阶段提取解读

针对可穿戴多通道录音中佩戴者自干扰过强与注册音频失配问题,论文用佩戴者抑制加目标提取加后处理三阶段流水线,在开发集上多数客观指标超过官方基线,在测试集上以可懂度下降为代价换取目标语音质量与总体质量提升。

 · 更新于 2026-09-24 · 约 19 分钟 · 9229 字 阅读 →
论文解读

词干首音节更用力吗:科姆语位置重音的时长与共振峰证据

本研究以半自发科姆语语料检验词干首位置是否伴随超发音式的元音分化,发现三个共有元音在重音位置共振峰更分散且时长略长,但声调未建模与词界混淆仍是主要代价与限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9033 字 阅读 →
论文解读

遗产俄语疑问语调守住了区别,变的是常用型的使用频率

该研究用话语补全任务比较 77 名西班牙加泰地区俄语遗产儿童与单语俄语和加泰西语双语对照组在特殊疑问句核配置上的分布,发现遗产儿童以 72% 的目标俄语型保持与社会语言的区别,但默认升降型显著少用并出现句末附加重音的非目标型。

 · 更新于 2026-09-24 · 约 18 分钟 · 9016 字 阅读 →
论文解读

听觉反馈不一致时口腔如何调整:辅音语境与掩蔽噪声共同塑造元音适应

该研究用实时共振峰扰动范式检验目标元音/E/在/p/、/b/、/m/语境和高低掩蔽噪声下的听觉运动适应,发现被试总体发生补偿性适应但高噪声下/p/适应最大而低噪声下辅音效应消失且邻近元音出现整体扩张,代价是内部传导与外部扰动的不一致无法被完全掩蔽且低噪声下扰动失败率更高。

 · 更新于 2026-09-24 · 约 19 分钟 · 9088 字 阅读 →