粗粒度保语义、细粒度保波形:DualSpecSE 为何要双路同时增强 Mel 与复谱
针对单做 Mel 需外接声码器而失真、单做复谱难学且伤识别的问题,DualSpecSE 用 Mel 分支保可识别成分、复谱分支保波形细节并以交互与融合连接,在 DNS2020 上 WB-PESQ 达 3.25、CHiME-4 波形输出 WER 降至 14.76%/13.21%,代价是双分支与多损失联合训练的复杂度。
针对单做 Mel 需外接声码器而失真、单做复谱难学且伤识别的问题,DualSpecSE 用 Mel 分支保可识别成分、复谱分支保波形细节并以交互与融合连接,在 DNS2020 上 WB-PESQ 达 3.25、CHiME-4 波形输出 WER 降至 14.76%/13.21%,代价是双分支与多损失联合训练的复杂度。
该研究用不改 Whisper 结构的二次重排与浅融合接入 Mistral 7B,在 Common Voice 朗读上把词错误率从 15,28% 降到 14,18% 与 14,68%,而在 ATCO2 管制通话上最好只与 18,78% 基线统计等价,代价是权重过大时性能明显退化。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
论文报告六说话人描述任务基线低于随机猜测,用 100 个头的注意力对数偏置把输出转向目标到 90% 以上,而纯文本任务选出的头可原样迁移,但饱和强度下增益多来自提示与汇点且随机对照本身波动极大。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
该试点以 9 名乳腺癌幸存者和 13 名健康对照的叙事语音比较韵律特征与 MFCCs,用逻辑模型树加十折交叉验证报告 86% 对 82% 的准确率,代价是 MFCCs 需 11 个系数且临床可解释性不足。
针对单数据集训练的语音阿尔茨海默检测在换录音与采集条件后大幅掉点的问题,论文用三种表示能力的模型对比无监督域适应,并提出交替做对抗对齐与高置信伪标签自训练的 IAST,在 Lu 目标域上取得最强或并列最强跨域准确率,但源域精度有时轻微下降。
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
StepAudio 3 Realtime 针对实时语音交互中深度推理与低延迟的矛盾,用听-说-想-做循环组织感知、双工话轮管理、边说边想与异步工具调用,在 MMSU 90.6、全双工 98.9 等报告结果上保持领先,但多轮约束保持与零售工具任务仍有明显短板。
针对发音评估既要认准音素又要定准边界的问题,该工作把每个音素展开为有序子音素状态并用最优时间传输做稠密单调训练,在朗读、自发与二语语音上改善切分并保持可比识别,主代价是更细帧率与更长拓扑会推高识别错误并需要权衡诊断增益。
VoiceMOS 2026 把语音评估拆成增强语音的绝对分与比较分、情感合成的自然度与情绪匹配、编解码合成的说话人与口音相似度 3 类任务,用 18 支队伍的提交显示多数队伍超过基线,而比较分与口音相似度仍最难,优胜系统普遍用预训练特征加听众建模加集成换取排序一致性。
论文比较北美英语人类与 Parler-TTS 在陈述句和极性问句中实现对比性焦点的声学线索,发现人类按句型反转 F0 策略而合成语音跨句型高度一致,且在语速与强度上整体偏离人类,最强证据来自贝叶斯逻辑回归的 95% 可信区间方向差异,代价是强度在人类数据中受录音变异掩盖而未能复现经典效应。
该研究用 20 人会话语料手工标注 6961 个/b/和 10844 个/v/并做持阻段声学比较,发现元音间/b/约 21% 实现为近音、全位置/v/约 38% 为近音且词内位置弱化率最高,个体层面两音弱化率正相关 r=0.7,但词频效应仅在女性中显著,支持处于规约化减弱而非已完成音位重组阶段。
针对自己声音堵塞效应个体差异大、难以重复呈现的问题,该工作用大耳罩物理去除空气传导再经实时滤波重放,并在人工头上验证了对多档堵塞增益与插入损失组合的独立仿真能力,代价是低频仍有残余上限与约 6.5 ms 系统延迟。
该研究用三音节形容词、名词、动词在对比焦点、窄焦点及两种焦点后条件下的对照发音实验,显示焦点使第二、三音节元音的基频、时长和能量一致抬高,而所谓词末重音与倒数第二重音的音节间差异并不稳定,仅频谱倾斜等个别指标支持重音解释。
该研究以陈述句的词末重音为基线,比较撒奇莱雅与法兰澳阿美语的疑问词首与祈使句动后小品的高音位置,提出高音重联而非重音移位的统一解释,代价是仅依赖八位发音人的声学描写而未做统计检验与感知验证。
针对可穿戴多通道录音中佩戴者自干扰过强与注册音频失配问题,论文用佩戴者抑制加目标提取加后处理三阶段流水线,在开发集上多数客观指标超过官方基线,在测试集上以可懂度下降为代价换取目标语音质量与总体质量提升。
本研究以半自发科姆语语料检验词干首位置是否伴随超发音式的元音分化,发现三个共有元音在重音位置共振峰更分散且时长略长,但声调未建模与词界混淆仍是主要代价与限制。
该研究用话语补全任务比较 77 名西班牙加泰地区俄语遗产儿童与单语俄语和加泰西语双语对照组在特殊疑问句核配置上的分布,发现遗产儿童以 72% 的目标俄语型保持与社会语言的区别,但默认升降型显著少用并出现句末附加重音的非目标型。
该研究用实时共振峰扰动范式检验目标元音/E/在/p/、/b/、/m/语境和高低掩蔽噪声下的听觉运动适应,发现被试总体发生补偿性适应但高噪声下/p/适应最大而低噪声下辅音效应消失且邻近元音出现整体扩张,代价是内部传导与外部扰动的不一致无法被完全掩蔽且低噪声下扰动失败率更高。