论文解读

只听说话方式不看说了什么:手工声学特征叠加 YAMNet 嵌入检测阿尔茨海默病

该研究只用语音音频区分阿尔茨海默病与健康对照,用 Librosa 手工声学均值特征与冻结 YAMNet 的 1024 维嵌入拼接后训练分类器,在 160 条合并数据上以 70% 训练 30% 测试取得 89% 测试准确率,代价是小样本、无人口学控制且未报告延迟与误判细节。

 · 更新于 2026-09-25 · 约 21 分钟 · 10343 字 阅读 →
论文解读

把音高、能量和语速画在同一条线上:VIP2VIP 的三维韵律可视化管线

针对单看基频会把重音归因给音高的问题,该文选择在平滑后的基频线上同时编码瞬时强度与局部音节速率,并在意大利诗歌朗读上展示联合线索如何区分延续类边界,代价是颜色只表相对快慢且跨录音比较仍需归一化。

 · 更新于 2026-09-25 · 约 22 分钟 · 10629 字 阅读 →
论文解读

无线光学追踪如何把超声、音频和头动收进同一时间轴

该文要解决超声舌成像中音频同步与头动记录分散、布线复杂的问题,选择无线 OptiTrack 六自由度头姿态加触发与时间戳统一采集的轻量方案,直接报告了设备布置与对齐检查流程,但完整的几何运动校正仍留待未来验证。

 · 更新于 2026-09-25 · 约 19 分钟 · 9106 字 阅读 →
论文解读

保住细粒度声学线索再借高层语义:CRAF 的不对称残差融合

针对未见伪造攻击泛化难的问题,CRAF 以 SSL 为主、ALLM 为高层引导做残差感知融合,在 ASVspoof 5 上 Kimi-Audio 配置报告评估 EER 为 5.96% 与 minDCF 为 0.1192,但攻击间差异与门控依赖仍是代价。

 · 更新于 2026-09-25 · 约 21 分钟 · 10497 字 阅读 →
论文解读

粗粒度保语义、细粒度保波形:DualSpecSE 为何要双路同时增强 Mel 与复谱

针对单做 Mel 需外接声码器而失真、单做复谱难学且伤识别的问题,DualSpecSE 用 Mel 分支保可识别成分、复谱分支保波形细节并以交互与融合连接,在 DNS2020 上 WB-PESQ 达 3.25、CHiME-4 波形输出 WER 降至 14.76%/13.21%,代价是双分支与多损失联合训练的复杂度。

 · 更新于 2026-09-25 · 约 18 分钟 · 8732 字 阅读 →
论文解读

把大语言模型接到 Whisper 上,为什么朗读提升了、管制通话却没有?

该研究用不改 Whisper 结构的二次重排与浅融合接入 Mistral 7B,在 Common Voice 朗读上把词错误率从 15,28% 降到 14,18% 与 14,68%,而在 ATCO2 管制通话上最好只与 18,78% 基线统计等价,代价是权重过大时性能明显退化。

 · 更新于 2026-09-25 · 约 18 分钟 · 8711 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 123 分钟 · 61526 字 阅读 →
论文解读

继承来的跟踪头:音频模型借用文本主干的位置机制选说话人

论文报告六说话人描述任务基线低于随机猜测,用 100 个头的注意力对数偏置把输出转向目标到 90% 以上,而纯文本任务选出的头可原样迁移,但饱和强度下增益多来自提示与汇点且随机对照本身波动极大。

 · 更新于 2026-09-25 · 约 22 分钟 · 10813 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 238 分钟 · 118878 字 阅读 →
论文解读

韵律特征省而可释,MFCCs 繁而自动:癌症相关认知损伤语音筛查的对照试点

该试点以 9 名乳腺癌幸存者和 13 名健康对照的叙事语音比较韵律特征与 MFCCs,用逻辑模型树加十折交叉验证报告 86% 对 82% 的准确率,代价是 MFCCs 需 11 个系数且临床可解释性不足。

 · 更新于 2026-09-25 · 约 18 分钟 · 8655 字 阅读 →
论文解读

跨采集条件仍能判准吗:用迭代对抗自训练把源域边界搬向目标域

针对单数据集训练的语音阿尔茨海默检测在换录音与采集条件后大幅掉点的问题,论文用三种表示能力的模型对比无监督域适应,并提出交替做对抗对齐与高置信伪标签自训练的 IAST,在 Lu 目标域上取得最强或并列最强跨域准确率,但源域精度有时轻微下降。

 · 更新于 2026-09-25 · 约 19 分钟 · 9191 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 360 分钟 · 180081 字 阅读 →
论文解读

边说边想:StepAudio 3 Realtime 如何协调听、说、想与做

StepAudio 3 Realtime 针对实时语音交互中深度推理与低延迟的矛盾,用听-说-想-做循环组织感知、双工话轮管理、边说边想与异步工具调用,在 MMSU 90.6、全双工 98.9 等报告结果上保持领先,但多轮约束保持与零售工具任务仍有明显短板。

 · 更新于 2026-09-25 · 约 24 分钟 · 11962 字 阅读 →
论文解读

在识别与切分之间加状态:用有序子音素与最优传输恢复帧级证据

针对发音评估既要认准音素又要定准边界的问题,该工作把每个音素展开为有序子音素状态并用最优时间传输做稠密单调训练,在朗读、自发与二语语音上改善切分并保持可比识别,主代价是更细帧率与更长拓扑会推高识别错误并需要权衡诊断增益。

 · 更新于 2026-09-25 · 约 23 分钟 · 11333 字 阅读 →
论文解读

比较分最难,口音比说话人难:VoiceMOS 2026 三赛道技术解读

VoiceMOS 2026 把语音评估拆成增强语音的绝对分与比较分、情感合成的自然度与情绪匹配、编解码合成的说话人与口音相似度 3 类任务,用 18 支队伍的提交显示多数队伍超过基线,而比较分与口音相似度仍最难,优胜系统普遍用预训练特征加听众建模加集成换取排序一致性。

 · 更新于 2026-09-25 · 约 18 分钟 · 8939 字 阅读 →
论文解读

疑问句里的重音为何变了形:人类会换声调策略,合成语音却只用陈述句一套

论文比较北美英语人类与 Parler-TTS 在陈述句和极性问句中实现对比性焦点的声学线索,发现人类按句型反转 F0 策略而合成语音跨句型高度一致,且在语速与强度上整体偏离人类,最强证据来自贝叶斯逻辑回归的 95% 可信区间方向差异,代价是强度在人类数据中受录音变异掩盖而未能复现经典效应。

 · 更新于 2026-09-25 · 约 20 分钟 · 9663 字 阅读 →
论文解读

法语浊唇阻塞音是变懒了还是正在音变:从/b/与/v/的近音化看弱化起点

该研究用 20 人会话语料手工标注 6961 个/b/和 10844 个/v/并做持阻段声学比较,发现元音间/b/约 21% 实现为近音、全位置/v/约 38% 为近音且词内位置弱化率最高,个体层面两音弱化率正相关 r=0.7,但词频效应仅在女性中显著,支持处于规约化减弱而非已完成音位重组阶段。

 · 更新于 2026-09-25 · 约 21 分钟 · 10217 字 阅读 →
论文解读

先消掉空气声、再用滤波器重放:可独立控制堵塞增益与插入损失的耳罩装置

针对自己声音堵塞效应个体差异大、难以重复呈现的问题,该工作用大耳罩物理去除空气传导再经实时滤波重放,并在人工头上验证了对多档堵塞增益与插入损失组合的独立仿真能力,代价是低频仍有残余上限与约 6.5 ms 系统延迟。

 · 更新于 2026-09-25 · 约 19 分钟 · 9394 字 阅读 →
论文解读

焦点抬高了整词,重音却只剩半边:雅美语焦点与重音的首次分离检验

该研究用三音节形容词、名词、动词在对比焦点、窄焦点及两种焦点后条件下的对照发音实验,显示焦点使第二、三音节元音的基频、时长和能量一致抬高,而所谓词末重音与倒数第二重音的音节间差异并不稳定,仅频谱倾斜等个别指标支持重音解释。

 · 更新于 2026-09-25 · 约 20 分钟 · 9595 字 阅读 →
论文解读

高音不在重音上时:阿美语疑问词与祈使句的声调重联分析

该研究以陈述句的词末重音为基线,比较撒奇莱雅与法兰澳阿美语的疑问词首与祈使句动后小品的高音位置,提出高音重联而非重音移位的统一解释,代价是仅依赖八位发音人的声学描写而未做统计检验与感知验证。

 · 更新于 2026-09-25 · 约 20 分钟 · 9608 字 阅读 →