转录文本里的停顿与问答为何比语义向量更能分开自闭症与发育迟缓
该研究在 48 名 3 至 6 岁儿童的 Eigsti 自由游戏转录上用随机森林做自闭症、典型发育与发育迟缓三分类,通过语义嵌入加转录标注的韵律交互特征加认知年龄特征达到交叉验证 99.5% 正确率,但样本小且依赖人工转录标注与认知测验是主要代价与限制。
该研究在 48 名 3 至 6 岁儿童的 Eigsti 自由游戏转录上用随机森林做自闭症、典型发育与发育迟缓三分类,通过语义嵌入加转录标注的韵律交互特征加认知年龄特征达到交叉验证 99.5% 正确率,但样本小且依赖人工转录标注与认知测验是主要代价与限制。
该研究用词与句子配对的同异判别任务与可解释分类器检验原型语音空间在语言层级间的稳定性,最强证据是句内准确率高于词内而跨层级泛化不对称下降,代价是均值线索在长语音中可靠性下降而对语速与变异性线索依赖上升。
该研究用说话人嵌入加回归器做年龄估计,再用成对听辨实验对照人类表现,显示系统误差能预测人耳难易,且双方共享基频等声学线索而人耳额外依赖语速节奏,但数据不均衡与噪声限制了结论外推。
论文把词入侵测试搬到说话人表示上,用 Top-K 稀疏自编码器从 ECAPA-TDNN 嵌入中抽出 500 维稀疏维度,再靠 22 人听辨找侵入者,结果显示只有噪声、口音和语言等少数维度可被人感知,而低典型性并不保证可解释,一致性余弦分数则与判对显著相关。
该研究以贝多芬第七与柴可夫斯基第五的 55 加 71 个演奏版本为对象,用声学特征加 VGGish 嵌入与五种元数据分组加戴维斯博尔丁指数检验相似性来源,最强证据是指挥主导速度响度而乐团在特定乐章主导音色,代价是录音环境未统一与因果解释仍需专家验证。
该研究用 11 个声学参数加随机森林区分女性双侧声带小结与健康嗓音,最强证据是声调 3 模型准确率 0.836 与 AUC 0.902,代价是仅覆盖女性北方官话单字朗读且未验证连续语流与男性泛化。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
论文用线性与非线性探针检验 Mimi 编码器输出与各码本是否保留八种英语核语调的区别,最强证据是 hhh 与 lll 等二分类可达约 90% 准确率,而五类聚类最高约 0.45 且远不及人类,代价是语调信息分散在多个码本且对重音不如对边界调敏感。
该研究用同一 TCN 分割模型对比绝对特征与帧间差分、保留或去掉重叠前单人语音、打乱帧顺序三类扰动,显示 WavLM 在 DIHARD III 上达 0,680 F1-score 而 MFCC 仅 0,424,且打乱时序会系统性推高重叠类概率,代价是扰动结论依赖小样本长重叠段与伪概率曲线。
该研究把语种识别改写为二值语音属性上的独立伯努利似然,用二值自编码器加按频率估计的激活概率做闭集判分,在 FLEURS 上以 mms-lid-126 嵌入达到与 PLDA 相当的精度,同时保留按属性回看判分依据的能力,代价是在 ECAPA-TDNN 与未见语种上出现更明显的性能下降。
论文把 TiCodec 的时间不变分支放在编码器不同深度和不同片段采样下逐项对照,发现第 2 层保波形细节、第 3 层保感知与说话人,再用双分支 Dual-TIRE 组合两者,代价是解码结构与训练约束更复杂且跨域增益并不覆盖全部指标。
论文针对基于冻结自监督模型的音频伪造检测器提出无说话人依赖的线性卷积攻击 Malasimplex,在 YourTTS 与 XTTS 两组高质量伪造上把等错误率推高 2 到 7 倍,并在更换骨干时仍保持黑盒迁移,同时以频响曲线解释攻击在哪些频带掩盖伪造痕迹。
针对音频多模态大模型自由描述中每个词缺乏时频依据的问题,STAG 用词条件内部激活做时间定位、用频带遮挡做频谱定位再做可分融合,在四个时序标注基准上取得最佳事件定位,并在反事实删除中以目标置信下降和事件消失支持其忠实性,代价是可分假设与缺少频率真值。
该研究用图片描述语音的声学流畅性与文本流畅性双路特征加注意力多示例学习,在 742 人 SONIVA 语料上不依赖影像预测中风状态、偏侧、体积三分级和 12 个半球脑叶受累,并报告左半球偏文本、右半球偏声学的特征依赖梯度与定位性能差距。
针对埋地供水管道分布式声传感数据的多标签识别与时空定位问题,论文用事件级标签加像素级掩膜联合训练并在推理时用类激活图输出热力图,在保持多标签分类的同时把定位从零提升到可用水平,代价是需要人工矩形掩膜标注且只在单一工况 testbed 上验证。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
论文用带精确起止时间的合成复调音频检验片段级分类器的事后积分梯度时间定位能力,最强证据是积分梯度达到平均交并比 0.39 与帧级 F1 值 0.52,接近弱监督帧级模型,但峰值定位一致性代价明显。
论文把多种自监督音频、视觉和音画特征冻结后只训练线性分类头,在科学数据集与野外数据上比较检测、异常检测、可解释定位与互补融合,发现含音频信息的表示泛化最好但野外数据仍困难,且随机特征也能靠捷径得高分。