混合声能写成声源之和吗:冻结音频表示的加性组合诊断
论文用典型相关分析和留一组合重构检验冻结的 Wav2Vec2、HuBERT 和 CLAP 能否把未见声源组合表示成各声源贡献之和,最强证据是 CLAP 在 FSD50K 重复保持组合上同时超过置换与标签重叠基线,但三者都存在不可忽略的重构残差。
论文用典型相关分析和留一组合重构检验冻结的 Wav2Vec2、HuBERT 和 CLAP 能否把未见声源组合表示成各声源贡献之和,最强证据是 CLAP 在 FSD50K 重复保持组合上同时超过置换与标签重叠基线,但三者都存在不可忽略的重构残差。
论文审计六个英语语音技术数据集,发现可测量的酷儿占比仅 0–1.4% 而不足以做稳健差异度量,并以两个酷儿社群语音库为对照,提出规模化与包容、效率与参与、开放与自主、静态类别与流动身份四组张力,且代价是现有众包与开放流程难以覆盖小而易受污名群体。
论文把短到长训练拆成呈现顺序、批次组成与损失归一化三件事来测,在 87M 语音词元模型上发现固定组批后排序本身不降困惑度,首轮分组的增益只出现在按批平均的损失下并随词元均衡归一化而消失,而持续排序反而更差。
论文用 908072 段 AIS 标注录音说明部署间先验差超 200 倍、随机窗口验证比未见站点验证高出配对 0.049 的 ROC-AUC,因而主张按站点分组验证并扩大独立空间采样,空间专家模型仍只是待验证假设。
该文把语料看作语音相似 utterance 图,先用零模型检验其聚类与模块度,再按社区分层加稀有音素播种做时长预算选择,在孟加拉语和英语 20% 预算下均显著降低合成可懂度误差,孟加拉语还以 4.5 倍更少训练时间超过全量训练。
该研究把黑胶损伤检测做成修复导向的 5 类时序路由,用稀疏、突发、密集 3 路专家证据加分层路由器与验证集选定的维特比转移惩罚,在 597 段合成基准上达到 0.730 的 5 类宏 F1,主要增益来自时序解码而非分层本身,且混合类仍最难。
针对自发语音中疾病效应被语言音系差异掩盖的问题,CL-DAF 在英孟 272 维公共声学空间中用符号秩二列效应与语言不变分数筛选出 26 个方向一致特征,使英译孟与孟译英 AUC 分别达到 0.825 和 0.722,而代价是需要双语标签估计对齐且目标全参与选择时会高估约 0.04 到 0.09。
针对多编码器大音频语言模型靠直觉或穷举选编码器的问题,论文提出只用单编码器成绩算类别级与任务级相关性的 CUES 规则,在 XARES-LLM 上 Track A 选出三编码器提升 4.3% 而 Track B 主动只留双编码器提升 6.3%,代价是选择依赖开发集打分且仅在单 135M 骨干上验证。
该研究用先定位中频能量谷再验证释放的闭合计数器替代包络峰计数,在六个语料库 356 名说话人 3560 个合格颤音上得到中位数 2 个闭合、约 36 毫秒间隔,语境效应稳健而性别效应消失,代价是只描述成形良好的浊音周期性颤音且缺乏人工逐点基准。
针对移动物理声源导致镜像源整体平移且部分可见性变化的问题,论文用部分最优传输恢复起点与终点镜像源集合的配对并做位移插值,在统计数据和镜像源仿真数据上均优于线性插值,而源信息代价在简洁性和精度上最实用。
论文用 10 名双语政客各 20 句卢森堡语加 20 句法语共 400 句和 41 个魅力相关声学韵律特征,以混合效应模型分离说话人与语言方差,发现说话人中位解释一半以上方差而语言中位仅占约 0.5%,语言差异集中在法语更高的 shimmer 与句末基频和卢森堡语更强的中频谱能量,但合成魅力指数无语言主效应。
该研究以 10 名卢森堡政治人物各 20 句卢森堡语加 20 句法语共 400 句自发政治话语为对象,用 C/V 分段与成对变异等时长节律指标加配对 t 检验与方差分解,报告显示元音时长与语速主要随语言重组而辅音时序保留说话人特征,且未发现语言与性别交互。
针对肺功能检查依赖设备与配合的问题,SpiroPhonia 用真实访谈中的自发语音提取抖动、频谱与停顿三类特征,在 201 人被试独立测试上报告 78% 准确率、80% F1 与 87% AUC,代价是小样本下置信区间宽且跨语言跨设备泛化待验证。
论文用隐式求解的有限差分弓弦模型复现亥姆霍兹运动并修正最小弓压定律为一次方依赖,再以等容量的门控循环控制器在扰动下领先前馈控制器,但证明其稳态调节不超过查表教师,只在教师失效处反超。
该研究把 1046 个手工段落与 0.5 秒步长的模型估计效价-唤醒轨迹对齐,显示段落差异主要在唤醒度上且高唤醒位置偏向后段,但进入副歌路径多样、重复段落并不回到初始水平,代价是情绪轨迹来自冻结教师模型而非人工连续标注。
针对音频时刻检索中提议级置信度缺少全局竞争的问题,该文用半马尔可夫条件随机场对全部分割归一化并以片段边缘后验排序,在 CASTELLA 上报告 41.15% R1@0.7 和 34.68% mAP,代价是需做前向后向推理与非极大值抑制并保留双分支联合训练。
该研究用同一冻结编码器流程与 1501 事件配额比较四种嗓音库,发现抹香鲸类型积累最快而孟加拉雀局部顺序依赖最强,且加长历史会把比较推向鲸,代价是结论只在原生事件尺度与档案录音条件下成立。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
该研究以 391 首多轨录音为对象,用起音时间差与 Mel 谱相似度推断是否同室录音,报告有串音歌曲的时值波动中位数更低,但串音只是同室的非充分不必要指示且存在混淆。