不用重训练也能拧动音高与时值:残差流线性方向与正交解耦
论文在预训练多轨音乐 Transformer 上用均值差提取音高与时值方向并以系数加偏做推理期操控,以无条件与强条件延续实验验证线性可控性,并用格拉姆施密特正交缓解双属性纠缠,但大强度与极端下行仍带来质量退化。
论文在预训练多轨音乐 Transformer 上用均值差提取音高与时值方向并以系数加偏做推理期操控,以无条件与强条件延续实验验证线性可控性,并用格拉姆施密特正交缓解双属性纠缠,但大强度与极端下行仍带来质量退化。
该文针对独立向量抽取中源先验不准与二阶算法需要快速求导的问题,用许瓦里宁分数匹配训练正弦多层源非线性,并在仿真与目标说话人抽取中报告了对传统模型的系统性提升与对微调噪声指示器的累积增益。
针对唇读受视觉歧义和说话人差异影响且输出可靠性难判断的问题,论文引入贝叶斯不确定性和熵不确定性及其组合来估计词错误率并做主动学习选难样本微调,在 VoxLRS-SA 及合成池上显示不确定性与词错误率强相关且高不确定性微调在同等标注量下达到或超过随机采样,但估计需少量有标数据拟合映射且小数据微调本身不稳定。
该研究把 1 秒多通道语音转为时延轨迹、双耳相位与低频气流三组可解释特征再用 XGBoost 判真伪,在 D3 六通道上报告等错误率 17.8%,代价是仍需多通道阵列且在空旷与车载等未见环境下误差明显上升。
Murzinograph 用三维确定性卷积自编码器把频谱图窗口序列压成三维加时间的轮廓轨迹,以牺牲精细重建为代价换取人可读的可视化,并在音乐、鸟鸣、鲸歌与约 2 小时的山谷田野录音上展示跨材料的一致性与社区解读价值。
该研究把同一段语音拆成前景/背景、谐波/打击、低频段与房间脉冲响应分别训练检测器,报告在 ASVspoof 2019 训练下低频 0-4 kHz 与去混响 MFCC 能改善跨域 EER,但以 ITW 上 24% 仍远非可用为代价。
针对发动机爆燃脉冲的时序本质,论文用可微脉冲串加卡普拉斯-斯特朗共振器重建声音,在三类发动机共 7.5 小时音频上把总验证损失平均降低 5.7%、谐波重建提升 21%,代价是共振器音色偶尔偏离目标且尚未在真实录音上验证。
该文冻结 LAION-CLAP 音频编码器,用线性、两层 MLP 和核岭回归三种探针在五类数据上回归 RT60、LUFS、频谱质心与相对音高,最强证据是非线性探针在全部属性上可靠恢复,而线性探针仅对 RT60、LUFS 和相对音高有效,代价是频谱质心需要非线性流形且相对音高方向高度依赖领域。
该文在 ESC-50 的 5 任务类增量设置下用 Integrated Gradients 跟踪任务级解释漂移,报告含回放的混合方法同时获得最高平均准确率 0.4400 与最低遗忘 0.3896 并压低解释漂移,而正则化方法遗忘高且漂移大。
TriDF 针对以人为中心的伪造提出可解释检测基准,用细粒度伪影感知、真假判定与解释幻觉三维评估多模态大模型,报告显示语义伪影最难且幻觉会切断感知到判定的链路。
针对二语流利度评估中声学加文本的朴素双模态融合在转写含噪时会低于纯声学基线的问题,论文用声学自监督嵌入加 BERT 文本加六维心理语言学标记的三模态投影加 BiLSTM 融合恢复并超过基线,在 Speechocean762 上达到 82.60% F1、在 Avalinguo 上达到 95.84% F1,代价是依赖转写与三编码器拼接带来的额外计算量。
论文以 M2D 自监督 ViT 为对象,用音频激活概率熵找出类特异神经元,报告其在未见任务上接近全类别覆盖与跨任务共享,并以不足 1% 神经元的失活验证其对分类的功能影响与局限。
论文以 96 个语言的类比成功率与声码器重合成声学测量为证据,说明自监督语音模型以线性方向编码音系特征并以向量尺度连续控制实现程度,但合成效果仍受声码器与上下文切分条件限制。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该工作把受限对角复数状态空间等价为并联二阶全极点模态滤波器组,并在 DAFx 板式混响基准上用矩阵铅笔引导的特征值初始化拟合脉冲响应,报告显示合成误差与频率和衰减辨识优于常用初始化,但增益匹配仍存在离群与正则化代价。
该研究以语音情绪识别为探针比较四种神经元选择器,用失活与放大的自对交叉对照验证情绪敏感神经元的存在,其中均值偏离与对比间隔选择器显示约 11–15 个准确率点的自效应而交叉影响接近零,但标签无关的联合放大效果不稳定且存在跨数据集部分迁移的代价与边界。
该文把说话人身份当作一阶模式,把表征聚类当作刻画网络认法 的二阶模式,用单链接聚类发现、用语义匹配解释、用基于梯度代价外推的新方法判定未见语音归属,报告显示路径完整度从百分之十一点六八升至百分之三十四点一九,原子语义召回从零点五一一九升至零点五六六九,但国籍召回仍明显偏低。
该文用 14 维说话人一致构音特征比较 VCTK 苏格兰、英格兰、爱尔兰口音,以 DTW 对齐达到 99% 分类准确并以最优传输扩展到非平行语料,但 OT 需要约 7.5 分钟语音和上百聚类点才稳定。
该文把 256 维说话人嵌入重编码到 500 维,用矩阵级稀疏、向量级稀疏与正交三种自编码器在同一说话人验证协议下比较,报告中等至高稀疏可在保持可比等错率的同时带来去相关与典型性改善,而互信息结合解耦熵式的指标更能跟踪这种改善,但高稀疏的零方差维度与概念选择敏感构成主要代价。