零样本能认情绪,却认得不公平:Qwen2-Audio 多类别公平性审计
论文在五个语音情绪数据集上零样本评测 Qwen2-Audio 并用多组多类公平指标审计,发现其总体预测分布较均衡但总体准确率平等性差距大,且解码温度超过 0.7 会同时损害准确率与公平性。
论文在五个语音情绪数据集上零样本评测 Qwen2-Audio 并用多组多类公平指标审计,发现其总体预测分布较均衡但总体准确率平等性差距大,且解码温度超过 0.7 会同时损害准确率与公平性。
针对只有正常机声可训练的异常声音检测,该文用两层 MuReNN 加注意力与可训练幂变换提取谱时调制并以 Deep SVDD 把正常样本压向超球面中心,在 MIMII 上平均 AUC 达 90.3%,代价是在 -6 dB 强噪声下落后于带去噪重建的 DeSpaWN。
该研究把管弦乐引子与静息任务态脑电都转成时间序列做复发分析,用层流性、确定性、复发率和缺隙度刻画动力学组织,并提出局部密度相似性做音乐与脑电复发图的跨比较,最强证据是贝多芬引子与健康脑电的平均局部密度相似性下降最大而柴可夫斯基最小,代价是仅两例被试与首 60 秒音乐的探索性小样本。
针对紧凑阵列按用户给定方向图做空间滤波的问题,该工作把采样方向图经 FiLM 调制送入 FT-JNF 并用差分与矩形混合配方训练,在未见高阶与缩放方向图上高于理想到达方向的参数滤波上界,代价是依赖大量无混响仿真语音与固定阵列几何。
该研究把同一段语音拆成前景/背景、谐波/打击、低频段与房间脉冲响应分别训练检测器,报告在 ASVspoof 2019 训练下低频 0-4 kHz 与去混响 MFCC 能改善跨域 EER,但以 ITW 上 24% 仍远非可用为代价。
论文把传声器信号写成声源经无限冲激响应的卷积,证明在环路延迟足够长且该无限冲激响应可用有限冲激响应近似时反馈分量落入晚期混响段,从而用加权预测误差去混响做联合去混响与声反馈抑制,仿真显示其在 6 dB 与 -6 dB 增益裕量下均优于连续自适应滤波器,代价是依赖延迟条件与有限冲激响应近似。
该文把线性链条件随机场中的硬维特比解码换成温度控制的软最大值近似得到可微模块 dCRF,并在双声部干扰下的音高类别估计中显示 Toeplitz 约束的 dCRF-T 接近双向长短期记忆网络精度但参数少得多,而全参数 dCRF 提升有限。
该文研究只测到部分房间脉冲响应时能否用扩散修复补齐缺失通道并用于阵列处理,最强证据是在仿真与 MeshRIR 实测上重建误差低于样条插值且掩膜 0 和 1 下波束形成接近全阵列,但掩膜 3 等极端缺测下 SI-SDR 下降约 4 dB。
针对声速变化导致离线测得脉冲响应失配、空间音频控制退化的问题,该文提出在多通道放音过程中只用单个观测麦克风逐帧最小化实测与参数化重放模型误差来估计声速,并在估计偏移超过阈值时用插值修正脉冲响应重算声区控制滤波器,仿真显示能跟踪声速并接近已知真实脉冲响应与已知声速插值的性能,代价是依赖均匀温度假设、已知参考脉冲响应和逐帧网格搜索计算。
该文用带噪潜变量微调一致性音频自编码器加感知损失来学习由粗到细的感知层次,并用自回归整流流估计音高惊奇度,在重建保真、与 IDyOM 相关性和 EEG 预测上报告了提升,但干净重建略有损失且高噪声机制仍待验证。
针对语音编码器偏发音而大语言模型偏语义的对齐错位,该文提出先预测音素再生成文本的联合训练,在 100 小时低资源和 960 小时及荷兰语条件下报告词错率下降,代价是输出变长与仍需低秩适配。
针对无线声传感器网络中集中式传输原始麦克风信号开销大且难扩展的问题,论文提出传输平面波与边界元物理映射加低秩先验的隐坐标并做反向注水比特分配,仿真报告在相同估计误差下分配策略比均匀量化需要更少总速率,但低秩与高噪声会抬高误差下限。
针对发动机爆燃脉冲的时序本质,论文用可微脉冲串加卡普拉斯-斯特朗共振器重建声音,在三类发动机共 7.5 小时音频上把总验证损失平均降低 5.7%、谐波重建提升 21%,代价是共振器音色偶尔偏离目标且尚未在真实录音上验证。
针对混响下窄带声源逐帧网格定位带来网格失配的问题,该文把点神经元声场前向模型嵌入卡尔曼滤波,只在首帧做定位、之后直接对麦克风声压做连续三维跟踪,单源在 800 到 1200 赫兹多轨迹上报告接近零误差并可扩展到三源,但代价是 95 到 119 个贴边界麦克风和受控仿真条件。
针对听音者移动导致声传递函数变化时时域 FxLMS 加 RLS 在线建模计算重、重收敛慢的问题,论文提出频域极坐标 FxNLMS 加 NLMS 声路径跟踪与声对比度驱动变步长,在 10 扬声器仿真中把每帧计算量降低约 99.94% 并把移动后重收敛时间常数从 33.11 s 缩短到 3.71 s,代价是仍只在自由场白噪声仿真中验证且依赖多组 Sigmoid …
论文以 Whisper-small 为对象,用梯度与 Fisher 灵敏度定位可剪部位并做无微调一次幅度剪枝,最强证据是解码器自注意力 50% 稀疏度在 LibriSpeech test-other 上绝对词错误率下降 2.38%,代价是解码器前馈与早期解码器层在同等稀疏度下灾难性退化且全局均匀剪枝在 40% 附近崩溃。
针对目标说话人提取中干扰声与目标方向接近且混响模糊空间线索的问题,该工作在 SpatialNet 骨干上加入区域方向卷积、高斯核距离编码与混响参数调制,并在方位差为零的极端条件下报告大幅提升,但小距离间隔叠加相似混响指纹时仍有退化。
该工作用共享拓扑的配准耳网格研究几何驱动的个性化 HRTF 合成,对比 30 维 PCA 几何与全分辨率网格、潜空间与全信号回归以及单域与多域损失,显示多域复合损失把时域表示的 LSD 从约 15 dB 降到约 9.4 dB,但全几何增益依赖表示且波形一致性仍有限。
针对含噪机器声中最近邻匹配不可靠的问题,该研究用机器与噪声标注加混合对齐做保留式再预训练,在受控信噪比与噪声失配下相对 BEATs 提升低信噪比约 4.1、平均约 3.1,代价是仍与嵌入混合上界有差距且依赖固定的 0.5 混合系数。
该文研究已知麦克风与声源位置下用直达与反射距离估计鞋盒房间六面墙的问题,提出三距离全求解器与两距离正交求解器并结合 RANSAC 剔除误检,最强证据是已知 chirp 与未知移动音乐两类仿真及 ScanNet++ 伪合成与实录中仍能找回多面墙,代价是逐墙剔除会误删他墙对应距离且后几面墙更难找。