只用仿真训练时,如何让跟踪模型不再记住仿真痕迹
针对合成到真实的域偏移,论文在合成训练中把隐表示拆成波达方向相关与干扰两路并施加互信息最小化和均匀约束,仅用仿真训练就在真实录音上把误差降到 3.22 度、准确率提到 82.76%,代价是增加了解耦分支与两项正则的训练复杂度但推理结构不变。
针对合成到真实的域偏移,论文在合成训练中把隐表示拆成波达方向相关与干扰两路并施加互信息最小化和均匀约束,仅用仿真训练就在真实录音上把误差降到 3.22 度、准确率提到 82.76%,代价是增加了解耦分支与两项正则的训练复杂度但推理结构不变。
针对固定帧与浊音基音周期非整数比造成频谱失真的问题,该文用声门闭合时刻定帧界并重采样到统一时频网格,在 TIMIT 音素分类上以 6 ms 表观支撑达到 47.3% 准确率,超过 24 ms 固定帧的 46.8%,代价是依赖 GCI 估计与二维插值且未建模上下文。
针对亮区固定、暗区用户移动时离散切换会掉声对比度并引起系数跳变的问题,该文把整段轨迹滤波器拼成块矩阵并在分母加相邻差分平滑项做广义瑞利商最大化,仿真报告最小声对比度最多提升约 7 dB,代价是峰值提升有限且引入平滑正则权衡。
该研究用受控仿真对比卷积噪声与加性噪声对房间脉冲响应表征的影响,显示在能量交点附近截断卷积噪声并在增强时加入加性噪声能改善潜空间可分性与混响时间估计,而把过长噪声尾保留进训练会损害向真实混响语音的泛化。
该研究把正常听觉与电刺激听觉都写成可微模型,用同一段语音驱动两条通路并以螺旋神经节神经元包络误差为目标训练双网络刺激器,在 TIMIT 干净语音上把包络平均绝对误差从 0.6261 降到 0.0934,代价是仅用单一包络指标、干净语音和 8 kHz 以下频带且允许同时刺激。
该文研究混响加定向噪声下两人混合的多麦目标说话人提取,对比瞬时相对传递函数、已知波达方向和单通道声纹三种配准线索,随机位置上瞬时相对传递函数取得 9.2 dB 和 0.81 的分离与可懂度,同波达方向下仍保持 8.8 dB,代价是需要与目标同位置的无噪配准信号。
该研究以 CosyVoice2 为骨干解决法语和德语零样本段落合成可懂度低的问题,选择只微调文本语音语言模型加流解码器并冻结声码器,最强证据是在 250 小时法语和 500 小时德语下相对词错误率下降 83 到 91%,代价是微调声码器会损害可懂度且超量加长数据会因复杂度多样性失配使词错误率回升。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该文把声道发音合成的评价转为发音特征上的音素识别问题,用同一识别器比较真实轮廓与三种合成轮廓的音素错误率,最强证据是加浊音编码后无模型合成达到 20.59 的错误率,代价是单说话人法语实时磁共振数据与缺声源信息的固有限制。
论文用带精确起止时间的合成复调音频检验片段级分类器的事后积分梯度时间定位能力,最强证据是积分梯度达到平均交并比 0.39 与帧级 F1 值 0.52,接近弱监督帧级模型,但峰值定位一致性代价明显。
针对 F0 可控声码器在大规模多说话人训练和噪声下是否仍可控的问题,论文用概率潜变量替代确定性特征并以重合成谱误差做数据筛选,报告显示筛选能阻止错误数据拖累训练、上移 F0 时清浊判断更准而下移与高频区仍有挑战、噪声下优于基线,但筛选阈值仍需人工设定。
该研究针对波兰儿童浊卷舌擦音发音部位分类,用支持向量机比较梅尔倒谱、谱描述子、摩擦噪声与新提出谱比值特征及多种特征选择方法,最强证据是梅尔倒谱加谱描述子加谱比值配合套索选择达到灵敏度 0.72 与特异度 0.81,代价是小样本与类别不平衡下的稳定性仍需更多验证。
针对双耳助听中降噪与干扰声方向保持的矛盾,论文提出按频点在高降噪与严格保方向之间做凸组合切换,并在与松弛联合双耳约束相同方向误差下获得更高信干噪比,其代价是在大松弛量时部分频点仍需求解松弛优化而耗时增加。
该文把轻量语音转文本后的饼干失窃描述转成词共现图,用两层图卷积区分阿尔茨海默症与健康人,在 ADReSS-o 上主体词图达到 88.73%、精炼版 90.14%,代价是词表依赖该图片描述任务且只用文本模态。
针对 FSD50K 存在背景干扰、重叠与稀疏标注的问题,该工作用扩散模型生成干净单源样本再构造受控混合来训练 BEATs 加 Bi-LSTM 判别器,在专家整理的 BSE 集上报告 95.51% 准确率与 98.58% 精确率,并据此筛选出 32,880 条的 FSD50K-Solo,代价是未验证对未见类别的泛化。
针对助听器要在多人同场中判断助听器用户想和谁交谈的问题,论文提出只用每人二值语音活动流的多人贝叶斯最小重叠间隙框架,用会话对齐分数刻画群体轮替,并在真实 2、3、4 人对话上分别报告 97.1%、90.1% 和 90.4% 的平均伙伴识别准确率,代价是需要数十秒到数百秒的积分窗口才能观察到充分轮替。
针对广义零样本声事件分类中未见类被大量判为已见类的问题,论文用属性条件 GAN 生成未见类隐特征训练分类器,再以类级分布外检测做分流与概率融合,在 RWCP-SSD 上把调和平均从 36.2 提高到 78.7,代价是类级检测器数量与阈值调节成本增加。
该文把群延迟乘积谱作为 Clarinet 神经声码器的条件特征,在英语与希腊语上与梅尔谱基线做可运行对照,主观 MOS 接近基线而客观 MCD 偏高、F0 周期性误差相当,关键代价是平滑系数 ρ 取值敏感。
论文把标准评测中已知机器身份的假设拿掉后联合评测,发现判别式模型退化最小而依赖机器专属分数的方法退化明显,且退化程度与隐式机器识别准确率相关,但局部密度归一化为例外显示识别准不是高检测性能的必要条件。
针对单通道语音增强中幅度与相位分工不同的问题,论文把实数分支的幅度掩蔽与复数分支的加性复数修正并联并在瓶颈处交换信息,在参数量对齐的卷积去噪自编码器与卷积循环网络上以短时客观可懂度、语音质量感知评估和尺度不变信号失真比为指标验证,并在乘加操作数上付出更少计算代价。