拥挤时少数的说话人为何消失:把存在和活动绑在一起再计数
针对五人以上拥挤录音中端到端 diarization 系统性少计低话量说话人的问题,论文在 EEND-TA 上加训练期门控耦合正则与按说话人加权的归约,最终系统把拥挤子集精确计数从 32.9% 提到 41.6%,代价是 CallHome 这类吸收型错误为主的域精确计数下降且需多调存在门指数。
针对五人以上拥挤录音中端到端 diarization 系统性少计低话量说话人的问题,论文在 EEND-TA 上加训练期门控耦合正则与按说话人加权的归约,最终系统把拥挤子集精确计数从 32.9% 提到 41.6%,代价是 CallHome 这类吸收型错误为主的域精确计数下降且需多调存在门指数。
论文研究角间隔 ECAPA-TDNN 分类器原型在单位超球面上的集中与有效维度坍缩问题,用铰链式 Riesz 对数能量与参与率最大化两项直接作用于原型的正则改善覆盖,并在 Fast-VGAN 零样本换声上以 WER 从 6.54% 到 5.97%、相似度从 0.65 到 0.69、UTMOSv2 从 2.47 到 2.70 为证据显示鲁棒性提升,而说话人识别 …
针对显式思维链导致注意力偏离音频的推理落差,SPARE 在推理起点插入寄存器令牌并用结论语义做余弦对齐,在 SALMONN 13B 上把 MMAU 提升到 58.03%、MMAR 提升到 40.32%,代价是微调阶段增加一个训练期对齐分支而推理零新增开销。
针对同一话语的频谱图、MFCC 与 HuBERT 既重叠又互补而直接融合会淹没弱线索的问题,TriCGF 先分解为公共与特有分量再用全局共识加门控融合,在 IEMOCAP 上取得 74.19% 加权准确率与 75.17% 非加权准确率、在 EmoDB 上取得 94.36% 与 94.28%,代价是三路编码与门控带来更多训练配置与调参负担。
针对构音障碍语音识别中离散 token 与识别目标错位且随严重程度漂移的问题,该文用迭代伪标签更新、可微端到端优化与严重程度不变正则学习 DSI token,在 UASpeech 与 TORGO 上显著优于可比 HuBERT 连续与离散基线,系统组合后最低词错误率分别为 18.90% 和 6.38%,代价是需内容平行的健康对照与额外的端到端训练。
针对耳蜗个体差异难以直接调参的问题,该文在可微 CARFAC 上增加后向传输与相干反射路径,以复合损失拟合瞬态诱发耳声发射波形,在传输线模型仿真与 58 耳实测数据上显示可还原不同听力损失形态,但对真实生理状态与泛化仍需更多验证。
该文研究针对 Whisper 系列的通用、有迁移性的目标性声学攻击,提出 MuteOut 随机掩码优化,以较大的扰动预算换取跨模型的目标词成功率,同时用词错率和语义分数量化通用性与迁移性之间的折中。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对可调旋钮的黑盒虚拟模拟在旋钮转动时出现噪声的问题,论文用深层拼接条件 LSTM 加谱范数或无穷范数正则与 32 通道 Gammatone 滤波损失,在三块效果器数据上把正则模型的精度追近无正则基线,同时把零输入下的控制噪声压到实用底噪以下,但同等规模下正则仍有小幅精度代价。
针对合成到真实的域偏移,论文在合成训练中把隐表示拆成波达方向相关与干扰两路并施加互信息最小化和均匀约束,仅用仿真训练就在真实录音上把误差降到 3.22 度、准确率提到 82.76%,代价是增加了解耦分支与两项正则的训练复杂度但推理结构不变。
针对亮区固定、暗区用户移动时离散切换会掉声对比度并引起系数跳变的问题,该文把整段轨迹滤波器拼成块矩阵并在分母加相邻差分平滑项做广义瑞利商最大化,仿真报告最小声对比度最多提升约 7 dB,代价是峰值提升有限且引入平滑正则权衡。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
论文研究说话人识别中速度扰动和混合拼接增强如何加大训练难度,提出用杰弗里斯损失约束非目标分布并用面向近邻的混合采样供给局部样本,在多组失配评估上报告稳健性方向,同时显示单阶段联合多种增强会使判别过难而分数融合更稳妥。
针对重构训练的编码器与自回归语言模型目标不一致导致词元难学的问题,论文用未来词元预测与语义对齐改造编码器,在 SALMon 上报告 61.6% 准确率与 35 倍困惑度下降,同时语音 Mel 距离改善 5.0%,代价是需要配对文本与额外训练开销。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
论文在 AASIST 最后隐层加 Top-K 稀疏约束,用 ASVspoof5 验证检测性能与按攻击类型度量的解耦度,最强证据是 D=320、k=20 时测试集 EER 为 23.36% 且单样本约 95% 维度为零,代价是需放大隐层并舍弃难检攻击后解耦结论才成立。
针对 ASVspoof 5 训练中说话人分布与真伪标签纠缠导致跨域失效的问题,论文用 VoxCeleb 教师经梯度反转引导学生去身份并以变分信息瓶颈控制抑制强度,在九个域外集的混合评估上相对 MHFA 基线降低混合等错率 25.7%,代价是在 ASVspoof 5 域内集上弱于挑战赛前列系统且部分数据集出现回退。
针对流利度评分既要看整体节奏又要抓局部停顿且等级有序的问题,该研究用专家特征锚定 Whisper 时序表示做深度融合,并用距离感知的顺序平滑损失建模等级远近,在 SpeechOcean762 上报告 83.40% 准确率,代价是依赖冻结声学表示与有限人群验证。