重叠越密越要看嘴型:NJU-AALAB 用数据清洗与模板混合加持视听识别
针对多人同时说话造成的严重重叠与多会话分组难题,该工作保留基线说话人检测不变,主攻视听语音识别的数据清洗与模板化混合仿真并用大语言模型做会话聚类,开发集最好结果为词错误率 42.81% 与聚类分数 97.77%,代价是强单说话人骨干仍易误转干扰人且文本纠错收益有限。
针对多人同时说话造成的严重重叠与多会话分组难题,该工作保留基线说话人检测不变,主攻视听语音识别的数据清洗与模板化混合仿真并用大语言模型做会话聚类,开发集最好结果为词错误率 42.81% 与聚类分数 97.77%,代价是强单说话人骨干仍易误转干扰人且文本纠错收益有限。
针对离线轮替标注中暂停打断与重叠打断样本过少导致韵律学不会的问题,论文比较声学扰动、删尾重组及其组合三种增广,用随机森林在阿根廷西班牙语任务对话上把开发集 PI 从 0.36 提到 0.45、I 从 0.41 提到 0.48,代价是平滑转换与重叠转换的 F1 轻微下降且留出集宏平均未提升。
该文用转角域重采样加阶次跟踪从实录提取随转速和扭矩变化的谐波指纹,再驱动谐波加噪声合成器生成带四通道嵌入标注的音频,证据是 8 个子集上阶次结构随工况对应且基线网络可收敛,代价是高阶细节为参数化改动而非逐频复刻。
针对未见过文本到音频与音频到音频生成器的环境音伪造检测,论文用高效音频 Transformer 做前端加图注意力后端,配合差分微调与编解码增广,在 EnvSDD 上报告测试等错误率 2.48%,代价是依赖大规模预训练与特定增广组合。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对帕金森病理语音增强数据少且声学 atypical 的问题,论文在 PC-GITA 上系统比较变换型、生成型与噪声增强对预测式 CR 与生成式 SB 模型的影响,最强证据是噪声增强带来最稳健的大幅提升,而生成式合成在比例增大时反而损害性能,且病理与常态语音间的差距依然存在。
该研究用受控仿真对比卷积噪声与加性噪声对房间脉冲响应表征的影响,显示在能量交点附近截断卷积噪声并在增强时加入加性噪声能改善潜空间可分性与混响时间估计,而把过长噪声尾保留进训练会损害向真实混响语音的泛化。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该文以同一 Transformer 比较六种从纯音符到全量表达的切分方式,最强证据是渲染音频的 FAD 均值中音符加速度加踏板为 1.76、全量为 1.97,均优于纯音符基线的 3.10,而节拍标注平均未带来增益且代价是类别间波动大。
该文用文本到图像与文本到音频模型构造 VGGSound 合成克隆并固定 ACL-SSL 做对比学习,验证同规模替代、合成图像配真实音频修正与 2 倍 3 倍混合扩展三类用法,最强混合配方相对纯真实基线提升约 8.62 cIoU、5.58 mIoU 与 12.16 IIoU,代价是合成音频弱于真实音频且纯合成需到 3 倍才稳定超越。
针对小型弦乐重奏近场麦克风串音问题,论文把去串音做成 P 进 P 出的多通道分离,并在训练时对输入与目标施加同一随机置换以强制通道置换等变,在未见房间布局和真实 URMP 录音上提升 SDR,但低频与未见乐器上的增益仍然有限。
该研究把 DiffRIR 从单声源扩展为多声源联合优化并把学习率调到 3×10-2,用 24 条 RIR 实现频谱误差下降,同时揭示空间不变晚期残响在多声源下存在时间衰减精度的结构性代价。
针对吉他缺乏力度标注的问题,该工作用虚拟乐器渲染带力度标签的合成数据先学力度曲线,再把冻结的力度子模块拼到在真实录音上训练的音高转录模型中,合成集上平均绝对误差从约 32 降到约 7 但跨音色误差增大,而在 GuitarSet 与 EGDB 上的音符转录 F 值只提升约 0.1 个百分点。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
Affectron 针对开放场景下非言语发声数据少且无对齐监督的问题,用解耦小语料上的情感驱动匹配与情感感知路由构造增广样本并微调 VoiceCraft 主干,报告显示非言语真实感与多样性提升而口语自然度基本保持,代价是重叠语音未建模且依赖伪标签与小规模干净语料。
该研究用会话对齐加 Conformer 加 CTC 直接从皮层神经活动解码字符序列,在验证集上报告字符错误率为 23.80%,代价是跨会话信号漂移仍大且词边界错误集中。
论文研究说话人识别中速度扰动和混合拼接增强如何加大训练难度,提出用杰弗里斯损失约束非目标分布并用面向近邻的混合采样供给局部样本,在多组失配评估上报告稳健性方向,同时显示单阶段联合多种增强会使判别过难而分数融合更稳妥。
针对 SRE24 音频验证中固定训练缺阿拉伯语与法语、短语音与多说话人测试变难的问题,I4U 用 Multi2dCoTNet 多嵌入约束、NPSVM 分类器、自适应归一化与 Mixed-Norm 虚拟说话人给出官方五系统方案,并用 Multi2dCoTNet 加 XLSR-CAMHFA 的两系统精简方案在更低算力下达到相近精度,但短时长与声源失配仍是主要误差 …