论文解读
整场会议的自回归日志:事件式输出更稳,跨段身份仍需显式链接
该工作把完整会议说话人日志写成条件于声学输入的自回归结构化词元生成,对比事件式与帧式表示并引入语音活动与重叠等辅助线索,最强可运行证据是事件式 SAD 到 OD 再到 SD 链经 VBx 链接后在 AMI 上达到 24.40% 日志错误率,代价是原始输出跨段身份混乱且重叠区漏检仍然很高。
该工作把完整会议说话人日志写成条件于声学输入的自回归结构化词元生成,对比事件式与帧式表示并引入语音活动与重叠等辅助线索,最强可运行证据是事件式 SAD 到 OD 再到 SD 链经 VBx 链接后在 AMI 上达到 24.40% 日志错误率,代价是原始输出跨段身份混乱且重叠区漏检仍然很高。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
该研究用同一 TCN 分割模型对比绝对特征与帧间差分、保留或去掉重叠前单人语音、打乱帧顺序三类扰动,显示 WavLM 在 DIHARD III 上达 0,680 F1-score 而 MFCC 仅 0,424,且打乱时序会系统性推高重叠类概率,代价是扰动结论依赖小样本长重叠段与伪概率曲线。
针对聚类式说话人日志把多人同时说话和背景语音误并入单说话人簇的问题,论文用多说话人态与背景态增广 HMM 状态空间并引入外部说话人切换点约束,在 DoPaCo 无重叠上相对基线降低约 55% 说话人错误率,代价是默认非重叠输出在重叠区漏检较高,需外接重叠检测才可做重叠感知输出。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读