aaai-2026 论文深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对两说话人 Hindi-English 医疗对话的说话人日志任务,论文比较 Diaper、Pyannote 3.1 与 DiariZen 并做域自适应,最强证据是解冻 WavLM 的 DiariZen-large 在 dev2 上达 8.57% DER、六系统融合后达 8.48% DER,代价是半监督策略高度依赖模型且融合增加系统复杂度。
针对聚类式说话人日志把多人同时说话和背景语音误并入单说话人簇的问题,论文用多说话人态与背景态增广 HMM 状态空间并引入外部说话人切换点约束,在 DoPaCo 无重叠上相对基线降低约 55% 说话人错误率,代价是默认非重叠输出在重叠区漏检较高,需外接重叠检测才可做重叠感知输出。
针对短停顿标注松紧不一致会抬高日志误差率并掩盖真实模型误差的问题,论文保留标准 DER 不变并将其精确拆分为停顿归因部分与残余核心部分,最强证据是合成变换只把填充归为停顿而插入与移位仍留在核心,代价是核心误差不能单独优化且跨不同松紧参考不可直接比较。
针对 SRE24 音频验证中固定训练缺阿拉伯语与法语、短语音与多说话人测试变难的问题,I4U 用 Multi2dCoTNet 多嵌入约束、NPSVM 分类器、自适应归一化与 Mixed-Norm 虚拟说话人给出官方五系统方案,并用 Multi2dCoTNet 加 XLSR-CAMHFA 的两系统精简方案在更低算力下达到相近精度,但短时长与声源失配仍是主要误差 …
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
该文以 WavLM 为骨干研究说话人日志,报告加权多层目标、10k 小时数据规模、Large 容量与 Conformer 切块调优带来可复现的 DER 下降,但 100k 小时与剪枝收益趋平且标注噪声限制可测改进。
针对多人重叠会议中内容、说话人与时间边界相互纠缠的问题,TagSpeech 用解耦的语义与说话人双流加交错数字时间锚统一解码,在 AMI 与 AliMeeting 上以只训练投影层的低成本取得 diarization 误差的明显下降,但重叠区外的时间边界精度仍不及专用级联系统。
针对多人对话中谁在何时说话与内容难以联合对齐的问题,TellWhisper 在语音编码器内用时间说话人旋转位置编码联合建模时间与说话人活动,并用双曲空间说话人日志估计帧级活动,在真实会议数据上取得内容加说话人加时间的一致改进,但支持说话人数限于 1 至 4 人且编码器与双曲分类器仍处在不同几何空间。
CSPB 针对噪声混响与重叠语音的真实多人对话,用冻结上游加轻量下游的统一协议在四套数据上考识别日志与增强分离,报告显示多样数据加增强预训练的模型更稳健而波束形成与原生多通道带来一致增益,代价是原生多通道预训练数据远少且基准仍以编码器结构为主。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
EgoEMS 针对院前急救中多成员协同与强流程性难以建模的问题,用 233 次模拟试验同步采集第一视角视频、音频、手表惯性与按压真值并标注 67 类关键步骤,基准显示监督变换器在分类达 62.3% 而零样本大模型仍明显落后,代价是模拟与真实出警之间仍有分布差距。
该提案要把语音感知大语言模型从只做转写扩展到原生联合完成自动语音识别与说话人切分,做法是冻结大语言模型主干、分两阶段训练音频编码器与适配器并加入上下文提示,证据是所列开源切分数据的时长与语言分布以及词错率与切分错率的明确定义,代价是切分标注数据少且尚未给出可运行系统的定量主结果。
针对松标注训练导致边界过松、而因果-反因果伪标签又收得过紧并增加漏检的问题,论文用保边界去停顿填充、预热上下文和非因果感知协同训练来缓解,并在 AMI 与 AliMeeting 上把与理想紧标签上限的 DER 差距缩小约四到六成,代价是虚警与漏检之间仍需权衡。
该文用同一组流式识别与流式说话人日志模型派生出级联、掩码输入、词级串行输出和日志条件四种架构,对比多说话人准确率、单说话人退化、内存占用与训练代价,并以排列不变动态时间规整解决短片段训练标签对齐问题,其中日志条件精度最好但需要微调与多实例代价。
针对级联式说话人日志与识别中误差传递与重叠语音难处理的问题,SpeakerLM 用音频编码器加投影器接入大语言模型的端到端多模态方案,在约 7638.95 小时数据下主指标超越最强级联基线,但小数据与仿真失配时仍明显落后。
针对长录音中说话人、韵律、情感与场景需联合标注的问题,论文用全开源的前端加先验加三智能体加有界复核流程组织标注,并在 8.87 小时九类中文主基准上以时间线与固定时间线两套条件报告了可复述的误差与消融代价。
针对说话人日志与语音识别分开建模带来的切分错位和语义断裂,WhisperDiari 在 Whisper 上增加说话人适配器与说话人解码器做词元级说话人标注,LibriDiari 与 AMI 证据显示其词元级误差更低,但其帧级时间戳精度仍受解码器时间戳限制。