论文解读

拥挤时少数的说话人为何消失:把存在和活动绑在一起再计数

针对五人以上拥挤录音中端到端 diarization 系统性少计低话量说话人的问题,论文在 EEND-TA 上加训练期门控耦合正则与按说话人加权的归约,最终系统把拥挤子集精确计数从 32.9% 提到 41.6%,代价是 CallHome 这类吸收型错误为主的域精确计数下降且需多调存在门指数。

 · 约 17 分钟 · 8417 字 阅读 →
论文解读

从全脸到嘴部:ROAM-ASD 用联合自注意力应对开放世界的说话人检测

针对野外遮挡噪声下说话人易误判问题,ROAM-ASD 联合音频、全脸与嘴部三流并用联合自注意力加模态丢弃融合,在五个基准上取得 98.8%、87.9% 等 mAP,代价是需要人脸跟踪与嘴部关键点定位。

 · 约 20 分钟 · 9534 字 阅读 →
论文解读

两人对话先分清谁在说,再听懂整场在说什么:第二届 MLC-SLM 的多任务设定

该挑战用约 2100 小时 14 语言双人对话同时考 diarization 加识别与整场理解,基线显示长时说话人对齐与语义推理是主要瓶颈,而参赛系统靠域内 diarization 适配与音频依赖监督把误差与准确率推到新水平。

 · 约 20 分钟 · 9734 字 阅读 →
论文解读

长对话问答不缺音频而缺取舍:按问题动态分配文本与声学证据

针对多语言双人长对话口语问答中不同问题依赖不同证据的问题,该工作用带说话人时间戳的转写做主干、按问题动态挂接局部或全局音频,开发集任务二达到 94.84% 准确率,但消融无法完全分离标签质量与证据分配的因果。

 · 更新于 2026-09-24 · 约 20 分钟 · 9904 字 阅读 →
论文解读

整场会议的自回归日志:事件式输出更稳,跨段身份仍需显式链接

该工作把完整会议说话人日志写成条件于声学输入的自回归结构化词元生成,对比事件式与帧式表示并引入语音活动与重叠等辅助线索,最强可运行证据是事件式 SAD 到 OD 再到 SD 链经 VBx 链接后在 AMI 上达到 24.40% 日志错误率,代价是原始输出跨段身份混乱且重叠区漏检仍然很高。

 · 更新于 2026-09-24 · 约 18 分钟 · 8820 字 阅读 →
论文解读

先分清谁在说话、再转写说什么:Transsion 级联式多语说话人归属转写系统解读

针对无预先切分的多语会话转写任务,该工作用说话人日志、长语音识别与 CTC 对齐加融合的级联路线,在官方评测集上报告 tcpMER 为 15.41% 获得第二名,代价是三模块串行依赖与多阶段微调成本。

 · 更新于 2026-09-24 · 约 18 分钟 · 8539 字 阅读 →
论文解读

不动 ASR 模型,如何把田间嘈杂的多人农问转写做准

针对田间噪声、多说话人和农业词汇三类失败,论文用可开关的增强、说话人分离与词表修复包裹未改动的 ASR 模型,在印地语等三语评估上实现云端相对 16% 至 23% 的词错误率下降,多说话人下达 32% 至 42%,代价是增强与修复只在证据支持时生效且 M4 未被测量。

 · 更新于 2026-09-24 · 约 19 分钟 · 9045 字 阅读 →
论文解读

把谁说了什么写对:用真实失败做偏好优化的端到端角色转写

针对临床访谈中医生与患者归属问题,论文用 LoRA 微调 Whisper-large-v3 并加帧级角色头做端到端转写,再用真实解码失败做 DPO 提炼,在 29 个 DAIC-WOZ 测试会话上达到 0.973 角色准确率与 0.119 DER,但中文语音转换数据的剩余误差仍集中在角色判错而非漏转。

 · 更新于 2026-09-24 · 约 19 分钟 · 9324 字 阅读 →
论文解读

给定时转录本后一次标全词时间戳与说话人:非自回归标注为何更快更准

该研究把时间戳与说话人归属做成对给定转录本的单遍占位填充,用双向大模型同时输出全部标签,在相同训练数据下比同类自回归模型更准且标注快一到两个数量级,但流水线总速度仍受前置语音识别限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9939 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

重叠喀哒声串归谁:三水听器加视频如何拆解抹香鲸近场混叠

针对两头同龄雄性幼鲸近距离身体接触时连续重叠喀哒声串难以归属的问题,论文用单通道恒 Q 变换谱加步间间隔节律做声学解交织,再用三元紧凑阵列到达时差定位投影到视频验证,在简单场景聚类误差为 0.0%、最难场景达 25.79%,并以 10 度容限实现主要发射者最高 100% 水平视觉一致,代价是垂直方向系统性偏差与近平面阵列几何盲区导致两个场景无法最终归属。

 · 更新于 2026-09-24 · 约 20 分钟 · 9640 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
论文解读

把临床对话变成可复核的时间线:自动语音分析如何从噪声中算出韵律

该演示针对精神科访谈中非正式韵律观察不可复现的问题,给出从录音到说话人分段、转写、音节定位再到时间韵律指标与人工核对的端到端流程,并以一段含 2 人 3 轮的示例说明可视化核对方法,代价是仍需人工复核且未报告定量精度与临床阈值。

 · 更新于 2026-09-24 · 约 18 分钟 · 8940 字 阅读 →
论文解读

对齐到文本之后,说话人信息去哪了:残差、层权重与注意力权重的三路核查

论文追问句级语音语义向量是否还残留可用的说话人信息,用与各自对齐几何一致的音频减文本残差做无监督聚类检验,并用冻结编码器的说话人分割层权重与帧级注意力分布定位信息位置,最强证据是按句聚类准确率仍高达 0 点 96 以上而按说话人聚类接近随机,代价是该结论只在朗读平行语料与特定分割流程下成立。

 · 更新于 2026-09-24 · 约 21 分钟 · 10092 字 阅读 →
论文解读

把可懂度放进对话时间里:舌切除患者与临床医生轮流说话时的动态测量

该研究把原来只给朗读打一个总分的可懂度模型改造为按轮次打分的时间序列方法,在 13 例舌切除患者的半结构化临床对话上检验临床医生说话是否影响患者下一轮可懂度,最强证据是 7 例中存在显著关联且 PMB01 约 40% 变化可被解释,代价是 10 秒窗导致的时间粒度粗糙且个体差异极大。

 · 更新于 2026-09-24 · 约 20 分钟 · 9528 字 阅读 →
论文解读

把高斯方差换成重尾假设,远场多人日志为何更稳

针对远场多通道会议中混响噪声与重叠语音的日志难题,该工作把神经 FCASA 的高斯源方差模型推广为瘦峰广义高斯与学生 t 分布的重尾模型并统一为高斯尺度混合训练目标,在 AMI、AliMeeting 和 CHiME-6 上报告了日志错误率与 Jaccard 错误率下降,但部分形状参数会退化且跨语料直接迁移仍明显变差。

 · 更新于 2026-09-24 · 约 17 分钟 · 8093 字 阅读 →
论文解读

不先卷识别率:以对话聚类带动联合误差下降的 AUVIS 系统

针对 360 度远场多说话人重叠对话的音视频识别与说话人归属问题,AUVIS 在官方基线五阶段流水线上保留基线检测与跟踪、只做切分与聚类参数解耦和网格优化,用开发集上聚类 F1 到 0.906 的 14.8% 相对提升带动联合误差 17.09% 相对下降,而识别字错误率仅相对下降 0.9% 到 0.4943。

 · 更新于 2026-09-24 · 约 15 分钟 · 7103 字 阅读 →
论文解读

看不见脸时说话人是谁:CineSRD 用视觉锚点加语音语义补齐影视对白

针对影视长视频、多说话人和音画不同步问题,CineSRD 先用视觉锚点聚类注册说话人再用音频语言模型做轮次检测与幕后补充,在 SubtitleSD 上报告更低的 DER 与 JER,代价是多阶段集成而非端到端且依赖人脸与字幕时间轴。

 · 更新于 2026-09-24 · 约 17 分钟 · 8047 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →