论文解读

不换打分只换加权:按隐含条件自适应融合说话人确认分数

针对多系统分数融合采用全局映射会抹掉信道与性别等条件差异的问题,该文用嵌入推断离散隐条件并按条件做高斯生成式似然比融合,在 SRE24 评测上相对逻辑回归取得约两成相对改善,但代价是引入嵌入维度与条件数等超参数和更复杂的无监督训练。

 · 更新于 2026-09-24 · 约 17 分钟 · 8222 字 阅读 →
论文解读

合不合语境比像不像情绪更难:CEAEval 如何评语音表达得体性

论文把问题定为普通话有声书语境下语音表达是否贴合叙事意图,提出规划器与评判器分离的 CEAEval-M,并报告在人工测试集上线性相关 0.72 与 70.80% 准确率,其代价是依赖人工标注语境与多阶段训练。

 · 更新于 2026-09-24 · 约 23 分钟 · 11141 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

用双模识别稳住部分音频,再让大模型翻译:NeMo 级联同传如何兼顾延迟与质量

该工作用双模统一识别器做流式转写加多语言大模型做翻译的级联路线,在英德英意英中和捷英四个方向上以统一模型覆盖高低延迟档,最强证据是低延迟下统一模型转写与翻译质量优于缓冲与缓存感知基线,代价是中文等语序重排方向需缩小块并提前结束以控延迟。

 · 更新于 2026-09-24 · 约 16 分钟 · 7887 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

不靠模态先验,把波形表征和可算特征拼起来反推薄板参数

针对从位移脉冲响应反推六个可辨识薄板参数的任务,论文用预训练 CNN14 波形分支拼接 15 维物理启发特征做回归,在官方验证集上报告总体归一化均方误差 0.00362,代价是仍依赖合成数据与固定预处理条件。

 · 更新于 2026-09-24 · 约 17 分钟 · 8476 字 阅读 →
论文解读

不改伪标签,在参数空间里纠正伪标签:Pseudo2Real 的跨口音修正向量

针对无目标域标注时伪标签存在系统性口音偏置的问题,论文在源域用同起点真标签模型减伪标签模型得到修正向量并加到目标域伪标签模型上,在 AFRISPEECH-200 十个口音上把 Whisper TINY 平均 WER 从 89.3 降到 57.7,代价是需要有标注源域和调缩放系数 λ。

 · 更新于 2026-09-24 · 约 19 分钟 · 9357 字 阅读 →
论文解读

先判有没有声,再判是不是说完:用两级协作做实时轮次结束检测

针对语音对话中停顿与轮次结束难以区分的问题,论文构建含合成与真实对话的 OpenETD 数据集并提出 SpeculativeETD 两级协作推理,用端侧轻量模型逐块判有声无声、只在静音段触发服务端大模型判暂停还是结束,在混合训练下真实集上取得更好分割效果,代价是服务端调用与传输延迟仍需计入部署预算。

 · 更新于 2026-09-24 · 约 17 分钟 · 8486 字 阅读 →
论文解读

字幕块太碎翻不好:先固定时间,再用整句重写文本

该工作用语音活动检测加字幕块翻译先固定时间模板,再把相邻音频聚成长段并用整句翻译重写文本后回填原时间,开发集证据显示翻译质量随句子尺度提升,但更长更完整的译文需要后处理才能兼顾阅读速度与行长限制。

 · 更新于 2026-09-24 · 约 17 分钟 · 8262 字 阅读 →
论文解读

一句话生成可玩视觉小说:AniTales 如何用情绪标签对齐故事、立绘与配音

AniTales 针对文本互动故事缺少稳定多模态呈现的问题,用大语言模型生成带说话人与情绪标签的结构化剧本,再以同一标签驱动立绘表情与语音韵律,在 10 名普通用户与 5 名专家的十幕故事试用中获得可用性 84 分与角色对话匹配 4.2 分,但语音适配在两组均为 3.6 分成为最弱环节。

 · 更新于 2026-09-24 · 约 19 分钟 · 9137 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

MAViS:用多智能体分阶段协作把一句话变成一分钟有声故事短片

针对长序列视频叙事中辅助能力弱、视觉质量差和表达单调的问题,MAViS 用分阶段多智能体与 3E 迭代和剧本写作约束组织生成,最强证据是用户研究约 69.44% 平均投票份额与关键帧 CLIP 34.22,主要代价是双 H100 上平均 13.63 小时的生成耗时。

 · 更新于 2026-09-24 · 约 22 分钟 · 10619 字 阅读 →
论文解读

流式多说话人识别要在单实例省内存与多实例保重叠之间选边

该文用同一组流式识别与流式说话人日志模型派生出级联、掩码输入、词级串行输出和日志条件四种架构,对比多说话人准确率、单说话人退化、内存占用与训练代价,并以排列不变动态时间规整解决短片段训练标签对齐问题,其中日志条件精度最好但需要微调与多实例代价。

 · 更新于 2026-09-24 · 约 24 分钟 · 11655 字 阅读 →
论文解读

不训练也能听懂说话:冻结视觉语言模型的外挂语音路由何时够用

论文用冻结视觉语言模型加 Whisper 转写路由构造免训练语音中心全模态理解,在 56 个基准和 21 种语言的配对比较中语音任务可比原生全模态训练而保留视觉推理能力,代价是增加串行语音识别延迟且无法处理音乐与环境声等非语音线索。

 · 更新于 2026-09-24 · 约 19 分钟 · 9198 字 阅读 →
论文解读

当嵌入不再确定:把不确定性从打分一路带到校准的后端闭环

说话人验证 | 7.8/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11936 字 阅读 →
论文解读

类型未知时如何判真假:用两套耳朵听同一段音频

音频伪造检测 | 6.3/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11814 字 阅读 →
论文解读

Investigating voiced and unvoiced regions of speech for audio deepfake detection

语音伪造检测 | 6.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6842 字 阅读 →
论文解读

SonarLLM: A Native Sonar--Optical Multimodal Large Language Model for Underwater Perception

音频理解 | 8.0/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7258 字 阅读 →
论文解读

Adaptive Hierarchical Representation Alliance for Multimodal Learning

语音情感识别 | 8.6/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4966 字 阅读 →
论文解读

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

语音识别 | 7.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5235 字 阅读 →