论文解读

整场会议的自回归日志:事件式输出更稳,跨段身份仍需显式链接

该工作把完整会议说话人日志写成条件于声学输入的自回归结构化词元生成,对比事件式与帧式表示并引入语音活动与重叠等辅助线索,最强可运行证据是事件式 SAD 到 OD 再到 SD 链经 VBx 链接后在 AMI 上达到 24.40% 日志错误率,代价是原始输出跨段身份混乱且重叠区漏检仍然很高。

 · 更新于 2026-09-24 · 约 18 分钟 · 8820 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-22

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 54 分钟 · 26987 字 阅读 →
论文解读

听不见还硬说:用冻结声学裁判在训练时管住语音大模型的插入幻觉

针对语音大模型强化学习只看文本词错率而放任语言先验补词的问题,该研究在训练期叠加冻结字符级 CTC 声学裁判做组内奖励,用一次贪心解码在 AMI 远场会议上把插入错误降低 22.3% 至 28.3%,代价是少量删除错误上升且只验证了单个 7B 策略与 0.3B 裁判组合。

 · 更新于 2026-09-24 · 约 22 分钟 · 10827 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-16

共分析 59 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 104 分钟 · 52022 字 阅读 →
论文解读

一个小模型装不下两种语言:希腊-英语生产识别的步数前沿与绕行办法

论文要解决希腊语混英语电话与会议转写同时过九道生产门的问题,选择不再找单一训练配比而是用路由加解码干预加组合绕行,最强证据是三模型词投票把门覆盖从单模型 4 到 7 项拉到 9 项并把重叠语音词错误率从 53.35% 降到 37.87%,代价是单模型在该规模下希腊噪声门与英语语种识别门所需步数相差近 6 倍而无交集。

 · 更新于 2026-09-24 · 约 21 分钟 · 10106 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-15

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 38 分钟 · 18639 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
论文解读

不在同一房间,开口为何更费力:远程、共处与混合会议中的停顿证据

该研究以三人协作生存排序任务比较远程、共处与混合三种会议形式,发现远程和混合会议中填充停顿率显著高于共处会议、远程会议中无声停顿率也更高,而平均时长无差异,提示非共处设置增加了交际努力,但混合会议内远程与共处者之间无差异。

 · 更新于 2026-09-24 · 约 18 分钟 · 8764 字 阅读 →
论文解读

把高斯方差换成重尾假设,远场多人日志为何更稳

针对远场多通道会议中混响噪声与重叠语音的日志难题,该工作把神经 FCASA 的高斯源方差模型推广为瘦峰广义高斯与学生 t 分布的重尾模型并统一为高斯尺度混合训练目标,在 AMI、AliMeeting 和 CHiME-6 上报告了日志错误率与 Jaccard 错误率下降,但部分形状参数会退化且跨语料直接迁移仍明显变差。

 · 更新于 2026-09-24 · 约 17 分钟 · 8093 字 阅读 →
论文解读

先消近讲串扰再做视听提取:用增强近讲语音做伪标签弥合仿真与真实鸡尾酒会差距

针对多人多会话同时进行的真实鸡尾酒会转写与会话聚类问题,论文采用先用 CTRnet 消除近讲串扰再用其输出做伪标签微调 AV-TFGridNet 视听目标说话人提取的两阶段路线,在开发集上用 AV-HuBERT 转写达到 33.78% 联合错误率,代价是仍依赖说话人活动时间戳弱监督与未做提取后 ASR 适配时约 48% 说话人词错误率。

 · 更新于 2026-09-24 · 约 18 分钟 · 8626 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-14

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 57 分钟 · 28192 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

长会议听不懂也找不着:用多维图加计划智能体做可定位问答

针对长会议中声学线索缺失与上下文碎片化问题,论文把会议建成多维异构图并用计划执行反思智能体检索生成,在 LongAudioQA 三套数据上以语义准确率为证据取得领先,但迭代规划带来更高推理开销且依赖上游识别与说话人分离质量。

 · 更新于 2026-09-24 · 约 22 分钟 · 10529 字 阅读 →
论文解读

谁在何时说了什么:用双流解耦与数字时间锚做联合识别与 diarization

针对多人重叠会议中内容、说话人与时间边界相互纠缠的问题,TagSpeech 用解耦的语义与说话人双流加交错数字时间锚统一解码,在 AMI 与 AliMeeting 上以只训练投影层的低成本取得 diarization 误差的明显下降,但重叠区外的时间边界精度仍不及专用级联系统。

 · 更新于 2026-09-24 · 约 20 分钟 · 9666 字 阅读 →
论文解读

把谁和何时放进编码器:TellWhisper 的时间说话人联合建模

针对多人对话中谁在何时说话与内容难以联合对齐的问题,TellWhisper 在语音编码器内用时间说话人旋转位置编码联合建模时间与说话人活动,并用双曲空间说话人日志估计帧级活动,在真实会议数据上取得内容加说话人加时间的一致改进,但支持说话人数限于 1 至 4 人且编码器与双曲分类器仍处在不同几何空间。

 · 更新于 2026-09-24 · 约 18 分钟 · 8841 字 阅读 →
论文解读

把“谁何时说了什么”一次生成:SpeakerLM 如何统一日志与识别并兼容注册条件

针对级联式说话人日志与识别中误差传递与重叠语音难处理的问题,SpeakerLM 用音频编码器加投影器接入大语言模型的端到端多模态方案,在约 7638.95 小时数据下主指标超越最强级联基线,但小数据与仿真失配时仍明显落后。

 · 更新于 2026-09-24 · 约 18 分钟 · 8705 字 阅读 →
论文解读

边听边分清谁在说:把长历史留下来做说话人归属

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4402 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-03

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 49 分钟 · 24532 字 阅读 →