论文解读

打开语音输出反而答错:用更强的纯文本策略把交错生成拉回来

论文发现相同语音输入下交错语音文本生成的内部文本准确率大幅低于纯文本回答,提出联合输出在策略蒸馏用冻结的语音到文本策略监督学生自己的联合轨迹,在 Step-Audio-2-mini 上把输出模式差距从 42.87 降到 16.26 个百分点而语音到文本基本不变,代价是仍残留十余点差距且口语答案增益小于内部文本增益。

 · 更新于 2026-09-24 · 约 19 分钟 · 9447 字 阅读 →
论文解读

不训练也能估可懂度:Whisper 末端表示加分布距离何时比词错误率更稳

该工作研究无训练介入式可懂度预测,用冻结语音基础模型分层嵌入的参考测试分布距离代替人评,在英文编码增强与中文增强数据上显示 Whisper 末端层加 Fréchet Audio Distance 相关最强且跨语种比词错误率稳健,代价是需要成对参考与更大模型开销。

 · 更新于 2026-09-24 · 约 16 分钟 · 7721 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

语音能听懂却不会推理:用在线轨迹对齐把语音拉回文本推理线

针对语音输入推理明显弱于文本的模态推理鸿沟,论文提出非对称奖励的在线轨迹对齐框架 TARS,用表示对齐约束层间隐状态、用行为对齐约束输出语义,在 MMSU 与 OBQA 上把语音恢复率提升到 98.89 到 100.45 区间,代价是约 27.5 小时基线之上的在线强化学习与约 4.4% 额外奖励计算开销。

 · 更新于 2026-09-24 · 约 18 分钟 · 8538 字 阅读 →
论文解读

语音 token 不必个个不同:大语音模型的分层冗余与亲和合并

论文用单词对齐的逐层干预揭示浅层保留声学细节而深层可大幅压缩的层级冗余,并提出训练无关的相似度合并与双阶段压缩,在三类语义任务上减少约 27.48% 预填充计算量,但中间过渡层敏感且细粒度声学影响尚未充分验证。

 · 更新于 2026-09-24 · 约 17 分钟 · 8248 字 阅读 →
论文解读

把文字方向做成向量:语音基础模型中线性的文字表征与免训练转写控制

针对多文种语音识别中同一语言输出文字不确定的问题,论文用解码器激活均值差提取文字向量并在推理时相加,在塞尔维亚语和中文混淆缓解与跨语言罗马化、西里尔化上验证效果,但西里尔化弱语言与编码器干预仍有限。

 · 更新于 2026-09-24 · 约 23 分钟 · 11447 字 阅读 →
论文解读

说了就忘:多轮对话中语音风格为何守不住

论文把多轮语音风格保持定义为首轮指令后的逐轮指令遵循率,用同一话题与同一模拟用户测五类模型,报告首轮尚可但后续迅速退化,并显示显式回忆能部分缓解但需额外轮次代价。

 · 更新于 2026-09-24 · 约 17 分钟 · 8201 字 阅读 →
论文解读

毫秒级颅内信号能否把语音模型调向大脑的时间分层

针对功能磁共振时间分辨率不足以区分言语与语言加工阶段的问题,该工作用词 onset 对齐的皮层脑电高频信号做时空预测微调,在三个语音模型上提升脑对齐且保持下游任务,同时以时间平均与打乱对照证明毫秒结构带来额外增益,但数据仅为 9 人单播客因而覆盖与多样性受限。

 · 更新于 2026-09-24 · 约 18 分钟 · 8700 字 阅读 →
论文解读

先想后说再调工具:VoxMind 如何把语音对话做成可规划的端到端智能体

VoxMind 针对端到端语音智能体规划弱与工具多时延迟高的问题,采用先显式推理再说话与并行动动态工具管理,并在 AgentChat 上训练,主评测总体 74.57 分超越基线,但推理轨迹带来固定开销且合成数据与真实口语仍有差距。

 · 更新于 2026-09-24 · 约 18 分钟 · 8998 字 阅读 →
论文解读

说了是谁还不够:全双工语音智能体能否在正确时刻做对地板动作

论文用同一段用户语音只换提示词的方法,测显式规则与角色暗示下的抢话、倾听与让出行为,发现内容像角色不等于动作像角色,且良性冲突会跟、安全冲突仍难覆盖。

 · 更新于 2026-09-24 · 约 17 分钟 · 8224 字 阅读 →
论文解读

热启动之后再听一次:用隐状态夹角找出语义词并只在那里纠错

论文在 LoRA 适配的 ASR-LLM 中复用基座 LLM,以对应层隐状态的余弦相似度和范数比定位需语义纠错的词;单遍混合解码的平均实体错误率为 18.38%,有效搜索宽度约为贪心的 1.4 倍,双遍精修则把波束基线的 18.29% 降到 17.69%,但其总计算成本与墙钟时间未量化。

 · 更新于 2026-09-24 · 约 16 分钟 · 7795 字 阅读 →
论文解读

边听边分清谁在说:把长历史留下来做说话人归属

语音识别 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4402 字 阅读 →
论文解读

不做硬切分:用连续说话人占比给 Whisper 注入重叠感知

语音识别 | 6.2/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11582 字 阅读 →
论文解读

在并行与记忆之间找缝隙:WhisperX 如何既跑得快又记得住

语音识别 | 7.4/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10440 字 阅读 →
论文解读

从一次性生成到先诊断再重做:LoopTTS 如何让语音大模型当韵律医生

语音合成 | 7.0/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12606 字 阅读 →
论文解读

会打断、会附和,还要听得懂分寸:把“何时说话”从“说什么”里拆出来

语音交互 | 7.3/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2608 字 阅读 →
论文解读

给大模型加声学缰绳:用 0.6 nats 的似然约束把翻译式幻觉拉回转录

语音识别 | 7.8/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11082 字 阅读 →
论文解读

口音不是噪声,是距离:当母语离英语越远,ASR 的潜空间就越把你推开

语音识别 | 6.9/10

 · 更新于 2026-09-24 · 约 22 分钟 · 11019 字 阅读 →
论文解读

当语音和文本各说各话,重排器如何当翻译官?

LoRA | 5.8/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8739 字 阅读 →
论文解读

当一句非洲对话里藏着两种语言,语音识别该听哪一种?

语音识别 | 8.1/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8671 字 阅读 →