不拼向量而是换切分:用三种编码器视角训练同一个解码器
针对离散词元依赖单一编码器切分的问题,该文把三个固定自监督编码器当作同一句话的多种分词器来训练一个共享大语言模型解码器,在保持单编码器推理成本下把 WavLM 视角做到 LibriSpeech 干净集 3.30% 与其他集 8.13%,再用三路 ROVER 投票做到 3.03% 和 7.38%,代价是训练量变为三倍且泛化仍受限。
针对离散词元依赖单一编码器切分的问题,该文把三个固定自监督编码器当作同一句话的多种分词器来训练一个共享大语言模型解码器,在保持单编码器推理成本下把 WavLM 视角做到 LibriSpeech 干净集 3.30% 与其他集 8.13%,再用三路 ROVER 投票做到 3.03% 和 7.38%,代价是训练量变为三倍且泛化仍受限。
针对音素到文本重建训练用干净音素而推理遇到视觉识别错误的问题,论文提出从合成扰动到多域再到目标域伪标签的三阶段渐进训练 PECT,在 LRS2 上把 HP-VSR-FiLMFuse(L4) 从 23.3% 降到 22.2%,代价是需要五折训练视觉前端生成伪标签且仍受限于第一阶段音素质量。
针对交错式流式语音识别大模型中外部强制对齐与模型自身对齐不一致的问题,该文用冻结非流式教师的文本音频注意力经置信度回退和单调搜索构造学生训练序列,并叠加 logit 与隐状态蒸馏,以聚合错误率从 9.35% 降至 7.80% 为最强证据,代价是相同蒸馏配置下闪烁高于强制对齐对照。
针对真实扰动下单一音频伪造检测器不稳定的问题,ROGUE 用扰动智能体出难题、策略智能体按序挑选检测工具的对抗方式构造工作流,在 WaveFake 训练与多扰动和跨数据集评测中提升了平均准确率,但代价是联合搜索更贵且依赖工具多样性。
针对配对语音文本不足的目标域,该研究把同一基座大模型微调得到的目标域语言模型适配器直接加到语音识别模型参数上,在日语和英语的领域适应中报告了目标域改善,且推理时只跑单个识别模型。
该研究把时间戳与说话人归属做成对给定转录本的单遍占位填充,用双向大模型同时输出全部标签,在相同训练数据下比同类自回归模型更准且标注快一到两个数量级,但流水线总速度仍受前置语音识别限制。
该研究用不改 Whisper 结构的二次重排与浅融合接入 Mistral 7B,在 Common Voice 朗读上把词错误率从 15,28% 降到 14,18% 与 14,68%,而在 ATCO2 管制通话上最好只与 18,78% 基线统计等价,代价是权重过大时性能明显退化。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对同一录音中多组高度重叠对话的转写与分组问题,该工作用视觉门控的目标说话人长时解码做转写、用大模型话题相似度做分组,在开发集上报告约 33.7% 词错误率和 0.97 聚类 F1,但长时视觉缺失填充与模拟数据域失配仍是主要代价。
共收录 14 篇 chime-2026 会议论文的 Reader 深度解读
针对自然语言到二维均衡参数的连续控制任务,论文用约 9 万次用户交互构建非参数偏好密度奖励面,先以 GRPO 做在线结构对齐再以 DPO 做峰值注入精修,在分布外概念上以 1.5B 模型达到与 GPT-4o mini 可比的听感,代价是混合管线对分组数敏感且仅适用于低维空间。
该研究把主动规划、口头对话与非言语通信统一为一个零样本提示驱动的 LLM 代理工作流,并在 Pepper 机器人上与基于规则的多策略基线对比,主动性离线重放占优而用户体验总体接近,但推理延迟与样本不均衡仍是主要代价。
该工作把文王法起卦的偶然性放在投掷阶段、用规则加概率做实时伴奏,再把本卦之卦与动爻的经文交给大语言模型做针对性解读并转写成音乐提示词驱动生成模型,其代价是未做定量听感评估且生成音乐对细粒度语义提示不够敏感。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
针对多人同时说话造成的严重重叠与多会话分组难题,该工作保留基线说话人检测不变,主攻视听语音识别的数据清洗与模板化混合仿真并用大语言模型做会话聚类,开发集最好结果为词错误率 42.81% 与聚类分数 97.77%,代价是强单说话人骨干仍易误转干扰人且文本纠错收益有限。
针对室内社交中最多八人四会话并行且重叠率超 90% 的问题,采用每人视觉流做说话人检测分段、音频视觉目标语音抽取去干扰、音频视觉识别转写再做大模型会话聚类的级联路线,最强可复现证据是原始开发集上提交三的 32.03/16.02 到 31.39/15.70 与聚类满分,代价是多前端多后端融合与大模型多次投票的系统复杂度。
该研究把文本转音乐从一次生成波形改为持续解析为 34 字段可读合成器配置,用后台解析加前台交叉淡出的实时生成器维持不断声,最强证据是 200 条提示下嵌入检索后端全部成功且配置生成约 0.3 秒而外部大模型后端成功 178/200 且需约 5.6 秒,代价是音色泛化弱于神经音频且检索覆盖不足时会出现语义错配。
针对长时叙事音频的时间连贯与组合推理难题,AudioStory 用大语言模型做分段规划加扩散模型逐段合成,在自建 AudioStory-10K 上以显式推理和语义加残差双桥接实现更强的指令遵循,但多段拼接与长时一致性仍受训练数据和评估条件的限制。
针对印地语英语代码切换中声音对但文字错的问题,论文冻结语音编码器与指示大模型只训练 27.8M 瓶颈适配器,以 21.56% 词错误率与 20.69% 转写词错误率超过解码器微调基线,代价是依赖大模型词表与干净盲测集。