不用文字推理链,改向波形预测表示学推理:JELAR 的声学条件潜推理
针对文本链条与音频证据脱节的问题,JELAR 用冻结 WavJEPA 波形表示构造连续潜推理目标替代文本 CoT,在受控对比中 MMAU-mini 从 59.70% 到 62.40%、MMAR 从 43.70% 到 52.80%,代价是训练需非因果专家且推理仍需固定 20 步潜嵌入。
针对文本链条与音频证据脱节的问题,JELAR 用冻结 WavJEPA 波形表示构造连续潜推理目标替代文本 CoT,在受控对比中 MMAU-mini 从 59.70% 到 62.40%、MMAR 从 43.70% 到 52.80%,代价是训练需非因果专家且推理仍需固定 20 步潜嵌入。
针对全双工语音模型在实时打断和多轮追问中容易丢失角色身份的问题,CharDuplex 把 GLM-4-Voice 改成双流同步结构并用自动生成加验证的角色语音数据做监督微调,再用 FDGym 在线交互强化学习修正角色一致性,最强证据是 SpeechRole-Eval 平均 0.785 分且通用与交互指标大体稳定,代价是依赖大规模合成语音与在线仿真采样的训练预 …
该文针对多说话人场景下谁说了哪句话的归因失败,用动物合成诊断集揭示按画面位置顺序配对语音顺序的偏置,并用 400 个位置与顺序解耦的合成视频微调在真实基准上为 Qwen2.5-Omni 带来平均 8.27% 增益。
共分析 93 篇语音/AI 论文
针对标注稀缺且带声调和形态变化的 Basaà语,研究用多语言自监督表示 XLS-R 做微调,在 1671 条测试上报告词错误率 14.13% 和字错误率 3.51%,代价是方言覆盖窄且声调细节仍易错。
针对整句单标签无法定位多人多事件录音中情绪归属的问题,论文把任务改写为带起止时间的语音段结构化预测,并用掩蔽情绪与距离加权时间戳辅助损失训练 EMO-TAG,在 MELD 和 IEMOCAP 多段定位与单句识别上超过所比基线,但代价是两次前向与精心清洗的多段构造流程。
共收录 1354 篇 interspeech-2026 会议论文的 Reader 深度解读
共分析 43 篇语音/AI 论文
该展示论文要解决如何让学习者在移动端直接听到和比较虚构角色的日语风格差异,选择人物条件大语言模型加角色专用合成语音加点击查词的完整交互环,不做离线评测与学习效果验证,代价是风格化口语不适合正式场合且噪声下依赖文本输入保底。
针对卒中后构音障碍朗读中停顿是否恰当难自动评的问题,论文用逐字 Whisper 转写加 MFA 对齐与 VAD 修正再交大模型分类,专家评定上轻中度组宏 F1 达 0.68,加入不恰当停顿特征使构音障碍检出宏准确率提升 8.4 个百分点,但重度组因转写不可靠未纳入定量评价。
针对饼干失窃图描述任务,该研究用微调伯特模型做 23 类内容信息单元识别并用层相关传播定位时间,再把单元转移建模为带时间间隔权重的有向时序图,证据是手动转录上 F1 为 0.879 左右而临床组表现出更少独立节点和更长转移间隔,代价是动作类定位精度偏低且长叙事需要按词数归一化。
论文把部分伪造 utterance 中合成词定位问题并入 Whisper 的下一词预测,用前后标记包住假词并用部分声码器重合成词降低数据成本,同域上检测与转写与专用 ResNet 相当,但跨合成器与跨域时明显退化。
论文固定后训练检查点比较监督微调与组相对策略优化微调,报告纯 GRPO 在域内持平而四个域外集回升,但强正则欠拟合与去掉负奖励变差构成主要代价。
论文用三数据集、四系统、十一档性别配比共 132 次训练检验微调能否揭示构成与偏差关系,最强证据是 Kaldi 从头训练下 DDS 随女性占比单调翻转超 80 个百分点而三预训练模型始终在约±12 内无序波动,代价是平衡微调数据不足以修复预训练带来的偏差。
该工作针对阿姆哈拉语和阿凡奥罗莫语从零搭建录音室级多说话人语音合成数据与基于 SpeechT5 的微调流程,用 100 小时加 13 小时针对性数据的规模与主观平均意见分 4.65 和 4.43 证明语言学知情数据是关键,代价是同形异义消歧仍依赖规范化输入且未开源验证。
论文把连续监听下的何时提醒形式化为四态决策,用打断与静默两种解码标记在 Qwen2-Audio-7B 上实现主动辅助,在 ESC-50 上报告 99.6% 打断 F1 与 100% 去重召回,在 Epic-Sounds 零样本下保持 96.7% 起始召回,代价是噪声域静默召回偏低且平均延迟约 3.5 秒。
针对可懂度仅 20.9% 的重度构音障碍单人长时数据,论文用 BLSTM-HMM 从零训练与 Whisper 英文模型微调做说话人相关识别,并把微调后的 medium 模型泛化到 TORGO,最强证据是 medium 测试词错误率 10.5% 与重度组平均 6.4 个百分点改善,代价是需要十小时级单人数据与大模型微调成本且极重度个案未获益。
针对串联语音对话缺少训练时中间引导的问题,该研究用目标回答加随机采样回答构造引导流,在合成对话上达到与大模型模拟相当的回答质量,并在 3.8k 小时真实对话上提升轮转顺滑度和听感自然度,代价是打断处理仍弱且真实数据模型回答分略低于合成基线。
针对拉脱维亚语医疗口述的富格式转写问题,论文比较直接生成格式文本的端到端微调与先逐字转写再用大模型格式化的两阶段路线,最强证据是微调 Whisper-large-v3 加 75 小时伪标注数据达到 10.6% 词错误率,代价是幻觉风险与格式细节仍需人工校验。
针对自然语言细粒度表达难控与参考音频风格泄漏问题,Poly-InstructTTS 用 1000 小时影视多模态指令数据训练无提示音频的 GPT 加流匹配声学模块,在 InstructTTSEval 上取得高指令跟随分,但以词错误率上升与复杂声学条件不稳为代价。