论文解读

不用文字推理链,改向波形预测表示学推理:JELAR 的声学条件潜推理

针对文本链条与音频证据脱节的问题,JELAR 用冻结 WavJEPA 波形表示构造连续潜推理目标替代文本 CoT,在受控对比中 MMAU-mini 从 59.70% 到 62.40%、MMAR 从 43.70% 到 52.80%,代价是训练需非因果专家且推理仍需固定 20 步潜嵌入。

 · 更新于 2026-10-01 · 约 16 分钟 · 7906 字 阅读 →
论文解读

被打断后还像同一个人:CharDuplex 用双流时序加角色验证管线训练全双工语音对话

针对全双工语音模型在实时打断和多轮追问中容易丢失角色身份的问题,CharDuplex 把 GLM-4-Voice 改成双流同步结构并用自动生成加验证的角色语音数据做监督微调,再用 FDGym 在线交互强化学习修正角色一致性,最强证据是 SpeechRole-Eval 平均 0.785 分且通用与交互指标大体稳定,代价是依赖大规模合成语音与在线仿真采样的训练预 …

 · 更新于 2026-10-01 · 约 22 分钟 · 10824 字 阅读 →
论文解读

先看脸排座次再听说话:音视频大模型的序数配对捷径

该文针对多说话人场景下谁说了哪句话的归因失败,用动物合成诊断集揭示按画面位置顺序配对语音顺序的偏置,并用 400 个位置与顺序解耦的合成视频微调在真实基准上为 Qwen2.5-Omni 带来平均 8.27% 增益。

 · 更新于 2026-10-01 · 约 20 分钟 · 9991 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-30

共分析 93 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 179 分钟 · 89435 字 阅读 →
论文解读

只有 14 小时标注也能做识别:Basaà语调迁移与字符级解码的第一条基线

针对标注稀缺且带声调和形态变化的 Basaà语,研究用多语言自监督表示 XLS-R 做微调,在 1671 条测试上报告词错误率 14.13% 和字错误率 3.51%,代价是方言覆盖窄且声调细节仍易错。

 · 更新于 2026-10-01 · 约 17 分钟 · 8184 字 阅读 →
论文解读

整句判情绪为何不够:把情绪放回语音时间轴上的定位与训练

针对整句单标签无法定位多人多事件录音中情绪归属的问题,论文把任务改写为带起止时间的语音段结构化预测,并用掩蔽情绪与距离加权时间戳辅助损失训练 EMO-TAG,在 MELD 和 IEMOCAP 多段定位与单句识别上超过所比基线,但代价是两次前向与精心清洗的多段构造流程。

 · 更新于 2026-10-01 · 约 19 分钟 · 9407 字 阅读 →
会议总览

interspeech-2026 论文深度解读

共收录 1354 篇 interspeech-2026 会议论文的 Reader 深度解读

 · 更新于 2026-10-01 · 约 2613 分钟 · 1309023 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-29

共分析 43 篇语音/AI 论文

 · 更新于 2026-10-01 · 约 81 分钟 · 40144 字 阅读 →
论文解读

把声音放在前面:用角色化语音让日语风格差异可听可见

该展示论文要解决如何让学习者在移动端直接听到和比较虚构角色的日语风格差异,选择人物条件大语言模型加角色专用合成语音加点击查词的完整交互环,不做离线评测与学习效果验证,代价是风格化口语不适合正式场合且噪声下依赖文本输入保底。

 · 更新于 2026-10-01 · 约 15 分钟 · 7470 字 阅读 →
论文解读

把停顿钉在文字上:用逐字转写加对齐让大模型判断构音障碍的不恰当停顿

针对卒中后构音障碍朗读中停顿是否恰当难自动评的问题,论文用逐字 Whisper 转写加 MFA 对齐与 VAD 修正再交大模型分类,专家评定上轻中度组宏 F1 达 0.68,加入不恰当停顿特征使构音障碍检出宏准确率提升 8.4 个百分点,但重度组因转写不可靠未纳入定量评价。

 · 更新于 2026-10-01 · 约 21 分钟 · 10195 字 阅读 →
论文解读

从词到时间图:把饼干失窃描述变成可计算的叙事轨迹

针对饼干失窃图描述任务,该研究用微调伯特模型做 23 类内容信息单元识别并用层相关传播定位时间,再把单元转移建模为带时间间隔权重的有向时序图,证据是手动转录上 F1 为 0.879 左右而临床组表现出更少独立节点和更长转移间隔,代价是动作类定位精度偏低且长叙事需要按词数归一化。

 · 更新于 2026-10-01 · 约 16 分钟 · 7773 字 阅读 →
论文解读

让 Whisper 边转写边标假词:只改标注不改模型的低成本尝试

论文把部分伪造 utterance 中合成词定位问题并入 Whisper 的下一词预测,用前后标记包住假词并用部分声码器重合成词降低数据成本,同域上检测与转写与专用 ResNet 相当,但跨合成器与跨域时明显退化。

 · 更新于 2026-10-01 · 约 17 分钟 · 8259 字 阅读 →
论文解读

小数据微调为何越调越偏:纯 GRPO 能否保住域外检测能力

论文固定后训练检查点比较监督微调与组相对策略优化微调,报告纯 GRPO 在域内持平而四个域外集回升,但强正则欠拟合与去掉负奖励变差构成主要代价。

 · 更新于 2026-10-01 · 约 16 分钟 · 7606 字 阅读 →
论文解读

微调配比动不了的偏差,从头训练却能翻转:预训练表征如何掩盖性别构成效应

论文用三数据集、四系统、十一档性别配比共 132 次训练检验微调能否揭示构成与偏差关系,最强证据是 Kaldi 从头训练下 DDS 随女性占比单调翻转超 80 个百分点而三预训练模型始终在约±12 内无序波动,代价是平衡微调数据不足以修复预训练带来的偏差。

 · 更新于 2026-10-01 · 约 16 分钟 · 7729 字 阅读 →
论文解读

低资源也有高质量:用语言学定制数据加自监督模型做阿姆哈拉语和阿凡奥罗莫语合成

该工作针对阿姆哈拉语和阿凡奥罗莫语从零搭建录音室级多说话人语音合成数据与基于 SpeechT5 的微调流程,用 100 小时加 13 小时针对性数据的规模与主观平均意见分 4.65 和 4.43 证明语言学知情数据是关键,代价是同形异义消歧仍依赖规范化输入且未开源验证。

 · 更新于 2026-10-01 · 约 16 分钟 · 7726 字 阅读 →
论文解读

只给一句话守候意图,模型何时该开口、何时该沉默

论文把连续监听下的何时提醒形式化为四态决策,用打断与静默两种解码标记在 Qwen2-Audio-7B 上实现主动辅助,在 ESC-50 上报告 99.6% 打断 F1 与 100% 去重召回,在 Epic-Sounds 零样本下保持 96.7% 起始召回,代价是噪声域静默召回偏低且平均延迟约 3.5 秒。

 · 更新于 2026-10-01 · 约 18 分钟 · 8950 字 阅读 →
论文解读

重度构音障碍语音并非不可建模:21 小时单人数据如何让常规与大模型都学会

针对可懂度仅 20.9% 的重度构音障碍单人长时数据,论文用 BLSTM-HMM 从零训练与 Whisper 英文模型微调做说话人相关识别,并把微调后的 medium 模型泛化到 TORGO,最强证据是 medium 测试词错误率 10.5% 与重度组平均 6.4 个百分点改善,代价是需要十小时级单人数据与大模型微调成本且极重度个案未获益。

 · 更新于 2026-10-01 · 约 19 分钟 · 9300 字 阅读 →
论文解读

不用模拟后端也能训练前后端:随机化中间引导让真人对话接管串联语音对话

针对串联语音对话缺少训练时中间引导的问题,该研究用目标回答加随机采样回答构造引导流,在合成对话上达到与大模型模拟相当的回答质量,并在 3.8k 小时真实对话上提升轮转顺滑度和听感自然度,代价是打断处理仍弱且真实数据模型回答分略低于合成基线。

 · 更新于 2026-10-01 · 约 17 分钟 · 8375 字 阅读 →
论文解读

五十小时能做富格式医疗转写吗:拉脱维亚语端到端与两阶段路线的对照

针对拉脱维亚语医疗口述的富格式转写问题,论文比较直接生成格式文本的端到端微调与先逐字转写再用大模型格式化的两阶段路线,最强证据是微调 Whisper-large-v3 加 75 小时伪标注数据达到 10.6% 词错误率,代价是幻觉风险与格式细节仍需人工校验。

 · 更新于 2026-10-01 · 约 18 分钟 · 8609 字 阅读 →
论文解读

野外影视学表达:用属性思考令牌把开放指令和音色解耦

针对自然语言细粒度表达难控与参考音频风格泄漏问题,Poly-InstructTTS 用 1000 小时影视多模态指令数据训练无提示音频的 GPT 加流匹配声学模块,在 InstructTTSEval 上取得高指令跟随分,但以词错误率上升与复杂声学条件不稳为代价。

 · 更新于 2026-10-01 · 约 19 分钟 · 9229 字 阅读 →