会议总览
interspeech-2026 论文深度解读
共收录 1354 篇 interspeech-2026 会议论文的 Reader 深度解读
共收录 1354 篇 interspeech-2026 会议论文的 Reader 深度解读
针对车舱中文多意图口语理解缺少复杂基准的问题,论文构建含 8 域 81 意图 192 槽位的多意图数据集并统一评测多类大模型与大音频模型,报告显示上下文学习总体准确率不足 15% 而域内微调可达 60.73%,端到端模型靠避免识别误差传播追平流水线方法。
针对车内多座位语音串扰问题,该研究把心理声学掩蔽权重写入多用户 MIMO 加权最小均方误差预编码,在实车测得脉冲响应上报告 MU-MIMO-Perceptual 取得 STOI 0.859 与 ViSQOL 4.191 的最高语音质量,代价是在部分频段声对比度不及只压能量的 ACC 与 PM。
针对多轮语音任务中对话与执行时间尺度不一致的问题,论文用前台对话加后台委托的编排运行时分离两者,并在 134 例座舱基准上以混合路由实现 91.04% 任务成功率,代价是需要维护任务状态、投递调度和跨会话记忆等额外机制。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对车内发动机与路噪导致 Silero VAD 误检多、人工标注难的问题,SylVAD 用韩语音节级 MFA 自动构造标签并以噪声加权损失微调,在实车日志上把非语音段误检数从 3243 降到 1475,F1 从 0.9372 提升到 0.9556,代价是依赖文本与对齐分数过滤且推理结构不变。
音乐生成 | 5.2/10
多模态模型 | 7.3/10
音频质量评估 | 3.5/10
信号处理 | 2.7/10