会议总览

interspeech-2026 论文深度解读

共收录 1354 篇 interspeech-2026 会议论文的 Reader 深度解读

 · 更新于 2026-10-01 · 约 2613 分钟 · 1309023 字 阅读 →
论文解读

多意图车舱语音理解为何难测:MAC-SLU 用真实指令与统一评测拉开上下文学习和微调的差距

针对车舱中文多意图口语理解缺少复杂基准的问题,论文构建含 8 域 81 意图 192 槽位的多意图数据集并统一评测多类大模型与大音频模型,报告显示上下文学习总体准确率不足 15% 而域内微调可达 60.73%,端到端模型靠避免识别误差传播追平流水线方法。

 · 更新于 2026-10-01 · 约 20 分钟 · 9597 字 阅读 →
论文解读

车里每人听各的:用人耳掩蔽去管多用户串扰的预编码

针对车内多座位语音串扰问题,该研究把心理声学掩蔽权重写入多用户 MIMO 加权最小均方误差预编码,在实车测得脉冲响应上报告 MU-MIMO-Perceptual 取得 STOI 0.859 与 ViSQOL 4.191 的最高语音质量,代价是在部分频段声对比度不及只压能量的 ACC 与 PM。

 · 更新于 2026-10-01 · 约 20 分钟 · 9897 字 阅读 →
论文解读

边说话边做事:用前后台分离让语音中断不再取消任务

针对多轮语音任务中对话与执行时间尺度不一致的问题,论文用前台对话加后台委托的编排运行时分离两者,并在 134 例座舱基准上以混合路由实现 91.04% 任务成功率,代价是需要维护任务状态、投递调度和跨会话记忆等额外机制。

 · 更新于 2026-10-01 · 约 17 分钟 · 8482 字 阅读 →
会议总览

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-10-01 · 约 247 分钟 · 123292 字 阅读 →
论文解读

车里噪音太多判不准语音:用音节级对齐重造训练标签的 SylVAD

针对车内发动机与路噪导致 Silero VAD 误检多、人工标注难的问题,SylVAD 用韩语音节级 MFA 自动构造标签并以噪声加权损失微调,在实车日志上把非语音段误检数从 3243 降到 1475,F1 从 0.9372 提升到 0.9556,代价是依赖文本与对齐分数过滤且推理结构不变。

 · 更新于 2026-10-01 · 约 16 分钟 · 7642 字 阅读 →
论文解读

Drive-to-Music: Context-Aware Generative Audio for In-Vehicle Experiences

音乐生成 | 5.2/10

 · 更新于 2026-10-01 · 约 15 分钟 · 7478 字 阅读 →
论文解读

InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring

多模态模型 | 7.3/10

 · 更新于 2026-10-01 · 约 12 分钟 · 5751 字 阅读 →
论文解读

Perceived Annoyance in Multi-source Electric Vehicle AVAS Environments

音频质量评估 | 3.5/10

 · 更新于 2026-10-01 · 约 19 分钟 · 9113 字 阅读 →
论文解读

6G Communication Networks Enabling Embodied Agents: Architecture and Prototype

信号处理 | 2.7/10

 · 更新于 2026-10-01 · 约 13 分钟 · 6088 字 阅读 →