每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

合流者不拉开距离、清晰者主动靠近:粤语三六声调在对话中如何对齐音高区间

论文用十对多合流与少合流粤语者的无脚本密室游戏对话检验声调超音段适应,发现少合流者缩小三声与六声的归一化基频距离以靠近多合流者、两组在对话末尾对齐而前后朗读无变化,支持目标驱动的音高区间趋同而非简单的去合流模仿。

 · 更新于 2026-09-24 · 约 18 分钟 · 8822 字 阅读 →
论文解读

误会迫使换权重:英语者缩短松元音,日语与普通话者走向不同维度

该研究用协作放图游戏诱发英语紧松元音误会并以归一化时间为轴跟踪 F1、F2 与时长占比,发现英语者在与日语者对话时缩短/ɪ/扩大时长区分、普通话者降低/ɑ/的 F1 与 F2 扩大频谱区分且超过英语均值,而对话前后朗读无保持,代价是每组仅 5 对且只报告两组元音。

 · 更新于 2026-09-24 · 约 20 分钟 · 9910 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
论文解读

零前视下全身协调:LiveGesture 用分区域专家加因果融合做流式手势

LiveGesture 针对实时对话中不能等待整句语音的手势生成问题,采用可流式解码的分区运动词表加区域专家与因果空时融合,在 BEAT2 上以零前视达到与离线方法可比的真实感与节拍同步,但面部顶点误差与首包延迟仍受音频编码与自回归漂移约束。

 · 更新于 2026-09-24 · 约 21 分钟 · 10263 字 阅读 →
论文解读

无菌环境下不敢动手:语音多智能体如何接管手术室设备控制与延迟

针对无菌手术室中多设备协调控制难与语音交互延迟高的问题,论文提出分层语音流水线加智能体核心的 SurgicalRoomAgent,用 KV 缓存预热、流式提前执行与渐进式提示披露降低延迟与上下文压力,但所报告的延迟数字为理论估计且缺乏大规模临床验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8706 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

幻影威胁:物理传感器攻击如何让视觉-语言-动作模型失手,又如何加固

论文针对视觉-语言-动作模型的摄像头与麦克风输入,研究用激光、电磁、超声等物理信号注入的八种攻击如何导致任务失败,并用先干净训练再混入攻击数据的对抗训练在保持干净性能的同时提升中强度攻击下的鲁棒性,代价是干净集平均约 3% 的下降与部分强攻击仍难完全防住。

 · 更新于 2026-09-24 · 约 21 分钟 · 10495 字 阅读 →
论文解读

从单人情绪标签转向多人声音互动场:耦合只在共同在场时出现

该文把情感计算的主单元从个人状态改为多人声音构成的互动场,用 WavLM 连续表征加零校准的格兰杰方向耦合检验,在 AMI 四人会议上显示微秒级重叠语音有约加 6.6 至加 7.4 个百分点的超额拒绝而独占语音趋近于零,代价是宏观尺度样本不足且只在 AMI 内验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8971 字 阅读 →
论文解读

发音纠错不能只给分数:让音频语言模型说出错在哪、怎么练

论文研究朗读式聊天发音训练,用 L2-Arctic-plus 提供词级错误解释与可操作建议,通过两阶段指令微调音频语言模型,在误读检测与建议生成上超过级联 ASR 加 LLM 和现有开源模型,代价是依赖合成标注与朗读场景。

 · 更新于 2026-09-24 · 约 18 分钟 · 8778 字 阅读 →
论文解读

从注视到聆听:LipCoder 把 AI 编程装进语音闭环

LipCoder 针对视障程序员在可视编辑器与 AI 补全中被迫逐行听屏的断裂,用语音输入与听觉输出统一导航理解修改验证,在 5 名视障被试的探索性对照中可用性数值向好但校正后均不显著,且强依赖识别与大模型可靠性。

 · 更新于 2026-09-24 · 约 18 分钟 · 9013 字 阅读 →
论文解读

轮次向真实语音学,语义向可配文本学:有限状态机全双工的解耦数据路线

针对合成文本同时学轮次与语义不可靠的问题,该工作用真实人与人语音学轮次、用可改写的人与智能体文本保语义,配合规则化事件转磁带与来源感知校准损失,在等量 token 下把轮次 F1 从约 0.34 提升到约 0.65 并把语义恢复到接近基座上限,代价是暂停处理仍弱于保守系统且单带离散化会丢信息。

 · 更新于 2026-09-24 · 约 18 分钟 · 8979 字 阅读 →
论文解读

说了是谁还不够:全双工语音智能体能否在正确时刻做对地板动作

论文用同一段用户语音只换提示词的方法,测显式规则与角色暗示下的抢话、倾听与让出行为,发现内容像角色不等于动作像角色,且良性冲突会跟、安全冲突仍难覆盖。

 · 更新于 2026-09-24 · 约 17 分钟 · 8224 字 阅读 →
论文解读

想练好一句难开口的话,机器得先学会怎么“演人”:Conversation Coach 的延迟与演技取舍

语音交互 | 6.3/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12239 字 阅读 →
论文解读

别再让大模型把“3.45 美元”直接念出来:用 40 个可解释特征把文本对齐到可朗读

语音合成 | 7.4/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11235 字 阅读 →
论文解读

会打断、会附和,还要听得懂分寸:把“何时说话”从“说什么”里拆出来

语音交互 | 7.3/10

 · 更新于 2026-09-24 · 约 6 分钟 · 2608 字 阅读 →
论文解读

0.76 分里的诚实:当语音失灵时,眼睛如何泄露下一句话的时机

语音交互 | 6.0/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9435 字 阅读 →
论文解读

听错一句,机器就敢动手:语音误差如何撬开具身智能的安全锁

语音交互 | 5.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8038 字 阅读 →
论文解读

先分清状态,再决定能不能说话:Anian 如何把生成关进安全笼子

语音交互 | 5.0/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8236 字 阅读 →