speechprosody-2026 论文深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
论文用十对多合流与少合流粤语者的无脚本密室游戏对话检验声调超音段适应,发现少合流者缩小三声与六声的归一化基频距离以靠近多合流者、两组在对话末尾对齐而前后朗读无变化,支持目标驱动的音高区间趋同而非简单的去合流模仿。
该研究用协作放图游戏诱发英语紧松元音误会并以归一化时间为轴跟踪 F1、F2 与时长占比,发现英语者在与日语者对话时缩短/ɪ/扩大时长区分、普通话者降低/ɑ/的 F1 与 F2 扩大频谱区分且超过英语均值,而对话前后朗读无保持,代价是每组仅 5 对且只报告两组元音。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
LiveGesture 针对实时对话中不能等待整句语音的手势生成问题,采用可流式解码的分区运动词表加区域专家与因果空时融合,在 BEAT2 上以零前视达到与离线方法可比的真实感与节拍同步,但面部顶点误差与首包延迟仍受音频编码与自回归漂移约束。
针对无菌手术室中多设备协调控制难与语音交互延迟高的问题,论文提出分层语音流水线加智能体核心的 SurgicalRoomAgent,用 KV 缓存预热、流式提前执行与渐进式提示披露降低延迟与上下文压力,但所报告的延迟数字为理论估计且缺乏大规模临床验证。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
论文针对视觉-语言-动作模型的摄像头与麦克风输入,研究用激光、电磁、超声等物理信号注入的八种攻击如何导致任务失败,并用先干净训练再混入攻击数据的对抗训练在保持干净性能的同时提升中强度攻击下的鲁棒性,代价是干净集平均约 3% 的下降与部分强攻击仍难完全防住。
该文把情感计算的主单元从个人状态改为多人声音构成的互动场,用 WavLM 连续表征加零校准的格兰杰方向耦合检验,在 AMI 四人会议上显示微秒级重叠语音有约加 6.6 至加 7.4 个百分点的超额拒绝而独占语音趋近于零,代价是宏观尺度样本不足且只在 AMI 内验证。
论文研究朗读式聊天发音训练,用 L2-Arctic-plus 提供词级错误解释与可操作建议,通过两阶段指令微调音频语言模型,在误读检测与建议生成上超过级联 ASR 加 LLM 和现有开源模型,代价是依赖合成标注与朗读场景。
LipCoder 针对视障程序员在可视编辑器与 AI 补全中被迫逐行听屏的断裂,用语音输入与听觉输出统一导航理解修改验证,在 5 名视障被试的探索性对照中可用性数值向好但校正后均不显著,且强依赖识别与大模型可靠性。
针对合成文本同时学轮次与语义不可靠的问题,该工作用真实人与人语音学轮次、用可改写的人与智能体文本保语义,配合规则化事件转磁带与来源感知校准损失,在等量 token 下把轮次 F1 从约 0.34 提升到约 0.65 并把语义恢复到接近基座上限,代价是暂停处理仍弱于保守系统且单带离散化会丢信息。
论文用同一段用户语音只换提示词的方法,测显式规则与角色暗示下的抢话、倾听与让出行为,发现内容像角色不等于动作像角色,且良性冲突会跟、安全冲突仍难覆盖。
语音交互 | 6.3/10
语音合成 | 7.4/10
语音交互 | 7.3/10
语音交互 | 6.0/10
语音交互 | 5.1/10
语音交互 | 5.0/10