多人同场说话时,助手先要判断该不该开口、再判断替谁做事
MSI-Bench 用 1152 个多人多轮语音场景考查说话人限定的记忆、指令跟随与推理,最强配置英文全通过率仅 66.8%、中文 54.5%,开源模型主要卡在多人语音感知,前沿模型则卡在干净文本上的说话人限定决策与开口克制。
MSI-Bench 用 1152 个多人多轮语音场景考查说话人限定的记忆、指令跟随与推理,最强配置英文全通过率仅 66.8%、中文 54.5%,开源模型主要卡在多人语音感知,前沿模型则卡在干净文本上的说话人限定决策与开口克制。
共分析 42 篇语音/AI 论文
该工作用隐式提示迫使模型从互补的多模态证据中推断缺失事件并用生成视频表达,在 517 个实例上 MiniMax-H3 总体成功率报告为 41.97%,其中视频决策最好而音频消歧最弱,说明多模态支持尚未转化为可靠推理。
针对泰卢固语语音事实问答缺少基准与评测不可靠问题,VākQA 用 2001 对真人 quiz 语音与双语转写先校准自动评测再测问答,发现 Gemini 作答与做裁判均领先但仍受语言、模态与级联误差影响且文化域最敏感。
共分析 36 篇语音/AI 论文
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该研究用 12 句自然叙述录音让 245 名听者做二选一变体判断,总准确率 64.7% 高于机遇,但单语和西班牙语主导者约 70% 而遗产双语者仅 58.8%,且回归显示听者画像效应稳健而熟练度和接触量不再显著。
该研究用 48 段高兴与生气冲突或一致的动态视听短片加眼动追踪,检验 27 名人工耳蜗学龄前儿童与 25 名健听同龄人的线索权重与注视分配,发现人工耳蜗组在冲突时显著偏向面孔且眼口注视更均衡,代价是听觉线索利用不足与注视表现关联缺失。
该文把 CFPR 扩展为八类口音评测基准并做 87 人听辨实验,再用冻结的 MMS-LID-256 训练八分类器,报告在 CFPR 上整体准确率 40.98% 而人类多数投票为 70.4%,代价是中部与东部分类互相混淆且增强后大类反而下降。
该研究以法语单音节与双音节无意义词为材料,用声学时长与喉头仪信号加听辨实验检验耳语中清浊对立的保持机制,最强证据是耳语仍可听辨且时长对比基本保留,代价是塞音后接口塞音时尾音节清浊时长对比消失。
该研究用说话人嵌入加回归器做年龄估计,再用成对听辨实验对照人类表现,显示系统误差能预测人耳难易,且双方共享基频等声学线索而人耳额外依赖语速节奏,但数据不均衡与噪声限制了结论外推。
该研究用口语词云重组任务检验形容词长度与介词短语类型对法语形容词前置率的影响,最强证据是长形容词主效应系数 -2.29 且名词补语与动词补语都提升前置率,代价是韵律模式仍在分析中且样本限于双音节名词与特定音节组合。
该研究用 40 个法语西班牙语非言语声音做四选一情绪识别,报告年龄越大识别越准、喜悦悲伤优于恐惧、非言语声优于句子、五岁双语儿童优于单语,但样本小且组间不均衡使语言效应只能算探索性发现。
论文把词入侵测试搬到说话人表示上,用 Top-K 稀疏自编码器从 ECAPA-TDNN 嵌入中抽出 500 维稀疏维度,再靠 22 人听辨找侵入者,结果显示只有噪声、口音和语言等少数维度可被人感知,而低典型性并不保证可解释,一致性余弦分数则与判对显著相关。
该研究用双音节词对绕口令式重复任务检验重音格是否独立于音段被计划,初步显示时长无主效应但重复次数与错误数支持抽象格,代价是样本仅 36 人且功效不足。
针对西班牙语初学者学法语难元音的问题,该研究用五天个性化重读双音节无意义词训练比较四种隐性纠正反馈,发现以声学距离度量的元音产出普遍改善且超韵律操控组优势显著,但未报告可听度与长期保持之外的代价细节。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
用影子跟读检验香港粤语 T2-T5 与 T3-T6 并调是否向相反声调启动靠拢,最强证据是基线可分而跟读出现中度与强趋同且真人强于 AI、视频强于图片,代价是合并者仅每对 2 人而无法定论。
论文以天津话嘛的疑问与否定两读为对象,用感知辨义与诱导产出两组实验说明无句法语境线索时存在真歧义,而时长、音强、最大基频与基频域等韵律线索可部分补足区分,但加工更慢且分布因有无句法标记而转移。