论文解读

多人同场说话时,助手先要判断该不该开口、再判断替谁做事

MSI-Bench 用 1152 个多人多轮语音场景考查说话人限定的记忆、指令跟随与推理,最强配置英文全通过率仅 66.8%、中文 54.5%,开源模型主要卡在多人语音感知,前沿模型则卡在干净文本上的说话人限定决策与开口克制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8849 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-23

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 77 分钟 · 38502 字 阅读 →
论文解读

能接收多模态不等于会联合推理:MiniMax-H3 物理世界推理的隐式评估

该工作用隐式提示迫使模型从互补的多模态证据中推断缺失事件并用生成视频表达,在 517 个实例上 MiniMax-H3 总体成功率报告为 41.97%,其中视频决策最好而音频消歧最弱,说明多模态支持尚未转化为可靠推理。

 · 更新于 2026-09-24 · 约 23 分钟 · 11496 字 阅读 →
论文解读

泰卢固语先出声再作答:VākQA 如何把语音、转写与评测分开检验

针对泰卢固语语音事实问答缺少基准与评测不可靠问题,VākQA 用 2001 对真人 quiz 语音与双语转写先校准自动评测再测问答,发现 Gemini 作答与做裁判均领先但仍受语言、模态与级联误差影响且文化域最敏感。

 · 更新于 2026-09-24 · 约 20 分钟 · 9667 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-18

共分析 36 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 67 分钟 · 33126 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

能听出“歌唱腔”和“敲击腔”吗:墨西哥西班牙语韵律变体靠早期经验来分辨

该研究用 12 句自然叙述录音让 245 名听者做二选一变体判断,总准确率 64.7% 高于机遇,但单语和西班牙语主导者约 70% 而遗产双语者仅 58.8%,且回归显示听者画像效应稳健而熟练度和接触量不再显著。

 · 更新于 2026-09-24 · 约 17 分钟 · 8140 字 阅读 →
论文解读

当脸和声音吵架时,人工耳蜗学龄前儿童为什么更信脸

该研究用 48 段高兴与生气冲突或一致的动态视听短片加眼动追踪,检验 27 名人工耳蜗学龄前儿童与 25 名健听同龄人的线索权重与注视分配,发现人工耳蜗组在冲突时显著偏向面孔且眼口注视更均衡,代价是听觉线索利用不足与注视表现关联缺失。

 · 更新于 2026-09-24 · 约 17 分钟 · 8194 字 阅读 →
论文解读

八类法语口音为何难分:小而偏的训练集与人类听辨上限共同设限

该文把 CFPR 扩展为八类口音评测基准并做 87 人听辨实验,再用冻结的 MMS-LID-256 训练八分类器,报告在 CFPR 上整体准确率 40.98% 而人类多数投票为 70.4%,代价是中部与东部分类互相混淆且增强后大类反而下降。

 · 更新于 2026-09-24 · 约 20 分钟 · 9907 字 阅读 →
论文解读

声带不振动时,法语清浊对立靠时长和邻音保住,但塞音连缀会中和

该研究以法语单音节与双音节无意义词为材料,用声学时长与喉头仪信号加听辨实验检验耳语中清浊对立的保持机制,最强证据是耳语仍可听辨且时长对比基本保留,代价是塞音后接口塞音时尾音节清浊时长对比消失。

 · 更新于 2026-09-24 · 约 19 分钟 · 9098 字 阅读 →
论文解读

机器和人耳都会听错年龄:误差从何而来,又靠哪些声学线索解释

该研究用说话人嵌入加回归器做年龄估计,再用成对听辨实验对照人类表现,显示系统误差能预测人耳难易,且双方共享基频等声学线索而人耳额外依赖语速节奏,但数据不均衡与噪声限制了结论外推。

 · 更新于 2026-09-24 · 约 18 分钟 · 8983 字 阅读 →
论文解读

法语形容词前后位置之争:句法邻近要求与韵律分组如何共同起作用

该研究用口语词云重组任务检验形容词长度与介词短语类型对法语形容词前置率的影响,最强证据是长形容词主效应系数 -2.29 且名词补语与动词补语都提升前置率,代价是韵律模式仍在分析中且样本限于双音节名词与特定音节组合。

 · 更新于 2026-09-24 · 约 20 分钟 · 9856 字 阅读 →
论文解读

四到七岁听出喜怒哀惧:语言复杂度、目标情绪与双语经验如何分工

该研究用 40 个法语西班牙语非言语声音做四选一情绪识别,报告年龄越大识别越准、喜悦悲伤优于恐惧、非言语声优于句子、五岁双语儿童优于单语,但样本小且组间不均衡使语言效应只能算探索性发现。

 · 更新于 2026-09-24 · 约 21 分钟 · 10083 字 阅读 →
论文解读

稀疏了却不一定可解释:说话人入侵测试检验维度可解释性

论文把词入侵测试搬到说话人表示上,用 Top-K 稀疏自编码器从 ECAPA-TDNN 嵌入中抽出 500 维稀疏维度,再靠 22 人听辨找侵入者,结果显示只有噪声、口音和语言等少数维度可被人感知,而低典型性并不保证可解释,一致性余弦分数则与判对显著相关。

 · 更新于 2026-09-24 · 约 19 分钟 · 9247 字 阅读 →
论文解读

重叠只是难念,还是真的在抢同一个节律槽位:语音计划中有没有抽象重音格

该研究用双音节词对绕口令式重复任务检验重音格是否独立于音段被计划,初步显示时长无主效应但重复次数与错误数支持抽象格,代价是样本仅 36 人且功效不足。

 · 更新于 2026-09-24 · 约 19 分钟 · 9447 字 阅读 →
论文解读

调超韵律参数为何比直接调共振峰更能纠正法语元音

针对西班牙语初学者学法语难元音的问题,该研究用五天个性化重读双音节无意义词训练比较四种隐性纠正反馈,发现以声学距离度量的元音产出普遍改善且超韵律操控组优势显著,但未报告可听度与长期保持之外的代价细节。

 · 更新于 2026-09-24 · 约 21 分钟 · 10475 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

听到错调是纠正还是跟读:粤语并调对真人与 AI 的语音趋同

用影子跟读检验香港粤语 T2-T5 与 T3-T6 并调是否向相反声调启动靠拢,最强证据是基线可分而跟读出现中度与强趋同且真人强于 AI、视频强于图片,代价是合并者仅每对 2 人而无法定论。

 · 更新于 2026-09-24 · 约 21 分钟 · 10331 字 阅读 →
论文解读

同形“买嘛”如何分义:天津话疑问与否定共用形式下的韵律分工

论文以天津话嘛的疑问与否定两读为对象,用感知辨义与诱导产出两组实验说明无句法语境线索时存在真歧义,而时长、音强、最大基频与基频域等韵律线索可部分补足区分,但加工更慢且分布因有无句法标记而转移。

 · 更新于 2026-09-24 · 约 18 分钟 · 8981 字 阅读 →