论文解读

疑问词韵律压住边界时,长度为什么还能移动重音性拖长

该研究在南庆尚韩语疑问词与格歧义句中检验成分长度是否仍改变韵律分组,方法是固定矩阵疑问辖域并对比长短主语的首读与指定解读发音,最强证据是首读中长主语在主语处拖长而短主语在疑问词与格处拖长,代价是指定解读下长度效应明显减弱且解读偏好几乎不随长度变化。

 · 更新于 2026-09-24 · 约 17 分钟 · 8384 字 阅读 →
论文解读

句法标出焦点后重音为何变轻:普通话分裂句的韵律补偿

该研究用十六人半自发问答对比书面与口语的焦点实现,发现书面窄焦点靠分裂句而口语靠韵律,无标记窄焦点的四声 f0 范围更大且主语分裂时长更短,说明句法已标记时韵律按经济性减弱但仍高于宽焦点基线。

 · 更新于 2026-09-24 · 约 16 分钟 · 7927 字 阅读 →
论文解读

听不清鼻音时,孩子跟着念也会丢掉鼻口对比:声码器模拟下的鼻音度证据

该研究让 4 名 8 岁儿童重复经声码器降质的法语鼻元音与口元音,用鼻音度量化产出,发现通道减少与插入偏移使鼻元音口音化而口元音鼻音化并在 4 通道最严重,但个体差异大且样本仅 4 人。

 · 更新于 2026-09-24 · 约 20 分钟 · 9654 字 阅读 →
论文解读

只留韵律能听出精神分裂症谱系障碍吗:人类感知与机器分类的平行验证

该研究用自适应低通滤波去掉可懂语义后,比较 33 名评分者对 25 人语音的韵律判断与 108 个声学时序特征训练的逻辑回归分类器在 251 人数据上的表现,两者准确率均为 80.0%,代价是灵敏度中等且韵律标记与症状总分无显著关联。

 · 更新于 2026-09-24 · 约 17 分钟 · 8278 字 阅读 →
论文解读

厦门闽南语变调能产性之争:任务变简单了,被试就真会了吗

该研究以厦门闽南语五条非入声变调规则为对象,用看图产出与两种违例音节的多选任务比较变调应用率,显示更简单的多选任务与更合乎音位的偶然空位能提高正确率,但效应随具体变调规则而异,且变调后形式是否合法会改变错误偏好。

 · 更新于 2026-09-24 · 约 21 分钟 · 10156 字 阅读 →
论文解读

同字不同意:蒙古语反问句靠句末声调与时长被听出来

该研究用 20 对同字句最小对与三选一听辨任务检验喀尔喀蒙古语真问与否定反问能否仅靠韵律区分,最强证据是反问显著更易被辨认且集中使用 LHL% 边界调并伴随更长时长与更高起始及疑问词音高,代价是真问辨认接近机遇水平并存在向反问判断的系统偏向。

 · 更新于 2026-09-24 · 约 22 分钟 · 10546 字 阅读 →
论文解读

用伪词堵住语言补偿之后,可懂度评分还变吗

该研究用 80 名口腔与口咽癌患者的伪词解码任务检验可懂度评分是否随词表、面对面与远程场景和评估者经验而变,结果显示词表与场景无显著差异而重度损伤段专家评分幅度更收敛,但专家效应仍是待解释的代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9127 字 阅读 →
论文解读

把 32 通道空间音频搬进地下商场:共享基建如何撑起五组公共互动作品

论文要解决空间音频一次一建、难以公共复用的问题,用一套可搬运的扬声器与交互基建在亚特兰大地下城支撑 5 组学生作品,以 Since Everyone's a DJ 为案例验证多人手势协作演奏可行,但连续空间控制易被掩蔽且评价仍是小样本反思。

 · 更新于 2026-09-24 · 约 18 分钟 · 8873 字 阅读 →
论文解读

先编织后通电:以安第斯螺旋时间组织声音界面生成的设计过程

论文以制作中的触觉声音界面 Kirma 为线索,提出先经盘卷编织、手感聆听与在地拾取形成手势拓扑,再让电容传感与合成去转译编织已组织起来的连续声音,当前证据停在材料样机与方法阐述,电子与声音映射尚未实测验证。

 · 更新于 2026-09-24 · 约 24 分钟 · 11880 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

相同文字不同处境,相同处境不同语气:AEQ-Bench 拆解全模态模型共情

AEQ-Bench 用 1,885 个音频加文本实例把共情拆成生成回应与判断回应 2 类任务,用相同话语换语境和相同语境换语调 2 种对照进行测试,报告显示带音频输出的模型在自然度与语音表达上占优,而细粒度韵律自动评估仍不可靠,代价是依赖人工核验与粗粒度量表。

 · 更新于 2026-09-24 · 约 18 分钟 · 8948 字 阅读 →
论文解读

边说边听不断线:用自动考官逼出多轮全双工对话的掉线与失忆

针对全双工语音智能体多轮一致性缺乏可复现评测的问题,该文用合成语音自动考官加分阶段语义目标与快慢两种节奏做流式多轮交互,并以轮换流畅度、多轮指令遵循和任务专属三维打分报告了三系统随时间下滑且修正与实体跟踪最难的证据,代价是仅覆盖英语四类任务并依赖转写加模型打分。

 · 更新于 2026-09-24 · 约 20 分钟 · 9960 字 阅读 →
论文解读

多人对话视频看似逼真却接不上话:MTAVG-Bench 如何逐层诊断结构性失败

论文针对多人对话音视频生成中身份漂移与轮转混乱难以被感知质量指标发现的问题,构建覆盖四层九维度的失败诊断问答基准,用 12 个全模态模型的诊断得分与三类生成器的人评成功率显示交互层是主要瓶颈,但诊断高度依赖音频输入与提示对齐条件。

 · 更新于 2026-09-24 · 约 16 分钟 · 7726 字 阅读 →
论文解读

人设没崩在哪条路:把说什么和怎么说分开查的语音人设诊断

针对长程语音角色扮演中崩人设难定位的问题,论文提出把文本路由与音频路由投影到共享情感空间做分路由、按轮次诊断的 PED 框架,并在端到端与级联两种 3B 量级系统上揭示出可分性受限、文本向中性集中、双路由弱耦合等可复述的诊断信号。

 · 更新于 2026-09-24 · 约 20 分钟 · 9970 字 阅读 →
论文解读

机器在打电话:先数录音重放,再问合成语音占多少

该研究用双轨应答蜜罐加音频指纹与商用合成语音检测器测量骚扰来电开场,报告机器发声至少占 26.9%,其中约一半是跨通话重放的录音,但合成标签只有约 54.4% 经盲听确认且阈值与播种历史显著影响读数。

 · 更新于 2026-09-24 · 约 25 分钟 · 12414 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-12

共分析 42 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 79 分钟 · 39128 字 阅读 →
论文解读

把申克分析变成逐层留音符:用多关系图与节点隔离学层次

针对巴洛克赋格主题的申克层次标注问题,AutoSchA 把乐谱建成多关系音符图并用节点隔离做可学习的逐层池化,在小样本专家数据上接近人类分析但仍残留可察觉的别扭连接且仅验证了该体裁。

 · 更新于 2026-09-24 · 约 18 分钟 · 8947 字 阅读 →
论文解读

答对不等于听懂:用六维过程分拆开音频推理的感知与推进

针对大音频语言模型只看准确率会把猜对误判为真推理的问题,论文提出免人工标注金链的六指标 ARIA-Rubrics 做过程评估,在 9 个模型与 2 个基准上显示准确率与过程质量系统性偏离,而完整 ARIA 与人评 Spearman 达 0.671,代价是仍需冻结的轻量打分模型与外部对齐模型。

 · 更新于 2026-09-24 · 约 20 分钟 · 9627 字 阅读 →
论文解读

证据分散且多解:用分角色辩论与淘汰赛留下更站得住的关系判断

针对从双人对话推断熟人与陌生人及具体熟人关系的问题,论文提出免训练的多角色辩论与竞争裁决流程,在同一过滤测试集上比较零样本与辩论基线,结构化交互在文本与音文结合上取得宏 F1 领先,但纯音频提升不稳定且多次调用带来更高推理成本。

 · 更新于 2026-09-24 · 约 21 分钟 · 10210 字 阅读 →