英文题目:Sense of Distance: Word-Dependent Prosodic Cues for Addressee Recognition
会议身份:
conference:speechprosody:2026:conference-paper-id:murakami26_speechprosody
✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。
标签:#心理声学实验 #韵律 #言语感知 #语音 #语音属性识别
评分:3.9/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.4/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- Haruka Murakami:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以呼唤语音为输入,判别被呼唤者处于近端个人距离1.0 m、中端社交距离2.5 m还是远端公共距离4.0 m,难点在于除响度外是否存在稳定可感知的嗓音与风格线索。方法链分三步衔接:先按个人空间理论布置三名听者距离并由实验者指定目标编号,为距离差异赋予可辨意义;再由说话人面向目标产出14种呼唤项,将距离意图编码进语音;最后三名听者背对回应并按转身、手指编号与交叉手臂计分,前一步的发音输出直接作为后一步的听辨输入,汇总为全听者与目标听者正确率。与以情感建模丰富表现力的合成路线不同,本文把距离感视为先于情感的表达基底,直接检验其听觉可辨性而非叠加情绪控制。在呼唤任务评测设置下,全部呼唤项的全听者准确率为0.702,高于随机水平的全听者准确率0.333。词级差异进一步表明线索具词依赖性,Hey的可辨性高而声学相近的Hi明显偏低,说话人间亦存在可辨但幅度不一的差异。该结论适用边界受限于仅4人轮换且角色不独立、语言背景混杂及房间混响与响度未量化控制,响度归一化后仍可感知的推论尚未验证,仅见于演示设想。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么要先证明距离感存在,而不是直接做情绪合成?
输入是这篇论文要回答的起点:富有表现力的语音合成近年已经能做到高度自然,并积极叠加情绪建模来丰富表达。目标是检验日本戏剧现场的一种实践知识,即所谓距离感,本文译为 sense of distance,日语为距离感,被认为是所有表达的基础。必须保留的信息是作者的判断链条:如果距离表达错了,再精细的情绪也会听起来像平淡的朗读,传达不出东西。输出是本解读要帮研究生建立的第一个可核对事实:本文不做合成器改进,不做情绪分类,而是先做听辨能否成立的实证。
沿着学习依赖,先理解任务与相关路线的分叉。主流情绪合成路线把输入当作带情绪标签的语料,把输出当作带情绪的波形,监督来自情绪标注。距离感路线把输入当作朝向不同物理距离听者的呼唤发声,把输出当作听者对目标听者的判断,监督来自是否判对。这种分叉很重要,因为响度、音质、说话风格都会随远近变化,图 1 的经验示意正是要提醒初学者不要把距离感等同于音量旋钮。
距离感 × 情绪表达: 距离感指说话人对交谈对象远近关系的声音拿捏,负责先定下发声的朝向、投射与分寸;情绪表达负责在此基础上叠加喜怒哀乐的色彩;搭配理由是日本戏剧现场经验认为距离错了情绪再细也像平淡朗读,组合意义是把富有表现力的合成先建立在可被听辨的距离编码上。
对刚入门的同学,白话是这样:情绪表达回答你什么心情,距离感回答你对谁说、多远说。英文名是 sense of distance,又称 Kyorikan。后文简称距离感。论文的直接报告是听者能高于随机水平识别目标听者,支持距离现象存在;这属于报告与有限解释,不是对全部日常对话的因果承诺。复述方法时要守住边界:本文只证明呼唤任务下可听辨,没有测量声学参数与感知的映射,也没有证明合成器加上距离控制就一定更自然。
情绪合成、个人空间理论与现场经验各解决什么问题?
同输入同目标的对照是情绪语音合成。输入同样是语音,目标同样是更具表现力的输出,监督同样来自人类感知,但运行阶段不同:情绪合成在生成端控制风格,本文在感知端验证距离是否可辨。原文引用了端到端合成与情绪控制的工作,说明技术底座已经自然,缺的是现场知识的科学化。不能把类别差异当同条件胜负:本文没有与情绪合成系统比好坏,只是提出基础顺序应先立距离。
同监督思路的对照是个人空间理论。输入是人与人之间的物理距离,目标是解释交往行为分区,监督来自行为观察。原文明确参照了个人空间理论,并引用相关著作,把距离操作化为有代表性的类别区间。这种借用给了距离差异意义,避免随意选几个米数。初学者要记住这里的监督不是语音标注,而是先验的社会心理学分区,后续语音判断是否落在这些分区上。
同运行阶段的对照是剧场实践知识。输入是演员对搭档包括自己的距离把握,目标是让台词不沦为朗读,监督来自现场是否传达。这部分没有量化证据,论文如实写为很少被文献描述、尚未被科学检验。因此本文的定位是第一步的听辨检验,而不是对现场经验的全面形式化。教学例子是:好比先验证观众能否听出演员在喊前排还是喊后排,再谈如何合成这种区别。
听者能仅凭语音分辨喊的是哪个距离的人吗?
把问题收敛为可执行的操作。输入是一个呼唤发音样本,说话人事先被告知目标听者编号。表示是听者一方听到的声音,不给视觉目标信息。组件是 3 名站在不同距离的听者与 1 名说话者。目标是每名听者独立判断自己是否被喊、或被喊的是哪 1 位。输出是两种准确率:全听者准确率与目标听者准确率。
关键信息条件是听者背对说话者作答。原文规定听者背对说话者,若觉得是自己被喊就转身,若觉得是别人被喊就用手指显示另 1 位听者编号,若不确定就双臂交叉。这个动作设计阻断了目光与口型提示,让判断只能依赖声音。随机化条件是每个项目每轮做 9 次试验,每名听者各做 3 次目标,顺序随机。随机水平因此是 3 选 1,对应全听者准确率的随机基线为 3 分之 1。
误解要提前澄清:问题不是测声音传多远、不是测谁耳朵灵,也不是让说话者故意夸张表演。呼唤项目被选为对陌生听者的通用呼唤,以最小化除物理距离之外的因素。这意味着词义的社会含义被压低,留下的是投射方式的差异。是否真有系统差异,要看主结果是否稳定高于随机水平,以及是否出现词依赖性。
三档距离与呼唤任务如何构成一条可走通的证据链?
先沿一个样本走完全程。假设说话者被实验员指示目标是 2 号听者,项目是 Hey。输入是目标编号加词形。说话者朝向站在 2.5 米处的 2 号听者发出呼唤。3 名听者都背对说话者,仅凭听到的声音各自作答。
理想输出是 2 号转身、1 号与 3 号用手指指向 2 号。若 3 人都对,全听者准确率记高;若 2 号自己转身,目标听者准确率记对。这就是从输入到表示到组件到目标到输出的闭环。
距离设置是证据链的地基。原文把近端设为 1.0 米对应个人距离,中段设为 2.5 米对应社会距离,远端设为 4.0 米对应公共距离。三档都落在有代表性的类别内,使差异有理论含义,而非任意米数。教学例子是:1.0 米像对身边人小声招呼,2.5 米像隔几步叫住人,4.0 米像朝远处喊人。
下面这张距离示意图需要在读方法时先建立空间感,它把三档距离与分区标签直接对应起来,是后文所有准确率讨论的空间前提。
看图路径: 1. 先从左向右读底部三档标签 Personal、Social、Public 与头顶 1.0 米、2.5 米、4.0 米的对应关系;2. 再看色块分区与 0.45 米、1.2 米、3.5 米等边界线如何划分区间;3. 最后确认三个人形图标所站位置正是后文实验的三档听者距离
论文图 2。原论文 Figure 2:“Distance settings in the experiment.”。
这张图显示 3 个人形分别站在 1.0 米、2.5 米、4.0 米刻度下,底部依次标注个人、社会、公共分区,背景用不同色块划分区间,还标出 0.45 米、1.2 米、3.5 米等边界参考。它的教学价值是让研究生把抽象的距离感锚定到具体米数与理论类别上:后文说的近、中、远不是相对用词,而是固定站位。复现时必须照此摆位,不能自行改为等间距走廊,否则类别含义改变。
说话者、听者、呼唤词各自承担什么分工?
说话者组件负责编码距离。4 名成年人参与,2 名葡萄牙人、2 名中国人,均为 20 多岁,在日本生活、日常使用英语,彼此不认识,轮流担任说话者或听者。不认识这一点减少了熟人间的特殊默契,使编码更依赖一般可懂的投射方式。说话者按实验员指示朝指定听者发声,不是自由选择喊谁。
听者组件负责解码距离。3 名听者同时站在 3 个距离上,每次只听 1 次发声就独立作答。作答动作区分了自我识别与他人识别,还保留了不确定的选项。这种设计同时给出群体一致性与被寻址者自身感受两个视角,为后文双准确率埋下分工。
呼唤词组件负责承载韵律。共 14 个呼唤项目,包括常用问候呼唤 Hello、Hi、Hey、Excuse me、Wait,较长呼唤如 You drop something、Thank you very much、Number 4 please,非词声音如狗叫、猫叫,以及其他语言如日语的 Sumimasen、Konnichiwa 加各自母语的 Hello 与 Excuse me。选择原则是对应陌生听者的通用呼唤,压低词义与关系因素。
个人距离 × 社会距离: 个人距离负责界定近端亲近关系下的小声量投射,本研究操作为 1.0 米;社会距离负责界定日常交往的公开投射,本研究操作为 2.5 米;搭配理由是两者同属个人空间理论的不同区间可形成可比梯度,组合意义是用三档距离检验语音是否随关系距离系统变化。
社会距离 × 公共距离: 社会距离负责中等距离的呼唤可懂度,操作为 2.5 米;公共距离负责远端 4.0 米的投远呼唤;搭配理由是两者都需要提高可达性但投射负担不同,组合意义是观察听者能否在都不近的条件下继续区分中间与最远。
组合意义在于三者缺一不可:没有固定站位,词差异无法归因到距离;没有背对作答,准确率可能混入视觉;没有多词覆盖,就看不到词依赖性。原文没有给出麦克风型号、房间混响、录音电平等声学采集细节,这是复现时的具体缺项,写解读时要明确指出未报告,不从常理推定设备。
本研究训练了什么模型?没有训练时真实计算是什么?
本研究没有训练任何神经网络模型,没有优化器、梯度路径、参数冻结与更新、早停或权重下载等环节。必须明确说明没有训练阶段,不能把无训练等同于确定性求解,也不能从参与者轮换推定输出确定。真实计算是行为实验的组织与计分,不是反向传播。
实际调用与计算过程是这样:实验员指定目标听者编号,触发 1 次发声;3 名听者按规则作答;按项目聚合正确率。聚合分两条:其一是全听者准确率,定义为 3 名听者正确性的均值;其二是目标听者准确率,定义为被寻址听者是否正确认出是自己被喊。
全听者准确率的随机水平为 3 分之 1。每个项目每轮 9 次试验,每名听者各 3 次目标且顺序随机,这是重复与平衡的来源。
标注与监督来源是作答动作本身:转身、手指编号、双臂交叉分别对应自我命中、他人指向、不确定。不确定在计分上不算对,这是保守的监督。搜索或检索过程不存在,仿真也不存在。复现者要重放的是流程控制:随机序列生成、指示传递不被听者看到、作答记录表、双口径计分代码。缺失的是试验轮数总量、是否多轮会话、跨说话者顺序如何平衡,原文未交代,需要在复现笔记中标为待确认。
人在哪里站、怎么喊、怎么记分才算条件一致?
数据与协议按原文交代。被试 4 人轮换角色,距离固定为 1.0 米、2.5 米、4.0 米,呼唤项目 14 个,作答时背对说话者。每项目每轮 9 次试验,每人 3 次目标。指标是两种准确率,方向是越高越好,随机基线为 3 分之 1。聚合对象是先按项目平均,再报总体均值。
说话者维度另按人平均。统计方法如显著性检验、置信区间在现有证据中未报告,不能自行补充。
为确认空间与遮挡条件,需要细读实验现场照片,它展示了说话者与 3 名听者的相对位置、地面距离标记与作答姿态,是判断条件一致性的关键。
看图路径: 1. 先找到左侧 Speaker 与右侧 Listener1、2、3 的站位与朝向关系;2. 再看地面 1 米、2.5 米标注与前景实验员手势指示方向的作用;3. 最后观察听者背对说话者与举手示意的作答方式如何阻断视觉提示
论文图 3。原论文 Figure 3:“Experimental situation. Table 1: Stimuli used in the call-out task.”。
这张照片左侧是说话者侧影,右侧是背对镜头的 3 名听者,头顶分别标注听者 1、2、3,地面可见 1 米与 2.5 米的绿色标记线,前景有实验员手臂指示方向。可见内容支持两个判断:听者确实背对说话者,减少视觉泄露;站位呈纵深排布,与三档距离一致。像素不能精确辨别房间尺寸与麦克风位置,不要硬写。复现时要保留的核心是背对、纵深站位、实验员指示对听者不可见。
硬件预算与成本在原文中未报告。没有声压校准、录音设备、房间混响时间的记录,这是部署与复现的缺项。展示环节提到用响度归一化后的子集做演示,让参加者判断远、中、近,这支持响度之外仍有可感知信息,但该演示不是主实验的对照条件,不能当作消融证据。
总体能否听辨出来?词与人带来多大摆动?
测什么、与谁比、条件是否一致要先说清。测的是呼唤发声中是否含有可被听辨的距离信息,与随机猜测 3 分之 1 相比,条件一致体现在同一批人、同一站位、同一作答规则下比较。指标方向是准确率越高支持编码存在。关键数字是总体均值:全听者准确率 0.702,目标听者准确率 0.748,均超过 0.333。支持的判断是听者能高于随机水平识别目标听者,提示距离感现象存在;限制是样本小、未做声学分解,不能推出具体靠什么声学线索。
词层面的摆动是核心发现。Hey 最高而声学上相似的 Hi 较低,说明词形相近不保证同样好辨。主观印象与客观成绩脱节:被试反映长句好判断、动物模仿难区分,但实际准确率未呈现对应趋势。这提示可听性直觉不能直接当作客观难度的代理。
全听者准确率 × 目标听者准确率: 全听者准确率负责衡量 3 名听者平均每人是否判对,反映群体一致性;目标听者准确率负责衡量被喊到的那个人自己是否认出被喊,反映被寻址者的切身感知;搭配理由是前者防偶然跟风后者贴近真实呼唤场景,组合意义是双口径互相印证距离信息是否真的可听辨。
比较问题是:在随机基线相同、计分口径不同的情况下,总体与词级成绩是否一致高于随机,且词间差异是否真实存在?公平条件是同一实验流程与同一批听者,指标方向都是越高越好。下表把总体与代表词放在同一框架下对照,数值保留原文精度。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 全部呼唤项目平均 | 全听者准确率 | 0.333 | 0.702 | 总体均值高于随机 |
| 全部呼唤项目平均 | 目标听者准确率 | 0.333 | 0.748 | 被喊者自身识别更高 |
| 单词 Hey | 全听者准确率 | 0.333 | 0.787 | 词中最高 |
| 单词 Hi | 全听者准确率 | 0.333 | 0.639 | 声学相似但较低 |
表后解释要同时讲收益与代价。收益是双口径都大幅高于随机,且 Hey 与 Hi 的反差说明距离线索具有词依赖性,不是单一响度规则能解释。代价与反例是 Hi 仅 0.639,虽仍高于随机但明显弱于 Hey,说明并非所有常用呼唤都同样有效;若只看总体 0.702 会掩盖这种不均匀。未胜出项是 Hi 与动物模仿类,它们提醒复现者选词即选难度,做合成选材时不能随意挑词。原文表头与算术未见冲突,但词级完整分布表在现有证据中只有摘要句,没有逐词全表,这是细节缺项。
说话者维度的摆动同样要核对。总体均值仍是 0.702,范围从 0.551 到 0.820,所有说话者都高于随机,但个体差距可达约 0.27。这支持每位说话者的发声都含有可被检测的距离差异,同时说明编码能力因人而异。比较问题是:在同一听者组与同一词集下,不同说话者的可辨度是否都成立?下表给出可运行的按人对照。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 说话者 1 发声 | 目标识别准确率 | 0.333 | 0.551 | 4 人中最低但仍高于随机 |
| 说话者 2 发声 | 目标识别准确率 | 0.333 | 0.657 | 中等 |
| 说话者 3 发声 | 目标识别准确率 | 0.333 | 0.820 | 4 人中最高 |
| 说话者 4 发声 | 目标识别准确率 | 0.333 | 0.780 | 次高 |
表后解释要指出:收益是无人掉到随机线下,支持现象的一般性;代价是说话者 1 仅 0.551,接近猜测区的上沿,若系统只用这类说话风格训练,距离控制可能学不到稳定映射。未评测边界是说话者性别、语言背景、音量习惯是否驱动了差距,原文只给出国籍与语言使用背景,没有做分组检验,不能归因。总体趋势不等于每词每人都成立,复述时必须保留这种异质性。
响度归一后还能辨吗?熟悉度与语言能解释词差异吗?
先做词依赖的对照。原文讨论明确检验了两个候选解释:呼唤表达是否熟悉、所用语言是否不同。结论是词间差异不能被熟悉度或语言解释。这是否定性反证,排除了最容易想到的混淆。教学例子是:不能说 Hey 好辨只是因为大家常说 Hey,因为同样常用的 Hi 并不好辨;也不能说外语词天然难辨,因为证据不支持语言主效应。
再做主观与客观的对照。被试主观报告长句易判断、动物模仿难区分,但客观准确率没有对应趋势。这说明主观可听性印象与客观识别成绩脱节。若把可听性问卷当作难度标签,会误导选词。复述时要用支持与待验证区分:报告显示主客观不一致,支持直觉不可靠,但未验证到底何种声学结构驱动了词差异。
呼唤词 × 距离听辨: 呼唤词负责提供承载韵律的词形与长度,如 Hey 与 Hi 虽相似但效果不同;距离听辨负责输出对远近的判断准确率;搭配理由是同一说话距离换词后准确率变化可揭示词依赖性,组合意义是说明距离感不是脱离词形的纯响度现象。
关于响度的作用,原文在展示环节给出有限解释:演示用子集呼唤词,把总体强度做均方根电平归一化后仍让参加者判断远中近,以此展示不依赖响度也能感知距离信息。这支持响度之外确有线索,但它不是主实验内的消融条件,主实验没有报告归一化前后的对照数字,也没有报告去掉响度后准确率掉多少。因此不能承诺去掉响度后性能不变,只能说存在非响度线索的可能性得到演示层面的支持,严格验证待补。缺失的消融是声学参数消融:基频、时长、共振峰、嗓音质量、语速等逐一控制或重合成后听辨如何变化,原文未做,这是下一步最值得补的验证。
哪些结论现在还不能下?
数据与方法的边界要逐项点名。被试仅 4 人,且为特定国籍与语言背景,在日本生活、日常用英语,彼此不认识。这种小而同质的样本支持内部可比,但不支持向一般人群推广。试验量按每项目每轮 9 次、每人 3 次目标来平衡,但在现有证据中总轮数与总试次数不明,不能计算统计功效。统计检验、置信区间、个体显著性均未报告,只能说均值高于随机,不能说差异显著。
测量边界是只有行为准确率,没有声学测量与感知模型。原文没有给出基频、强度包络、时长、频谱倾斜等任何参数,也没有做响度归一化的正式对照。因此相关性不是因果:能听辨不等于知道靠什么听辨,更不等于合成器调某个参数就能复现。训练资源、推理开销、输出帧率与实际延迟在本研究中不适用,因为无模型训练与部署,不承诺任何效率改善。
未测量的是误判结构。远近混淆矩阵没有给出:是远近两端好分、中间易错,还是远端系统偏向?没有这些就无法指导合成优先级。房间声学、背景噪声、麦克风距离带来的物理衰减也没有分离,严格说物理传播效应与发声调节效应混在一起。把这些缺项写清不是技术错误,而是在保护复现者不做过度承诺。
要重做这个呼唤实验先摆什么、先记什么?
何时值得尝试:如果你的合成器情绪控制总像朗读,或你的呼唤助手在远近场听感不一致,这个范式值得先做 1 次小规模听辨,确认距离编码是否存在于你的语料与场景中,再决定是否投入声学建模。复现先做什么:按 1.0 米、2.5 米、4.0 米纵深摆 3 名听者,1 名说话者侧向站立,听者全程背对说话者;实验员的指示动作必须对听者不可见;呼唤词先用原文的 14 类覆盖常用呼唤、长句、非词声音与多语言,再按需扩展。
记录与计分要可重放。每项目每轮 9 次,每人各 3 次目标,顺序随机;作答三选一为转身、手指他者编号、双臂交叉表不确定;同步记录说话者编号、项目、目标编号、3 人作答;按双口径聚合:全听者准确率为 3 人正确性均值,目标听者准确率为被喊者命中率,随机基线记 0.333。保留关键超参数其实是实验参数:三档米数、每人 3 次目标、背对规则、不确定计为错。
还需补哪项验证:第一是声学侧录与标注,至少记录校准后的声压、基频、时长与频谱特征,才能把行为差异落到信号上;第二是响度归一化的正式对照,用同一批录音做归一化前后听辨,才能量化非响度线索的贡献;第三是混淆矩阵与按距离分层的准确率,才能知道中间距离是否最难;第四是扩大被试与房间条件,检验跨人、跨房间的稳定性。资源状态是正文开源声明的唯一依据:本次未发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开,复现需自行搭建流程。
一句话收束:什么成立、什么待定、下一步做什么?
成立的是听者能高于随机水平从呼唤语音中识别目标距离,全听者准确率 0.702、目标听者准确率 0.748 对 0.333,且所有说话者都高于随机,词间存在 Hey 为 0.787 而 Hi 为 0.639 这类差异。待定的是差异由何种韵律线索驱动,熟悉度与语言已被排除,主观易难度与客观成绩脱节,响度之外的线索只得到演示层面支持。下一步应补声学分解、响度归一化对照与混淆矩阵,再谈合成控制。
对研究生的行动建议是:复述方法时只讲论文实际做的呼唤任务,不添加无源的数值或效果;教学例子明确标为例子;引用数字时核对数据集、阶段、指标与聚合对象,百分点与相对百分比不混用。常见误解是把距离感当作音量,把总体均值当作每词每人都好辨,把演示归一化当作正式消融。纠正方法是回到原文安排:距离是理论分区加固定米数,成绩是双口径加词与人双维度摆动,机制是未验证。守住这些,这篇短文就能成为你进入语音韵律研究的一块可靠跳板。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

