英文题目:The Sound of Code-Switching: Prosodic Profiles of Spontaneous Spanish-English Speech

会议身份:conference:interspeech:2026:conference-paper-id:bhattacharya26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#统计分析 #韵律 #多语言 #语音 #语言识别

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:前50% | 文档类型:应用研究

👥 作者与机构

  • Debasmita Bhattacharya:机构信息未能从会议 PDF 纯文本可靠映射
  • Michela Marchini:机构信息未能从会议 PDF 纯文本可靠映射
  • Julia Hirschberg:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究输入为迈阿密自发西英对话的话语级音频、词级语言标识与说话人人口学元数据,输出为语码转换话语相对英语单语与西班牙语单语在音高、能量与时长上的差异画像及其受熟练度与多语属性调节的解释,难点在于自然对话中说话人、话题、话语长度与语言含量高度混杂。首先提取语言无关韵律特征并做分布检验定位差异层级,其次用无监督聚类检验差异的可分性,最后把预训练语言识别模型当探针检验韵律与熟练度的关联。与既往聚焦朗读、少数说话人、单音素或特定句法位置的感知或产出研究不同,该工作采用宏观话语级通用特征加模型诊断路径,直接刻画自然语码转换整体听感,定性上呈现更高、更轻、更断续且方差更大的模式。在Bangor Miami语料的二元韵律语言识别任务下,微调加分类头模型的准确率为0.92,高于预训练基线的准确率0.64。进一步发现熟练度主要塑造单语而非语码转换韵律,语码转换更接近说话人高熟练语言的单语韵律,而转换方向影响不显著、插入与交替策略及语码丰富度调节差异幅度。该结论的适用边界限于该西英自发对话语料,尚未验证向其他语言对、方言转换及对齐与交互场景的外推。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么要单独研究语码转换的韵律?

输入是研究生已熟悉的事实:全球多数多语者在非正式自发对话中会交替使用两种语言,输出是希望回答的问题:这种交替听起来是否与只说一种语言不一样。本文的目标不是做转换检测器,而是把韵律当作可测量的维度,检验转换句在音高、能量与时长上是否系统偏离单语句。必须保留的信息是研究对象为自发西班牙语与英语转换,研究层级为话语级整体轮廓而非单个音素,研究方法为统计分布比较加模型诊断。

先说白话:韵律指一句话的高低、轻重、快慢与停顿,语码转换指一句话里出现两种语言。论文要区分的不是词是什么语言,而是整句话唱出来的形状是否不同。理解这一点后,后续特征、检验与建模才有学习依赖:特征提供形状的数字表示,检验回答形状是否不同,模型回答这种不同是否稳定到可被无监督或有监督方法学到。

已有路线研究了什么,还缺哪一块拼图?

已有计算研究覆盖了语码转换的形态句法、社会语言与话语功能,但韵律长期缺位。感知路线报告音高重音、语速与嗓音起始时间等线索帮助听者预测转换点,产生路线则发现转换多发生在语调单位边界而非其内部。直接比较转换与单语韵律性质的结论并不一致:有研究称法语或西英转换与单语无异,有研究称转换是韵律句法上根本不同的类型,还有研究称双语话语中同时出现两种语言的语调轮廓。

分歧的来源在原文有明确交代:除一项研究外,多数只用少数说话人的朗读语音,只分析孤立词、音素或特定句法框,只用狭窄韵律类别中的少数特征。本文的定位是补上自然发生的、大规模语料上的宏观比较。教学例子:这好比前人多在录音棚里让人读带转换的单句,本文则去真实闲聊里比较成千上万句的整体响度与节奏。前者控制严格但生态效度低,后者噪声大但更接近部署场景。

原文因此提出两个研究问题:转换句与单语句在话语级音高、能量、时长特征上是否存在差异,差异又如何受说话人熟练度与多语属性影响。

本文要回答的两个问题是什么?

第一个问题是存在性问题:用一套语言无关的音高、能量与时长特征,比较转换句与单语英语、单语西班牙语的话语级分布,判断差异是否显著且跨语言成立。第二个问题是解释性问题:若差异存在,它在多大程度上可被说话人语言熟练度解释,又在多大程度上可被转换本身的多语属性解释,多语属性包括转换的量与频度、转换方向与转换策略。

任务输入是带词级语言标识的转写话语与说话人人口学元数据,输出不是逐帧标签,而是组级分布差异的比例、方向性定性趋势与诊断模型的分类行为。需要强调的是,单语在此指多语会话语境中的单语句,而非单语者或单语语境录音,原文后续还借助另一项工作做传递推断,但本文直接证据只覆盖前者。复述时不要把音高更高、声音更轻、更断续当作每句必成立的规则,原文报告的是均值方向与方差增大的组级趋势。

从一句话到结论要走哪几步?

先沿一个样本走完全流程。取一段去噪后的对话录音中的一句话及其词级语言标识,若整句只有英语或只有西班牙语则记为单语句,若同时包含两种语言则记为转换句。对该句提取 103 维话语级韵律向量,覆盖基频、能量与时长 3 类,每类再按浊音段、清音段、首末音节与暂停段细分,并用均值、标准差、最大值、最小值、偏度、峰度 6 种泛函汇总。随后把所有转换句向量与所有单语句向量按组比较分布,得到哪些特征显著不同。

再按说话人熟练度分组重复比较,判断熟练度是否改变差异格局。最后把转换句喂给只允许输出英语或西班牙语的语言标识模型,看它更倾向判为哪一侧,以此诊断转换韵律更接近哪种单语。整条链条中,特征提取负责把可听差异变成可比数字,统计检验负责给出显著性与效应量,聚类与语言标识模型负责检验差异是否显著到可被学到。原文明确为去噪后数据以与前人工作保持一致,并使用已有的转换方向与策略标注以及转换丰富度指标。

103 维韵律向量是如何算出来的?

白话先行:基频即声音高低的基础频率,能量即响度,时长即各段发声与停顿持续多久。英文名分别为 fundamental frequency、energy 与 duration。DisVoice 特征集是把这 3 类量落实为程序可算向量的工具:对每句话先划分浊音段、有声与无声的能量计算区、段首与段末音节,时长还额外计入停顿段,然后在每段上计算 6 种泛函。6 种泛函为均值、标准差、最大值、最小值、偏度与峰度,前两者刻画集中与离散,中间两者刻画极值,后两者刻画分布形状。如此组合得到 103 维话语级向量,每句话一个向量,可直接做组间比较。

语码转换 × 单语话语: 语码转换指同一会话或同一句内交替使用西班牙语与英语,单语话语指整句只用其中一种语言,二者分工在于提供待比较的韵律总体,搭配理由是在同一多语会话语境下比较才能区分转换本身的效应与语境效应,组合意义是把韵律差异定位到转换行为而非说话人或话题差异。

韵律特征 × DisVoice 特征集: 韵律特征指基频、能量与时长 3 类可跨语言计算的声学量,DisVoice 特征集指把每类特征按浊音段、清音段及首末音节切分再用均值、标准差等 6 种泛函向量化的具体实现,前者负责定义比较什么,后者负责定义如何算,组合后得到 103 维话语级向量,使统计检验与聚类有统一输入。

该设计的安排理由是语言可泛化与宏观层级:不依赖特定语言的音位或句法标注,只用声学泛函刻画整句轮廓,因此可同时用于英语、西班牙语与转换句。局限也要先记下:话语级泛函会抹平转换点前后的局部重置细节,只能回答整体形状是否不同,不能定位差异发生在转换边界之前还是之后。

统计检验与诊断模型各自承担什么验证?

统计部分对每个韵律特征做独立 t 检验比较转换组与单语组的分布,并用 Benjamini-Hochberg 方法校正多重比较,再以 Cohen’s d 报告效应量与比例 z 检验辅助判断组间显著比例差异。白话是:t 检验看每个特征的两组均值分布是否不太可能由偶然造成,校正处理 1 次看 103 个特征带来的假阳性膨胀,效应量说明差异有多大。建模部分做两件互补的事。无监督用 scikit-learn 1.6.1 的 k 均值默认超参数做两类聚类,不给语言标签,只看韵律向量自身能否分成转换与单语。有监督把 Whisper-base 当作韵律语言标识探针,限制输出为英语与西班牙语两类,先测现成性能,再在说话人层面的转换数据上微调。

韵律-语言标识 × Whisper-base: 韵律-语言标识指只给英语与西班牙语两类输出、要求模型从韵律线索判断输入更像哪种单语的诊断任务,Whisper-base 指原为 97 种语言单语识别预训练、允许抽取中间语言标识符的 74M 参数模型,前者负责提出可解释的判别问题,后者负责提供已内化多语声学的起点,二者组合把分类正确率转化为语码转换韵律更接近哪侧单语的证据。

插入型转换 × 交替型转换: 插入型转换指把另一语言的词或短语嵌入主体语言框架,交替型转换指在句内较长跨度上切换语言框架,二者分工在于区分转换的结构方式,搭配理由是不同结构可能带来不同的停顿与音高重置需求,组合意义是检验韵律偏离是否随转换策略变化而非一概而论。

组合机制的关键是假设无关与任务转移:聚类不依赖任何语言标签,若仍能分开则支持差异是数据内禀的;语言标识把生成式识别模型转用于判别诊断,若微调后能学会转换句更像高熟练度一侧的单语,则支持熟练度解释。原文还测量话语级转换丰富度,用 M 指数与 I 指数表示量与频度,并沿用已有的转换方向与策略标注,避免自造划分。

哪些部分没有训练,哪些部分真正更新了参数?

本研究没有训练韵律特征提取器,DisVoice 只是按固定规则计算声学泛函,没有梯度更新。统计检验也没有训练,只是计算 p 值与效应量。真正涉及参数更新的只有两处。第一处是 k 均值聚类,有 206 个参数,按默认超参数在韵律向量上迭代优化簇中心,不使用语言标签监督,推理时按最近簇心指派。第二处是 Whisper-base 的微调:该 74M 参数模型原为 97 种语言的单语识别预训练,本文将其中间语言标识符限制为英语与西班牙语以强制二分类。

微调与推理采用说话人层面的转换数据按 90 比 10 划分,选择损失最小的检查点,批量大小为 8,训练 5 轮,微调学习率为 1e-5,加线性分类头时为 5e-5,全部微调与推理在一块 T4 上不足 1 小时完成。原文未报告冻结哪些层、梯度是否穿过编码器之外的解码器、分类头初始化与重置时机等细节,因此复述时只能说微调提升了二分类性能,不能从模型名称推定具体冻结策略。无训练不等于确定性求解:聚类受初始化影响,Whisper 推理仍是统计模型行为。

数据、划分与指标条件是否可比?

数据为 Bangor Miami 语料的自发西英对话,含 35 小时录音、56 段会话、46900 句转写,其中约 2400 句为转换句,约 30700 句为英语单语句,约 13800 句为西班牙语单语句,来自美国佛罗里达州迈阿密的 84 名成年说话人,话题为家庭生活、情感与爱好等非正式闲聊,每句有人工词级语言标识。说话人元数据包括受教育语言、语言使用年数、自评能力与父母主要语言,原文据此操作化语言熟练度,并注明缺少母语信息且说话人大致为均衡双语、略偏向一侧。特征来自去噪后音频以与前人一致。

比较条件上,统计检验在合并单语、单语英语、单语西班牙语 3 种对照下分别比较转换句;熟练度分析按分类特征分语言装箱、连续特征按西英比值大于 1 或小于 1 分组,再在转换句、英语句、西班牙语句内比较不同熟练度组的韵律分布;丰富度分析按说话人聚合 M 指数与 I 指数,以语料中位数为界分高低组;方向分析比较西译英与英译西,策略分析比较插入型与交替型。指标方向为 p 小于 0.05 判显著,效应量看 Cohen’s d,组间显著比例差异用比例 z 检验。

硬件预算仅报告微调部分,其余统计与聚类成本未报告。

转换句的韵律偏离体现在哪里,有多大?

本节回答第一个研究问题:转换句是否在整体上偏离单语句。组级比较显示,转换句的大部分韵律特征与单语英语和西班牙语均显著不同,无论对照是合并单语还是分语言对照。时长是主要驱动力,能量次之,音高贡献最小,这一排序与前人单语语境研究相反,有助于区分多语语境中的单语与真正的多语话语。

定性上,转换句首末浊音段基频轮廓均值更高且方差更大,首末浊音段能量均值与最大值更低、清音段最小能量亦更低而能量方差更大,浊音段与清音段时长均值与标准差以及停顿持续更大,停顿占发声段比例也更高。综合为更高、更轻、更断续,且跨特征的方差增大非常一致。聚类进一步显示这种差异可被无监督方法捕捉。

下表整理组级显著比例与效应量方向,比较问题是 3 类特征中哪类最能区分转换与单语,公平条件是同一话语级向量与同一显著性阈值,指标方向是显著比例越高则该类贡献越大。

特征组指标转换对合并单语转换对英语转换对西班牙语
时长组显著比例与方向至少 96% 显著不同至少 96% 显著不同至少 96% 显著不同
能量组显著比例与方向不少于 87.5% 显著不同不少于 87.5% 显著不同不少于 87.5% 显著不同
音高组相似比例与方向高达 30% 与单语相似高达 30% 与单语相似高达 30% 与单语相似
全部显著特征效应量范围0.2 到 0.8 中小效应0.2 到 0.8 中小效应0.2 到 0.8 中小效应

上表说明主要收益是时长与能量提供稳定区分度,代价是音高约三成特征无差异且显著特征多为中小效应,不能夸大为每句必可听辨。未胜出项即音高组,其相似比例最高,复现时应优先检查时长与停顿实现是否正确。

以下先看显著性全景图,再看两个代表性特征的分布形态。首图按特征横轴展示三行比较的逐特征 p 值,蓝色显著、红色不显著,可直观核对时长段几乎全蓝而音高段红色集中。

看图路径: 1. 先看三行比较:首行是转换句对合并单语,中行对英语,末行对西班牙语;2. 再按横轴三段核对音高、能量、时长三组中红色不显著条带的位置;3. 对比三行蓝色占比,确认时长几乎全蓝而音高红色最多;4. 结合图注确认蓝色为 p 小于 0.05,显著特征效应量多为中小效应

原论文 Figure 1:p-values for prosodic feature distribution comparisons between code-switched and combined…

论文图 1。原论文 Figure 1:“p-values for prosodic feature distribution comparisons between code-switched and combined monolingual English & Spanish (top), monolingual English (middle), and monolingual…”。

该图显示三行均以蓝色为主,证实转换与单语在多数特征上显著不同;分段看,右侧时长段蓝色最密,左侧音高段红色条带相对最多,中段能量介于其间;三行都存在红色不显著点,说明并非全部 103 维都不同。结合效应量为中小效应,应表述为组级可靠偏离而非强分离。

再看能量均值与时长均值的箱线图,左图纵轴为分贝,右图纵轴为秒,横轴均为转换句、合并单语、英语、西班牙语 4 类。

看图路径: 1. 左图看纵轴 dB 方向:转换句箱体中线是否低于三组单语;2. 右图看纵轴 s 方向:转换句箱体中线是否高于三组单语;3. 对比箱体高度与须线长度,观察转换句能量方差与时长分布形态;4. 核对横轴四类标签 CSW、合并单语、英语、西班牙语的对应关系

原论文 Figure 2:Visualizing trends in (a) mean energy and (b) mean duration of intial voiced segments across…

论文图 2。原论文 Figure 2:“Visualizing trends in (a) mean energy and (b) mean duration of intial voiced segments across utterance types.”。

左图转换句箱体位置整体低于 3 组单语,支持转换句更轻的判断;右图转换句箱体中线高于 3 组单语,支持更长与更断续的判断。两图须结合箱体高度与离群点看方差:转换句并非每句极端,而是整体分布平移加离散变化。像素不能精确读出具体分贝与秒数,复述时只讲方向与相对位置,不硬写数值。

下表给出无监督可分性的可运行数字,比较问题是仅用韵律能否分开转换与单语,基线为英语对西班牙语的聚类准确率,指标方向是准确率越高则可分性越强。

比较设置指标基线英语对西班牙语转换对合并单语转换对英语与对西班牙语
两类 k 均值聚类准确率0.6360.8430.837 与 0.868
同上相对基线显著性基线p 远小于 0.05p 远小于 0.05
同上参数与监督206 参数无监督206 参数无监督206 参数无监督
同上输入韵律向量韵律向量韵律向量
同上可视化单语对单语单语对转换可分分语言对照亦可分

上表的主要收益是转换对单语的聚类准确率达约 85%,显著高于英语对西班牙语的基线,代价是聚类仍有约 15% 错误且主成分可视化只显示最高载荷方向,不能证明线性可分。未评测边界是未报告不同随机种子与簇数下的稳定性。

熟练度与转换属性如何改变差异格局?

本节回答第二个研究问题,先看说话人熟练度。按受教育语言等分组后,单语句内不同熟练度组的韵律差异很大,例如中学教学语言不同可导致 80% 以上特征显著不同,小学教学语言不同亦导致 70% 以上特征不同;但在转换句内,只有一项熟练度因子即使用年数能让过半特征显著不同。这支持熟练度更 strongly 塑造单语而非转换句的韵律变异,其中教学语言的分类定义带来最大差异。

进一步假设转换韵律更接近高熟练度一侧的单语:小学或中学为西班牙语教学者,其转换句与西班牙语句的显著差异数少于与英语句的差异数,差值约 15 到 16 个百分点;英语教学者亦呈现镜像模式,差值约 9 到 10 个百分点,经比例检验显著,约占单语英西基线差异的 15 到 20%,且西班牙熟练者效应更强。表述须用支持而非证明,因证据为组级显著比例差。

为诊断该关联,原文用韵律语言标识探针检验:若转换韵律反映熟练度,西班牙熟练者的转换句应被判为西班牙语,英语熟练者反之。下表比较现成、微调与加分类头三档可运行策略,指标方向是准确率与分语言 F1 越高越好。

模型条件指标现成 Whisper-base微调 Whisper-base微调加分类头
二分类准确率0.640.830.92
同上英语 F10.740.860.93
同上西班牙语 F10.440.770.89
同上相对现成显著性基线p 小于 0.01p 小于 0.01
同上测试条件说话人未见平衡测试说话人未见平衡测试说话人未见平衡测试

上表显示现成模型泛化差且两类不平衡,微调显著提升但仍温和,加线性分类头后在未见说话人上达 0.92 准确率,分语言亦均衡。这支持模型可学到转换韵律与熟练度的关联,但代价是原序列标注目标不适配分类,需改结构才能充分发挥;未胜出项即现成模型,其西班牙语 F1 仅 0.44,不可直接部署。

再看转换自身属性。高转换量与高转换频度的说话人,其转换与单语的显著比例差异更大,相对英语差值约 10 与 9 个百分点,相对西班牙语差值约 0,约占英西基线差异的 11%,提示丰富度轻微放大偏离且对英语对照更明显。方向上西译英略大于英译西约 3 个百分点但不显著,不支持方向效应。策略上相对英语插入与交替差异约 4 个百分点不显著,相对西班牙语插入比交替多约 10 个百分点且显著,约占两策略基线差异的 17%,集中在音高与时长,提示策略可能起作用但证据混合。

以下看无监督分离的可视化,横纵轴为降维后主成分,蓝色为单语点云,绿色为转换句点云。

看图路径: 1. 确认蓝色为全部单语句点云,绿色为转换句点云及其向右延伸趋势;2. 沿横轴观察两类点云交界处是否存在大致可分的边界;3. 注意纵轴散布范围,比较单语向下延展与转换句向右上延展的差异;4. 把该可分性与约 85% 聚类准确率的数值结论对应起来

原论文 Figure 3:Clustering all monolingual (blue) vs. code-switched (green) utterances.

论文图 3。原论文 Figure 3:“Clustering all monolingual (blue) vs. code-switched (green) utterances.”。

该图显示蓝绿点云在中部形成大致边界,绿色向右延伸更远且更分散,蓝色在左侧更密集并向下延展,与约 85% 准确率一致。解释时只能说视觉上可分且方差模式与前文能量音高载荷一致,不能读出具体主成分值或断言线性边界位置。

这些结论在什么边界内成立?

直接报告的边界有 4 条。第一,语料边界:仅为迈阿密自发西英对话,84 名大致均衡双语者,转换句仅约 2400 句,结论向其他语言对、方言转换或朗读语体的泛化待验证。第二,特征边界:103 维话语级泛函抹平转换点局部动态,不能回答偏离来自转换前、转换点还是转换后。第三,熟练度操作化边界:缺少母语信息,依赖受教育语言、自评与使用年数等代理变量,相关性不是因果。

第四,模型诊断边界:语言标识二分类强制把转换句判为单语一侧,只是探针行为,不能证明说话人产出时有意朝高熟练度靠拢。未测量项包括误判率的人听感知对应、合成改善的主观得分、延迟与成本,原文未承诺这些量得到改善。效应量多为中小效应且部分特征不显著,总体趋势不等于每组每句成立。引用资源状态方面,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,不得声称代码、模型或数据已公开。

要复述与复现应先做什么?

复现先做三件事。第一,取得 Bangor Miami 语料的转写与词级语言标识,按整句是否含两种语言划分转换句、英语句与西班牙语句,保留说话人标识以便按说话人划分微调与测试,避免同一说话人泄露。第二,对去噪后音频用 DisVoice 文档的韵律模块提取 103 维向量,注意复刻浊音段、清音段、首末音节与停顿段的划分及 6 种泛函,避免自创窗口。第三,按原文做逐特征独立 t 检验加 Benjamini-Hochberg 校正并算 Cohen’s d,再跑默认超参数的两类 k 均值,以英语对西班牙语为基线做比例检验。

诊断模型复现需用 Whisper-base 并将其语言标识限制为英语与西班牙语两类,按说话人层面 90 比 10 微调,选损失最小检查点,记录现成、微调与加分类头三档在平衡未见说话人测试上的准确率与分语言 F1。关键超参数为批量 8、5 轮、学习率 1e-5 与加头时 5e-5。还需补的验证是多种子稳定性、按性别与会话对手分层的稳健性,以及把话语级结论与转换点附近的帧级分析对照,确认宏观偏离的来源。

何时值得尝试这些发现,如何一句话记住?

当任务涉及多语会话中的自然度时值得参考:例如为语码转换语音合成设计更安静、更高且停顿占比更大的整体韵律基线,或为转换检测增加时长与停顿比例特征。但尝试条件是先确认目标语料也是自发对话且说话人接近均衡双语,否则朗读或高度不平衡双语可能不呈现相同排序。若目标是精确定位转换边界,本文话语级特征不够,需补帧级音高重置与停顿建模。

一句话记住:自发西英转换在整体上更高、更轻、更断续且方差更大,时长最能区分,能量次之,音高最弱;熟练度主要塑造单语而转换韵律略偏向高熟练度一侧,转换量与策略轻微调节偏离而方向无显著作用。常见误解是把组级均值方向当作每句规则,或把语言标识准确率高当作转换可完美识别,原文证据只支持组级显著偏离与探针可学性,且效应多为中小并有不显著特征留存。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总