英文题目:Perception of interrogativity in Basque by native and L2 speakers

会议身份:conference:speechprosody:2026:conference-paper-id:txurruka26_speechprosody

✅ 来源为官方会议 PDF;表格与 Figure 按原文证据绑定。PDF 公式以原页区域图片展示,未冒称作者原始 TeX。

会议来源:官方记录 · 官方 PDF

标签:#心理声学实验 #韵律 #言语感知 #语音 #口语理解

评分:4.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.0/1.5

排名:后50% | 文档类型:应用研究

👥 作者与机构

  • Izaro Bedialauneta Txurruka:机构信息未能从会议 PDF 纯文本可靠映射
  • Jose Ignacio Hualde:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该任务输入为马尔基纳巴斯克语无词重音词构成的中性陈述与是非问朗读录音,输出是听者判断是否为问句的二选一回答,实际难点在于双语者在两语言核部 circumflex 轮廓相似时仍会误判整体问句性。方法链分三步推进:先由一名马尔基纳母语作者将单短语与双短语各4句分别录制为中性陈述和中性是非问以构造最小对照,其录音输出直接构成后续听辨刺激;再通过Qualtrics在线实验向马尔基纳母语者与西班牙语母语的巴斯克语二语者单次播放共43个刺激并收集是否为问句的判断;最后按组统计正确率并用韦尔奇t检验与Cohen’s d比较组间差异。与仅依据句末核轮廓判断问句性的传统解释不同,该研究强调词重音缺失与短语划分形成的整体基线形状同样决定感知。在双短语问句判断条件下,Markina母语组的准确率为97.2%,高于L2西班牙语组的准确率23.8%。该结论的适用边界目前受限于马尔基纳朗读句、无词重音词与西班牙语背景二语者,尚未验证其他方言、自发语料及操控基频的因果作用。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:双语者听到的巴斯克语问句与陈述为何值得单独检验?

这篇论文的输入是巴斯克语口语句子的录音,目标是让听者判断每一句是不是问句。研究对象不是合成语音或朗读风格的泛泛韵律,而是北部比斯开地区 Markina 方言的自然中性陈述与中性是非问。作者在开头交代的背景是,成年巴斯克语母语者全部是巴斯克语与西班牙语双语者,同时有大量以西班牙语为母语、巴斯克语流利的二语者。前人报告指出,双语者在两种语言的是非问句末都使用相似的终点卷曲轮廓,因此直觉上二语者不应更难区分问句与陈述。

但 Markina 巴斯克语有一个关键差异:大多数词是词汇上无重音词,只有少数有词汇重音的词在所有句子环境中都带 H*L 音高重音,无重音词只在焦点位置才获得突显。西班牙语没有这种大规模无重音词格局。于是问题变成:即使句末核轮廓相似,整句音高形状的差异是否仍会左右听者把一句话听成问句还是陈述。输出是二分类判断,听者对每段刺激只回答是问题还是不是问题。

论文摘要已给出最强对照:Markina 母语者在 4 种条件下识别正确率高于 95%,而二语者把双短语问句大量听成陈述,把单短语陈述较多听成问句。学习这篇论文时,必须保留的关键信息是方言限定为 Markina、刺激限定为全部由无重音词组成的句子、句法限定为单动词与分词加助动词两类、任务限定为在线单次播放的是非判断。本文后续按任务路线、刺激构造、统计比较与复现条件展开,所有数字与条件只以原文证据为准。

相关路线比较:核轮廓相似性能说明什么,不能说明什么?

相关工作提供了两条路线。第一条是巴斯克西班牙语与巴斯克语是非问核轮廓比较路线。引用的 Bilbao 西班牙语与巴斯克西班牙语研究指出,绝对问句不一定是简单上升,在巴斯克地区西班牙语的是非问中也会出现终点卷曲轮廓,这与巴斯克语的是非问终点形状相似。如果只看句末最后一个音节,这条路线支持二语者应该能迁移母语知识,准确识别问句。第二条是巴斯克方言重音与短语结构路线。

引用的巴斯克重音研究与 Lekeitio 巴斯克语无重音性研究指出,词汇有无重音决定句子是否出现词级 HL,分词加助动词结构会在动词分词前成分末端插入后词汇 HL,形成两个韵律短语。这条路线强调不能只看核轮廓,还要看句首到句末的整体分布。本文选择第二条路线作为解释框架,设计了单短语与多短语的对照。教学上可以这样理解:第一条路线只比较句末形状,相当于只看句号前最后一个弯;第二条路线比较整句地形,相当于同时看中途是否有山峰和全程是否高原。

同输入都是巴斯克语音频,同目标都是问句判断,但监督来源不同,前者依赖句末范畴,后者依赖整句结构知识。论文的贡献正是证明在核轮廓相似时,整体形状仍造成显著的第一语言效应。需要保留的边界是,原文没有重新录制西班牙语刺激作同条件对照,而是引用文献描述西班牙语轮廓,因此跨语言相似性是文献支持的解释,不是本实验内直接测量的对照。

要回答的具体问题:哪种句子形状最容易让二语者听错?

论文把大问题拆成 5 条可检验的假设。第一,单短语句末有突显卷曲的问句,两组都应准确判断为问句,因为句末高音或先升后降是多语言共有的问句线索,且巴斯克地区西班牙语也用该轮廓。第二,单短语陈述从句首到倒数第二音节是高平,末音节急降,这种形状在西班牙语不常见,二语者可能把倒数第二音节的高音听成疑问线索,从而把陈述误判为问句。第三,多短语问句句末同样有卷曲,预测两组都应准确判断为问句。

第四,多短语陈述最后几个音节是低音,预测两组都应准确判断为陈述。第五,Markina 母语者在 4 种条件下都不应有困难。例子有助于理解:单动词句如 gure lagune da,他或她是我们的朋友,整句是一个韵律短语;分词加助动词句如 txorixe urrundu da,鸟飞走了,在 txorixe 末端有一个分界式下降,后面直到句末是低调。这两类句各有陈述与问句实现,问句实现都在句末最后一个音节加卷曲。

问题于是聚焦为:二语者是否只在单短语陈述上有困难,还是在多短语问句上也出现未预期的困难。原文摘要与结果部分报告后者确实发生,这成为全文需要解释的反例。

方法全景:从录音刺激到单次在线判断的完整链条

方法全景可以沿一个样本走完。输入是一句全部由无重音词组成的 Markina 巴斯克语句子,例如 txorixe urrundu da。表示是说话人实际发出的基频曲线,单短语陈述表现为第二音节起的高平到倒数第二音节再落到末音节低音,单短语问句表现为末音节加宽加长的卷曲,多短语陈述表现为前段第二音节上升后在动词前成分末端陡降、后段低平,多短语问句表现为同样中部分界加上句末卷曲。

组件是句法条件与语用条件的交叉:句法分单短语与多短语,语用分中性陈述与中性是非问,另有三句真值焦点强调陈述作为第二组刺激。目标是听者给出是不是问句的二选一回答。输出是每类条件的正确率与组间差异检验。实验通过 Qualtrics 在线进行,每段刺激只允许听 1 次,听完回答屏幕提示 galdera da,是问题吗,点击 bai 是或 ez 否。刺激总数为四十三,包括八句核心实验刺激、强调陈述与基频被改动的操纵文件,但操纵文件不在本文讨论。

参与者共 71 人完成实验,其中 Markina 母语者 19 人、其他巴斯克方言母语者 32 人、西语母语的巴斯克语二语者 20 人,本文只比较 Markina 组与二语组。这里存在一个必须保留的数字冲突:摘要写 15 名 Markina 说话者,正文方法写 19 名,复述时应明确标注冲突并以方法部分的 71 人细分为准。统计方法是对两组正确率百分比做系列 Welch 独立样本 t 检验,并报告 Cohen’s d 作为效应量。

组件拆解:词汇重音与短语分界如何塑造四种轮廓?

理解 4 种轮廓需要先分清 2 个组件。词汇重音决定词是否有固定音高重音,Markina 多数词无重音,因此实验句避开有重音词如 léku,只用无重音词如 katu,使整句形状不受词重音峰干扰。短语划分决定句中是否有分界,分词加助动词句在分词前成分末端插入后词汇 HL,形成多短语句,单动词句无此分界,为单短语句。图注文字描述了对比:含 léku 的句子在该词上有 HL 配置,其他三词无重音;全无重音的 hori katu baltza da 则相对平坦并在句末下降。

沿单短语陈述 gure lagune da 走一遍:从第二音节到倒数第二音节是高平,末音节落到低音,没有中部分界。沿多短语陈述 txorixe urrundu da 走一遍:第二音节上升,在 txorixe 末端陡降,此后到句末保持低音。两种问句实现都是在上述基础上把句末最后一个音节做成卷曲,但多短语问句同时保留中部分界。正是这个中部分界成为后文误听的关键。

词汇重音 × 短语划分: 词汇重音负责决定单个词是否自带 HL 音高重音,无重音词在非焦点位置不产生词级突显;短语划分负责在分词加助动词结构前插入后词汇 HL 形成两个韵律短语,二者搭配决定整句是平坦低结尾还是中部出现陡降,组合意义是听者不能只看句末,必须结合中部是否有分界来判断问句与陈述。

核轮廓与整体形状的区分同样重要。核轮廓只看句末,整体形状看全程。若只看句末,多短语问句与单短语问句都有卷曲,都应判为问句;若看全程,多短语问句前半段有一个类似强调的下降与重置,二语者可能按母语经验把它归为陈述类。论文用图三至图六展示 4 种形状,但本次没有收到图像像素,只能依据正文对高平、陡降、低平与卷曲的文字描述复述,不猜测坐标轴刻度、颜色或曲线精确位置。

核轮廓 × 整体音高形状: 核轮廓负责句末最后一个音节的卷曲升降,是两语言共有的问句线索;整体音高形状负责从句首到句末的高台、低平与分界分布,两者搭配理由是核轮廓相同不足以保证解读一致,新增作用是解释为何二语者把有多短语问句听成陈述、把单短语陈述听成问句。

有无训练:本研究没有模型训练,真实计算是什么?

本研究没有训练神经网络,也没有冻结或更新任何模型参数,因此不存在梯度路径、优化器、早停或参数重置时机。真实计算过程是人类感知实验的构造与统计。构造侧的计算是刺激录制与筛选:由 1 位 Markina 母语作者录制 8 个句子,每个句子录制中性陈述与中性是非问两种语用,共 16 种核心实现的一半即 8 种实验刺激的说法在摘要中简化表述,方法部分明确为 8 个句子各录两种。

标注侧的计算是被试在线判断与计分:每人听 43 段刺激,每段只听 1 次,回答是或否,按是否为问句计正确率。分析侧的计算是对两组被试的正确率百分比做 Welch 独立样本 t 检验并计算 Cohen’s d。原文未报告反应时、置信度或个体听力筛查细节,也未报告录音设备、采样率与基频提取参数,这些是具体缺项,不能从任务名称推定。不能把无训练等同于确定性求解,人类判断本身有变异,统计检验正是为量化组间差异的不确定性。

复现时不需要准备训练算力,需要准备的是相同的方言说话人、相同的无重音词表、相同的单次播放控制与相同的计分聚合口径。

实验条件:被试、刺激与判断流程如何保证可比?

实验条件按数据、协议与指标交代。被试分为 Markina 巴斯克语母语组与西班牙语为母语的巴斯克语二语组,方法部分给出 71 人中 19 人为 Markina 母语、32 人为其他巴斯克方言母语、20 人为西语母语二语者,本文分析只用其中两组。刺激分为 4 类核心条件:单短语问句、单短语陈述、多短语问句、多短语陈述,每类由不同例句承载,例如单短语用 gure lagune da 与 mendire dator,多短语用 txorixe urrundu da 与 Anek lagundu dau,所有词均为无重音词。

第二组刺激为三句真值焦点陈述,表达命题真实性的强调,如 ogixe ekarri dau,他确实带来了面包,其中两句用合成动词,一句用迂说法,动词带前缀 ba 以标记强调。流程条件一致:在线 Qualtrics 呈现,随机或固定顺序未在证据中说明,每刺激只听 1 次,回答 galdera da。指标是判断为问句与否的正确率百分比,方向是越高越好,聚合对象是组内被试的平均正确率,统计是组间 t 检验与 d 值。

需要保留的限制是,播放设备、听音环境、被试巴斯克语水平测试分数均未报告,因此组间差异只能报告为与第一语言相关的差异,不能直接断言为 proficiency 因果。资源状态方面,本次未发现来源绑定且完成验证的代码、数据或模型资源,不得声称刺激音频或数据已公开。

主结果:四种形状下两组正确率差在哪里?

主结果按单短语与多短语分别组织。先看单短语。问句条件下两组几乎都正确判断为问句,组间无显著差异,假设一得到确认。陈述条件下 Markina 组接近天花板,二语组显著更低,假设二得到确认。这说明即使句末都是降,高平加末降的形状对二语者仍有迷惑性。

下面第一张表整理单短语两条件的组间对照问题:在播放条件与计分相同、指标均为正确率越高越好的前提下,母语组是否稳定高于二语组,差距在问句与陈述上是否不对称。

条件指标Markina 母语组二语组组间检验
单短语问句判为问句正确率接近全部正确接近全部正确t=1.75,p=0.083,d=0.38,不显著
单短语陈述判为非问句正确率98.6% 正确60.8% 正确t=-6.64,p 小于 0.001,d=1.42,差异显著

该表显示主要收益是母语组在陈述上保持高稳,代价集中在二语组把约四成单短语陈述听成问句。未胜出项是二语组在单短语问句上并不差,说明句末卷曲线索在无中部分界时对二语者有效,不能推广为二语者整体不会听问句。

单短语陈述 × 多短语问句: 单短语陈述负责检验高平直到倒数第二音节再急降的形状是否被误判为问句;多短语问句负责检验中部有分界加句末卷曲的形状是否被误判为陈述,二者搭配覆盖了有无助动词两种句法条件,组合意义是同时暴露二语听者在首尾两端的系统性偏差。

再看多短语。多短语问句出现大反转:母语组几乎满分,二语组正确率极低,多数被听成陈述,假设三未被确认。多短语陈述两组都极准,假设四得到确认。母语组 4 条件均高于 95%,假设五得到确认。

下面第二张表整理多短语两条件的对照,公平条件与指标方向同上。

条件指标Markina 母语组二语组组间检验
多短语问句判为问句正确率97.2% 正确23.8% 正确t=14.21,p 小于 0.001,d=3.52,差异显著

该表显示二语者在多短语陈述上完全可用,代价全部集中在多短语问句,效应量 d 达 3.52,远大于单短语陈述的效应。这支持论文判断:相似核轮廓之外,中部分界与整体形状决定解读。

反证与第二组刺激:强调陈述能否解释误听?

论文用真值焦点强调陈述作反证,检验二语者是否把多短语问句按强调陈述归类。真值焦点句的形状是第一到第二音节上升并保持高直到倒数第二音节,与中性问句不同的是卷曲对齐在倒数第二音节而非末音节,且迂说法动词带 ba 前缀。预测是 Markina 组能区分该轮廓与问句,二语组不能。结果符合预测。

下面第三张表整理该反证与被试规模,比较问题是:在正确回答应为非问句的前提下,两组能否拒绝问句解读。

条件指标Markina 母语组二语组补充信息
真值焦点陈述三句判为非问句正确率92.6% 正确23.7% 正确每组样本为 Markina 19 人,二语 20 人,总完成 71 人
被试构成完成人数19 人20 人另有其他方言 32 人,不纳入主比较

表后解释需要同时讲收益与代价。收益是该结果与多短语问句误听方向一致:二语者倾向把高突显延续到接近句末的形状听成问句,把带中部分界加句末卷曲的形状听成陈述,这与西班牙语中强调与疑问轮廓相似的文献描述吻合。代价是该解释仍是假设,原文用可能一词提出,未在实验内直接播放西班牙语强调句作交叉感知对照,也未操纵中部分界的有无做最小对立体,因此不能断言因果。未评测边界包括操纵基频后的四十三减去核心与强调之外的刺激,原文明确留出不讨论,不能拿来补证。

中性问句 × 真值焦点陈述: 中性问句负责提供句末音节对齐的卷曲轮廓作为问句基准;真值焦点陈述负责提供倒数第二音节对齐的高突显加断言语义作为强调基准,二者分工是区分疑问语用与强调语用,搭配理由是二者在西班牙语中轮廓相似易混,组合意义是检验二语者是否把问句按强调陈述来归类。

限制:哪些结论是报告,哪些只是待验证解释?

需要区分 3 层表述。直接报告的是 4 条件正确率与组间检验:单短语问句无显著差异,多短语陈述无显著差异,单短语陈述与多短语问句差异显著且效应量大,母语组全条件高准。这些是显示层级。有限解释的是单短语陈述误听机制:非末尾词缺乏突显在西班牙语问句中常见,可能诱发疑问感知;多短语问句误听机制:可能被听成强调陈述,因为在西班牙语中两者相似而在 Markina 中不相似。

这些是支持层级,用了可能与假设措辞。未验证推测是把相关性当因果,例如断言二语者一定因西班牙语强调范畴而误听,或断言去掉中部分界后误听必然消失,原文没有做这种因果实验,不能这样复述。其他限制包括:摘要与方法被试数冲突,十五与十九不一致;刺激例句数量少,每条件仅 2 到 4 个句子,泛化到所有无重音句需谨慎;在线单次播放控制了重复但未控制设备与环境。

未测量反应时、置信度、语言水平分数与误判率分布;未报告录音与基频处理参数。总体趋势不等于每句都成立,真值焦点部分已显示三句之间可能有差异,但原文只以图展示分句正确率,未给出分句数字,复述时不硬写分句值。

第一语言 × 普遍问句线索: 第一语言负责提供听者已有的韵律范畴,如西班牙语中强调与疑问的对应关系;普遍问句线索负责提供跨语言常见的句末高音或升降卷曲,二者搭配理由是假设两者一致时二语者应判断正确,组合意义是当两者冲突时可以定位误差来自母语迁移还是普遍倾向失效。

复现先做什么:刺激表、流程与统计的最小清单

复现应先重建刺激表,而不是先跑统计。第一步找 1 位 Markina 方言母语者,录制全部由无重音词组成的句子,覆盖单动词句与分词加助动词句,每句录中性陈述与中性是非问,另录三句真值焦点陈述并保留 ba 前缀标记。录制时保持自然语速与中性语气,避免对比焦点。第二步按原文流程在 Qualtrics 或等价平台呈现,关键信息条件是每段只听 1 次,问题统一为 galdera da,选项为 bai 与 ez,指导语用巴斯克语。

第三步招募两组被试:Markina 母语组与西语母语的巴斯克语二语组,记录年龄、语言史与巴斯克语水平,但原文未规定具体量表,复现时需补记并报告。第四步计分:问句刺激答是为正确,陈述与强调刺激答否为正确,按被试聚合为每条件正确率百分比。第五步统计:对每条件做两组正确率的 Welch 独立样本 t 检验并报告 Cohen’s d,不做跨条件混合方差分析的替代,保持与原文一致。

第六步核对:先看母语组是否 4 条件高于 95%,再看二语组是否在多短语问句与单短语陈述上显著更低。若母语组未达标,应先检查方言是否为 Markina、词汇是否有隐藏重音、短语分界是否自然,而不是直接归因于被试。代码与数据方面,本次无可用资源声明,复现需自建语料并妥善保存原始录音与作答记录。

收束:何时值得借鉴这个发现,何时不必?

当教学或系统需要处理巴斯克语问句判断时,这个发现值得借鉴:如果只给学习者或模型看句末升降,会低估中部分界与高平分布的作用。单短语陈述的高平加末降应作为重点训练项,多短语问句的中部分界加句末卷曲应作为易混项,强调陈述应作为最小对比项。当任务是西班牙语问句识别或通用跨语言问句检测时,不必直接套用本文数字,因为本文没有在西班牙语刺激上做同条件测试,相似性来自文献引用。

复述方法时应保留的核心是:方言为 Markina、无重音词表、单短语与多短语对照、中性语用、单次播放、正确率百分比与 Welch 检验。应删去的是对曲线颜色、斜率数值或设备参数的想象。最终判断是:核轮廓相似不保证语用解读一致,整体音高形状与第一语言范畴共同决定听者把一句话听成问句还是陈述,这一判断由母语组高稳与二语组两处系统性误听共同支持,但迁移机制仍待用跨语言对照与分界操纵实验进一步验证。

📐 原文公式与排版

以下展示论文原页中的数学表达区域,保留原始上下标、分式和符号排版。区域序号仅用于本文导航,不是论文公式编号。

另有 6 个候选区域因边界不明确或图片数量、尺寸限制未展开;请查看完整论文中的原始排版。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 speechprosody-2026 论文汇总