本汇总收录 authenticated plan 选择集内全部 188 篇已完成分析、重标和单篇 staging 的论文。
🏷️ 标签说明:本期使用新版受控 taxonomy;热门方向只统计主任务。
⚡ 今日概览
✅ authenticated plan 入选 188 篇 → 🔬 深度分析、Reader 与页面投影完成
🏷️ 热门方向
| 方向(仅主任务) | 数量 |
|---|---|
| #语音属性识别 | 111 篇 |
| #口语理解 | 20 篇 |
| #病理语音评估 | 15 篇 |
| #音频分类 | 9 篇 |
| #语音情感识别 | 6 篇 |
| #文本到语音 | 4 篇 |
| #音视频理解 | 3 篇 |
| #语音识别 | 3 篇 |
| #轮次切换 | 2 篇 |
| #语言识别 | 2 篇 |
| #语音合成 | 2 篇 |
| #语音交互 | 2 篇 |
| #语音可懂度评估 | 2 篇 |
| #说话人验证 | 1 篇 |
| #音乐理解 | 1 篇 |
| #音频交互 | 1 篇 |
| #音频理解 | 1 篇 |
| #音视频交互 | 1 篇 |
| #语音编码 | 1 篇 |
| #语音质量评估 | 1 篇 |
📊 论文评分排行榜
| 排名 | Reader 中文题目 | 英文题目 | 八维评分 | 分档 | 文档类型 | 主任务 |
|---|---|---|---|---|---|---|
| 1 | 阿姆哈拉语短语重音是边界还是节律头:窄聚焦与宽聚焦的证据 | Phrase-level prominence in Amharic in broad and narrow focus | 6.7/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 理论研究 | #语音属性识别 |
| 2 | 拍手何以助听词:安静与噪声下节拍手势加速词汇通达却不依赖重音对齐 | Beat gestures facilitate lexical access in quiet and degraded speech | 6.7/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 1.5/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 前50% | 应用研究 | #口语理解 |
| 3 | 五音节切成两块,低音目标为何只留在最后:青年上海话的声调切分与收敛 | Low Tone Target in Pentasyllabic Noun Phrases in Youth Shanghainese | 6.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 理论研究 | #语音属性识别 |
| 4 | 把音高、能量和语速画在同一条线上:VIP2VIP 的三维韵律可视化管线 | A Multi-Dimensional Pipeline for Holistic Prosodic Visualization: Integrating f0, Intensity, and Syllabic Rate using VIP2VIP | 6.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.5/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音属性识别 |
| 5 | 结尾多出一个央元音小音节时,连续上扬调还是原来的上扬调吗 | Consequences of schwa insertion on continuation rises in Southern and Non-Southern French | 6.6/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 理论研究 | #语音属性识别 |
| 6 | 真浊塞音一定压低基频吗:坦头闽南语四个声调里的反例 | True voicing and F0 perturbations: evidence from Tantou Southern Min | 6.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 理论研究 | #语音属性识别 |
| 7 | 先按非韵律证据找句子,再看调形:伦敦多族裔英语疑问句与强调 lengthening 的升降调 | Multicultural London English Intonation: Pattern and Performance | 6.5/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 8 | 希腊语是非问句只有一个升调吗:自然对话里声调选择与偏向高低的分离 | Greek polar question tunes: Insights from naturalistic speech | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #口语理解 |
| 9 | 重音类型是音系类别,还是线索打包?德语产出与突显感知的对照检验 | Are pitch accent types more than just phonetic cue bundles? | 6.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 理论研究 | #语音属性识别 |
| 10 | 只留韵律还能分出印地语和印度英语吗:边界线索的听辨与声学对照 | Comparing acoustic cues to phrase boundary in Hindi and Indian English | 6.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语言识别 |
| 11 | 普通话里听谁更突出:快速韵律转写一致性为何偏低 | Rapid Prosody Transcription as a tool to assess the perception of phrase-level prominence in Mandarin | 6.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 12 | 下颌开合的幅度与变异如何塑造朗读节奏:有声音表现训练者的证据 | Jaw movements shape the rhythm of prose and poetry reading: evidence from speakers with vocal expression skills | 6.4/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 13 | 自动韵律切分能代替人工切分吗:巴西葡萄牙语自发语音合成的对照检验 | Investigating the effect of automatic prosodic segmentation on speech synthesis for Brazilian Portuguese | 6.3/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #文本到语音 |
| 14 | 听到错调是纠正还是跟读:粤语并调对真人与 AI 的语音趋同 | Phonetic Accommodation to AI and Human talkers: A Case Study of Cantonese Tone Mergers | 6.3/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #音视频交互 |
| 15 | 平均音高一样动听,为何还是听出刻板:用熵量面谈对话里的语调多样性 | Entropy, individual differences, and autism: Quantifying the diversity of intonation style in face-to-face conversation | 6.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #病理语音评估 |
| 16 | 只有 1.5 小时录音时先冻住耳朵再改手写:Amchi Konkani 的迁移加词典修正 | Amchi - Low Resource Language ASR with Crowdsourced Post-Processing | 6.2/10 · 创新 1.2/2 · 技术严谨 0.9/1.5 · 实验充分 0.6/1.5 · 清晰度 0.6/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #语音识别 |
| 17 | 句首助动词重音何时才算偏向:否定极性占主导,陡升台阶音只在肯定问句中核查眼前证据 | The interpretation of prenuclear accents in English (biased) questions | 6.2/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #口语理解 |
| 18 | 低后元音真的更挤嗓吗:英语中舌位回缩与声门收缩的受控检验 | The interaction between vowel quality and voice quality in English | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 前50% | 理论研究 | #语音属性识别 |
| 19 | 同是下降调,为何高低相同却仍能分开:飞翔话两个降调的音高与时间二维证据 | Falling in Two Dimensions: Pitch and Temporal Properties in Feixiang Chinese Falling Tone Contrast | 6.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 理论研究 | #语音属性识别 |
| 20 | 听不见反馈的声音怎么做识别:把马拉地语聋人语音映射到日常任务词表 | ResonAIte: ASR for Everyday Tasks of a Deaf User via Transfer Learning | 6.1/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.5/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #语音识别 |
| 21 | 在非声调二语里压住声调:普通话、日语、韩语、法语听者如何处理英语音高 | Pitch Suppression in L2 English Lexical Access: Cross-Typological Evidence from Mandarin, Japanese, Korean, and French Listeners | 6.1/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #口语理解 |
| 22 | 句末耳语为何锚定在重音之后:西班牙电视新闻的边界标记解读 | Phrase-final whisper in Spanish broadcast speech | 6.0/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 23 | 四岁孩子在家说话快慢为何变:小组生人效应与说话-身体的补偿关系 | Coordinating speech and body during conversation: an at-home study with 4-year-olds | 6.0/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 24 | 想让人想买,先让人感到愉悦:用知觉情绪约束合成广告语音 | The Impact of Perceived Emotions on Purchase Intention in Synthesized Advertising Speech | 6.0/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 应用研究 | #文本到语音 |
| 25 | 声调语言里哄孩子也要抬高音调吗:伊博语儿歌的音高与音质分层 | Singing to Children in Igbo: An Acoustic Analysis of Pitch and Voice Quality | 6.0/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.9/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 26 | 音高敏感跨母语起作用,节奏敏感却分母语:德法韩学习者感知西班牙语重音 | Disentangling the Musical Dimensions related to L2 Stress Perception: Evidence from German, French, and Korean Learners of Spanish | 6.0/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 27 | 按行停顿还是按句停顿:克里利十三年朗读里的诗行乐谱 | The Prosody of Poetic Performance in Robert Creeley’s “I Know a Man” | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 28 | 濒危遗产语还分得清三种问句吗:保加利亚犹太西班牙语的问句语调 | Question Intonation in Bilingual Speakers of Bulgarian and Judeo-Spanish | 5.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 29 | 一足还是两足:索伊科拉英格里亚语三音节中范畴切分下的渐变语音 | Phonetic graduality behind categorial phonological footing in Soikkola Ingrian | 5.9/10 · 创新 1.4/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 前50% | 理论研究 | #语音属性识别 |
| 30 | 把噪声当刻度:用回归预测朗伯德效应的强度 | Detection of Lombard Speech Using Different Model Architectures and Speech Features | 5.8/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 31 | 整句里的手势为何不再决定重音:西班牙语节拍手势效应的整句检验 | Assessing the Effect of Beat Gestures on the Perception of Lexical Stress in Full Spanish Sentences | 5.8/10 · 创新 0.8/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.0/1.5 | 前50% | 应用研究 | #音视频理解 |
| 32 | 打断太少学不会:用声学扰动与删尾重组补足离线轮替标注中的中断样本 | Too few interruptions? Using data augmentation to improve offline automatic turn-taking annotation | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #轮次切换 |
| 33 | 听得准的人一定说得清吗:普通话问句与陈述语调的感知与产出关联 | Relationship Between Perceptual Accuracy and Productive Distinctness of Question and Statement Intonations in Mandarin | 5.8/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #音频分类 |
| 34 | 时长被抹掉之后,三声才像二声:普通话二三声混淆的再检验 | Mandarin Tone 2/3 confusion revisited | 5.8/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 35 | 手势与重音是互相叠加还是互相补偿:一段德语演讲里的多模态显著性检验 | Multimodal prosody in German – Evidence for the additive nature of gestural and accentual prominence in form and timing | 5.8/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 36 | 巴西口音英语重音:时长缩减不足,响度对比来补 | English with Brazilian beat: Brazilian English word stress and vowel reduction | 5.8/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.6/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 37 | 带口音的普通话还是整齐的音节节律吗:十地口音的连续统证据 | Rhythm Variation in Regional Accented Putonghua: A Continuum Perspective | 5.8/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.3/1.5 | 前50% | 理论研究 | #语音属性识别 |
| 38 | 突出时听者为何反而少用频谱线索:英语紧松元音感知的产生镜像 | Effects of F0-based Prosodic Prominence on the Perception of the English Tense-Lax Vowel Contrast | 5.7/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #音频分类 |
| 39 | 定冠词更短吗:德语冠词边界时长如何标记已知与未知 | Signalling language redundancy: The acoustic salience of in/definite articles in German | 5.7/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 40 | 焦点在句首名词短语内部时,前置词为何要压低自己的 prominence | Pre-focal intonational variation in Hungarian as prominence reduction | 5.7/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 41 | 用长语境找韵律:从 YouTube 检索到 wav2vec2 二选一的韵律最小对基准 | ML Classification in a Benchmark of Prosodic Minimal Pairs | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #音频分类 |
| 42 | 焦点靠音高撑起来吗:两种墨西哥西班牙语用音高范围和形状标记焦点的程度之差 | F0 focus marking in two Mexican Spanish ethnolects | 5.7/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.4/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 43 | 默读时的重音从哪来:当词汇被拿掉,谁还在用纯韵律做理解 | Individual differences in use of prosodic and lexical information in implicit prosody | 5.7/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #口语理解 |
| 44 | 发得出却听不出:粤语 T2-T5 近合并如何被最小对比例稳住 | Equilibrium Dynamics of Near-Merger: Functional Load Effects in Cantonese Tone Contrast | 5.7/10 · 创新 1.4/2 · 技术严谨 0.8/1.5 · 实验充分 0.5/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 1.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.3/1.5 | 前50% | 理论研究 | #音频分类 |
| 45 | 听见介音需要多长时间:语速与音节结构如何塑造普通话/j/的时间累积 | Speech rate and syllable structure effects on the perception of Mandarin medial /j/ by native and Japanese listeners | 5.7/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 46 | 声调难量化:连续表征记得住声调,离散单元却偏向音素 | Lexical Tone is Hard to Quantize: Probing Discrete Speech Units in Mandarin and Yorùbá | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 方法研究 | #音频分类 |
| 47 | 先吸气还是先想好说什么:用儿童与成人对比判断呼吸与韵律的方向 | On the Relationship between Breathing and Prosody in the CAPIL Corpus | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 数据集与基准 | #语音属性识别 |
| 48 | 妈妈对孩子说话更清楚:时长拉长与抵抗弱化的信息动因 | Informational Motivations for Prosodic Variation in Child-Directed Speech | 5.7/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 49 | 当脸和声音吵架时,人工耳蜗学龄前儿童为什么更信脸 | Audiovisual Emotion Perception in Mandarin-Speaking Preschoolers with Cochlear Implants: Visual Dominance and Balanced Eye-Mouth Attention | 5.7/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音情感识别 |
| 50 | 焦点抬高了整词,重音却只剩半边:雅美语焦点与重音的首次分离检验 | A first look at the prosody of focus and stress in Yami (Tao) | 5.7/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 51 | 焦点拉长时长,语义似然却未必:德语朗读实验中的时长编码 | What kind of informativity could drive phonetic duration modification: Focus structure or semantic likelihood? | 5.7/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 52 | 倒数第二音节拉长是边界提前开始,还是重音与边界两件事相遇:塞茨瓦纳实时 MRI 的运动学证据 | Articulatory kinematics of penultimate and final lengthening in Setswana: Evidence from real-time MRI | 5.7/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 53 | 误会迫使换权重:英语者缩短松元音,日语与普通话者走向不同维度 | Timing the message: Reweighting temporal and spectral cues in native-nonnative conversational speech adaptation | 5.7/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音交互 |
| 54 | 笑点前多停 157 毫秒:普通话脱口秀会标记笑点,但听众不靠它觉得好笑 | Prosodic Markers in Mandarin Stand-Up Comedy: An Acoustic and Perceptual Study of Pauses | 5.7/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #音频理解 |
| 55 | 不在同一房间,开口为何更费力:远程、共处与混合会议中的停顿证据 | Filled and silent pause production in remote, collocated and hybrid meetings | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 56 | 声调相似不等于线索相同:法语者辨北方越南语声调的基线与跨语言训练为何只快不准 | Perception of Northern Vietnamese Tones: A Cross-Language Training Experiment | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 57 | 同一句 Since when are they linguists?不信与求信息靠韵律分开 | The prosody of English since-when questions | 5.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 58 | 敬畏的声音为何又慢又轻又稳:单字韵律中时长、音高变化与共振峰稳定的分工 | Prosodic features of awe: What makes the voice sound in awe? | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音情感识别 |
| 59 | 词干首音节更用力吗:科姆语位置重音的时长与共振峰证据 | Acoustic correlates of positional prominence in Kom | 5.6/10 · 创新 1.4/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 60 | 不是打绝对分,而是估计变化量:同人同文本的相对声音印象 | Investigation for Relative Voice Impression Estimation | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 61 | 中性爱尔兰语合成句能否只改嗓音源就听出喜怒:全局与重音局部变换的叠加检验 | Voice parameter shifts and the perception of emotion in Irish synthetic utterances | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 方法研究 | #语音合成 |
| 62 | 结构对上了才搬:瑞典语重音与调峰定时如何进入日语声调 | L1 Swedish transfer of stress and F0 peak alignment in L2 Japanese prosody | 5.6/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.1/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 63 | 不切音节、不标声调:用一整段 F0 变化分布刻画一门语言 | Holistic distributional signatures of F0 dynamics | 5.6/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 方法研究 | #语音属性识别 |
| 64 | 时长为主、音高为辅:粤语母语者三语普通话焦点韵律的感知与产出如何各自为政又彼此牵连 | Complexity in the perception-production link: A case of L3 Mandarin focus prosody by L1 Cantonese learners | 5.6/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 65 | 声学没变好、词汇却在接管:普通话儿童声调加工从独立到权衡 | From Independence to Trade-offs: Developmental Shifts in Lexical Tone Processing among Mandarin-Speaking Children | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #音频分类 |
| 66 | 入声舒化早期:大同晋语时长守住对立、音高与嗓音让位 | Production and perception of Checked Syllables Opening in progress: A case study from Datong Jin Chinese | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 67 | 焦点后压缩与疑问上扬并存:昆明话如何同时标记强调与问句 | Prosodic Realization of Focus and Interrogative Intonation in Kunming Mandarin | 5.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 68 | 母语方言里音高的分量不同,听第二语言重音的方式也会不同吗 | Dialectal Variation in Korean: Sensitivity to F0 in the Discrimination of L2 Lexical Stress | 5.6/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 69 | 丢掉的/h 留下的低音:布拉杰语声调是听得出来的范畴,还是正在磨掉的痕迹 | Perceptual Correlates of Lexical Tone in Brajbhasha | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 70 | 升调是谁的:话语语境如何左右普通话声调与语调的判断 | Discourse Context in the Perception of Mandarin Tone-Intonation Ambiguity | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 71 | 同样都带重音,波斯语三种焦点为何舌头和嘴唇动得不一样 | Prosodic Strengthening and Focus Type in Persian: an EMA Study | 5.6/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 72 | 疑问句里的重音为何变了形:人类会换声调策略,合成语音却只用陈述句一套 | Would a *human* sound like that?: Acoustic correlates of focus in human and synthetic speech | 5.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音合成 |
| 73 | 惊讶不在一个地方:升调看句尾,降调看重音 | Phonological Encodings of Speaker Surprise in American English Rising and Falling Nuclear Tunes | 5.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #语音情感识别 |
| 74 | 高低重音不只靠音高:德语疑问句中嗓音质量束如何分工标记突显 | Beyond F0: Voice-Quality Bundles as Prominence Cues in German | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 75 | 语码切换遇上对比性焦点:基频是相互靠近还是切回后更夸张 | Interactions between Code-switching and Contrastive Focus in Bilingual Language Production | 5.6/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 76 | 词准句偏:语速与变异线索如何改写句子层面的音色判别 | Dominant role of temporal–prosodic cues in sentence-level voice discrimination: Insights from interpretable machine learning | 5.6/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.4/1.5 | 前50% | 应用研究 | #说话人验证 |
| 77 | 韵律重音与句末偏好相争时,6 到 8 岁儿童如何判断焦点 | Focus Comprehension in Mandarin-speaking Children: Evidence from Sentence Verification Task | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #口语理解 |
| 78 | 手势能画出声调吗:哼唱与手指轨迹为何趋同而带词朗读却偏离 | Gestural-Based Production of Ambiguous Mandarin Tones: A Multimodal Comparison of Native and Non-native Speakers | 5.6/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #音频交互 |
| 79 | 戴口罩反而更好:粤语声调辨别为何不受遮挡拖累 | Mask-Wearing Facilitates Cantonese Tone Discrimination | 5.6/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 80 | 下颌开口峰速度对准元音起点,强弱分配却随母语走:普通话口音英语的两种节律 | Mandarin Speakers of English: Universal and language-specific timing of syllabic jaw movement with acoustic vowel onset | 5.5/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 1.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 81 | 低平 F0 是重音还是边界调:美国英语低调目标的线索权重 | Pitch accent or edge tone? Acoustic cue weighting for perception of Low tonal targets in American English | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 82 | 声调中和下温州话高低调域为何不同时消失:位置、轮廓与年龄的线索重组 | Register Realization under Tonic Neutralization in Wenzhounese | 5.5/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.4/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 83 | 只留韵律能听出精神分裂症谱系障碍吗:人类感知与机器分类的平行验证 | Speech Prosody in Schizophrenia Spectrum Disorders: Perceptual Evaluation and Machine Classification | 5.5/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 84 | 粤语者为何更准分辨英语重音:把重音听成声调的两类同化解释 | The Cantonese Advantage in English Lexical Stress Discrimination: A Perceptual Assimilation Perspective | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #音频分类 |
| 85 | 他加禄语句子位置是否以同样方式触发元音低化和喉塞删除 | The realization of prosodically-conditioned segmental alternations in Tagalog | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 86 | 手势顶点为何在 Babanki 音节里更早:双语者音节内重音时序的跟随证据 | Variation in the Fine Timing of Co-Speech Gestures Among Bilingual Speakers | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #音视频理解 |
| 87 | 同形“买嘛”如何分义:天津话疑问与否定共用形式下的韵律分工 | Prosodic Disambiguation of Wh-Words: In the Case of “ma” in Tianjin Mandarin | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #口语理解 |
| 88 | 焦点里谁在用力:单人层面看韵律与手势如何分工做超清晰化 | Individual strategies in multimodal hyperarticulation | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 89 | 韵律测不准不是孩子问题:一个 iPad 测验能否分开年龄成长与自闭症困难 | The Prosody Assessment Application as a Tool to Evaluate Prosody in Autistic and Non-Autistic Children | 5.5/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 90 | 汉字有调、日语有型:新日语借词普通话声调为何两边都不跟 | Tonal adaptation of recent Japanese phonemic loanwords in Mandarin Chinese | 5.5/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 91 | 焦点不都靠抬高音调:南宁普通话在句首焦点缺压缩、句尾焦点保留压缩 | Focus marking in a language contact context: A comparison of focus-induced f0 effects in Nanning Mandarin and Standard Mandarin | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 92 | 句首算话语、句尾只听声音:中国英语学习者韵律加工的位置分离 | Position-Dependent Integration of Pitch Accent and Focus in Chinese EFL Learners: An ERP Study | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 93 | 把精神科听诊变成可量化的韵律测量:一个嵌入问诊的说话人-轮次-韵律工具 | Computational Analysis of Prosody for Clinical Psychiatry | 5.5/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.6/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 1.0/1.5 | 前50% | 系统技术报告 | #病理语音评估 |
| 94 | 赢球和输球听得出来吗:用赛后采访捕捉自发情感的语音数据集 | iMiGUE-Speech: A Spontaneous Speech Dataset for Affective Analysis | 5.5/10 · 创新 1.0/2 · 技术严谨 0.9/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 前50% | 数据集与基准 | #语音情感识别 |
| 95 | 段内快慢与一次能说多长分开受控:安大略少数法语的速率与语段长度解读 | Language Use index and Articulation rate variation in a minority Canadian French | 5.5/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 96 | 低调的疑问与高调的起点:通古贝埃维语疑问韵律如何同时容纳频率码与松弛韵律 | Tongugbe Ewe yes-no question prosody: revisiting the frequency code and lax prosody | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 97 | 声调语言里靠什么赢得演讲:普通话演讲比赛中的共振峰与音高策略 | Speaking to Win: How Prosodic Features Predict Success in Mandarin Public Speaking Competitions | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 98 | 同一个 53 调形,为何低水平粤语者把普通话一声听宽了 | Joint Effects of Native Phonological Rule and L2 Proficiency on Cross-language Tone Perception | 5.5/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 前50% | 应用研究 | #音频分类 |
| 99 | “You Good?”靠什么区分陈述与疑问:F0 峰位置与眉毛峰时序的协同证据 | “You Good?”: Examining the Coordination of F0 and Eyebrow Movements in the Differentiation of Sentence Types | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 100 | 元音开口大小与声调高低如何共同改变嗓音的稳定程度 | Mandarin vowels: Intrinsic properties and interaction with tone | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 101 | 语速变慢就更清楚吗:还原程度不只由全局时长决定 | Speech Reduction and Perceived Clarity: Just a Matter of Rate? | 5.5/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音可懂度评估 |
| 102 | 同字不同意:蒙古语反问句靠句末声调与时长被听出来 | The Prosody of Rhetorical Questions in Mongolian | 5.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #口语理解 |
| 103 | 自闭症儿童韵律不是单一偏离:跨芬兰语、法语、斯洛伐克语的音质与强度证据 | Cross-linguistic Prosodic Analysis of Autistic and Non-autistic Child Speech in Finnish, French and Slovak | 5.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #病理语音评估 |
| 104 | 平静不是省力,指挥不止大声:冥想与魅力演讲的声音策略对照 | From Calm to Command: Acoustic Strategies of Corporate Leaders and Guided Meditation Coaches | 5.5/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 105 | 能听出“歌唱腔”和“敲击腔”吗:墨西哥西班牙语韵律变体靠早期经验来分辨 | Attunement to Prosodic Cues in Mexican Spanish: Social Profiles and Dialect Perception | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 前50% | 应用研究 | #语言识别 |
| 106 | 德语靠重音、意大利语靠语序:意大利学习者如何重配焦点标记 | Focus marking in L2 German: How Italian learners adjust their use of prosody and syntax | 5.5/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 107 | 遗产俄语疑问语调守住了区别,变的是常用型的使用频率 | Acquisition of wh-question intonation in Russian heritage children | 5.5/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 108 | 母语里没有的降升调,法国人就听不出:英语升调与降升调的辨别实验 | Rise or fall-rise? On the perception of English intonation by French listeners | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.9/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 109 | 真诚与反讽没有时间差吗:用注视时间检验基频与谐噪比如何实时引导语义选择 | An exploratory eye-tracking study into the time course of sincere and sarcastic speech recognition | 5.5/10 · 创新 1.0/2 · 技术严谨 0.8/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 1.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 前50% | 应用研究 | #口语理解 |
| 110 | 低声调为何进不了第一槽:粤语双重粗口语素的声调排序偏好 | Tone-Driven Preference in Cantonese Double Expletive Constructions | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 111 | 去掉语境只听语调:普通话反语表扬为何最难听懂 | Ironic Prosody Perception in Mandarin: The Role of Autistic Traits | 5.5/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 前50% | 应用研究 | #口语理解 |
| 112 | 诗句的停顿不是刻死的:语速一变,双字脚就合并且消失 | Dynamic Prosodic Grouping—Evidence from Recitation of Classical Chinese Poetry | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.6/1 · 影响力 0.9/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 113 | 英语里听到的声调,何时自动点亮普通话词汇:双语者跨语言音系激活的脑磁图证据 | The neural basis of lexical tone in bilingual language processing: A MEG study | 5.5/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 1.0/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 前50% | 应用研究 | #语音属性识别 |
| 114 | 又快又要分清两级短语:Rapid-ToBI 只做分组判断的取舍 | Rapid-ToBI for Phrasing: Comparing Methods for (Faster) Annotation of Prosodic Phrase Structure | 5.4/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 后50% | 方法研究 | #语音属性识别 |
| 115 | 不用切分音节也能认词:连续韵律线索如何逐帧改写词竞争 | Prosody in Motion: Continuous Cue Integration in Incremental Word Recognition Across English Segments, Mandarin Tones, and Italian Stress | 5.4/10 · 创新 1.0/2 · 技术严谨 0.8/1.5 · 实验充分 0.5/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #语音识别 |
| 116 | 普通话焦点不是不会发,而是基频让位:自闭症儿童的声学线索再分配 | Prosodic Focus Production in Mandarin-speaking Children with Autism Spectrum Disorder: Atypical Acoustic Cue Distribution | 5.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.4/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 117 | 合流者不拉开距离、清晰者主动靠近:粤语三六声调在对话中如何对齐音高区间 | I don’t have grudges, I have a wish: Cantonese Suprasegmental Adaptation in Conversations | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音交互 |
| 118 | 重音落在形容词还是名词上:峰值与均值、时长如何分别推动肯定还是否定解读 | Pitch, intensity, and duration in prosodic focus: Predicting listeners’ interpretations of ambiguous responses | 5.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #口语理解 |
| 119 | 自闭症儿童语音线索跨语言能通用吗:芬兰语、法语和斯洛伐克语的对照分类 | Classification of Autistic and Non-Autistic Children’s Speech: A Cross-Linguistic Study in Finnish, French, and Slovak | 5.4/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 1.0/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.7/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 120 | 高音不在重音上时:阿美语疑问词与祈使句的声调重联分析 | A Phonological Analysis of Sentence Types in Amis (Formosan): Wh-interrogatives and Imperatives | 5.4/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.5/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.2/1.5 | 后50% | 理论研究 | #语音属性识别 |
| 121 | 疑问词韵律压住边界时,长度为什么还能移动重音性拖长 | Prosodic Realization of Attachment Ambiguity: Length and Wh-Intonation in Korean | 5.4/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #口语理解 |
| 122 | 法语重音短语能装多少音节:用 250 毫秒下限和 1250 毫秒上限来定界 | Duration of accentual phrases in French | 5.4/10 · 创新 1.2/2 · 技术严谨 0.8/1.5 · 实验充分 0.5/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 1.2/1.5 · 可复现 0.1/0.5 · 工程/实践 0.3/1.5 | 后50% | 理论研究 | #语音属性识别 |
| 123 | 只听到前三个词时,高共情听者为何更早猜中对比含义 | Using an incremental guessing game to study the role of empathy in prosodic processing | 5.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.4/1.5 | 后50% | 应用研究 | #口语理解 |
| 124 | 只给看、不给听的反馈:视觉反馈如何帮普通话人建立粤语声调范畴 | Enhancing Cantonese tone learning in Mandarin speakers: The role of visual feedback and individual differences | 5.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 125 | 面子威胁越高声音越低吗:用整句语调曲线检验墨西哥西班牙语提议的礼貌 | Visualizing intonation and politeness: A GAM-based analysis of Mexican Spanish offers | 5.4/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 126 | 当语调不再标记焦点:匈牙利语中手势与元音目标的稳定对齐 | Examining the role of prosody and information structure in Hungarian speech and co-speech gestural coordination: An EMA study | 5.4/10 · 创新 1.1/2 · 技术严谨 1.2/1.5 · 实验充分 0.6/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.6/1.5 | 后50% | 应用研究 | #音视频理解 |
| 127 | 尼日利亚英语核调型不只是升降:听者如何用结尾音高判断礼貌与得体 | Perception and social meanings of Nuclear Configurations in Nigerian English | 5.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 128 | 有声调母语也救不了新声调:粤语者跨情境学普通话声调的特异性干扰 | The Role of L1 Tonal Experience in Cross-Situational Learning of Non-Native Tone Contrasts | 5.3/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #口语理解 |
| 129 | 窄焦点张口更大:用下颌位移检验焦点类型与 EMA 和 MARRYS 的一致性 | Comparison of EMA and MARRYS: Jaw displacement in narrow vs broad focus | 5.3/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.8/1.5 | 后50% | 方法研究 | #语音属性识别 |
| 130 | 动漫腔不只在音高:句内气声、粗糙与挤压如何分段出现 | Local Non-Modal Voice Quality Dynamics in Japanese Anime Speech | 5.3/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.2/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 131 | 音长与重音共享发音手段却错时出现:爱沙尼亚语韵脚的逆时关系新解 | Articulatory Dynamics of Quantity and Stress in Estonian Prosody | 5.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 132 | 白语透镜下的普通话声调:早期双语儿童为何先会升调 | The Bai Lens: Examining Mandarin Tone Development in Bilingual Preschoolers | 5.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 133 | 走快了说也快,说快了走却不快:走路加说话的不对称耦合 | Do walking and talking entrain in a simultaneous walking + talking task? | 5.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 134 | 长短时间尺度对不齐:ALS 构音障碍中频谱流与语调短语起点的相位一致性下降 | Cross timescale coherence as a biomarker in speakers with ALS | 5.2/10 · 创新 1.3/2 · 技术严谨 1.2/1.5 · 实验充分 0.6/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.4/0.5 · 工程/实践 0.4/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 135 | 都听基频轮廓,为何声调母语者更会放弃无效线索:粤语与英语听者辨别泰语声调 | Optimizing Utilization: Language Experience and F0 Dimension-weighting in Thai Tone Perception | 5.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 136 | 压低末尾音高峰反而更快:听损者话轮结尾预测中的韵律线索取舍 | Enhancing and reducing prosodic cues: A preliminary investigation of turn-end prediction in listeners with hearing loss | 5.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #轮次切换 |
| 137 | 字都对,意思却偏了:生成语音为何传达不好信息结构 | Evaluating prosodic encodings of information structure in generative speech AI | 5.2/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 数据集与基准 | #文本到语音 |
| 138 | 先一致还是先趋同:立场一致如何塑造后续语速趋同 | Speech Rate Convergence as a Function of Prior Stance Agreement and Perceived Social Dynamics | 5.2/10 · 创新 1.1/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.4/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 139 | 绕口令里的加速与升调:口语流利自闭症儿童的性别差异与症状关联 | Prosody during tongue twisters in verbally fluent autistic children: Sex differences and correlations with symptom severity | 5.2/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 140 | 非法还是非词:声调搭配与词汇身份如何压缩听感距离 | The Interaction of Tonotactics, Lexicality, and Psychoacoustics in Evaluating Perceptual Distinctiveness | 5.2/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音质量评估 |
| 141 | 缺上下文就掉线、缺节奏要分心:主观认知下降在不同表达风格下的听觉追踪 | Keep Calm and Listen: Subjective Cognitive Decline Modulates Cortical Tracking of Speech and Music in Different Expressive Styles | 5.2/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 142 | 看得见的重音:波斯语焦点越强,头部摆动越大越快 | Visual prosody in Persian: Tracking 3D head movement patterns with electromagnetic articulography | 5.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 143 | 朗读与自发语体下性取向语音差异:为何身份标记只在自发 speech 中显现 | Interactions of sexuality and (supra)segmental correlates of speech register | 5.2/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 144 | 法语歧义边界靠什么分开:母语者的上扬与拉长,中级以上二语者才跟上 | Melodic and Temporal Markers of French Ambiguous Prosodic Boundaries in Natives’ and Chinese L2 Learners’ Speech Production | 5.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 145 | 做到了音高目标,却没衔接好过程:法语母语者普通话声调四一声连接的时序证据 | Process vs. Result: Evidence for Coarticulatory Process Difficulties in French-speaking Learners of Mandarin | 5.2/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 146 | 焦点重音放在句首还是句尾:3 到 9 岁儿童如何从随机猜测走向成人式感知 | Development of Focal Accent Perception in 3- to 9-Year-Old Mandarin-Speaking Children: Evidence from Prosodic Continua | 5.2/10 · 创新 1.3/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.4/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 147 | 句法标出焦点后重音为何变轻:普通话分裂句的韵律补偿 | Prosody-syntax trade-offs in Mandarin clefts | 5.2/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.9/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.4/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 148 | 孩子把《戴帽子的猫》读得像大人吗:用词时长偏离度预测阅读理解 | Prosodic fluency in spoken productions of The Cat in the Hat predicts reading comprehension skill in 6-10-year-olds | 5.1/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.7/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 149 | 降阶重音真的更省力吗:用瞳孔扩张检验可及与全新语境下的韵律适配 | Using pupillometry to assess the interpretation of downstepped contours in Mainstream US English | 5.1/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.6/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #口语理解 |
| 150 | 句子变难时音高拉大还是压平:3 到 5 岁普通话儿童的范围与稳定性分化 | Linguistic Complexity Modulates Pitch Variability in 3-5-Year-Old Mandarin-Speaking Children | 5.1/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 1.0/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 151 | 声调管空间、焦点管时间:台湾华语辅音手势的两种突出机制 | Distinct Articulatory Effects of Tone and Focus in Taiwan Mandarin | 5.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 152 | 重叠只是难念,还是真的在抢同一个节律槽位:语音计划中有没有抽象重音格 | Evidence of Absence? Abstract Metrical Structure in Speech Planning | 5.1/10 · 创新 1.2/2 · 技术严谨 1.3/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 153 | 句首鼻音变弱、句尾元音鼻化变弱:北京话声门开合与舌动作的时间竞争 | Prosodic effect on initial coronal nasal /n/ and post-nasal vowel nasalization in Beijing Mandarin | 5.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 154 | 没有声调就没有重音:泰语重音回忆揭示重音与声调的依赖关系 | No stress without tone: insights from Thai stress recall | 5.1/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 155 | 弱元素也能被强调吗:天津话七类弱成分的整体抬高与各自封顶 | The Effect of Focus on Different Weak Elements Categories: In the Case of Tianjin Mandarin | 5.1/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 156 | 神经音频编解码器能分清英语核语调吗:对 Mimi 的探针检验 | Probing neural audio codecs for distinctions among English nuclear tunes | 5.1/10 · 创新 1.3/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.8/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.3/1.5 | 后50% | 方法研究 | #语音属性识别 |
| 157 | 动词前后宾语为何声音不同:伊捷尔曼语中信息状态与韵律突显的对应 | On the prosodic realization of pre- and post-verbal objects in Itelmen | 5.0/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 158 | 台山话声调在痉挛型构音障碍中为何高平调最先丢失 | Tone Production in a Toisanese Speaker with Dysarthria | 5.0/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.5/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 159 | 音乐家识别言语情绪更快:韵律之外还有语义,冲突调节却未占优 | Musician Advantage for Speech Emotion Recognition: Beyond Prosody | 5.0/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音情感识别 |
| 160 | Mimi 码本分工真的切开了吗:语义码本与韵律编码的核对 | Is Prosody Encoded in the Neural Audio Codec Mimi? | 4.9/10 · 创新 1.1/2 · 技术严谨 0.9/1.5 · 实验充分 0.8/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #语音编码 |
| 161 | 喊“大声点”与“用点意念”:帕金森说话人为何调不准用力刻度 | Speaking “loud” and its effect on speech intelligibility and naturalness in Parkinson’s disease | 4.9/10 · 创新 1.2/2 · 技术严谨 0.8/1.5 · 实验充分 0.7/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 后50% | 应用研究 | #语音可懂度评估 |
| 162 | 韵律特征省而可释,MFCCs 繁而自动:癌症相关认知损伤语音筛查的对照试点 | Performance comparison of prosodic features and MFCCs for identifying cancer survivors with cognitive impairment | 4.9/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.6/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 163 | 停顿次数追上母语者,停顿位置却走反了:二语普通话韵律的量质分离 | Quantity Convergence, Quality Divergence: Disentangling Fluency and Accuracy in L2 Mandarin Prosody | 4.9/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 164 | 唱词听得清吗:中文音乐剧里字调与旋律如何算出依字率 | Tone-Tune Correspondence in Chinese Musicals: A Quantitative Study | 4.9/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.7/1.5 · 清晰度 0.6/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #音乐理解 |
| 165 | 不预设几类声调:用函数型主成分加非参数聚类重看开封话低调 | Modeling Tonal Variance by Functional Data Analysis: An Empirical Case of L-tone Variants in Kaifeng Mandarin | 4.9/10 · 创新 1.2/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 方法研究 | #音频分类 |
| 166 | 核前基频变化为何不显著:模仿、插值与局部上升的证据 | On the limited salience of variation in prenuclear F0 | 4.8/10 · 创新 1.0/2 · 技术严谨 1.1/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 167 | 只听说话方式不看说了什么:手工声学特征叠加 YAMNet 嵌入检测阿尔茨海默病 | A Hybrid Deep Learning Framework for Alzheimer’s Detection Through Voice Biomarkers | 4.8/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 168 | 早开始为何没更快:普通话韵律边界感知中的总体梯度与边界交互 | Prosodic Boundary Perception in Mandarin Heritage Speakers | 4.8/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #口语理解 |
| 169 | 当重音与裂句打架时:普通话背景二语者为何更信句式 | Prosodic and Syntactic Cue Integration in L2 English Focus Processing | 4.8/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #口语理解 |
| 170 | 低频拉长边界而语义场启动缺席:德语边界时长的非对称证据 | Effects of lexical frequency and semantic priming on durational patterns in German | 4.8/10 · 创新 1.2/2 · 技术严谨 1.1/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 171 | 重音更突出却没有更快:词汇通达不受韵律突显推动 | Prosodic prominence does not facilitate lexical access in a lexical decision task | 4.7/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.8/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.3/1.5 | 后50% | 应用研究 | #口语理解 |
| 172 | 语速走认知、音高走情感:27 段微格教学的双通道声音映射 | Dual Routes of Vocal Influence on Microteaching Evaluations: Speech Rate for Cognition, Pitch for Affect in Pre-Service Teacher Training | 4.7/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.8/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 173 | 强烈负情绪下高度熟练者也会漏出母语韵律:以音高范围为核心的证据 | Encoding of emotions in L2 and multidialectal English speech | 4.6/10 · 创新 1.0/2 · 技术严谨 1.2/1.5 · 实验充分 0.7/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #语音情感识别 |
| 174 | 声调轮廓为何能暴露双侧声带小结:基频与周期性线索的可解释分类 | Machine Learning-Based Evaluation of Mandarin Tone in Patients with Bilateral Vocal Nodules | 4.6/10 · 创新 1.1/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.6/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.6/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 175 | 基线先稳、顶线后变:3-5 岁普通话儿童自发话语中音高下倾的分化发展 | Pitch Declination Development in Spontaneous Speech of 3-5-year-old Mandarin-Speaking Children | 4.6/10 · 创新 1.2/2 · 技术严谨 0.8/1.5 · 实验充分 0.6/1.5 · 清晰度 0.6/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 176 | 把临床对话变成可复核的时间线:自动语音分析如何从噪声中算出韵律 | Demonstration of Automated Speech Analysis Tool for Clinical Use | 4.6/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.2/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 1.0/1.5 | 后50% | 系统技术报告 | #病理语音评估 |
| 177 | 三语者法语节奏为何只在辅音间隔上偏离:六个指标的顺向与逆向迁移 | Cross-Linguistic Influences on Rhythm in Trilingual Learners of French: A Multidimensional Analysis | 4.5/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 178 | 在变调中找重音:北卡舒布语用同一词的不同读法分离时长与强度 | Stress placement variability and acoustic stress correlates. The case of Northern Kashubian | 4.5/10 · 创新 1.2/2 · 技术严谨 0.8/1.5 · 实验充分 0.5/1.5 · 清晰度 0.5/1 · 影响力 0.7/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 179 | 单音节问句与陈述句的升降调:唐氏综合征成人能发出可辨认的轮廓,但诱发音系对立仍困难 | How speakers living with Down syndrome produce monosyllabic interrogative and declarative sentence types Challenges of a preliminary laboratory phonology experiment | 4.4/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #病理语音评估 |
| 180 | 厦门闽南语变调能产性之争:任务变简单了,被试就真会了吗 | The Effects of Task Complexity and Phonotactic Well-formedness on Tone Sandhi Application in Xiamen Southern Min | 4.4/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.8/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.0/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 181 | 无线光学追踪如何把超声、音频和头动收进同一时间轴 | A Wireless Synchronized Ultrasound-Audio-Motion Capture System | 4.3/10 · 创新 0.8/2 · 技术严谨 1.0/1.5 · 实验充分 0.3/1.5 · 清晰度 0.7/1 · 影响力 0.6/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.8/1.5 | 后50% | 系统技术报告 | #语音属性识别 |
| 182 | 核轮廓相似仍听错:重音缺失与短语分界如何左右巴斯克语问句判断 | Perception of interrogativity in Basque by native and L2 speakers | 4.3/10 · 创新 1.2/2 · 技术严谨 1.2/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.0/1.5 | 后50% | 应用研究 | #口语理解 |
| 183 | 提示词比性别更能改变播客节奏:NotebookLM 双人播客的语速与停顿实测 | Rhythm Variability in NotebookLM Podcasts | 4.2/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.5/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.4/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 184 | 语序错了、语调错了,为什么匈牙利听者还觉得可以:窄焦点的语境补偿 | Anything goes? On the appropriateness of mismatches between prosody and syntax in Hungarian narrow focus marking | 4.1/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.6/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.0/1.5 | 后50% | 应用研究 | #口语理解 |
| 185 | 问句该升该降:用短篇故事检验合成语音的疑问语调 | Evaluating Question Prosody in Text-to-Speech Software | 4.1/10 · 创新 0.8/2 · 技术严谨 0.8/1.5 · 实验充分 0.5/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.5/1.5 | 后50% | 应用研究 | #文本到语音 |
| 186 | 喊谁听得出来:距离感是否藏在呼唤的韵律里 | Sense of Distance: Word-Dependent Prosodic Cues for Addressee Recognition | 3.9/10 · 创新 1.0/2 · 技术严谨 1.0/1.5 · 实验充分 0.4/1.5 · 清晰度 0.7/1 · 影响力 0.5/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 187 | 母语时长策略迁入英语:四名波斯语者八次模仿中谁跟上了、谁没跟上 | An Exploratory Study of Farsi Speakers’ Imitation of English Lexical Stress | 3.6/10 · 创新 0.8/2 · 技术严谨 0.8/1.5 · 实验充分 0.5/1.5 · 清晰度 0.6/1 · 影响力 0.4/1.5 · 开源 0.0/1.5 · 可复现 0.3/0.5 · 工程/实践 0.2/1.5 | 后50% | 应用研究 | #语音属性识别 |
| 188 | 句末先嘎吱后清化:伊纳里萨米语中清化时长随词长增长而嘎吱不跟随 | Utterance-final devoicing and creaky voice in Inari Saami | 3.6/10 · 创新 0.8/2 · 技术严谨 1.0/1.5 · 实验充分 0.7/1.5 · 清晰度 0.6/1 · 影响力 0.4/1.5 · 开源 0.0/1.5 · 可复现 0.1/0.5 · 工程/实践 0.0/1.5 | 后50% | 应用研究 | #语音属性识别 |
📋 论文列表
1. 阿姆哈拉语短语重音是边界还是节律头:窄聚焦与宽聚焦的证据
英文题目:Phrase-level prominence in Amharic in broad and narrow focus
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Jackson Kellogg:机构信息未能从会议 PDF 纯文本可靠映射
- Jonathan Barnes:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究以阿姆哈拉语实验室朗读的无语境宽焦点陈述句与问答及纠正窄焦点对话为输入,以窄焦点声学实现方式与宽焦点默认突显位置的音系判断为输出,难点在于边缘突显语言是否存在类似英语核重音的默认突显及其表征。方法链分三步:先在亚的斯亚贝巴组织16名母语大学生佩戴头戴麦克风按伪随机幻灯片朗读宽窄焦点句组以获得受控语料,录音进入Praat声学标注步骤按感知峰值取音高峰值并切分词首尾音节提取时长强度与H1-H2,标注结果进入线性混合效应回归以分离焦点条件与句法位置效应并映射为重音短语与语调短语结构。与韩语式窄焦点左边界插入研究相比,该工作同时检验动词前而非句前末位置的默认突显假设,并区分问答焦点首部强化与纠正焦点尾部 lengthening的不同边界来源。在窄焦点语料条件下,纠正焦点的展平比例指标为38%,高于问答焦点的展平比例指标17%。在宽焦点语料条件下,动词前宾语相对动词前副词呈现更高音高峰值并伴随前词尾部 lengthening与更多前暂停,窄焦点则伴随可选的焦点后音高压缩。该结论的适用边界受限于三音节词受控朗读与年轻学生群体,自发语料感知突显与跨方言外推尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/rvlenth/emmeans — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/ByronAhn/PoLaR-Praat-plugin — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
2. 拍手何以助听词:安静与噪声下节拍手势加速词汇通达却不依赖重音对齐
英文题目:Beat gestures facilitate lexical access in quiet and degraded speech
标签:#心理声学实验 #言语感知 #音视频 #语音 #口语理解
评分:6.7/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Matteo Maran:机构信息未能从会议 PDF 纯文本可靠映射
- Silvia-Diana Drăgan:机构信息未能从会议 PDF 纯文本可靠映射
- Hans Rutger Bosker:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理视听言语感知中的词汇通达问题,输入为高预测性荷兰语句末双音节目标词视频语音,输出为词汇判断反应时与正确率,难点在于区分手势存在的整体易化与手势时点和词重音一致的特异性偏置。方法链分三步:先复用公开荷兰语视听材料构建在线词汇判断范式,操纵无手势与首音节或次音节对齐的拍节手势并遮挡面部以隔离手势线索,其试次分配输出进入下一步听觉操纵。接着将同一视频音轨与言语形噪声按负信噪比混合形成降质语音,使清晰与噪声两实验仅在可懂度上不同并提高视觉权重。最后用线性与广义混合模型对反应时与准确率建模,分离手势存在、词汇性与重音类型的交互并跨实验检验降质放大效应。与聚焦极小对重音知觉的前人工作不同,本研究使用无竞争词并结合高预测语境,直接检验交际性注意易化而非音位选择。在降质语音条件下,词目标的反应时指标易化量为122 ms,高于伪词目标的反应时指标易化量75 ms。结论适用边界受限于高预测语境、单说话人、遮挡面部与极端降质,重音一致性在中度降质和低预测语境的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://doi.org/10.34973/1qh4-5838 → https://data.ru.nl/collections/di/dcc/DSC_2025.00095_949 — 链接可访问(HTTP 200)
- 数据相关资源:https://osf.io/8vsfq/ — 链接可访问(HTTP 200)
- 数据相关资源:https://doi.org/10.34973/1qh4-5838 → https://data.ru.nl/collections/di/dcc/DSC_2025.00095_949 — 链接可访问(HTTP 200)
- 复现相关资源:https://doi.org/10.34973/1qh4-5838 → https://data.ru.nl/collections/di/dcc/DSC_2025.00095_949 — 链接可访问(HTTP 200)
- 第三方资源:https://cran.r-project.org/package=buildmer → https://cran.r-project.org/web/packages/buildmer/index.html — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
3. 五音节切成两块,低音目标为何只留在最后:青年上海话的声调切分与收敛
英文题目:Low Tone Target in Pentasyllabic Noun Phrases in Youth Shanghainese
标签:#统计分析 #语音学与音系 #韵律 #语音 #语音属性识别
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Jingyuan Gu:机构信息未能从会议 PDF 纯文本可靠映射
- Menghui Shi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为青年上海话二加三式五音节名词短语及所含二音节与三音节子单元的孤立读音,输出为砂变域是否重组与低调目标是否重插的声学判定,难点在于长域中词调中和与韵律分解是否同步发生。方法链分三步展开,先以生长曲线分析检验五字格整体基频曲线受整句首调还是第三音节即子单元首调支配,其输出的域切分假设进入下一步,再以逐时间点单因素方差分析检验各单元末音节跨首调的基频收敛以定位低调目标,最后以生长曲线对比分解与孤立条件的曲线高度差异以判断目标高低变化。相对已有四音节以内单域收敛研究,关键机制差异是同时检验砂变域重组与低调目标域是否重合,从而区分边界调与跨域弱目标两种解释。在末音节逐时间点方差分析检验条件下,孤立名词短语末音节在100%时间点的F指标为2.41n.s.,低于孤立名词短语末音节在80%时间点的F指标6.54*。结果支持分解为二加三两个砂变域,分解二音节末无收敛且高于孤立形式,分解三音节即五字格末在70%至80%处收敛且低于孤立三音节,支持单一低调目标贯穿五音节。该结论适用边界受限于二加三分解的青年口音名词短语,尚未验证三子域以上切分及其他句法结构与老年对照。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
4. 把音高、能量和语速画在同一条线上:VIP2VIP 的三维韵律可视化管线
标签:#开源工具 #信号处理 #韵律 #语音 #语音属性识别
评分:6.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音属性识别 | 主方法:#信号处理
👥 作者与机构
- Federico Lo Iacono:机构信息未能从会议 PDF 纯文本可靠映射
- Antonio Romano:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该文输入为意大利诗歌朗读录音及轻量Praat TextGrid标注,输出为单画布上同步显示基频曲率、响度和局部语速的三维韵律可视化,难点在于传统基频单维图无法共时呈现能量与时间密度的权衡。方法链分三步:先在浊音区间以5 ms步长抽取基频与强度并做z分数去野点,再由音节时长倒数经插值与归一化得到瞬时音节速率代理,最后用局部加权回归(Locally Weighted Scatterplot Smoothing,LOWESS)或加性模型(Generalized Additive Model,GAM)平滑基频并以线宽编码强度、颜色编码语速。与MOMEL/INTSINT、Prosogram及分窗显示相比,该机制把能量与时间许可条件直接绑定在音高轨迹上,使重音式起伏与短语漂移可目视区分。原文未提供可核对的关键定量结果,仅以4个诗例定性说明延续与列举等功能区分。该结论仅在意大利诗歌朗读及有音节与浊音标注的干净数据上展示,未验证对会话语音与跨语言的泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/fedeloiac/vip-pipeline — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
5. 结尾多出一个央元音小音节时,连续上扬调还是原来的上扬调吗
英文题目:Consequences of schwa insertion on continuation rises in Southern and Non-Southern French
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Cristel Portes:机构信息未能从会议 PDF 纯文本可靠映射
- Emilie Marty:机构信息未能从会议 PDF 纯文本可靠映射
- Caterina Petrone:机构信息未能从会议 PDF 纯文本可靠映射
- Martine Grice:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理语调短语末延续升调在浊辅音韵尾与插入schwa音节上的实现归属问题,输入为已标延续语义的短语末重读音节及后续韵尾或schwa语音,输出为应记作LHH%还是LHL%及南北变体的关联结构,难点在于schwa上的快速下降在听辨上易被误判为音系性L%边界调。方法分三步:先对日常新闻播报语料延续语义句做作者共识筛选与双标注者分歧定位,输出延续共识子集进入分布统计;再统计开音节、闭音节与schwa分布及韵尾加schwa时长与标注结果的关联,输出音系假设;最后用话语补全诱发开放音节与闭音节加schwa的延续产出并对比南北方实现以验证假设。与见schwa上fall即记LHL%的做法不同,本文以外位格与弱音节trochee节律地位解释分叉,主张非南方话H%仍次级关联于重读音节而南方话H%可直接关联成音节schwa。在日常新闻播报语料延续共识子集评测设置下,标注为HL%条件的带韵尾比例指标为95%,高于标注为H*H%条件的带韵尾比例指标的55%。该结论适用边界仅限语调短语末延续语义且经共识筛选的升调,尚未验证对比义rise-fall的感知区分与更多说话人外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.praat.org/ → https://praat.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
6. 真浊塞音一定压低基频吗:坦头闽南语四个声调里的反例
英文题目:True voicing and F0 perturbations: evidence from Tantou Southern Min
标签:#统计分析 #语音学与音系 #韵律 #语音 #语音属性识别
评分:6.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Jiexiong Zheng:机构信息未能从会议 PDF 纯文本可靠映射
- Jingfen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究考察广东陆丰坦头闽南语中清塞音、浊塞音与鼻塞音对后接元音基频扰动的规律,输入为三类声母与四类声调组合的单音节词朗读,输出为归一化F0轨迹,难点在于声调语言中真浊音样本稀少且易与前鼻化、内爆及鼻化元音效应混杂。方法链首先采集30名母语者最小三重对比词表并用喉头仪与麦克风录音,其输出的标注语料进入F0与时长提取环节,在声调承载段取等距点并剔除异常得到4058个有效样本。随后以每人单音节调系均值与标准差做LZ-Score归一化消除个人音高差异,其输出的归一化轨迹进入分声调广义加性混合模型,分离声母主效应与轮廓形状差异并做成对与逐点显著性及效应量验证。与将浊音统一视为压低F0的通用预期不同,本文按高平、高降、高升与高短调分别建模,揭示扰动方向强烈依赖声调类别且延续至元音中段。在Tone55声调条件下,V vs N配对的Cohen’s d指标为0.639,高于V vs U配对的Cohen’s d指标0.447。该结论适用边界仅限坦头方言已测高调与升调语境,向低调、长时协同发音及跨方言声调演变的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
7. 先按非韵律证据找句子,再看调形:伦敦多族裔英语疑问句与强调 lengthening 的升降调
英文题目:Multicultural London English Intonation: Pattern and Performance
标签:#统计分析 #韵律 #社会语音学 #语音 #语音属性识别
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Sam Hellmuth:机构信息未能从会议 PDF 纯文本可靠映射
- Elisa Passoni:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
多元文化伦敦英语语调缺乏基于自然语料的系统描写,输入为半自发社会语言学访谈连续话语,输出为可比极性问句与强调延长的调形概括,难点在于访谈难以提供可控韵律目标且需无循环地界定可比单元并比较轮廓形态。作者先以次轮回应证明界定极性问句并区分是否含主助倒装,再以听辨显著的辅音延长界定强调性辅音延长,将两类非韵律标准选出的目标送入统一标注流程。接着人工标注重音前后音节地标域并做听觉轮廓分类,其标注域直接作为地标配准函数主成分分析的输入,以建模基频形态并控制目标词重音位置。与已有方法的机制差异在于韵律选择标准与韵律判断解耦,并用配准后主成分分离整体音域与峰谷形态,使分布差异可在形态不变下得到检验。在伦敦东部加勒比裔青少年半自发访谈语料下,一般疑问句的升降调占比指标为84%,高于陈述问句的升降调占比指标64%。该结论适用边界受限于伦敦东部加勒比裔青少年半自发话语中的问句与强调延长,未分离信息寻求与确认寻求问句,外推至其他族群与语体尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://generationsoflondonenglish.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
8. 希腊语是非问句只有一个升调吗:自然对话里声调选择与偏向高低的分离
英文题目:Greek polar question tunes: Insights from naturalistic speech
标签:#统计分析 #韵律 #语音 #口语理解
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#统计分析
👥 作者与机构
- Maria Lialiou:机构信息未能从会议 PDF 纯文本可靠映射
- Jeremy Steffman:机构信息未能从会议 PDF 纯文本可靠映射
- Mary Baltazani:机构信息未能从会议 PDF 纯文本可靠映射
- Elinor Payne:机构信息未能从会议 PDF 纯文本可靠映射
- Martine Grice:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为希腊语非脚本播客访谈中的极性问句音频及其话轮上下文,输出为核音高重音类型、右边缘调型与问句偏向类别,并检验基频形态是否编码肯定或否定预期,自然语料中曲调变异大且话语社会因素干扰强是实际难点。方法先按希腊语ToBI标注最后一个完备音高重音为核重音并记录右边缘短语重音加边界调,再用会话分析与下一轮回证法依据问者知识状态与答者回应区分肯定偏向、否定偏向与无偏向,其输出的偏向标签与三音节窗口基频轨迹一同进入下一步。接着以纵向数据时序k均值聚类自下而上发现基频轨迹类型并用Calinski-Harabasz指标优选簇数,再用函数主成分分析将连续曲线压缩为主成分分数,最后以贝叶斯层次回归检验偏向对聚类归属与主成分分数的影响。与实验室预设低核重音加上升短语重音为默认极性问句曲调不同,该文发现H星加L、H星、L星等多类核重音跨偏向出现,而肯定偏向整体基频更高更平,具有跨曲调的梯度语音实现含义。在三集播客访谈语料条件下,肯定偏向相对无偏向条件的PC1分数的β为-4.71,低于无偏向相对否定偏向条件的PC1分数的β为-0.58。结论适用边界仅限动词非句末为主、右边缘为LH-L%的陈述同形极性问句与确认寻求主导的访谈语体,外推到朗读、辩论、mipos粒子问句或他种方言尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://osf.io/zq5vt/overview — 链接可访问(HTTP 200)
- 数据相关资源:https://osf.io/zq5vt/overview — 链接可访问(HTTP 200)
- 复现相关资源:https://osf.io/zq5vt/overview — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
9. 重音类型是音系类别,还是线索打包?德语产出与突显感知的对照检验
英文题目:Are pitch accent types more than just phonetic cue bundles?
标签:#无监督学习 #韵律 #言语感知 #语音属性识别
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音属性识别 | 主方法:#无监督学习
👥 作者与机构
- Janne Lorenzen:机构信息未能从会议 PDF 纯文本可靠映射
- Jeremy Steffman:机构信息未能从会议 PDF 纯文本可靠映射
- Stefan Baumann:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务以德语目标词声学实现为输入,以母语听者感知突显度评分为输出,难点在于重音范畴间语音重叠严重、人工韵律标注一致性有限、连续线索与范畴预测力难以分离。方法链分三步:先用互动朗读任务采集20名说话人789个目标词,由两人按DIMA与GToBI独立标注并经第三人协商取得共识,其共识标注作为人工范畴基准进入下一步比较。再并行做两路自下而上K均值聚类,一路基于静态多线索参数,一路基于归一化F0轮廓时间序列,均考察2至10组并以Calinski-Harabasz指数定最优,其分组结果进入感知预测竞争。最后用65名母语听者对47个语篇摘录中共3055个滑块评分,以随机森林比较全部聚类方案、人工重音状态与类型及连续参数的变量重要性。与已有韵律聚类研究的关键差异在于同时检验静态打包与完整轮廓形状打包,并在同一感知任务中与人工范畴直接竞争,而非止于描述分组形态。在静态与轮廓聚类一致性评测任务下,3分组方案的ARI指标为0.040,高于2分组方案的ARI指标-0.001。结论的适用边界是该等价仅限突显度预测层面,聚类与音系范畴并非一一对应,重音状态仍需韵律结构分析,数学最优二分并非感知最相关划分。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
10. 只留韵律还能分出印地语和印度英语吗:边界线索的听辨与声学对照
英文题目:Comparing acoustic cues to phrase boundary in Hindi and Indian English
标签:#心理声学实验 #韵律 #多语言 #语音 #语言识别
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语言识别 | 主方法:#心理声学实验
👥 作者与机构
- Mildred Pereira:机构信息未能从会议 PDF 纯文本可靠映射
- Preeti Rao:机构信息未能从会议 PDF 纯文本可靠映射
- Hansjoerg Mixdorff:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以去词汇化语音为输入判别印地语与印度英语并解释边界声学权重的语言差异,难点在于滤除词汇句法后仅剩基频强度时长与停顿等弱韵律线索仍需可判别。第一步构建十二故事双向翻译平行语料由五名模型读者分语言朗读共二百四十段并由三名双语标注者按多数票标出中间短语边界语调短语边界与非边界为后续分析提供对齐标签。第二步将段落切分为每条八秒至十五秒的句子刺激每语言五十条经零至三百赫兹低通滤波去词汇化后交由二十名双语听者在心理物理实验中做三选一语言判别其输出直接验证纯韵律可分性。第三步对强制对齐后词级音节做跨边界基频差相对强度差边界前时长比与归一化停顿时长提取并做多变量方差分析与分语言随机森林十折三分类从而将感知结果回接到可解释声学线索。相对已有单语言边界研究的关键差异在于同一平行朗读语料上并置感知判别与跨语言声学建模,揭示英语重时长而印地语重相对强度的分工,对理解音节节律与动词尾句法下的韵律类型学有实际意义。在去词汇化语言判别任务下,二十名双语听者的识别准确率为63.5%,高于机遇条件的准确率50%。该结论适用边界受限于朗读叙事体与教师筛选的模型读者尚未验证自发语音与其他口音及自动识别的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://tinyurl.com/y2vt7w5b → https://polydactyl-dumpling-7fc.notion.site/Speech_Prosody_2026_supplementary-26cdb788c9e08073b7c2d1b3c06f6fdd — 链接可访问(HTTP 200)
- 数据相关资源:https://tinyurl.com/dm2uzhdh → https://www.andiamo.co.uk/resources/expansion-and-contraction-factors/?utm_source=chatgpt.com — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/timmahrt/LMEDS — 链接可访问(HTTP 200)
- 第三方资源:https://www.bhashini.gov.in/ — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
11. 普通话里听谁更突出:快速韵律转写一致性为何偏低
标签:#众包评测 #韵律 #言语感知 #语音 #语音属性识别
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#众包评测
👥 作者与机构
- Patrick Louis Rohrer:机构信息未能从会议 PDF 纯文本可靠映射
- Yuting Sun:机构信息未能从会议 PDF 纯文本可靠映射
- Yiya Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Hans Rutger Bosker:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为6个普通话TED演讲中切分的146个自然语句共1326词,输出为每个词是否被感知为短语层显著的二值判断,难点在于基频同时承载声调词义与焦点韵律调制,朴素母语者难以直观区分声学显著范畴。方法链分三步衔接:先用Whisper生成字符级时间对齐并在Praat中人工校对翻译与加注得到可点击文本,再将146句按奇偶编号分为72句的List 1与74句的List 2以阻断相邻语篇信息结构依赖,最后在Gorilla平台让被试至多听两遍后勾选听感上更响更长夸张清晰的词并计算词级显著得分与成对一致性。与面向重音语言的ToBI音高重音标注思路不同,该工作不依赖语调音系类别而直接众包朴素显著感,因而能检验感知方法向声调语言迁移的可行性与局限。在奇偶分列的双列表评测任务下,List 1的Cohen’s Kappa指标为0.27,高于List 2的Cohen’s Kappa指标0.231。该结果表明自然语流中声调与显著性线索相互混淆导致朴素判断离散较大,显著性并非稳定的直觉范畴。结论的适用边界仅限于自然演讲普通话的声学显著性感知任务,尚未验证其向朗读语体受控焦点材料或声学预测模型的外推表现。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://osf.io/mtf3p/ — 链接可访问(HTTP 200)
- 数据相关资源:https://osf.io/mtf3p/ — 链接可访问(HTTP 200)
- 复现相关资源:https://osf.io/mtf3p/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.prolific.com/ — 链接可访问(HTTP 200)
- 第三方资源:https://praat.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
12. 下颌开合的幅度与变异如何塑造朗读节奏:有声音表现训练者的证据
标签:#统计分析 #发声与构音 #韵律 #语音 #语音属性识别
评分:6.4/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Plinio Barbosa:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为巴西葡萄牙语诗歌与散文朗读的同步音频与下颌垂直位移信号,输出为舞台艺术训练组与普通组在韵律声学与关节参数上的差异解释,难点在于自然语篇中元音高低、语速与短语切分会掩盖节律性下颌运动。方法链分三步:先用Marrys cap同步采集并重采样至16 kHz、对下颌做1 Hz至5 Hz带通滤波与平滑后求导合成三通道音频位移速度信号;再承接三通道信号按静音停顿切分话语块并自动检测位移与速度极值、标注音节数;最后承接话语块用Three Biometries Extractor逐块提取16个声学韵律参数与关节量并以混合模型检验组别文体性别效应。与既往孤立句受控实验不同,该研究引入有发声表现技能者对比普通学生并系统对比诗歌行结构与散文段落结构,凸显下颌节律对表现力的塑造作用。在JAW-DANCING语料下,实验组诗歌条件下平均静音时长指标为642 ms,高于对照组的平均静音时长指标445 ms。该结论适用边界受限于12人短篇朗读与固定文本顺序及散文诗歌长度不平衡,尚未验证自发对话歌唱或跨语言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/pabarbosa/prosody-scripts — 链接可访问(HTTP 200)
- 数据相关资源:https://doi.org/10.6084/m9.figshare.30417130 → https://figshare.com/articles/dataset/Three_biometries_corpus/30417130 — 链接可访问(HTTP 202) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
13. 自动韵律切分能代替人工切分吗:巴西葡萄牙语自发语音合成的对照检验
标签:#评测协议 #韵律 #语音 #文本到语音
评分:6.3/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#文本到语音 | 主方法:#评测协议
👥 作者与机构
- Julio Galdino:机构信息未能从会议 PDF 纯文本可靠映射
- Rian Pereira Fernandes:机构信息未能从会议 PDF 纯文本可靠映射
- Giovana Meloni Craveiro:机构信息未能从会议 PDF 纯文本可靠映射
- Caroline Adriane Alves:机构信息未能从会议 PDF 纯文本可靠映射
- Sidney Evaldo Leal:机构信息未能从会议 PDF 纯文本可靠映射
- Arnaldo Candido Junior:机构信息未能从会议 PDF 纯文本可靠映射
- Flaviane Romani Fernandes Svartman:机构信息未能从会议 PDF 纯文本可靠映射
- Sandra Maria Aluísio:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文面向巴西葡萄牙语自发语音的文本到语音合成,输入为转写文本、输出为声明句语音,难点在于自发语流边界模糊且1970年代卷轴磁带录音噪声大,常规按静音切分易破坏语调单元。方法链分三步:先用新版强制对齐器UFPAlign对NURC-SP Minimal Corpus做音素音节词级对齐,输出带起止时间的标注进入下一步;再用Parselmouth提取暂停时长、F0范围与能量等九维音节级声学特征,经随机森林判别终端边界TB并输出韵律切分TextGrid;最后将人工韵律切分、WhisperX自动切分与该自动韵律切分三版语料分别训练FastSpeech2并对比自然语音做语音学与音系学分析。相比仅按静音或语音活动切分的WhisperX,该方法显式建模暂停与F0变化等语调边界机制,因而能保留语调单元完整性并使F0曲线走向更接近人工切分,具有实际建库意义。在NURC-SP MC语料评测下,本工作方法的F1分数为61%,高于Craveiro et al.(2024)方法的F1分数31%。但70%合成核轮廓仍偏离自然模式,表明自动切分尚未系统捕获全部边界变异。该结论适用边界受限于单模型、约14小时51分训练切分语料与TB边界,不支持向大模型或多说话人外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/nilc-nlp/ProsSegue — 链接可访问(HTTP 200)
- 复现相关资源:https://nilc-nlp.github.io/entoa-tts-prossegue → https://nilc-nlp.github.io/entoa-tts-prossegue/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/YannickJadoul/Parselmouth — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
14. 听到错调是纠正还是跟读:粤语并调对真人与 AI 的语音趋同
英文题目:Phonetic Accommodation to AI and Human talkers: A Case Study of Cantonese Tone Mergers
标签:#人类参与评测 #语音学与音系 #语音 #音视频交互
评分:6.3/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音视频交互 | 主方法:#人类参与评测
👥 作者与机构
- Yitian Hong:机构信息未能从会议 PDF 纯文本可靠映射
- Yusheng Tian:机构信息未能从会议 PDF 纯文本可靠映射
- Grace Wenling Cao:机构信息未能从会议 PDF 纯文本可靠映射
- Tan Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Peggy Pik Ki Mok:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为香港粤语T2-T5上升调与T3-T6平调最小对读音,输出为基线朗读与影子跟读中的十点归一化基频轮廓,难点在于五调挤在中低音区差异细微且感知生产不对称易被归一化掩盖。首先以对立调反向启动材料诱发顺应,使基线区分轮廓成为后续比较基准。接着将人类女声录音与保留音色但加入合成特征的时长知情合成AI音频配对静态图像与动态视频呈现,使说话人类型与呈现模态进入被试内跟读。最后用STRAIGHT提取十点归一化F0并拟合广义可加混合模型比较轮廓差异,按K-S分数与平均F0差异划分合并者做探索性对照。在影子跟读任务条件下,主实验的被试人数指标为16人,高于预实验的被试人数指标12人。与交互校准模型预测的自动无差别趋同不同,该设计以交际顺应理论的社会动机解释差异,人类与视频条件因社会吸引与互动鲜活感引发更强趋同而具有实际意义。结论的适用边界仅限于单音节实验室跟读的短期声学趋同,不能外推为已稳定的音系合并或长期AI驱动音变。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://osf.io/872qt/overview?view_only=0a8836291223420a8 — 链接可访问(HTTP 200)
- 第三方资源:https://www.mathworks.com/ — 链接不可用(HTTP 403)
- 第三方资源:https://zoom.us/ → https://www.zoom.com/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
15. 平均音高一样动听,为何还是听出刻板:用熵量面谈对话里的语调多样性
标签:#统计分析 #韵律 #语音 #病理语音评估
评分:6.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Simon Wehrle:机构信息未能从会议 PDF 纯文本可靠映射
- Sabina Oliver:机构信息未能从会议 PDF 纯文本可靠映射
- Kai Vogeley:机构信息未能从会议 PDF 纯文本可靠映射
- Martine Grice:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为面对面自由讨论中的连续基频轮廓,输出为说话人层面的整体旋律度与风格多样性判定,难点在于自发对话个体差异大且单调吟唱难以用平均音高动态直接刻画。方法链分三步推进:先经Praat手工校对基频后自动计算抖动度与宽广度以表征整体旋律,再将二维指标按四分位数划为十六格并统计每位说话人的分布比例,最后计算香农熵以量化风格可预测性并用贝叶斯分层模型检验组别效应。与仅报告均值旋律度的已有做法不同,该机制直接度量分布离散程度,从而区分高均值但单一与高均值且多样两种情形,具有识别刻板旋律的实际意义。在46名德语被试共1360个停顿间单元的讨论语料下,非自闭组的熵指标为3.1,高于自闭组的熵指标2.94。同时整体抖动度与宽广度未见组别主效应,说明个体差异压过了诊断状态效应。结论适用边界限于单一讨论场景与德语成人匹配双人组,任务型与初识寒暄场景及他语言尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://osf.io/tv62x/ — 链接可访问(HTTP 200)
- 数据相关资源:https://osf.io/tv62x/ — 链接可访问(HTTP 200)
- 复现相关资源:https://osf.io/tv62x/ — 链接可访问(HTTP 200)
- 第三方资源:https://osf.io/5e7fd/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
16. 只有 1.5 小时录音时先冻住耳朵再改手写:Amchi Konkani 的迁移加词典修正
英文题目:Amchi - Low Resource Language ASR with Crowdsourced Post-Processing
标签:#迁移学习 #韵律 #跨语言 #低资源 #语音识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 0.9/1.5 | 实验充分 0.6/1.5 | 清晰度 0.6/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#语音识别 | 主方法:#迁移学习
👥 作者与机构
- Moksh Kopikar:机构信息未能从会议 PDF 纯文本可靠映射
- Naman Mandloi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
Amchi Konkani是以口语传承为主、无标准文字和商业自动语音识别(Automatic Speech Recognition, ASR)支持的印度西海岸方言,输入为社区采集的自然故事录音,输出为天城体(Devanagari)文字转写,难点在于数据极少且口语到书面形式边界模糊。系统先冻结AI4Bharat IndicConformer混合联结时序分类与循环神经网络换能器(Connectionist Temporal Classification-Recurrent Neural Network Transducer, CTC-RNNT)模型中的Conformer编码器以保留印度语系声学表征,再仅微调CTC解码线性层以映射方言正字法,解码输出随后进入约80条手工正则规则与约5000词众包词典构成的后处理引擎做纠错与标准化。与直接复用邻近大语种模型相比,该链条把声学泛化与正字法适配解耦,使小数据训练不易过拟合。在以Marathi为最优源语言的对比中,后处理将基线词错误率(Word Error Rate, WER)从35.1%降至21.3%,相对降幅约39%。该结论仅在同一1.5小时社区故事数据上验证,未做跨说话人划分、噪声鲁棒性与统计显著性检验,字符错误率(Character Error Rate, CER)与延迟仅在演示设想中提及而无实测值。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://github.com/mokshkopikar/amchi_asr — 链接可访问(HTTP 200)
- 模型相关资源:https://huggingface.co/ai4bharat/IndicConformer — 暂时无法访问
- 第三方资源:https://github.com/NVIDIA/NeMo → https://github.com/NVIDIA-NeMo/Speech — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
17. 句首助动词重音何时才算偏向:否定极性占主导,陡升台阶音只在肯定问句中核查眼前证据
英文题目:The interpretation of prenuclear accents in English (biased) questions
标签:#心理声学实验 #韵律 #言语感知 #语音 #口语理解
评分:6.2/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Emily Lau:机构信息未能从会议 PDF 纯文本可靠映射
- Judith Schlenter:机构信息未能从会议 PDF 纯文本可靠映射
- Johannes Heim:机构信息未能从会议 PDF 纯文本可靠映射
- Sophie Repp:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为美式英语肯定与否定极性问句中句首助动词的前核重音录音,输出为听者对给予或寻求信息、复核先验假设或刚注意证据及强烈情感的7点量表评分,难点在于自然语料中重音类型、核轮廓与词汇内容高度混杂难以分离。先输入9音节肯定否定配对文本模板,由标准美式女声录制职责完成基线发音,输出10组自然模板录音。再输入模板中L+H录音,用Praat音高点合成职责生成H、L+H、(L+H)、L|H并归一化为3、5、9半音及无重音条件,再统一拼接L H-H%核上升,输出120条仅前核突显度不同的刺激,该模板录音直接作为合成基底进入本步。最后输入120条刺激,经SoSci Survey分两名单呈现职责组织108名美国本土被试分两实验完成三量表评分,输出可建模的偏见解读评分,该刺激集直接作为知觉评测输入进入本步。与以往仅区分重读与否或只看L+H*不同,本文在同词框架下比较六种形态并按半音突显度分组检验梯度,旨在分离前核突显度对偏见解读的独立贡献。在跨问句类型合并评测下,实验2中9半音阶跃条件的强情感评分指标系数为0.74,高于实验1中9半音阶跃条件的强情感评分指标系数为0.4。前核9半音阶跃在肯定问句中提升复核刚注意证据的判断,而否定问句中重音类型差异基本不显著,表明极性是最强偏见信号,其适用边界是前核效应小且主要限于肯定问句证据复核与跨问句情感唤醒,尚未验证脱离实验室呈现外自然对话语境的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://osf.io/9njgs — 链接可访问(HTTP 200)
- 复现相关资源:https://osf.io/9njgs — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
18. 低后元音真的更挤嗓吗:英语中舌位回缩与声门收缩的受控检验
英文题目:The interaction between vowel quality and voice quality in English
标签:#统计分析 #发声与构音 #语音 #语音属性识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Jiaang Dong:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究检验低后元音是否因舌后缩协同喉上提而带来更强声门收缩,输入为连续朗读中目标元音的同步音频与EGG波形,输出为接触商与共振峰关联及元音类别差异判断,难点在于短语末嘎裂声与词首喉化等独立喉化源极易污染元音效应。为此作者定制音段与韵律环境平衡的朗读短文并采集20名美式英语母语者的同步音频与EGG信号,使
\[æ\]与
\[ɑ\]在词首与句末等促喉化环境中数量均等。接着逐帧提取接触商CQ与第一第二共振峰并取词均值,经0.3至0.7取值过滤与F1×F2马氏距离异常剔除及ΔF归一化后得到可靠的元音声门度量,进入统计检验。统计上分别以F1×F2多元回归检验共振峰对CQ的连续预测力,再以混合效应模型比较
\[æ\]\[ɑ\]\[i\]\[u\]类别差异并容许被试随机截距与斜率。相对以往用声学嘎裂征兆间接推断收缩的做法,该文以EGG接触比例直接度量声门接触并前置平衡韵律与音段环境,机制上更贴近喉收缩本体。在20名母语者朗读平衡短文语料的测试条件下,低后元音
\[ɑ\]的接触商CQ指标均值约为0.51,高于低前元音
\[æ\]的接触商CQ指标均值约0.50。共振峰主效应与交互均不显著且最大预测值落在无观测的边缘外推区,表明差异仅为模态嗓音区间内的微小接触增加而非质变性收缩。该结论适用边界目前受限于美式英语朗读体受控比较,尚未验证自发语、其他语言及句中短语边界未编码的情形,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/kirbyj/praatsauce — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
19. 同是下降调,为何高低相同却仍能分开:飞翔话两个降调的音高与时间二维证据
英文题目:Falling in Two Dimensions: Pitch and Temporal Properties in Feixiang Chinese Falling Tone Contrast
标签:#统计分析 #语音学与音系 #语音 #语音属性识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Jianfeng Guo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为费翔晋语两类词位对立降调Fall 1与Fall 2韵母段基频轮廓,输出为二者对立载体与音系表征判断,难点在于两调同为下降且基频极值可能重叠,传统调高差假设难以解释对立所在。提取阶段以ProsodyPro标注韵母区间并取40点时间归一化半音基频与时长,按发音人标准化后用三次多项式拟合得到最大值、最大值时间、最小值、极差、斜率与曲率,其输出直接作为后续检验的特征集。检验阶段先以广义加性混合模型定位整体轮廓差异区间,再以线性混合效应模型逐特征检验显著性并做Bonferroni校正,显著特征的相关结构进入降维分类阶段。降维分类阶段对显著动态与时间特征做主成分分析得到音高维与时间维,再以逻辑混合回归检验两维联合区分力,使相关特征的联合贡献可被量化评估。相对把同形调预设为53对31式调高差、把调位对齐视为音节内非对立的做法,该文主张差异在韵母后段整体实现且极值无显著差异,动态调目标加时间协同才是对立本质。在单字慢读鼻音语料评测设置下,PC2单维的方差解释率指标R2为0.67,高于PC1的R2 0.66。该结论适用边界受限于单字慢读鼻音可控语料,尚未验证听者感知利用与连续语流外推,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
20. 听不见反馈的声音怎么做识别:把马拉地语聋人语音映射到日常任务词表
英文题目:ResonAIte: ASR for Everyday Tasks of a Deaf User via Transfer Learning
标签:#迁移学习 #韵律 #低资源 #语音 #语音识别
评分:6.1/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音识别 | 主方法:#迁移学习
👥 作者与机构
- Naman Mandloi:机构信息未能从会议 PDF 纯文本可靠映射
- Moksh Kopikar:机构信息未能从会议 PDF 纯文本可靠映射
- Taranath Shenoy:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为缺乏听觉反馈的聋人马拉地语发音,输出为天城体正字法文本,难点在于扁平语调与拖长音节等非典型韵律被典型识别模型判为噪声而导致近乎完全失效。方法链第一步由社区移动应用按购物出行等日常任务定向采录目标短语,构成一小时个性化语料并作为后续适配的输入。第二步冻结的IndicConformer编码器保留预训练马拉地语音素表征,对该语料输出鲁棒声学表征以避免小样本过拟合。第三步仅训练末端联接时序分类线性层将声学序列映射为标准转写,再经日常任务词表约束与后处理收敛到高频意图文本。与重学声学前端不同,该机制只重建非典型声学序列到正字法的映射,将可训练参数从120M降至约250K,因而在极小样本下仍可快速适配并降低计算量。在受限日常任务场景下,个性化系统的WER为64%,低于标准马拉地语基线的WER 97%。结论的适用边界受限于受限词表与合作录音的单用户个性化条件,向开放词表与多说话人外推尚未验证,而冻结编码器与Serverless部署设计使推理开销保持低延迟可行。
🔗 开源资源
- 代码相关资源:https://github.com/namanmandloi/marathi_deaf_speech_asr — 链接可访问(HTTP 200)
- 代码相关资源:https://github.com/mokshkopikar/amchi_asr — 链接可访问(HTTP 200)
- 模型相关资源:https://huggingface.co/ai4bharat/IndicConformer — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
21. 在非声调二语里压住声调:普通话、日语、韩语、法语听者如何处理英语音高
标签:#心理声学实验 #韵律 #言语感知 #口语理解
评分:6.1/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Marta Ortega-Llebaria:机构信息未能从会议 PDF 纯文本可靠映射
- Zhaohong Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Maite Martinez Garcia:机构信息未能从会议 PDF 纯文本可靠映射
- Sharon Peperkamp:机构信息未能从会议 PDF 纯文本可靠映射
- Keiichi Tajima:机构信息未能从会议 PDF 纯文本可靠映射
- Mafuyu Kitahara:机构信息未能从会议 PDF 纯文本可靠映射
- Kiyoko Yoneyama:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务输入为仅基频上升与下降不同的孤立英语单音节词,输出为词与非词判断的反应时与正确率,难点在于判断听者是将音高当作词汇线索还是一般听觉差异处理。方法链分三步:先按凸显实现位置招募普通话、日语、韩语、法语与英语五组共213名被试以覆盖词汇与短语层面音高功能,其分组输出决定跨类型比较框架;再以载体句诱导录制12组四元词并切分出上升与下降两种轮廓的96个刺激,其声学输出直接进入启动范式;最后操纵启动词与目标词在音段和轮廓上的匹配关系并以线性混合效应模型检验音高形状与母语的交互。与仅强调凸显类型二分的研究不同,本文提出功能可解释性机制,即只有当英语轮廓能映射到母语中有意义或高频模式时才干扰词汇通达,这解释了为何类型标签相同但行为分化。在词汇判断任务条件下,普通话组在完全匹配条件下的F指标为8.15,高于失配F0条件下的F指标4.28。实词层面音高形状与母语交互显著而非词层面仅有主效应而无交互,表明效应作用于词汇表征而非前词汇听觉加工。该结论适用边界在于日语与韩语偏离预测,表明类型标签本身无法决定抑制,且音高敏感性与工作记忆等个体因素尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
22. 句末耳语为何锚定在重音之后:西班牙电视新闻的边界标记解读
标签:#统计分析 #发声与构音 #韵律 #语音 #语音属性识别
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Nicholas Henriksen:机构信息未能从会议 PDF 纯文本可靠映射
- Lorenzo Garcia-Amaya:机构信息未能从会议 PDF 纯文本可靠映射
- Claire Byrd:机构信息未能从会议 PDF 纯文本可靠映射
- Nikhil Walling:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为西班牙公共电视Telediario连续播音语音,输出为语调短语末尾是否出现真性耳语及其起点相对重音节的位置与话者话语因素的对应关系,难点在于区分真性耳语与气息声并排除话者与话语混杂影响。方法先以原始播报音频为输入,经听辨结合Praat声学检验筛选无周期性与基频缺失的耳语段,剔除气息声干扰并经双人一致性核验,输出可靠的耳语标记。再以耳语标记为输入,负责位置与时长归一化,将耳语起点相对重音节编码为重音前重音及柱后类型,并除以每人实际播报秒数得到每分钟耳语率,输出归一化后的耳语率与位置编码。最后以归一化耳语率与话题延续及话者延续编码为输入,送入组间检验与准泊松回归模型,分别验证主播差异、重音绑定与话语效应,输出统计检验结论。相对已有英语句末气嗓研究的关键机制差异在于提出同源喉部收缩的不同参数设置可实现耳语或气嗓两种边界标记,即会厌喉收缩降调叠加喉高低与声门开合差异,从而把音高降低与非模态发声统一解释。在20期Telediario播报语料评测设置下,Siscar的每分钟耳语率指标为2.79,高于Barreiro的每分钟耳语率指标2.45,但差异未达显著水平。该结论适用边界限于陈述句低边界调的正式播音语体,向疑问句高边界调与日常会话的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://www.rtve.es/play/ → https://www.rtve.es/play/internacional/portada/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
23. 四岁孩子在家说话快慢为何变:小组生人效应与说话-身体的补偿关系
英文题目:Coordinating speech and body during conversation: an at-home study with 4-year-olds
标签:#统计分析 #韵律 #生理信号 #语音 #语音属性识别
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Chantal-Valerie Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Guillaume Dumas:机构信息未能从会议 PDF 纯文本可靠映射
- Ahmed Jerôme Romain:机构信息未能从会议 PDF 纯文本可靠映射
- Simone Falk:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为蒙特利尔法语儿童在家庭自然互动中的日间音频与肢体加速度信号,输出为不同社交情境下言语速率与身体活动的关系,难点在于生态噪声、说话人混淆与长时程跨模态对齐。首先以首尾敲击峰对齐音频与加速度并计算活动计数,其输出的统一时间基直接进入后续等长时段切分。接着用韵律脚本检测音节核并结合两套说话人标注交叉筛选儿童话语,得到干净的速率估计并汇入同时段活动均值。最后在等长时段上平均并输入线性混合模型检验情境与活动量预测,以分离个体与时段变异。与实验室短时观察不同,该工作保留家庭双人与小组自然互动并显式区分纯家庭小组与含外部成员的混合小组,突出熟悉度而非人数的调节意义。原文未提供可核对的关键定量结果。该结论适用边界受限于健康法语儿童室内家庭互动,尚未验证与外部成员的双人情境及纵向外推,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://doi.org/10.1080/0969594x.2021.1951162 → https://www.tandfonline.com/doi/full/10.1080/0969594X.2021.1951162 — 链接不可用(HTTP 403)
- 第三方资源:https://doi.org/10.21437/interspeech.2023-2193 → https://www.isca-archive.org/interspeech_2023/gong23d_interspeech.html — 链接可访问(HTTP 200)
- 第三方资源:https://doi.org/10.1038/s41598-022-16003-x → https://idp.nature.com/transit?redirect_uri=https%3A%2F%2Fwww.nature.com%2Farticles%2Fs41598-022-16003-x&code=8930ca34-1177-417f-8ab2-712ba71b149c — 暂时无法访问(HTTP 502) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
24. 想让人想买,先让人感到愉悦:用知觉情绪约束合成广告语音
英文题目:The Impact of Perceived Emotions on Purchase Intention in Synthesized Advertising Speech
标签:#多任务学习 #主观评测 #语音 #文本到语音
评分:6.0/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#文本到语音 | 主方法:#多任务学习
👥 作者与机构
- Mizuki Nagano:机构信息未能从会议 PDF 纯文本可靠映射
- Kenichi Fujita:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuke Ijima:机构信息未能从会议 PDF 纯文本可靠映射
- Sadao Hiroya:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为广告文本、任意说话人参考语音与目标购买意愿值,输出为保留说话人身份且提升购买意愿的合成广告语音,难点在于韵律特征与购买意愿呈非线性关系且听者内部感知状态难以直接优化。方法链分三步衔接:参考编码器从参考语音提取384维语音嵌入作为韵律基线并送入修改模块;语音嵌入-购买意愿模型从嵌入预测购买意愿得分以提供优化目标;嵌入修改模块冻结该预测模型并经50轮反向传播迭代更新嵌入,再由零样本语音合成模型结合目标文本生成最终波形。与直接学习嵌入到购买意愿映射的无约束模型相比,关键差异是受约束模型在训练中间层额外以愉悦度与唤醒度情绪得分的均方误差为约束,使优化梯度蕴含听者感知方向,合成时并不直接输入情绪标签,从而避免学到单纯加快语速的伪相关。在闭集说话人配对比较评测下,受约束语音的说话人相似度得分为0.93±0.02,高于无约束语音的说话人相似度得分0.85±0.02。购买意愿与情绪听辨进一步显示受约束语音愉悦度显著更高而唤醒度与无约束语音无显著差异,说明增益主要经由愉悦度实现且同时更好地保留了原始音色。该结论适用边界受限于日语广告朗读短句的在线试听场景,尚未验证真实购买行为、长期效果与跨语言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://ntt-hilab-gensp.github.io/SP2026ADspeech/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
25. 声调语言里哄孩子也要抬高音调吗:伊博语儿歌的音高与音质分层
英文题目:Singing to Children in Igbo: An Acoustic Analysis of Pitch and Voice Quality
标签:#统计分析 #韵律 #音乐 #语音属性识别
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Vincent Nwosu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为6位Onitsha-Igbo母亲在家中对婴儿与对成人演唱同一批传统摇篮曲与游戏歌的成对录音,输出为婴儿指向与成人指向寄存差异及与歌曲功能交互的声学判定,难点在于声调语言中词汇声调、旋律走向与情感性音高抬升相互纠缠。方法链分三步衔接:先在家庭自然场景按婴儿指向与成人指向条件平衡采集3至5分钟演唱以获得可比成对样本;再用蒙特利尔强制对齐器初切分并经Praat全部人工校对得到1456个元音段,剔除清音与嘎裂段后进入声学测量;最后用ProsodyPro提取平均F0、F0范围与H1-A3、倒谱峰突出度与谐噪比,并以平均F0为协变量的线性混合效应模型检验条件、歌曲类型及其交互。相对欧洲与东亚语言已有研究,关键机制差异是同时检验声调约束下的音高抬升与独立于音高的气息化调节,并保留安抚与逗乐的不同唤醒目标,其实际意义在于验证情感目标可压倒词汇声调与旋律约束。在摇篮曲与游戏歌分歌曲功能的条件下,摇篮曲的平均F0指标提升为91.2 Hz,高于游戏歌的平均F0指标提升78.9 Hz。该分层还体现在F0范围与H1-A3上,婴儿指向版范围更宽、发声更柔更气息化,而倒谱峰突出度与谐噪比在控制音高后无显著差异。结论适用边界受限于熟悉传统儿歌的Onitsha-Igbo中年母亲家庭演唱,声调实现是否受损及城市英语主导年轻父母的表现尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
26. 音高敏感跨母语起作用,节奏敏感却分母语:德法韩学习者感知西班牙语重音
标签:#心理声学实验 #听觉与音乐认知 #韵律 #言语感知 #语音属性识别
评分:6.0/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Sandra Schwab:机构信息未能从会议 PDF 纯文本可靠映射
- María Teresa Martínez García:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理二语西班牙语词汇重音听辨,输入为音段相同而重音位置不同的三词序列,输出为奇异项位置判断,难点在于说话人与语调变异下对基频时长与强度的细微整合。研究先以奇异项任务在四种说话人与语调变异下让每名被试完成144随机试次并以正确率衡量辨别表现,其输出进入按母语分组的跨语言比较。接着以迷你音乐感知测验Mini-PROMS分别评估旋律重音调音与速度四个知觉维度得分,为回归提供可分离的音乐能力输入。最后以准二项回归检验母语与四维度分数的主效应及与母语的交互,仅保留显著交互以解释音乐维度如何调节辨别。相对以往音乐家二分或混合总分做法,本研究关键差异在于分离音高轮廓与节奏强调等通道,使跨语言补偿假设可被分别证伪并明确音高能力的普遍作用。在奇异项辨别任务设置下,德语组的准确率为86.74%,高于法语组的准确率57.60%。该结论适用边界受限于中级水平学习者三音节词与实验室辨别任务,尚未验证自然词汇识别产出迁移及初学者阶段是否成立。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://doi.org/10.5565/rev/languesparole.133 → https://revistes.uab.cat/languesparole/article/view/v8-schwab-pythoud — 暂时无法访问
- 第三方资源:https://benjamins.com/catalog/jslp.23028.sch — 链接可访问(HTTP 200)
- 第三方资源:https://doi.org/10.1515/iral-2019-0081 → https://www.degruyterbrill.com/document/doi/10.1515/iral-2019-0081/html — 链接可访问(HTTP 202) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
27. 按行停顿还是按句停顿:克里利十三年朗读里的诗行乐谱
英文题目:The Prosody of Poetic Performance in Robert Creeley’s “I Know a Man”
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Stefan Blohm:机构信息未能从会议 PDF 纯文本可靠映射
- Chris Mustazza:机构信息未能从会议 PDF 纯文本可靠映射
- Plínio Barbosa:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为作者亲读《I Know a Man》的13段跨数十年历史录音,输出是对诗行边界停顿与表演运动轨迹的韵律刻画,难点在于区分句法自然停顿与视觉诗行强制停顿,并从高变异朗读中提炼稳定表达资源。方法链分三步:先用Praat手动切分诗行、词与静音停顿并标注从句与诗行边界类型,为后续统计提供对齐边界;再用韵律描述符抽取器逐行计算基频、强度、速率与音质等多维声学参数,将波形转为可比行级特征;最后以逻辑回归与Welch t检验验证停顿分布,并对16个参数做旋转主成分分析后用方差分析与逐行比较追踪运动,前步特征直接进入降维与检验。相比按语法停顿的常规朗读建议,该文把印刷诗行视为乐谱式表演指令并检验作者是否忠实执行,具有文本语音学交叉意义。旋转主成分揭示言语节奏与音质随诗行推进系统变化,而旋律成分保持稳定,支撑了以 timing 组织场景对话的解释。在诗行与从句边界停顿对比任务下,诗行边界的停顿概率指标为0.59,高于从句边界的停顿概率指标为0.28。该结论适用边界受限于单首诗与单作者朗读,尚未验证向其他诗人、语言或即兴朗读的外推。原文未披露训练、推理或部署成本
🔗 开源资源
- 代码相关资源:https://github.com/pabarbosa/prosody — 链接不可用(HTTP 404)
- 数据相关资源:https://writing.upenn.edu/pennsound/x/authors.php — 链接可访问(HTTP 200)
- 复现相关资源:https://www.r-project.org/ — 链接可访问(HTTP 200)
- 复现相关资源:https://cran.r-project.org/package=emmeans → https://cran.r-project.org/web/packages/emmeans/index.html — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
28. 濒危遗产语还分得清三种问句吗:保加利亚犹太西班牙语的问句语调
英文题目:Question Intonation in Bilingual Speakers of Bulgarian and Judeo-Spanish
标签:#数据标注 #韵律 #多语言 #语音 #语音属性识别
评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#数据标注
👥 作者与机构
- Iona Gessinger:机构信息未能从会议 PDF 纯文本可靠映射
- Bistra Andreeva:机构信息未能从会议 PDF 纯文本可靠映射
- Christoph Gabriel:机构信息未能从会议 PDF 纯文本可靠映射
- Jonas Grünke:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为话语补全任务诱发的半自发疑问句录音,输出为是否问句、wh问句与选择问句的核重音与边界调型分布,难点在于濒危遗产语高龄发音人稀少且三类问句样本极不平衡。先将嵌入约10分钟话语补全任务的3个场景呈现给被试以诱发三类问句,其双语者先测保加利亚犹太西班牙语后测保加利亚语,得到的录音直接进入下一步切分。再对录音做词与音节层切分并剔除缺失、严重不流利或误解场景试次,保留的切分后试次全部进入合议标注。最后由作者团队按ToBI式框架合议标注核音高重音加边缘调构成的核轮廓,其中选择问句分前后两个韵律单位分别标注,标注结果用于组间比较。与聚焦陈述句趋同的前作不同,本文以疑问句检验语码区分与接触影响,揭示了双语者区分语码且偏离单语者的韵律变异机制。在DCT诱发疑问句语料任务下,BJS的YNQ高结尾占比指标为71%,高于单语BG的YNQ高结尾占比指标69%。结论适用边界受限于保加利亚老年双语者及诱发语体,尚未验证自然对话与年轻传承者的外推范围。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://osf.io/6kacx — 链接可访问(HTTP 200)
- 复现相关资源:https://osf.io/6kacx — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
29. 一足还是两足:索伊科拉英格里亚语三音节中范畴切分下的渐变语音
英文题目:Phonetic graduality behind categorial phonological footing in Soikkola Ingrian
标签:#统计分析 #语音学与音系 #韵律 #语音 #语音属性识别
评分:5.9/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Natalia Kuznetsova:机构信息未能从会议 PDF 纯文本可靠映射
- Elena Markus:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为Soikkola Ingrian三音节词的田野录音与音段切分,输出是对单音步词与双音步词音系对立的语音学解释,难点在于次重读与非重读在连续语流中缺乏稳定的声学边界,易与语调短语边界混淆。方法链分三步:先以44词例小问卷对比单音步与双音步词中第二音节源长元音的实现,其输出的时长差异为音步划分提供范畴证据;再以21类三音节音步大语料建模第三音节短元音时长随音步核结构的变化,其输出的反补偿模式进入韵律域分析;最后提取每词11点基频轮廓观察音高重置与边界调分布,以检验呼吸与喉控制域假设。在句中短语内部44词例的语料设置下,双音步词mättīmǟ的V2时长指标高于单音步词mättīsin的V2时长指标32.4 ms的估计差值,SE为8.75 ms。与强调补偿性缩短的已有Finnic研究不同,本文发现V2量度越大后续V3时长指标越长,并把最长核上的音高重置解释为共时压缩与历时音变的连续基础。该结论的适用边界受限于单发音人ST的配对与词尾轻重对立,其向四音节词或非Finnic重音系统的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://osf.io/rbw3m/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
30. 把噪声当刻度:用回归预测朗伯德效应的强度
英文题目:Detection of Lombard Speech Using Different Model Architectures and Speech Features
标签:#CNN #模型比较 #语音 #语音属性识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#CNN
👥 作者与机构
- Judith Bauer:机构信息未能从会议 PDF 纯文本可靠映射
- Frank Zalkow:机构信息未能从会议 PDF 纯文本可靠映射
- Meinard Müller:机构信息未能从会议 PDF 纯文本可靠映射
- Christian Dittmar:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
伦巴德检测输入为1秒干净语音段,输出为0到1之间的效应强度分,难点在于效应强度受说话人、性别与噪声类型调制且跨数据集泛化困难。预处理先用WhisperX切除首尾静音并保留至多50ms,经去直流、峰值归一到0.99与16kHz重采样,输出规范波形以进入特征提取。特征级并行提取一种高维表征与音高、能量、音素时长、第一共振峰及频谱倾斜等6种一维线索并统一为100帧输入,为回归提供互补信息。模型级用卷积、卷积加双向长短时记忆网络或Transformer编码器回归以噪声级为代理的连续标签,预测经Sigmoid约束并以L2损失训练。相对既有二分类与自相似矩阵路线,连续回归保留了30dB到85dBA等多级噪声的单调顺序,并允许DB-ASP等多级语料联合训练。在留出语料DB-SO的评测设置下,MWLMLSTM模型的L2损失指标为0.0841,低于MWLMTRAN模型的L2损失指标0.0998。该结论适用边界受限于朗读式平行语料与耳机播放言语形噪声条件,对自发对话与真实环境噪声的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/interactiveaudiolab/ppgs — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/maxrmorrison/torchcrepe — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/YannickJadoul/Parselmouth — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
31. 整句里的手势为何不再决定重音:西班牙语节拍手势效应的整句检验
英文题目:Assessing the Effect of Beat Gestures on the Perception of Lexical Stress in Full Spanish Sentences
标签:#心理声学实验 #韵律 #言语感知 #音视频 #音视频理解
评分:5.8/10 | 创新 0.8/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.0/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音视频理解 | 主方法:#心理声学实验
👥 作者与机构
- Floris Cos:机构信息未能从会议 PDF 纯文本可靠映射
- Lieke van Maastricht:机构信息未能从会议 PDF 纯文本可靠映射
- Hans Rutger Bosker:机构信息未能从会议 PDF 纯文本可靠映射
- Matteo Maran:机构信息未能从会议 PDF 纯文本可靠映射
- Esther Janse:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理完整西班牙语句子中词汇重音感知,输入为含最小重音对动词的音视频句子,输出为代词选择的重音归属判断,难点是句中非焦点词声学线索弱且音节级手势对齐难以分辨。方法链分三步推进:先录制16个动词的现在时与过去时句子并插值时长与基频等参数构建听觉连续统,其输出的歧义档位进入下一步筛选;再经听觉预筛选确定接近25%、50%、75%反应的档位并将拍手势顶点对齐至倒数第二或最后音节,形成16动词各5音频档与2手势条件的刺激;最后用在线二选一任务同时记录选择与反应时并以混合效应模型分析。相对既往单手势遮脸孤立词设计,本研究保留说话人面部并采用多手势自然变体,实际意义是以生态效度换取手势线索可靠性下降,从而检验自然语速下的线索加权。在主实验反应时任务条件下,音频模糊性效应的β指标为-135.659,低于拍手势对齐与音频阶交互效应的β指标-3.451。结论的适用边界仅限中等语速自然句子中的清晰至中度模糊语音,尚未验证噪声或退化语音及第二语言者等外推情形。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://doi.org/10.34973/p4q6-z265 → https://data.ru.nl/collections/ru/cls/cue_integration_multimodal_l1_l2_speech_dsc_691 — 链接可访问(HTTP 200)
- 复现相关资源:https://doi.org/10.34973/p4q6-z265 → https://data.ru.nl/collections/ru/cls/cue_integration_multimodal_l1_l2_speech_dsc_691 — 链接可访问(HTTP 200)
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
32. 打断太少学不会:用声学扰动与删尾重组补足离线轮替标注中的中断样本
英文题目:Too few interruptions? Using data augmentation to improve offline automatic turn-taking annotation
标签:#数据增强 #韵律 #离线推理 #语音 #轮次切换
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#轮次切换 | 主方法:#数据增强
👥 作者与机构
- Agustin Gravano:机构信息未能从会议 PDF 纯文本可靠映射
- Tomas Gallo:机构信息未能从会议 PDF 纯文本可靠映射
- Nadia Guadalupe Molina:机构信息未能从会议 PDF 纯文本可靠映射
- Abi Oppenheim:机构信息未能从会议 PDF 纯文本可靠映射
- Jazmin Sneider:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
离线轮次标注输入为完整双人对话音频与语段切分,输出为每个过渡点的7类标签,难点在于打断类稀少且韵律变异大导致模型学不到让位与保持线索。本文先以随机森林为基线提取语段时长与韵律特征,再并行验证3条增强链:扰动已有打断的声学时间序列后重算均值与斜率,删除保持过渡前的尾部语段以伪造新的打断,以及两者组合后重训练同一分类器。与已有过采样相比,该机制不再复制相同特征向量,而是引入可控的音高与嗓音质量变化或构造韵律上更像句中的中断上下文。在开发集5折交叉验证设置下,组合增强模型的宏平均F1分数为.620,高于初始模型的宏平均F1分数.597。组合策略对无重叠打断与重叠打断均有改善,特征重要性分析显示句末音高水平与音高斜率排名靠前,说明模型更多依赖韵律信息进行区分。该结论适用边界受限于阿根廷西班牙语任务型对话语料,对重叠打断与未见说话人的泛化仍不稳定,删除原始保持样本还会拉低平滑转换性能,属于已知失败条件。在未见说话人任务上整体增益消失等尚未验证的外推范围仍需检验,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
33. 听得准的人一定说得清吗:普通话问句与陈述语调的感知与产出关联
标签:#心理声学实验 #统计分析 #韵律 #语音 #音频分类
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#心理声学实验
👥 作者与机构
- Tong Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yao Yao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理普通话疑问与陈述语调的二选一感知,输入为载体句“ta1 shuo1 ”末音节的韵律实现,输出为语调类别判断,难点在于词汇声调与语调在基频上冲突且疑问易被偏向听成陈述。先复用16名北方官话发音人的朗读库,以时长、平均基频与基频范围为输入计算每位发音人在声调2与声调4下的韵律差异指数PDI,输出按发音人区分的信号分离度。再将上一步已量化PDI的935段语音按65dB归一后作为听辨刺激,输入给约6个月后返回的8名女性完成远程二选一听辨与音色相似度评分,输出自身与他人条件下的感知响应。最后将前两步得到的说话人PDI、听者PDI与逐试次听辨响应共同输入贝叶斯逻辑混合效应模型,分离听者PDI与说话人PDI及语调与声调的交互,输出各通路效应估计。与只看群体均值的既有语调研究不同,该设计同时检验自身产量与信号分离度两条通路及其语境依赖。在远程二选一听辨任务条件下,听自身语音的准确率为90.43%,高于听其他女性语音的准确率84.59%。听他人时说话人PDI越高识别越准且对疑问句增益更强,而陈述整体更准并在声调4下优势更大。该结论适用边界受限于小样本朗读语料,男性听者、自发对话及跨方言等外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
34. 时长被抹掉之后,三声才像二声:普通话二三声混淆的再检验
标签:#心理声学实验 #语音学与音系 #言语感知 #语音 #语音属性识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Zixuan Li:机构信息未能从会议 PDF 纯文本可靠映射
- Zeyu Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Shijing Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Xu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理普通话第二声与第三声在自然产出中是否真易混淆的问题,输入为孤立与列表语境下朗读的单音节最小对立词,输出为三声变体的声学分布与母语听辨混淆矩阵,难点在于引文式全三声与列表中低降变体的分布条件不清,且时长归一化掩盖了自然时长差异。方法链分三步:先以列表朗读与单字朗读对照诱发低降与降升两种三声变体并提取时长与基频最低点相对位置的关联,再以原始时长与时长归一化两套刺激做四选一汉字听辨以分离时长效应,最后以话语语料库中停顿前三声核查实验室发现的外部适用性。与既有范畴感知研究固定时长只操纵基频轮廓的做法不同,该工作把时长作为区分性线索而非需控制的冗余变量,揭示短时长低降变体在自然语流中的主导地位。在原始时长与时长归一化对照的听辨任务下,原始时长刺激的三声识别准确率为89.474%,高于时长归一化刺激的识别准确率80.047%。时长归一化后降升变体与二声混淆明显上升,而低降变体则更多混向一声与四声,说明混淆模式随变体与时长条件而异。语料库核查进一步发现停顿前747个三声中仅4例为降升变体,平均时长差异也与实验室关联一致。结论适用边界仅限北京官话背景的成年母语者朗读孤立单音节词与短篇朗读语料,尚未验证自发对话、儿童与第二语言者及跨方言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
35. 手势与重音是互相叠加还是互相补偿:一段德语演讲里的多模态显著性检验
标签:#统计分析 #韵律 #音视频 #语音属性识别
评分:5.8/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Klymentii Myslyvyi:机构信息未能从会议 PDF 纯文本可靠映射
- Janne Lorenzen:机构信息未能从会议 PDF 纯文本可靠映射
- Stefan Baumann:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为标准德语TED演讲连续语音与同步手部视频,输出为音节是否伴随手势、三级手势突显度与笔触顶点对齐距离,难点在于重音突显度、重音类型与核地位高度共线且特强等级样本稀疏。方法先用WebMAUS Basic做词音节切分并按DIMA标注重音突显度再共识转写为GToBI调重音类别,其输出的突显音节作为手势分析的定位基准。接着按M3D指南在无声条件下标注手势单元、笔触与顶点并评定弱典型强三级突显度,其顶点作为对齐锚点进入下一步。然后以顶点为锚计算与最近重音音节的音节距离并分别用二项广义线性模型和累积链接模型检验出现与突显关联。与补偿假设不同,累积线索机制预测语音越突显手势越多越强且对齐越紧,具有冗余增强的实际意义。在TED演讲语料条件下,顶点落在重音音节内的占比指标为55.43%,高于落在相邻音节的占比指标29.53%。结论适用边界受限于单人排练型演讲与手部手势,尚未验证自发对话、跨说话人与感知判断的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://archive.mpi.nl/tla/elan — 链接可访问(HTTP 200)
- 第三方资源:https://cran.r-project.org/package=ordinal → https://cran.r-project.org/web/packages/ordinal/index.html — 链接可访问(HTTP 200)
- 第三方资源:https://rvlenth.github.io/emmeans/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
36. 巴西口音英语重音:时长缩减不足,响度对比来补
英文题目:English with Brazilian beat: Brazilian English word stress and vowel reduction
标签:#统计分析 #语音学与音系 #韵律 #语音 #语音属性识别
评分:5.8/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.6/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Amanda Post da Silveira:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为美式英语三音节词孤立朗读录音,输出为全元音与弱化元音在时长、共振峰谱、基频与强度上的母语与二语差异判定,难点在于巴西葡萄牙语无频谱央化导致范畴合并与策略代偿难以分离。方法链分四步:朗读采集获取可比语料并送入Praat切分标注,中点第一、第二共振峰与三分点半音基频及平均强度的声学测量提取多维参数,说话人内标准化消除语速与声道差异,分组回归检验语言组与元音类别效应。相对已有重音研究,该工作把频谱弱化缺失作为核心机制差异,揭示二语者以强度夸张补偿时长与频谱弱化不足,具有解释口音成因的实际意义。在三音节词朗读语料下,巴西二语者弱化元音/ə/的时长指标为82(37),高于美式母语者的时长指标68(34)。频谱上母语者央元音与开中后元音在第一共振峰上显著分离而二语者无显著差异,强度上两组全元音均更强但二语组对比更大,基频峰则无组间差异。结论适用边界受限于高水平巴西学习者朗读首音节与次音节重音词,尚未验证自发语篇与感知层面的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 数据相关资源:https://doi.org/10.5281/zenodo.18632734 → https://zenodo.org/records/18632734 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
37. 带口音的普通话还是整齐的音节节律吗:十地口音的连续统证据
英文题目:Rhythm Variation in Regional Accented Putonghua: A Continuum Perspective
标签:#统计分析 #韵律 #社会语音学 #语音 #语音属性识别
评分:5.8/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Zhiwei Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Aijun Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为十地区中等口音普通话自发独白语音,输出为其在音节定时—重音定时—莫拉定时三角中的相对位置,难点在于方言词汇距离与节奏距离不一致且口音程度与体裁变异交织难控。方法链分三步:先将汉语音节拆为声母对应辅音区间与韵母对应元音区间并提取区间度量、成对变异指数与语速指标,输出归一化节奏向量进入筛选环节。再用Kruskal-Wallis检验筛选高区分力度量并聚焦percent V、delta C与nPVI等类型学常用指标做二维投影,投影揭示的区分格局进入距离建模。最后对归一化节奏向量求欧氏距离并做多维标度与Ward层次聚类,得到连续体结构与四簇划分。在十地区自发独白语料下,中央簇高值端的rPVI-C指标为5.2,高于中央簇低值端的rPVI-C指标5.0。相对离散节奏类型划分,关键差异在于强调表层语音实现的连续动态变化,并以吴语韵律词域声调主导与普通话系统相对简单解释迁移方向,有助于揭示音系复杂性不对称的实际意义。该结论适用边界仅限中等口音程度的独白体,朗读与问答体及轻重口音外推尚未验证,且年龄性别等社会因素统计受限。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
38. 突出时听者为何反而少用频谱线索:英语紧松元音感知的产生镜像
英文题目:Effects of F0-based Prosodic Prominence on the Perception of the English Tense-Lax Vowel Contrast
标签:#心理声学实验 #韵律 #言语感知 #语音 #音频分类
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#心理声学实验
👥 作者与机构
- Juhyung Cho:机构信息未能从会议 PDF 纯文本可靠映射
- Yoonjung Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Jessamyn Schertz:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为含/i/-/ɪ/元音的hid-heed孤立词刺激,输出为二选一heed-hid范畴判断,难点在于基频既可能是元音固有高低属性也可能是韵律突出线索,听者需据此反向重校准范畴边界。方法链先以线性预测编码重合成七级共振峰与七级时长连续体以正交控制线索,再以基音同步叠加法合成下落与升降后落两种轮廓并仅作用于元音段,然后经在线听辨收集反应并用广义线性混合模型分离边界位移与边界锐化。七级频谱与七级时长正交组合并交叉两种轮廓共生成九十八个刺激,前一步声学参数化输出直接进入后一步听辨建模以估计线索权重变化。与全局线索增强观不同,该文提出生产镜像机制,认为知觉权重应跟随生产中时长对比增强而频谱未增强的格局,突出时更依赖时长而非全面锐化。在在线二选一heed-hid听辨任务条件下,频谱线索的估计指标为1.364,高于时长线索的估计指标0.570。升降后落突出轮廓显著降低/i/反应并减弱频谱斜率,其中频谱与轮廓交互估计为负且在中长时程更明显,支持语境自适应重校准而非固有基频解释。结论适用边界仅限于北美英语听者对高元音时紧对立的孤立词判断,尚未验证句子语境、跨元音与跨语言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://cran.r-project.org/package=emmeans → https://cran.r-project.org/web/packages/emmeans/index.html — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
39. 定冠词更短吗:德语冠词边界时长如何标记已知与未知
英文题目:Signalling language redundancy: The acoustic salience of in/definite articles in German
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Mila Freiseis:机构信息未能从会议 PDF 纯文本可靠映射
- Tianyi Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Tina Bögel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文检验平滑信号冗余假设在德语定指性上的适用性,输入为句法框架相同但切换定冠词die与不定冠词eine及高低频三音节名词的句对,输出为冠词前后边界区间时长是否随语义语用冗余度变化,难点在于eine与die音节结构不可比且韵律边界强化难以与音段固有时长及重音效应分离。方法链由三步衔接构成:先以21组四元句式控制句法并匹配名词首音节与重音位置以隔离词边缘效应,再经图片预展示建立共同基础后在隔音室朗读采集以激活定指共指,然后经慕尼黑自动切分系统初切加Praat手校提取B1与B2边界区间并送入线性混合效应回归检验定指性与词频效应。与既往聚焦词频与句法概率并经由重音显著性实现的研究相比,本文把定指表征的已知信息冗余经由韵律边界时长强化而非重音加以位置特异性检验。在按列表划分高低频名词子集的验证集条件下,冠词前边界B1定指短于不定指的时长指标为p<0.001,低于冠词名词间边界B2低频子集定指短于不定指的时长指标β=0.0015所对应的显著性水平。全集上B1定指显著短于不定指而B2无显著差异且词频主效应与交互均缺失,表明冗余效应具边界位置特异性。结论适用边界受限于朗读式标准德语阴性名词短语的时长生产端,尚未验证基频线索、感知可利用性与自发对话外推,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.dwds.de/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
40. 焦点在句首名词短语内部时,前置词为何要压低自己的 prominence
英文题目:Pre-focal intonational variation in Hungarian as prominence reduction
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Frank Kügler:机构信息未能从会议 PDF 纯文本可靠映射
- Corinna Langer:机构信息未能从会议 PDF 纯文本可靠映射
- Anja Arnhold:机构信息未能从会议 PDF 纯文本可靠映射
- Nele Ots:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务输入为句首限定词加双形容词加名词构成的动词前焦点复杂名词短语,输出为每词语调模式与窄焦点位置的对应判定,难点在于整个短语已占据句法焦点位,仅靠句法无法区分焦点落在首形容词、次形容词还是名词。方法链分三步:先用语境问句诱发首形容词、次形容词与名词三种窄焦点并录制朗读,使上步的焦点条件进入声学样本;再经强制对齐提取每词基频极值并计算极差与斜率,按一塞米阈值三分出下降、上升与平台,使上步波形转为可统计的类别序列;最后以卡方检验关联模式分布与焦点条件并以方差分析比较下降斜率,使类别差异接受显著性检验。与把句首下降视为唯一焦点标记的传统描写不同,该机制把焦点前成分改用非下降模式或压平下降斜率视作突显缩减,从而相对提升后部焦点词的突显并保留左边缘结构。在包含19名母语者10套材料3种焦点条件的570句朗读语料条件下,首形容词在A1焦点条件下的下降次数指标为171,高于在A2焦点条件下的下降次数指标91。该结论适用边界受限于受控朗读的双形容词名词短语,对自发话语、更长短语及知觉功能负荷的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.audacityteam.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
41. 用长语境找韵律:从 YouTube 检索到 wav2vec2 二选一的韵律最小对基准
英文题目:ML Classification in a Benchmark of Prosodic Minimal Pairs
标签:#基准测试 #SFT #韵律 #音频分类
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#音频分类 | 主方法:#SFT
👥 作者与机构
- Sahya Lagisetty:机构信息未能从会议 PDF 纯文本可靠映射
- Mats Rooth:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为已知词串的短语音片段,输出为该词串两种韵律读法之一,难点在于焦点重音与默认重音的声学差异细微,且自然语料中带韵律标签的同词串样本难以大规模获得。方法先以包含对比主语或时间状语的长串在filmot.com的YouTube转写索引中检索候选并获取视频标识,再用yt-dlp下载音频并截取约10秒中段音频作为待处理区间。然后用stable-ts重做识别与词级时间对齐,并据此从中段音频切出最小对短片段,同时生成Praat TextGrid备查。切分后的短片段连同由长串检索条件决定的弱标签进入wav2vec2-base加分类头的微调,使低层表征直接适配韵律二选一。与Howell等人人工校对转写、人工标注焦点并手工测量时长基频谱倾斜再训练SVM/LDA的路线相比,该路线以检索约束代替人工标注、以自监督表示代替特征工程,具有可扩展收集的实际意义。在验证集划分的基准条件下,present10条件的准确率为0.9934,高于present01条件的准确率0.9661。该结论的适用边界受限于英语YouTube朗读式语料的四个短串,且同一音频复用于不同视频导致训练验证泄漏而高估准确率,跨说话人、跨风格与跨语言外推尚未验证。原文未披露训练、推理或部署成本
🔗 开源资源
- 第三方资源:https://github.com/jianfch/stable-ts — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
42. 焦点靠音高撑起来吗:两种墨西哥西班牙语用音高范围和形状标记焦点的程度之差
标签:#统计分析 #韵律 #社会语音学 #语音 #语音属性识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Gilly Marchini:机构信息未能从会议 PDF 纯文本可靠映射
- Jeremy Steffman:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以纠正问答中双音节倒数第二重音目标词及其相邻音节的时间归一化、说话人内标准化F0轨迹为输入,输出焦点条件与变体差异的连续量化解释,难点在于小样本下分离音域、形状与对齐交织的曲线变异。方法链首先经语料诱发与声学前端采样得到可比曲线,AFS分析1467条、AMS分析1522条轨迹并按焦点、变体与说话人编码,接着经函数主成分分析将每条曲线分解为均值函数加主成分加权得到PC得分,再用贝叶斯多变量混合模型联合预测多个PC得分并做组水平与逐说话人边缘焦点对比,前一步得分直接作为后一步回归因变量。与基于离散Sp_ToBI标注的既有描述相比,该机制以数据驱动连续模态替代先验类别判断,可同时估计变异方向、幅度与个体异质性。在纠正问答诱发双音节词语料条件下,AMS的PC1焦点对比得分为-6.50,低于AFS的PC1焦点对比得分-2.65。该结论适用边界仅限于朗读双音节词的内焦点与后焦点对比,尚未验证短语边界、语气、自然对话及性别年龄外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://joss.theoj.org/papers/10.21105/joss.01541 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
43. 默读时的重音从哪来:当词汇被拿掉,谁还在用纯韵律做理解
英文题目:Individual differences in use of prosodic and lexical information in implicit prosody
标签:#心理声学实验 #心理测量 #韵律 #语音 #口语理解
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Joy Mills:机构信息未能从会议 PDF 纯文本可靠映射
- Sasha Calhoun:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为听觉启动句与视觉呈现的歧义only目标句,输出是对后续句指向动词关联还是名词关联的二选一解读,难点在于默读时的隐性韵律不可直接观测且与词汇句法信息高度纠缠。先由受过韵律训练的发音人录制不同信息结构指向的听觉启动句,职责是提供可控的重音对比,其输出的完整语音进入下一步的去词汇化处理。再用音素替换并叠加原始韵律轮廓合成去词汇化版本,职责是剥离词汇句法而保留韵律,其输出与未处理版本共同构成词汇有无的对照条件并进入跨通道启动呈现。最后将同一条件的多个听觉启动连续呈现后接入视觉目标句进行默读,职责是诱发隐性韵律预期并用后续句二选一测量解读倾向,其输出进一步结合自闭特质与工作记忆等个体差异分析调节作用。与以往多用关系从句依附且分离被试比较词汇影响的研究不同,该工作以信息结构歧义隔离句法混淆并实现被试内比较,因而能区分纯韵律与词汇句法的作用。原文未提供可核对的关键定量结果。该结论的适用边界仅限于离线二选一解读任务与英语only焦点结构,尚未验证注视或脑电时间进程中的即时加工分歧。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://escholarship.org/uc/item/1z6819t5 — 链接不可用(HTTP 403) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
44. 发得出却听不出:粤语 T2-T5 近合并如何被最小对比例稳住
英文题目:Equilibrium Dynamics of Near-Merger: Functional Load Effects in Cantonese Tone Contrast
标签:#形式化分析 #语音学与音系 #言语感知 #音频分类
评分:5.7/10 | 创新 1.4/2 | 技术严谨 0.8/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:理论研究 | 主任务:#音频分类 | 主方法:#形式化分析
👥 作者与机构
- Tianyi Ni:机构信息未能从会议 PDF 纯文本可靠映射
- Rebecca Morley:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
粤语上升调T2与T5近合并研究输入为调尾基频F0目标值的一维声学分布,输出为产生与感知两套范畴均值随迭代演化的距离,要求解释为何产生可保留细微分离而感知先行塌缩,难点在于模糊证据在两空间中的污染路径不对称且受最小对功能负载约束。方法链分四步:先以232个T2与242个T5真实语料初始化双空间样例库并区分单例与最小对词项,再在产生端依次施加时长截断欠射与最小对超发音增强以形成对比目标,其后叠加高斯归并噪声并经经验回路回写,最后在感知端用高斯核分类器判定类别并对模糊双例执行双重存储。产生输出作为感知输入进入下一轮迭代,感知误判只污染感知库而不直接改写产生目标,从而形成非对称耦合的平衡动力学。相对共享样例库的经典样例模型,分离存储加非对称入库是关键机制差异,使模糊证据的平均效应集中拉近感知均值而产生端仍受超发音牵引,实际意义在于用功能负载比例解释了稳定近合并态的维持条件。在以232个T2与242个T5真实语料初始化的仿真任务下,产生语法的对比距离指标在约800轮迭代后仍为分离保持值,高于感知语法的对比距离指标在约600轮迭代后压缩后的低值。该结论适用边界受限于单维调尾高度、无语境与等频词选择的理想词库,外推到多线索自然语流或儿童发展轨迹尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
45. 听见介音需要多长时间:语速与音节结构如何塑造普通话/j/的时间累积
标签:#心理声学实验 #语言习得 #言语感知 #语音 #语音属性识别
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Yuyan Niu:机构信息未能从会议 PDF 纯文本可靠映射
- Albert Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理普通话第二音节中介音/j/的/i/样感知如何随声学暴露累积形成的问题,输入为不同截断长度的门控语音片段,输出为五点量表上的/i/样程度判断,难点在于第二共振峰快速上升过渡短暂且同时受整体语速压缩与母语切分策略调制。方法链分为三步:先由北京官话女性发音人以快、中、慢三种语速产出含miao、mian、mia、yao的载体句并标定辅音起点与介音起点与元音起点,再将介音区间按实际时长比例切分为渐进增长的十级门控以控制局部证据量,随后让汉语母语者与日语初级组和中级组在线听辨评分并用累积链接混合模型与线性混合模型解析门控与语速与音节结构效应。与以往关注静态F1/F2分布的研究不同,本设计把语速视为全局时间资源约束,把门控视为局部证据累积探针,从而分离整体压缩与局部可辨度的交互。在门控听辨任务条件下,慢速语音的平均得分增量为0.42个量表点,高于中速语音的平均得分增量0.28个量表点。在全部10800个目标观测上每增加一个门控平均提升0.19个量表点,且组间形成汉语母语者大于中级组大于初级组的稳定梯度。结论的适用边界仅限于单发音人、单一声调高平调及四个选定音节,尚未验证多发音人与自然语流中的外推性,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
46. 声调难量化:连续表征记得住声调,离散单元却偏向音素
英文题目:Lexical Tone is Hard to Quantize: Probing Discrete Speech Units in Mandarin and Yorùbá
标签:#向量量化 #韵律 #语音 #音频分类
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#向量量化
👥 作者与机构
- Opeyemi Osakuade:机构信息未能从会议 PDF 纯文本可靠映射
- Simon King:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为普通话与约鲁巴语元音段的冻结自监督连续表征,输出为音位与词法声调类别,难点在于量化后声调等超音段信息比音位信息丢失更快。先用冻结的MandarinHuBERT与AfriHuBERT从语音中抽取帧级隐向量,得到同时保留音位与声调的连续表征,再将其送入量化环节进行离散化。再用经典K均值、神经VQ/RVQ及残差K均值等量化器把上述隐向量转为离散语音单元码本向量,输出码本向量序列以进入探针评测。最后在强制对齐得到的元音段上训练轻量探针分类器,帧序列用单层LSTM加线性头、单向量用逻辑回归,输出加权F1分数以比较音位与声调保留度。关键差异是残差K均值先在均值池化段上做50类粗聚类吸收音位身份,再对残差做450类细聚类回收声调,与单层平面码本形成粗到细对照,其实际意义在于把方差大的音位与方差小的声调分层建模,避免距离或重构目标被音位主导。在AISHELL-1普通话元音探针评测设置下,深层残差向量量化的Tone F1分数为0.82,高于经典K均值的Tone F1分数0.70。结论适用边界受限于仅做元音探针分类而尚未验证语音合成或语言建模等下游任务,也尚未验证对重音与节奏等广义韵律的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
47. 先吸气还是先想好说什么:用儿童与成人对比判断呼吸与韵律的方向
英文题目:On the Relationship between Breathing and Prosody in the CAPIL Corpus
标签:#数据集 #统计分析 #韵律 #语音属性识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Melissa Redford:机构信息未能从会议 PDF 纯文本可靠映射
- Bess Frerichs:机构信息未能从会议 PDF 纯文本可靠映射
- Kristopher Kyle:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为自发叙述与说明言语的同步声学波形与胸腹呼吸运动学信号,输出为呼吸组层面的韵律分句、音高变化与音高重置预测,难点在于区分生理容量约束与言语运动规划对韵律的驱动方向。方法链先以声学停顿与运动学极值独立切分话语与呼吸周期,再对齐为单次呼气言语加前置吸气的呼吸组,使呼吸深度预测量进入后续建模。接着经Momel与INTSINT算法将连续基频建模为调音目标序列,并提取短语数与基频极差作为韵律变量。最后对比语言学单因素与加入吸气深度的混合效应模型,以检验呼吸增量解释力与年龄交互。相对已有成人小样本生理相关研究,关键机制差异是以儿童与成人发育对照检验方向性,若儿童耦合更弱则支持交际驱动而非容量约束,实际意义在于提供规划成熟证据。在CAPIL语料分句建模任务下,呼吸主效应模型的指标χ2为23.36,高于加入年龄交互后增量模型的指标χ2的13.63。结论适用边界受限于西海岸美式英语叙述与说明语体及五岁与青年对照,尚未验证其他年龄语言与对话互动的外推,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://praat.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
48. 妈妈对孩子说话更清楚:时长拉长与抵抗弱化的信息动因
英文题目:Informational Motivations for Prosodic Variation in Child-Directed Speech
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Rebecca Scarborough:机构信息未能从会议 PDF 纯文本可靠映射
- Bhuvana Narasimhan:机构信息未能从会议 PDF 纯文本可靠映射
- Allison Hilger:机构信息未能从会议 PDF 纯文本可靠映射
- Kanupriya Kale:机构信息未能从会议 PDF 纯文本可靠映射
- Justin Bai:机构信息未能从会议 PDF 纯文本可靠映射
- Chloe Circenis:机构信息未能从会议 PDF 纯文本可靠映射
- Tessa Moskoff:机构信息未能从会议 PDF 纯文本可靠映射
- Caitlin Amero:机构信息未能从会议 PDF 纯文本可靠映射
- Veronica Shlyapnikova:机构信息未能从会议 PDF 纯文本可靠映射
- Alex Hutton:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为母亲面向儿童或成人听者复述放置与触摸遮盖动作的教学指令语音,输出为目标词元音时长与平均基频,难点在于区分情感性夸张与为帮助指称识别而做的信息性清晰化调整。方法链分四步:先通过Zoom在线呈现放置与触摸遮盖动画诱发首提新信息与复提给定信息,其产生的首复提语境进入难度操纵步骤,分别设置单指称、对比干扰与语音混淆三种指称识别难度并平衡目标配对。难度配对后的产出语音进入声学测量步骤,经Montreal Forced Aligner自动切分并手工校正后用Praat提取目标元音时长与平均基频,其测量值再进入统计建模步骤,以被试与条目为随机效应的混合效应回归分离听者与难度效应并检验交互。与既有CDS描述性比较不同,该设计将难度效应置于话语任务中并检验其在CDS中是否增强或抵抗缩减,从而把清晰度解释与情感夸张解释分开,具有验证信息性动机的实际意义。在首提新信息任务条件下,CDS的目标元音时长指标为242ms,高于ADS的目标元音时长指标211ms。该结论适用边界受限于3岁至5岁儿童的美国英语母亲实验室诱发语,尚未验证其向自然互动、自发韵律与跨语言普遍性的外推,失败条件下第二提及缩减与基频下降模式可能改变。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://praat.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
49. 当脸和声音吵架时,人工耳蜗学龄前儿童为什么更信脸
标签:#人类参与评测 #统计分析 #音视频 #语音情感识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音情感识别 | 主方法:#人类参与评测
👥 作者与机构
- Ruowei Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Qiunan Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Zheyu Song:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Li:机构信息未能从会议 PDF 纯文本可靠映射
- Shanpeng Li:机构信息未能从会议 PDF 纯文本可靠映射
- Ping Tang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理动态视听情绪感知中的冲突加权问题,输入为面部表情与情绪言语不一致的视频,输出为儿童判断的高兴或愤怒标签,难点在于听觉退化儿童如何重组多感觉权重与面部注视。研究先录制女性播音员的积极与消极语句并做声学校验,再通过保留原片与跨情绪配音构造一致与冲突刺激,接着让人工耳蜗(Cochlear Implant,CI)组与健听组边看边做二选一判断并同步记录眼动,最后用混合效应模型与相关分析连接判断偏向与注视分配。与健听儿童近似均等加权不同,CI儿童表现出明确视觉主导并形成更均衡的眼口分配,机制差异体现为听觉可靠性下降驱动的感觉重加权而非单纯唇读延续。在冲突条件下CI组基于面部的反应比例显著高于随机水平而健听组停留于随机水平,一致条件下两组准确率分别达91.98%与99.67%。结论目前仅适用于普通话高兴与愤怒的强表情加完整语义刺激,未验证其他情绪与纯韵律条件的推广性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
50. 焦点抬高了整词,重音却只剩半边:雅美语焦点与重音的首次分离检验
英文题目:A first look at the prosody of focus and stress in Yami (Tao)
标签:#统计分析 #语音学与音系 #韵律 #语音 #语音属性识别
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Chun-Jan Young:机构信息未能从会议 PDF 纯文本可靠映射
- Argyro Katsika:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
雅美语焦点是否以韵律标记、假定词重音是否独立于焦点存在,是本文以语境诱发话语为输入、以音节级声学差异为输出的实证任务,其难点在于词层面突显长期与短语边界和信息结构突显相混淆。为此研究先以图片加问答对话诱发句首对比焦点、窄焦点及相应的后焦点基线,并把目标词固定于句首焦点槽位以隔离短语首边界效应。该诱发话语的输出进入声学测量步骤,经标注元音核并抽取基频、时长、均方根能量与谱倾斜均值,形成可供建模的元音核样本集。测量结果再进入统计建模步骤,以线性混合效应模型检验词类、音节与焦点条件的交互,从而分离焦点效应与假定重音。相对以往未控制焦点且混淆词与短语突显的描写,该设计以后焦点为无焦点基线并对比状态词与名词动词,使音节间残留差异可作为重音证据,其实际意义在于检验次末重音与末重音假设。原文未提供可核对的关键定量结果。聚焦词与后焦点词在时长与能量维度得到区分,而对比焦点与窄焦点未见稳定分化,重音证据仅在状态词相关声学维度上较可靠,其适用边界受限于兰屿老年双语人小样本及特定音节均值分析,尚未验证向宽焦点与自发语体的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://cran.r-project.org/package=emmeans → https://cran.r-project.org/web/packages/emmeans/index.html — 链接可访问(HTTP 200)
- 第三方资源:https://chatgpt.com/ — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
51. 焦点拉长时长,语义似然却未必:德语朗读实验中的时长编码
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Ivan Yuen:机构信息未能从会议 PDF 纯文本可靠映射
- Bernd Moebius:机构信息未能从会议 PDF 纯文本可靠映射
- Bistra Andreeva:机构信息未能从会议 PDF 纯文本可靠映射
- Mitko Sabev:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为问答诱发的宽焦点、窄焦点物体与窄焦点地点语境及64组物体-地点名词对,输出为目标短语中物体名词N1与地点名词N2的时长及其比率,难点在于需在受控朗读中分离焦点结构效应与意义层语义似然效应并处理地点名词音节长度差异。首先由问答范式诱发三种焦点并将64对高低语义似然短语嵌入载体句中部朗读采集,其输出的录音进入Praat人工标注以切分目标短语及N1与N2边界。随后标注时长进入R中线性混合效应建模,以宽焦点与高似然为参照并纳入说话人与项目随机效应,其输出的原始时长与N1/N2比率再经音节归一化验证句内凸显关系。与基于三元组意外度的语料研究不同,本工作采用物体-地点语义关联似然操纵并在实验内正交控制焦点,因而可检验意义层可预测性是否独立调制时长。在937句朗读语料条件任务下,窄焦点地点条件的N2时长指标为20.6,高于低语义似然条件的N2时长指标-6.9。该结论适用边界仅限德语朗读体、中部宾语短语及时长维度,对自发语、基频与强度及完整样本的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.labvanced.com/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
52. 倒数第二音节拉长是边界提前开始,还是重音与边界两件事相遇:塞茨瓦纳实时 MRI 的运动学证据
标签:#统计分析 #发声与构音 #韵律 #语音 #语音属性识别
评分:5.7/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Yubin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Xuan Shi:机构信息未能从会议 PDF 纯文本可靠映射
- Kevin Huang:机构信息未能从会议 PDF 纯文本可靠映射
- Prakash Kumar:机构信息未能从会议 PDF 纯文本可靠映射
- Kevin Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Boitumelo Moshoete:机构信息未能从会议 PDF 纯文本可靠映射
- Keneilwe Matlhaku:机构信息未能从会议 PDF 纯文本可靠映射
- Dani Byrd:机构信息未能从会议 PDF 纯文本可靠映射
- Louis Goldstein:机构信息未能从会议 PDF 纯文本可靠映射
- Krishna Nayak:机构信息未能从会议 PDF 纯文本可靠映射
- Shrikanth Narayanan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为塞茨瓦纳语目标词在载体句中部与末尾位置的中矢面实时磁共振影像与同步音频,输出为倒数第二与末音节辅音与元音手势的时长、位移与峰速及其韵律解释,难点在于需在连续收缩序列中分离边界减速与短语重音的叠加效应。首先以0.55T磁共振采集正中矢状面影像并半自动分割构音器轮廓,得到的轮廓序列进入收缩量计算。然后计算唇与舌腭区域最小距离得到收缩时间序列,并按速度极值标注手势起始、峰速与偏移,导出时长、位移与峰速三个运动学量。最后将词位置与话语位置合并为四水平韵律位置变量,构建包含韵律位置、手势类型及其交互的线性混合效应模型并做两组事后比较,得到位置趋势估计。相对把倒数第二拉长视为边界手势提前启动的单阶段观点,该文主张短语重音μ手势与边界π手势协同调控,预测时长呈双峰而空域仅单调增强,具有区分重音与边界机制的实际意义。在句末与句中对比测试条件下,C1位置的峰速指标为6.31,高于C2位置的峰速指标0.80。该结论适用边界受限于受控载体句中的双音节词尾序列,尚未验证自发语篇、其他边界等级与疑问句语调的外推,存在失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
53. 误会迫使换权重:英语者缩短松元音,日语与普通话者走向不同维度
标签:#统计分析 #语音学与音系 #韵律 #语音 #语音交互
评分:5.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音交互 | 主方法:#统计分析
👥 作者与机构
- Han Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyao Ruan:机构信息未能从会议 PDF 纯文本可靠映射
- Dawn Behne:机构信息未能从会议 PDF 纯文本可靠映射
- Allard Jongman:机构信息未能从会议 PDF 纯文本可靠映射
- Joan Sereno:机构信息未能从会议 PDF 纯文本可靠映射
- Paul Tupper:机构信息未能从会议 PDF 纯文本可靠映射
- Yue Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理母语英语与日语、汉语晚期二语者在英语紧张-松弛元音混淆引发误解时的在线语音适应,输入为无脚本合作放图游戏对话中的最小对目标词发音,输出为光谱线索F1、F2与时间线索时长比权重随时间的分离变化,难点在于区分自动趋同与以可懂度为目标的策略性调整。方法链分三步:先用Escape Simulator游戏诱发sheep-ship类误解并记录自由协商以提供适应窗口,其输出的连续对话录音进入声学标注环节。接着用Praat标注元音边界并提取中点共振峰转Bark标度与元音占词时长比,得到的归一化声学表进入统计建模环节。最后按任务与语言组合与元音对分别拟合线性混合效应模型并以归一化时间的三重交互与边缘趋势检验适应方向。与既往单向复述或整体相似度知觉评价相比,该工作把线索权重作为随对话演化的因变量,揭示母语者也会向非母语者母语偏好偏移,具有双向协同的实际意义。在游戏对话任务条件下,英语者/ɪ/的时长指标βTime为-.12,低于日语者/ɪ/的时长指标βTime.04,组间分离扩大方向一致。结论的适用边界受限于高混淆压力任务型对话且前后测朗读无迁移,/u-ʊ/因样本过少尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://praat.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
54. 笑点前多停 157 毫秒:普通话脱口秀会标记笑点,但听众不靠它觉得好笑
英文题目:Prosodic Markers in Mandarin Stand-Up Comedy: An Acoustic and Perceptual Study of Pauses
标签:#心理声学实验 #韵律 #言语感知 #语音 #音频理解
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频理解 | 主方法:#心理声学实验
👥 作者与机构
- Ruiyao Zhong:机构信息未能从会议 PDF 纯文本可靠映射
- Xiyu Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理普通话单口喜剧中笑点前停顿是否为系统性时间标记及其能否提升幽默感知难题,输入为现场演出音频与重合成音频,输出为停顿分布差异与趣味度评分关系。方法先对约八十分钟职业演出语料做声学分析,按笑话内配对提取笑点前最终静音段与 setup 基线均值并排除笑声重叠,以检验产生端标记。接着经文本趣味与熟悉度筛选选出二十个陌生笑话,按对数感知设置二百至一千八百毫秒五档时长插入笑点边界并保持其他声学特征不变,交由五十名被试单次平衡呈现评分。相对英语业余讲笑话无标记结论与重音语言自由调动音高机制,本研究聚焦职业演员与声调约束,提出表演驱动的显性时间切分而非内容理解必需机制,有助于区分舞台结构需求与听众认知需求。在职业单口喜剧语料条件下,笑点前停顿的平均时长指标为634.50 ms,高于基线停顿的平均时长指标477.91 ms。感知端陌生试次混合模型显示停顿主效应不显著,表演偏好的六百毫秒附近时长并未带来评分优势,说明语义保留时时间微调作用受限。结论适用边界限于保留语义的叙事类文本笑话纯音频评分任务,尚未验证多模态现场互动及语速节奏协同变化下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
55. 不在同一房间,开口为何更费力:远程、共处与混合会议中的停顿证据
英文题目:Filled and silent pause production in remote, collocated and hybrid meetings
标签:#会议转录 #统计分析 #韵律 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Ghazaleh Esfandiari Baiat:机构信息未能从会议 PDF 纯文本可靠映射
- Ambika Kirkland:机构信息未能从会议 PDF 纯文本可靠映射
- Jens Edlund:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为三人协作生存排序会议语音,输出为填充停顿与无声停顿的频率与时长特征,难点在于分离会议媒介效应与说话人个体差异及任务内容差异。首先在设施内组织多组英语流利被试按随机顺序完成同地远程与混合共识会议并同步录音,输出多通道会议语音进入标注环节。接着用标注工具按轮次单元逐说话人标注轮次内可感知填充停顿与无声停顿,输出逐人停顿计数与时长进入统计环节。然后以每分钟说话时长归一化停顿率并做重复测量方差分析与事后校正检验,混合内再做远近被试对照。与仅描述现象的既有停顿研究不同,本文以被试内跨媒介比较与混合内远近对照直接检验沟通努力共享机制,具有揭示媒介负荷的实际意义。原文未提供可核对的关键定量结果。该结论适用边界受限于英语流利成人结构化共识任务与视频会议介导环境,尚未验证与主观努力感及轮次管理的因果链。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
56. 声调相似不等于线索相同:法语者辨北方越南语声调的基线与跨语言训练为何只快不准
英文题目:Perception of Northern Vietnamese Tones: A Cross-Language Training Experiment
标签:#心理声学实验 #言语感知 #跨语言 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Hồng Quang Chāu:机构信息未能从会议 PDF 纯文本可靠映射
- Ioana Chitoran:机构信息未能从会议 PDF 纯文本可靠映射
- Hiyon Yoo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为法语母语者对北部越南语四对声调的听辨,输出为AXB辨别准确率与正确反应时,难点在于音高与发声态多维耦合且关键差异出现晚而微弱并易被母语语调同化。方法链分三环衔接:先录制多说话人刺激并经声学校验选定目标对比与泰语普通话粤语类比对比,再实施无反馈前测建立难度层级并以混合模型分离被试与音节随机效应,接着按五组施加带反馈的低变异训练并做后测比较以检验即时迁移。相对已有单语言内声调训练,该设计以跨语言宽泛相似对检验是否足以触发线索重加权,具有明确的理论针对性。前测显示发声态上升对最易而发声态下降对最难且层级在训练后依然持续,训练主效应显著但组别与声调对交互均不显著,表明仅为加工效率提升而非特异性迁移。在基线评测条件下,全模型的准确率方差解释率为13.6%,高于声调对固定效应的准确率方差解释率6.6%。训练后整体正确率提升优势比为1.49且反应时加快约28%,但个体基线与提升斜率变异远大于平均练习效应。该结论适用边界受限于短时低变异即时迁移条件,无法外推到长时高变异或生产泛化,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/kirbyj/praatsauce — 链接可访问(HTTP 200)
- 第三方资源:https://cran.r-project.org/package=afex → https://cran.r-project.org/web/packages/afex/index.html — 链接可访问(HTTP 200)
- 第三方资源:https://cran.r-project.org/package=emmeans → https://cran.r-project.org/web/packages/emmeans/index.html — 链接可访问(HTTP 200)
- 第三方资源:https://cran.r-project.org/package=MuMIn → https://cran.r-project.org/web/packages/MuMIn/index.html — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
57. 同一句 Since when are they linguists?不信与求信息靠韵律分开
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Youngdong Cho:机构信息未能从会议 PDF 纯文本可靠映射
- Fengyue Lisa Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Chloe Dokyung Kwon:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
英语since-when问句以同一字符串加话语语境为输入,以韵律实现为输出,需在索取事件起点与表达难以置信之间切换,难点在于判定差异属于范畴性调型替换还是梯度性音高缩放。研究先用Since when are they名词框架构造10个目标句并嵌入100%难以置信、50%难以置信与信息索取三种语境做在线产出采集,再经蒙特利尔强制对齐校正与Praat基频平滑提取音节级时长及F0均值、最小值与范围,随后并行使用线性混合效应模型检验静态均值差异并以广义加性混合模型拟合女性说话者动态轮廓。与Kiss基于内省的低边界调描述及依赖ToBI范畴标签的修辞问句研究相比,该工作直接量化F0谷深度与上升斜率的梯度变化,因而能揭示难以置信语境下when延长并伴随更深F0谷与更陡上升的连续实现。在在线产出采集任务条件下,女性说话者在难以置信语境中三音节名词重读音节的F0均值指标降幅估计为22.86,高于双音节名词首重读音节的F0均值指标降幅估计18.85。该结论的适用边界受限于受控朗读框架、美国英语青年被试与237个可用token,尚未验证自发对话、多方言及男性精细轮廓的外推范围。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.labvanced.com/publication.html — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
58. 敬畏的声音为何又慢又轻又稳:单字韵律中时长、音高变化与共振峰稳定的分工
英文题目:Prosodic features of awe: What makes the voice sound in awe?
标签:#统计分析 #韵律 #语音 #语音情感识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音情感识别 | 主方法:#统计分析
👥 作者与机构
- Valerie Coulombe:机构信息未能从会议 PDF 纯文本可靠映射
- Vincent Martel-Sauvageau:机构信息未能从会议 PDF 纯文本可靠映射
- Laura Monetta:机构信息未能从会议 PDF 纯文本可靠映射
- Maxime Montembeault:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理从单字语音韵律中表达与识别敬畏的问题,输入为31名魁北克法语者按情景表演的/papa/发音,输出为敬畏相对愤怒、恐惧、悲伤、愉悦惊奇、喜悦的声学差异及听者判为敬畏的声学预测因子。难点在于敬畏与愉悦惊奇、喜悦、悲伤在效价与唤醒度上重叠且缺乏已知声学标记,易被误判为相邻情绪。方法分三步推进:先录制切分得到372个语音文件并由5名专家听众完成1860人次识别评分,评分求和构成敬畏识别得分进入后续分析。再用openSMILE提取扩展eGeMAPS的88个特征,并以情绪为固定效应的线性混合效应模型筛选编码特征并按相关性去冗余。最后以敬畏识别得分为因变量做线性回归与多项逻辑回归,前步保留的时长与基频变异等量进入后步预测检验以确定解码线索。与已有基本情绪韵律研究相比,该工作把敬畏单独作为低至中等唤醒的积极情绪建模,并区分说话人意图编码与听者感知解码两条证据链,具有细粒度情绪定位意义。在372个单字/papa/语料的听者解码任务下,时长对敬畏识别得分的回归系数β为0.76,高于音高变异性f0 CoV对同一得分的回归系数β的0.13。该结论适用边界受限于受控表演的单字短语、年长魁北克法语群体与实验室听辨条件,尚未验证自发敬畏、长句与跨语言泛化,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
59. 词干首音节更用力吗:科姆语位置重音的时长与共振峰证据
标签:#统计分析 #语音学与音系 #韵律 #语音 #语音属性识别
评分:5.6/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Matthew Faytak:机构信息未能从会议 PDF 纯文本可靠映射
- Tianle Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Ivo Forghema Njuasi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为科姆语半自发口头语料中元音/i a ɨ/的切分片段,输出为词干首音节是否承载位置显著性的声学判定,难点在于声调占据基频线索、正字法不完整标调且语流中元音合并与删除频繁。该方法链分三步推进:先以正字法转写驱动蒙特利尔强制对齐器获得词与音素边界,再人工校对显著性归属并修正元音序列的合并与删除,随后提取中点共振峰与时长并做说话人内标准化进入统计检验。对标准化后的声学量分别建立含元音、显著性及其交互的线性混合效应回归,并以估计边际均值做同元音显著与非显著的事后比较。与既有尼日尔-刚果文献只强调分布不对称不同,该文以超发音解释显著元音更外围、更长的协同变化,具有统一空间扩张与时长增加的实际意义。在17205个开放音节元音语料下,/i/的F2指标为1.901,高于/ɨ/的F2指标0.1086。该结论适用边界受限于开放音节与三个共存元音,尚未验证声调类别交互、词边界混淆与闭音节及完整十一元音库的外推。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
60. 不是打绝对分,而是估计变化量:同人同文本的相对声音印象
标签:#自监督学习 #模型比较 #零样本 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#自监督学习
👥 作者与机构
- Kenichi Fujita:机构信息未能从会议 PDF 纯文本可靠映射
- Yusuke Ijima:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究相对语音印象估计,输入为同一说话人朗读相同文本的两段语音,输出为第二段相对第一段在九对反义轴上的九维印象差向量,难点在于固定音色与文本后仍需捕捉细粒度表现力与知觉变化。经典声学路先用openSMILE的eGeMAPSv02提取发声段特征并筛选高相关特征,再对差分向量做线性回归或对拼接特征训练前馈网络以学习非线性映射。自监督路将两段语音分别送入日语HuBERT经加权求和得帧表示,再经双向长短期记忆网络与注意力池化聚合成话语向量并拼接后由多层感知机回归九维差值。多模态大模型路将语音对与日语提示直接送入音频大模型,在零样本或少示例条件下直接输出九个数值与理由以检验感知推理能力。在10折交叉验证条件下,SSL方法的Pearson相关系数为0.84,高于Linear回归的Pearson相关系数0.60。与差分回归相比,拼接加非线性映射与上下文表示能更好刻画与特定声学量弱相关的维度,其实际意义在于支撑按参考样例微调合成与表演指导。结论的适用边界受限于单名女性声优日语朗读与同文本配对,跨说话人跨性别与自发语音尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
- 模型相关资源:https://huggingface.co/rinna/japanese-hubert-base — 暂时无法访问
- 演示资源:https://ntt-hilab-gensp.github.io/sp2026rie/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
61. 中性爱尔兰语合成句能否只改嗓音源就听出喜怒:全局与重音局部变换的叠加检验
英文题目:Voice parameter shifts and the perception of emotion in Irish synthetic utterances
标签:#心理声学实验 #韵律 #低资源 #语音 #语音合成
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音合成 | 主方法:#心理声学实验
👥 作者与机构
- Anna Maria Giovannini:机构信息未能从会议 PDF 纯文本可靠映射
- Zihan Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Ailbhe Ní Chasaide:机构信息未能从会议 PDF 纯文本可靠映射
- Christer Gobl:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为ABAIR系统特定方言男声的中性合成语句,输出为指向多种情感状态的情感着色语音,难点在于低资源爱尔兰语缺乏情感语料且需兼顾方言重音结构与情感表达的交互。逆滤波分析先对同说话人情感录音与中性合成句做手动逆滤波与声门模型参数化,提取基频与激励及波形紧张度相关参数轨迹并完成时间对齐,为变换计算提供可比参数轨道。变换建模再基于回归与重音锚点插值计算全局均匀缩放与局部重音缩放因子,将对齐后的目标与中性差异转化为可施加的缩放参数并送入重合成。信号重合成最后经声源发生器生成新声源信号并用叠加算法调整时长与共振峰,输出全局与局部及组合多类情感刺激供知觉测试。相对心理学式全局均匀变换,其关键机制差异在于显式分离全局基线漂移与重音音节局部凸显并验证叠加效应,从而可独立控制并组合不同层级的情感线索。原文未提供可核对的关键定量结果。结论的适用边界在于高激活情感区分清晰而低激活状态高度混淆且仅在单句单说话人单方言上验证,尚需跨语句与多人多方言检验。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://github.com/AERodgers/plugindraw — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
62. 结构对上了才搬:瑞典语重音与调峰定时如何进入日语声调
英文题目:L1 Swedish transfer of stress and F0 peak alignment in L2 Japanese prosody
标签:#统计分析 #语言习得 #韵律 #语音 #语音属性识别
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Natsumi Goto:机构信息未能从会议 PDF 纯文本可靠映射
- Shinichiro Ishihara:机构信息未能从会议 PDF 纯文本可靠映射
- Mitsuhiko Ota:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为固定载体句中朗读的双音节日语目标词录音,输出为跨母语组的一二音节时长差异与归一化基音峰值对齐比较,难点在于日语只有词汇音高重音而无重音,需与瑞典语兼具重音与声调的实现方式分离。方法链分为三步:先用十五个选自I-JAS的高熟悉词诱发朗读并自动切分音节以获得时长与峰值位置,再以混合效应线性模型检验母语组与重音类型的交互作用,最后按南中瑞典方言与SPOT及 immersion背景做调节检验以排除熟练度解释。与以往只做听辨判断或只描绘音高曲线的迁移研究不同,本研究将能否迁移绑定到高低调轮廓是否结构兼容,从而预测时长标记只在首音节重音时出现。在双音节词朗读任务条件下,日语母语组首末音节时长差估计指标在1-2对比为39.76,高于0-2对比的时长差估计指标8.34,而瑞典组仅在首音节重音显著拉大首末时长差并在非重音与末重音显著提前峰值。该结论适用边界在于仅覆盖双音节词朗读语体,尚未验证自发语流、长词与初始低降及知觉范畴是否同步迁移。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.homepages.ucl.ac.uk/~uclyyix/ProsodyPro/ — 链接可访问(HTTP 200)
- 第三方资源:https://ttbj.cegloc.tsukuba.ac.jp/en/index.html — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
63. 不切音节、不标声调:用一整段 F0 变化分布刻画一门语言
标签:#统计分析 #韵律 #多语言 #语音属性识别
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Khalil Iskarous:机构信息未能从会议 PDF 纯文本可靠映射
- Simon Roessig:机构信息未能从会议 PDF 纯文本可靠映射
- Doris Mücke:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以多语种连续语音的帧级F0轨迹为输入,输出刻画语言整体F0使用方式、可跨语言直接比较的整体分布签名,难点在于传统实验室音系学聚焦特定声调、重音或阻塞音扰动等离散参数,难以统一处理多源变异并形式化比较两种语言的梯度差异。方法先用Librosa在浊音段以23ms帧提取F0并求相邻帧差分得到dF0序列,以剥离绝对音高、保留动态变化作为下一步输入。再对FLEURS语料中20种语言各60分钟语音做核密度估计形成dF0概率分布,观察零点峰与多模形态差异,其分布形状经同一语言内不同12分钟子样本检验保持稳定。在FLEURS语料的跨语言评估设置下,跨语言全对比较条件的Wasserstein1距离指标计数为100对,高于单语言内复测条件的Wasserstein1距离指标计数5个。然后以最优传输度量分布间Wasserstein1距离并经1000次置换检验评估可靠性,再用最优传输方案热图刻画模态位置移动、高度增减与分裂。与已有逐现象建模机制差异在于不标注声调与重音单元,而是将全部变异压缩为单一经验分布并视为玻尔兹曼分布进行整体比较,为韵律类型学与AI分布学习对比提供统一框架。模态功能归因与合成语音对比等外推尚未验证,适用边界受限于可行性展示阶段,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
64. 时长为主、音高为辅:粤语母语者三语普通话焦点韵律的感知与产出如何各自为政又彼此牵连
标签:#心理声学实验 #语言习得 #韵律 #言语感知 #语音属性识别
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Chris Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文任务输入为问答语境诱发的普通话受控语句与时长、基频、强度三维重合成听觉刺激,输出为焦点位置判断与目标词在宽焦点、窄聚焦与话语已知状态下的声学实现,难点在于粤语母语偏好时长拉长而普通话目标模式依赖音高范围扩张与压缩,感知产出关联易被个体线索权重差异掩盖。方法链先以焦点语境辨认任务估计听者在三条六步连续统上的感知权重,其判断结果进入贝叶斯混合效应逻辑回归得到个体线索斜率;再以问答朗读任务采集目标词时长与音高强度测量并做被试内标准化,输出进入贝叶斯混合效应多项回归得到聚焦度与已知度分数;最后以模型预测相对朴素分类器的提升幅度操作化跨模态一致性,并用Kendall秩相关检验权重与一致性的关联。与以往笼统比较母语与非母语优劣不同,该链条将感知权重、产出分数与一致性分离估计,使时长主导与音高次要的跨模态转移得以在同一量纲下对照。在焦点语境辨认任务下,时长连续统的回归得分β为.492,高于基频连续统的回归得分β.220。结论适用边界限于粤语主导且英语强于普通话的香港学习者受控朗读语料,对自发语篇与其他母语背景尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
65. 声学没变好、词汇却在接管:普通话儿童声调加工从独立到权衡
标签:#心理声学实验 #韵律 #言语感知 #语音 #音频分类
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#心理声学实验
👥 作者与机构
- Jiaxin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Weng:机构信息未能从会议 PDF 纯文本可靠映射
- Yicheng Rong:机构信息未能从会议 PDF 纯文本可靠映射
- Gang Peng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理普通话学龄儿童对模糊声调的分类问题,输入为介于高平调与升调之间的八步连续语音,输出为音节的声调类别判断,难点在于声学线索模糊时需调用词库知识消解歧义。方法链首先以真词与伪词配对的声调Ganong范式操纵词汇偏向并采集分类反应,共完成160试次的听音按键辨别。其输出的试次数据进入个体指标分离步骤,分别计算词汇依赖的Cohen’s d值与声学语音加工的分类曲线斜率,以区分自下而上与自上而下的贡献。随后引入三音 oddball自适应测听得到的音高辨别阈限与校内语文成绩排名,以检验感觉敏锐度与语言熟练度的调节作用。与既有成人权衡观相比,关键机制差异是提出独立并行先于交互权衡的发展重组假说,意味着低龄时两流独立运行,高语言熟练度成熟后才形成有效的资源权衡与补偿策略。在声调Ganong任务条件下,成人组的Spearman相关指标为ρ = -.69,低于六年级组的Spearman相关指标ρ = -.42。该结论适用边界受限于普通话高平调与升调对比及所用真词与伪词配对,尚未验证其他声调对比、自然噪声与纵向个体转变的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://interactions.jacob-long.com/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.praat.org/ → https://praat.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
66. 入声舒化早期:大同晋语时长守住对立、音高与嗓音让位
标签:#心理声学实验 #语音学与音系 #言语感知 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Zhenyi Liao:机构信息未能从会议 PDF 纯文本可靠映射
- Lei Liang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究以大同晋语入声与上声合流风险为对象,输入为孤立单音节朗读与基于老年无合流发音的操控刺激,输出为多代人的声学实现差异与辨认边界,难点在于喉塞尾弱化是时长基频与嗓音多特征异步渐变且易与语速和边界效应混淆。生产采集单音节语料并用嗓音分析程序提取基频与谱倾斜及周期噪声参数加常用语音软件测量时长,其输出的归一化量度进入增长曲线分析与线性混合效应模型以检验声调与年龄交互。降维与权重估计用主成分分析压缩嗓音与基频轨迹并以逻辑回归估计时长与音高线索权重,其输出的权重排序直接决定辨认实验中时长与基频连续统的设计与边界建模。辨认验证实施强迫选择任务并用逻辑回归拟合辨认曲线与边界,前步的生产量度与权重为后步刺激步长与解释提供依据。与既往印象式描写不同,该文同时量化时长音高轮廓与周期性噪声并做代际比较,揭示线索权重再配置而非简单合流,具有早期音变阶段判断意义。原文未提供可核对的关键定量结果。结论的适用边界仅限单音节缓读的大同平城区话早期舒化阶段,尚未验证连读语流与鼻尾字调外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
67. 焦点后压缩与疑问上扬并存:昆明话如何同时标记强调与问句
英文题目:Prosodic Realization of Focus and Interrogative Intonation in Kunming Mandarin
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Siqi Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Cong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为昆明话人物加时间加动词加地点框架下的陈述与疑问句朗读语音,输出是对焦点位置与疑问语调韵律编码方式的判断,难点在于窄焦点引发的后焦点压缩与句末疑问上扬在句末位置直接冲突。首先基于情境诱导采集母语者多焦点多句类语料并在语音分析软件中手动切分音节边界,其切分结果进入下一步声学参数提取。接着提取基频时长与强度等声学参数并转换为半音后做说话人内归一化以消除个体差异,其归一化参数进入统计检验阶段。然后采用线性混合效应模型检验焦点类型与句类对声学参数的影响,从而得到焦点与疑问语调交互作用的统计证据。与重庆话无后焦点压缩的已有结论相比,该文关键机制差异是同时保留压缩与句末疑问上扬而非牺牲其一,其实测表现为压缩后句末再上扬并整体抬高疑问句音高以确保焦点信息传递。其中时长是最稳定的焦点标记而强度仅在句末位置有效且声调组合不影响焦点实现。在宽焦点语料条件下,原文未提供可核对的关键定量结果。该结论适用边界仅限于受控朗读材料而自发对话与跨方言泛化尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
68. 母语方言里音高的分量不同,听第二语言重音的方式也会不同吗
英文题目:Dialectal Variation in Korean: Sensitivity to F0 in the Discrimination of L2 Lexical Stress
标签:#心理声学实验 #韵律 #言语感知 #跨语言 #语音属性识别
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- María Teresa Martínez-García:机构信息未能从会议 PDF 纯文本可靠映射
- Sandra Schwab:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究检验庆尚与首尔韩语母语者如何利用基频感知西班牙语三音节词词汇重音,输入为重音位置不同的基线与重音线索被右移的重合成对,输出为相同与不同判断,难点在于分离基频与时长和强度的贡献并排除短语语调与末音节延长的干扰。方法链分为三步:先以西班牙语真词与伪词构建前重音、次末重音和末重音最小三元组以固定词汇材料,再用重合成独立操纵基频、时长和强度及其组合以模拟重音右移并送入后续比较,最后实施鉴别任务并以混合效应逻辑回归分析群体与模式和操纵类型的交互。与以往跨语言比较不同,该设计把方言内词汇性音高与短语性音高的功能负荷差异作为预测变量,直接检验基于线索的迁移假说。在PP>P鉴别条件下,庆尚组的判异率指标为91.67%,高于首尔组的判异率指标85.1%。在次末转末重音模式下两组对含基频操纵的敏感性趋同,说明基频优势受重音位置与边界时长交互的约束。该结论适用边界受限于无西班牙语经验的大学生被试与实验室鉴别任务,尚未验证识别任务、自然语流或学习后重加权能否保持。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
69. 丢掉的/h 留下的低音:布拉杰语声调是听得出来的范畴,还是正在磨掉的痕迹
标签:#心理声学实验 #语音学与音系 #社会语音学 #言语感知 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Neetesh Kumar Ojha:机构信息未能从会议 PDF 纯文本可靠映射
- Shakuntala Mahanta:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究检验布拉杰语新兴低调是否具有心理现实性,输入为基频受控降低的听觉刺激,输出为低调与非低调图片二选判断,难点在于区分整元音整体降低与时序位置不同的局部轮廓线索。方法链分三步:先选取12个中性调词覆盖词首、词间与词尾三种历史/h/脱落语境,再用Praat施加整段降低与前半段、后半段局部降低共12个版本形成144个刺激并以PsychoPy采集182名母语者判断,最后用二项逻辑广义线性混合模型建模,前一步的操纵刺激直接进入后一步的感知建模。与既有产出声学研究相比,该设计把历时来源作为感知预测因子,而非仅验证高低二分能否听辨,揭示了范畴与语音源头的持续联系。在相同二选感知任务条件下,教育模型的AIC指标为35413.7,低于年龄组模型的AIC指标35504.2。交互分析还显示第二半段降低在词尾与词间语境中正向效应最强,验证了尾部扰动的历时路径。该结论适用边界仅限于重音节承载的低调与中性调对立,尚未验证自然语流及声调与其他韵律边界交互的情形。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.psychopy.org/ → https://psychopy.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
70. 升调是谁的:话语语境如何左右普通话声调与语调的判断
英文题目:Discourse Context in the Perception of Mandarin Tone-Intonation Ambiguity
标签:#心理声学实验 #韵律 #言语感知 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Yining Qu:机构信息未能从会议 PDF 纯文本可靠映射
- Laurel Brehm:机构信息未能从会议 PDF 纯文本可靠映射
- Geoffrey Raymond:机构信息未能从会议 PDF 纯文本可靠映射
- Argyro Katsika:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
普通话基频同时承载字调与句调,句末上升既可解析为阳平也可解析为疑问语调,输入为男声语境句加女声目标句的短对话,输出为目标句陈述与疑问的二选判断,难点在于声学线索模糊时语用预期会系统性重塑感知。方法链分三步衔接:先以听说式与坦白式语境句建构听者与说者在事件上的知识优势差异,其输出作为话语一致性条件;再呈现末字为声调2或声调4且语调正交操纵的目标句,使同一音段只差语调;最后采集辨认率与按键延迟并用混合效应模型检验语用一致性与声调语调的交互。相对已有语义限制语境研究,该设计将语境上移至话语语用预期层面,并以一致与冲突配对直接观察错误归因,因而能分离声学歧义与预期偏差的贡献。在声调与语调正交操纵的在线辨认任务下,一致问句中声调2相对声调4的反应时指标为0.09,高于冲突问句中声调2相对声调4的反应时指标-0.09。该结论的适用边界受限于受控朗读语料与无形态标记极性问句,对自然对话韵律、其他声调组合及跨方言的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
71. 同样都带重音,波斯语三种焦点为何舌头和嘴唇动得不一样
英文题目:Prosodic Strengthening and Focus Type in Persian: an EMA Study
标签:#统计分析 #发声与构音 #韵律 #语音 #语音属性识别
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Simon Roessig:机构信息未能从会议 PDF 纯文本可靠映射
- Mortaza Taheri-Ardali:机构信息未能从会议 PDF 纯文本可靠映射
- Lena Pagel:机构信息未能从会议 PDF 纯文本可靠映射
- Doris Mücke:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文针对波斯语宽焦点、窄焦点与纠正焦点在同带音高重音时的细微发音强化差异,输入为问答语境诱发的目标句发音,输出为舌体与唇孔径运动学参数的焦点效应,难点在于三者均携带重音且运动学差异极细微易被平均化。研究先以足球观赛问答游戏诱发三类焦点并同步采集电磁发音仪与声学信号,输出带标注的目标词发音轨迹进入定位环节。接着在元音序列中基于舌体轨迹检测运动起始点、目标点与峰值速度点,提取位移、峰值速度、达峰时长与持续时间的舌体垂直水平及唇孔径量,进入建模环节。最后以贝叶斯线性混合模型估计焦点对比的后验概率,并将运动学模式映射为发音音系学的手势目标、刚度与激活区间参数。与仅比较重音有无的既有强化研究不同,本文在同一重音框架内比较突显等级,因而能揭示目标更极端与激活延长等连续调控机制,具有细化突显理论的实际意义。原文未提供可核对的关键定量结果。该结论适用边界受限于旅德波斯语母语者的伪词材料、特定重音音节与实验室朗读场景,尚未验证自发语篇、其他元音与韵律边界交互下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://escholarship.org/uc/item/83k7q53v — 链接不可用(HTTP 403) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
72. 疑问句里的重音为何变了形:人类会换声调策略,合成语音却只用陈述句一套
英文题目:Would a *human* sound like that?: Acoustic correlates of focus in human and synthetic speech
标签:#统计分析 #模型比较 #韵律 #语音 #语音合成
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音合成 | 主方法:#统计分析
👥 作者与机构
- Brooklyn Sheppard:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为标注焦点词的陈述句与极性问句微对话文本,输出为人类与合成语音焦点韵律是否一致的判定,难点在于问句高边界调与焦点重音相互作用且问句在训练数据中属长尾。首先在隔音室以44100Hz录制10名人类朗读54组微对话,并用Parler-TTS生成10个女性音色的平行合成集以控制性别与强调标注。接着经蒙特利尔强制对齐器切分词级时长并提取语速与平均及最大强度及F0勒让德前三系数,F0经插值并转为说话人归一化半音。然后以贝叶斯逻辑回归建模语音来源与句类与各声学预测因子交互,用95%可信区间是否含零判断焦点预测效应及句类差异。与已有仅看F0或仅看陈述句工作不同,该文同时检验语速强度与音高形状并跨句类比较,揭示合成语音以陈述式实现跨句类同质化的机制缺陷,对依赖合成语音沟通者意义重大。在对比人类朗读与合成语音跨陈述句与问句的评测条件下,合成语音的最大强度指标以95%可信区间不含零为聚焦正效应,高于人类语音的最大强度指标以95%可信区间包含零为无聚焦效应。该结论适用边界受限于朗读式标准北美英语、10人且性别高度偏斜样本及尚未验证感知有效性与自发对话外推,失败条件包括录音强度变异与问句韵律多样性不足。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/huggingface/parler-tts — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
73. 惊讶不在一个地方:升调看句尾,降调看重音
英文题目:Phonological Encodings of Speaker Surprise in American English Rising and Falling Nuclear Tunes
标签:#心理声学实验 #韵律 #言语感知 #语音情感识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音情感识别 | 主方法:#心理声学实验
👥 作者与机构
- Rebekah Stanhope:机构信息未能从会议 PDF 纯文本可靠映射
- Jennifer Cole:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为美式英语陈述句核词上重合成的升调与降调核调轮廓,输出为听者对说话人惊讶程度的6点评分,难点在于分离核音高重音目标与边缘调结尾目标各自贡献并判断其权重是否随调形翻转。先以同说话人升调源与降调源录音为输入,分别重合成重音目标与结尾目标各4档正交交叉的2个4x4连续统共32个轮廓,输出可控刺激集。再将该刺激集输入54名美式英语听者的在线单刺激评分环节,每试次评6点惊讶得分且试次间朗读计数以阻断跨试次比较,输出无顺序偏置的评分数据。最后将该评分数据输入贝叶斯累积链接模型,估计重音、结尾与调形的三类主效应与交互并允许调形区分辨参数,输出权重翻转的统计证据。相对以往将L+H*视为惊讶唯一标记或笼统比较终点F0的做法,本研究按核调形状分开建模,揭示了升调依赖边缘调而降调依赖重音的权重翻转机制。在在线单刺激惊讶评分任务评测条件下,重音目标的回归系数指标为1.08,高于结尾目标的回归系数指标0.82。该结论适用边界受限于无话语语境单句朗读与实验室重合成语音,尚未验证断言疑问解读与自然对话外推,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.ncbi.nlm.nih.gov/pmc/articles/PMC6124675/ → https://pmc.ncbi.nlm.nih.gov/articles/PMC6124675/ — 链接不可用(HTTP 403) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
74. 高低重音不只靠音高:德语疑问句中嗓音质量束如何分工标记突显
英文题目:Beyond F0: Voice-Quality Bundles as Prominence Cues in German
标签:#统计分析 #发声与构音 #韵律 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Christiane Ulbrich:机构信息未能从会议 PDF 纯文本可靠映射
- Jörn Krantz:机构信息未能从会议 PDF 纯文本可靠映射
- Sophie Repp:机构信息未能从会议 PDF 纯文本可靠映射
- Heiko Seeliger:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究德语信息寻求型wh问句中核重音与核后目标的高低音高如何搭配嗓音质量实现韵律突出度,输入为已标注的问句元音段声学参数,输出为高低音高条件下的嗓音质量束差异,难点在于基频之外的周期性与频谱倾斜常与音高存在生物力学耦合而难以分离功能性控制。方法链分三步:复用三个已有产出实验的490个问句并完成德语GToBI核重音类型与音节元音边界标注,为后续测量提供对齐基准;用Parselmouth按统一基频上下限提取核音节与核后重读音节的谐噪比HNR、平滑倒谱峰突出度CPPs、抖动、微颤及H1-H2与H1-A3,并按元音类型分组进入统计;以说话人、条目和性别为随机截距拟合线性混合效应模型,分别对比核重音H与L及核后高低目标的嗓音质量差异。与只看F0高度或早期单指标比较不同,本文把突出度视为多参数协同的嗓音质量束,揭示高核重音的高谐噪比与低核重音的高倒谱平衡呈分离模式。在由189个高核重音与301个低核重音组成的语料评测设置下,低核重音L条件的H1-A3指标估计值为3.88,高于高核重音H条件的H1-A3指标参照水平,该效应统计量t为2.62。该结论适用边界受限于信息寻求型wh问句特定元音与语料复用条件,尚未验证听者是否利用这些线索及跨言语行为的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
75. 语码切换遇上对比性焦点:基频是相互靠近还是切回后更夸张
英文题目:Interactions between Code-switching and Contrastive Focus in Bilingual Language Production
标签:#统计分析 #韵律 #多语言 #语音 #语音属性识别
评分:5.6/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Xiaotian Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Robert Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Kathryn Franich:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为英语为矩阵语嵌入粤语词的载体句朗读,输出为焦点词至句末的基频轮廓与双音节间音高域,实际难点在于词汇声调与语调焦点标记在同一基频通道上重叠且易与后焦点压缩混淆。方法链首先以焦点问答诱发有无对比焦点并控制矩阵语方向与重复朗读,使上一步的语料进入声学分析。接着经蒙特利尔强制对齐切分音节并以韵律分析工具提取归一化时长与基频曲线,为形态建模提供对齐输入。最后以广义加性混合效应模型刻画归一化时间上的轮廓差异并以线性混合效应模型检验音高域的语言与焦点交互,将曲线形态检验与参数检验衔接。相对已有语段层面混合与超发音研究,该工作把平行激活的同化性混合与抑制驱动的异化性极端化同时置于韵律层检验,具有将激活与抑制统一解释语调的实际意义。原文未提供可核对的关键定量结果。结论适用边界受限于粤语主导双语者的朗读式英语矩阵句,尚未验证自发语码转换、反向嵌入及其他声调组合的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://praat.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://blp.coerll.utexas.edu/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
76. 词准句偏:语速与变异线索如何改写句子层面的音色判别
标签:#心理声学实验 #可解释性 #韵律 #言语感知 #说话人验证
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#说话人验证 | 主方法:#心理声学实验
👥 作者与机构
- Tianze Xu:机构信息未能从会议 PDF 纯文本可靠映射
- Xiaoming Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Volker Dellwo:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理词与句子层面的说话人身份辨别,输入为配对语音的声学差异,输出为感知上的相同或不同说话人判断,难点在于基于基频、共振峰离散度与谐波噪声比的固定原型空间无法解释句子层同说话人项目的感知表现。先从浊音段提取音高、共振峰与谐波源谱形等特征的均值与变异并做Mel感知转换,输入为单条伪词与伪句录音,职责是输出每条语音29个变量的声学表征。再以上一步29变量的配对差值经z归一化为输入,结合252名听者对576对刺激的AX判断按多数感知身份二值化的标签,职责是构成跨层可比的监督样本,输出带标签的配对差异向量进入下一步。最后将带标签的配对差异向量输入LDA、LR、DT、XGB、RF五种可解释分类器,职责是做层内训练测试与跨层泛化测试,输出重要性排序与泛化结果以反推线索权重。与固定权重原型模型相比,关键机制差异在于权重随语言结构自适应变化,句子层更依赖语速等时间韵律线索,具有澄清单一空间失效原因的实际意义。在词与句子层内测试设置下,句子分类器的准确率为M = .80,高于词分类器的准确率为M = .66。该结论适用边界受限于中性风格普通话伪词与八字伪句及青年听者群体,尚未验证自然语义语音与跨语言泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
77. 韵律重音与句末偏好相争时,6 到 8 岁儿童如何判断焦点
英文题目:Focus Comprehension in Mandarin-speaking Children: Evidence from Sentence Verification Task
标签:#心理声学实验 #语言习得 #韵律 #语音 #口语理解
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Mengzhu Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Sasha Calhoun:机构信息未能从会议 PDF 纯文本可靠映射
- Xingtong Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理普通话儿童焦点理解任务,输入为典型主谓宾句听觉刺激与三联卡通图片,输出为儿童的是非判断与纠正句,难点在于声调语言中音高同时承载词汇与语调功能且句末宾语存在强默认焦点偏置。方法链分为三环:先录制主语重音与宾语重音两类刺激并做声学校验以确立韵律对比,其输出直接作为组间呈现材料;再实施图片命名与练习以统一词汇与回答格式,其合格者进入正式验证;最后收集听句看图验证中的纠正倾向并用广义线性混合模型检验韵律条件效应。与仅关注学龄前儿童的前人工作不同,本研究锁定六至八岁过渡期并分离韵律提示与位置偏置的权重竞争,具有揭示发展转折的实际意义。在宾语韵律验证任务条件下,遵循韵律作宾语纠正儿童的占比指标为62.5%,高于作主语纠正儿童的占比指标37.5%。该结论适用边界受限于无障碍单语普通话学龄儿童的规范主谓宾句与本任务范式,尚未验证向年长儿童预测性加工与自发对话的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
78. 手势能画出声调吗:哼唱与手指轨迹为何趋同而带词朗读却偏离
标签:#教育 #用户研究 #语言习得 #语音 #音频交互
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频交互 | 主方法:#用户研究
👥 作者与机构
- Haohan Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Yedong Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Claire Pillot-Loiseau:机构信息未能从会议 PDF 纯文本可靠映射
- Xiao Xiao:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为以第三声为锚点的双音节普通话最小对,输出为词汇复述、哼鸣与手指手势三种基频轮廓,难点在于非声调母语者受母语韵律干扰,且动态声调存在协同发音变体与声调2和声调3易混淆。方法链分三步:女性标准音录音派生出去噪归一化词汇音频、由Praat输出的纯基频音频与平滑视觉参考线并载入浏览器界面,上一步输出为下一步模仿加载直接可用的听觉与视觉目标。被试按词汇模仿、哼鸣模仿、引导描摹熟悉、不显示引导线的自由手势绘制固定顺序完成18个刺激,手势纵坐标映射为正弦音高并同步记录轨迹,再按音节兴趣区归一化采样后用广义加性混合模型比较整体高度与形状差异。与既有表演性嗓音合成相比,关键差异是用纯正弦输出替代嗓音合成并去掉专用硬件,使远程自主练习成为可能。在声调2模仿任务条件下,母语组词汇模仿的整体高度指标为-1.54,低于手势模仿的整体高度指标-0.09。结论适用边界仅限于无普通话经验的法国成人对特定混淆对的短期模仿,尚未验证长期习得或词汇整合效果。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://tone-canvas-frontend.vercel.app/ — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
79. 戴口罩反而更好:粤语声调辨别为何不受遮挡拖累
标签:#心理声学实验 #言语感知 #音视频 #语音 #语音属性识别
评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Jiaqing Zu:机构信息未能从会议 PDF 纯文本可靠映射
- Tianyu Chu:机构信息未能从会议 PDF 纯文本可靠映射
- William Choi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理粤语词汇声调在外科口罩遮挡与环境噪声下的可辨别性问题,输入为同音节/fu/六声调的成对语音与同步人脸视频,输出为相同或不同的二选判断,难点在于声调仅靠低频F0细微差异区分且易被听觉衰减与视听整合负荷掩盖。方法链分三步推进:由男女母语者分别在戴与不戴外科口罩下自然录制孤立单音节刺激,其输出进入跨说话人AX辨别范式以抑制纯声学比对;该范式的试次准确率进入信号检测论转换得到敏感度指标d’以控制反应偏向;d’进入贝叶斯双因素方差分析并辅以Praat声学检验验证时长与F0是否随口罩变化。与强调抽象范畴化的识别任务不同,本研究以辨别任务直接检验听觉敏感性,并提出视觉缺失减少跨模态认知负荷从而释放音高注意的机制解释,具有澄清口罩影响来源的实际意义。在安静与52 dB SPL校园噪声混合的AX辨别任务条件下,戴口罩条件的敏感度指标d’高于不戴口罩条件的敏感度指标d’,贝叶斯事后比较的贝叶斯因子BF10为67.37。结论适用边界受限于外科口罩、单音节孤立词与实验室辨别任务,尚未验证句子理解、其他口罩类型及儿童或听损人群的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://praat.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
80. 下颌开口峰速度对准元音起点,强弱分配却随母语走:普通话口音英语的两种节律
标签:#统计分析 #发声与构音 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Plinio Barbosa:机构信息未能从会议 PDF 纯文本可靠映射
- Gustavo Silveira:机构信息未能从会议 PDF 纯文本可靠映射
- Donna Erickson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为9名普通话背景英语使用者朗读目标句I saw five bright highlights in the sky tonight的声学与电磁构音图同步信号,输出为音步内下颌位移分布类型与声学元音起点相对时序的判定,难点在于分离生物力学普遍约束与母语韵律迁移对第二语言重音实现的影响。方法链分四步:先用三维电磁构音仪同步采集下门齿垂直轨迹并以咬合板校正头动与咬合平面,再提取各音节最大开口量并计算five/bright、high/lights、sky/night三对位移比值以区分强弱与弱强音步,接着以第二共振峰跃变为基准手工标注声学元音起点,最后求起点与加速度极小值、速度极小值、位移极小值三地标的时间差分布并做跨说话人非参数检验。与已有美国英语结果的关键机制差异是同时检验分布形态与对齐锚点,发现分布可随第二语言熟练度漂移而速度极小值锚点保持稳定,表明对齐具普遍性而分布具语言特异性。熟练度分层显示仅5级说话人比值中位数最高且几乎全大于1呈典型强弱式,低水平者中位数最低且偏向弱强式,表明边缘强化迁移随熟练度减弱。在50个token朗读语料评测条件下,跨说话人位移比Kruskal-Wallis检验的p值指标为p<0.02,低于显著性判定阈值的p值指标0.05。该结论适用边界受限于朗读体单句与/ɑɪ/受控条件,/h/起始的high与复辅音/br/起始的bright已出现系统偏离尚未验证外推。原文未披露训练、推理或部署成本
🔗 开源资源
- 代码相关资源:https://github.com/pabarbosa/prosody-scripts — 链接可访问(HTTP 200)
- 代码相关资源:https://github.com/silveira7/PointDistancesFromAVO — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
81. 低平 F0 是重音还是边界调:美国英语低调目标的线索权重
标签:#心理声学实验 #韵律 #言语感知 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Alejna Brugos:机构信息未能从会议 PDF 纯文本可靠映射
- Jonathan Barnes:机构信息未能从会议 PDF 纯文本可靠映射
- Chris Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Stefanie Shattuck-Hufnagel:机构信息未能从会议 PDF 纯文本可靠映射
- Nanette Veilleux:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为重合成英文句Ramona didn’t analyze the nomads,输出是将目标词nomads上低平F0判为核低重音L*还是去重音后L-短语音的二选一,难点在于目标段F0同为低平使高重音峰高线索失效而需依赖远端与局部弱线索。方法链先以强弱基拼接控制片段线索,将中性开头与强弱两种the nomads尾部拼接而开头保持同一中间形态以隔离早期干扰。接着用Praat中PSOLA正交构建5级-e nom-时长连续统与5级Ramona后远端下落斜率F0连续统并重合成150种核心刺激。最后经含多说话人自然例的训练加162试次二选一感知任务,并以贝叶斯混合逻辑回归估计三线索权重及个体斜率与相关。与聚焦高重音峰高突显的既有工作不同,该设计把远端语调形态作为自变量并分离时长与音质,使低调目标的可感知性可被分解检验。在32名有效听者5172试次的感知任务条件下,时长步进的回归系数β指标为1.22,高于远端F0步进的回归系数β指标的.259。结论适用边界仅限单句单男声的受控低调矛盾语境且个体在局部与远端策略上分化明显,自然多线索共变与跨说话人外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
82. 声调中和下温州话高低调域为何不同时消失:位置、轮廓与年龄的线索重组
英文题目:Register Realization under Tonic Neutralization in Wenzhounese
标签:#统计分析 #韵律 #社会语音学 #语音 #语音属性识别
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Ziru Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Jeremy Steffman:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为温州话双音节变调中发生声调归并但保持重读的最小对,输出是高低发声态在词首与词中位置是否仍可区分的判断,难点在于基频中和后多线索可能重组而非同步消失。处理链分三步:先在Praat中标注辅音与元音边界并用VoiceSauce提取F0与频谱倾斜等参数,该参数时程进入下一步建模;再对时变曲线拟合含年龄与发声态平滑项的广义加性混合模型并用似然比检验比较含与不含发声态的模型,其显著性结果决定线索有效性;最后对嗓音起始时间与闭塞时长拟合线性混合效应模型并做边际均值比较,以检验辅音计时线索。与既有温州话研究相比,该工作把嗓音质量细分为H1相关倾斜与倒谱峰突出度并追踪其在元音内的时程,从而区分辅音源与元音固有气嗓。在词首双音节变调语料条件下,HM声调对H1∗–H2∗的ΔAIC指标为38.0,高于MLM声调对的ΔAIC指标-6.2。结论适用边界受限于瑞安籍两年龄组、双音节重音中和及唇塞音加低元音语料,尚未验证短语层与自然语流中的泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://rvlenth.github.io/emmeans/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
83. 只留韵律能听出精神分裂症谱系障碍吗:人类感知与机器分类的平行验证
英文题目:Speech Prosody in Schizophrenia Spectrum Disorders: Perceptual Evaluation and Machine Classification
标签:#语音生物标志物 #人类参与评测 #韵律 #语音 #病理语音评估
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#人类参与评测
👥 作者与机构
- Anna Seo Gyeong Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Ryan Partlan:机构信息未能从会议 PDF 纯文本可靠映射
- Alex Richardson:机构信息未能从会议 PDF 纯文本可靠映射
- Sandy Yin:机构信息未能从会议 PDF 纯文本可靠映射
- Nourhan Zalat:机构信息未能从会议 PDF 纯文本可靠映射
- Katharina Brosch:机构信息未能从会议 PDF 纯文本可靠映射
- Amir Nikzad:机构信息未能从会议 PDF 纯文本可靠映射
- Simran Bhola:机构信息未能从会议 PDF 纯文本可靠映射
- Khatiya Moon:机构信息未能从会议 PDF 纯文本可靠映射
- Sunghye Cho:机构信息未能从会议 PDF 纯文本可靠映射
- Sunny X. Tang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为自发临床访谈的滤波语音,输出为精神分裂症谱系障碍与健康对照的二分类判断,难点在于去除可懂语义后仅靠音高轮廓与节奏等超音段线索仍需可辨。方法链分三步:先以基于基频估计的自适应低通滤波去除可懂度并保留韵律轮廓与节奏,再组织33名不同资历评分者对每人首尾15秒片段做4级似然判断并按均值聚合,其次在251人样本上抽取声学与停顿特征训练逻辑回归等分类器并做被试级划分评测。相对混用语义与韵律的完整语音分类,该机制差异在于强制信息瓶颈在韵律层,从而同时检验人类感知显著性与机器可计算性,为语言无关筛查提供依据。在人类感知与机器分类对比任务下,人类聚合评分的AUC为0.820,高于Logistic Regression的AUC 0.805。人机均达约八成准确率且临床经验与评分准确率无显著关联,提示可辨性更多依赖一般社会感知而非专科训练。该结论适用边界受限于英语单中心采集的短片段滤波语音,尚未验证跨语言筛查与重症程度追踪的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
84. 粤语者为何更准分辨英语重音:把重音听成声调的两类同化解释
标签:#心理声学实验 #韵律 #跨语言 #语音 #音频分类
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#心理声学实验
👥 作者与机构
- William Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Cheuk Lun Isaac Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Doris Yu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理英语双音节词首重与尾重对立的听辨任务,输入为不同说话人录制的无元音弱化最小重音对立体,输出为相同或相异判断,难点在于母语无词重音的粤语者反而超越母语者。方法链分三步推进:先由美式英语男女声录制4组重音对立刺激以控制说话人线索,再以跨说话人AX范式对30名粤语者与30名英语者施测96试次辨别并计算敏感度,前者输出辨别力进入组间回归比较。接着仅对粤语组施测音节级粤语声调匹配与相似度评级,输出声调选择分布进入多项回归与事后比较,以判定同化类型为TC对还是SC或CG对。与强调基频线索注意的声学注意语境假说不同,本文将优势机制表述为双音节重音对立被重编码为声调序列对立,因而具有可直接检验的同化预测与实际意义。在跨说话人AX辨别任务下,粤语组的d’指标为4.20,高于英语组的d’指标的1.96。该结论适用边界受限于无元音弱化双音节词与实验室耳机听辨条件,尚未验证操纵声调可及性或线索权重时的因果效应。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
85. 他加禄语句子位置是否以同样方式触发元音低化和喉塞删除
英文题目:The realization of prosodically-conditioned segmental alternations in Tagalog
标签:#统计分析 #语音学与音系 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Alessa Farinella:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以他加禄语动词首陈述句中处于动词、施事与受事位置的词尾元音为输入,以元音高度与喉化程度的连续声学度量为输出,难点在于既有描写多凭听辨印象且对声门塞音删除与后元音低化所依韵律域界定含混不清。方法链先经人工切分2170个元音并以VoiceSauce提取三点平均F1与H1-H2及HNR,其输出经说话人内对数均值与z-score归一化以消除个体量程差异,随后进入线性混合效应模型检验句子位置与底层形式的交互影响。相对既有基于正字法语料与范畴听辨编码的做法,该链以F1联合H1-H2与HNR的分布刻画不完全中和,使喉化元音与常态元音的嗓音质量差异可被连续区分并检验两过程是否聚类。在动词首陈述句语料条件下,底层声门塞音在受事位置的指标H1-H2效应为β = -3.49,低于施事位置的指标H1-H2效应β = -0.86。与之对照,后元音F1未随句子位置系统性低化,仅低元音在受事位置相对施事显著降低,说明两交替并不受同一域制约且低化具可变性。该结论适用边界仅限所测动词首语序陈述句与4名说话人初步子集,语调短语边界、语态与形态结构的调节作用尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://rvlenth.github.io/emmeans/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
86. 手势顶点为何在 Babanki 音节里更早:双语者音节内重音时序的跟随证据
英文题目:Variation in the Fine Timing of Co-Speech Gestures Among Bilingual Speakers
标签:#统计分析 #韵律 #多语言 #音视频理解
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音视频理解 | 主方法:#统计分析
👥 作者与机构
- Kathryn Franich:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为巴班基语—英语双语者自然对话音视频,输出为手势顶点相对音节内位置的时滞测量,难点在于语言间突显时间实现差异易与说话人个体、语速及话语信息状态混杂,需在亚音节精度分离辅音强调与元音延长。方法链分三步衔接:先以半结构访谈分语言采集对话并经母语转写与FAVE-Align词与音素级强制对齐获得音段边界,再由人工标注手势抚触相位并以MediaPipe无标记动捕提取抚触内腕部最低速度点作为顶点以承接相位标注,最后计算顶点至元音起始与笔触起始至词首时滞并以线性混合效应模型检验语言与话语突显效应。相对已有重音节层面吸引研究,关键机制差异是检验音节首辅音与核心元音时长分布对手势顶点位置的细粒度牵引,并将其解释为突显时长调制手势的物理实现。在词与音素强制对齐评测条件下,人工校对前对齐准确率指标从60%升至70%。巴班基语突显主要落在音节首辅音而顶点相对元音起始更早,英语辅音与元音均延长而顶点与笔触起始更晚,语言主效应与音段位置交互显著。该结论适用边界受限于仅检验单音节词首提及与复提及对比,尚未验证对比焦点等多音节与更强突显的外推。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
87. 同形“买嘛”如何分义:天津话疑问与否定共用形式下的韵律分工
英文题目:Prosodic Disambiguation of Wh-Words: In the Case of “ma” in Tianjin Mandarin
标签:#人类参与评测 #韵律 #言语感知 #口语理解
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#人类参与评测
👥 作者与机构
- Tianqi Geng:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Cong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究天津话嘛在字面串相同条件下疑问与否定解读的消歧,输入为无标记句张三买嘛及句法或语境变体,输出为功能类别判断与词层句层声学实现差异,难点在于声调干扰下韵律是否独立承担消歧且策略随标记有无而变。方法链分三步:先以目标组与疑问否定对照组交叉语境句法韵律线索收集四选判断与反应时以检验歧义,其输出的混淆分布进入下一步;再以语境诱导的目标集与句法标记对照集的实验室朗读录音做分层标注与归一化以提取时长强度基频,其输出的声学参数进入下一步;最后比较词层与句层突显分配以归纳编码策略。与已有跨语言陈述疑问韵律研究相比,关键机制差异在于揭示否定在无句法标记时将突显从嘛转移至主语或动词而疑问始终强化嘛本身,具有为多功能词消歧建模的意义。在感知判断任务条件下,Question组选择wh的优势比指标为53.4,高于Target组选择wh的优势比指标20.9。结论适用边界在于仅覆盖天津话单音节嘛与实验室朗读语料,尚未验证自发对话与跨方言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://firebase.google.com/docs — 链接可访问(HTTP 200)
- 第三方资源:https://www.praat.org/ → https://praat.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
88. 焦点里谁在用力:单人层面看韵律与手势如何分工做超清晰化
标签:#统计分析 #韵律 #音视频 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Alina Gregori:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为德语自发对话中背景与焦点语段及伴随的手势与基频轨迹,输出为每位说话人在焦点中是否增强发音。实际难点在于韵律斜率与视听对齐时间距离量纲不同且个体差异大,群体平均易掩盖互补偏好。方法分三步:先按LISA、M3D与GToBI标注焦点域、手势apex与音高重音并组成apex-accent对,上一步的配对结果直接进入下一步计算。再分别计算下降重音H+L*的F0斜率与apex-accent绝对时间距离,得到两种策略的原始量。最后按被试聚合背景与焦点均值并经z变换比较强弱,与以往只报告群体平均不同,该文把单模态韵律与多模态对齐置于同一可比尺度,揭示一弱一强互补的实际意义。在SaGA语料条件下,仅用一种策略的人数指标为15人,高于同时使用两种策略的人数指标9人。结论的适用边界仅限德语叙述性对话中共现下降重音与手势的样本,未区分对比焦点与信息焦点细节且未纳入时长强度与其他重音类型与跨语言验证;原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://archive.mpi.nl/tla/elan — 链接可访问(HTTP 200)
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
89. 韵律测不准不是孩子问题:一个 iPad 测验能否分开年龄成长与自闭症困难
标签:#心理测量 #韵律 #语音 #病理语音评估
评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#心理测量
👥 作者与机构
- Kara Hawthorne:机构信息未能从会议 PDF 纯文本可靠映射
- Nahar Albudoor:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究面向儿童韵律临床评估缺乏可用工具的问题,输入为英语儿童对预录韵律刺激的听辨二选一反应与跟读或语境产出话语,输出为各子测验正确率随年龄与诊断分组的变化规律及工具可用性判断,难点在于远程施测下评分标准模糊且缺乏年龄常模导致个体结果难以解读。方法链分三步:先经Zoom远程以Qualtrics改编施测Prosody Assessment的听说子测验,再以逻辑混合效应回归分离年龄与诊断效应并控制社会经济地位与双语状态且纳入被试与条目随机截距,最后由作者从内容效度、评分者一致性、文化偏倚与标准化进行专家评价,前一步的条目水平反应逐级进入下一步建模与评价。与操作繁琐而临床采用有限的Profiling Elements of Prosody in Speech-Communication相比,机制差异在于同时覆盖情感、语用、语法功能与韵律形式并提供可解读的发展性常模与自闭症分域弱项定位,实际意义在于提升研究与临床直接可用性。在远程Zoom施测的对比性重音接受任务评测设置下,典型发育组的正确率优势比为1.87,高于自闭症组的正确率优势比1.69。自闭症组在情感与语用韵律任务上正确率更低而在语法任务上与典型发育组相当,表明工具能定位分域强弱项。结论适用边界受限于英语学龄儿童的结构化诱发任务与高社会经济地位样本,不支持外推到自然对话韵律或非英语文化情境。原文未披露训练、推理或部署成本
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
90. 汉字有调、日语有型:新日语借词普通话声调为何两边都不跟
英文题目:Tonal adaptation of recent Japanese phonemic loanwords in Mandarin Chinese
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Jueyu Hou:机构信息未能从会议 PDF 纯文本可靠映射
- Tim Laméris:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究考察无日语学习经历的北方普通话母语者如何为汉字书写的近期日语音位借词指定声调,输入为6个二音节加6个三音节词在孤立、默认载体句和语境句中的朗读,输出为各词是否遵循汉字本调的二分判断及偏离者的连续F0轮廓类型,难点在于汉字本调、日语高低重音与普通话默认节律可能三向冲突且易被词汇熟悉度混淆。方法链分三步:先用词汇熟悉度二选一判断筛选已知状态并采集三语块朗读,再由两名母语人听辨二分为字符一致与其他类并对其他类做层级聚类提炼偏好轮廓,前步的分类结果与F0曲线分别进入后步的广义线性混合模型与广义加性混合模型检验字符调型、熟悉度与语境效应。相对已有英语借词研究强调重音对应声调或高频声调默认,该工作同时检验字符路径与语源路径并允许非典型实现,从而能识别既非汉字调也非日语调的自创默认轮廓。在孤立、默认载体句和语境句三语块朗读任务下,三音节其他发音的集中度指标为75.9%,高于二音节其他发音的集中度指标58.7%。2675个可用Token中57%被判为其他发音,且模型显示说话人与词条随机效应解释了大部分变异而固定效应贡献有限。该结论适用边界受限于19-31岁北方官话青年朗读语体,尚未验证自发对话与跨方言外推,社会语音解释亦未做因果检验。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
91. 焦点不都靠抬高音调:南宁普通话在句首焦点缺压缩、句尾焦点保留压缩
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Xinzi Hou:机构信息未能从会议 PDF 纯文本可靠映射
- Eleanor Chodroff:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为疑问词问答诱发的宽焦点、句首窄焦点与句末窄焦点话语,输出为主语与宾语位置基频最小值、最大值与极差的焦点效应判定,难点在于声调与语调纠缠且南宁粤语接触影响难以分离。先以预录制问句与脚本化主谓宾目标句为输入诱发自然产出并经强制对齐切分,输出音节级浊音区间,再将该浊音区间输入两遍自相关基频提取与说话人归一化对数T值转换,输出连续调值,最后将该连续调值输入以焦点条件为核心固定效应并控制声调、前接辅音与年龄的线性混合效应模型,输出焦点显著性检验结果。相对已有2至6人描写性研究,本工作引入南宁普通话与标准普通话直接比较及声调交互控制,使粤语式无后焦点压缩的接触假设可被证伪。在比较句末焦点与宽焦点的主语位置条件下,标准普通话主语f0指标在极差维度上的回归效应值为–0.25,低于主语f0指标在最大值维度上的回归效应值–0.15。本结论适用边界受限于朗读式简单句的基频维度,尚未验证自发语、时长强度线索及南宁粤语本体的同期平行效应。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
92. 句首算话语、句尾只听声音:中国英语学习者韵律加工的位置分离
英文题目:Position-Dependent Integration of Pitch Accent and Focus in Chinese EFL Learners: An ERP Study
标签:#心理声学实验 #语言习得 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Xiaoli Ji:机构信息未能从会议 PDF 纯文本可靠映射
- Can Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhan Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Aijun Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理在线口语理解中音高重音与信息焦点的整合问题,输入为疑问词问句引导的被动句听觉对话,输出为自然度判断行为反应与锁定首名词短语与次名词短语起点的事件相关电位,难点在于分离声学显著性驱动的持续正波与话语层焦点表征维持的负波。在120组四条件对话语料下,先由疑问词问句设定焦点落在首名词或次名词并交叉重音有无,其输出进入美国英语男声录音与基频校验以固定声学实现。再将校验后刺激分块呈现并做32导脑电记录与自然度判断,从而分离位置依赖的重音与焦点效应。相比母语者两阶段短时正波与稳健冗余惩罚,本工作呈现时程拉长的平台样正波与仅限句首的焦点负波,意义在于揭示学习者依赖反应性声学策略而非预测性话语评估的部分习得接口。在次名词短语200-1200毫秒听觉对话评测条件下,缺失重音条件在中线电极的主效应指标为F(1,31)=12.250,高于该条件在双侧电极的主效应指标的F(1,31)=10.260。结论适用边界受限于通过大学英语六级且词汇量测试超50分的中等水平中国学习者被动句听理解的句首整合优势,尚未验证高水平者、自发对话或句法编码焦点的外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
93. 把精神科听诊变成可量化的韵律测量:一个嵌入问诊的说话人-轮次-韵律工具
英文题目:Computational Analysis of Prosody for Clinical Psychiatry
标签:#信号处理 #统计分析 #韵律 #语音 #病理语音评估
评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:系统技术报告 | 主任务:#病理语音评估 | 主方法:#信号处理
👥 作者与机构
- Jeremiah Joyce:机构信息未能从会议 PDF 纯文本可靠映射
- Erik Clemens:机构信息未能从会议 PDF 纯文本可靠映射
- Josh Boesche:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为医患临床对话的长时WAV录音,输出为分说话人、带轮次与停顿结构、词级时间戳及韵律参数的JSON标注与可复核可视化,难点在于交互不可打断、重叠与角色混淆普遍,且需多语言部署与纵向可比。流水线先以说话人分离标注切分谁在何时说话,并基于200ms静音阈值构建停顿间单元、轮次、暂停、间隙与轮内轮间重叠,再以语音识别转写并强制对齐词级时间戳以承接韵律计算,随后以de Jong和Wempe声学法检测音节核得到构音速率与语速变异性等指标,最后经人工同步视听复核修正后归档。与直接输入音频或文本预测疾病的端到端黑箱不同,该方法坚持语言学可解释的显式预处理与透明时序结构,使测量可追溯、可修正并服务于精神状态检查中的言语评估。在CASLIM个体内纵向评测任务下,发言时长条件的关联指标为β=0.54,高于构音速率条件的关联指标的β=0.24。该工具同时支持英语、西班牙语与加泰罗尼亚语的自动语言检测与声学音节法统一分析,以保证跨语言比较的一致性。结论的适用边界受限于成人住院躁狂缓解对照,Barcelona躁郁区分、门诊随访与谵妄环境传感尚未验证。原文未披露训练、推理或部署成本
🔗 开源资源
- 第三方资源:https://aclanthology.org/L06-1082/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
94. 赢球和输球听得出来吗:用赛后采访捕捉自发情感的语音数据集
英文题目:iMiGUE-Speech: A Spontaneous Speech Dataset for Affective Analysis
标签:#数据集 #数据集构建 #韵律 #语音 #语音情感识别
评分:5.5/10 | 创新 1.0/2 | 技术严谨 0.9/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:数据集与基准 | 主任务:#语音情感识别 | 主方法:#数据集构建
👥 作者与机构
- Sofoklis Kakouros:机构信息未能从会议 PDF 纯文本可靠映射
- Fang Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyu Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为网球大满贯赛后发布会长视频,输出为按运动员与记者分离的短语音片段、转写文本及词级对齐与情感标签,难点在于多人轮替、重叠说话、背景噪声与自发情感标签缺失并存。处理链先抽取音轨并标准化为单通道PCM,再以说话人分离标注区分说话轮次并结合重叠检测与语音活动检测剔除非目标与重叠干扰,得到的纯净轮次送入Whisper Large生成英文转写并汇总为多层标注。转写与原始音频再送入蒙特利尔强制对齐器产生词级与音素级时间边界,最后按累计说话时长最长者为运动员的启发式完成角色映射与片段切分,形成可与微手势标注同步配对的语料。与表演式语料的关键机制差异在于情感来自真实比赛胜负而非剧本诱发,因而保留的韵律与时间边界能反映受社会规范与压力塑造的自然情感编码,具有多模态配对研究的实际意义。在iMiGUE-Speech语料的胜负分组基准任务下,获胜组的Valence得分为0.5361,高于失利组的Valence得分0.5025。会话层聚合还显示失利组主导情绪为悲伤的比例为85.2%,获胜组主导情绪为悲伤的比例为64.7%且快乐与中性占比抬升,呈现结果驱动的情感分化。结论的适用边界仅限于英语赛后采访的胜负二分代理情感,尚未验证跨语言、跨运动与采访内时变预测的外推能力,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
95. 段内快慢与一次能说多长分开受控:安大略少数法语的速率与语段长度解读
英文题目:Language Use index and Articulation rate variation in a minority Canadian French
标签:#统计分析 #韵律 #社会语音学 #语音 #语音属性识别
评分:5.5/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Svetlana Kaminskaia:机构信息未能从会议 PDF 纯文本可靠映射
- Luke Hagar:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为加拿大安大略西南部Windsor地区12位法语发音人的文本朗读与自发会话录音,输出为发音速率与语间停顿区间长度的变异规律,难点在于语言接触强度、语体、年龄、性别与语句长度多因素交织且样本仅12人、分组亦非完全正交。先输入原始录音与转写,以Praat结合EasyAlign初标并人工校对音节边界与80毫秒以上静音停顿,职责是切分语间停顿区间并测量每段时长与音节数,输出干净的区间级数据集。再将上一步输出的区间发音速率平方根作为因变量,职责是以说话人为随机截距的线性混合效应模型检验语言使用指数、语体、年龄、性别与区间音节数的固定效应及其交互,输出各因素估计值与显著性。最后将上一步已验证显著的区间音节数取对数作为新的因变量,职责是追踪建模判断语句长度是否中介年龄效应,输出区间长度自身的变异规律。与以往按地区法语人口比例衡量接触的研究不同,本文在说话人个体层面使用0到2的语言使用指数区分无限制、半限制与受限使用者,因而能分离个体日常语言实践的影响。在Windsor语料的朗读与自发会话场景下,语间停顿区间长度的显著性指标p值为p < .001,低于性别条件的显著性指标p值p = .29。结果显示自发会话快于朗读、年龄增长降低朗读速率而语言使用对发音速率无显著影响,但无限制使用者产生更长停顿区间,该结论适用边界仅限于该地区成年双语接触变体,尚不能外推到欧洲法语、阿卡迪亚法语或儿童与二语习得场景。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.fon.hum.uva.nl/praat/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
96. 低调的疑问与高调的起点:通古贝埃维语疑问韵律如何同时容纳频率码与松弛韵律
英文题目:Tongugbe Ewe yes-no question prosody: revisiting the frequency code and lax prosody
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Man Yan Priscilla Lam:机构信息未能从会议 PDF 纯文本可靠映射
- Yiya Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理通古贝埃维语一般疑问句韵律标记问题,输入为词汇内容可比的肯定陈述与疑问句语音,输出为局部末韵母与全局整句声学参数差异,难点在于声调语言中词调与语调纠缠且松弛韵律与频率码预测方向相反。方法链分三步:先以配对图片游戏诱发肯定、否定与疑问三类目标句并录制26位Mepe镇母语者语音,其输出进入词与音素级切分及每5ms基频与频谱特征提取,再进入线性混合效应与广义加性混合模型检验句类与末音节声调交互。切分输出直接作为逐帧声学测量与平滑建模的对齐基础,模型比较则以前一阶段的归一化轮廓为输入以分离局部与全局效应。与仅报告末尾降调或无系统变调域提升的既往描写相比,本研究同时建模末韵母精细轮廓与整句起点、均值与范围并检验声调条件依赖,具有区分混合韵律的实际意义。在26位母语者2567句可用话语的语料条件下,疑问句全局平均强度指标的回归效应为0.42,低于疑问句全局基频范围指标的回归效应0.62所对应的偏离强度。该结论适用边界限于加纳Mepe镇通古贝变体产出层面,尚未验证跨方言感知权重与语义功能泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://github.com/kirbyj/praatsauce — 链接可访问(HTTP 200)
- 第三方资源:https://praat.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
97. 声调语言里靠什么赢得演讲:普通话演讲比赛中的共振峰与音高策略
英文题目:Speaking to Win: How Prosodic Features Predict Success in Mandarin Public Speaking Competitions
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Dongmei Lin:机构信息未能从会议 PDF 纯文本可靠映射
- Oliver Niebuhr:机构信息未能从会议 PDF 纯文本可靠映射
- Rongjie Shi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为I’m a Speaker第一季与第二季48位选手演讲音频中靠近开头与结尾的30秒片段,输出为Top6、Top12、Top24、Top36排名名次,难点在于普通话基频兼具声调词汇功能与副语言功能且电视排名混杂内容人气与后期制作干扰。首先从每人演讲首尾附近截取等长30秒片段并避开掌声音乐覆盖区,经LALALA.AI去残留背景音乐后送入声学分析。然后用ProsodyPro、VocalToolkit及De Jong与Wempe音节核脚本提取基频均值与基频范围、第一至第三共振峰均值、停顿个数与平均停顿时长、净音节语速与平均均方根响度九维参数。接着以排名数值为因变量拟合广义线性混合模型,先做全样本模型再按性别与首尾位置分组建模,季节与性别作为随机效应,变换后参数作为固定效应预测排名。与英语德语强调基频均值响度与较快语速不同,本研究关键机制差异在于发现普通话成功标记更依赖共振峰谱特征与性别分化的音高动态及首段印象,具有跨语言普遍性与声调制约并存的实际意义。在I’m a Speaker两季演讲语料条件下,女性组mean f0指标的P-value为0.33,低于起始段mean f0指标的P-value 0.57。该结论适用边界受限于该节目两季电视演讲首段印象与分组建模条件,因果方向尚未验证且尾段无显著预测力,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
98. 同一个 53 调形,为何低水平粤语者把普通话一声听宽了
英文题目:Joint Effects of Native Phonological Rule and L2 Proficiency on Cross-language Tone Perception
标签:#心理声学实验 #语音学与音系 #言语感知 #跨语言 #音频分类
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#音频分类 | 主方法:#心理声学实验
👥 作者与机构
- Min Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Siyi Lian:机构信息未能从会议 PDF 纯文本可靠映射
- Wenting Mao:机构信息未能从会议 PDF 纯文本可靠映射
- Yingyang Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入连续基频变化,输出对普通话高平调/55/与高降调/51/的离散范畴归属,难点在于同一
\[53\]轮廓在粤语是/55/的自由变体而在普通话是/51/在/51/前的条件变体,低层听觉相似无法预测其跨语言干扰方向。方法链分三步:先以PSOLA合成从/55/到/51/的十三步连续统并嵌入典型
\[53\]中点,为知觉提供可控输入;再对低水平粤语组、高水平粤语组与普通话对照组实施T1-T4标识实验,并以逻辑回归拟合类别边界位置与宽度;随后用相同连续统实施两步差异的AX辨别实验,并以Haskins公式由标识概率计算预测辨别率以检验范畴化程度。与烟台方言变体直接对应L2范畴的研究不同,本文检验无直接对应关系的次音位变体能否充当知觉锚点,并引入普通话熟练度作为调节变量,实际意义在于区分听觉相似与音系规则的作用。标识结果显示低水平粤语组/55/范畴扩大且边界左移变宽、范畴化程度降低,而高水平组与普通话对照组模式相近,表明母语规则效应随L2熟练度减弱。在普通话/55/-/51/连续统AX辨别任务下,HP组的Pbc辨别得分为0.806,高于NT组的Pbc辨别得分0.788。结论适用边界仅限受控单音节实验室知觉,对自然连读、其他声调对及非粤语背景尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
99. “You Good?”靠什么区分陈述与疑问:F0 峰位置与眉毛峰时序的协同证据
标签:#统计分析 #韵律 #音视频 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Kendall Lowe:机构信息未能从会议 PDF 纯文本可靠映射
- Yoonjeong Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Natasha Abner:机构信息未能从会议 PDF 纯文本可靠映射
- Jelena Krivokapić:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为非裔美国英语使用者朗读的陈述与疑问句目标短语音视频,输出为句类标签的韵律与手势区分线索,难点在于疑问句终调多变且高音调重音加低短语调和低边界调轮廓可兼用于陈述,单靠基频轮廓形状难以区分。方法链分三步:先用十二组剧本对话诱发多义短语你好及单义对照的陈述与疑问变体并由同方言合作者引导朗读,其输出的录制视频直接进入下一步特征提取;再用Praat标记目标短语基频峰位置并用OpenFace追踪左侧眉弓垂直位移后经标定手势起始与极值,其输出的峰时间戳进入下一步关系建模;最后计算基频峰与最近眉峰时距并做逻辑回归检验句类与多义性效应。与已有英语研究的关键机制差异在于发现疑问句眉上扬更少而眉峰更早,提示手势标记具方言特异性而非疑问普遍上扬,具有矫正通用疑问手势假设的实际意义。在375段对话的基频峰位置逻辑回归评测任务下,句子类型效应的回归系数指标为5.25,高于多义性效应的回归系数指标0.74。结论适用边界仅限于实验室朗读的双音节浊音短语,尚未验证自发对话、皱眉类型区分及跨方言泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
100. 元音开口大小与声调高低如何共同改变嗓音的稳定程度
英文题目:Mandarin vowels: Intrinsic properties and interaction with tone
标签:#统计分析 #发声与构音 #韵律 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Lorna McGregor-Smith:机构信息未能从会议 PDF 纯文本可靠映射
- Irena Yanushevskaya:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为普通话单元音与声调组合的开音节单音节词自然产出,输出是嗓音声学参数随元音与声调的变化规律,难点在于声源与滤波器经共享肌肉与气压耦合,使抖动与微振等微扰测量同时受元音构型与声调喉部紧张度污染。诱发记录负责获取可比样本,将目标词分别嵌入载体句与单字引用形朗读并手工切分完整区间与稳态段,其切分结果进入声学提取。声学提取负责刻画滤波与声源特性,用Praat提取基频、抖动、微振、谐噪比与平滑倒谱峰凸显度及第一第二共振峰,并对基频与倒谱峰做时间归一化轮廓,其参数进入统计建模。统计建模负责分离效应,以元音、声调及其交互为固定效应、被试与重复为随机截距拟合线性混合效应模型。与仅考察单一声调延长元音且未控制说话人变异的已有工作相比,关键机制差异是将声调作为系统性实验因子并检验元音与声调交互,实际意义在于能识别紧元音对声调不稳定性的缓冲作用。原文未提供可核对的关键定量结果。结论的适用边界受限于成年女性大学生的实验室朗读单音节词,对男性、连续语流与病理嗓音的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://praat.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
101. 语速变慢就更清楚吗:还原程度不只由全局时长决定
英文题目:Speech Reduction and Perceived Clarity: Just a Matter of Rate?
标签:#主观评测 #韵律 #言语感知 #语音 #语音可懂度评估
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#主观评测
👥 作者与机构
- Hansjörg Mixdorff:机构信息未能从会议 PDF 纯文本可靠映射
- Hartmut Pfitzinger:机构信息未能从会议 PDF 纯文本可靠映射
- Noam Amir:机构信息未能从会议 PDF 纯文本可靠映射
- Angelika Hönemann:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为德语BonnTempo语料中4至5音节朗读语块,输出为听者感知的清晰度评价与配对偏好,难点在于语速加快同时压缩时长、央化元音并缩减辅音与停顿,难以分离全局快慢与底层发音缩减各自的贡献。方法链先从极慢、正常、极快三档自然产出切分语块并用PSOLA生成压至正常与拉至正常两个时长匹配操纵条件,再经WebMAUS强制对齐与Praat共振峰测量量化局部语速与分段缩减并估计元音目标距离,最后由独立被试完成单刺激1至9分评价与80对配对比较并用混合效应模型分析。与单纯时长缩放解释不同,拉伸快语不恢复慢语元音目标而压缩慢语不损伤目标,说明时间缩放保留了底层缩减程度且自然时序分布无法被线性缩放复制。在BonnTempo语料配对比较任务条件下,全部3640次试次中较慢或缩减较少方的选择率指标为76%,高于等时长配对中自然语音的选择率指标约70%。单刺激清晰度差异与配对偏好高度一致,相关系数为0.81,且重音音节与元音目标保持较好者更清晰。该结论适用边界受限于德语朗读体与中等长度语块,对自发对话、多说话人与合成语音优化尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
102. 同字不同意:蒙古语反问句靠句末声调与时长被听出来
标签:#人类参与评测 #韵律 #言语感知 #语音 #口语理解
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#人类参与评测
👥 作者与机构
- Anujin Munkhbat:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为字面完全相同的蒙古语wh疑问句录音,输出为听者判定的典型疑问或反问解读,难点在于词句相同时只能依靠韵律区分语力而易受偏置干扰。方法链第一步按语境诱发两名喀尔喀母语人录制20对when与who最小对立句及20个填充句并做归一化,形成仅韵律不同的刺激候选。第二步对这些候选做边界调、时长、起始与wh词音高及音质的声学核查,确认反问多带LHL%边界调、更长更高且多气嗓声后才送入感知环节。第三步用20名母语听者的在线三选一强制选择任务检验仅凭韵律的可辨别性,其选择分布直接回答声学差异能否被范畴感知。与以往英语德语等仅做产出分析的研究不同,本文直接检验听者端利用韵律的解读能力,具有验证跨语言普遍倾向的意义。在在线三选一强制选择感知任务下,反问试次的准确率为约87%,高于典型疑问试次的准确率39.5%。结论适用边界受限于喀尔喀蒙古语否定性wh反问、在线实验与两个发音人音色条件,低辨识典型疑问试次多与反问韵律重叠的失败条件尚未验证单线索因果与跨方言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://gorilla.sc/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
103. 自闭症儿童韵律不是单一偏离:跨芬兰语、法语、斯洛伐克语的音质与强度证据
标签:#统计分析 #韵律 #多语言 #语音 #病理语音评估
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Ida-Lotta Myllylä:机构信息未能从会议 PDF 纯文本可靠映射
- Sofoklis Kakouros:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为芬兰语、法语和斯洛伐克语自闭症与非自闭症儿童自然对话语音,输出为区分诊断组的韵律声学画像,难点在于语言音系基线、年龄性别与录音情境混杂且高维声学特征高度共线。先以停顿间单元切分语音并用扩展日内瓦极简参数集为每段提取88维特征,为后续建模提供统一表征。再对合并与单语数据分别做主成分分析得到正交韵律维度,其得分直接作为下一步因变量进入模型。最后以线性混合效应模型检验分组效应并控制年龄性别与说话人嵌套,跨语言模型另设语言内说话人嵌套随机截距。与以往聚焦基频均值与变异的研究不同,本文将谐噪比与频谱倾斜等嗓音质量及整体与动态强度分离建模,揭示稳定性与调制属于不同维度。在芬兰语语料任务下,对照组相对自闭症组PC2得分差值95%置信区间上限条件的得分指标为5.90,高于下限条件的得分指标2.06。该结论适用边界受限于可完成协作任务的学龄言语儿童且斯洛伐克语数据占主导,外推至其他年龄、性别比例、语言与支持需求水平尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
104. 平静不是省力,指挥不止大声:冥想与魅力演讲的声音策略对照
英文题目:From Calm to Command: Acoustic Strategies of Corporate Leaders and Guided Meditation Coaches
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Oliver Niebuhr:机构信息未能从会议 PDF 纯文本可靠映射
- Anabell Hacker:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为美国冥想教练与企业领导者的公开演讲录音,输出为音高、音质、强度与时间组织上的风格分野及其性别调节,难点在于录音环境异质且每单元说话人极少而难以分离风格效应与个人变异。方法链首先筛选高触达冥想与企业家样本并统一预处理,以人声清洁去除冥想背景音乐并对两类语音做同等处理以控制伪影,其清洁语音进入声学参数批量提取。接着以定制脚本提取基频、共振峰、谱倾斜与强度指标,其结果连同音节核检测得到的话语与停顿划分共同进入按性别分别建模的多元统计检验。相对既有魅力语音研究,该工作引入冥想对照极并提出监管韵律解释,将激励上调与镇静下调统一为听者注意与唤醒调节的不同方向,具有类型化比较意义。原文未提供可核对的关键定量结果。该结论的适用边界受限于表演性名人小样本选择,尚未验证日常冥想、其他语言及实际放松功效的外推。原文未披露训练、推理或部署成本
🔗 开源资源
- 第三方资源:https://www.lalal.ai/voice-cleaner/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
105. 能听出“歌唱腔”和“敲击腔”吗:墨西哥西班牙语韵律变体靠早期经验来分辨
英文题目:Attunement to Prosodic Cues in Mexican Spanish: Social Profiles and Dialect Perception
标签:#人类参与评测 #韵律 #社会语音学 #言语感知 #语言识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语言识别 | 主方法:#人类参与评测
👥 作者与机构
- Marta Ortega-Llebaria:机构信息未能从会议 PDF 纯文本可靠映射
- Natalia Mazzaro:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为墨西哥中部Cantadito与北部Golpeadito的自然叙事重述句,输出为听者作出的Norte与Centro二选一地域判断,难点在于两方言差异主要在宏观节律(macro-rhythm)与基频旋律组织而非稳定音段标记。方法链先从小红帽(Caperucita Roja)复述中截取自然句并作幅度归一化以保留原始韵律,再经线上问卷采集童年地域与家庭及学校语言背景,随后用独热编码加主成分分析(Principal Component Analysis,PCA)与K均值聚类生成听者社会语言画像,最后以混合效应逻辑回归分离画像与熟练度及熟悉度的作用。与依赖音段线索的方言感知研究不同,该工作把可感知的地域身份锚定在全局基频变化与旋律起伏等高层韵律结构。在自然语音条件下245名听者共2940个试次总体辨别准确率为64.7%,显著高于50%随机水平,证实宏观韵律线索具有感知显著性。结论仅适用于自然完整语音的离散地域二分类,不覆盖低通滤波或单调化语音、连续地域变体与跨方言泛化等外推情形。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
106. 德语靠重音、意大利语靠语序:意大利学习者如何重配焦点标记
英文题目:Focus marking in L2 German: How Italian learners adjust their use of prosody and syntax
标签:#统计分析 #语言习得 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Bianca Maria De Paolis:机构信息未能从会议 PDF 纯文本可靠映射
- Janne Lorenzen:机构信息未能从会议 PDF 纯文本可靠映射
- Stefan Baumann:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为图片故事约束下诱发的德语与意大利语陈述句,输出为目标成分属于空标记、纯句法、纯韵律与叠加标记的判定,难点在于韵律凸显与句法移位的相对权重在德语与意大利语中不同且在二语产出中相互纠缠。方法链第一步用图片约束问答诱发宽焦点、标识焦点与纠正焦点并固定主语、宾语类共22个目标句,第二步由意德双标注者独立完成韵律窄焦点二值判断与句法是否采用焦点化非典型结构判断并对分歧协商达成共识,第三步将两类标签合并为四分类响应并以多项贝叶斯模型估计组别与语境交互下的策略概率。与仅分析音高或仅分析词序的已有工作相比,该机制差异在于把空标记与三种显性策略放在同一竞争框架下比较,因而能同时刻画一语迁移、部分重构与过度明确化。在标识焦点条件任务下,GEL1组相对ITL1组的纯韵律策略回归系数指标为2,高于叠加标记策略的回归系数指标1.98。该结论适用边界受限于居住德国的沉浸习得意大利学习者及所测主语与宾语类题项,向课堂学习者或其他母语对的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
107. 遗产俄语疑问语调守住了区别,变的是常用型的使用频率
英文题目:Acquisition of wh-question intonation in Russian heritage children
标签:#统计分析 #语言习得 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Mariia Pronina:机构信息未能从会议 PDF 纯文本可靠映射
- Sergey Knyazev:机构信息未能从会议 PDF 纯文本可靠映射
- Maria del Mar Vanrell:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为俄语传承儿童在半自发话语补全中产出的特殊疑问句录音,输出为核构型音系标注及三组分布差异,难点在于俄语IK-2、IK-4、IK-5均可表特殊疑问句且加泰罗尼亚语与西班牙语并存降调与升调,难以区分直接借用与系统内分布偏移。方法链分三步:先用视听语用测试APT诱发两类特殊疑问句半自发语料,再经Praat手工标注转写、音节与ToBI式音高重音及边界调并经作者交叉核对,随后将L+H类合并为升、H+L类合并为降并以广义线性混合效应模型检验组别与构型交互,随机效应为被试。前两步输出逐级进入后一步,标注类别直接构成混合模型的计数因变量与自变量。相对已有成人传承语调与双语儿童个案研究,本工作以俄语传承组、俄罗斯单语组与加泰罗尼亚—西班牙语双语组三方对照分离传承特有变异与社会语言影响,具有多语情境与代表性样本意义。在APT特殊疑问句任务语料下,传承组儿童平均年龄指标为7;8,高于单语组儿童平均年龄指标6;5,且传承组标准默认构型使用显著低于单语组,证据为回归指标β为.61,SE为.17,z为3.47,p为.001。传承儿童总体维持俄语目标构型且默认帽子型仍最常见,但对非默认目标型与句末附加重音变体使用更多,未发现加泰罗尼亚语或西班牙语调型直接套用。结论适用边界仅限西班牙加泰罗尼亚与马略卡地区3至13岁俄语传承儿童的特殊疑问句,年龄增长效应与自发对话外推性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://cat-tobi.upf.edu/ — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
108. 母语里没有的降升调,法国人就听不出:英语升调与降升调的辨别实验
英文题目:Rise or fall-rise? On the perception of English intonation by French listeners
标签:#心理声学实验 #韵律 #言语感知 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.9/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Antoine Regis:机构信息未能从会议 PDF 纯文本可靠映射
- Sophie Dufour:机构信息未能从会议 PDF 纯文本可靠映射
- Sophie Herment:机构信息未能从会议 PDF 纯文本可靠映射
- Amandine Mihelas:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究检验母语缺失特定语调范畴是否导致辨别困难,输入为3名美式英语母语者产出的12个三音节无意义词录音,输出为听者在ABX范式下判断X与A或B何者相同,难点在于上升调在两语言共有而下降-上升调仅英语特有且出现频率低、缺乏词汇语境支撑。方法链先以疑问语气诱发两语言共有的上升调LH%,以怀疑语气诱发英语特有的下降-上升调HLH%,形成受控的语调对比材料,上一步的录音输出直接进入下一步校验。接着经ToBI标注确认调形符合预期并对时长与响度做均衡处理,消除非语调线索干扰,再进入由20名法语单语者与18名美式英语单语者参与的ABX辨别测试,用混合效应逻辑回归比较组别正确率。相对已有音段、声调与重音聋研究,关键机制差异在于将感知同化从词汇层面推向话语语调层面,强调母语语调库缺失对语调对比感知的制约,具有拓展音系性聋理论适用范围的意义。在ABX辨别任务条件下,美国听者对本族语调对比的准确率为79%,低于母语者辨别音段或重音对比时通常报告的准确率90%或更高。结论适用边界仅限于孤立无意义词、无句子语境支持的低频迟疑调辨别,尚未验证句子语境、高频语调或学习效应下的外推,频率与语境丰富度仍可能制约感知表现。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
109. 真诚与反讽没有时间差吗:用注视时间检验基频与谐噪比如何实时引导语义选择
英文题目:An exploratory eye-tracking study into the time course of sincere and sarcastic speech recognition
标签:#心理声学实验 #韵律 #言语感知 #语音 #口语理解
评分:5.5/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Isabella Noor Warner:机构信息未能从会议 PDF 纯文本可靠映射
- Sueah Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Thomas Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Ryuki Matsuura:机构信息未能从会议 PDF 纯文本可靠映射
- Seth Wiener:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理英语口语讽刺意图实时识别任务,输入为陈述句加回应的连续声学信号与分别描绘真诚与讽刺解释的配对图像,输出为关键短语时间窗内对目标图像的注视选择,难点在于讽刺韵律线索微弱且依赖视觉语境支撑才能直接通达。构建陈述加回应最小对立材料并仅在回应关键短语保留真诚与讽刺两种录制韵律,其输出进入人工智能图像生成环节形成语义配对的极简视觉语境,随后通过网络视觉世界范式同步播放音频并用家用摄像头连续记录眼动,最后以强制对齐定位关键短语并用广义线性混合模型检验声学预测效应。与既往离线辨别和阅读眼动研究不同,该设计把连续声学输入与视觉支撑语境直接耦合,意在检验互动观与模块观关于讽刺加工时程的预测差异。在关键短语前1000ms窗注视预测任务条件下,F0主效应的指标回归系数β为.16,高于F0×讽刺韵律交互的指标回归系数β–.27。结论适用边界仅限受控英语材料与强视觉支撑语境,受限于预览期真诚偏置、约一半眼动帧损耗与两项目超90%误判剔除,无法裁决互动与模块之争且尚未验证向自然对话与跨语言的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://osf.io/g8wbf/ — 链接可访问(HTTP 200)
- 数据相关资源:https://osf.io/g8wbf/ — 链接可访问(HTTP 200)
- 复现相关资源:https://osf.io/g8wbf/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
110. 低声调为何进不了第一槽:粤语双重粗口语素的声调排序偏好
英文题目:Tone-Driven Preference in Cantonese Double Expletive Constructions
标签:#心理声学实验 #语音学与音系 #韵律 #言语感知 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Alex Hong-Lun Yeung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理香港粤语新兴双感叹词排序问题,输入为双音节形容词或副词加形容词框架加两个语义等价感叹词`l5n25`、`k5u55`与`tsh5t22`,输出为感叹词居首偏好,难点在于剥离音段词汇联想而验证纯声调效应。方法链分三步衔接:先以社交媒体挖掘建立低调`tsh5t22`回避居首的分布假设,其输出的非对称模式直接作为受控实验的待验假设;再以视觉迫选任务检验跨构式与周边声调下的能产性偏好,其平衡刺激排除了语料分布不均的干扰;最后以哼唱只留声调轮廓的知觉任务检验因果,其无音段输入承接前步的偏好结论并隔离声调。与已有变调研究的范式改变逻辑不同,本文机制是无交替的排序择优,即在等义项中选择高调居首而非改写底层声调,具有揭示韵律位置 prominences 驱动语序的实际意义。在迫选任务评测条件下,构式类型效应的显著性指标p为.65,高于周边声调语境效应的显著性指标p的.3参照水平。该结论适用边界受限于三词及年轻人口语新兴构式,尚未验证四音节词库频率或韵律组块解释。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://doi.org/10.17605/OSF.IO/MD832 → https://osf.io/md832/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
111. 去掉语境只听语调:普通话反语表扬为何最难听懂
英文题目:Ironic Prosody Perception in Mandarin: The Role of Autistic Traits
标签:#心理声学实验 #韵律 #言语感知 #语音 #口语理解
评分:5.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Aijing Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhan Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Lu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为剥离上下文的普通话孤立句音频,输出为字面与反语的二分类判断,难点在于声调语言中词汇声调约束下韵律线索能否独立消解语义极性与说话人立场的冲突。首先通过语境诱导录制目标句并从对话中切除上下文以生成纯韵律刺激,其输出经振幅归一化后进入受控句式构建环节。接着采用固定句式你真是个体贴的朋友类模板并经情感词表校验以分离语义类型与韵律类型,其形成的四条件刺激集进入在线听辨任务。然后在个人设备上随机呈现刺激并收集字面或反语判断,其判断结果进入重复测量方差分析与孤独症谱系商数相关检验。与既有临床分组二分比较不同,该工作将孤独症特质视为连续维度并聚焦无语境韵律条件,揭示了韵律有效性依赖冲突方向的非对称机制。在无语境听辨任务条件下,反语批评的准确率为.84,高于反语表扬的准确率.25。结论的适用边界受限于单发音人短句与实验室听辨情境,尚未验证多轮对话多说话人与多模态线索下的外推,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.fon.hum.uva.nl/praat/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.credamo.com/#/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
112. 诗句的停顿不是刻死的:语速一变,双字脚就合并且消失
英文题目:Dynamic Prosodic Grouping—Evidence from Recitation of Classical Chinese Poetry
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.6/1 | 影响力 0.9/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Jiangxin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhuyin Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Yi Xu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究以汉语古典格律诗整首对句朗诵音频为输入,以每音节边界强度估计与韵律分组结构推断为输出,难点在于缺乏重音的汉语中音步边界本就没有公认声学标记,而传统理论又预设了稳定的二分层级。先以四十名被试对五言与七言对句在三种朗诵风格下的三次重复录音为输入,负责采集共两千余条语音并用ProsodyPro切分标注,输出每音节时长数据。再以输出的音节时长为输入,负责按当前音节时长除以前一音节时长计算音节时长比,输出SDR边界强度估计。最后以输出的SDR为因变量输入,负责拟合以诗行、风格和音节位置为固定效应且被试为随机截距的线性混合效应模型,输出不同位置与风格下的边界差异比较。在五言与七言对句朗读语料下,五言行第二音节的平均SDR指标为超过1.8,高于七言行第二音节的平均SDR指标1.0。与静态韵律层级理论的关键机制差异在于分组被视为语速与句长动态博弈的结果而非句法直接投射,因此慢速诗体中的二加三分组可在日常语速下合并为整体。该结论适用边界仅限于熟悉格律诗的普通话朗读语料,尚未验证自发对话与其他方言的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
113. 英语里听到的声调,何时自动点亮普通话词汇:双语者跨语言音系激活的脑磁图证据
英文题目:The neural basis of lexical tone in bilingual language processing: A MEG study
标签:#心理声学实验 #言语感知 #脑信号 #语音 #语音属性识别
评分:5.5/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:前50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- XinDong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Junjie Wu:机构信息未能从会议 PDF 纯文本可靠映射
- Judy Zhu:机构信息未能从会议 PDF 纯文本可靠映射
- Xin Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理普通话-英语双语者在纯英语语境下是否自动激活母语声调词汇表征的问题,输入为自然英语单音节词与叠加普通话四声的偏离词,输出为脑磁图源空间失配场差异,难点在于区分低水平音高敏感与高水平跨语言词汇竞争。先由刺激构造输入自然英语同音词与非同音词,负责去基频后移植普通话四声生成偏离刺激与新异词,输出Oddball序列进入MEG记录。再由MEG记录与预处理输入连续脑磁信号,负责滤波分段与事件相关场平均,输出标准与偏离平均信号进入源重建。最后由源重建与建模输入平均信号,负责经动态统计参数映射估计双侧颞上回与左侧颞中回活动并以线性混合效应检验交互,输出源空间失配场差异。与单语声调感知工作相比,关键差异是将声调操控嵌入全英语Oddball任务并以同音与非同音偏离对照分离声学与词汇效应,意义在于定位右颞上回声学加工与左颞上回词汇激活的分工。在被动听觉Oddball任务条件下,双语组左侧颞上回的MMF效应指标为0.16,高于单语组左侧颞上回的MMF效应指标0.03。结论适用边界仅限被动聆听孤立单音节词情形,连续语流与产出任务等外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://surfer.nmr.mgh.harvard.edu/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
114. 又快又要分清两级短语:Rapid-ToBI 只做分组判断的取舍
标签:#数据标注 #模型比较 #韵律 #语音属性识别
评分:5.4/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#数据标注
👥 作者与机构
- Jason Bishop:机构信息未能从会议 PDF 纯文本可靠映射
- Boram Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Sun-Ah Jun:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为连续英语语音及词与音节时间对齐,输出为每个词边界无边界、中间短语与语调短语的三类判定,难点在于完整主流美式英语ToBI训练与标注成本过高,而小波与众包方法只输出梯度连接度,无法恢复中间短语与语调短语的音系对立。所提快速短语标注先搭建词层、重音可视的音节层、语调短语区间层、被支配的中间短语区间层与静音标记,其输出进入以停顿间区间为单位的感知连接度初分。初分结果进入音高重置核验与短语尾音高形态核验,分别负责将模糊连接度升级为短语边界并确认短语重音加边界调序列,其输出再进入逐语调短语的内部中间短语精化,全程以音系线索压倒感知线索作裁决。与连续小波边界强度阈值二值化相比,该方法保留离散音系证据并以区间分组表征层级,因而能作出两级短语区分并可用于训练验证自动化模型。在约10分钟Barack Obama周播演讲语料下,合并ip与IP后二分类的κ指标为.89,高于三分类的κ指标.87。该结论适用边界受限于受过主流美式英语ToBI训练的标注者与单人朗读式男性英语,临床口语、自发对话与多说话人外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
115. 不用切分音节也能认词:连续韵律线索如何逐帧改写词竞争
标签:#统计分析 #韵律 #言语感知 #多语言 #语音识别
评分:5.4/10 | 创新 1.0/2 | 技术严谨 0.8/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音识别 | 主方法:#统计分析
👥 作者与机构
- Adam A. Bramlett:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文处理增量口语词识别,输入为随时间到达的连续声学切片,输出为词候选上的后验激活轨迹,难点在于音段与韵律线索异步展开且跨语言诊断性权重迥异。方法链分三步:语言使用者模块提供线索权重与表征精度先验,词库模块将词编码为多维高斯分布随时间变化的均值轨迹,增量识别器结合前两者的权重与轨迹逐帧计算似然并经加权乘积与softmax竞争更新激活。与TRACE及Shortlist固定时间片对齐离散特征的做法不同,该框架把基频F0、时长与音段证据都视为连续时间似然,避免将声调与重音离散化为音段对齐特征。原文未提供可核对的关键定量结果。三组仿真仅以激活曲线复现beaker目标下首音共享cohort早期共激活、T2与T3延长竞争、T1与T4早分叉及重音音节处延迟分叉等定性模式。结论适用边界受限于作者手设的小词库演示,外推至连续语流、协同发音、声调变调与第二语言适应尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 代码相关资源:https://osf.io/7ab2u/overview — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
116. 普通话焦点不是不会发,而是基频让位:自闭症儿童的声学线索再分配
标签:#统计分析 #韵律 #言语障碍 #语音 #语音属性识别
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Honghui Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Xiyu Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理普通话疑问句诱发的句中焦点与中性描述口语录音,输入为遮挡图片问答采集的单句录音,输出为在位聚焦音节与紧邻后聚焦音节的多线索分布判定,难点在于基频需同时承载声调对立与焦点增强压缩而易混淆。方法链条由游戏化遮挡问答诱发采集承接声学参数化提取基频振幅斜率与时长,再由线性混合模型检验焦点句与中性句的标量差异,最后由广义加性混合模型在归一化时间轴上刻画轮廓时程差异,前一步的归一化轮廓直接构成后两步建模对象。与既往孤立报告音高变平不同,该文把在位增强与后聚焦压缩置于同一焦点结构内比较,揭示线索跨位置再分配而非有无焦点,实际意义在于为干预提供立足已有后聚焦优势再搭建在位基频的路径。在游戏化问答诱发的分声调评测下,孤独症组相对典型发展组在位音节振幅指标在声调三条件的峰值差为-9.23 z,低于声调一条件的振幅指标峰值差-8.37 z。标量检验还显示典型发展组以在位基频增强为主而孤独症组以后聚焦振幅压缩为主,轮廓分析显示典型发展组在位基频更高而孤独症组后聚焦声调二尾段异常上扬。结论适用边界受限于六岁左右单语句中焦点与单后聚焦窗口,尚未验证其他焦点位置与自发对话的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
117. 合流者不拉开距离、清晰者主动靠近:粤语三六声调在对话中如何对齐音高区间
英文题目:I don’t have grudges, I have a wish: Cantonese Suprasegmental Adaptation in Conversations
标签:#统计分析 #韵律 #语音 #语音交互
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音交互 | 主方法:#统计分析
👥 作者与机构
- Ivan Fong:机构信息未能从会议 PDF 纯文本可靠映射
- Haoyao Ruan:机构信息未能从会议 PDF 纯文本可靠映射
- Dawn Behne:机构信息未能从会议 PDF 纯文本可靠映射
- Allard Jongman:机构信息未能从会议 PDF 纯文本可靠映射
- Joan Sereno:机构信息未能从会议 PDF 纯文本可靠映射
- Paul Tupper:机构信息未能从会议 PDF 纯文本可靠映射
- Yue Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
粤语Tone3与Tone6合流使jyun3怨与jyun6愿等最小对立体难以区分,任务输入为合流程度不同的双人自然对话语音,输出为归一化平均基频上的T3-T6距离变化,难点在于无脚本交互中需分离交际驱动的协同调适与单纯声学模仿。方法链分四步:先用载体句朗读建立合流基线并据Tdiff与K-S分数划分多合流与少合流角色,其输出决定配对;再让被试在双房间虚拟逃脱游戏中口头描述目标与填充图片位置以制造频繁误认压力;随后对韵母抽取10点F0并经T量表归一化以跨说话人比较;最后用混合效应模型与emtrends检验对话进程与前后测非交互朗读的距离变化。相对已有整体感知判断与非交互影子跟读,该设计将调适从单向模仿转为双向可发起的任务成功协同校准,使趋同过程可由对话全程的声学轨迹直接观察。在对话任务起始0%条件下,少合流组的Tdiff指标为0.970,高于多合流组的Tdiff指标0.339。对话终点两组距离分别变为0.644与0.586且差异不再显著,趋同主要由少合流者T6上升更快致距离缩小驱动,多合流者T3上升而T6稳定使距离基本维持,前后测非交互任务均无显著变化。该结论适用边界受限于年轻香港粤语者平调高度维度,轮廓、时长与嗓音质量等线索的招募、知觉获益与长期保持尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.irasutoya.com/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
118. 重音落在形容词还是名词上:峰值与均值、时长如何分别推动肯定还是否定解读
标签:#心理声学实验 #韵律 #言语感知 #语音 #口语理解
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Candice Frances:机构信息未能从会议 PDF 纯文本可靠映射
- Antje Meyer:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理英语间接标量问答的语用消歧,输入为是否大动物配小象回答类问答对,输出为听者整体作肯定或否定判断,难点是形容词与名词分别拉向相反极性且真值条件兼容两种解读。方法分三步推进:先由单名母语者录制形容词重音、名词重音与中性基线三类刺激并在语音分析软件中手工切分语境与目标词,切分边界输出的词段进入特征提取。再对形容词和名词分别提取基频峰值与均值、强度峰值与均值及词时长,得到的连续特征矩阵进入二项逻辑混合效应模型预测解释跟随形容词还是名词,并控制插入语与词汇条件。与以往只看重音有无或范畴类型的工作不同,该文检验局部突变与整体平均的不同功能,揭示突出并非单调增强权重而是轮廓形状决定解读。在模糊回答二选一判断任务下,名词时长的回归系数指标为0.15,高于形容词时长的回归系数指标-0.02。该结论适用边界仅限英语句末名词的标量形容词结构与二选一肯定否定任务,尚未验证其他句式、对话情境与跨说话人泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.praat.org/ → https://praat.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
119. 自闭症儿童语音线索跨语言能通用吗:芬兰语、法语和斯洛伐克语的对照分类
标签:#集成学习 #韵律 #跨语言 #语音 #病理语音评估
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#集成学习
👥 作者与机构
- Sofoklis Kakouros:机构信息未能从会议 PDF 纯文本可靠映射
- Ida-Lotta Myllylä:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为芬兰语、法语和斯洛伐克语孤独症与典型发育儿童的停顿间话语单元,输出为说话人层面的二分类标签,难点在于被试极少、录音任务各异且韵律表现本身异质性强。方法链分为三步:先将全部语音切分为停顿间单元并用 openSMILE 抽取 eGeMAPS 声学韵律向量,再用 XGBoost 与随机森林在说话人隔离交叉验证下训练单语分类器,最后通过多语混合与留一语种测试检验跨语言迁移并用多方法共识做特征重要性分析。与既往单语声学分类相比,该工作把分类器当作探针而非追求最优性能,机制差异在于用迁移成败反推线索的语言依赖性。留一语种测试中,在斯洛伐克语和法语上训练后在芬兰语测试集上达到准确率 0.68 与 F1 值 0.79,在芬兰语和法语上训练后在斯洛伐克语测试集上为准确率 0.56 与 F1 值 0.70,而在芬兰语和斯洛伐克语上训练后在法语测试集上仅为准确率 0.28 与 F1 值 0.42。结论仅适用于三语小样本与 eGeMAPS 特征范围,外推到其他语言、女性被试或自然对话前未经验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
120. 高音不在重音上时:阿美语疑问词与祈使句的声调重联分析
标签:#形式化分析 #语音学与音系 #韵律 #语音 #语音属性识别
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:理论研究 | 主任务:#语音属性识别 | 主方法:#形式化分析
👥 作者与机构
- Tsu-im Khuat:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以阿美语Sakizaya与Falangaw变体田野诱发口语录音与句法语境为输入,输出基于自主音段节律框架的音系表征,难点在于词孤立形式保持稳定的词末凸显而特定句类高音却出现在非末位置。先以陈述句与孤立词建立词重音与边界调的默认格局,区分Sakizaya的词层面高音加词边界低调与Falangaw的句调短语边界低调实现,为后续偏离提供参照。在田野诱发语料设置下,高龄端受试者的年龄指标为80,高于低龄端受试者的年龄指标35。再对比句首疑问词如cima、icuwaay与动词后小品如han、ho、haw的音高与时长实现,确认Falangaw疑问词的次末高音与祈使小品高音并非词层重音而是构式敏感分布。进而用高音重联统一解释偏移,保留词层面重音位置不变,仅允许高音在构式条件下脱钩并重新停靠。与既有重音移位或高音插入分析相比,该机制避免增加调库存或改写重音规则,其实质意义在于以时长保持稳定而音高脱钩来刻画构式敏感语调。其结论适用边界限于所采两方言特定疑问与祈使构式及eyza、iraw等佐证环境,跨构式量化验证尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
121. 疑问词韵律压住边界时,长度为什么还能移动重音性拖长
英文题目:Prosodic Realization of Attachment Ambiguity: Length and Wh-Intonation in Korean
标签:#人类参与评测 #韵律 #语音 #口语理解
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#人类参与评测
👥 作者与机构
- So Young Lee:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理韩语疑问词与格附着歧义,输入为矩阵主语长度不同的全局歧义疑问句,输出为附着解释与韵律实现,难点在于南庆尚韩语疑问词语调从疑问词短语延伸至句末疑问标记形成大语调域,后焦点删除可能阻止内部成短语从而中和长度效应。为排除辖域变异先将疑问标记恒置句末使疑问词辖域恒为矩阵域,其输出的固定辖域句进入长度操纵步骤。接着以短主语与长主语构造目标句对,其输出的长短配对句进入时长比较步骤。最后比较矩阵主语中心名词与疑问词与格时长以判定短语末延长位置并关联附着解释。与普通名词与格研究相比,关键差异是将疑问词焦点后压缩纳入考量,检验长度线索在统一语调域内是否以弱化形式存留,具有澄清韵律与句法交互机制的实际意义。原文未提供可核对的关键定量结果。结论的适用边界仅限于矩阵辖域固定的南庆尚疑问词与格朗读产出,尚未验证知觉有效性与自然对话泛化。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
122. 法语重音短语能装多少音节:用 250 毫秒下限和 1250 毫秒上限来定界
标签:#心理声学实验 #韵律 #言语感知 #脑信号 #语音属性识别
评分:5.4/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 1.2/1.5 | 可复现 0.1/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:理论研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Philippe Martin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以连续朗读与自发话语中的音节及重读音节序列为输入,以排除强调重音的法语重音短语右边界划分为输出,难点在于重音固定落在短语末词末音节而与词类无关,语义单位、词类与音节数规则均有反例且同一词串随语速改变切分。方法先考察相邻可重读音节间声学间隔以判定重音冲突的保持、移位或删除,其输出的重音位置序列进入下一步时长上限检验。接着以超长词被迫出现次重音的现象检验单个短语可延伸上限,将过长发音分裂为多个重音短语并输出候选边界。然后用剪辑语音感知翻转与默读眼动证据验证感知端约束,并将最小与最大时间约束映射到theta同步音节感知与delta同步重音间隔机制。在剪辑语音感知任务条件下,剪辑后语音的间隔指标为180 ms,低于自然语音的间隔指标250 ms。相对已有按语义单位、单一词汇词或固定音节数切分的方法,关键差异是以250 ms至1250-1350 ms的可变时间窗统一解释保持与分裂,实际意义在于兼容快慢语速下的不同切分而不依赖句法不可分规则。该结论适用边界限于非强调性法语有声与默读情形,尚未验证受控大规模语料上的稳定性与跨语速外推,失败条件包括强调重音与呼吸组中断干扰。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://bonpatron.com/fr/phonetics/1432157276/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
123. 只听到前三个词时,高共情听者为何更早猜中对比含义
英文题目:Using an incremental guessing game to study the role of empathy in prosodic processing
标签:#心理声学实验 #心理测量 #韵律 #言语感知 #口语理解
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Céline Pozniak:机构信息未能从会议 PDF 纯文本可靠映射
- Giuseppina Turco:机构信息未能从会议 PDF 纯文本可靠映射
- Barbara Hemforth:机构信息未能从会议 PDF 纯文本可靠映射
- Mariapaola D’Imperio:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
法语确认义bien sûr与对比义plutôt同音句的语用解读依赖语调增量展开,听者须在核重音出现前利用核前区线索预测含义,共情是否调节该预测尚难直接证明。研究先用Praat对沿用录音做声学核验,量化核前区J’ai un/e的基频极值、频程与时长,为后续可利用性提供输入基础。再以三段增量猜测游戏呈现语句片段,被试每段后从两张卡片二选一并在末段获正确答案反馈,其选择输出进入下一步建模。最后以贝叶斯逻辑回归建模正确率随含义条件、试次顺序与连续共情分数的演化,并按共情中位分组拆解交互。在三段增量二选一猜测任务下,三变量交互指标为-0.001,高于顺序与含义两变量交互指标的-0.01。相对既往视觉世界研究只报告核重音前注视分化,该显式猜测范式证明高共情者能逐步利用核前更窄频程与更短时长实现学习,而低共情者滞留确认偏向。该结论适用边界受限于单名女性朗读人录制的少量同音项目与显式二选一任务,尚未验证自然对话与跨说话人外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://shs.hal.science/halshs-00184995 — 链接可访问(HTTP 200)
- 第三方资源:https://shs.hal.science/halshs-01428391 — 链接可访问(HTTP 200)
- 第三方资源:https://hal.science/hal-00743678 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
124. 只给看、不给听的反馈:视觉反馈如何帮普通话人建立粤语声调范畴
标签:#心理声学实验 #语言习得 #言语感知 #语音 #语音属性识别
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Yuqin Shu:机构信息未能从会议 PDF 纯文本可靠映射
- Mingxi Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Gaode Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Ran Tao:机构信息未能从会议 PDF 纯文本可靠映射
- Gang Peng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理普通话母语者感知粤语6个松声调(unchecked tones)的跨语言声调习得问题,输入为多说话人自然粤语单音节音频,输出为六选一声调类别判定,难点在于粤语在音高高度乘音高斜率(pitch height × pitch slope)空间密集重叠而普通话4声相对离散。训练链条为三步:先听目标刺激并按键选择声调类别以建立听觉到标签的初始映射,再接受正确(蓝色注视点)或错误(红色注视点)信号并观看持续3秒的视觉反馈,视觉信息包含繁体汉字、英文词义、1至6声调编号与赵元任声调字母(Chao tone letters);最后在无声音重放条件下依据视觉抽象特征回忆并修正内部范畴,该修正结果进入下一试次的感知决策。与以往训练中直接同步呈现音高曲线、手势或颜色的做法不同,本范式将视觉信息后置为反馈并强制心理复述,从而推动抽象范畴形成而非特定声学记忆。与训练前基线相比,30名北方普通话母语者在4天共576试次训练后显著提升,延迟一周后在训练说话人条件下的保持测试中音乐性(Musical Ear Test,MET)得分仍显著预测识别正确率,标准化回归系数为0.45。该结论仅适用于短期保持与实验室六选一识别任务,未验证自然对话理解或发音迁移,也未检验无反馈重复训练是否同样有效。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
125. 面子威胁越高声音越低吗:用整句语调曲线检验墨西哥西班牙语提议的礼貌
英文题目:Visualizing intonation and politeness: A GAM-based analysis of Mexican Spanish offers
标签:#统计分析 #韵律 #社会语音学 #语音 #语音属性识别
评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Bruno Staszkiewicz:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入是语境段落限定的中部墨西哥西班牙语八音节陈述体提议句朗读录音,输出是面威胁度与整句音高轨迹关系的判断,难点在于相同语用功能下词汇差异与社会变量交织且传统均值会抹平形状信息。方法链分三步推进:先用蒙特利尔强制对齐切分音节并按每音节十点比例抽取基频转半音,再以面威胁指数回归检验平均音高是否随威胁度下降,最后对权力、距离和负担各拟合随时间变化的广义加性混合模型并用差异平滑定位显著区间。与只看均值或句末边界调的已有做法不同,该研究把整句轮廓作为函数型对象建模,能同时区分全局抬降与局部形状分歧。在八种权力-距离-负担组合的朗读语料测试条件下,P–D–I–条件的平均F0指标为11.30 st,高于P–D+I–条件的平均F0指标9.05 st。结果显示亲近语境整体更高且威胁度越高均值越低,权力与负担则呈现方向相反的局部差异。结论的适用边界受限于受控朗读与非完全相同的目标句,尚未验证自发对话、疑问句或其他方言的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.phonic.ai/ → https://phonic.ai/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
126. 当语调不再标记焦点:匈牙利语中手势与元音目标的稳定对齐
标签:#统计分析 #语音学与音系 #韵律 #语音 #音视频理解
评分:5.4/10 | 创新 1.1/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.6/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#音视频理解 | 主方法:#统计分析
👥 作者与机构
- Csilla Tatar:机构信息未能从会议 PDF 纯文本可靠映射
- Ezra Keshet:机构信息未能从会议 PDF 纯文本可靠映射
- Jelena Krivokapić:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为匈牙利语问答诱发的含目标词Mima的朗读句及同步EMA运动学、声学与双视角视频,输出为发音与指向手势关键点间时滞的协调模式判断,难点在于焦点与话题主要靠语序而非强制性音高重音实现,语用与韵律显著性高度纠缠。方法链分三步衔接:先用问答对诱发五种信息结构并重复采集朗读指向任务,其输出的语料进入EMA与手部追踪同步采集及mview标注,得到辅元音、音高重音与f0极大值的起始与目标点。再对目标词f0做轮廓聚类并以线性回归检验信息结构、轮廓类型及其交互对起始对起始与目标对目标时滞的影响,以最短且最不离散为耦合定义。相对以往只看峰与峰重叠,该工作同时检验两类对齐并分离音高重音峰与f0极大值,使无强制重音时的组织者得以显现。在问答诱发的五种信息结构语料条件下,corrective focus的轮廓1 token计数指标为10,高于轮廓2 token计数指标的0。单被试结果显示第一音节元音目标到指向目标时滞最短且最稳定,不受信息结构与轮廓显著影响。结论适用边界仅限单说话人朗读指向任务与给定目标词结构,尚未验证自发对话与其他手势及多说话人外推,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://praat.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
127. 尼日利亚英语核调型不只是升降:听者如何用结尾音高判断礼貌与得体
英文题目:Perception and social meanings of Nuclear Configurations in Nigerian English
标签:#主观评测 #韵律 #社会语音学 #语音 #语音属性识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#主观评测
👥 作者与机构
- Oluwasegun Amoniyan:机构信息未能从会议 PDF 纯文本可靠映射
- Shelome Gooden:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为尼日利亚英语青少年签证面试表演话语的核构型音频,输出为成年尼日利亚听者对其延续发话、强调、礼貌、尊重与文化适宜性的赞同度,难点在于剥离词汇内容后检验终点音高形态本身是否携带社会索引意义。方法链分三步衔接:先从Accelerate TV播出的#visaonarrival视频截取青少年与两位女性成人的互动片段并做简化ToBI式听辨标注,输出RISE-RISE、强调式RISE-FALL、宽焦RISE-FALL、FALL-LOW四类典型轮廓;再将四段音频送入Qualtrics匹配假装任务,由129名成年听者随机化完成五点李克特感知评定;最后以核构型为固定效应、被试为随机截距拟合序数混合效应模型,分离轮廓与性别、族群、社会经济地位效应。相对以往只重句法标记、态度功能准确率仅18.8%的产出描写,关键差异是把终点升降视为概率性社会索引而非范畴性句法标记,并联合测量语用与社会文化维度。在尊重判断任务评测设置下,强调式RISE-FALL-EMP的尊重得分系数为.55,高于宽焦RISE-FALL的尊重得分系数.43。结论适用边界受限于层级互动框架下的尼日利亚听者感知,尚未验证产出分布、跨年龄阶层外推与因果机制。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
128. 有声调母语也救不了新声调:粤语者跨情境学普通话声调的特异性干扰
英文题目:The Role of L1 Tonal Experience in Cross-Situational Learning of Non-Native Tone Contrasts
标签:#心理声学实验 #语言习得 #言语感知 #语音 #口语理解
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Yin To Chui:机构信息未能从会议 PDF 纯文本可靠映射
- Zhen Qin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理跨情境词学习下第二语言声调词指映射问题,输入为含糊试次中的伪词发音与多候选新颖物体,输出为词指映射选择,难点是粤语母语者需在普通话声调最小对立中编码精细基频轮廓。方法分三步:先构造3个基词与T1-T1、T2-T1、T4-T1组合的9个伪词并固定配对新颖物体,为统计学习提供可区分载体。接着以288个二选一无反馈训练试次建立8比1共现统计,使正确配对随试次累积显现,前步映射直接构成该阶段学习目标。然后用54试次三选一测试分离声调最小对与非最小对表现,并以混合效应模型与误差分析定位同化模式,测试输出回接到训练统计的保持检验。相对英语者完全学不会声调的已有方法,本工作以声调母语者为对照,揭示干扰是特定范畴映射而非泛化不敏感,具有厘清声调迁移机制的意义。在训练后三选一测试任务下,粤语组由非最小对到声调最小对的准确率估计为-1.61,低于普通话组的准确率估计-1.07。结论适用边界仅限粤语学普通话T1-T2-T4有限集与实验室短期学习,尚未验证长时保持与连续语流外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
129. 窄焦点张口更大:用下颌位移检验焦点类型与 EMA 和 MARRYS 的一致性
英文题目:Comparison of EMA and MARRYS: Jaw displacement in narrow vs broad focus
标签:#统计分析 #发声与构音 #韵律 #语音 #语音属性识别
评分:5.3/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Johan Frid:机构信息未能从会议 PDF 纯文本可靠映射
- Donna Erickson:机构信息未能从会议 PDF 纯文本可靠映射
- Malin Svensson Lundmark:机构信息未能从会议 PDF 纯文本可靠映射
- Oliver Niebuhr:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为两组含低元音内容词的美式英语问答式朗读语句与窄聚焦位置标注,输出为目标词最大下颌下降量及聚焦类型效应判断,难点在于同时分离元音固有高度、句法位置与窄聚焦和宽聚焦的混杂影响。方法链分四步依次衔接:先用三维电磁发音仪与下巴带双侧弯曲传感器的头戴式节律系统同步采集声学与下颌运动轨迹,再经蒙特利尔强制对齐器切分词边界并提取每词下颌垂直最低点,接着按说话人与句式归一化位移并拟合聚焦类型与词位的线性混合效应模型,最后用动态时间规整校正早期版本时间漂移后计算两系统信号相关以验证可比性。与下颌门齿刚性粘贴直接追踪的电磁发音仪相比,下颌动作节律系统以可调下巴带间接估计开口,便携低成本且适合田野与课堂大规模采集,但早期版本需跨系统非线性时间对齐才能保证时域可比。在200个话语同步记录的评测条件下,动态时间规整对齐后轨迹的Pearson相关平均为0.97,高于对齐前轨迹的Pearson相关平均0.84。窄聚焦词在81.6%话语中取得全句最大张口的分布分析进一步表明聚焦具有全句显著性,且位置交互显示窄聚焦效应在句首最强而非聚焦效应随句尾增强。该结论适用边界仅限于受控朗读的美国英语低元音内容词与小样本实验室条件,尚未验证自发语、其他元音、其他语言与大样本泛化,且句法结构差异带来的句尾效应仍受限于两类句式观察。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.articulograph.de/ — 链接可访问(HTTP 200)
- 第三方资源:https://praat.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://ubeam.engr.wisc.edu/pdf/ubdbman.pdf — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
130. 动漫腔不只在音高:句内气声、粗糙与挤压如何分段出现
英文题目:Local Non-Modal Voice Quality Dynamics in Japanese Anime Speech
标签:#统计分析 #韵律 #社会语音学 #语音 #语音属性识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Carlos Ishi:机构信息未能从会议 PDF 纯文本可靠映射
- Akira Utsugi:机构信息未能从会议 PDF 纯文本可靠映射
- Ichiro Ota:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为职业声优与声优课程女学生的配音、复述与朗读日语动漫对白,输出为音节内局部非模态音质事件的类别、位置与声学可分性,难点在于气息、粗糙与压紧变化短促且易与情感表达和角色声线混淆。方法先由熟悉音质分析的专家结合听觉印象与语图视觉检查切分全部话语中的非模态区间,并归为气息类、粗糙类、压紧类与吸气类等亚型,其标注结果直接作为后续统计的事件集合。再统计各类事件在配音、复述与朗读任务间及短语首、中、尾位置上的分布差异,以揭示局部调制的位置约束,该分布输出又作为声学验证的分组依据。最后提取HNR、F1F3syn与H1-A1等谐波性与声门紧张度参数,用方差分析与多重比较检验类别区分度及其跨群体一致性。相对以往只比较整句基频与整体音质的做法,该工作将表达力定位到音节内动态调制与固定位置搭配,因而更能解释动漫表演的社会语用含义。在区分气息成分的声学验证任务条件下,模态段与压紧段的F1F3syn指标为接近1,高于气息段的F1F3syn指标接近0。该结论适用边界受限于11名年轻女性学生、单部2016年动漫与四种角色,尚未验证跨作品、跨性别与感知层面的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 演示资源:https://sigroup-official.github.io/localnonmodalvoicequality → https://sigroup-official.github.io/localnonmodalvoicequality/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
131. 音长与重音共享发音手段却错时出现:爱沙尼亚语韵脚的逆时关系新解
英文题目:Articulatory Dynamics of Quantity and Stress in Estonian Prosody
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Argyro Katsika:机构信息未能从会议 PDF 纯文本可靠映射
- Eva Liina Asu:机构信息未能从会议 PDF 纯文本可靠映射
- Matthew Gordon:机构信息未能从会议 PDF 纯文本可靠映射
- Pärtel Lippus:机构信息未能从会议 PDF 纯文本可靠映射
- Anton Malmi:机构信息未能从会议 PDF 纯文本可靠映射
- Yining Qu:机构信息未能从会议 PDF 纯文本可靠映射
- Sherry Chien:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
爱沙尼亚语三级音长仅见于词首主重音音节,任务输入为2至4音节、首音节具短长超长对立及次重音变体的词序列,输出为唇孔与舌尖发音手势的运动学轮廓,难点是母语词中音长与重音效应完全共现而难以分离。方法先按音长与词长构造S1Q1至S1Q3及S2Q2对照刺激并嵌入载体句,以 broad focus 单一语调短语诱发目标词,再用电磁发音仪记录8名母语者发音并半自动标定C1至C3起始辅音手势的形成时长与位移并按音素做z归一化,随后以线性混合效应模型检验音长与词长的交互并做Holm校正的事后比较。与把逆时模式归于固定trochee音步域的旧解释不同,本文提出音长早作用而重音晚展开的部分重叠调控域,并以反相位mu手势解释时序错位,其实质意义是无需音步即可产生逆时关系。在包含L2、L3和L4词长的评测设置下,C2位移的交互指标为χ2(6)=70.86,高于C2形成时长的交互指标的χ2(6)=59.59。该结论适用边界受限于开音节唇音起始辅音与可标定辅音手势,尚未验证韵尾辅音与更多音节形状下的重叠预测。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
132. 白语透镜下的普通话声调:早期双语儿童为何先会升调
英文题目:The Bai Lens: Examining Mandarin Tone Development in Bilingual Preschoolers
标签:#统计分析 #语言习得 #语音学与音系 #语音 #语音属性识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Zenghui Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Shufen Liang:机构信息未能从会议 PDF 纯文本可靠映射
- Ao Chen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理白语为母语的学前儿童如何产出普通话单字调引用形式的问题,输入为图片命名诱发的自发单音节录音,输出为各年龄组基频轮廓与声学参数是否达到成人母语基线的判定,难点在于入园前后普通话暴露剧变与白语多声调向普通话声调非对称映射相互混杂。图片命名采集为第一环,经田野预试保证概念可识可产且仅保留自发产出以隔离音系能力,其合格录音进入第二环。第二环用标注与半音归一化,以韵核为单元提取多时间点基频序列与时长和音高极值,其参数序列进入第三环增长曲线分析与线性混合效应建模,分别检验轮廓截距斜率曲率与离散参数的组间差异。与普通话母语儿童先高平后降再升最后低曲折的路径不同,白语儿童呈现先升调后高平再曲折与降调的顺序,关键机制差异在于早期二语范畴形成仍受母语声调空间同化主导而非单纯按声学复杂度习得。原文未提供可核对的关键定量结果。该结论的适用边界限于云南特定白语社区的早期白语普通话二语者单字调产出,语流变调与感知能力等外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
133. 走快了说也快,说快了走却不快:走路加说话的不对称耦合
英文题目:Do walking and talking entrain in a simultaneous walking + talking task?
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Alice Turk:机构信息未能从会议 PDF 纯文本可靠映射
- Bin Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Kuilin Li:机构信息未能从会议 PDF 纯文本可靠映射
- Marisa Flecha-Garcia:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究检验同步步行加说话是否双向夹带,输入为45米户外步行中朗读普通话北风与太阳段落或重复音节/pɑ/的音频与步数视频,输出为平均步长与去停顿平均音节时长或/pɑ/间隔,难点在于区分振荡器耦合、节拍对齐、经头部运动的生物力学互动与整体生理唤醒四种解释。方法链分三步推进:先以站立朗读与常速步行练习确立单任务基线,再将20人分为步行指导组与说话指导组在慢速常速快速三档下完成双任务试验,最后逐试次计算对数化平均步长与平均音节时长。提取的步长与语速指标直接进入以对数时长互为预测的线性混合效应模型检验,随机截距与斜率按被试建模并用Satterthwaite方法评估显著性。与步行加咀嚼的对称耦合不同,该设计的关键机制差异在于对比非周期性段落与周期性/pɑ/重复,并双向检验指导模态对非指导模态的影响,从而判断是否存在可供步伐对齐的语音节拍。在同时步行加重复/pɑ/音节的双任务条件下,步行指导组的对数时长回归斜率指标为1.62,高于说话指导组的对数时长回归斜率指标的.06。结论的适用边界受限于健康青年普通话者在户外短距朗读与单音节重复任务,尚未验证向自发对话、歌唱或病理步态的外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
134. 长短时间尺度对不齐:ALS 构音障碍中频谱流与语调短语起点的相位一致性下降
英文题目:Cross timescale coherence as a biomarker in speakers with ALS
标签:#语音生物标志物 #时频分析 #韵律 #语音 #病理语音评估
评分:5.2/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.4/0.5 | 工程/实践 0.4/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#时频分析
👥 作者与机构
- Jessica Campbell:机构信息未能从会议 PDF 纯文本可靠映射
- Dani Byrd:机构信息未能从会议 PDF 纯文本可靠映射
- Louis Goldstein:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为朗读段落的声学录音,输出是频谱流与语调短语起始之间跨尺度相干的定量度量,难点在于ALS继发构音障碍的停顿延长、呼吸噪声与发音速度变异会同时污染短时频谱与长时韵律两个尺度。方法链分三步:先对25ms窗MFCCs参数2-13差分求和并低通滤波得到频谱流,其输出直接作为后续相位分析的时间函数;再以250ms最小停顿幅度阈值检测语调短语起始并计算其发生频率,为相干分析提供长端锚点;最后在每个起始点前后各取2.5秒窗做0至15Hz频带分解并以成对相位一致性度量各频带相位规律性。与既往聚焦音节与重音耦合的研究相比,本文把长端锚定到包含停顿的短语规划单元,从而分离韵律规划节律与运动启动耦合,实际意义在于检验规划保留而启动受损假说。在Hunter朗读语料任务下,典型组平均语调短语起始次数指标为20次,高于ALS组平均语调短语起始次数指标19次。语调短语起始频率组间无显著差异而频谱流频率显著偏低的分离,支持规划相对保留而启动耦合受损的解释。该结论适用边界受限于英语朗读短段落与7例ALS对8例对照的小样本,尚未验证自发对话与疾病分期外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
135. 都听基频轮廓,为何声调母语者更会放弃无效线索:粤语与英语听者辨别泰语声调
英文题目:Optimizing Utilization: Language Experience and F0 Dimension-weighting in Thai Tone Perception
标签:#心理声学实验 #言语感知 #语音 #语音属性识别
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Runqing Cheng:机构信息未能从会议 PDF 纯文本可靠映射
- William Choi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为泰语五声调在四个音节、男女各一名发音人条件下的自然语音,输出为无泰语经验的粤语听者与英语听者在跨性别AX辨别任务中的相同与相异判断,要求克服说话人差异仅依声调决策,难点在于基频高度、轮廓、起点与终点多线索耦合且跨语言权重未知。方法链分三步:先用跨性别AX辨别任务收集行为反应并换算辨别敏感度d’以控制反应偏向,得到的组平均正确率直接作为后续权重反推的因变量;再用Praat提取基频高度、轮廓、起点与终点四维声学量并以单因素多元方差分析检验其对声调类型的区分有效性,为权重解释提供 cue有效性基准;最后计算试次内两刺激间绝对声学差异与组平均正确率的Pearson相关以反推权重。相对已有方法的关键机制差异在于同时检验自下而上心理声学选择与语言经验驱动偏向,预测有效线索共享而无效线索分化,其实质意义是揭示非母语声调感知中声学显著性与母语经验的交互利用方式。在跨性别AX辨别任务条件下,英语听者的F0轮廓Pearson相关为r = .43,高于粤语听者的F0轮廓Pearson相关r = .42,且两组均仅在轮廓维度呈显著正相关。结论适用边界仅限于实验室条件下特定泰语音节的成年粤语与英语听者辨别,尚未验证训练迁移、其他母语或连续语流表现。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
136. 压低末尾音高峰反而更快:听损者话轮结尾预测中的韵律线索取舍
标签:#心理声学实验 #韵律 #语音 #轮次切换
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#轮次切换 | 主方法:#心理声学实验
👥 作者与机构
- Lorenza Zaira Curetti:机构信息未能从会议 PDF 纯文本可靠映射
- Hae-Sung Jeon:机构信息未能从会议 PDF 纯文本可靠映射
- Lauren Hadley:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究面向听力损失听者的会话轮次末端预测,输入为自然朗读的英语wh-疑问句音频,输出为按键预测的结束时刻及努力度与自信度,难点在于听觉退化下需提前利用微弱韵律线索而非被动等待静音。方法链分三步:先由青年南部英格兰男性以会话风格录制189个常识问句并预试均衡难度,输出难度相当的目标与填充问句集进入下一步。再用Praat提取并重合成句末基频轮廓,形成自然、增强与降低三种条件,输出仅基频峰高与下降起点不同的可比刺激进入下一步。最后通过在线按键任务采集相对题偏的速度与绝对距离的精度反应时并关联下降起点时长,输出速度与精度的条件差异进入解释。与既往以夸张基频峰值增强显著性改善识别的思路不同,本文假设压低末重音峰值并提前呈现语调短语边界低边界与延长下降更能提供早期预警,实际意义在于以语言结构对齐的早期线索促进预测而非增加显著性。在在线按键任务条件下,降低条件的速度反应时指标为193 ms,低于增强条件的速度反应时指标224 ms。该结论适用边界受限于安静下单说话人朗读问句与句末降调,主观评分触顶,且尚未验证噪声、多说话人、自发对话及经听力学确诊人群的外推,失败条件包括设备差异噪声与自报告听力样本偏差。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
137. 字都对,意思却偏了:生成语音为何传达不好信息结构
英文题目:Evaluating prosodic encodings of information structure in generative speech AI
标签:#主观评测 #模型评估 #韵律 #语音 #文本到语音
评分:5.2/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:数据集与基准 | 主任务:#文本到语音 | 主方法:#主观评测
👥 作者与机构
- Jianjing Kuang:机构信息未能从会议 PDF 纯文本可靠映射
- Ethan Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Kevin Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
文本到语音的输入是附带疑问语境的目标句“Molly mailed a melon”,输出是需正确标记宽焦点与主语、动词、宾语窄焦点的自然语音,难点在于相同字面须依语用意图产生不同的时长、基频与强度实现,否则含义会被遮蔽或误读。该工作先以问答范式诱发四种信息结构条件,将同一设计并行施加于人类说话人与七个显式与隐式控制系统以保证可比;再经Charsiu强制对齐切分词边界并在Praat中提取归一化时长、最大基频与平均强度,输出进入听辨实验。听辨实验在PCIbex上呈现179个音频片段,要求被试完成自然度打分、人机判断与焦点分类,使声学对比与感知准确率共同决定优劣。相比以往整体质量评测,该设计以词汇完全相同的最小对立隔离韵律能力,区分了显式标记语言与隐式上下文提示两类控制路径并量化其总体对比度与感知相关性。在包含宽焦点与三种窄焦点条件的听辨评测任务下,Gemini的焦点识别准确率为62.50%,高于ElevenLabs的焦点识别准确率29.92%。该结论适用边界受限于英语单句受控朗读,窄焦点在句尾显著退化且自然度与准确性相互权衡,尚未验证长篇对话、情感与多语言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
138. 先一致还是先趋同:立场一致如何塑造后续语速趋同
英文题目:Speech Rate Convergence as a Function of Prior Stance Agreement and Perceived Social Dynamics
标签:#统计分析 #韵律 #社会语音学 #语音属性识别
评分:5.2/10 | 创新 1.1/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Wei Lai:机构信息未能从会议 PDF 纯文本可靠映射
- Delin Deng:机构信息未能从会议 PDF 纯文本可靠映射
- Duane Watson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理自然双人对话中言语速率趋同是否受先验社会结盟影响的方向性难题,输入为公开表态后的协作解谜对话音频,输出为双人归一化音节速率绝对差,难点在于既往多在对话后收集好感度量,无法区分因为喜欢而趋同还是因为趋同而喜欢。方法链分为三步:首先通过预测试挑选立场一致与分歧议题并以同步举牌公开结盟状态,输出匹配与不匹配的社会先验分组;其次令被试完成主题独立的困境案例协作讨论,将上述分组带入自发语音采集;最后用音节核检测提取速率并以线性混合效应模型检验调节作用,输出收敛差异估计。与以往事后收集亲和度的工作不同,该设计把社会信息在时间上前置为自变量,从而直接对比沟通适应理论与互动结盟模型的预测。在四轮陈述立场与案例解决配对任务下,StatementStanceMatch×Agency交互的卡方指标为6.27,高于StatementStanceMatch×Attractiveness交互的卡方指标3.71。该结论适用边界受限于短时实验室任务与美国高校本科生群体,尚未验证基频与强度等多维趋同及个体非对称效应。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
139. 绕口令里的加速与升调:口语流利自闭症儿童的性别差异与症状关联
标签:#语音生物标志物 #统计分析 #韵律 #语音 #病理语音评估
评分:5.2/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Wei Lai:机构信息未能从会议 PDF 纯文本可靠映射
- Mark Liberman:机构信息未能从会议 PDF 纯文本可靠映射
- Azia Knox:机构信息未能从会议 PDF 纯文本可靠映射
- Meredith Cola:机构信息未能从会议 PDF 纯文本可靠映射
- Riccardo Fusaroli:机构信息未能从会议 PDF 纯文本可靠映射
- Julia Parish-Morris:机构信息未能从会议 PDF 纯文本可靠映射
- Sunghye Cho:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为儿童自闭症研究中心采集的65名英语母语学龄儿童居家朗读录音,涵盖常规句与加速绕口令两种条件,输出为基频半音值与每秒音节语速的任务增量,实际难点在于自闭症韵律异质性大且既往男性样本主导易掩盖女孩特征。方法链分三步:首先按统一指令呈现常规句与加速绕口令并采集朗读语音,经多级标注得到逐句切分,切分结果进入声学分析。然后提取基频半音值与语速并以绕口令减常规句得到任务增量,该增量进入分组统计。最后按性别与诊断分组比较增量并与SRS-2与BRIEF量表做相关分析,以揭示性别特异模式与症状严重度关联。与既往朗读与访谈任务相比,关键机制差异在于用加速指令制造发音与认知负荷以放大计划与投入差异,具有行为探针意义。在ADOS-2临床评测任务下,ASD组的ADOS-2 Total得分为6.53(2.0),高于TD组的ADOS-2 Total得分1.18(0.4)。结论适用边界仅限于言语流畅且智商匹配的英语母语学龄儿童,尚未验证重度自闭症与共患语言障碍的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://doi.org/10.1002/wics.147 → https://wires.onlinelibrary.wiley.com/doi/10.1002/wics.147 — 链接不可用(HTTP 403) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
140. 非法还是非词:声调搭配与词汇身份如何压缩听感距离
标签:#心理声学实验 #言语感知 #语音 #语音质量评估
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音质量评估 | 主方法:#心理声学实验
👥 作者与机构
- Pauline Bolin Liu:机构信息未能从会议 PDF 纯文本可靠映射
- Mingxing Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究任务是检验母语声调配位与词汇知识如何影响相对可区分度判断,输入为一次听到的两对普通话音节对序列,输出为哪一对内部差异更大的二选一判断及决策反应时,难点在于声学差异、配位合法性与词汇对应性相互纠缠难以分离。先以北京官话男性发音人产出的双音节无意义词首目标音节录音为输入,对时长、基频与强度做规整以保证典型表征,输出规整后单音节刺激。再以规整后单音节刺激为输入,按非法-合法对决合法-合法对等关系承担构对职责,将鼻边音与高平、升、降调组合构成六类比较序列,输出可直接施测的两对序列。最后以两对比较序列为输入,承担施测与分析职责,采集二选一判断与对数反应时并做拟合优度卡方与混合效应分析,输出配位、词汇与声学因素的分离效应。与已有单音节沿连续统辨认研究相比,关键机制差异在于用两对之间相对区分度比较替代绝对范畴辨认,直接检验非法与非词表征在比较中的弱化效应,具有揭示比较性知觉的作用。在S1序列比较任务设置下,含非法音节对
\[naHH\-laHH\]的被判更分立比率指标为0.28,低于全合法对
\[naLH\-laLH\]的被判更分立比率指标0.72。结论适用边界仅限北方官话母语者对鼻边音与高平、升、降调组合的判断,尚未验证其他辅音、声调及跨方言外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
141. 缺上下文就掉线、缺节奏要分心:主观认知下降在不同表达风格下的听觉追踪
标签:#统计分析 #音乐 #脑信号 #语音 #病理语音评估
评分:5.2/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Matthew King-Hang Ma:机构信息未能从会议 PDF 纯文本可靠映射
- Manson Cheuk-Man Fong:机构信息未能从会议 PDF 纯文本可靠映射
- Yun Feng:机构信息未能从会议 PDF 纯文本可靠映射
- Cloris Pui-Hang Li:机构信息未能从会议 PDF 纯文本可靠映射
- William Shiyuan Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入是认知正常粤语老年人连续聆听多种语音与音乐风格时的脑电与声学特征,输出是主观认知下降严重度对皮层追踪强度的调节效应,难点在于客观认知正常阶段效应微弱且听力损失与情绪评价混杂难分离。先构建效价匹配的语音音乐刺激并采集连续聆听脑电与自评,其输出进入声学特征提取;再提取包络与包络起始并分低频段滤波,得到分频段神经与刺激时间序列;接着以多变量时间响应函数拟合刺激到脑电的编码映射并以留一刺激交叉验证相关度量追踪强度;最后用线性混合效应模型检验严重度与风格交互并做事后比较。与聚焦记忆执行功能的研究相比,该机制把感觉退化与认知补偿拆分为无语境语音的自下而上失真与无节拍音乐的自上而下注意维持,具有早期标志物意义。原文未提供可核对的关键定量结果。该结论适用边界仅限粤语非音乐家老年人横断聆听场景,尚未验证纵向转归为轻度认知障碍的能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
142. 看得见的重音:波斯语焦点越强,头部摆动越大越快
英文题目:Visual prosody in Persian: Tracking 3D head movement patterns with electromagnetic articulography
标签:#统计分析 #发声与构音 #韵律 #语音 #语音属性识别
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Doris Muecke:机构信息未能从会议 PDF 纯文本可靠映射
- Lena Pagel:机构信息未能从会议 PDF 纯文本可靠映射
- Philip Georgis:机构信息未能从会议 PDF 纯文本可靠映射
- Mortaza Taheri-Ardali:机构信息未能从会议 PDF 纯文本可靠映射
- Simon Roessig:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为问答诱发的背景、宽、窄、纠正焦点波斯语载体句同步音频与三维头部运动,输出为目标词附近位移与速度随显著度等级的变化刻画,难点在于节拍幅度小、方向多变且个体差异大。先以电磁发音仪跟踪双耳与鼻尖传感器并拟合广义加性混合模型生成三维动画,定性确认周期性运动形态,其确认鼻尖最能捕捉头部旋转因而选定鼻尖进入定量分析。再以鼻尖窗内最远两点欧氏距离量化位移并用贝叶斯多层模型检验焦点等级,其位移等级排序结果进入速度时间序列建模。最后对鼻尖速度建模以分离整体快慢与波形形状效应。与既有视频分析相比,该方法以高时空分辨率连续运动学参数替代离散标注,能同时检验位移幅度与双峰速度包络。在问答诱发的背景、宽、窄、纠正焦点语料条件下,纠正焦点的速度指标为5.43,高于窄焦点的速度指标3.36。结论适用边界受限于实验室诱发的伪名载体句与习惯朗读风格,自发对话与大动作手势尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
143. 朗读与自发语体下性取向语音差异:为何身份标记只在自发 speech 中显现
英文题目:Interactions of sexuality and (supra)segmental correlates of speech register
标签:#统计分析 #社会语音学 #语音 #语音属性识别
评分:5.2/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Liza Sulkin:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为波士顿地区18岁以上美式英语母语的女同、双性恋、异性恋指定女性出生者各15人的社会语言学访谈与两次朗读录音,输出为朗读与自发语域下平均基频、F0范围、元音离散度与发音速率随性取向的变化,难点在于语域省力效应与身份索引效应交织且既有文献在F0与元音空间方向上结论冲突。先进行语料采集与转写对齐,输入访谈与彩虹通道朗读录音,职责是获取每次发声的正字转写与音素边界,输出平均每人6分钟朗读与24分钟自发语音及元音区间,该区间直接作为后一步声学测量的定位依据。再进行声学特征提取,输入上述元音区间波形,职责是在元音中点计算基频、F1与F2的Bark离散度并用公开Praat脚本估计每秒音节发音速率,输出逐元音特征矩阵,该矩阵直接进入后一步回归模型的因变量。最后进行分语域与合并建模检验,输入特征矩阵中的性取向与语域标签,职责是比较含交互项与不含交互项模型的拟合以检验语域调节效应,输出各声学指标的组间差异估计。与以往只看单语域且合并酷儿群体的做法不同,本文把语域作为调节变量并保留女同与双性恋三分,提出身份凸显依赖非正式互动,具有强调自然语料的实际意义。在波士顿自发与朗读语料交互检验条件下,自发语域与异性恋交互项的F0范围指标为14.16,高于自发语域与双性恋交互项的F0范围指标11.21。该结论适用边界仅限年轻波士顿英语指定女性出生者与酷儿女性访谈者情境,尚未验证话题熟悉度与跨方言外推及感知显著性,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
144. 法语歧义边界靠什么分开:母语者的上扬与拉长,中级以上二语者才跟上
标签:#统计分析 #语言习得 #韵律 #语音 #语音属性识别
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Lei Xi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为5对仅靠韵律边界位置区分句义的法语歧义句,覆盖早期闭合与晚期闭合两种条件,输出为边界前元音是否以边界上升调与末音节延长标记边界,难点在于汉语靠音区重设而法语靠上升调加延长,迁移路径不明。先招募10名法国本土成人与21名中国学习者并按自评分为高、中、低三组,以正常语速中性情感朗读每句两遍,其620句录音输出进入切分环节。再经SPPAS自动切分加作者人工校对,在Praat语音与词汇两层标注上定义四类关键元音,其元音区间输出进入测量环节。最后提取元音时长与元音内20%至90%处基频差并以线性混合模型加Tukey事后检验做组内边界对照,以判定上升与延长是否成立。与中国学习者英语消歧研究相比,本文把早期与晚期闭合配对范式迁移到法语并同时检验旋律与时长两类标记,具有跨语言验证意义。在正常语速中性情感朗读条件下,本土组的F0差值指标增幅为119%,高于低水平学习者组的F0差值指标增幅33%。结论适用边界受限于受控朗读、正常语速与中性情感条件,尚未验证自发对话与感知消歧及停顿行为的外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
145. 做到了音高目标,却没衔接好过程:法语母语者普通话声调四一声连接的时序证据
标签:#统计分析 #语言习得 #韵律 #语音 #语音属性识别
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Yingyu Yan:机构信息未能从会议 PDF 纯文本可靠映射
- Jorina Brysbaert:机构信息未能从会议 PDF 纯文本可靠映射
- Anne-Catherine Simon:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为中性焦点问答诱发的T4-T1a-T1b连续语音,输出为跨音节协同的过程失调与声调目标达成结果的分离判断,实际难点在于T4急降后须立即稳住高平T1,稍有定时偏差就会在边界形成凹陷而非目标本身不达标。方法第一步经Whisper转写加SPPAS强制对齐并经Praat听辨与频谱图人工校正获得音节边界,为声学测量提供切分基础。第二步将基频转换为相对个人中值的半音并用定制Praat脚本抽取目标与动态指标,其输出直接进入第三步的线性混合效应模型检验组别效应并控制音节时长与说话人与条目随机截距。相对孤立声调研究的关键机制差异在于把许的基频目标实现框架操作化为以谷点定时与T1a凹陷表征过程、以T4跌幅与T1平台高度表征结果,其实质意义是把教学焦点从静态音高转向音节间衔接定时。在中性焦点问答语料条件下,L2学习者组的指标t4_drop_range_st为5.23 st,高于L1母语者组的指标t4_drop_range_st的5.12 st。该结论适用边界受限于法语母语且HSK4级、无超12个月汉语区居留的学习者在特定调序与中性焦点下的表现,其他非声调母语背景是否成立尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
146. 焦点重音放在句首还是句尾:3 到 9 岁儿童如何从随机猜测走向成人式感知
标签:#心理声学实验 #语言习得 #韵律 #语音 #语音属性识别
评分:5.2/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Sichen Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Aijun Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理普通话窄焦点在句首句中句末三处位置的听辨发展问题,输入为重合成的韵律连续统刺激,输出为焦点位置判断,难点在于词汇声调与焦点引起的基频变化在同一基频曲线上叠加,且3到9岁儿童注意与执行功能不稳定易引入变异。方法链首先录制五音节源语句并提取十点基频与韵母时长,在半音域做等距插值生成11步连续统,再经PSOLA重合成保留音段音质而替换整体韵律并协变时长。上一步输出的连续统进入行为施测,对儿童施测ABX韵律匹配、对成人施测三选一标识,最后用逻辑回归拟合反应曲线估计阈值斜率与交叉区并用广义加性混合模型检验年龄组差异。与仅操控焦点音节局部的范式不同,本研究坚持全句整体操控以保留焦点内音域扩张与焦点后压缩等关系性线索,更贴合汉语语调音系对焦点效应的描述。在端点焦点位置标识任务条件下,8;1以上儿童组的准确率为91.1%,低于成人对照组的准确率93.1%。曲线由3;1-4;6的平坦高变异经4;7-7;0中部渐陡发展至7;1后成人样S形,阈值与斜率在5;1-5;6后稳定而交叉区至7;1-8;0收窄,句末对比与有意义音节更早更稳。结论适用边界限于北京地区单语典型发育儿童的离线行为感知,尚未验证在线加工与跨方言外推,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://support.pstnet.com/ → https://support.pstnet.com/hc/en-us — 链接不可用(HTTP 403)
- 第三方资源:https://ggplot2.tidyverse.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
147. 句法标出焦点后重音为何变轻:普通话分裂句的韵律补偿
标签:#人类参与评测 #韵律 #语音 #语音属性识别
评分:5.2/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.4/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#人类参与评测
👥 作者与机构
- Ziyan Zou:机构信息未能从会议 PDF 纯文本可靠映射
- Anja Arnhold:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为诱发主语焦点、地点焦点、宾语焦点与宽焦点的问句语境,输出为说话人选择的句法结构与焦点词声学实现,难点在于分裂句句法标记与韵律凸显功能重叠,固定朗读难以分离选择策略与实现强度。方法先以信息不对称问答游戏诱发半自发产出,书写任务封锁韵律通道而口语任务开放双通道,研究者按键猜测焦点以维持交际压力。接着由母语标注者切分音节与词边界并由第一作者校正Praat基频跟踪错误,提取焦点词f0范围、f0最大值、f0最小值与词时长并做说话人内归一化,输出进入统计检验。然后以线性混合效应模型检验句法类型、成分与声调交互并做事后比较,以量化句法有无对韵律凸显的影响。与限定朗读的前人工作相比,关键差异在于允许自由选择句法,从而观察到补偿性弱化而非叠加增强,具有揭示线索经济性的实际意义。在口语窄焦点条件任务下,无标记句的占比指标为超过70%,高于主语焦点下分裂句的占比指标17.7%。结论适用边界限于受控双音节主语与Tone1/Tone4材料下的实验室半自发普通话,尚未验证自发对话与其他声调组合及知觉有效性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
148. 孩子把《戴帽子的猫》读得像大人吗:用词时长偏离度预测阅读理解
标签:#教育 #统计分析 #韵律 #语音 #语音属性识别
评分:5.1/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Mara Breen:机构信息未能从会议 PDF 纯文本可靠映射
- Katerina Drakoulaki:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为91名6-10岁儿童朗读《戴帽子的猫》全书的连续词时长序列,输出为KTEA-3阅读理解标准化分数,难点在于将可听的时长伸缩归因于韵律流畅性而非解码速度、词频或词类差异。方法链第一步以17名成人朗读的27118个词时长拟合回归基准,刻画格律层级、句法边界、词长、词频与强调的规范效应,其输出的预测时长进入下一步作为参照。第二步将每个儿童实测词时长代入成人模型逐词求残差并加总为韵律误差分,该误差作为个体偏离成人韵律的表征进入下一步。第三步将韵律误差与语音意识、加工速度及年龄共同纳入线性回归以预测理解分数,从而分离韵律的独立贡献。相对印象式流畅性评分的关键差异在于以可复现的声学距离替代主观判断,其实测意义是让高度可解码韵文的加工负荷降低后高层结构实现得以显现。在91名6-10岁儿童朗读语料预测阅读理解任务下,语音意识对KTEA标准分数的估计得分为0.22,高于加工速度对KTEA标准分数的估计得分0.13。该结论适用边界受限于无阅读障碍英语母语儿童朗读高度规则韵文的横断面关联,尚未验证自然散文、自发韵律或干预因果,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://escholarship.org/uc/item/6g36v229 — 链接不可用(HTTP 403) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
149. 降阶重音真的更省力吗:用瞳孔扩张检验可及与全新语境下的韵律适配
英文题目:Using pupillometry to assess the interpretation of downstepped contours in Mainstream US English
标签:#心理声学实验 #韵律 #言语感知 #语音 #口语理解
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Rachel Burdin:机构信息未能从会议 PDF 纯文本可靠映射
- Casey Roark:机构信息未能从会议 PDF 纯文本可靠映射
- Jill Thorson:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理主流美国英语中降阶轮廓与信息状态是否匹配的在线理解问题,输入为前语境加语境加目标句的双句语篇,输出为目标句偏置后瞳孔直径相对基线的比例变化所反映的加工负荷,难点在于降阶本质上是依赖前一重音的关系性音高结构且内省式适切度判断难以反映实时认知努力。语境操控步骤通过上位词与习惯性副词构造可及与全新指称条件,其受控语篇输出直接作为声学刺激生成的输入。声学受控步骤由单说话人录制高星序列与降阶轮廓并经直线近似加PSOLA重合成统一基频曲线,其一致化刺激输出直接进入生理记录环节。生理统计步骤以语境偏置后500毫秒静默窗均值校正基线并在目标句偏置后2秒静默窗连续记录瞳孔,再以广义加性模型拟合非线性时间曲线并以95%置信区间非重叠判定差异。在声学一致化合成设置下,核前词的基频指标为240 Hz,高于目标词的基频指标224 Hz。相对需外显判断的离线匹配与评分任务,该链无需外显判断即可在复述诱发前分离新信息入库成本与韵律失配成本,具有在线捕捉隐性加工的实际意义。结论适用边界受限于受控合成轮廓与实验室恒定光照下的36名年轻成人听者,向自发语流与多说话人的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://escholarship.org/uc/item/68q9c2r8 — 链接不可用(HTTP 403)
- 第三方资源:https://www.sr-research.com/eyelink-1000-plus/ — 链接可访问(HTTP 200)
- 第三方资源:https://osf.io/a — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
150. 句子变难时音高拉大还是压平:3 到 5 岁普通话儿童的范围与稳定性分化
英文题目:Linguistic Complexity Modulates Pitch Variability in 3-5-Year-Old Mandarin-Speaking Children
标签:#统计分析 #语言习得 #韵律 #语音 #语音属性识别
评分:5.1/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Lu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Aijing Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuhan Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为3至5岁普通话儿童自发对话中的陈述句语音与转写文本,输出为基音频率派生的句内Pitch Range与Pitch SD,难点在于声调词汇功能与语调结构功能共享同一音高通道,且认知负荷与运动控制成熟度共同干扰变异解释。筛选ChildMandarin语料中45名轻微口音儿童每人30句共1350句并以平均话语长度等验证组间发展阶段差异后,用Praat自相关算法提取F0并计算极差与标准差,其输出直接进入下一步复杂度计算。接着用spaCy分词与依存分析得到平均词数、异词数与句法树深度及生产性句法与发展性句子评分近似值并以第一主成分解释59.32%方差构成句法综合指数,最后用以被试为随机截距的线性混合效应模型检验复杂度与年龄交互并以emmeans做简单斜率分解。相对已有在非声调语言中争论高负荷压缩或扩张的机制,本研究利用普通话高功能负荷情境同时检验节约、唤醒与权衡预测,揭示音域扩张与标准差稳定分离的权衡意义。在ChildMandarin语料任务下,4岁组相对3岁组的Pitch Range指标为-2.07,低于5岁组相对3岁组的Pitch Range指标-1.99。该结论适用边界限于5至12字陈述句自发对话场景,疑问句与朗读任务及纵向个体发展轨迹尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
151. 声调管空间、焦点管时间:台湾华语辅音手势的两种突出机制
英文题目:Distinct Articulatory Effects of Tone and Focus in Taiwan Mandarin
标签:#统计分析 #发声与构音 #语音学与音系 #韵律 #语音属性识别
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Sherry Chien:机构信息未能从会议 PDF 纯文本可靠映射
- Argyro Katsika:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
台湾华语需在同一基频通道同时编码词汇声调与焦点语调,输入为短语中介位置单音节目标词,输出为焦点类型与声调类别对超喉部构音手势的影响判定,难点在于二者共享音高资源时难以区分空间贡献与时间贡献。研究先用电磁发音仪同步采集唇与舌位移并以问答语境诱发窄焦点与对比焦点等多种信息结构,获得声学与运动轨迹配准的连续数据。接着用基于速度阈值的半自动标注提取词首辅音手势的形成时长位移与峰值速度,将上一阶段连续运动切分为可比较的形成与释放关键点。最后以焦点与声调为固定效应的线性混合效应模型做校正比较,将运动学差异归因于固定效应并控制发音人与词段构成随机截距。与重音语言中重音与焦点同时调制位移和时长不同,该工作发现声调主导空间幅度而焦点主导时间扩展,体现声调语言特有的资源分工。原文未提供可核对的关键定量结果。结论的适用边界目前仅限于词首辅音手势与短语中介位置,尚未验证元音手势韵律边界位置与声学扩张的中介机制。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://escholarship.org/uc/item/62w9h491 — 链接不可用(HTTP 403) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
152. 重叠只是难念,还是真的在抢同一个节律槽位:语音计划中有没有抽象重音格
英文题目:Evidence of Absence? Abstract Metrical Structure in Speech Planning
标签:#人类参与评测 #语音学与音系 #韵律 #语音 #语音属性识别
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.3/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#人类参与评测
👥 作者与机构
- Yang Di:机构信息未能从会议 PDF 纯文本可靠映射
- Mara Breen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究检验英语双音节词朗读中节律结构是否独立于音段规划,输入为正交操控节律重叠、首音节重音与词首音段重叠的词对,输出为高速重复下的平均词对时长、正确完整重复数与言语错误数,难点在于分离纯节律竞争与全词音段相似带来的词汇激活混淆。方法链分三步衔接:先构造160对刺激并计算不含重音标记的Levenshtein语音距离以获得全词梯度控制量,其距离输出作为协变量进入后续建模;再经4秒默读加8秒口头高速重复采集语音,其录音进入标注环节;最后用Praat人工标注与Montreal Forced Aligner强制对齐提取三项指标,并以线性混合效应回归检验主效应与交互。相对Myers and Watson仅保留词首重叠的做法,新设计新增无词首重叠条件并引入全位置距离控制,使节律主效应可在无词首重叠时被分离检验,具有澄清独立规划阶段的实际意义。在初始音段重叠模型评测条件下,初始音段重叠条件的正确完整重复数指标估计为-0.51,低于节律重叠条件的正确完整重复数指标-0.32。结果呈现指标分裂:时长无节律主效应,而重复数与错误数支持抽象节律表征。该结论适用边界受限于程式化高速重复的双音节词任务,尚未验证自发语述、长词与跨语言外推,且小样本下时长零效应无法区分证据缺席与缺席证据。原文未披露训练、推理或部署成本。
🔗 开源资源
- 复现相关资源:https://osf.io/987c4/overview — 链接可访问(HTTP 200)
- 第三方资源:https://www.findingfive.com/ → https://us.findingfive.com/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
153. 句首鼻音变弱、句尾元音鼻化变弱:北京话声门开合与舌动作的时间竞争
英文题目:Prosodic effect on initial coronal nasal /n/ and post-nasal vowel nasalization in Beijing Mandarin
标签:#统计分析 #语音学与音系 #韵律 #语音 #语音属性识别
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Yijing He:机构信息未能从会议 PDF 纯文本可靠映射
- Wai-Sum Lee:机构信息未能从会议 PDF 纯文本可靠映射
- Chu Yan Ho:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为6名北京普通话母语者在句首、句中、句尾与孤立词四种韵律位置朗读的含齿龈鼻音/n/的去声单音节词/ni51 nu51 na51/,输出为/n/鼻属性与后接元音顺向协同鼻化随位置的变化规律,难点在于鼻化声学指标难以跨高低元音系统比较,且难以分离协同发音抗性与韵律强化的各自贡献。方法链分三步:先以双腔口鼻面罩同步采集口鼻气流并经140 mL注射器校准将压力换算为流率,再经Praat手动切分/n/与元音区间并做40 Hz低通与5 Hz平滑去噪以提取平均与峰值气流、总气流、相对峰时间、鼻持续时间与鼻比率指标,继而以线性混合效应模型与Beta广义线性混合模型分离位置、元音及其交互并做Tukey校正的事后比较。与既往声学研究相比,本文以空气动力学直接度量软腭开闭时序与流量累积,能区分鼻流量绝对量与口鼻分配比例的不同走向,具有厘清时序压缩与分配增强的实际意义。在宽焦点朗读语料评测条件下,句尾相对句首的鼻比率指标差异Δ为0.59,高于句尾相对孤立词的鼻比率指标差异Δ0.22。该结论适用边界仅限慢速宽焦点朗读的三词去声样本,语速、重音等级、自发语与感知可辨性等外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://cran.r-project.org/package=flux → https://cran.r-project.org/web/packages/flux/index.html — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
154. 没有声调就没有重音:泰语重音回忆揭示重音与声调的依赖关系
英文题目:No stress without tone: insights from Thai stress recall
标签:#心理声学实验 #韵律 #言语感知 #语音属性识别
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Constantijn Kaland:机构信息未能从会议 PDF 纯文本可靠映射
- Komtham Domrongchareon:机构信息未能从会议 PDF 纯文本可靠映射
- Ruben van de Vijver:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
泰语同时具有固定词重音与五个词汇声调,任务输入为三至五词无意义音节序列,输出为按键回忆的音位或重音模式,难点在于时长、强度与基频三线索高度纠缠且声调功能负载优先使重音难以分离感知。方法首先复用荷兰语与波斯语发音的48个nonce词原始刺激,先经按键映射学习与暖机再完成30试次回忆测试以建立可比基线。接着用Praat重合成将基频展平为中位水平而保留其他线索,其输出直接作为第二组被试的测试刺激以隔离音高贡献。最后以广义线性混合模型比较基频条件、对比类型与序列长度效应,相对既有产出研究仅靠时长即可的结论,该设计关键差异在于感知端剥离基频并以音位回忆为对照。在三至五词序列回忆任务条件下,展平基频刺激的指数指标为62.22,高于原始刺激的指数指标24.36。这表明感知阶段高度依赖音高而非时长,揭示重音与声调的依存关系并修正重音为独立词汇属性的主张,具有澄清功能负载假说在泰语中表现的意义。该结论适用边界仅限标准中部泰语孤立词层面,尚未验证连续语流与具体声调类别归因等外推范围。原文未披露训练、推理或部署成本。
🔗 开源资源
- 复现相关资源:https://osf.io/xwmka/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
155. 弱元素也能被强调吗:天津话七类弱成分的整体抬高与各自封顶
英文题目:The Effect of Focus on Different Weak Elements Categories: In the Case of Tianjin Mandarin
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:5.1/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Zhijie Li:机构信息未能从会议 PDF 纯文本可靠映射
- Hui Feng:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为天津话双音节词组中居第二音节的七类弱元素,输出为窄焦点与无焦点下弱元音基频轨迹形态与上下边界,难点在于弱成分时长短且缺乏稳健调目标、音高多由前字顺承决定,难以判断其能否承载重音。先以语义语法分类为输入,承担七类划分与前字四声覆盖职责,输出窄焦点与无焦点配对语料库。再以该配对语料为输入,组织12名母语者隔音室录音并经xSegmenter自动切分加人工校对,输出每元音十个等距基频点经50赫兹参考转半音再做z分数归一化的曲线。最后以归一化曲线为输入,承担增长曲线分析与线性混合效应建模职责,输出截距高度与斜率曲率及上下边界检验结果,前一步的归一化曲线直接进入模型检验环节。相对以往只谈强度频谱或混谈轻声的做法,关键机制差异是把焦点效应分解为垂直缩放与轮廓重塑,证明弱成分只有整体抬升而无斜率曲率变化,支持弱实现假设的全局抬升解释。在5608个token的语料下,叠音词的估计指标为-0.175,低于体标记的估计指标0.195。该结论适用边界是叠音词与词缀靠抬高上限、体标记靠压低下限实现扩张,而功能类、结构助词与趋向动词等高度语法化成分存在天花板效应而难以扩张,原文未披露训练、推理或部署成本
🔗 开源资源
- 第三方资源:https://cran.r-project.org/package=emmeans → https://cran.r-project.org/web/packages/emmeans/index.html — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
156. 神经音频编解码器能分清英语核语调吗:对 Mimi 的探针检验
英文题目:Probing neural audio codecs for distinctions among English nuclear tunes
标签:#评测协议 #向量量化 #可解释性 #韵律 #语音属性识别
评分:5.1/10 | 创新 1.3/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音属性识别 | 主方法:#评测协议
👥 作者与机构
- Juan Pablo Vigneaux:机构信息未能从会议 PDF 纯文本可靠映射
- Jennifer Cole:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入为美式英语短句末尾重读词录音,输出为8种核调、人类产出与感知合并的5簇以及升降二分类标签,难点在于语调与音段内容解耦且依赖长时基频轨迹。Mimi编码器先将24 kHz波形映射为12.5 Hz的512维未量化隐表示,其变换器上下文为20秒且卷积因果可流式运行,为后续探针提供时序上下文表示。量化器再对该表示并行施加向量量化与残差向量量化得到多码本码字,保留离散词元形式以便比较语义与声学码本的信息分布。聚合阶段对末尾词区间做前后衰减加权平均并经主成分分析降维为单向量,输入由交叉熵与Adam优化的线性或非线性分类探针完成调型判别。与已有编解码器可解释性工作相比,关键差异是系统比较非量化隐变量与全部码本并引入语言学定义的8调与5簇划分,质疑语义与声学码本二分,具有诊断口语对话模型语用推理缺陷的实际意义。在英语核调分类任务的测试集下,5分类探针的准确率为0.45,高于8分类探针的准确率0.31。结论适用边界仅限单语种受控短句末尾单调重音核调,5簇判别远未达人类水平且多轮对话语用推理尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://openreview.net/forum?id=AF9Q8Vip84 → https://openreview.net/challenge?redirect=%2Fforum%3Fid%3DAF9Q8Vip84 — 链接可访问(HTTP 200)
- 第三方资源:https://ieeexplore.ieee.org/document/9814838 — 链接可访问(HTTP 202)
- 第三方资源:https://doi.org/10.1093/oxfordhb/9780198832232.013.29 → https://academic.oup.com/edited-volume/34870/chapter/298317190 — 链接不可用(HTTP 403)
- 第三方资源:https://openreview.net/forum?id=91H76m9Z94 → https://openreview.net/challenge?redirect=%2Fforum%3Fid%3D91H76m9Z94 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
157. 动词前后宾语为何声音不同:伊捷尔曼语中信息状态与韵律突显的对应
英文题目:On the prosodic realization of pre- and post-verbal objects in Itelmen
标签:#统计分析 #韵律 #低资源 #语音 #语音属性识别
评分:5.0/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Lena Borise:机构信息未能从会议 PDF 纯文本可靠映射
- Jonathan David Bobaljik:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理伊捷尔曼语动宾句中前置与后置直接宾语的韵律实现差异,输入为田野叙事录音中的词汇动词与直接宾语中心语,输出为宾语韵律显著性高低判断,难点在于该语言短语韵律音系完全未知且仅有老旧单人磁带可用、样本稀少易受录音质量干扰。方法链分四步:先在ELAN与Praat中标注全部词汇动词与直接宾语中心语并剔除感知动词等复杂句,接着按前文是否提及将宾语二分为新信息与给定信息。然后用ProsodyPro提取平均强度、平均基频、基频变化幅度与词时长并转入R分析,最后以词序为固定效应拟合线性模型并以同句动词作位置对照来分离句末自然衰减。相对仅报告词序与信息结构相关的已有研究,该工作引入韵律显著性作为解释后置成分分布的中介机制,其实质意义在于以后置给定成分去重音容忍度来衔接跨语言后置成分演变的两阶段假说。在Kutkh and the mice叙事语料下,后置宾语的平均强度指标为56dB,低于前置宾语的平均强度指标63dB。结论适用边界限于灵活词尾语中给定后置宾语去重音早期阶段,信息结构与基频交互趋势未达显著且新信息后置与焦点重音情形尚未验证,受限于单讲述人小样本与固定话筒录音。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://archive.mpi.nl/tla/elan — 链接可访问(HTTP 200)
- 第三方资源:https://praat.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://ggplot2.tidyverse.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
158. 台山话声调在痉挛型构音障碍中为何高平调最先丢失
标签:#主观评测 #语音 #语音可懂度评估 #病理语音评估
评分:5.0/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#主观评测
👥 作者与机构
- Stanley Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Nancy Eng:机构信息未能从会议 PDF 纯文本可靠映射
- Stella Yank:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
台山话声调产出研究输入为构音障碍者复述的目标单音节词,输出为5个声调类别的感知归属与声学实现,难点在于呼吸与喉部控制受损会同时扭曲音高高度、曲拱与嗓音品质。方法链由4步构成:先构建4组同音节异调词并用载体句加图片诱发复述,其输出的60段录音进入5名母语者图片指认以得到可懂度矩阵;同步用PRAAT提取目标词基频(fundamental frequency, F0)起点与终点及音节时长;最后以配对t检验对比患者与对照并按高、中、低三档归并检验高度完整性。与普通话和粤语既有结论的关键机制差异是患者并未呈现水平化为平调,而是全调位塌陷为跌落型且高、中、低起点均挤在一起。在5名评判者对60个产出的感知设置下,总体准确率为36.1%,其中高平调T1仅被正确识别6%,而低平调T3达到53%。结论仅适用于该重度嗓音杂质个案的台山话产出,无法外推至其他严重度、类型或方言,也未能分离构音误差与音高控制失效。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
159. 音乐家识别言语情绪更快:韵律之外还有语义,冲突调节却未占优
英文题目:Musician Advantage for Speech Emotion Recognition: Beyond Prosody
标签:#心理声学实验 #韵律 #言语感知 #语音 #语音情感识别
评分:5.0/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音情感识别 | 主方法:#心理声学实验
👥 作者与机构
- Jing Qi:机构信息未能从会议 PDF 纯文本可靠映射
- Shuting Qi:机构信息未能从会议 PDF 纯文本可靠映射
- Kaile Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为普通话双音节词录音中语义与韵律双通道情绪线索,输出为按语义任务或韵律任务判断积极与消极情绪的按键反应,难点在于两通道同时呈现且经常冲突时需选择性注意目标维度并抑制非目标维度干扰。方法链由三步构成:先从中文EmoBank筛选正性负性与中性词并经独立听辨验证语义可分性,再由播音训练母语者以高兴与愤怒韵律录制并筛选出发音人刺激,接着以情绪斯特鲁普范式组织语义与韵律各三百试次并用混合模型分离一致性任务与组别对准确率和对数反应时的效应。与以往仅测韵律识别的研究不同,该设计把语义识别与一致不一致冲突代价同时纳入,可直接区分敏感性提升与执行控制提升,具有跨域检验意义。在语义任务与韵律任务对比条件下,音乐家组的任务间对数反应时指标效应估计β = -0.066,低于非音乐家组的任务间对数反应时指标效应估计β = -0.010。同时总体准确率维持高位且组别与一致性交互不显著,表明优势主要体现为整体更快编码而非冲突解决成本下降。该结论适用边界受限于仅验证高兴与愤怒在普通话双音节词上的效应,尚未验证复杂情绪其他语言与更强干扰下的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://cran.r-project.org/package=emmeans → https://cran.r-project.org/web/packages/emmeans/index.html — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
160. Mimi 码本分工真的切开了吗:语义码本与韵律编码的核对
标签:#统计分析 #语音学与音系 #韵律 #语音编码
评分:4.9/10 | 创新 1.1/2 | 技术严谨 0.9/1.5 | 实验充分 0.8/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#语音编码 | 主方法:#统计分析
👥 作者与机构
- Nicolas Ballier:机构信息未能从会议 PDF 纯文本可靠映射
- Artem Saloev:机构信息未能从会议 PDF 纯文本可靠映射
- Erin Pacquetet:机构信息未能从会议 PDF 纯文本可靠映射
- Taylor Arnold:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为连续语音波形,输出为Mimi神经音频编解码器的8层离散码本序列,难点在于验证官方分工是否成立:首层码本经蒸馏偏向语义与音段内容,其余声学码本应承载韵律残差,需在离散标识与连续韵律参数间建立可度量关联。方法链分三步:先用WinPitch对载体句末音节正交扰动音高、时长与滑音生成受控变体,再送入Mimi编码器得到每80ms一组的码本标识并对齐TIMIT后验图音素预测,前步离散编码直接作为后步探测输入,最后用基于汉明核的核典型相关分析度量共享结构并用TiMBL记忆学习器从末音节对应窗口预测类别。与侧重解码重建质量的平均意见分和词错误率评价相比,关键差异是将编码侧离散表征作为可探测对象并引入三维正交扰动做三角验证,其实质意义在于检验韵律是否被显式编码而非仅能重建。在合成变体与TIMIT对齐的分类任务下,时长分类的准确率为92.3%,高于音高分类的准确率15.5%。核典型相关第一维度解释约24.8%共享方差且滑音准确率仅8.1%而音素准确率为68.32%,表明时长敏感而细粒度基频斜率保留有限且预测力集中于1-3号码本。该结论适用边界受限于英语单载体句末音节受控扰动与8码本配置,尚未验证噪声、多说话人、自发语及跨语言外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://ilk.uvt.nl/timbl/ → https://languagemachines.github.io/timbl/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://openreview.net/forum?id=fgjN8B6xVX → https://openreview.net/challenge?redirect=%2Fforum%3Fid%3DfgjN8B6xVX — 链接可访问(HTTP 200)
- 第三方资源:https://www.ai-sesame.com/ — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
161. 喊“大声点”与“用点意念”:帕金森说话人为何调不准用力刻度
英文题目:Speaking “loud” and its effect on speech intelligibility and naturalness in Parkinson’s disease
标签:#主观评测 #言语障碍 #言语感知 #语音 #语音可懂度评估
评分:4.9/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音可懂度评估 | 主方法:#主观评测
👥 作者与机构
- Alexandra Barnes:机构信息未能从会议 PDF 纯文本可靠映射
- Caroline Menezes:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理帕金森病低音量言语中清晰度与自然度难以兼顾的问题,输入为不同提示与自我感知用力等级下的朗读语音,输出为听者强制选择判断与声学解释,难点在于同一发声变化对两种感知维度产生相反走向且提示语义易混淆。方法分三步衔接:先以固定组块可刺激性测试采集大声与意图两种提示下50%、100%、200%、400%共四档语音,每条件重复五次并用头戴麦保持距离一致,其输出的切分单句直接进入下一步。再将320条语音随机呈现给21名通过听力筛查的听者做清晰或自然二选一判断,同时在同一语料上用PRAAT测量全句平均强度与音高范围并做方差分析以关联感知。与既往多报告大声提升可懂度的工作不同,本文将自然度作为并列终点并对比大声与意图的机制差异,实际意义在于揭示强度提升并不自动带来自然感知。在同一朗读语料条件下,大声提示的平均强度指标为70.834 dB,低于意图提示的平均强度指标70.97 dB。结论的适用边界仅限于男性患者朗读单句与实验室提示条件,尚未验证自发言语、女性、不同听力损失群体及长期康复外推,400%用力出现强度与音高范围双降即为失败条件。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
162. 韵律特征省而可释,MFCCs 繁而自动:癌症相关认知损伤语音筛查的对照试点
标签:#语音生物标志物 #统计分析 #语音 #病理语音评估
评分:4.9/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Amélie Richard:机构信息未能从会议 PDF 纯文本可靠映射
- Pauline Mouchès:机构信息未能从会议 PDF 纯文本可靠映射
- Manon Lelandais:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为法语乳腺癌幸存者讲述图片故事的连续语音,输出为是否存在癌症相关认知障碍(Cancer-Related Cognitive Impairment,CRCI)的二分类,难点在于主观抱怨明显而神经心理测验分数常处于正常范围且样本极小。方法链分为四步:隔音亭采集叙事语音并做转写与停顿标注以得到韵律度量,同步对语音做重采样与去长静音后提取声学频谱特征,随后用单规则评估器(OneR)独立排序特征并递减筛选最优子集,最后用逻辑模型树(Logistic Model Tree)在10折交叉验证下分别训练韵律模型与声学模型。声学路径免转写且全自动,而韵律路径需人工校对停顿与音节计数,因而前者部署成本更低但临床可解释性更弱。在9例幸存者与13例对照组成的样本上,韵律模型以2个特征达到准确率86%与ROC 0.872,声学模型需11个特征达到准确率82%与ROC 0.829,两者100次置换检验均显著(\(p=0\.019\))。结论仅适用于法语女性小样本与理想录音条件,未验证真实诊室噪声、治疗异质性与跨人群外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
163. 停顿次数追上母语者,停顿位置却走反了:二语普通话韵律的量质分离
英文题目:Quantity Convergence, Quality Divergence: Disentangling Fluency and Accuracy in L2 Mandarin Prosody
标签:#统计分析 #语言习得 #韵律 #语音属性识别
评分:4.9/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Yuqi Shi:机构信息未能从会议 PDF 纯文本可靠映射
- How Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Xiyao Lu:机构信息未能从会议 PDF 纯文本可靠映射
- Jinsong Zhang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为朗读单句连续语音,输出为韵律边界等级及其对应依存句法关系,难点在于高水平学习者流利度提升会掩盖结构错位形成伪流利。先以朗读语音为输入,负责按C-ToBI体系标注韵律词B1与大小短语B2、B3等级,输出三级边界标签。再以连续文本分词结果为输入,负责经HIT-LTP初解析加人工校对得到主谓SBV与动宾VOB等依存关系,输出句法标签并以前步边界位置为键完成对齐。最后以对齐后的边界计数与句法映射表为输入,负责用负二项计数回归检验边界数量并用卡方标准化残差检验映射偏好,输出数量差异与偏好强度。相比仅统计停顿数量的表层流利度研究,该机制同时检验何处该断与以多强等级断开,从而区分数量趋同与质量偏离。在BLCU-SAIT语料评测设置下,VNH组的标准化残差指标为6.02,高于母语CN组的标准化残差指标-3.60。该结论适用边界受限于朗读单句受控语料与越南母语学习者群体,自发对话与跨母语外推尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://books.google.co.jp/books?id=Sji5vQEACAAJ — 暂时无法访问
- 第三方资源:https://doi.org/10.1177/0023830914563368 → https://journals.sagepub.com/doi/10.1177/0023830914563368 — 暂时无法访问 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
164. 唱词听得清吗:中文音乐剧里字调与旋律如何算出依字率
英文题目:Tone-Tune Correspondence in Chinese Musicals: A Quantitative Study
标签:#统计分析 #韵律 #音乐 #语音 #音乐理解
评分:4.9/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#音乐理解 | 主方法:#统计分析
👥 作者与机构
- Ruizhuo Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiangping Kong:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
中国原创音乐剧需使旋律走向与汉语声调轮廓相随否则倒字损害可懂度,本文输入为演唱录音与对应朗读录音,输出为逐音节声调与曲调是否相随判定及全曲依从率,难点在于演唱与朗读时长差异大且前后音节协同影响感知。方法链先按换气与旋律终止划分音乐短语并对齐朗读短语以保留表演韵律,再用ProsodyPro在每音节内等间隔提取基频F0并归一化以消除时长差异。接着分别计算单音节F0轮廓相关与纳入前后邻音节的三音节F0轮廓相关,统计正相关占比得到依从率并按声调与边界位置分层。相对Kong2021年古代吟诵以相关大于0.5为相随,本文以大于0即算相随,机制差异在于音乐剧曲谱严格只要不反向即保证可懂度,实际意义是放宽阈值聚焦倒字检测。在《身世》语料评测设置下,三音节相关方法的依从率指标为71%,高于单音节相关方法的依从率指标68%。分层显示轻声与短语边界更高且实际调值为214的Tone3在三音节下占优,说明创作优先保留拱形轮廓并在关键韵律位置强化对齐。该结论适用边界受限于关山作词三宝作曲姚旭演唱的两首录音共871音节,尚未验证跨作曲家跨演唱者与跨剧目的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
165. 不预设几类声调:用函数型主成分加非参数聚类重看开封话低调
标签:#无监督学习 #语音学与音系 #韵律 #语音 #音频分类
评分:4.9/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:方法研究 | 主任务:#音频分类 | 主方法:#无监督学习
👥 作者与机构
- Zihang Zuo:机构信息未能从会议 PDF 纯文本可靠映射
- Aijun Li:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
开封话低调变体建模的输入是时长归一化后的基频曲线,输出是变体子类型标签,难点在于曲线是动态连续过程而静态均值和整体斜率会丢失曲率与调位信息。先将离散基频观测经B样条插值为连续函数并做被试内和音节内标准化,再以函数型主成分分析提取曲率与调位主成分并输出主成分得分。接着对得分做狄利克雷过程高斯混合模型聚类以自适应确定类别数,最后用广义加性混合模型回放各类典型轨迹。与固定中点断点分段线性和预设类别数的人工分类相比,该链条以数据驱动基函数刻画整体动态并允许类别数从密度中生长,减少了反向推理与粗粒度指标的任意性。在456个低调音节语料的事后分段回归评测下,Falling+Level子类型第二段的R2指标值为0.29,低于Dipping子类型的R2指标值0.93。在456个开封话低调响音声母音节语料上,前两个函数型主成分共解释79.4%方差,聚类得到下降、凹陷与上升三类典型模式,其中下降类占多数且新发现的上升类是既有三分类文献未报告的。结论的适用边界仅限于受控单字朗读的成年本地发音人条件,向连续语流、跨方言与感知范畴性的外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
166. 核前基频变化为何不显著:模仿、插值与局部上升的证据
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:4.8/10 | 创新 1.0/2 | 技术严谨 1.1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Jennifer Cole:机构信息未能从会议 PDF 纯文本可靠映射
- Jeremy Steffman:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为六音节短语核重音前非重读段的F0轨迹,输出为核重音为高调H还是降调H+!H及降阶!H*时核前形态是否可分的判断,难点在于局部峰附近调音与跨音节插值或核前重音的贡献难以分离。方法链分三步:先用双模型人声的直线近似刺激诱发五种曲调模仿以控制目标;再经STRAIGHT提取F0并做跳变剔除与按音节十点时间归一化进入统一表征;最后以广义加性混合模型检验曲调间差异平滑,并以时序k均值聚类发现无监督分组与函数主成分分析量化变异模态互证。相对以往只看重音音节附近峰谷对齐的工作,差异在于把长核前区间作为检验对象并三角互证,实际意义在于澄清插值是否受控及降调前上升起点约束。在模仿生产任务语料下,女性模型声的F0指标为340 Hz,高于男性模型声的F0指标为180 Hz。在30名美式英语人的3272条保留轨迹上除Late与Linear核前上升外其余曲调对在归一化时间某处显著可分,四聚类退化为三元有效区分。结论适用边界仅覆盖短语末核重音前的高与降调模仿语料,尚未验证自发语、长句与感知显著性。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://doi.org/10.32614/CRAN.package.emmeans → https://cran.r-project.org/web/packages/emmeans/index.html — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
167. 只听说话方式不看说了什么:手工声学特征叠加 YAMNet 嵌入检测阿尔茨海默病
英文题目:A Hybrid Deep Learning Framework for Alzheimer’s Detection Through Voice Biomarkers
标签:#语音生物标志物 #模型融合 #语音 #病理语音评估
评分:4.8/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#模型融合
👥 作者与机构
- Zahid Rashid Sheikh:机构信息未能从会议 PDF 纯文本可靠映射
- Asma Irfan:机构信息未能从会议 PDF 纯文本可靠映射
- Navid Yazdi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
阿尔茨海默病语音检测以自发语音波形为输入,输出为阿尔茨海默病与健康对照的二分类标签,难点在于早期声学差异细微且易受年龄、通道与语言混杂影响。该工作先用 Librosa 提取梅尔频率倒谱系数 Mel Frequency Cepstral Coefficients 与抖动 Jitter、微颤 Shimmer 等手工声学特征并做均值池化得到定长向量,再用在 AudioSet 上预训练的 YAMNet 将音频切分为梅尔谱块并输出 1024 维嵌入,两路特征拼接后送入支持向量机 Support Vector Machine、随机森林 Random Forest 与深度神经网络 Deep Neural Network 完成分类。相对依赖转录的语言学路线,该纯音频融合同时保留低层发声细节与高层抽象声事件表示,因而具有语言无关潜力。在合并后的 160 条公开语音的 30% 测试划分上,混合特征加深度神经网络取得 89% 准确率,高于同划分下纯声学特征支持向量机的 82.1%。该结论仅适用于小样本受控录音,未验证跨数据集、跨年龄与跨采集设备的泛化能力。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
168. 早开始为何没更快:普通话韵律边界感知中的总体梯度与边界交互
英文题目:Prosodic Boundary Perception in Mandarin Heritage Speakers
标签:#心理声学实验 #韵律 #言语感知 #语音 #口语理解
评分:4.8/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Liuxu Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Jiang Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究处理普通话韵律边界感知,输入为音段与声调完全相同但边界位于第二或第三音节后的6音节听觉句,输出为屏幕双选项二选一判断及其反应时,难点在于词调与短语韵律共享基频且弱边界缺少停顿与显著时长线索,晚期学习者易误将短语级音高重置当作声调变化。首先构造12对最小对刺激并由女性母语者在隔音室录制以固定音段与六种声调分布。其输出直接作为听觉输入进入E-Prime 3.0呈现的拼音加汉字双选项迫选任务,采集二值准确率与对数反应时并剔除极端值。随后将试次级结果送入含群组与边界及声调交互的广义与线性混合效应模型,以分离群组与边界类型效应并做边际均值比较。相对既往仅比较母语与晚期二语者的方法,该设计加入早期遗产语者组以检验早期暴露是否保留层级韵律表征并刻画弱边界加工代价,具有厘清暴露年龄效应的实际意义。在听辨24句6音节人名最小对刺激的任务条件下,母语组的准确率为0.944,高于遗产组的准确率0.807。结论的适用边界受限于受控朗读的6音节人名结构与单一说话人条件,尚未验证向自然语流与长句切分的外推,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
169. 当重音与裂句打架时:普通话背景二语者为何更信句式
英文题目:Prosodic and Syntactic Cue Integration in L2 English Focus Processing
标签:#心理声学实验 #韵律 #言语感知 #语音 #口语理解
评分:4.8/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Yanjing Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Sarah Phillips:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理英语焦点解读任务,输入为书面语境加主语或宾语疑问词问题加单次播放的听觉回答,输出为回答恰当性的7点量表评分,难点在于韵律线索与句法线索冲突时汉语母语英语二语者如何加权。方法链第一步负责受控材料构造,用24个高频动词与48个通用名词加48个专有名词构造96组语境问答并正交交叉非裂句、主语裂句、宾语裂句与主语重音、宾语重音,形成12种实验条件。方法链第二步负责语音变量孤立,由美国英语男声录制并在Praat中将主语宾语区间基频重置为全句均值后把目标重读首音节F0峰值提升3个半音,输出的受控语音材料被送入行为采集。方法链第三步负责行为建模,经由Gorilla平台让32名汉语母语者按拉丁方单次听音并在6秒内评分,再对被试内z标准化评分拟合线性混合效应模型并做Type III Wald卡方检验。相对既往将音高、时长、强度打包处理的整体韵律操纵,只动F0而不动时长强度的设计使韵律无效结论更可归因于音高重音本身。在主语问题评测条件下,宾语裂句带主语重音条件的分数为−0.83,高于宾语裂句带宾语重音条件的分数−0.97。结论的适用边界受限于离线接受性判断中的句法主导偏好,尚未验证在线加工与跨母语推广。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
170. 低频拉长边界而语义场启动缺席:德语边界时长的非对称证据
英文题目:Effects of lexical frequency and semantic priming on durational patterns in German
标签:#统计分析 #语音学与音系 #韵律 #语音 #语音属性识别
评分:4.8/10 | 创新 1.2/2 | 技术严谨 1.1/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Tianyi Zhao:机构信息未能从会议 PDF 纯文本可靠映射
- Alice Turk:机构信息未能从会议 PDF 纯文本可靠映射
- Tina Bögel:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究以德语四音节名词短语朗读为任务,输入为目标名词频高低与上下文语义启动有无的组合,输出为三个边界相关区间的声学时长,难点在于将词汇固有可预测性与语篇语义激活对边界延长的贡献分离并检验其相对量级。方法链分四步:先按首末音节匹配从WebCelex等来源选出高低频目标词对并嵌入相同句法载体句以固定韵律位置,其次用含两个同语义场词的上下文句构造启动与非启动配对并以拉丁方平衡呈现,再经MAUS自动切分加Praat人工校正确定B1至B3边界区间,最后用对数时长线性混合效应回归检验主效应与交互。相对重复同一词形的已有启动研究,关键机制差异在于用同语义场不同词实现更隐性的语义启动,更贴近自然语篇可预测性来源,因而能直接比较词频与语义冗余度的时长效应大小。在载体句朗读任务条件下,非启动条件的B2区间时长指标为0.147 s,高于启动条件的时长指标0.136 s。进一步回归显示低频目标在三处边界区间一致更长而语义启动总体不显著,仅冠词韵母出现数值可忽略的反向交互,支持不同冗余因素影响程度不同的解释。该结论适用边界受限于朗读语体、重读名词短语边界及8名被试共313句的初步样本,尚未验证自发对话或词中非重读音节的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://pavlovia.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.dwds.de/d/wb-dwdswb — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
171. 重音更突出却没有更快:词汇通达不受韵律突显推动
英文题目:Prosodic prominence does not facilitate lexical access in a lexical decision task
标签:#心理声学实验 #韵律 #言语感知 #语音 #口语理解
评分:4.7/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.3/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Martina Penke:机构信息未能从会议 PDF 纯文本可靠映射
- Barbara Zeyer:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究检验孤立听觉呈现下韵律显著性是否加速词汇接入,输入为真词与伪词的录音,输出为词汇判断反应时,难点在于剥离语境与信息结构功能而分离显著性本身的在线效应。方法链分三步:先由标准德语女性发音人录制50个双音节扬抑格副词的显著上升重音L+H版本与去重音ø版本,并通过替换一至两个音素构造50个伪词按半数分属两种韵律录制。再采用双列表设计使每名被试对每个真词仅听一次且跨列表取相反韵律,词频在列表内条件间匹配并将真伪词伪随机混合呈现。最后仅对真词正确试次的反应时做对数转换后用线性混合效应模型检验条件效应。相对离线记忆研究将显著性等同于对比与焦点编码优势,本文关键机制差异在于主张起作用的是信息状态功能而非显著性本身,故预测孤立词无对比功能时应无促进。在词汇判断任务条件下,L+H条件的反应时指标为1334 ms,高于ø条件的反应时指标1328 ms,模型估计Est.为.002而效应量指标d为0.024且p为0.879显示无显著差异。结论的适用边界受限于无语境孤立词的早期词汇选择阶段,不能外推到语篇对比或记忆巩固阶段,原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
172. 语速走认知、音高走情感:27 段微格教学的双通道声音映射
标签:#教育 #统计分析 #韵律 #语音属性识别
评分:4.7/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Shota Shirasaka:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为27名日语职前教师3分钟模拟授课音频与729人次9维度同伴评分,输出为声学特征到教学评价维度的映射关系与参考区间,难点在于整体印象评分掩盖了认知加工与情感信号通道的差异化作用。方法链分三步:先采集模拟授课视频并同步获取同伴多维评价以建立课程级配对样本,再用Parselmouth客观提取基音均值等8维韵律与音质特征,前步得到的评分均值与特征分布直接构成相关检验的输入,最后以课程平均分为单元做斯皮尔曼等级相关与二次回归及性别分层区间估计以识别最优声学区间。与既往整体评分关联研究的关键机制差异在于按认知与社会情感功能拆分评价维度,分别检验语速的认知负荷路径与基音均值的副语言情感路径,因而可给出针对性发声训练反馈。在27门课程平均分评测设置下,语速与内容清晰度的斯皮尔曼相关系数指标为0.558,高于语速与总体评分的斯皮尔曼相关系数指标0.521。结论适用边界受限于日语俯仰重音语境与27门课程探索性设计,15个名义显著关联经Benjamini-Hochberg错误发现率校正后最小q值为0.158,均未通过阈值,尚待大样本与因果验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
173. 强烈负情绪下高度熟练者也会漏出母语韵律:以音高范围为核心的证据
英文题目:Encoding of emotions in L2 and multidialectal English speech
标签:#统计分析 #韵律 #跨语言 #语音 #语音情感识别
评分:4.6/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 0.7/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音情感识别 | 主方法:#统计分析
👥 作者与机构
- Jacqueline Alomenu:机构信息未能从会议 PDF 纯文本可靠映射
- Lluisa Astruc:机构信息未能从会议 PDF 纯文本可靠映射
- Zsuzsanna Barkanyi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为高熟练二语与多方言英语者在中性、积极与消极情感下的连续英语语音,输出为五项韵律参量的情感编码模式,难点在于强情感削弱认知控制并诱发第一语言习惯回潮,而自然情感难以在实验室复现。方法链分三步:先以4-5分钟自发叙事加视频观看后半自发描述分块诱发目标情感并收集1-10强度自评,其输出的连续录音进入基于语调短语的切分与时长、暂停、言语速率及音高范围提取,最后以线性混合模型检验组别与情感交互。相对既往依赖朗读短句与单语者的情感语音研究,该设计以生态化诱发与多方言对照凸显情感强度驱动的迁移,更具现实解释力。在消极情感语料条件下,牙买加组的平均强度得分为10,高于西班牙组的平均强度得分6.1。西班牙组消极相对中性下语调短语时长缩短且音高范围收窄,牙买加组消极暂停延长且言语减速,显示负向高强度情感更易触发迁移。该结论适用边界为高熟练且在南方标准英国英语社区连续生活或工作5年以上者与叙事类任务,尚未验证低熟练者与其他语言对。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
174. 声调轮廓为何能暴露双侧声带小结:基频与周期性线索的可解释分类
英文题目:Machine Learning-Based Evaluation of Mandarin Tone in Patients with Bilateral Vocal Nodules
标签:#集成学习 #可解释性 #语音 #病理语音评估
评分:4.6/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.6/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.6/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#集成学习
👥 作者与机构
- Binxin Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Hao Tang:机构信息未能从会议 PDF 纯文本可靠映射
- Dapeng Lei:机构信息未能从会议 PDF 纯文本可靠映射
- Wen Liu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入为女性普通话四声单字朗读波形,输出为双侧声带小结病理与否的二分类,难点在于轻症小结声学差异细微且与声调调制相互交织。为此方法链分为三步:先在隔音室采集40名发音人的2800个录音并切分元音早中晚三段以保留动态轮廓,输出分段波形进入特征提取。接着用VoiceSauce提取基频等11类声学参数并做共振峰校正,输出校正后特征向量进入分类训练。然后按7比3划分训练测试集并以网格搜索结合十折交叉验证训练6种传统分类器,再用SHAP解析特征贡献以支撑临床解释。与既往持续元音病理检测不同,该工作将声调轮廓作为探测发声控制缺陷的动态负载,其中非平调对声带控制要求更高因而病理差异更显著,具有可解释筛查意义。在测试集评测下,随机森林的准确率为0.861,高于决策树的准确率0.653。该结论适用边界仅限于北方官话成年女性孤立性双侧小结与小样本实验室录音,尚未验证男性、其他病理及连续语流的外推性。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
175. 基线先稳、顶线后变:3-5 岁普通话儿童自发话语中音高下倾的分化发展
英文题目:Pitch Declination Development in Spontaneous Speech of 3-5-year-old Mandarin-Speaking Children
标签:#统计分析 #语言习得 #韵律 #语音 #语音属性识别
评分:4.6/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.6/1.5 | 清晰度 0.6/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Yuhan Jiang:机构信息未能从会议 PDF 纯文本可靠映射
- Lu Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Aijing Yu:机构信息未能从会议 PDF 纯文本可靠映射
- Qiang Fu:机构信息未能从会议 PDF 纯文本可靠映射
- Ting Wang:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为3至5岁普通话儿童自发对话中的陈述句录音与字符级转写,输出为整体回归线、顶线与底线三条基频下倾斜率及其年龄组差异,难点在于词调起伏掩盖句级下倾且句长与焦点位置随年龄可变。方法链分四步:先从ChildMandarin语料库筛选北方轻口音45人、每人30句共1350句陈述句,再以Praat为基准并用CREPE算法提取基频并经置信度过滤与归一化得到可靠音高轨迹,然后对全部音高点拟合整体线并对峰谷点分别拟合顶线与底线,最后以年龄组为自变量、句长为协变量做协方差分析与Tukey事后比较,上一步的分组句集与音高轨迹直接进入下一步拟合与统计。相对英语朗读研究只拟合单一整体斜率,该工作依据顶线关联语义焦点而底线关联节奏组织的分离假设同时建模三线,因而能区分焦点调制与节奏组织的不同发育节奏。在ChildMandarin语料的话语时长比较设置下,3岁组的时长指标为2.27±0.71 s,高于5岁组的时长指标1.87±0.47 s。协方差分析显示整体线主效应F指标为F(2,1349)=7.90,p<0.05,顶线为F(2,1258)=11.58,p<0.05,均呈4岁显著陡于3岁与5岁,底线为F(2,1232)=3.38,p<0.05,仅3岁浅于4岁显著。该结论适用边界受限于北方轻口音3至5岁横断面自发陈述句,未控制焦点类型与声调组合,尚未验证向朗读语体或更年长儿童的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
176. 把临床对话变成可复核的时间线:自动语音分析如何从噪声中算出韵律
英文题目:Demonstration of Automated Speech Analysis Tool for Clinical Use
标签:#信号处理 #韵律 #语音识别 #说话人分离标注 #病理语音评估
评分:4.6/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.2/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#病理语音评估 | 主方法:#信号处理
👥 作者与机构
- Jeremiah B Joyce:机构信息未能从会议 PDF 纯文本可靠映射
- George Chatzisofroniou:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
临床心理访谈输入为含噪声、双人对话与重叠静音的连续录音,输出为按说话人与轮次归因的时间韵律指标,难点在于在噪声下同时保持语音检测、说话人归属与语言单位对齐一致。该链路先以语音活动检测与说话人分离标注切分话语间停顿单元并进一步划分轮次、话语内重叠与轮次间重叠及暂停与间隙,其边界时间戳进入下一步。接着以自动语音识别转写并将词与说话人归属对齐,再以声学音节核检测定位音节起始,为参数计算提供词与音节时间锚点。随后按说话人与轮次计算说话时长等八项时间指标,并经上下分屏同步仪表盘回放频谱与词边界以人工校对误归属与漏转写词。在演示音频片段场景下,轮次间重叠的重叠计数指标为1,高于话语内重叠的重叠计数指标0。与离线批处理脚本相比,关键差异在于将采集、预处理、可视化校对与指标回传封装为临床人员可直接操作的端到端演示系统。该结论适用边界仅限短片段流程跑通展示,尚未验证躁狂判别效度、跨设备泛化与重叠密集场景鲁棒性,判别外推受限。计算量方面原文披露预处理需专用工作站硬件,包括锐龙9 7950X中央处理器、32吉字节内存与GeForce RTX 4080 SUPER图形处理器及多型麦克风与采集接口。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
177. 三语者法语节奏为何只在辅音间隔上偏离:六个指标的顺向与逆向迁移
英文题目:Cross-Linguistic Influences on Rhythm in Trilingual Learners of French: A Multidimensional Analysis
标签:#统计分析 #语言习得 #韵律 #跨语言 #语音属性识别
评分:4.5/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Yufeng Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Fabián Santiago:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为汉语、英语、法语单语及中英、中法双语与中英法三语共42名被试的受控朗读语音,输出为六个节奏指标上组间差异的跨语言影响解释,实际难点在于同时分离母语促进、第二语言前向干扰与向母语的回溯重构。先以句法与音节长度受控的18句SVO文本为输入进行两次重复朗读采集,得到2520条可比话语,再将该2520条话语输入SPPAS自动切分与PRAAT手工校对流程以划分元音与辅音区间,并由Correlatore计算%V与ΔC等六个指标,最后将每名被试每种语言的指标均值输入RStudio单因素方差分析与Tukey HSD检验以输出组间差异结论。相对已有中法双语研究的关键机制差异是同时纳入两类双语组与三语组,以检验L2英语对L3法语的前向干扰和对L1汉语的回溯影响。实际意义在于揭示三语节奏习得并非仅由类型相似性决定,而是基于语言库的动态竞争与系统重组。在法语朗读任务条件下,三语组F与单语组C的ΔC差异指标p值小于0.001,低于双语组E与单语组C的ΔC差异指标p值大于0.05。结论适用边界仅限受控朗读短句与CEFR C1水平晚期学习者,尚未验证自发语篇、不同句法长度与更大样本的外推。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
178. 在变调中找重音:北卡舒布语用同一词的不同读法分离时长与强度
英文题目:Stress placement variability and acoustic stress correlates. The case of Northern Kashubian
标签:#统计分析 #韵律 #语音 #语音属性识别
评分:4.5/10 | 创新 1.2/2 | 技术严谨 0.8/1.5 | 实验充分 0.5/1.5 | 清晰度 0.5/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Andrzej Żak:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
北部卡舒布语重音兼具自由重音与移动残留,输入为同一名词词形在不同次实现中的重读与非重读元音,输出为时长、基频与强度是否为重音声学关联的判定。难点在于无通用书面语而无法用朗读诱发最小对立对,且变异受音系约束并正向范式一致化漂移。方法链分四步:2021年至2025年在北部8地入户录制50岁以上日常使用者自发对话并筛选可变重音名词词例,前序输出经CLARIN-PL插件自动切分与人工校界进入下一步,再用Praat与ProsodyPro提取时长、强度与基频的均值极值,最后以重音为固定效应的线性混合效应模型分别检验。与仅比较固定最小对立对的传统范式分析不同,该研究将同一词在相同音段位置的可变重读与非重读实现直接对照,以控制语音环境。原文未提供可核对的关键定量结果。定性上时长为主关联而基频无显著效应,强度在表格与正文报告不一致,结论适用边界仅限词中位置后元音
\[a\]与
\[ɔ\]及136个元音样本的老年自发语料,尚未验证频谱倾斜与其他元音。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
179. 单音节问句与陈述句的升降调:唐氏综合征成人能发出可辨认的轮廓,但诱发音系对立仍困难
标签:#统计分析 #韵律 #语音 #病理语音评估
评分:4.4/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#病理语音评估 | 主方法:#统计分析
👥 作者与机构
- Kornélia Juhász:机构信息未能从会议 PDF 纯文本可靠映射
- Julianna Jankovics:机构信息未能从会议 PDF 纯文本可靠映射
- Katalin Pirsel:机构信息未能从会议 PDF 纯文本可靠映射
- Alexandra Markó:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为实验室诱发的匈牙利语单音节极性疑问与陈述朗读录音,输出为可听辨的上升与下降基频曲线特征,难点是重复刻板、短时记忆与注意力缺陷使刺激意图与感知言外之力严重脱节。方法第一步用图片辅助朗读并辅以故事语境嵌入与直接指导多轮诱发三种CVC单音节的疑问与陈述实现,其录音直接进入感知筛选。第二步由四名评价者一致筛选可辨识实现并抛弃原刺激意图、以感知到的疑问或陈述标签重组数据,其分组输出直接作为后续建模的比较依据。第三步对每位说话者在归一化时长上用广义加性混合模型比较动态曲线,并辅以最小值、最大值、均值、范围及缺失值率的描述统计。与以往只比较平均说话基频高低的静态做法不同,该工作聚焦单音节内升降轨迹随时间的分离位置与缺失模式,具有时变分析意义。在图片辅助朗读任务语料下,刺激与感知一致的疑问实现的指标为25,高于刺激与感知一致的陈述实现的指标的15。该结论适用边界受限,仅适用于经严格听辨筛选后的可辨识样本,不支持对音系对比能力的直接推断,且对照组全为年轻女性而唐氏组年龄更宽且含男性。原文未披露训练、推理或部署成本
🔗 开源资源
- 第三方资源:https://www.praat.org/ → https://praat.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
180. 厦门闽南语变调能产性之争:任务变简单了,被试就真会了吗
标签:#人类参与评测 #语音学与音系 #韵律 #语音属性识别
评分:4.4/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.0/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#人类参与评测
👥 作者与机构
- Weijun Zhang:机构信息未能从会议 PDF 纯文本可靠映射
- Huangyang Xie:机构信息未能从会议 PDF 纯文本可靠映射
- Peggy Pik Ki Mok:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理厦门闽南语无核对音节双音节右重变调环的能产性判定,输入为首音节携带不同引文调的虚构音节加实词组合,输出为首音节应取的表层变调形式,难点在于变调为不透明循环链移且新音节无词库表征,产出发音困难易与音系知识缺失混淆。首先以图片命名生产任务诱发双音节产出并由母语者判定首音节是否正确变调,其输出的偶然空位词变调模式进入下一步对照;接着以系统空位加实词的多项选择任务检验引文调、正确变调与反向变调的辨别,其三选项选择分布进入下一步比较;最后以偶然空位加实词的多项选择任务区分半空位与全空位,检验正确变调形式合式性对错误模式的影响。与以往只用偶然空位做生产的范式不同,本文以低认知负荷识别代替产出并引入系统空位与半空位、全空位的梯度音位合式性分层,从而分离发音困难与音系知识缺失,具有避免将发音失败误判为无能产性的实际意义。在多项选择任务条件下,偶然空位词的随机基线准确率为0.25,低于系统空位词的准确率0.33。该结论的适用边界仅限所测五调循环及三类空位类型,跨年龄泛化与跨规则外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
181. 无线光学追踪如何把超声、音频和头动收进同一时间轴
英文题目:A Wireless Synchronized Ultrasound-Audio-Motion Capture System
标签:#数据集构建 #发声与构音 #语音 #语音属性识别
评分:4.3/10 | 创新 0.8/2 | 技术严谨 1.0/1.5 | 实验充分 0.3/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.8/1.5
排名:后50% | 文档类型:系统技术报告 | 主任务:#语音属性识别 | 主方法:#数据集构建
👥 作者与机构
- Jaekoo Kang:机构信息未能从会议 PDF 纯文本可靠映射
- Boram Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该工作面向超声舌成像实验中多流时间对齐困难与受试者头动污染舌形观测的问题,输入为舌超声视频、麦克风音频与无线光学测得的头部六自由度位姿,输出为时间戳统一、对齐可查且附带头动记录的可复用采集会话。方法链第一步由硬件层并行采集负责,超声探头经可调实验室探头支架稳定、音频接口加麦克风记录语音、无线光学追踪记录头部位姿,并将受试者端系留线缆压缩至两条以降低佩戴负担。第二步由实验启动器承接三路数据流,负责会话元数据录入、设备状态监控、统一时间戳与显式启停管理,并生成标准化命名与会话日志进入存储。第三步由事后数据分析器承接已存会话,负责基于事件与时间戳的流间对齐、头动汇总以及音频波形与超声脉冲和光学起止轨迹的联合可视化质检,从而把同步与边界问题暴露在分析前。相对早期有线光学校正系统,其关键机制差异在于以无线标记换取更轻的部署复杂度,并只做运动感知质检而将完整几何校正留待未来工作,其实质是用可记录的位姿为后续运动鲁棒分析留接口而非当场纠偏。原文未提供可核对的关键定量结果。当前结论的适用边界仅限受控演示与小规模采集流程验证,隔音室长期漂移、光照敏感与标记遮挡下的鲁棒性尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
182. 核轮廓相似仍听错:重音缺失与短语分界如何左右巴斯克语问句判断
英文题目:Perception of interrogativity in Basque by native and L2 speakers
标签:#心理声学实验 #韵律 #言语感知 #语音 #口语理解
评分:4.3/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.0/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#心理声学实验
👥 作者与机构
- Izaro Bedialauneta Txurruka:机构信息未能从会议 PDF 纯文本可靠映射
- Jose Ignacio Hualde:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为马尔基纳巴斯克语无词重音词构成的中性陈述与是非问朗读录音,输出是听者判断是否为问句的二选一回答,实际难点在于双语者在两语言核部 circumflex 轮廓相似时仍会误判整体问句性。方法链分三步推进:先由一名马尔基纳母语作者将单短语与双短语各4句分别录制为中性陈述和中性是非问以构造最小对照,其录音输出直接构成后续听辨刺激;再通过Qualtrics在线实验向马尔基纳母语者与西班牙语母语的巴斯克语二语者单次播放共43个刺激并收集是否为问句的判断;最后按组统计正确率并用韦尔奇t检验与Cohen’s d比较组间差异。与仅依据句末核轮廓判断问句性的传统解释不同,该研究强调词重音缺失与短语划分形成的整体基线形状同样决定感知。在双短语问句判断条件下,Markina母语组的准确率为97.2%,高于L2西班牙语组的准确率23.8%。该结论的适用边界目前受限于马尔基纳朗读句、无词重音词与西班牙语背景二语者,尚未验证其他方言、自发语料及操控基频的因果作用。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
183. 提示词比性别更能改变播客节奏:NotebookLM 双人播客的语速与停顿实测
标签:#教育 #统计分析 #韵律 #语音 #语音属性识别
评分:4.2/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.4/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Artem Saloev:机构信息未能从会议 PDF 纯文本可靠映射
- Nicolas Ballier:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究输入教学用PDF文档与面向不同受众的提示词,输出NotebookLM生成的男女双人播客音频,难点在于闭源生成链路不可见且语速停顿与说话人身份相互纠缠难以归因。方法链先以默认、中小学生教育型、大学研究型三类提示生成五十余个播客并保留具典型男女双声的样本,再用Whisper-X说话人分离标注切分男女声轮次并经人工校验剔除幻觉音色,接着用De Jong和Wempe基于Praat的音节核算法提取语音率与发音率并以线性混合效应模型检验提示与性别效应。与已有韵律研究相比,该文把提示词当作听众顺应的操纵变量并在对话进程上检验趋同。在播客语料任务下,女性声音的语音率指标为4.17音节每秒,高于男性声音的语音率指标3.98音节每秒。研究型提示下发音时长系数为-1664.84且显著而教育型提示系数为-1822.73仅边缘显著,语音率与发音率的固定效应均不显著且轮次进程斜率微小。该结论适用边界受限于所采英语教学类文档与默认一男一女双主持形态,换文档换语言或换音色库后外推尚未验证。原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://ilk.uvt.nl/timbl/ → https://languagemachines.github.io/timbl/ — 链接可访问(HTTP 200)
- 第三方资源:https://doi.org/10.21437/Interspeech.2023-78 → https://www.isca-archive.org/interspeech_2023/bain23_interspeech.html — 链接可访问(HTTP 200)
- 第三方资源:https://gebnlp-workshop.github.io/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.latent.space/p/notebooklm — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
184. 语序错了、语调错了,为什么匈牙利听者还觉得可以:窄焦点的语境补偿
标签:#主观评测 #韵律 #言语感知 #语音 #口语理解
评分:4.1/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.0/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#口语理解 | 主方法:#主观评测
👥 作者与机构
- Akos Buza:机构信息未能从会议 PDF 纯文本可靠映射
- Petra Wagner:机构信息未能从会议 PDF 纯文本可靠映射
- Farhat Jabeen:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究处理匈牙利语窄焦点理解任务,输入为诱发窄焦点的对话语境与不同词序韵律组合的语音答案,输出为母语者恰当性判断,难点在于动词前词序与语调各自能否独立许可焦点解读且二者失配时仍可能被接受。方法链分三步:先经20名母语者先导评定筛选出12个有效窄焦点语境并构造四种词序语调组合,再由4名母语发音人录制并经Praat与DIMA标注核验目标韵律实现,接着经Psytoolkit在线收集85名母语者的五点量表评分并用放宽比例优势假设的累积链接混合模型建模。与句法首要旧观点相比,该设计把韵律视为可独立起作用的线索而非附属标记,从而检验语境充足时线索的可加与宽容解读。在窄焦点恰当性评定任务下,snf-pseudobf条件的分数为5分的次数为93,高于sbf-pnf条件的分数为5分的次数59。与典型窄焦点基线相比三种失配均无显著差异,表明词汇语义充分时听者可补偿不一致线索。该结论适用边界受限于词汇语义充分且语境清晰的窄焦点问答,语境贫乏或歧义时权重可能反转但尚未验证,原文未披露训练、推理或部署成本。
🔗 开源资源
- 第三方资源:https://www.psytoolkit.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://www.r-project.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://cran.r-project.org/package=ordinal → https://cran.r-project.org/web/packages/ordinal/index.html — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
185. 问句该升该降:用短篇故事检验合成语音的疑问语调
标签:#主观评测 #韵律 #语音 #文本到语音
评分:4.1/10 | 创新 0.8/2 | 技术严谨 0.8/1.5 | 实验充分 0.5/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#文本到语音 | 主方法:#主观评测
👥 作者与机构
- Alexandra Salem:机构信息未能从会议 PDF 纯文本可靠映射
- Sarah Ita Levitan:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该研究以短篇故事《The Fir Tree》中疑问句文本为输入,以合成语音疑问韵律自然度的类型化评估为输出,难点在于疑问词问句应降调而是非问句应升调的预期需结合语境判断,且传统MOS整体打分难以定位类型错误而缺乏可扩展客观标准。方法链共分四步:首先从恢复标点的LibriTTS文本定位问句并对应LibriSpeech人类朗读,再经Praat手工重切为真正疑问片段,得到22个疑问词问句与9个是非问句。接着用Kokoro与FastSpeech 2合成内容对齐的平行语料,使同一文本具有人类与两种TTS三个来源。然后基于pYIN提取基频并仅对后半段F0拟合最佳直线以斜率符号二分尾调上升与下降,同时计算每句最大最小F0差的组内平均音域,其输出直接作为自动评测结果。最后以双人ToBI核轮廓标注一致性与母语者自然度打分校验自动标签,使斜率判断可与人工感知对齐。与以往依赖MOS整体质量评价不同,该工作将类型相关的语调预期显式化为可自动检验的尾调方向,从而能区分疑问词与是非问句的系统性误升。在《The Fir Tree》语料任务下,Kokoro的是非问句上升F0比例指标为66.7%,低于人类朗读者的上升F0比例指标77.8%。该结论适用边界受限于主流美式英语短故事朗读场景,难以外推至对话自发语音或其他语言风格,且原文未披露训练、推理或部署成本。
🔗 开源资源
- 模型相关资源:https://huggingface.co/hexgrad/Kokoro-82M — 暂时无法访问
- 模型相关资源:https://huggingface.co/ — 暂时无法访问
- 第三方资源:https://praat.org/ — 链接可访问(HTTP 200)
- 第三方资源:https://zenodo.org/doi/10.5281/zenodo.591533 → https://zenodo.org/records/21891531 — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
186. 喊谁听得出来:距离感是否藏在呼唤的韵律里
英文题目:Sense of Distance: Word-Dependent Prosodic Cues for Addressee Recognition
标签:#心理声学实验 #韵律 #言语感知 #语音 #语音属性识别
评分:3.9/10 | 创新 1.0/2 | 技术严谨 1.0/1.5 | 实验充分 0.4/1.5 | 清晰度 0.7/1 | 影响力 0.5/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#心理声学实验
👥 作者与机构
- Haruka Murakami:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以呼唤语音为输入,判别被呼唤者处于近端个人距离1.0 m、中端社交距离2.5 m还是远端公共距离4.0 m,难点在于除响度外是否存在稳定可感知的嗓音与风格线索。方法链分三步衔接:先按个人空间理论布置三名听者距离并由实验者指定目标编号,为距离差异赋予可辨意义;再由说话人面向目标产出14种呼唤项,将距离意图编码进语音;最后三名听者背对回应并按转身、手指编号与交叉手臂计分,前一步的发音输出直接作为后一步的听辨输入,汇总为全听者与目标听者正确率。与以情感建模丰富表现力的合成路线不同,本文把距离感视为先于情感的表达基底,直接检验其听觉可辨性而非叠加情绪控制。在呼唤任务评测设置下,全部呼唤项的全听者准确率为0.702,高于随机水平的全听者准确率0.333。词级差异进一步表明线索具词依赖性,Hey的可辨性高而声学相近的Hi明显偏低,说话人间亦存在可辨但幅度不一的差异。该结论适用边界受限于仅4人轮换且角色不独立、语言背景混杂及房间混响与响度未量化控制,响度归一化后仍可感知的推论尚未验证,仅见于演示设想。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
187. 母语时长策略迁入英语:四名波斯语者八次模仿中谁跟上了、谁没跟上
英文题目:An Exploratory Study of Farsi Speakers’ Imitation of English Lexical Stress
标签:#统计分析 #语言习得 #韵律 #语音属性识别
评分:3.6/10 | 创新 0.8/2 | 技术严谨 0.8/1.5 | 实验充分 0.5/1.5 | 清晰度 0.6/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.2/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Mohammad Ghorbani:机构信息未能从会议 PDF 纯文本可靠映射
- Ronald Scherer:机构信息未能从会议 PDF 纯文本可靠映射
- Sara Kalhoriboroujerdi:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为4名波斯语母语者在陈述句、Wh问句、Yes/No问句和感叹句中朗读的11个三音节英语目标词,输出为相对同性别美式英语母语模型在时长占比、平均基频、峰值基频和峰值强度上的绝对偏离,难点在于波斯语以时长为主而英语多线索并用导致的线索权重迁移。方法链为同性别母语人录制12句模型并由被试先自然朗读3遍再听后即时模仿8次,前步录音进入人工切分音节并提取四类声学参数,其中基频转为相对词内最高音节的半音差、强度取相对最高音节分贝差、时长取占词总时长百分比并按位置配对求绝对偏离,最后在模仿前与第1、4、8次四点分整词、重读与非重读音节三层做逐被试重复测量方差分析。相对已有方法其关键差异是不直接比较绝对时长音高而比较词内相对格局偏离,实际意义是剥离语速与整体响度基线后检验重音分布是否趋近母语模型。在整词时长偏离评测条件下,F1的偏η²指标为.248,高于F2的偏η²指标.130,事后显示模仿前偏离大于第1、4、8次而首次模仿后保持稳定。平均基频整词层4人均显著但重读音节层均不显著、非重读层均显著,峰值基频整词仅女性显著而峰值强度整词除F1外显著但效应量约.10至.11且多数事后无成对显著。该结论适用边界仅限高水平成年波斯语被试对少量三音节词的短期即时模仿,尚未验证保持、泛化、自然语流和知觉收益。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
188. 句末先嘎吱后清化:伊纳里萨米语中清化时长随词长增长而嘎吱不跟随
英文题目:Utterance-final devoicing and creaky voice in Inari Saami
标签:#统计分析 #发声与构音 #韵律 #语音 #语音属性识别
评分:3.6/10 | 创新 0.8/2 | 技术严谨 1.0/1.5 | 实验充分 0.7/1.5 | 清晰度 0.6/1 | 影响力 0.4/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.0/1.5
排名:后50% | 文档类型:应用研究 | 主任务:#语音属性识别 | 主方法:#统计分析
👥 作者与机构
- Helen Wilbur:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文以伊纳里萨米语陈述句句末双音节、三音节与四音节词的声学信号为输入,输出去浊段与嘎裂段的边界划分与时长解释,难点在于去浊与嘎裂呈连续渐变且话者间弱化频率和时长差异显著。方法链分三步:先复用Inari Saami Prosody Corpus的词与音段标注并人工复核去浊与嘎裂段,其输出的TextGrid标注进入下一步测量;再用Praat脚本基于TextGrid测量去浊段、嘎裂段与整词毫秒时长,其输出的时长数据进入统计建模;最后以贝叶斯广义多层模型检验音节数与前后发声条件对对数时长的影响。与芬兰语定性描写和Pite Saami自发语研究相比,本文将去浊与嘎裂视为同一句末弱化连续体的可度量部分并量化其此消彼长的权衡,具有明确的声学划分标准和可检验的时长模型意义。在句末朗读语料设置下,四音节词纯去浊段的时长指标为521 ms,高于双音节词纯去浊段的时长指标364 ms。该结论的适用边界仅限于老年男性朗读陈述句,尚未验证自发对话、女性与年轻话者及跨词边界弱化等外推范围。原文未披露训练、推理或部署成本。
🔗 开源资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。