论文解读

不用对齐音素也能评节奏:包络变化率为何在低分段更稳

该研究把二语节奏评估做成流利度和韵律分数回归,用一维卷积直接从语音幅度包络及其一阶导数学生节奏特征,最强证据是包络导数模型在低流利度组误差显著低于时长模型,代价是韵律维度仍受语调混杂与低分样本稀少限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9051 字 阅读 →
论文解读

词错率好看却漏掉关键信息:口音对话中实体与填充词如何被找回

针对印度、印尼和拉美口音的英语学习对话,该工作用启发式富实体选数据加分区 LoRA 双输出微调 Qwen2.5-Omni-3B,把实体召回做到 80-85% 区间并把填充词保留到 76-86% 区间,代价是依赖银标准转写参考与每个区域独立适配器。

 · 更新于 2026-09-24 · 约 19 分钟 · 9498 字 阅读 →
论文解读

把静态 NCERT 课本变成问答式视频:检索接地,生成管讲法与画面

该系统针对 NCERT 课本问答做个性化教学视频,用检索增强生成锁定课本依据并写出多场景脚本,再经 Stable Diffusion 配图、DynamiCrafter 做动效、Google TTS 配音并由 MoviePy 对齐合成,演示显示师生觉得比纯文本更易跟随,但原文只报告定性反馈而未给出可比的定量指标与对照代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10259 字 阅读 →
论文解读

造循环器学信号处理:把录音、叠加与消咔哒声做成可跟做的课程

该文以在 Max、gen~ 与 RNBO 中逐步建造现场循环器为教学方法,让学生在录音播放、叠加与去咔哒声等真实音乐任务中学习缓冲与时序,课堂观察显示参与度和迁移能力提升,但 gen~ 与 RNBO 的转换仍受单学期时间与代码畏难情绪限制。

 · 更新于 2026-09-24 · 约 22 分钟 · 10835 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

为全身舞蹈保留发声逻辑:1978 年 Terpsitone 的交互式数字孪生

论文以 1978-1979 年为 Lydia Kavina 制作的最后一台 Terpsitone 为对象,用实测建模的三维体、范德波尔振荡器差拍的声音引擎和头手质心映射的交互链做可演奏的虚拟现实孪生,历史考证显示至少四代形态而音量映射始终多变,当前原型已能走通动作到声音但精度与稳定性仍待验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10467 字 阅读 →
论文解读

把自行车变成可移动合奏:BIKES 如何用联网与制作串起教学

BIKES 把电动货运自行车做成可移动联网乐器,用集中式到网状网络、分布式音频与工业设计迭代解决户外移动演奏与教学问题,最强证据是四车系统的公共骑行与装置验证,代价是第二阶段外观模型尚无发声功能且系统依赖现场网络与人工运维。

 · 更新于 2026-09-24 · 约 20 分钟 · 9986 字 阅读 →
论文解读

语速走认知、音高走情感:27 段微格教学的双通道声音映射

该研究以 27 名日本职前教师的 3 分钟微格教学和 729 人次九维度同伴评分为对象,用 8 个客观声学特征做 72 对相关映射,发现语速偏向内容清晰等认知维度而平均基频偏向表情与观众意识等情感维度,但 15 个名义显著相关经错误发现率校正后全部不显著,故最优区间只作探索性参考。

 · 更新于 2026-09-24 · 约 17 分钟 · 8288 字 阅读 →
论文解读

会用控制器还不够:为数字音乐熟手补上原型设计的一整轮

针对已熟练使用商用数字音乐工具但缺硬件原型能力的高年级本科生,论文用研究—搭建—作曲—演出—文档的全周期结构组织 15 周课程,在 16 人两学期中报告 15 人完成全流程、7 人建后改硬件,以小班与统一套件为代价换来持续迭代条件。

 · 更新于 2026-09-24 · 约 19 分钟 · 9414 字 阅读 →
论文解读

把文本变成手码:TextCueS 如何让 LfPC 编码步骤可见可改

论文要解决从文本生成法语 LfPC/提示语编码的教学工具缺失问题,选择把生成引擎与语言规则分离并暴露三步可核对流程,其证据是已验证的生成引擎与用户测试过的界面,而代价是美式英语长元音三维动作在二维显示上尚未优化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8652 字 阅读 →
论文解读

手势能画出声调吗:哼唱与手指轨迹为何趋同而带词朗读却偏离

该研究用平板正弦声调界面比较母语与零起点法语者在词汇朗读、哼唱、手势三种模态下对易混双音节三声的模仿,显示哼唱与手势高度重合而词汇朗读系统性偏离,支持先做无词段旋律练习再进入词汇训练,但固定顺序与小样本限制了因果推断。

 · 更新于 2026-09-24 · 约 16 分钟 · 8012 字 阅读 →
论文解读

调超韵律参数为何比直接调共振峰更能纠正法语元音

针对西班牙语初学者学法语难元音的问题,该研究用五天个性化重读双音节无意义词训练比较四种隐性纠正反馈,发现以声学距离度量的元音产出普遍改善且超韵律操控组优势显著,但未报告可听度与长期保持之外的代价细节。

 · 更新于 2026-09-24 · 约 21 分钟 · 10475 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

不用连线也能发声:把 Pure Data 的波形逻辑搬进 C++ 类

论文把 Pure Data 的数字信号处理对象改写为 C++ 类并保留同名调用逻辑,用噪声与振荡器等实例显示声音一致的改写路径,代价是不自带音频与 MIDI 硬件客户端且线程与内存需开发者自行处理。

 · 更新于 2026-09-24 · 约 21 分钟 · 10201 字 阅读 →
论文解读

孩子把《戴帽子的猫》读得像大人吗:用词时长偏离度预测阅读理解

该研究以 91 名 6-10 岁儿童朗读《戴帽子的猫》的逐词时长为对象,用成人模型预测值与儿童实测值之差构造韵律错误分,报告了在控制年龄、语音意识和加工速度后韵律错误仍显著预测阅读理解标准分,但加工速度本身不显著且样本排除了无阅读能力和学习障碍儿童。

 · 更新于 2026-09-24 · 约 18 分钟 · 8944 字 阅读 →
论文解读

提示词比性别更能改变播客节奏:NotebookLM 双人播客的语速与停顿实测

该研究以 51 个 NotebookLM 生成播客为样本,用发音率与言语率检验面向不同听众的提示词与说话人性别的影响,发现提示词对发音时长的预测力强于性别,而男女声在停顿使用上趋同但在播客尾段发音率上出现分化,代价是 diarization 存在幻觉且输入文本未做控制。

 · 更新于 2026-09-24 · 约 21 分钟 · 10156 字 阅读 →
论文解读

无母语冲突的词先学会:具身训练为何只在部分任务和人群中显效

针对西班牙成人初学者英语词重音问题,研究用 9 小时动词-声调式具身感知训练检验识音与产出,最强证据是非同源词识音显著进步与朗读复述差异稳定存在,代价是整体进步不显著且高度依赖双语背景与词类别。

 · 更新于 2026-09-24 · 约 18 分钟 · 8804 字 阅读 →
论文解读

二十只音箱包住一个甜点:在教室里装下三阶全球声场

该报告为教学与研究搭建 20 只同轴音箱的正十二面体三阶全球 Ambisonics 系统,把 16 通道 HOA 解码到 20 路输出,用机械对准加插件补偿与声压归一完成校准,四年使用报告显示定位与包围感可用但单体保真度有限。

 · 更新于 2026-09-24 · 约 17 分钟 · 8382 字 阅读 →