封闭句库里练多人模型,再用三分钟校准新用户:表面肌电语音解码的个性化路径
针对 27 人、每人不足半小时数据的封闭 50 句表面肌电解码任务,论文用已发布单被试检查点初始化、多被试预训练再加目标被试微调达到 21.7% 字符错误率和 31.9% 词错误率,而 3 分钟校准与约 13 分钟全量校准无显著差异,但评估句一旦从所有训练数据中移除则退化到 78.6% 字符错误率。
针对 27 人、每人不足半小时数据的封闭 50 句表面肌电解码任务,论文用已发布单被试检查点初始化、多被试预训练再加目标被试微调达到 21.7% 字符错误率和 31.9% 词错误率,而 3 分钟校准与约 13 分钟全量校准无显著差异,但评估句一旦从所有训练数据中移除则退化到 78.6% 字符错误率。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
该研究用唇圆展无发声收缩加视觉反馈与视觉模拟量表测量主观构音努力,35 人队列平均呈二次关系而个体函数形态与任务执行差异大,代价是孤立口面动作与仅用表面肌电表征生理努力限制了向连续言语的直接推广。
该文把皮肤电、动作与面部表情当作可演奏的音乐材料,用 Python 中间件加 Pure Data 两阶段映射在键盘实践中检验,报告称离散受限映射更清晰、高层和声触发更连贯,代价是即时性下降与系统复杂、学习曲线陡峭。
该研究把植物生物电与光照湿度数据经物联网送入作曲环境来实时生成六声部乐谱,早期排练与观测显示声音与光照变化伴随信号波动,但完整演奏者与植物反馈闭环与互惠机制仍待验证。
该研究在 10 名法语 4 岁儿童约 200 小时家庭录音中检验社交情境对说话速度的影响,发现含家庭外成员的小组中语速更快,且身体活动越高语速越慢,支持补偿而非共同唤醒解释。
论文要解决肌电信号不可听不可判导致的生成模型难调试问题,选择先用含音频的七通道数据找架构再转六通道肌电的策略加两个残差向量量化变分自编码器与交叉注意力解码器 Transformer,最强证据是七通道实验中成功配置重建多样性恢复而过大隐维度配置坍缩,代价是六秒序列限制与推理仍需音频起始符。
针对钢琴演奏中呼吸隐蔽且难以精确回忆的问题,作者用纺织集成应变腰带同步记录胸腹呼吸与演奏数据并以事后可视化界面支持三重视角反思,在一位 35 年琴龄演奏者一个月四次会话中发现吸气锚定低音等耦合模式与主客观不一致的盲区,代价是单人个案尚不能推广到群体。
针对光学动捕只记大位移而漏掉 popping 式收缩与紧张的问题,KinoGroove 用预录动捕加肌电在 XR 里异步作曲,以 27 相机加 41 点骨架与上半身多通道肌电为证据,代价是设备昂贵且暂无用户评估。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
该研究把听众相位性皮肤电反应做成实时投入度信号,经滤波归一化与乐句对齐后映射为合成器低通滤波器截止频率的低频振荡器速率,在小提琴与爵士标准曲的三分钟单听众演示中跑通了表演者与听众可互相听见的反馈环,代价是仅单样本探索、无定量对照与群体验证。
该研究针对无预训练的即兴场景,用声音与肌电的四个在线预测器判断演奏是否可预测并以电刺激惩罚,报告预测准确率约为随机猜测的 1.5 至 2.5 倍,代价是误报多、演奏者注意力被算法牵走且只在作者本人的电子乐器演出中验证。
针对老年用户吹气能力差异导致高音量区够不着或维持不住的问题,该文用舒适呼吸对准 U=50、个性化上边界对准 U=100 的非线性归一化把不同绝对压力映射到同一 0-100 任务空间,两名 63 岁被试的试点显示同一长音目标带可被共同解释,但样本仅 2 人且单次会话不支持推广。
该研究用古筝、二胡、唢呐、堂鼓四种乐器的自录样本做前 8 个泛音的分轨重组与心电驱动的视听交互,在百余人次的非正式展览观察中看到熟悉又陌生的文化联想,代价是只有定性观察而无可控评估与生理推断力。
该研究把单通道肺音去噪定义为从心音、摩擦与环境噪声叠加中恢复胸壁肺音,用可微短时傅里叶变换包裹的复数谱残差 U-Net 做端到端估计,在合成与真实混合上报告了更高的信噪比改善和更低的重建误差,但高信噪比段的失真风险与临床保真仍待单独验证。
该文要解决现场表演中表达意图与听众感受难以对齐记录的问题,选择设计一套从练习曲到即兴的可重复多模态采集协议,用 16 场录音的阶段与表达性对照趋势验证流程可行,代价是商用低通道传感器保真度有限且样本存在西方与人口偏斜。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对听诊设备、听诊位置和病人特征带来的系统性偏移,该研究用门控残差、FiLM、TAFiLM 和 SoftFiLM 四种元数据调制机制改造音频频谱 Transformer,在 ICBHI 上 SoftFiLM 取得 4 类 64.11% 和 2 类 72.40%,代价是全层调制与全量微调及额外掩码正则。