英文题目:Steps toward a wearable-informed model of real-world listening effort and fatigue among adults with hearing loss
会议身份:
conference:interspeech:2026:conference-paper-id:meng26e_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#助听器 #用户研究 #生理信号 #音频分类
评分:5.4/10 | 创新 1.1/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.0/1.5
排名:后50% | 文档类型:应用研究
👥 作者与机构
- David Meng:机构信息未能从会议 PDF 纯文本可靠映射
- Marisa Poulos:机构信息未能从会议 PDF 纯文本可靠映射
- Erin O’Neill:机构信息未能从会议 PDF 纯文本可靠映射
- Qi Yang:机构信息未能从会议 PDF 纯文本可靠映射
- Ivan Iotzov:机构信息未能从会议 PDF 纯文本可靠映射
- Jorge Mejia:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本研究输入为听损成人在日常生活中经Apple Watch采集的心率、心率变异性、腕部声学描述子与睡眠数据,输出为瞬时聆听努力是否偏高与当天疲劳是否偏高,难点在于消费级信号粗糙、场景不可控且主观标签稀疏漂移。先由手表端超简生态瞬时评估以困难聆听时刻为输入,负责自发记录努力标签并同步提取声学特征,输出瞬时标签-声学对齐记录。再由日级聚合与二值化重构以上述对齐记录联同被动生理监测及手机端晨间睡眠与晚间疲劳调查为输入,负责聚合成睡眠、生理与声暴露日特征并重构为高努力与高疲劳二分类标签,输出可建模的日级样本。最后由分类与留一被试验证以上述日级样本为输入,负责用随机欠采样提升训练努力模型、用随机森林训练疲劳模型并检验个体泛化,输出泛化性能估计以判断野外可用性。与仅依赖实验室生理或声学的方法不同,该工作将内在生理负荷与客观声环境在真实聆听时刻对齐建模,直接面向用户状态感知声处理,但仍受限于腕部粗粒度传感。在每日疲劳评估任务下,非助听器使用者的疲劳得分为4.41,低于助听器使用者的得分5.55。该结论仅适用于轻中度对称感音神经性听损的小样本、缺失约32%日记录的场景,未验证跨设备、重度听损与长期纵向外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么听得累比听不清更难管?
本解读的输入是这篇实地研究论文的正文与 4 张官方原图,目标是让刚进入语音与听觉方向的研究生能复述它做了什么、怎么做的、在什么条件下成立。需要保留的关键信息是被试构成、采集方式、预测任务的切分方式与两个分类数字,输出则按从任务到复现的顺序展开。听力损失人群的抱怨常常不是测不准某个词,而是开 1 天会后脑子发木、晚上不想再说话。论文把这个问题拆成两个时间尺度:当下为了听懂而多花的力气,以及 1 天下来累积的疲劳。
前者受噪声、混响和多人说话影响很大,后者还与睡眠、整天声暴露和生理负荷有关。现有助听器能根据声学切换方向性与降噪,但看不见用户此刻累不累,因此作者想验证消费级手表能否在真实生活中同时记录主观感受与客观生理声学上下文。
聆听吃力 × 聆听相关疲劳: 聆听吃力指为听懂语音而即时调动的认知与生理资源,时间尺度是分钟级的当下时刻;聆听相关疲劳指这种吃力在 1 天内累积后的耗竭感,时间尺度是天级的累加结果。二者搭配的理由是只看瞬间吃力无法解释傍晚为何更累,只看疲劳又找不到是哪个场景造成的,组合起来才能把瞬间声学与生理信号和全天结局连成一条从触发到累积的链路。
白话先说清楚:聆听吃力英文是 listening effort,指听懂困难声音时大脑额外投入的资源;聆听相关疲劳英文是 listening-related fatigue,指这种投入持续后的疲惫结局。论文的逻辑是吃力是因、疲劳是果,但果不是因的简单相加,因为睡眠不好的人起点就更累。对初学者而言,记住这个因果链很重要,后面所有特征工程都是围绕它:用声级与心率解释当下吃力,用整天声暴露、心率极值与整夜睡眠解释全天疲劳。
实验室指标为什么搬到大街上就不好用?
与本研究同输入、同目标的路线主要有 3 条。第一条是认知负荷理论与框架 for understanding effortful listening,认为听觉退化迫使听者调用更多认知资源,从而挤占其他任务并导致疲劳,这解释了为什么要测吃力。第二条是生理指标路线,心率变异性英文是 heart rate variability,常被联系到认知负荷与压力,皮肤电等交感指标也随脑力负荷上升,这支持用手表心率做内在状态探针。第 3 条是声学处理路线,方向性麦克风与波束形成通过增强目标声、抑制竞争声在某些条件下降低吃力,但它们只看声学不看人。
论文指出的缺口是很少有工作把内在生理信号与客观声学上下文放在同一个生态效度框架里,既有主观报告又有连续生理与声学,且覆盖自然发生的日常场景。实验室范式能控制信噪比,却抓不住 1 天中什么时候最累、哪种场景最耗人,因此作者转向生态瞬时评估英文是 ecological momentary assessment,即在生活中即时打卡记录感受的方法。
要预测的到底是五档评分还是累与不累?
论文实际要解决的是两个可核对的分类问题,而不是连续回归。第一个是时刻级问题:给定 1 次手表打卡前后 30 秒声学特征加同期心率与心率变异性,判断这次自评吃力属于高吃力还是非高吃力。原始量表是 5 级,分别是 Very Low、Low、Moderate、High、Very High,论文报告近半数是 Moderate,两端很少。第二个是天级问题:给定 1 天内所有打卡声学汇总、白天心率极值、昨夜睡眠与当天困难场景自述,判断当天晚间疲劳是否达到疲劳阈值。
原始疲劳是 0 到 10 共 11 级,论文按小于 6 为不疲劳、大于等于 6 为疲劳切分,得到 72 与 73 个样本接近平衡。教学上可以举一个例子:比如某位被试中午在食堂打了 1 次卡评了 High,当晚评了 7 分,那么时刻模型只管中午那次算不算高,天模型则把全天所有中午下午的卡加睡眠一起算今天算不算累。这个例子只是帮助理解粒度,不代表原文有该具体数值。
从一次点按到一天标签的全链路是什么?
先沿一个样本走完全程。假设 1 位助听器用户中午在嘈杂餐厅觉得听不清,他抬腕在手表应用上点 Yes 确认正在经历困难,再滑动选择吃力程度,系统同时保存 30 秒声学描述子而不存原始录音,手表后台还有心率序列。当晚他再在手机上回答今天总体多累、早上回答昨晚睡得如何。
后台把中午这次打卡的响度、心率、心率变异性及其比值平方交互项拼成时刻特征,把全天多次打卡的平均声级、最大心率、睡眠时长等聚合成天特征,分别送给两个分类器得到高吃力与否、疲劳与否。整个链路由 3 段构成:手表端超短时自发起打卡加声学提取,手机端早晚问卷补睡眠与结局标签,离线端做二值化与分类评估。
生态瞬时评估 × 被动可穿戴监测: 生态瞬时评估是由被试在真实生活中主动点选手表完成的主观报告,负责给出当前吃力几级、今天有多累;被动可穿戴监测是由手表自动记录的心率、心率变异性、睡眠分期与 30 秒声学描述子,负责给出客观上下文。二者搭配的原因是主观报告有标签意义但稀疏,被动信号连续但不知好坏,同步采集后才能用客观特征去预测主观标签。
本小节配的手表界面图是理解负担设计的关键,导读如下:该图展示了四屏按时间顺序的打卡流程,重点看从确认到评分再到完成的点按次数与视觉反馈,横向对比有助于体会为什么无提醒下仍能保持每天约 3 次记录。
看图路径: 1. 从左到右看四块手表屏的流程:确认是否遇到困难、滑动选择吃力程度、显示完成对勾、累计计数;2. 注意第二屏用颜色渐变滑杆代替数字输入,目的是几次点按完成;3. 观察每屏右上角时间从 2:33 到 2:35,体会超短时评估的设计
论文图 3。原论文 Figure 2:“Screenshots of the watch-based EMA interface in chronological order. Check-in questions were completed via a small number of screen taps.”。
从像素可见四块黑底手表屏:第一屏问是否正在经历听觉挑战并给出 No 与 Yes,第二屏问有多挑战并用绿到红渐变滑杆选 Moderate,第三屏显示绿色对勾与已完成 1 份,第四屏显示累计计数与开始按钮,右上角时间从 2:33 走到 2:35。这说明每次打卡只需几次点按,且用滑杆代替键盘输入,反馈明确。结合正文无最低次数要求仍能收回可比数量,可以判断界面低负担是参与度的重要支撑,但也不能排除有科研经验的被试自行按每天 3 次打卡的习惯。
手表到底记录了哪些信号与声学量?
组件按输入到表示的顺序有 3 类。第一类是主观标签:手表打卡的 5 级吃力、晚间 0 到 10 疲劳、晨间 0 到 10 睡眠质量,以及白天困难场景数与最难场景描述,还有基线问卷包括修订版听觉障碍量表筛查版、英文简称 RHHI-S,范德比尔特疲劳量表、英文简称 VFS,言语空间质量量表 12 题版、英文简称 SSQ12。第二类是生理与睡眠:苹果手表的心率、心率变异性、白天最大心率,以及快速眼动加深睡眠总时长。
第 3 类是声学:每次打卡起始的 30 秒窗,采样率 22050 赫兹、帧长 23 毫秒,提取 A 计权与非计权声级、过零率、功率谱、浊音段倒谱基音特征、谱平坦度、熵与混响相关度量,不存原始音频以保护隐私。天级建模时还用 06:00 到 22:00 的日间聚合与全天打卡均值。术语首次出现按要求给白话:心率变异性指心跳间隔的毫秒级波动,A 计权声级指模拟人耳听感的加权响度分贝数。
心率变异性 × A 计权声级: 心率变异性是以毫秒为单位的心跳间期波动,反映认知负荷与自主神经调节,分工是刻画人的内在状态;A 计权声级是以分贝为单位、模拟人耳敏感度的环境响度,分工是刻画外在声学负荷。二者搭配的理由是同样 60 分贝下心跳平稳与心跳紊乱可能对应完全不同的吃力,组合成心率与响度比值及交互项后,模型才能区分是环境吵还是人吃力。
对初学者要强调手表声学是腕级而非耳级测量,采样粗且受手臂遮挡,与助听器麦克风位置不同,因此声级只能做相对暴露指标,不能当作鼓膜处精确剂量。心率也受走路、咖啡、情绪干扰,所以论文才加入响度归一化与交互项,试图剥离单纯运动带来的心率升高。
响度归一化与交互项想解决什么混淆?
第二个组件是特征工程。时刻级预选变量包括心率、1 千赫处高于阈值的响度、心率变异性,以及心率与响度比值、心率变异性平方、心率心率变异性响度之间的交互项。天级变量则包括主观睡眠分、客观快速眼动加深睡眠时长、最大心率、平均心率变异性、最大日间声级、打卡声学均值与谱带变化率、日困难场景数与基线问卷分。
设计意图是响度把声刺激换算到可听域上,心率除以响度近似得到单位声刺激下的生理反应,平方项允许非线性,交互项允许声与生理互相调节。论文报告即使有这些工程量,直接预测 5 级与连续疲劳仍表现有限,只有二值化后才可用。这提示消费级信号的区分粒度只够回答累与不累、高与不高,不够还原细粒度等级,复现时不应强行做五分类。
没有神经网络训练时模型学了什么?
本研究没有训练深度神经网络,也就没有梯度、冻结层与反向传播,需要明确说明未训练什么与实际做了什么计算。实际计算是两条经典机器学习流水线。吃力分支用随机欠采样增强英文是 Random Under-Sampling and Boosting,简称 RUSBoost,它在每次增强迭代中对多数类欠采样以平衡类别,再训练弱分类器并加权投票,输入是时刻级心率响度及工程项,监督来源是二值化后的高吃力标签,评估用 70/30 划分看召回精确率与校准后曲线下面积,再用留 1 人交叉验证看换人泛化。
疲劳分支用随机森林英文是 Random Forest,输入是天级聚合特征,监督来源是二值化后的疲劳标签,评估同样用 70/30 划分与留 1 人交叉验证,报告准确率灵敏度特异度与特征重要性。论文未报告超参数网格、树数深度、随机种子与校准方法细节,这是复现时需要补记的缺项,不能从模型名称推定默认实现。
RUSBoost × 随机森林: RUSBoost 是通过随机欠采样缓解类别不平衡再做增强学习的分类器,在本研究中负责时刻级高吃力与非高吃力的二分类;随机森林是通过多棵决策树投票的集成方法,在本研究中负责天级疲劳与非疲劳的二分类。分工不同的原因是吃力数据偏向中等、高度吃力较少需要偏向召回,疲劳数据经切分后接近平衡更适合稳健投票,二者分别对应瞬时检测与全天汇总两种决策粒度。
两种验证口径的含义需要分开。
留一被试交叉验证 × 70/30 划分: 70/30 划分是把所有打卡混在一起按比例切训练集与测试集,检验的是在已见过部分被试分布时模型能否分对;留一被试交叉验证是每次留出一整个人做测试,检验的是对完全没见过的新人能否分对。前者分工是给出上限性能,后者分工是给出泛化性能,二者搭配才能同时回答模型学会了什么与换人后还剩多少。
记住总体趋势不等于每人成立:吃力留 1 人后 F1 跨度很大,疲劳留 1 人后平均准确率明显低于混人划分,这正是小样本实地研究的典型表现。
46 人 10 天的数据是如何收上来的?
实验条件按人、设备、流程 3 层交代。被试是 46 名临床诊断感音神经性听力损失成人,23 名双耳助听器用户且佩戴超 6 个月,年龄 24 到 76 岁、均值 61 岁、14 名女性,23 名非助听器用户年龄 35 到 83 岁、均值 62 岁、10 名女性,双耳四频率平均听阈覆盖轻到中度,助听器组显著更重,非对称差不超过 9 分贝。设备是第二代苹果手表 SE,自备表也可,白天黑夜佩戴,保持日常作息与助听器设置,另用手机应用收早晚问卷。
流程是现场完成基线问卷与知情同意后进入 7 到 10 天实地,每天自发起在遇到听觉困难时手表打卡,无最低次数与定时提醒,早晚各 1 次手机问卷分别记录睡眠与全天回顾。声学窗为打卡起始 30 秒,不存原音。缺失规则是天级建模要求当天有手表打卡加早晚问卷加睡眠记录,缺任一则该天弃用,这直接导致约 32% 预期数据缺失。
本小节的听力图用于核对两组基线是否可比,导读如下:该图按左右耳与是否佩戴助听器分成四格,纵轴是听阈分贝数且向下变大,横轴是频率千赫数,黑线是个人曲线,彩线是组均值,重点看组均值高低与高频下滑形态。
看图路径: 1. 先确认四格布局:列是左耳与右耳,行是助听器组与非助听器组;2. 看纵轴阈值随频率走高而变大,横轴从 0.25 到 8 千赫;3. 比较红色与青色平均线,助听器组整体位置更高
论文图 1。原论文 Figure 1:“Individual and group-averaged audiograms for hearing- aid users and non-users (n = 23 per group).”。
从像素可见上下两行分别为佩戴组与非佩戴组,左右两列分别为左耳与右耳,纵轴 0 在上 120 在下,横轴从 0.25 延伸到 8。每格内十余条黑线个体差异大,高频端普遍下垂。红色与青色均值线在佩戴组位置更高,非佩戴组更低且更平,这与正文佩戴组四频率均值 32 到 59 分贝、非佩戴组 26 到 49 分贝一致。也正因基线听力不同,后面声级与吃力的组间趋势不能直接解读为助听器效果,需谨慎对待混淆。
无提醒的手表打卡真的有人用吗?
先回答参与度问题,再回答分类性能。论文把本研究与既往手机研究对比:既往是每天 3 次定时提醒加鼓励自发起,本次是完全自发起且无最低要求。结果是两边平均每天条数都约 3 次,本次顶部标注为 3.026,既往为 2.977。时间分布上本次集中在中午到下午早段,既往更贴近提醒时刻并延续到晚上。作者的判断是手表界面足够便捷,能抓住自然发生的困难时刻而非提醒时刻,但也承认有科研经验的被试可能 inferred 每天 3 次的期待,出现整齐的每天 3 条。指标方向是条数越多、越集中在日间自然需求时段,说明生态效度越好。
本小节的时间分布图是参与度证据的核心,导读如下:该图是左右对称的半小提琴图,纵轴是时刻从早 6 点到晚 23 点,左红为本研究、右蓝为既往研究,宽度表示加权概率密度,顶部数字为平均每天条数,重点比较峰位与尾部。
看图路径: 1. 看纵轴从早上 6 点到夜间 23 点,比较左右半边小提琴的胖瘦位置;2. 读顶部两组平均每天条数,确认无提醒与有提醒的数量接近;3. 注意左侧红色在正午附近最宽,右侧蓝色向傍晚延伸更明显
论文图 2。原论文 Figure 3:“Time-of-day distribution of EMA entries, shown as completion-rate–weighted probability densities of check-in times.”。
从像素可见左侧红色在正午 12 点附近最宽,向上下收窄,傍晚后迅速变薄;右侧蓝色峰更宽且向傍晚 18 点延伸更明显,夜间也有一定宽度。顶部红色 3.026 与蓝色 2.977 数值接近,证实无提醒下数量未掉。结合正文加权方式是按每人每天均值加权,可知高产被试贡献更大,但平均数相近仍支持可行性结论。不能把曲线胖瘦直接读成性能好坏,它只说明何时打卡,不说明分得准不准。
高吃力与高疲劳各能分到多准?
下面两张表分别对应人与时刻两个粒度的证据,表前先讲清比较问题与公平条件。第一张表问两组基线是否可比,比较的是年龄性别与听阈范围,公平条件是同一招募库与同一四频率定义,指标方向是听阈越高表示越重。第二张表问时刻级高吃力能否检出,比较的是二值化前后与混人划分下召回精确率,公平条件是同一批心率声学特征,指标方向是召回越高漏检越少、精确率越高误报越少。第三张表问天级疲劳能否检出,比较的是平衡切分下的准确率灵敏度,公平条件是同一天级聚合窗口,指标方向是三者越高越好且需显著高于 chance。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 助听器用户年龄 | 年龄范围与均值 | 35-83 岁,均值 62 岁 | 24-76 岁,均值 61 岁 | 年龄接近 |
| 非助听器用户听阈 | 四频率均值范围 | 26-49 dB HL | 32-59 dB HL | 助听器组更重 |
| 性别构成 | 女性数 | 10 名女性 | 14 名女性 | 性别略有差异 |
| 对称性 | 双耳差 | 不超过 9 dB HL | 不超过 9 dB HL | 均相对对称 |
上表说明两组人数与年龄可比,但听阈基线不可比,助听器组更重且检验显著,这为后面声级趋势的谨慎解读埋下伏笔。未胜出项是组间疲劳与睡眠等客观指标均无显著差异,不能声称戴助听器就不累。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 手表打卡 5 级分布 | Moderate 占比 | Very Low 占 6% | Moderate 占 46% | Very High 占 10% |
| 高吃力二分类 70/30 划分 | 召回率 | 连续 5 级预测有限 | 召回 92.6% | 漏检很少 |
| 高吃力二分类 70/30 划分 | 精确率与 F1 | 连续 5 级预测有限 | 精确率 77.9%,F1 为 84.6% | 误报仍存在 |
| 留 1 人验证 25 人 | 个体 F1 范围 | chance 基线 | 33.33% 到 95.24% | 13 人 F1 大于 70% |
| 留 1 人召回 | 满分人数 | chance 基线 | 15 人召回 100% | 偏向灵敏度 |
上表的主要收益是混人划分下高召回,代价是换人后精度波动大,有人 F1 仅 33.33%,且 15 人满召回伴随误报,说明模型宁可错报也不漏报。未评测边界是 5 级细粒度与连续回归,原文明确表现有限,复现时不应夸大为已解决细粒度吃力估计。
| 条件 | 指标 | 基线 | 本方法 | 比较对象 |
|---|---|---|---|---|
| 晚间 0-10 疲劳切分 | 样本平衡 | 小于 6 为不疲劳 | 72 与 73 个样本 | 近似平衡 |
| 天级 70/30 划分随机森林 | 准确率 | chance 水平 | 76.2% 准确率 | 显著高于 chance |
| 天级 70/30 划分随机森林 | 灵敏度与特异度 | chance 水平 | 灵敏度约 76.2% | 特异度相近 |
| 留 1 人验证 | 平均准确率 | 混人 76.2% | 均值 63.5%,中位 67% | 掉点明显 |
| 特征重要性前五 | 关键信号 | 单一问卷 | 平均 A 计权声级等五项 | 声睡心率结合 |
上表说明天级疲劳比时刻吃力更依赖多天聚合,前五重要特征包括打卡平均 A 计权声级、白天最大心率、前夜快速眼动加深睡眠时长、谱带变化率与日困难场景数。代价是留 1 人后均值 63.5% 只算中等稳健,且 8 人与 7 人因单类无法算灵敏度特异度,缺失与小样本是主要限制。
戴助听器的人是不是在更吵的地方才觉得累?
这一节按消融与反证的思路组织:测组间差异、看声级随吃力的曲线、检验统计显著性。论文用独立样本 t 检验比较日疲劳,非用户均值 4.41、助听器用户均值 5.55,差异未达显著。睡眠质量、手表睡眠时长、心率变异性与打卡声学熵平坦度倒谱过零率混响等也无显著组差,只有打卡 A 计权声级接近显著。于是做了探索性分析,看同一吃力档下两组声级是否不同。指标方向是同档声级越高,说明在更吵处才报同等吃力。
本小节的散点图用于检验该趋势,导读如下:该图横轴是 A 计权声级分贝,纵轴是五档吃力从很低到很高,蓝点为非用户、红点为助听器用户,小点是单次打卡,大点加横向误差条是组均值,重点看同档红蓝大点的左右错位。
看图路径: 1. 看横轴 A 计权声级、纵轴五档吃力,区分蓝色小点与红色小点;2. 找每档的大圆点均值与横向误差条,比较同档红点是否偏右;3. 观察从很低到很高档,整体点云是否随吃力升高向右移动
论文图 4。原论文 Figure 4:“A-weighted sound level versus self-rated listening effort during watch check-ins for HA users (red) and non-users (blue).”。
从像素可见每档都有密集点云集中在 50 到 75 分贝附近,Moderate 档点数最多,与 46% 占比一致。大圆点上助听器红点在各档均略偏右,非用户蓝点略偏左,但误差条重叠明显。正文也强调差异未达显著且基线听力不同,因此只能说趋势提示两组在声音策略或听觉剖面上可能不同,不能当作助听器降低或增加吃力的证据。未胜出项与边界是该分析是事后探索且样本仅轻中度损失,功效不足以检测组与环境的交互。
哪些缺失与设备限制会拉低结论?
限制分 3 层。第一是缺失:约 32% 预期数据缺失,主要因天级记录要求集齐晨晚问卷、手表打卡与睡眠数据,缺任一则整天弃用,可用疲劳标签仅 145 个。这增加了建模难度并使个体估计波动,部分留 1 人折只有单一标签而无法算灵敏度或特异度。第二是设备:第二代苹果手表 SE 采样控制有限,环境声级采样粗、无连续心电级心脏信号、心率变异性采样控制有限、无血氧访问权,且声学为腕级非耳级,与真实鼓膜暴露有差距。
第三是设计:无训练论文之外的建模细节如随机种子与校准方法未报告,组间比较功效不足,被试多有参试经验可能带来每天 3 次的习惯性打卡。区分表述很重要:论文报告的是二值化后显著高于 chance,支持的是可行性,有限解释是声睡心率结合有助于疲劳判断,待验证的是实时自适应助听处理,原文并未实测降噪切换或延迟功耗,不能承诺这些量得到改善。
要重做一遍先准备什么、按什么顺序跑?
复现先做三件事。第一是按原文重建人群与基线:46 人两组各 23 人,记录年龄性别与 0.5、1、2、4 千赫四频率均值及左右耳对称性,完成 RHHI-S 大于 8 的纳入、VFS 与 SSQ12 基线问卷,并保留自备助听器日常设置不变的条件。第二是重建采集管线:手表端实现两到三屏超短时打卡并在打卡起点存 30 秒声学描述子而不存原音,采样率 22050 赫兹、帧长 23 毫秒,同步心率与睡眠分期,手机端实现晨间睡眠与晚间疲劳问卷,天级窗口固定为 06:00 到 22:00 聚合。
第三是重建标签与评估:吃力按 High 与 Very High 为高、其余为非高,疲劳按大于等于 6 为疲劳、小于 6 为不疲劳,先跑 70/30 混人划分再跑留 1 人验证,分别用 RUSBoost 做时刻分类、用随机森林做天级分类,报告准确率召回精确率 F1 与曲线下面积及混淆矩阵。还需补的验证是记录缺失率、报告超参数种子、公开特征重要性计算方式,并说明代码模型数据当前均无可验证公开资源,不得声称已开源。
训练资源与推理开销在原文未报告,重做时应另测手表续航、上传量与离线推理耗时,不能把总体趋势当作每步都成立。
何时值得试、结论边界在哪里?
值得尝试的场景是需要低负担长期监测听觉负担的研究与临床随访:当你需要知道患者一周里哪几天最累、哪类声环境最耗人,且只能用消费级手表加简短打卡时,这套二分类思路可直接借用。时刻级适合做高吃力提醒的候选触发,天级适合做次日疲劳风险的回顾性解释,前提是接受误报换召回的代价。不值得的是把 wrist 声级当精确剂量、把二分类准确率当连续预测能力,或把组间趋势当助听器疗效。
核心判断是手表告知的吃力与疲劳在日常中可行但粗糙,连续评分仍难,换人泛化中等,缺失是最大工程敌人。未来要加活动、位置、对话上下文与个体基线,并处理缺失与小样本,才能走向随用户状态自适应的助听技术与纵向监测工具。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



