论文解读

多数类准确率会骗人:自然脊柱门诊普通话语音的开源情感识别为何在少数情绪上失效

在 65 条自然脊柱门诊普通话话语上比较 emotion2vec+、SenseVoice 与 FunASR 三套开源语音情感识别,以研究者共识为参照,发现非加权准确率 55.4%-61.5% 掩盖了少数情绪接近零的召回与仅约 24% 的样本加权准确率,代价是标注噪声大与类别极不平衡下无法直接部署。

 · 约 18 分钟 · 8817 字 阅读 →
论文解读

长期照护肺炎听诊:X 线监督与三通道前胸协议的稳定判别

针对日本长期照护高龄有症状人群的六通道前胸数字听诊任务,论文用 X 线监督训练共享权重 ARP-N 卷积网络并在病人级重复交叉验证下比较临床诊断监督,最强证据是听诊单模态 XRAY 模型 F1 为.729、准确率为.783 而融合模型 AUC 为.791,代价是单中心 185 例与域漂移限制外推。

 · 约 19 分钟 · 9465 字 阅读 →
论文解读

把谁说了什么写对:用真实失败做偏好优化的端到端角色转写

针对临床访谈中医生与患者归属问题,论文用 LoRA 微调 Whisper-large-v3 并加帧级角色头做端到端转写,再用真实解码失败做 DPO 提炼,在 29 个 DAIC-WOZ 测试会话上达到 0.973 角色准确率与 0.119 DER,但中文语音转换数据的剩余误差仍集中在角色判错而非漏转。

 · 更新于 2026-09-24 · 约 19 分钟 · 9324 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-17

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 53 分钟 · 26180 字 阅读 →
论文解读

长音频直接写病历:端到端 SOAP 生成的轻重模型对照

针对 5 分钟以上医患对话直接生成 SOAP 病历的问题,论文用统一端到端架构比较 3B 轻量与 30B 重量模型,报告四阶段训练把 Concept F1 从零样本的 0.26 和 0.18 分别推到 0.4082 和 0.5167,并以级联基线为对照说明直接优化的收益与容量代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9599 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

在手术室里听出细微口吃:用 GRU 把脑刺激引起的言语障碍自动分成正常与异常

针对清醒脑肿瘤手术中电刺激引起的短暂构音障碍难以实时听辨的问题,论文提出录音去噪加 Whisper 切分加 MFCC 加 GRU 的二分类方法,在计数与 DO80 任务上报告约 90% 以上验证精度,但合并任务出现过拟合且异常样本仍偏少。

 · 更新于 2026-09-24 · 约 17 分钟 · 8478 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

急救电话里的情绪不等于病情:27 项语音辅助分诊研究的任务、证据与落地差距

该综述按 PRISMA 筛出 2014-2025 年 27 项急救电话语音研究,发现 78% 做呼叫优先级排序且近半依赖情绪识别,但仅 7 项评估临床或运行影响、14 项依赖模拟语料,说明算法性能不等于分诊可用性。

 · 更新于 2026-09-24 · 约 16 分钟 · 7849 字 阅读 →
论文解读

把每一步变成声音:智能鞋如何同时处理冻结步的急救与步幅的慢训练

针对帕金森步态中冻结步突发与步幅缩小需长期训练的问题,该研究用足部边缘计算加网页蓝牙开发套件实现一步一鼓与随步幅开花的两套音乐反馈,在仅两例的试点中报告转弯冻结时长从 42.0 s 降至 2.3 s、交互期步幅显著上升,但样本极小且顺序未平衡,长期效果待验证。

 · 更新于 2026-09-24 · 约 24 分钟 · 11724 字 阅读 →
论文解读

给耳蜗模型装上逆行路:用瞬态诱发耳声发射反推外毛细胞状态

针对耳蜗个体差异难以直接调参的问题,该文在可微 CARFAC 上增加后向传输与相干反射路径,以复合损失拟合瞬态诱发耳声发射波形,在传输线模型仿真与 58 耳实测数据上显示可还原不同听力损失形态,但对真实生理状态与泛化仍需更多验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8669 字 阅读 →
论文解读

肺音没有干净配对时如何去噪:复数时频 U-Net 的分层合成与相位重建路线

该研究把单通道肺音去噪定义为从心音、摩擦与环境噪声叠加中恢复胸壁肺音,用可微短时傅里叶变换包裹的复数谱残差 U-Net 做端到端估计,在合成与真实混合上报告了更高的信噪比改善和更低的重建误差,但高信噪比段的失真风险与临床保真仍待单独验证。

 · 更新于 2026-09-24 · 约 17 分钟 · 8357 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

采集条件会改变声音:用元数据调制音频 Transformer 的内部表示

针对听诊设备、听诊位置和病人特征带来的系统性偏移,该研究用门控残差、FiLM、TAFiLM 和 SoftFiLM 四种元数据调制机制改造音频频谱 Transformer,在 ICBHI 上 SoftFiLM 取得 4 类 64.11% 和 2 类 72.40%,代价是全层调制与全量微调及额外掩码正则。

 · 更新于 2026-09-24 · 约 18 分钟 · 8615 字 阅读 →
论文解读

把传感与表面分开:为照护合奏重建触感与低延迟的模块乐器

针对社区合奏中运动障碍乐手的表达与照护后勤矛盾,该研究用可调硬度的 TPU 晶格加非接触霍尔传感与星形无线音频链实现约 7 毫秒端到端延迟,但开放式可拆洗结构与 2.4GHz 拥挤仍是代价与边界。

 · 更新于 2026-09-24 · 约 19 分钟 · 9047 字 阅读 →
论文解读

把听力筛查藏进播客静音里:间歇采集能省多少点击又保住多少精度

该研究把短暂宽带点击嵌入播客自然静音进行间歇采集与加权平均,在 1.5×播放约每分钟 102 次点击下取得平均约 5 dB 误差并把舒适度从 1.0×的低位提升到高位,代价是点击过少时误差底抬高。

 · 更新于 2026-09-24 · 约 19 分钟 · 9428 字 阅读 →
论文解读

无菌环境下不敢动手:语音多智能体如何接管手术室设备控制与延迟

针对无菌手术室中多设备协调控制难与语音交互延迟高的问题,论文提出分层语音流水线加智能体核心的 SurgicalRoomAgent,用 KV 缓存预热、流式提前执行与渐进式提示披露降低延迟与上下文压力,但所报告的延迟数字为理论估计且缺乏大规模临床验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8706 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

临床印地-英语混说下谁在说话:DiariZen 为何要解冻 WavLM 才跟得上

针对两说话人 Hindi-English 医疗对话的说话人日志任务,论文比较 Diaper、Pyannote 3.1 与 DiariZen 并做域自适应,最强证据是解冻 WavLM 的 DiariZen-large 在 dev2 上达 8.57% DER、六系统融合后达 8.48% DER,代价是半监督策略高度依赖模型且融合增加系统复杂度。

 · 更新于 2026-09-24 · 约 18 分钟 · 8756 字 阅读 →