Fairness Evaluation of Edge-AI Implementation for Cleft Lip and Palate Speech ASR

📄 平均分好看,重度患者却依然听不懂:在 Jetson 上重算唇腭裂语音的公平账 英文题目:Fairness Evaluation of Edge-AI Implementation for Cleft Lip and Palate Speech ASR 一句话:针对通用模型在唇腭裂不同严重度上系统性失效且云端不可靠的问题,论文用固定 280 条预算的严重度组合微调 Whisper-small 并在 Jetson 上做 FP16 端侧实测,以 NOMIMOSE 把汇总 WER 从 62.46% 降到 22.72% 且 RTF 保持 0.167 为证据,代价是重度组仍高达 54.96% 且仅在单一儿童语料上验证。 标签:#语音识别 | #迁移学习 | #低资源 评分:5.6/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Susmita Bhattacharjee:Indian Institute of Technology Guwahati, India Himashri Deka:Indian Institute of Technology Guwahati, India H.S. Shekhawat:Indian Institute of Technology Guwahati, India S.R.M. Prasanna:Indian Institute of Technology Dharwad, India 💬 毒舌点评 把严重度公平性与 Jetson 端侧实测放进同一闭环,直面了病理语音最痛的分布不均,选题切口准。短板是仅靠 280 条训练的单一儿童语料自证,重度词错误率仍在 55% 上下却被包装成均衡胜利,边缘侧也只是现成 Whisper 的半精度搬运。 ...

2026-09-04 · 更新于 2026-09-04 · 6 min · 1115 words

Removing Speech, Keeping Activities: A Privacy Firewall for Acoustic Sensing in Assisted Living

📄 关掉麦克风不行,擦掉人声才行:助老监听的隐私防火墙 英文题目:Removing Speech, Keeping Activities: A Privacy Firewall for Acoustic Sensing in Assisted Living 一句话:针对居家助老声音监测不敢录下谈话的落地难题,论文把语音剥离做成传感器后端防火墙,用全合成训练的 U 型谱映射 suppress 可检出语音并尽量保住活动识别,在轻干扰下恢复接近无语音基线,但重语音与真实强干扰下的不可懂性仍未被证明。 标签:#音频分类 | #迁移学习 | #语音活动检测 | #医疗音频 评分:5.9/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Pavlos Nicolaou:KIOS Research and Innovation Center of Excellence, University of Cyprus, Panepistimiou 1, Aglantzia, Nicosia, 2109, Cyprus Christos Efstratiou:School of Computing, University of Kent, Canterbury, CT2 7NZ, Kent, United Kingdom 💬 毒舌点评 把语音去除做成助老传感前端防火墙并坚持全合成训练,问题来自真实护理院部署痛点,链路完整值得肯定。但隐私证据几乎只靠语音活动检测(Voice Activity Detection / VAD)清零,且评估分支经过有损梅尔逆变换加Griffin-Lim重合成,所谓0%更多是检测器失明而非语音不可懂,强语音与多说话人家庭仍是外推。 ...

2026-09-03 · 更新于 2026-09-04 · 6 min · 1227 words

TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data

📄 不用真谱也能学会听谱:TUTTI 用 36 万首合成曲喂饱纯 Transformer 英文题目:TUTTI: Toward generalizable audio-to-score transcription via fully synthesized data 一句话:为破解音频到乐谱转录长期缺真实配对数据的困境,TUTTI 用 NotaGen 生成 36 万对合成音频-ABC 乐谱预训练纯 Transformer 编码器-解码器,再在真实数据上微调,在钢琴与弦乐四重奏上超越专用基线并零样本泛化到未见过的萨克斯,代价是评估仍限于 14.8 秒切块且合成到真实的域差距未被量化。 标签:#音乐转录 | #预训练 | #Transformer | #数据集 | #迁移学习 评分:7.4/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jianhuai Hu:机构信息未在 arXiv HTML 中可靠披露 Yashan Wang:机构信息未在 arXiv HTML 中可靠披露 Shangda Wu:机构信息未在 arXiv HTML 中可靠披露 Zhancheng Guo:机构信息未在 arXiv HTML 中可靠披露 Shijie Liang:机构信息未在 arXiv HTML 中可靠披露 Wuna Meng:机构信息未在 arXiv HTML 中可靠披露 Chuanqi Yang:机构信息未在 arXiv HTML 中可靠披露 Xiaobing Li:机构信息未在 arXiv HTML 中可靠披露 Feng Yu:机构信息未在 arXiv HTML 中可靠披露 Maosong Sun:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用 NotaGen 生成的 363610 对合成数据把数据饥渴的 Transformer 硬生生喂成了跨乐器通用转录器,在弦乐四重奏等任务上把总分从 84.9 拉到 95.6 的提升是实打实的。短板是整套流水线对合成到真实的域差距缺乏量化分析,EPR 与 SFZ 渲染的真实性未经听感或声学指标验证,且声称开源的 TuttiCorpus 与代码在截稿时仍为承诺状态。 ...

2026-09-02 · 更新于 2026-09-04 · 8 min · 1563 words

Not all generalisation failures can be bought back: four boundaries in affective audio modelling

📄 泛化失效有两种:能用标注买回的,和换什么表征也买不回的 英文题目:Not all generalisation failures can be bought back: four boundaries in affective audio modelling 一句话:论文把同一个声学到唤醒度的映射依次推过换库、换域、换合成、换生理通道与换人五道坎,用同一指标报告每道坎的天花板、幸存率和买回价格,证明同域损失可用百例标注回收三分之二,而跨音乐与环境声、跨到生理的损失在四类预训练表征下均未被买回。 标签:#音频理解 #迁移学习 #音乐理解 #对比学习 评分:8.5/10 | 创新 1.5/2 | 技术严谨 1.3/1.5 | 实验充分 1.4/1.5 | 清晰度 0.9/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Jingyi Zhang:Shanghai Huangan Technology Co., Ltd., Shanghai, China;Systems Neuroscience, Institute for Neuroscience, Department of Health Sciences and Technology (D-HEST), ETH Zurich, Zurich, Switzerland Xiaotong Yao:Correspondence: Jingyi Zhang, jingyi.zhang@hest.ethz.ch;Shanghai Huangan Technology Co., Ltd., Shanghai, China 💬 毒舌点评 把“模型不泛化”这句正确的废话拆成可证伪、可报价的两种诊断,并用跨语料、跨合成、跨通道、跨个体的四重边界在同一流程下兑现,统计对照与证伪实验的诚实度在情感音频领域罕见。短板是所有生理学结论仍被锁在单次实验室会话与人均约30试次量级,作者自称未测得生理目标上的学习曲线,却仍要给出信息受限标签,语气比证据多走半步。 ...

2026-08-31 · 更新于 2026-09-04 · 4 min · 767 words

Fine-Tuning Whisper for Automatic Speech Recognition in Baniwa: A Preliminary Study

📄 32 分钟语料能给 Baniwa ASR 一个起点,却不能借此跳过泛化检验 英文题目:Fine-Tuning Whisper for Automatic Speech Recognition in Baniwa: A Preliminary Study 一句话:这篇论文的可证伪判断是:在 1,373 条、约 0.54 小时且主要由引导式短片段构成的 Baniwa 语料上,Whisper Small 微调能形成初始词级基线;它没有证明连续语音、未见说话人或其他原住民语言也会得到同样表现。 标签:#语音识别 #低资源 #迁移学习 #预训练 #数据集 评分:4.7/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.6/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.4/1.5 💬 毒舌点评 这篇论文真正做对的是克制:它没有把 0.54 小时引导式短录音包装成“解决 Baniwa ASR”,而是留下 Whisper Small、Spanish transcription prompts、90%/5%/5% 切分和 WER/CER 的可检查起点。尤其 step 200 的 37.50% WER 与 step 300 的 40.00% WER 并置,至少让读者看见小语料微调的 checkpoint 选择不是看训练 loss 便可交差。 ...

2026-08-27 · 更新于 2026-09-04 · 4 min · 705 words

Cross-Subject Generalization in Decoding Perceived Speech from Non-Invasive Brain Recordings

📄 Cross-Subject Generalization in Decoding Perceived Speech from Non-Invasive Brain Recordings 标签:#语音识别 #对比学习 #迁移学习 #多模态模型 8.3/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #对比学习 | #迁移学习 #多模态模型 | arxiv 👥 作者与机构 第一作者:Aoke Zhang(北京大学智能科学与技术学院言语听觉研究中心、北京大学先进交叉学科研究院 BioMed-X 研究中心) 通讯作者:Jing Chen 作者列表:Aoke Zhang、Bo Wang、Xihong Wu、Heping Cheng、Jing Chen(机构:北京大学智能科学与技术学院言语听觉研究中心;北京大学先进交叉学科研究院 BioMed-X 研究中心;通用人工智能全国重点实验室) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 547 words

Simulation-to-Real First-Break Segmentation for Efficient Inversion in Musculoskeletal Ultrasound Tomography

📄 Simulation-to-Real First-Break Segmentation for Efficient Inversion in Musculoskeletal Ultrasound Tomography 标签:#音频事件检测 #CNN #迁移学习 #医疗音频 9.8/10 | 创新 1.6/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.3/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 9.8/10 | 前10% | 文档类型:应用研究 | 评分置信度:中 | #音频事件检测 | #CNN | #迁移学习 #医疗音频 | arxiv 👥 作者与机构 第一作者:Yifei Sun(State Key Laboratory of Acoustics and Marine Information、Laboratory of Ultrasonics, Institute of Acoustics, Chinese Academy of Sciences;University of Chinese Academy of Sciences;Université Bourgogne Europe, IMVIA UR 7535) 通讯作者:Yubing Li、Weijun Lin 作者列表:Yifei Sun、Yubing Li、Yannick Benezeth、Stéphanie Bricq、Yunrong Zhang、Lekang Jiang、Chang Su、Ligang Cui、Weijun Lin(机构:Institute of Acoustics, Chinese Academy of Sciences;University of Chinese Academy of Sciences;Université Bourgogne Europe, IMVIA UR 7535;Department of Ultrasound, Peking University Third Hospital) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 466 words

A Speech Corpus for Mizo Automatic Speech Recognition: Whisper and SraVaani 1.0 Fine-Tuning with Morphology-Aware Evaluation

📄 A Speech Corpus for Mizo Automatic Speech Recognition: Whisper and SraVaani 1.0 Fine-Tuning with Morphology-Aware Evaluation 标签:#语音识别 #数据集 #低资源 #迁移学习 6.7/10 | 创新 0.8/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 6.7/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #语音识别 | #迁移学习 | #数据集 #低资源 | arxiv 👥 作者与机构 Priyankoo Sarmah 与 Sanasam Ranbir Singh 来自印度理工学院古瓦哈提分校语言科学与技术中心,Lalhmingmawia 为米佐语母语合作者。语料由约两百名米佐母语者远程录制,错误分析由论文第三作者(母语者)人工完成。 ...

2026-08-21 · 更新于 2026-09-04 · 3 min · 456 words

ChiroEcho: extending automated bat vocalisation classification beyond the learned taxonomy

📄 ChiroEcho: extending automated bat vocalisation classification beyond the learned taxonomy 标签:#音频分类 #迁移学习 #低资源 #模型评估 6.7/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.7/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频分类 | #迁移学习 | #低资源 #模型评估 | arxiv 👥 作者与机构 第一作者:Burooj Ghani(机构未说明) 通讯作者:未说明 作者列表:Burooj Ghani、Welmoed Eversteijn、Milan van Hirtum、Juan Sebastián Cañas、Vincent J. Kalkman、Dan Stowell、A. Leonie Baier(机构信息未在当前正文中完整说明) ...

2026-08-20 · 更新于 2026-09-04 · 4 min · 803 words

A Parameter-Free Few-Shot Evaluation for Elephant Vocalisation Classification

📄 A Parameter-Free Few-Shot Evaluation for Elephant Vocalisation Classification 标签:#音频分类 #迁移学习 #低资源 #模型评估 5.9/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.9/10 | 前50% | 文档类型:应用研究 | 评分置信度:高 | #音频分类 | #迁移学习 | #低资源 #模型评估 | arxiv 👥 作者与机构 第一作者:Christiaan M. Geldenhuys(University of Stellenbosch, Department of Electrical and Electronic Engineering) 通讯作者:未明确标注(论文给出两位作者邮箱,但未指定通讯作者) 作者列表:Christiaan M. Geldenhuys(University of Stellenbosch, Department of Electrical and Electronic Engineering)、Thomas R. Niesler(University of Stellenbosch, Department of Electrical and Electronic Engineering) 💡 毒舌点评 这篇论文用一个“老到掉牙”的最近质心分类器,搭配现代预训练声学嵌入,干净地展示了低资源生物声学中“不训参数也能打”的偏置-方差/归纳偏置权衡。实验协议和 bootstrap 采样噪声分析做得比较细,对 k⋆ 和 complete/partial support set 的区分也有一定洞察。但方法本身几乎没有新意:本质是 prototypical networks 的非训练版本,换成固定嵌入后再做一次评估。代码、数据、模型权重和部署验证全部缺失,结论高度绑定两个大象叫声数据集和四个嵌入。它更像一篇扎实的生物声学应用实验报告,而不是能推动方法学边界的顶会论文;放在顶会审稿池里属于“认真但不性感”的类型。 ...

2026-08-18 · 更新于 2026-09-04 · 5 min · 858 words