论文解读

把互联网视频先验搬进声道核磁:Arti-JEPA 何时帮得上音素,何时帮不上

论文把 V-JEPA 2 延续到约 62 小时无标注声道实时核磁上,用冻结编码器加轻探针测跨域音素、口吃二分类与舌切除前后迁移,最强证据是跨域音素 κ 升至 0.352 而口吃仅小幅提升,代价是单卡小批量、短窗与三例临床样本的局限。

 · 更新于 2026-09-24 · 约 22 分钟 · 10941 字 阅读 →
论文解读

少通道也要分清四声:CAT-Net 用双向交叉注意力融合脑电与肌电

针对普通话四声在脑电中细微难分且跨人易失效的问题,CAT-Net 用脑电与肌电双分支时空编码加双向交叉注意力融合与域对抗训练,在 20 个脑电通道加 5 个肌电通道上报告了默读 88.08% 与出声 87.83% 的五折精度以及留一被试 85.10% 与 83.27% 的跨被试精度,但消融显示去掉融合与单模态后精度大幅下降且重度异常被试仍明显偏低。

 · 更新于 2026-09-24 · 约 20 分钟 · 9706 字 阅读 →
论文解读

去掉语言可预测成分后跨语言帕金森检测为何能找回灵敏度

针对目标语言只有健康人语音时分类器把目标语言当成健康信号的问题,论文用健康人拟合的岭回归残差去除语言可预测成分,在 5 个骨干、3 个任务、3 个目标语言上把平均 F1 从 0.52 提升到 0.87,但语言信息并未完全消除且评估仍限于印欧语系。

 · 更新于 2026-09-24 · 约 20 分钟 · 9640 字 阅读 →
每日研究速递

uai-2026 论文深度解读

共收录 1 篇 uai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 3 分钟 · 1181 字 阅读 →
论文解读

冷启动可用与少样本高精度的分野:域不变韵律与自监督表示的跨域语音钓鱼检测对比

在从场景化演员录音训练、真实诈骗电话测试的跨域条件下,论文对比域不变的 4 维韵律特征与冻结的 HuBERT/wav2vec2.0 表示,显示 4 维韵律在零样本达 69.5% F1 可直接部署,而 HuBERT 在 5 样本时达 94.2% F1 但需真实样本与 GPU。

 · 更新于 2026-09-24 · 约 20 分钟 · 9577 字 阅读 →
论文解读

严重程度拉开差距时仍要可用:用严重程度混合微调 Whisper-small 并在 Jetson 上实测

针对唇腭裂语音随严重程度差异大的识别难题,论文用不同严重程度组合微调 Whisper-small 并在 Jetson 上实测,NOMIMOSE 把合并词错误率从 62.46% 降到 22.72%,NOMIMO 把合并音素错误率降到 18.44%,CLP-only 拿到最接近零的公平性得分 -22.85,而微调模型保持 0.167-0.171 实时系数和约 …

 · 更新于 2026-09-24 · 约 18 分钟 · 8602 字 阅读 →
论文解读

先听见,再分清:两级级联如何把稀有虎鲸从海噪里捞出来

音频分类 | 6.7/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9076 字 阅读 →
论文解读

口音的长尾,为什么让无监督语音表示最先露怯?

语音编码 | 5.5/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8018 字 阅读 →
论文解读

把电话声道和业务词汇分开付账:Canary 的两次适配实验

语音识别 | 7.9/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3952 字 阅读 →
论文解读

一条咳嗽模型的跨国体检:高分为何更像设备在说话

音频分类 | 8.8/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5492 字 阅读 →
论文解读

Understanding Multilingual Medical ASR Adaptation Through Layer-Wise Analysis

语音识别 | 7.2/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5145 字 阅读 →
论文解读

Acoustic UAV Detection in Battlefield Scenarios: Handling Noise, Domain Shift, and Weak Labels

音频事件检测 | 6.7/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5205 字 阅读 →
论文解读

StreamHear: Domain-Adapted Pseudo-Labeling for Semi-Supervised Streaming Speech Recognition

语音识别 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5783 字 阅读 →
论文解读

On-Policy Self-Distillation for Multi-Dialect ASR: Mastering Dialects, Retaining Mandarin

语音识别 | 7.0/10

 · 更新于 2026-09-24 · 约 5 分钟 · 2303 字 阅读 →
论文解读

Beyond Piano: Cross-Instrument MIDI Velocity Estimation via Differentiable SoundFont Proxies

音乐理解 | 7.3/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8783 字 阅读 →
论文解读

A Study of ASR Adaptation and Representation Dimensionality Reduction in Persian Speech Emotion Recognition Using Whisper

语音情感识别 | 5.7/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4924 字 阅读 →
论文解读

Hidden-Domain Routing for All-Type Audio Deepfake Detection

领域适应 | 7.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6135 字 阅读 →
论文解读

Cloned Voices, Real Consequences: Evaluating Bias in Political Deepfake Detection for Electoral Integrity in Brazil

语音伪造检测 | 7.7/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7303 字 阅读 →
论文解读

A large-scale corpus of religious radio broadcast transcripts from webstream recordings in the United States

说话人日志 | 8.2/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6772 字 阅读 →
论文解读

Device Invariance using Domain Adaptation on Acoustic Scene Classification

领域适应 | 4.2/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6363 字 阅读 →