论文解读

跨语言帕金森严重程度分级:预训练语音嵌入能迁移什么,又在哪里混淆

该研究用四种语音基础模型嵌入加四种浅层分类器做健康对照、轻度、重度三分类,在意大利语、英语、哥伦比亚西班牙语之间做零样本与每类 49 个目标片段的 k 样本适配,发现 k 样本一致提升目标语言 F1 且源语言基本稳定,但重度与轻度边界和预处理线索损失仍是主要代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8858 字 阅读 →
论文解读

封闭句库里练多人模型,再用三分钟校准新用户:表面肌电语音解码的个性化路径

针对 27 人、每人不足半小时数据的封闭 50 句表面肌电解码任务,论文用已发布单被试检查点初始化、多被试预训练再加目标被试微调达到 21.7% 字符错误率和 31.9% 词错误率,而 3 分钟校准与约 13 分钟全量校准无显著差异,但评估句一旦从所有训练数据中移除则退化到 78.6% 字符错误率。

 · 更新于 2026-09-24 · 约 23 分钟 · 11142 字 阅读 →
论文解读

只看谱面判乐器:词序列加预训练的取舍与边界

该研究把 8 类独奏谱面图像转成 bootleg score 词序列做文本分类,用无标注语言模型预训练把 RoBERTa 片段准确率从 34.5% 提升到 42.9%,再用移调式训练与测试增强推到 58.8%,代价是长片段整页推理退化和大偏移抹掉音域线索。

 · 更新于 2026-09-24 · 约 18 分钟 · 8548 字 阅读 →
论文解读

气道狭窄听得出来吗:冻结语音基础模型加多任务聚合的筛查路径

该研究把气道狭窄检测做成患者级多录音分类,用冻结的 WavLM 第 15 层表示加 TransMIL 聚合,在 748 人五折交叉验证中报告 AUROC 为 0.952 与准确率为 0.924,而细粒度分型与严重度分级仍明显更难。

 · 更新于 2026-09-24 · 约 21 分钟 · 10216 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

只有 1.5 小时录音时先冻住耳朵再改手写:Amchi Konkani 的迁移加词典修正

针对无正式书写系统的 Amchi Konkani 口语转写问题,论文用冻结编码器的 Marathi IndicConformer 只微调 CTC 解码层并叠加约 5000 词众包词典与约 80 条正则后处理,把词错误率从 35.1% 降到 21.3%,代价是仅在小规模故事集上验证且依赖人工维护的词典与规则。

 · 更新于 2026-09-24 · 约 20 分钟 · 9729 字 阅读 →
论文解读

从逐帧鼻音概率到说话人指数:滑动窗口聚合在连续法语中的稳定与混杂

该研究以 wav2vec 2.0 第四层表示加 1024 单元多层感知器做鼻音二分类,用 50 毫秒窗与 10 毫秒步在无音位标注的连续法语上逐窗打分再聚成说话人指数,在 23 名说话人的朗读与自发配对比较中全局平均最简单稳定而语境归一化更可比,但分数仍与基频等总体嗓音特征纠缠而特异性待验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10371 字 阅读 →
论文解读

多语多设备之下帕金森构音障碍检测为何跨库就失效:冻结声学模型加多库训练的取舍

该研究以二分类检测特发性帕金森病的运动性言语障碍为问题,用冻结的 Wav2Vec 2.0 XLS-R 加 128 维多层注意力分类头做跨库评估,最强证据是三库联合训练在未见过的 MDVR-KCL 上达到 85.3% AUC 并避免单库模型的跨库崩塌,代价是对低 UPDRS 评分和 OFF-DOPA 条件的患者仍明显更难检出且结果受随机划分影响大。

 · 更新于 2026-09-24 · 约 19 分钟 · 9479 字 阅读 →
论文解读

不识别情绪类别,只跟踪状态漂移:用效价唤醒优势曲线看接警员是否还在状态

该研究把接警员投入度与心理灵活性下降转写为可实时跟踪的声音心理生理状态变化,用预训练模型输出效价唤醒优势三轴曲线先在中性到非中性合成序列上验证再在真实接警录音上试探,合成条件下变化可被标出而真实通话结果混杂因而需要更多通话特征。

 · 更新于 2026-09-24 · 约 20 分钟 · 9996 字 阅读 →
论文解读

归一化后还能听出发声有多用力吗:从频谱过拟合到自监督表示的跨录音条件泛化

论文复现基于频谱的句级嗓音强度回归并在新录音条件下发现其失效,进而用 Wav2Vec 2.0 浅层表示训练回归器,在 VIC 上把决定系数维持在 0.83 左右,代价是跨条件差距仍未完全消除。

 · 更新于 2026-09-24 · 约 18 分钟 · 8838 字 阅读 →
论文解读

资源不均时先学共性再学个性:奥克语六方言的跨方言微调

针对奥克语数据稀少且集中在加斯科涅和朗格多克方言的问题,论文比较直接微调、跨方言微调和两阶段微调,最强证据是两阶段在大资源方言上继续降低词错误率,而代价是小资源方言只能做迁移评估且测试集极小。

 · 更新于 2026-09-24 · 约 18 分钟 · 8746 字 阅读 →
论文解读

听不见反馈的声音怎么做识别:把马拉地语聋人语音映射到日常任务词表

针对标准马拉地语识别在聋人语音上接近失效的问题,论文用冻结编码器的迁移学习加日常任务词表约束,把词错误率从 97% 降到 64%,代价是仍高达 64% 且依赖单人小词汇后处理。

 · 更新于 2026-09-24 · 约 22 分钟 · 10762 字 阅读 →
论文解读

保留高维语音表示,只用一层分类器:KAN 为何比全连接更省且更稳

该工作以 XLS-R 高维表示为输入,对比单层全连接与单层 KAN 后端,在 21LA 上把聚合 EER 从 2.38% 降到 1.07%,代价是后端参数从 2.05k 增至 22.54k 但仍远小于主流系统,且在 FoR 等个别集上 KAN 并未取胜。

 · 更新于 2026-09-24 · 约 18 分钟 · 8844 字 阅读 →
论文解读

把做乐器的扩散模型拿去换嗓:统一条件如何同时管住音高、音素与演唱者

论文把多乐器音乐合成的注意力扩散模型改造为语音与歌声转换,用音素后验、基频与演唱者嵌入做条件,在自然度与演唱者相似度上追平专用转换模型,但音素保真下降且加入器乐数据会拉低人声质量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8901 字 阅读 →
论文解读

看不见的生成器:用通用音频语义加图结构抓环境音伪造痕迹

针对未见过文本到音频与音频到音频生成器的环境音伪造检测,论文用高效音频 Transformer 做前端加图注意力后端,配合差分微调与编解码增广,在 EnvSDD 上报告测试等错误率 2.48%,代价是依赖大规模预训练与特定增广组合。

 · 更新于 2026-09-24 · 约 19 分钟 · 9357 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

吉他没有力度真值时,如何让转录模型学会力度又不丢掉音高精度

针对吉他缺乏力度标注的问题,该工作用虚拟乐器渲染带力度标签的合成数据先学力度曲线,再把冻结的力度子模块拼到在真实录音上训练的音高转录模型中,合成集上平均绝对误差从约 32 降到约 7 但跨音色误差增大,而在 GuitarSet 与 EGDB 上的音符转录 F 值只提升约 0.1 个百分点。

 · 更新于 2026-09-24 · 约 17 分钟 · 8207 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →