会议总览

ICML 2026 语音/音频论文详细分析

共分析 137 篇 ICML 2026 论文

 · 更新于 2026-09-24 · 约 460 分钟 · 229980 字 阅读 →
论文解读

混合声能写成声源之和吗:冻结音频表示的加性组合诊断

论文用典型相关分析和留一组合重构检验冻结的 Wav2Vec2、HuBERT 和 CLAP 能否把未见声源组合表示成各声源贡献之和,最强证据是 CLAP 在 FSD50K 重复保持组合上同时超过置换与标签重叠基线,但三者都存在不可忽略的重构残差。

 · 约 19 分钟 · 9324 字 阅读 →
论文解读

长期照护肺炎听诊:X 线监督与三通道前胸协议的稳定判别

针对日本长期照护高龄有症状人群的六通道前胸数字听诊任务,论文用 X 线监督训练共享权重 ARP-N 卷积网络并在病人级重复交叉验证下比较临床诊断监督,最强证据是听诊单模态 XRAY 模型 F1 为.729、准确率为.783 而融合模型 AUC 为.791,代价是单中心 185 例与域漂移限制外推。

 · 约 19 分钟 · 9465 字 阅读 →
论文解读

把可懂度比较搬进声道:九维收缩变量为何能替掉上千维自监督特征

针对病理性语音可懂度评估需要准确且可解释的问题,ART-NAD 用说话人无关声学到发音反演得到的九通道准声道收缩变量替代 NAD 的 wav2vec2 特征做多变量 DTW,在 20 个参考音频协议上平均说话人级 Pearson 相关与 NAD-FA 持平而可定位到具体收缩通道,代价是反演模型只在英语 EMA 上训练导致非英语连贯语音出现差距。

 · 更新于 2026-09-24 · 约 21 分钟 · 10088 字 阅读 →
论文解读

合成语音露出口音破绽:巴西葡萄牙语方言不一致如何成为可解释的鉴伪线索

论文针对巴西葡萄牙语合成语音口音稀释问题,用多语言音素识别加传统声学分析构建说话人级音系画像,仅在自然语音上拟合核密度估计即显示可分性,并在自建集与公开反欺骗集上验证了对大模型的增益与跨域泛化,但语音克隆场景下增益收窄且需要较多同说话人语句聚合。

 · 更新于 2026-09-24 · 约 17 分钟 · 8342 字 阅读 →
论文解读

不重训也能定位合成语音毛刺:XSQ-AST 把质量分投影到音素与时间上

XSQ-AST 用冻结的 SQ-AST 做多维度打分、用 WhisperX 做音素对齐、用显著性加核密度估计定位时间毛刺,40 人听音验证显示 Rollout 等方法与听众标注呈中等相关且 AUC 高于随机,但不同伪影类型最优方法不同且存在未评测边界。

 · 更新于 2026-09-24 · 约 17 分钟 · 8513 字 阅读 →
论文解读

能解码不等于在用:语音拒绝的因果落点在文本主干的中后段

论文用分组留出的方向消融检验语音有害请求的拒绝边际,发现 Qwen2.5-Omni 在 L16 处消融使边际下降约 7.10 而投影器处仅约 0.013,代价是良恶提示的措辞差异使该方向只能读作拒绝相关而非纯粹有害性。

 · 更新于 2026-09-24 · 约 19 分钟 · 9116 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-22

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 54 分钟 · 26987 字 阅读 →
论文解读

只听静音也能分类:临床语音数据集里的捷径从何而来

该研究在抑郁、构音障碍、帕金森和口吃五个语音数据集上只用首秒或静音段做分类,发现其加权 F1 常与全音频持平甚至更高,说明录音条件等非言语线索可能贡献了预测性能,但未定位确切混杂源。

 · 更新于 2026-09-24 · 约 19 分钟 · 9426 字 阅读 →
论文解读

只用生成误差学作曲家风格:Composer2Vec 的时间轴从哪里来

论文用 124 位作曲家的旋律续写任务训练条件 Transformer,只以作曲家身份为监督,学到的 124×128 嵌入的第一主成分与出生年强相关并通过打乱检验,最强的向量算术例子同时暴露了旋律表征覆盖不了配器音色的代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9671 字 阅读 →
论文解读

先取证再打分:E-AVI 把面试录像变成可核查的证据池

针对自动视频面试只给分数而缺乏可检查依据的问题,E-AVI 选择先抽取带时间戳的结构化多模态证据再做维度条件打分,在 RecruitView 上把 MAE 从 0.641 降到 0.607、Spearman 从 0.440 提升到 0.541,代价是提取阶段仍是 83.3% 困难样本的瓶颈且推理依赖 15 秒级抽取开销。

 · 更新于 2026-09-24 · 约 21 分钟 · 10141 字 阅读 →
论文解读

生成式读标签为何不稳:用同一隐状态对比判别式读法

针对语音大模型用自回归解码做四分类情绪识别会产生无效标签并偏向多数类的问题,论文在冻结主干上对比同一最终提示词隐状态的生成式解码与单层线性分类头读出,最强证据是加入对话上下文后宏平均 F1 达到 78.14 且在 ASR 转写下从 74.47 提升到 76.50,代价是只验证了 IEMOCAP 四类设置且可解释关联暴露了预训练的文化偏置。

 · 更新于 2026-09-24 · 约 21 分钟 · 10279 字 阅读 →
论文解读

不只数出多少词:CCMAN 用词间不稳定捕捉流畅性任务中的认知衰退

针对一分钟语义和音位流畅性任务中整段平均会抹掉检索动态的问题,CCMAN 用词级多模态序列加双向跨模态注意与迁移学习建模时间不稳定性,在 843 人语料上语义二分类宏 F1 达到 0.81 而多分类仅 0.59,代价是三分类区分 MCI 与痴呆仍不显著且依赖 ASR 时间戳质量。

 · 更新于 2026-09-24 · 约 21 分钟 · 10114 字 阅读 →
论文解读

说话人向量为何按性别国籍分层:用单链接聚类与匹配打开黑盒

该文用单链接层次聚类分析说话人向量是否形成层次结构,再以总体匹配与一一匹配加诊断性分数解释性别国籍与身份语义,最强证据是身份与性别接近完全对齐而部分国籍组合匹配明显偏低且可归因到精度不足。

 · 更新于 2026-09-24 · 约 15 分钟 · 7308 字 阅读 →
论文解读

亲缘线索稀疏且跨库易失效时,用卷积加变换器做选择性聚合

论文针对日常录音下声音亲缘验证线索稀疏且跨库泛化难的问题,选择卷积局部编码加变换器长程聚合与注意力池化的两阶段度量学习路线,在自建普通话非受控库 ARKIN 上报告 CONVTRAP-TN 优于三元组基线,但从 KAN-AV 跨库到 ARKIN 时性能大幅下降且少量微调难以恢复。

 · 更新于 2026-09-24 · 约 18 分钟 · 8800 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

继承来的跟踪头:音频模型借用文本主干的位置机制选说话人

论文报告六说话人描述任务基线低于随机猜测,用 100 个头的注意力对数偏置把输出转向目标到 90% 以上,而纯文本任务选出的头可原样迁移,但饱和强度下增益多来自提示与汇点且随机对照本身波动极大。

 · 更新于 2026-09-24 · 约 22 分钟 · 10813 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-15

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 38 分钟 · 18639 字 阅读 →