ICML 2026 语音/音频论文详细分析
共分析 137 篇 ICML 2026 论文
共分析 137 篇 ICML 2026 论文
论文用典型相关分析和留一组合重构检验冻结的 Wav2Vec2、HuBERT 和 CLAP 能否把未见声源组合表示成各声源贡献之和,最强证据是 CLAP 在 FSD50K 重复保持组合上同时超过置换与标签重叠基线,但三者都存在不可忽略的重构残差。
针对日本长期照护高龄有症状人群的六通道前胸数字听诊任务,论文用 X 线监督训练共享权重 ARP-N 卷积网络并在病人级重复交叉验证下比较临床诊断监督,最强证据是听诊单模态 XRAY 模型 F1 为.729、准确率为.783 而融合模型 AUC 为.791,代价是单中心 185 例与域漂移限制外推。
针对病理性语音可懂度评估需要准确且可解释的问题,ART-NAD 用说话人无关声学到发音反演得到的九通道准声道收缩变量替代 NAD 的 wav2vec2 特征做多变量 DTW,在 20 个参考音频协议上平均说话人级 Pearson 相关与 NAD-FA 持平而可定位到具体收缩通道,代价是反演模型只在英语 EMA 上训练导致非英语连贯语音出现差距。
论文针对巴西葡萄牙语合成语音口音稀释问题,用多语言音素识别加传统声学分析构建说话人级音系画像,仅在自然语音上拟合核密度估计即显示可分性,并在自建集与公开反欺骗集上验证了对大模型的增益与跨域泛化,但语音克隆场景下增益收窄且需要较多同说话人语句聚合。
XSQ-AST 用冻结的 SQ-AST 做多维度打分、用 WhisperX 做音素对齐、用显著性加核密度估计定位时间毛刺,40 人听音验证显示 Rollout 等方法与听众标注呈中等相关且 AUC 高于随机,但不同伪影类型最优方法不同且存在未评测边界。
论文用分组留出的方向消融检验语音有害请求的拒绝边际,发现 Qwen2.5-Omni 在 L16 处消融使边际下降约 7.10 而投影器处仅约 0.013,代价是良恶提示的措辞差异使该方向只能读作拒绝相关而非纯粹有害性。
共分析 29 篇语音/AI 论文
该研究在抑郁、构音障碍、帕金森和口吃五个语音数据集上只用首秒或静音段做分类,发现其加权 F1 常与全音频持平甚至更高,说明录音条件等非言语线索可能贡献了预测性能,但未定位确切混杂源。
论文用 124 位作曲家的旋律续写任务训练条件 Transformer,只以作曲家身份为监督,学到的 124×128 嵌入的第一主成分与出生年强相关并通过打乱检验,最强的向量算术例子同时暴露了旋律表征覆盖不了配器音色的代价。
针对自动视频面试只给分数而缺乏可检查依据的问题,E-AVI 选择先抽取带时间戳的结构化多模态证据再做维度条件打分,在 RecruitView 上把 MAE 从 0.641 降到 0.607、Spearman 从 0.440 提升到 0.541,代价是提取阶段仍是 83.3% 困难样本的瓶颈且推理依赖 15 秒级抽取开销。
针对语音大模型用自回归解码做四分类情绪识别会产生无效标签并偏向多数类的问题,论文在冻结主干上对比同一最终提示词隐状态的生成式解码与单层线性分类头读出,最强证据是加入对话上下文后宏平均 F1 达到 78.14 且在 ASR 转写下从 74.47 提升到 76.50,代价是只验证了 IEMOCAP 四类设置且可解释关联暴露了预训练的文化偏置。
针对一分钟语义和音位流畅性任务中整段平均会抹掉检索动态的问题,CCMAN 用词级多模态序列加双向跨模态注意与迁移学习建模时间不稳定性,在 843 人语料上语义二分类宏 F1 达到 0.81 而多分类仅 0.59,代价是三分类区分 MCI 与痴呆仍不显著且依赖 ASR 时间戳质量。
该文用单链接层次聚类分析说话人向量是否形成层次结构,再以总体匹配与一一匹配加诊断性分数解释性别国籍与身份语义,最强证据是身份与性别接近完全对齐而部分国籍组合匹配明显偏低且可归因到精度不足。
论文针对日常录音下声音亲缘验证线索稀疏且跨库泛化难的问题,选择卷积局部编码加变换器长程聚合与注意力池化的两阶段度量学习路线,在自建普通话非受控库 ARKIN 上报告 CONVTRAP-TN 优于三元组基线,但从 KAN-AV 跨库到 ARKIN 时性能大幅下降且少量微调难以恢复。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
论文报告六说话人描述任务基线低于随机猜测,用 100 个头的注意力对数偏置把输出转向目标到 90% 以上,而纯文本任务选出的头可原样迁移,但饱和强度下增益多来自提示与汇点且随机对照本身波动极大。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
共分析 19 篇语音/AI 论文