整句高分掩盖局部损伤:用部分混合与帧对比学习做可定位的质量嵌入
针对现代语音整体质量高但损伤只出现在局部而难定位难分类的问题,该工作用部分混合生成帧级伪标签并加帧级监督对比损失训练双头帧级模型,在域内与域外混合数据上把嵌入检测做到交集面积 0.91 左右,代价是多重并发损伤下类型纯度下降且干净帧取舍需在检测稳定与聚类纯度间权衡。
针对现代语音整体质量高但损伤只出现在局部而难定位难分类的问题,该工作用部分混合生成帧级伪标签并加帧级监督对比损失训练双头帧级模型,在域内与域外混合数据上把嵌入检测做到交集面积 0.91 左右,代价是多重并发损伤下类型纯度下降且干净帧取舍需在检测稳定与聚类纯度间权衡。
该文针对合成语音评测只有分数、跨任务跨语言泛化弱的问题,构建覆盖四任务四语言的 SpeechEval 并用指令微调加奖励优化训练 SQ-LLM,最强证据是在评估与对比维度相关性上超过专家基线,代价是约 43 个 A100 小时训练与对特定伪造来源泛化仍不稳定。
针对语音生成评价依赖主观平均意见分且单指标奖励不透明的问题,UniSRM 用四任务统一数据加两阶段推理评价与推理一致奖励,在 UniSRM-Bench 上提升多任务准确率,但多轮对话与跨域泛化仍受数据覆盖和计算开销限制。
该文研究用大音频模型直接做成对语音评测是否可行,发现基础提示在副语言细粒度判断上接近随机猜测,而测试音频拼接加 4 样本上下文与多方面集成可在系统排名上达到 0.91 左右的人类偏好相关,但冗长与位置偏置仍需处理。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对语音到语音评价只看文字会漏掉语气、直接听音频又贵又不透明的问题,论文用先分内容音质副语言三维标注再把廉价声学信号写成文字蓝图交给大语言模型推理并按确定性规则融合的方法,在两个公开偏好集上提高了与人的一致性并把音频评测成本降到约三分之一。
VocalCap 把一次浏览器录音拆成原生对象、客户端无损 WAV 与服务端规范 WAV 三份互补文件并全程留证,在确定性破坏测试、39 例试点复检与 Chromium/WebKit 双端到端中验证了采集与变换契约,但声学校准、可用性与生物标志物有效性仍需独立研究。
该文在 1x 到 3x 主观评分基础上,用视频时间信息、语音语速和音乐节拍分别拟合指数衰减并融合成视听模型,在独立新序列上与主观均值高度一致,但意图推断只做到粗粒度辅助。
论文在 BVCC 训练、在 SOMOS 与 BC2019 零样本评测自监督、纯声学与统一编解码表示;融合语义和声学的部分模型有较好表现,但优劣随冻结或微调、数据集及评分或排序指标而变化,跨语种也有例外,不能据此宣布某一表示类别普遍最优。
语音编码 | 8.3/10
语音合成 | 7.6/10
语音质量评估 | 7.4/10
音视频理解 | 5.5/10
语音质量评估 | 6.7/10
语音质量评估 | 6.1/10
语音质量评估 | 8.2/10
语音质量评估 | 7.9/10
语音质量评估 | 7.1/10
音视频理解 | 6.3/10
语音增强 | 6.2/10