论文解读

整句高分掩盖局部损伤:用部分混合与帧对比学习做可定位的质量嵌入

针对现代语音整体质量高但损伤只出现在局部而难定位难分类的问题,该工作用部分混合生成帧级伪标签并加帧级监督对比损失训练双头帧级模型,在域内与域外混合数据上把嵌入检测做到交集面积 0.91 左右,代价是多重并发损伤下类型纯度下降且干净帧取舍需在检测稳定与聚类纯度间权衡。

 · 更新于 2026-09-24 · 约 19 分钟 · 9061 字 阅读 →
论文解读

从打分到讲理:用多任务标注与两阶段训练让语音大模型当评测者

该文针对合成语音评测只有分数、跨任务跨语言泛化弱的问题,构建覆盖四任务四语言的 SpeechEval 并用指令微调加奖励优化训练 SQ-LLM,最强证据是在评估与对比维度相关性上超过专家基线,代价是约 43 个 A100 小时训练与对特定伪造来源泛化仍不稳定。

 · 更新于 2026-09-24 · 约 18 分钟 · 8767 字 阅读 →
论文解读

从单分到多维推理:UniSRM 如何让语音评价说出依据

针对语音生成评价依赖主观平均意见分且单指标奖励不透明的问题,UniSRM 用四任务统一数据加两阶段推理评价与推理一致奖励,在 UniSRM-Bench 上提升多任务准确率,但多轮对话与跨域泛化仍受数据覆盖和计算开销限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9597 字 阅读 →
论文解读

AudioJudge:拼接与拆分提示如何让大音频模型做语音评测

该文研究用大音频模型直接做成对语音评测是否可行,发现基础提示在副语言细粒度判断上接近随机猜测,而测试音频拼接加 4 样本上下文与多方面集成可在系统排名上达到 0.91 左右的人类偏好相关,但冗长与位置偏置仍需处理。

 · 更新于 2026-09-24 · 约 17 分钟 · 8027 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

不用听原声也能评声音:先分维标注再用文字蓝图推理的语音评价

针对语音到语音评价只看文字会漏掉语气、直接听音频又贵又不透明的问题,论文用先分内容音质副语言三维标注再把廉价声学信号写成文字蓝图交给大语言模型推理并按确定性规则融合的方法,在两个公开偏好集上提高了与人的一致性并把音频评测成本降到约三分之一。

 · 更新于 2026-09-24 · 约 19 分钟 · 9444 字 阅读 →
论文解读

不只收一个 WAV:把浏览器采集与变换留证的录音系统

VocalCap 把一次浏览器录音拆成原生对象、客户端无损 WAV 与服务端规范 WAV 三份互补文件并全程留证,在确定性破坏测试、39 例试点复检与 Chromium/WebKit 双端到端中验证了采集与变换契约,但声学校准、可用性与生物标志物有效性仍需独立研究。

 · 更新于 2026-09-24 · 约 19 分钟 · 9021 字 阅读 →
论文解读

同样 2 倍速为何体验不同:按运动、语速和节奏算快放感知质量

该文在 1x 到 3x 主观评分基础上,用视频时间信息、语音语速和音乐节拍分别拟合指数衰减并融合成视听模型,在独立新序列上与主观均值高度一致,但意图推断只做到粗粒度辅助。

 · 更新于 2026-09-24 · 约 15 分钟 · 7185 字 阅读 →
论文解读

语义不够:语音平均意见分预测为何还需要声学保真度

论文在 BVCC 训练、在 SOMOS 与 BC2019 零样本评测自监督、纯声学与统一编解码表示;融合语义和声学的部分模型有较好表现,但优劣随冻结或微调、数据集及评分或排序指标而变化,跨语种也有例外,不能据此宣布某一表示类别普遍最优。

 · 更新于 2026-09-24 · 约 19 分钟 · 9134 字 阅读 →
论文解读

单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡

语音编码 | 8.3/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12427 字 阅读 →
论文解读

主观分数能当奖励吗?当感知预测器遇上可懂度硬约束

语音合成 | 7.6/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11677 字 阅读 →
论文解读

方差不该越过底线:用单峰约束重画 MOS 的容许区间

语音质量评估 | 7.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7106 字 阅读 →
论文解读

把销售话术拆成可审计的流水线:SETU 为何用多智能体而非一个大模型打分

音视频理解 | 5.5/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9507 字 阅读 →
论文解读

会数停顿的尺子,为什么比会说话的模型更懂流利度?

语音质量评估 | 6.7/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9539 字 阅读 →
论文解读

ASR 评测别急着换大模型:先分清向量度量、候选裁判与错误解释

语音质量评估 | 6.1/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5237 字 阅读 →
论文解读

DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization

语音质量评估 | 8.2/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4504 字 阅读 →
论文解读

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

语音质量评估 | 7.9/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6446 字 阅读 →
论文解读

Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions

语音质量评估 | 7.1/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8060 字 阅读 →
论文解读

AI-Guided Learning: Research on Knowledge and Skill Acquisition Support Methods Using Deep Learning Audio-Video Processing Techniques

音视频理解 | 6.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6962 字 阅读 →
论文解读

Mitigating Over-Suppression in Speech Enhancement via Inference-Time Rethink-and-Refine Correction Module

语音增强 | 6.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5718 字 阅读 →