不重训也能定位合成语音毛刺:XSQ-AST 把质量分投影到音素与时间上
XSQ-AST 用冻结的 SQ-AST 做多维度打分、用 WhisperX 做音素对齐、用显著性加核密度估计定位时间毛刺,40 人听音验证显示 Rollout 等方法与听众标注呈中等相关且 AUC 高于随机,但不同伪影类型最优方法不同且存在未评测边界。
XSQ-AST 用冻结的 SQ-AST 做多维度打分、用 WhisperX 做音素对齐、用显著性加核密度估计定位时间毛刺,40 人听音验证显示 Rollout 等方法与听众标注呈中等相关且 AUC 高于随机,但不同伪影类型最优方法不同且存在未评测边界。
共分析 42 篇语音/AI 论文
针对固定深度对所有语音做同样多次精修的浪费,ADER 用共享 TS-Transformer 块循环精修并以深度控制器硬早停加每步单专家残差适配,在 VCTK-DEMAND 上以平均 2.15 次迭代达到 WB-PESQ 3.37,代价是相对固定 3 步共享块仍有约 2.6% 的感知质量下降。
AVTR-1 用 153M 参数的双音频条件流匹配模型生成头部与表情动作,再用常开的渲染与调度循环把外部语音智能体的可变语音片段变成同步音视频,并用延迟分解与 R-DGG 验证了可交互性与说话人依赖,代价是仍依赖外部语音智能体与固定的窗口节拍。
针对单通道自监督音频编码器空间盲的问题,Bearings 用掩码重建方向场与双尺度扩散度学习可复用的声场嵌入,冻结拼接后在两个 SELD 数据集上把位置相关 F 值从 4 以下提升到 40 以上,代价是仍需轻量融合头训练且部分指标未超越联合训练模型。
针对印度、印尼和拉美口音的英语学习对话,该工作用启发式富实体选数据加分区 LoRA 双输出微调 Qwen2.5-Omni-3B,把实体召回做到 80-85% 区间并把填充词保留到 76-86% 区间,代价是依赖银标准转写参考与每个区域独立适配器。
针对掩码型语音增强在域偏移下掩码双峰性退化的问题,BLINC 冻结模型并用直方图匹配把预测掩码重映射到由含噪信号盲特征决定的双峰目标分布,在几乎不增加耗时的条件下提升了感知质量,但以信号级指标下降和无法修复排序错误为代价。
论文把带侧支亥姆霍兹腔的通气耳道建模为二端口传输问题,导出音频带预算只由总腔体积与通孔面积之比决定,再用危害加权注水分配证明低频选择在通气类中接近无效而中高频匹配设计可达十二分贝,代价是每 1 分贝言语代价约换 1.3 分贝防护。
论文用分组留出的方向消融检验语音有害请求的拒绝边际,发现 Qwen2.5-Omni 在 L16 处消融使边际下降约 7.10 而投影器处仅约 0.013,代价是良恶提示的措辞差异使该方向只能读作拒绝相关而非纯粹有害性。
COT-TTS 研究给定历史对话音频、固定目标文本和参考音色时如何先显式推理说话方式再合成语音,最强证据是 0.6B/1.7B 端到端模型在时长一致性和人评上接近 34-39B 级联基线,代价是可编辑推理大幅改动时会降低客观音质并引入推理与语音错位风险。
针对音素到文本重建训练用干净音素而推理遇到视觉识别错误的问题,论文提出从合成扰动到多域再到目标域伪标签的三阶段渐进训练 PECT,在 LRS2 上把 HP-VSR-FiLMFuse(L4) 从 23.3% 降到 22.2%,代价是需要五折训练视觉前端生成伪标签且仍受限于第一阶段音素质量。
该文用统一指令微调框架比较连续特征与离散口令在语音声音音乐理解任务上的表现,显示语义约束与多域预训练决定效果而扩大语言模型不能弥补前端信息损失,代价是连续特征训练更慢而重建型编码保真高但理解弱。
针对显式思维链导致注意力偏离音频的推理落差,SPARE 在推理起点插入寄存器令牌并用结论语义做余弦对齐,在 SALMONN 13B 上把 MMAU 提升到 58.03%、MMAR 提升到 40.32%,代价是微调阶段增加一个训练期对齐分支而推理零新增开销。
针对 Yemba 等低资源语言声学表示难学的问题,该工作用异构图把声学节点和语言节点放在同一张图里做消息传递,并在 Google Commands 缩减集和 Yemba 孤立词数据上用 SVM 和聚类指标验证跨模态表示优于 MFCC 基线和单模态 GCN,但推理依赖预训练声学模型且未做到句子级。
针对一阶 Ambisonics 在旋转与镜像下方向变化而声源不变的问题,EquiSELD 用不变标量与等变强度向量双流加等变注意力实现严格 O(3) 等变,在 TAU2021 上以 0.40 的综合分超过基线并以约 19 倍更少训练耗时超过已有等变网络,但在 STARSS23 真实场景上优势收窄且仍受类别覆盖与仰角先验限制。
针对说话数据训练的模型在唱歌时出现节奏漂移和表情受限的问题,论文用三阶段过滤构建 29500 余段野外唱歌头数据,并在 Hallo 等架构上验证了唇同步与节奏对齐的提升,但高强度筛选只保留约 6.9% 原料且依赖人工打分融合。
针对文本查询的音视事件时间定位,论文提出按边界可靠性分配教师监督位置的 OV-OrthKD,在 OV-AVEBench 上达到 0.816 片段 AP 且未见类 F1@0.5 提升 3.4 个百分点,代价是角色固定且仅做局部权重验证。
该文复刻频带切分循环网络用于人声贝斯鼓与其他四轨分离,在公开数据集上补齐预处理与训练细节并对比多种设计,结果显示大模型与替代增强可缩小与原报告的差距,但耐心延长与全项目试错带来数十倍于单次训练的能量开销。
针对低资源下语音文本对齐需要大编码器和大量平行数据的问题,该文把词级对齐建模为异构图上的链路预测,用 GraphSAGE 消息传递把固定文本表示传给语音节点,在 TIMIT 和 Yemba 上以轻量图训练达到可比 SAMU-XLSR 的富集与检索效果,代价是跨模态检索仍受初始声学质量制约且句子级与下游任务未验证。
针对单帧变 Q 输入的单音高估计,论文把频率轴空洞卷积拆成秩 9 瓶颈使参数从 17787 降到 11397 且三库精度持平,并证明训练噪声下限从 +6.02 dB 压到 -20 dB 能把 -20 dB 处 RPA50 从 2.44 提到 22.41,代价是干净集掉 0.35 点,自研 C 内核以 83 kB 在四款 CPU 上快于 …