短窗相关性太 noisy:用多尺度高斯混合稳住 HMM 发射分布
针对双人竞争听觉注意解码中短窗 Fisher-z 相关方差大、单尺度无监督 GMM 难分 attended 与 unattended 分量的问题,论文提出跨 8 种窗长共享均值、方差按 1/(N_L-1) 缩放的多尺度 GMM 联合估计 HMM 发射参数,在 72 分钟全量下 1 秒窗提升 1.82 个百分点、在 6 分钟数据下提升 8.32 个百分点,但数 …
针对双人竞争听觉注意解码中短窗 Fisher-z 相关方差大、单尺度无监督 GMM 难分 attended 与 unattended 分量的问题,论文提出跨 8 种窗长共享均值、方差按 1/(N_L-1) 缩放的多尺度 GMM 联合估计 HMM 发射参数,在 72 分钟全量下 1 秒窗提升 1.82 个百分点、在 6 分钟数据下提升 8.32 个百分点,但数 …
该研究把参考音频加自然语言指令作为融合查询,用构造时就定义好的七种风格歌词旋律音色关系诊断表示的默认偏好,最强证据是五类模型在七个任务上最高点估计互相反转且声学编码器与文本对齐编码器互补,而轻量文本条件融合未能一致提升主干。
Neyshekar 针对波斯语正式与非正式语体和命名实体覆盖不足,构建 99.02 小时朗读语料并以等时长对照证明两架构词错误率下降,但混合增益不稳定且说话人广度仍有限。
针对无线音频需在有损与无损之间无断点切换的问题,OLAC 只做可逆时域混叠抵消加窗而不做整数 MDCT 变换,用前向线性预测与 Golomb-Rice 编码实现无损压缩,在 20 毫秒帧下平均压缩到 56.8%,代价是帧间预测被切断且随机访问需先解前一帧。
针对开放回答口语缺少准确度、流利度、韵律逐句标注的问题,OpenEnded 用 1000 条三人标注测试集加 6109 条训练与 2673 条开发伪标签支撑评估,并以冻结骨干加三头评分的 VoxPA 为更强基线,但伪标签偏向中间分且低分常与无语音绑定。
针对域增量下旧音频不可回访且新专家对旧样本缺特征的问题,该文用冻结追加专家加无数据回放与跨域特征补全,在 DCASE 2026 任务 7 上报告 78.4% 微平均与 78.9% 宏平均,代价是专家数与拼接维度随域数线性增长。
针对生成式音视频越来越难靠伪影区分的问题,PIVOT 把检测改写为先估计时序物理量再逐条验算事件相关物理定律的核查流程,在 PhysForensics-Bench 上以 70.30% 与 72.16% 的双生成器准确率超过直接大模型目检,但其代价是依赖几何与声学估计质量并在弱观测事件上明显退化。
针对全局音高和速度不变的失真查询,POLARIS 用局部归一化显著性选地标、用 Delaunay 三角形组指纹、只在查询侧加两跳邻域指纹,在自建手机重录集上报告了可复述的流程与查询代价变化。
论文在匹配数据与匹配生成设置下比较纯语音、语音文本与纯文本模型,显示内部文本流大幅降低生成困惑度但说话人相似度和预测质量偏向纯语音模型,且联合模型能逼近大得多数据规模纯语音模型的语义水平。
Realtime-Venus 用两个 9B 前端分别处理音视频与纯音频全双工对话,用双环运行时把即时说话与后台推理工具执行解耦,最强证据是 Omni 在六项视频基准领先与 Audio 在 MMAU 等四项音频问答领先,代价是打断响应与参数准确率仍落后及委派判断存在漏委派与过度委派的权衡。
论文发现相同语音输入下交错语音文本生成的内部文本准确率大幅低于纯文本回答,提出联合输出在策略蒸馏用冻结的语音到文本策略监督学生自己的联合轨迹,在 Step-Audio-2-mini 上把输出模式差距从 42.87 降到 16.26 个百分点而语音到文本基本不变,代价是仍残留十余点差距且口语答案增益小于内部文本增益。
论文用可独立控制的 FormulaBank 把程序化规模拆成公式类覆盖 C 与类内渲染多样 I,在 FDSL 与 AudioMAE 对照中显示两者收益不同且依赖学习形式,匹配的 AudioMAE 实验显示程序化音频偏好 10–25% 低掩码而 AudioSet-28K 偏好 50–75% 掩码,代价是结论限于全量微调与特定模型流程。
针对前景与背景共现偏移导致的小样本音频分类失效,SampleSelect 在冻结编码器下为每个样本学习固定预算的特征掩码,在 SpurAudio 四个设置中取得相比方法的最高 OOD 准确率,并以 4.90-8.38 个百分点的提升超过匹配的 FullRep 对照,但选择预算与对比权重仍需按源域设定且诊断分析只建立关联而非因果。
该研究把 1046 个手工段落与 0.5 秒步长的模型估计效价-唤醒轨迹对齐,显示段落差异主要在唤醒度上且高唤醒位置偏向后段,但进入副歌路径多样、重复段落并不回到初始水平,代价是情绪轨迹来自冻结教师模型而非人工连续标注。
针对音频时刻检索中提议级置信度缺少全局竞争的问题,该文用半马尔可夫条件随机场对全部分割归一化并以片段边缘后验排序,在 CASTELLA 上报告 41.15% R1@0.7 和 34.68% mAP,代价是需做前向后向推理与非极大值抑制并保留双分支联合训练。
针对 Whisper 不支持的三种低资源语言,研究比较暖初始化、注意力融合与顺序适配器堆叠三种源适配器复用方式,最强证据是最近源上的顺序堆叠在全量数据上相对全量微调降低词错误率 5-8%,在一小时数据上降低 12-26%,代价是需先在约 120 小时源语言数据上训练并冻结源适配器。
论文把生成与编辑看作稀疏到稠密的条件谱,用同一潜在流匹配模型在生成分支与重建分支间随机切换训练,以词级音素对齐、节拍条件和变分自编码器表征对齐提升可懂度,并用残差瓶颈容量换取重建保真度与可编辑性,最强证据是分离人声词错误率做到 0.133 但感知质量仍落后于偏好优化基线。
StepAudio 3 Music 针对完整歌曲的长程结构与高保真渲染矛盾,采用 50 赫兹 65536 表项单码本离散表示加混合专家自回归组织音乐序列再由流匹配扩散渲染 48 千赫音频,并以 ABC 记谱作显式编曲计划,在 339 条歌词到歌曲与 316 条人声条件上取得内容享受 7.7086 与文本相似 0.4465 的最高均值,代价是自回归序列翻倍与符 …
该研究用同一冻结编码器流程与 1501 事件配额比较四种嗓音库,发现抹香鲸类型积累最快而孟加拉雀局部顺序依赖最强,且加长历史会把比较推向鲸,代价是结论只在原生事件尺度与档案录音条件下成立。
针对自回归语音模型在长提示下跳过与幻觉导致的最坏词错率飙升,论文提出只在检测到失败时回滚并临时加硬注意力掩码的 LACI,用 10 种子最坏值在 1500 词以上把 35.2% 降到 3.4%,代价是需要保留对齐头与设置重试上限。