不用改 vocoder 结构,只换条件特征:群延迟乘积谱能否替代梅尔谱
该文把群延迟乘积谱作为 Clarinet 神经声码器的条件特征,在英语与希腊语上与梅尔谱基线做可运行对照,主观 MOS 接近基线而客观 MCD 偏高、F0 周期性误差相当,关键代价是平滑系数 ρ 取值敏感。
该文把群延迟乘积谱作为 Clarinet 神经声码器的条件特征,在英语与希腊语上与梅尔谱基线做可运行对照,主观 MOS 接近基线而客观 MCD 偏高、F0 周期性误差相当,关键代价是平滑系数 ρ 取值敏感。
针对联合扩散中双路噪声导致的对齐漂移,Harmony 用音频驱动与视频驱动辅助任务提供干净锚点,并以全局局部解耦交互与同步增强引导提升细粒度同步,主结果报告 Sync-C 为 5.61、Sync-D 为 7.53,代价是三阶段训练与双分支推理开销。
针对小时级视频上下文过长与朴素切分检索导致碎片化的问题,论文提出离线构建全局-场景-片段-实体四层索引并用说话人身份做跨模态实体黏合,再由智能体按需多粒度检索,在 LVBench 上以 30 秒粗切分与至多 10 步推理达到 84.1% 整体准确率,但高密度采样与多工具调用仍带来离线与在线开销。
该文把市售通灵板重语境化为 communal NIME,用陈述采集加光流示位器驱动四路基于语料库的拼贴合成,在两次公开展示中验证了独奏贡献到群奏的链路,其代价是无定量评估与语料重聚类后可能出现声音死区。
针对长时长音频驱动全身动画的身份漂移与手部畸变问题,论文采用先生成低分辨率同步视频再用姿态引导精炼器恢复高分辨率的由粗到精路线,在全身集上报告图像距离 60.71 与手部置信度 0.90 等结果,代价是两阶段训练与大规模单人数据依赖。
针对麦克风少于声源的欠定盲分离,论文把时频掩蔽引入切换型 MVDR 的目标函数并联合优化滤波器、组合系数与掩蔽,报告在 2 麦 3/4 说话人任务上优于直接掩蔽、FastMNMF 与掩蔽 MVDR,但效果依赖掩蔽质量与声源相对位置。
该文针对独立向量抽取中源先验不准与二阶算法需要快速求导的问题,用许瓦里宁分数匹配训练正弦多层源非线性,并在仿真与目标说话人抽取中报告了对传统模型的系统性提升与对微调噪声指示器的累积增益。
LiveGesture 针对实时对话中不能等待整句语音的手势生成问题,采用可流式解码的分区运动词表加区域专家与因果空时融合,在 BEAT2 上以零前视达到与离线方法可比的真实感与节拍同步,但面部顶点误差与首包延迟仍受音频编码与自回归漂移约束。
针对紧凑阵列按用户给定方向图做空间滤波的问题,该工作把采样方向图经 FiLM 调制送入 FT-JNF 并用差分与矩形混合配方训练,在未见高阶与缩放方向图上高于理想到达方向的参数滤波上界,代价是依赖大量无混响仿真语音与固定阵列几何。
针对视频配音只做可见环境声、做不了语音与画外声共存的问题,OmniSonic 用视频加文本联合条件的流匹配扩散与三路交叉注意力加门控融合,在自建的三场景基准上同时生成语音与环境声,主观与客观指标报告全面领先,但时间同步仍弱于带细粒度同步视觉特征的基线。
该研究把同一段语音拆成前景/背景、谐波/打击、低频段与房间脉冲响应分别训练检测器,报告在 ASVspoof 2019 训练下低频 0-4 kHz 与去混响 MFCC 能改善跨域 EER,但以 ITW 上 24% 仍远非可用为代价。
论文把传声器信号写成声源经无限冲激响应的卷积,证明在环路延迟足够长且该无限冲激响应可用有限冲激响应近似时反馈分量落入晚期混响段,从而用加权预测误差去混响做联合去混响与声反馈抑制,仿真显示其在 6 dB 与 -6 dB 增益裕量下均优于连续自适应滤波器,代价是依赖延迟条件与有限冲激响应近似。
针对音频驱动说话人脸只求口型对齐而说话风格单一、情绪不可控的问题,PC-Talk 用隐式关键点上的唇同步变形与纯情绪变形分别建模,在 HDTF 上以视频输入 9.03 与图像输入 9.37 的 LSE-C 显示口型优势,并以情绪分类准确率 46.19 与 72.32 显示情绪优势,代价是需要分开训练两个控制模块并固定渲染器参数。
针对语音编码器偏发音而大语言模型偏语义的对齐错位,该文提出先预测音素再生成文本的联合训练,在 100 小时低资源和 960 小时及荷兰语条件下报告词错率下降,代价是输出变长与仍需低秩适配。
论文以 Whisper-small 为对象,用梯度与 Fisher 灵敏度定位可剪部位并做无微调一次幅度剪枝,最强证据是解码器自注意力 50% 稀疏度在 LibriSpeech test-other 上绝对词错误率下降 2.38%,代价是解码器前馈与早期解码器层在同等稀疏度下灾难性退化且全局均匀剪枝在 40% 附近崩溃。
论文以持续一年的生成式广播 In Search of Good Ancestors 为案例,提出再活化框架把数据集制作、迭代再训练与长期聆听当作现场性所在,证据是四层异步系统与四轮工作坊加巩固期的可复述过程,代价是放弃低延迟 virtuosity 式控制与可重复定量评价。
针对目标说话人提取中干扰声与目标方向接近且混响模糊空间线索的问题,该工作在 SpatialNet 骨干上加入区域方向卷积、高斯核距离编码与混响参数调制,并在方位差为零的极端条件下报告大幅提升,但小距离间隔叠加相似混响指纹时仍有退化。
针对加性噪声下传统加权预测误差去混响鲁棒性下降和多通道延迟观测导致矩阵求逆复杂度为 O(M^3L^3) 的问题,论文用观测自相关矩阵主特征向量重建参考信号并压缩延迟观测子空间,在 8 麦克、混响时间 800 毫秒、白噪声与扩散噪声各两种信噪比仿真中提升去混响增益,代价是压缩维度与迭代近似带来性能与复杂度权衡。
针对双说话人竞争下脑电信噪比低而窗级解码在分辨率与精度间折中问题,论文用马尔可夫切换模型把包络回归与注意状态转移联合建模并用 EM 逐采样点估计,在 KULeuven 数据上取得与 HMM 后处理相当的中位精度而中位切换检测延迟显著更短,代价是对初始化敏感且仍依赖线性回归假设。
针对 CLIP 视频文本检索丢弃音轨且 AST 类编码器不理解语音的问题,SAVE 用 Whisper 转写加 CLIP 文本编码的语音分支与 ImageBind 软监督的 soft-ALBEF 先对齐再融合,在五个基准上超过 AVIGATE 等基线,代价是依赖 ASR 可用性与离线三分支特征抽取。