不用干净语音和 transcript,能否用端到端识别的不确定性估计每个词的可懂度
该工作用注意力端到端语音识别内部后验的不确定性做全盲微观可懂度估计,在 GRID 句库上以熵和离散度指标在相关性和逻辑回归预测准确率上超过直接用识别结果的基线,代价是离散度需额外对齐与多假设打分且结论限于小词汇矩阵句。
该工作用注意力端到端语音识别内部后验的不确定性做全盲微观可懂度估计,在 GRID 句库上以熵和离散度指标在相关性和逻辑回归预测准确率上超过直接用识别结果的基线,代价是离散度需额外对齐与多假设打分且结论限于小词汇矩阵句。
论文在 Qwen2-Audio 上对照显式、隐式、课程式思维链与无序槽填充,报告槽填充在语音理解上 UAR 最高而从左到右课程学习在描述上相似度最高,且显式链随推理变长因误差累积明显下降。
针对埋地供水管道分布式声传感数据的多标签识别与时空定位问题,论文用事件级标签加像素级掩膜联合训练并在推理时用类激活图输出热力图,在保持多标签分类的同时把定位从零提升到可用水平,代价是需要人工矩形掩膜标注且只在单一工况 testbed 上验证。
针对 Transformer 解码器非因果交叉注意力导致的长删除与重复幻觉,该文提出只在推理时逐 token 右移注意力质心并钳制跳变的方法,在 LibriSpeech 四集上相对基线平均降低 8.9% 词错误率,代价是引入 δ、β、ν 三个需在开发集上调参的启发式阈值且不改变模型参数。
针对电影音轨要分成对白音乐音效的问题,CineSubNet 用稀疏编解码加 Transformer 分离并以 Whisper 加 BERT 字幕作语义先验,在 DnR 全系列上以 SDR 为指标超过 BandIt 等基线,多模态版本代价是参数从 23.5M 到 24.1M 而延迟基本不变。
针对卒中后失语命名中发音变异和多重尝试导致转写不可靠的问题,论文把判断改成音频与提示文本在共享空间的配对,用两组法语命名数据在留一说话人评估下报告最高 0.90 准确率,代价是仍需在失语数据上微调且重度损伤集上降到 0.85。
针对稀疏双耳房间脉冲响应重建后 700 个时域等效源带来双耳卷积负担的问题,论文提出能量加权方向 K 均值聚类把重建方向压缩到 30 个,ABX 显示与全分辨率难以区分,而按能量排序的基线在全部条件下均可被区分,代价是低能量但定位重要的源可能被合并且结论限于特定房间与早期反射条件。
针对类别标签难表混合情绪、维度分数难直观解释的问题,该研究把日语表演性情绪语音标注为色相、饱和度、明度并用回归直接预测,留一说话人交叉验证下多任务学习在色相角误差约 29.7 度、饱和度与明度一致性相关系数约 0.560 与 0.803、六分类准确率 90.8% 上同时优于单任务,但结论限于表演性日语与小规模众包标注条件。
该文用图像字幕先建视觉词表再过滤语音,用无监督词发现做两两对齐与堆叠评分定位关键词,在视觉监督下超过神经基线,但共现词与字幕噪声仍带来明显定位损失与计算代价。
针对可穿戴 6 自由度声音事件定位与检测中混响和噪声破坏声学空间线索的问题,该文用信噪比与混响时间辅助监督学场景嵌入并以此控制音频-运动融合门,在 6DoF SELD 数据集上把聚合误差降到 0.265、相对静态融合降低 5.69%,代价是增加 18.6K 参数和 37.4M 计算量。
该研究比较声学氛围驱动与歌词语义驱动的背景视频选择,提出在约 14000 个音乐视频上对比学习音乐视频联合嵌入并用束搜索做全局非重叠选段,最强证据是主观评价中声学方法在整体不自然感和转场连续性上显著优于歌词方法,代价是剪辑节奏与歌词具体指涉仍存在错位。
针对高阶全通变换 DCT 分析合成滤波器组相位与混叠失真难以同时补偿的问题,论文用凸最小二乘直接求解 FIR 合成子滤波器系数,以完全重建设计实现全局最优,并以混叠受限的近完全重建设计换取更好的合成滤波器频率选择性。
针对印地语英语代码切换中声音对但文字错的问题,论文冻结语音编码器与指示大模型只训练 27.8M 瓶颈适配器,以 21.56% 词错误率与 20.69% 转写词错误率超过解码器微调基线,代价是依赖大模型词表与干净盲测集。
针对帕金森病理语音增强数据少且声学 atypical 的问题,论文在 PC-GITA 上系统比较变换型、生成型与噪声增强对预测式 CR 与生成式 SB 模型的影响,最强证据是噪声增强带来最稳健的大幅提升,而生成式合成在比例增大时反而损害性能,且病理与常态语音间的差距依然存在。
针对弓弦乐器源-滤波器分离含混问题,DDSP-Violin 用亮度、弓位与残差约束谐波源,在合成数据上把体共振重建误差做小,而多尺度频谱重建质量基本不下降,代价是仍有局部共振细节误差与相位不定问题。
针对分布式子阵列间通信贵、难同步的问题,论文提出只在子阵列间共享非负矩阵分解变量的三种去中心化独立低秩矩阵分析,并报告基共享变体在混响与采样时间偏移下保持稳定分离的主要证据与建模代价。
该研究把单通道肺音去噪定义为从心音、摩擦与环境噪声叠加中恢复胸壁肺音,用可微短时傅里叶变换包裹的复数谱残差 U-Net 做端到端估计,在合成与真实混合上报告了更高的信噪比改善和更低的重建误差,但高信噪比段的失真风险与临床保真仍待单独验证。
针对 Conformer 在噪声下注意力分散导致上下文建模退化的问题,论文提出混合式修正差分门控注意力 Conformer,在保持参数量基本一致时于 Librispeech 干净与加噪测试上取得相对词错误率下降,但小模型增益有限且早期全量替换会损害表征。
针对模数转换器动态范围不足导致的削波与绕回溢出,该文在模拟前端引入模折叠并用分帧离散余弦变换加矩阵铅笔法恢复丢失的高位,硬件实验报告在严重削波下提升超过 25 dB,但依赖过采样与带限平滑先验且对硬件非理想折叠需鲁棒处理。
针对单嵌入把声源与空间混在一起的问题,DISSE 在同一主干上接声源头与空间头并用弱配对监督对比学习,在保持在任务检索的同时把偏离任务检索压到接近零,但代价是依赖合成房间脉冲与因子标签且只冻结编码器训练投影头。