声音不够时让文字来帮忙:用异构图把语言知识传给语音表示
针对 Yemba 等低资源语言声学表示难学的问题,该工作用异构图把声学节点和语言节点放在同一张图里做消息传递,并在 Google Commands 缩减集和 Yemba 孤立词数据上用 SVM 和聚类指标验证跨模态表示优于 MFCC 基线和单模态 GCN,但推理依赖预训练声学模型且未做到句子级。
针对 Yemba 等低资源语言声学表示难学的问题,该工作用异构图把声学节点和语言节点放在同一张图里做消息传递,并在 Google Commands 缩减集和 Yemba 孤立词数据上用 SVM 和聚类指标验证跨模态表示优于 MFCC 基线和单模态 GCN,但推理依赖预训练声学模型且未做到句子级。
针对低资源下语音文本对齐需要大编码器和大量平行数据的问题,该文把词级对齐建模为异构图上的链路预测,用 GraphSAGE 消息传递把固定文本表示传给语音节点,在 TIMIT 和 Yemba 上以轻量图训练达到可比 SAMU-XLSR 的富集与检索效果,代价是跨模态检索仍受初始声学质量制约且句子级与下游任务未验证。
共分析 29 篇语音/AI 论文
针对轻量音视语音增强中拼接缺乏结构、先验稠密注意力易错配的问题,SG-Mamba 用±3 帧稀疏异构图做局部内容自适应融合再交由单向 Mamba 建模全局时序,在 LRS3 噪声下取得 13.091 dB SI-SDR,代价为 5.3 M 参数和 3.45 G MACs。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
针对对话情感识别中随机缺失模态导致语义不一致与模态冲突,论文用掩码超图注意力为扩散恢复提供条件并用特征源与判别双通道估计不确定性做证据融合,在缺失率 0.0 至 0.7 下保持最高准确率,代价是两阶段训练与 300 步扩散采样开销。
针对未见过文本到音频与音频到音频生成器的环境音伪造检测,论文用高效音频 Transformer 做前端加图注意力后端,配合差分微调与编解码增广,在 EnvSDD 上报告测试等错误率 2.48%,代价是依赖大规模预训练与特定增广组合。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对给定目标音色从预设库中找回最接近 DX7 预设的问题,论文用 SLAP 式音频参数联合嵌入加仿真调制信号流的 DX7-GNN 编码器,在未见拓扑上以 52.2% R@1 超过 Transformer 与 Highway 基线,代价是依赖算子交换增强与单音高单力度渲染条件。
该文把轻量语音转文本后的饼干失窃描述转成词共现图,用两层图卷积区分阿尔茨海默症与健康人,在 ADReSS-o 上主体词图达到 88.73%、精炼版 90.14%,代价是词表依赖该图片描述任务且只用文本模态。
论文把作曲从指定事件改为设定条件,用三层架构与成对射频加声学校准推断相对拓扑来参数化局部耦合,合成验证显示双模态距离误差降到 10.03 cm 左右而位置误差方差仍大,代价是真实房间性能尚未验证。
针对生成式视频谣言跨模态语义一致导致旧数据集失真的问题,该研究构建含声明、视频、音频与跨模态四类操纵的 9049 对 RAVM 数据集并提出证据图检测模型 IEEG,以 75.99% 准确率取得最优但仍显示通用大模型的脆弱性,代价是生成与评测流程复杂且数据集链接当前不可用。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对对话中模态缺失切断细粒度跨模态因果链的问题,CaM-HG 采用先由历史条件混合专家补全再由非对称因果动态超图挖掘的路线,在 IEMOCAP 等 3 套基准上报告了高缺失率下更慢的衰减,但连续极端缺失与结构因果解耦仍是边界。
针对巴洛克赋格主题的申克层次标注问题,AutoSchA 把乐谱建成多关系音符图并用节点隔离做可学习的逐层池化,在小样本专家数据上接近人类分析但仍残留可察觉的别扭连接且仅验证了该体裁。
论文用冻结语音基础模型做表示、图神经网络做已知生成器归因、近邻分支做未知检测并以置信度阈值分流,在 DiffSSD 上 Mamba-B 的联合配置取得 DEV 准确率 98.11% 与等错误率 2.33%,代价是仍依赖固定阈值且不对多个未知源做细粒度区分。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读