论文解读

声音不够时让文字来帮忙:用异构图把语言知识传给语音表示

针对 Yemba 等低资源语言声学表示难学的问题,该工作用异构图把声学节点和语言节点放在同一张图里做消息传递,并在 Google Commands 缩减集和 Yemba 孤立词数据上用 SVM 和聚类指标验证跨模态表示优于 MFCC 基线和单模态 GCN,但推理依赖预训练声学模型且未做到句子级。

 · 更新于 2026-09-24 · 约 18 分钟 · 8920 字 阅读 →
论文解读

把对齐做成链路预测:异构图如何把文本知识搬进语音词表示

针对低资源下语音文本对齐需要大编码器和大量平行数据的问题,该文把词级对齐建模为异构图上的链路预测,用 GraphSAGE 消息传递把固定文本表示传给语音节点,在 TIMIT 和 Yemba 上以轻量图训练达到可比 SAMU-XLSR 的富集与检索效果,代价是跨模态检索仍受初始声学质量制约且句子级与下游任务未验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8776 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-22

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 54 分钟 · 26987 字 阅读 →
论文解读

用稀疏局部图约束跨模态对齐,再让 Mamba 管长时序的轻量音视增强

针对轻量音视语音增强中拼接缺乏结构、先验稠密注意力易错配的问题,SG-Mamba 用±3 帧稀疏异构图做局部内容自适应融合再交由单向 Mamba 建模全局时序,在 LRS3 噪声下取得 13.091 dB SI-SDR,代价为 5.3 M 参数和 3.45 G MACs。

 · 更新于 2026-09-24 · 约 18 分钟 · 8523 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

缺模态下先补语义再算不确定性:超图引导扩散与双通道证据融合

针对对话情感识别中随机缺失模态导致语义不一致与模态冲突,论文用掩码超图注意力为扩散恢复提供条件并用特征源与判别双通道估计不确定性做证据融合,在缺失率 0.0 至 0.7 下保持最高准确率,代价是两阶段训练与 300 步扩散采样开销。

 · 更新于 2026-09-24 · 约 20 分钟 · 9807 字 阅读 →
论文解读

看不见的生成器:用通用音频语义加图结构抓环境音伪造痕迹

针对未见过文本到音频与音频到音频生成器的环境音伪造检测,论文用高效音频 Transformer 做前端加图注意力后端,配合差分微调与编解码增广,在 EnvSDD 上报告测试等错误率 2.48%,代价是依赖大规模预训练与特定增广组合。

 · 更新于 2026-09-24 · 约 19 分钟 · 9357 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

把接线图学进去:用仿真 FM 信号流的图编码器做音频到预设检索

针对给定目标音色从预设库中找回最接近 DX7 预设的问题,论文用 SLAP 式音频参数联合嵌入加仿真调制信号流的 DX7-GNN 编码器,在未见拓扑上以 52.2% R@1 超过 Transformer 与 Highway 基线,代价是依赖算子交换增强与单音高单力度渲染条件。

 · 更新于 2026-09-24 · 约 21 分钟 · 10101 字 阅读 →
论文解读

把转录文本连成图:用主体词关系检测阿尔茨海默症

该文把轻量语音转文本后的饼干失窃描述转成词共现图,用两层图卷积区分阿尔茨海默症与健康人,在 ADReSS-o 上主体词图达到 88.73%、精炼版 90.14%,代价是词表依赖该图片描述任务且只用文本模态。

 · 更新于 2026-09-24 · 约 16 分钟 · 8007 字 阅读 →
论文解读

不用对钟也能合奏:用空间排布与关系感知组织声音群体

论文把作曲从指定事件改为设定条件,用三层架构与成对射频加声学校准推断相对拓扑来参数化局部耦合,合成验证显示双模态距离误差降到 10.03 cm 左右而位置误差方差仍大,代价是真实房间性能尚未验证。

 · 更新于 2026-09-24 · 约 23 分钟 · 11460 字 阅读 →
论文解读

跨模态一致反而更难查:RAVM 用多智能体伪造现实感视频谣言并以证据图检测

针对生成式视频谣言跨模态语义一致导致旧数据集失真的问题,该研究构建含声明、视频、音频与跨模态四类操纵的 9049 对 RAVM 数据集并提出证据图检测模型 IEEG,以 75.99% 准确率取得最优但仍显示通用大模型的脆弱性,代价是生成与评测流程复杂且数据集链接当前不可用。

 · 更新于 2026-09-24 · 约 18 分钟 · 8720 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

缺模态是因果链断裂:先按历史补锚点,再用超图挖高阶组合

针对对话中模态缺失切断细粒度跨模态因果链的问题,CaM-HG 采用先由历史条件混合专家补全再由非对称因果动态超图挖掘的路线,在 IEMOCAP 等 3 套基准上报告了高缺失率下更慢的衰减,但连续极端缺失与结构因果解耦仍是边界。

 · 更新于 2026-09-24 · 约 18 分钟 · 8552 字 阅读 →
论文解读

把申克分析变成逐层留音符:用多关系图与节点隔离学层次

针对巴洛克赋格主题的申克层次标注问题,AutoSchA 把乐谱建成多关系音符图并用节点隔离做可学习的逐层池化,在小样本专家数据上接近人类分析但仍残留可察觉的别扭连接且仅验证了该体裁。

 · 更新于 2026-09-24 · 约 18 分钟 · 8947 字 阅读 →
论文解读

既要指认合成语音来自哪台生成器,又要识破没见过的新生成器

论文用冻结语音基础模型做表示、图神经网络做已知生成器归因、近邻分支做未知检测并以置信度阈值分流,在 DiffSSD 上 Mamba-B 的联合配置取得 DEV 准确率 98.11% 与等错误率 2.33%,代价是仍依赖固定阈值且不对多个未知源做细粒度区分。

 · 更新于 2026-09-24 · 约 19 分钟 · 9354 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →