论文解读

干净集打平、噪声下才拉开差距:SwinV2 与 AST 的蚊种对数加权融合

该研究以六类蚊种图像加 5 秒翅振音频为输入,用 SwinV2 与音频频谱变换器分别输出类别对数再做可学习加权融合,在干净集上融合准确率为 97.8 未超过单模态,而在图像与音频双侧加噪后融合仅下降 4.66 个百分点的代价是需要配对双模态输入与联合微调。

 · 更新于 2026-09-25 · 约 16 分钟 · 7551 字 阅读 →
论文解读

不发原声原脸如何做青少年抑郁焦虑压力筛查:AdoDAS 的隐私接口与双赛道设计

AdoDAS 在不分发未成年人原始音视频的前提下提供 6000 人四会话的匿名化表征与文本,要求在隐藏测试集上完成 D/A/S 二分类筛查与 21 项 DASS-21 序数预测,音视频基线均值 F1 为 0.4604、均值 QWK 为 0.2675,最优提交分别达到 0.5921 和 0.2776,但提升主要来自时序多模态与跨会话建模而非原始编码器规模。

 · 更新于 2026-09-25 · 约 21 分钟 · 10035 字 阅读 →
论文解读

从看得连贯到剪得准确:CutCraft 如何把多镜头音画的剪辑执行变成可核验的度量

CutCraft 把多镜头音画生成从感知连贯拉回到可核验的剪辑执行,用 295 条结构化提示与分层混合评估在 13 个主流模型上检验镜头结构、转场与蒙太奇的指令遵从,并以规划-分镜合成-后期合成的智能体基线揭示离散剪辑控制可提升而高阶蒙太奇仍难的代价边界。

 · 更新于 2026-09-25 · 约 27 分钟 · 13248 字 阅读 →
论文解读

从歌曲证据到可执行分镜:MVWeaver 为何用层次规划加歌曲到视觉的桥接来做长篇音乐视频

针对全曲音乐视频需要把歌曲语义与音乐结构转成连贯视觉发展的难题,MVWeaver 用层次化规划把总概念逐级展开为可渲染镜头,并用从真实歌曲-MV 对中学习到的歌曲到视觉桥接来条件化规划,证据显示其在歌曲贴合与长程连贯上优于同条件基线,但增益依赖桥接监督与层次资产复用。

 · 更新于 2026-09-25 · 约 22 分钟 · 10949 字 阅读 →
论文解读

噪声越大越要看嘴型:AV-STE 在冻结对话模型前修复语义口令

针对全双工语音对话在背景噪声和重叠说话下语义口令损坏的问题,AV-STE 用流式视听编码器加噪声自适应融合在冻结 Moshi 之前恢复第一码本语义口令,同数据集多人干扰下 GPT-4o 连贯性平均从 1.42 提到 1.91,代价是干净语音存在口令失配且依赖可靠唇部视频。

 · 更新于 2026-09-25 · 约 22 分钟 · 10743 字 阅读 →
论文解读

把打断、等待与做任务放进同一个流:Gander 如何用块展平与小脑-大脑分工实现可打断的全双工 Omni 智能体

针对语音视觉文本连续输入下既要低延迟可打断对话又要长程工具执行的问题,Gander 用小脑负责流式交互与块级控制、大脑免训练负责长程推理并通过编排运行时协同,在 Full-Duplex-Bench 上以 100% 合时接管与 8.0 抢话率取得交互最优,同时在 SpokenQA 上保持 75.60 与 59.30 的流式问答能力,代价是 WorldSense …

 · 更新于 2026-09-25 · 约 29 分钟 · 14523 字 阅读 →
论文解读

把波形峰值关进语义空间:MAPS 如何在非线性功放下同时做对齐与 PAPR 抑制

针对多用户 OFDM 下多模态 Token 经 Modified Rapp 功放非线性失真导致任务精度与能效下降的问题,MAPS 用两阶段训练在嵌入空间联合优化跨模态对齐与均衡 PAPR 抑制,在 IBO=3 dB 时相对同条件基线获得约 64.5% AVQA 精度提升与约 64.4% 任务导向能效提升,代价是引入方差均衡与锚定重构等额外约束以稳定训练。

 · 更新于 2026-09-25 · 约 22 分钟 · 10894 字 阅读 →
论文解读

从隐式注意力到可编辑的时滞轨迹:音视同步如何为发音评估提供可解释时序依据

针对仅靠音频评估无法诊断唇动与语音时序错位的问题,论文用跨模态注意力显式建模帧级对齐并导出时滞轨迹与稳定性指标,在 8 类录制条件下以线性复杂度和可视化分析实现可解释的同步性诊断。

 · 更新于 2026-09-25 · 约 23 分钟 · 11297 字 阅读 →
论文解读

音频三路特征与视频时空建模为何需要注意力来对齐:多模态情绪识别的可复述路径

针对单模态易受噪声与信息缺失影响的问题,论文用 Wav2Vec2、MFCC 与统计声学特征经 BiLSTM 建模音频、用 ResNet50-BiLSTM 建模视频,并以多头交叉注意力做特征级融合,在 MELD 上微平均 93.7% 与 IEMOCAP 上 90.3% 准确率上验证效果,但未报告训练超参细节与统计显著性。

 · 更新于 2026-09-25 · 约 22 分钟 · 10959 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-09

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 2 分钟 · 1002 字 阅读 →
论文解读

AVENUE:当提示只改一个模态时,模型能否守住另一个模态

AVENUE 用 1291 个源片段和 7957 条指令把音频、视频与音视频耦合编辑分开考核,并用样本级四维评测揭示现有三类范式在保持未编辑模态上普遍失效,且反演式音频模型在保真与可编辑性间最均衡。

 · 更新于 2026-09-25 · 约 23 分钟 · 11214 字 阅读 →
论文解读

联合分支不可全信:用冲突量与可干预性重配解码权重

针对全模态大模型中音频视觉联合预测不可靠融合的问题,论文提出免训练的冲突感知解码 CAD,用潜在冲突量与任务空间可干预性决定是否把联合分支权重转给单模态分支,在 Qwen2.5-Omni-7B 上把 CMM 整体准确率提到 85.0% 与 AVHBench 提到 84.1%,代价是每步要跑四个分支并依赖人工阈值。

 · 更新于 2026-09-25 · 约 20 分钟 · 9605 字 阅读 →
论文解读

长时音视频为何不能只靠分块拼接:Encore 用参考锚点与自适应信号路由维持一致性

针对长时同步音视频生成中视频连贯、音频连贯与跨模态同步三重耦合难题,Encore 以重叠运动帧迭代与参考锚点分工配合可学习的自适应信号路由实现无限长度生成,并在扩展的 VerseBench 上以更低的时序漂移与更高的身份与同步指标验证效果,同时保留高分辨率与语音能力。

 · 更新于 2026-09-25 · 约 24 分钟 · 11802 字 阅读 →
论文解读

低码率语音编解码装不下时:用语义与唇动补上高层信息

针对低码率下仅靠语音表示难以保留上下文与发音信息的问题,论文在 MDCTCodec 上增加语义与图像两个辅助分支并用交叉注意力融合,以直接拼接的融合模式和蒸馏后纯语音推理的蒸馏模式组织实验,在 TaL80 上把 ViSQOL 从 3.86 提升到 4.01,代价是融合模式推理需要额外的唇部图像与预训练语义输入。

 · 更新于 2026-09-25 · 约 22 分钟 · 10955 字 阅读 →
论文解读

PRISM-Bench:用音频类型与声源可见性交叉诊断文生音视频的接地能力

针对文生音视频评估重视频轻音频的问题,PRISM-Bench 以语音/音乐/音效与 On-screen/Off-screen 交叉分层与四维度 35 条细粒度标准组织 900 条人工校验样本,并用盲式并排、以真值为锚的 MLLM-as-a-Judge 两阶段打分实现超过 70% 的人类一致性,揭示前沿闭源模型在可感保真度上已超真值但在可见声源同步与精细声音控 …

 · 更新于 2026-09-25 · 约 19 分钟 · 9227 字 阅读 →
论文解读

ParaJSCC: A Parameterized Framework for Reusable Multimodal Joint Source-Channel Coding

音频编码 | 6.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6157 字 阅读 →
论文解读

Separate First, Then Associate: A Two-Stage Approach for Real-World Audio-Visual Speech Enhancement

音视频语音分离 | 6.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5443 字 阅读 →
论文解读

LoopVSR: A Loop Engineering Framework for Automated Repair of Visual Speech Recognition Inference Pipelines

音视频语音识别 | 6.6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7037 字 阅读 →
论文解读

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

音视频问答 | 7.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6710 字 阅读 →
论文解读

Modeling turn-taking with distant viewing: investigating silence thresholds in human and AI-generated discourse

音视频 | 6.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6168 字 阅读 →