论文解读

从感知到干活:Qwen3.8-Omni-Flash 如何把长音视频变成可执行的智能体工作流

论文要解决长音视频生产力任务中感知与长程规划脱节的问题,选择原生多模态共训加百万上下文与按需取证的智能体执行,证据是多说话人识别与长视频推理的大幅提升,代价是通用转写翻译仍有差距且实时交互需非思考模式换取低延迟。

 · 约 21 分钟 · 10373 字 阅读 →
论文解读

把专家混合塞进卷积-Transformer:MECT 如何在小参数下做说话人确认与流式推理

MECT 针对全监督说话人确认中卷积局部建模与 Transformer 全局建模难以兼顾的问题,把四种混合专家结构放进 Transformer 前馈位置,用帧级稠密 4 专家在 VoxCeleb 上取得 minDCF 0.012、0.026、0.048 的报告结果,代价是参数从 9.40M 增至 9.57M 并需因果重训才支持 100 ms 流式。

 · 更新于 2026-09-24 · 约 19 分钟 · 9498 字 阅读 →
论文解读

共享一块做精修:ADER 用早停深度与单专家适配省掉冗余迭代

针对固定深度对所有语音做同样多次精修的浪费,ADER 用共享 TS-Transformer 块循环精修并以深度控制器硬早停加每步单专家残差适配,在 VCTK-DEMAND 上以平均 2.15 次迭代达到 WB-PESQ 3.37,代价是相对固定 3 步共享块仍有约 2.6% 的感知质量下降。

 · 更新于 2026-09-24 · 约 17 分钟 · 8386 字 阅读 →
论文解读

先分证据再定修复模式:稀疏、突发与密集专家的时序路由

该研究把黑胶损伤检测做成修复导向的 5 类时序路由,用稀疏、突发、密集 3 路专家证据加分层路由器与验证集选定的维特比转移惩罚,在 597 段合成基准上达到 0.730 的 5 类宏 F1,主要增益来自时序解码而非分层本身,且混合类仍最难。

 · 更新于 2026-09-24 · 约 21 分钟 · 10120 字 阅读 →
论文解读

把情感拆成方向与强度:瓶颈专家分治处理多模态情绪

该文把视频多模态情感分析拆为极性判别与强度回归,用极性与强度瓶颈专家分别压缩各模态信息再做跨模态路由融合,在四个中英文数据集与多种语言模型上报告了路由设置与专家分工证据,但未公开代码与完整训练预算。

 · 更新于 2026-09-24 · 约 8 分钟 · 3732 字 阅读 →
论文解读

先规划后演奏:StepAudio 3 Music 用单码本与 ABC 计划平衡长曲连贯与音质

StepAudio 3 Music 针对完整歌曲的长程结构与高保真渲染矛盾,采用 50 赫兹 65536 表项单码本离散表示加混合专家自回归组织音乐序列再由流匹配扩散渲染 48 千赫音频,并以 ABC 记谱作显式编曲计划,在 339 条歌词到歌曲与 316 条人声条件上取得内容享受 7.7086 与文本相似 0.4465 的最高均值,代价是自回归序列翻倍与符 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10836 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
论文解读

不重建人体动作:把音频当风格信号直接驱动人形机器人跳舞与演讲

论文把音乐与语音当作隐式风格控制信号,用音频-动作对齐加残差混合专家教师与内容加风格扩散学生实现免重定向的音频到关节动作映射,在 FineDance 与 BEAT2 上报告了检索与跟踪指标,但跨仿真与真机泛化仍受数据集与物理条件限制。

 · 更新于 2026-09-24 · 约 19 分钟 · 9367 字 阅读 →
论文解读

一个模型压七种数据:OmniZip 以统一分词加稀疏路由做轻量无损压缩

针对单模态压缩器重复部署与大模型压缩器过重的问题,OmniZip 用统一可逆分词加双路模态路由的轻量序列模型预测概率再算术编码,在 16 个数据集上接近专用方法并在笔记本与手机上接近实时,代价是自然图像与基因等难例仍弱于专用大模型。

 · 更新于 2026-09-24 · 约 19 分钟 · 9291 字 阅读 →
论文解读

不只把话说对,还要动得对:ViBES 如何联合规划语言与身体

ViBES 针对多轮对话中语言与身体脱节的问题,采用文本语音专家加面部与身体专家的混合模态专家结构并在 25 帧统一时钟上联合生成,在对话行为基准上取得高于共语音手势与文本到动作基线的对齐度,代价是依赖单目重建数据与尚不完善的行为评价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9907 字 阅读 →
论文解读

说话很准、唱歌就失灵:用三路特征混合守住语音又学会歌声

针对语音训练的伪造检测器在歌声上失效的问题,论文用对数梅尔谱、MFCC 与 Wav2Vec2 三专家加门控融合与 50/50 语音歌声联合微调,在 CtrSVDD 上报告 1.82% 等错误率并在 ASVspoof 2019 上保持 0.38%,代价是多分支推理开销与 SingFake 野外数据上仍高达 44.20%。

 · 更新于 2026-09-24 · 约 20 分钟 · 9546 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

缺模态是因果链断裂:先按历史补锚点,再用超图挖高阶组合

针对对话中模态缺失切断细粒度跨模态因果链的问题,CaM-HG 采用先由历史条件混合专家补全再由非对称因果动态超图挖掘的路线,在 IEMOCAP 等 3 套基准上报告了高缺失率下更慢的衰减,但连续极端缺失与结构因果解耦仍是边界。

 · 更新于 2026-09-24 · 约 18 分钟 · 8552 字 阅读 →
论文解读

把预训练语音模型改成高层专家分工:抗伪造要在保留表示的前提下做稀疏扩容

针对未见合成方法泛化难的问题,论文把 WavLM-Large 部分高层的前馈块替换为多专家并用门控做整句选路,在 14 个评测集上把宏平均等错率从 5.46% 降到 4.81%,代价是参数增至 329M 且需全量微调。

 · 更新于 2026-09-24 · 约 19 分钟 · 9258 字 阅读 →
论文解读

一个模型管 72 个方向:用源端与目标端双路专家拆开识别与翻译的干扰

针对多对多联合识别与翻译中共享模型的负迁移与目标语言漂移,论文在分层 Transducer 上加入源条件与目标条件两组 MoE 适配器,在 Europarl-ST 九语言 72 方向上以单个 77M 模型实现平均 20.5 BLEU、0.651 COMET 与 15.71% WER,代价是仍需已知源与目标语言标识且仅验证离线场景。

 · 更新于 2026-09-24 · 约 20 分钟 · 9802 字 阅读 →
论文解读

先用口音标签分工,再用转写质量选路:MOE-CTC 的口音鲁棒识别

针对口音导致词错率上升且推理时无可靠口音标签的问题,论文在 FastConformer 中插入序列级混合专家并为每个专家配独立 CTC 头、用两阶段路由从口音感知过渡到无标签推理,最强证据是在 MCV-ACCENT 上有预训练条件下大小模型同时降低已见和未见口音词错率,代价是训练早期仍需口音标签并增加混合专家参数与训练开销。

 · 更新于 2026-09-24 · 约 18 分钟 · 8721 字 阅读 →
论文解读

声音太杂,一个投影器学不过来:用稀疏专家拆开梯度冲突

针对语音、音乐、环境声混在一起导致共享适配器梯度互相打架的问题,论文用稀疏混合专家适配器把音频令牌分流到不同专家,在总参数约 94.4M、激活约 70.8M 的受控预算下把 MMSU 音频准确率从 35.03% 提升到 38.19%、OBQA 从 50.10% 提升到 53.85%、MMAU 从 59.79% 提升到 61.50%,代价是需要负载均衡约束来维 …

 · 更新于 2026-09-24 · 约 19 分钟 · 9268 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

从离散缺失到连续可靠度:QA-MoE 用质量分数压住不可靠专家的路由

针对文本、音频、视觉在噪声与缺失连续变化时情感分析退化的问题,论文用连续可靠度谱统一三种退化协议并提出以偶然不确定性驱动路由的 QA-MoE,在 CMU-MOSI 等基准上保持领先,代价是需要谱感知的数据增强与双分支不确定性建模。

 · 更新于 2026-09-24 · 约 20 分钟 · 9751 字 阅读 →