STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

📄 STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits #音视频生成 #语音合成 #扩散模型 #自回归模型 #多模态模型 6.8/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | #音视频生成 | #扩散模型 | #语音合成 #自回归模型 | arxiv 👥 作者与机构 第一作者:Foivos Paraperas Papantoniou(Imperial College London, UK) 通讯作者:Foivos Paraperas Papantoniou(Imperial College London, UK) 作者列表:Foivos Paraperas Papantoniou(Imperial College London, UK)、Stathis Galanakis(Imperial College London, UK)、Rolandos Alexandros Potamias(Imperial College London, UK)、Bernhard Kainz(Imperial College London, UK; FAU Erlangen–Nürnberg, Germany)、Stefanos Zafeiriou(Imperial College London, UK) 💡 毒舌点评 这篇论文把一个音频驱动说话人脸生成和一个新视角合成任务塞进了同一个框架,工程整合能力值得肯定,自强迫训练策略和纯ID驱动生成确实让动画没那么“僵尸”了。但本质上,它就是拿Arc2Face当骨架,套上AnimateDiff的时间层,加个ReferenceNet,再用自强迫和唇读损失微调一下——每个组件都是现成的,论文没在理论或架构上给出让人眼前一亮的新洞见。最致命的还是不提供代码和模型,在如今“没有开源就别想拿高分”的顶会气氛下,这种做法无异于自断一臂,尤其是实验结果里那些微小的LSE-C领先,没给置信区间,完全是给人留质疑的把柄。 ...

2026-07-04 · 更新于 2026-07-30 · 4 min · 761 words

Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage

📄 Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage #流式处理 7.2/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.2/10 | 前50% | #流式处理 | #流式处理 | arxiv 👥 作者与机构 第一作者:Siddhant Arora(Meta AI / Carnegie Mellon University) 通讯作者:Siddhant Arora(siddhana@meta.com)、Zhaojiang Lin(zhaojiang@meta.com) 作者列表:Siddhant Arora(Meta AI, USA / Carnegie Mellon University, USA)、Haidar Khan(Meta AI, USA)、Kai Sun(Meta AI, USA)、Xin Luna Dong(Meta AI, USA)、Sajal Choudhary(Meta AI, USA)、Seungwhan Moon(Meta AI, USA)、Xinyuan Zhang(Meta AI, USA)、Adithya Sagar(Meta AI, USA)、Surya Teja Appini(Meta AI, USA)、Kaushik Patnaik(Meta AI, USA)、Sanat Sharma(Meta AI, USA)、Shinji Watanabe(Carnegie Mellon University, USA)、Anuj Kumar(Meta AI, USA)、Ahmed A Aly(Meta AI, USA)、Yue Liu(Meta AI, USA)、Florian Metze(Meta AI, USA)、Zhaojiang Lin(Meta AI, USA) 💡 毒舌点评 本文提出了一种将语音对话系统的工具调用从“端点后”推进到“流式并行”的工程框架,其“边听边查”的思路以及对延迟的大幅改善(结合vLLM后达57%)无疑是务实且有效的。然而,这也是一篇典型的工业界系统工程论文:核心的Model-Triggered策略本质上是对LLM的一次精巧适配和指令微调,学术深度有限,未能对“为何流式查询不损害准确率”提供理论层面的洞见。此外,论文回避了Reflector机制在关键实体后置时的失效问题,且对多轮、嘈杂环境的鲁棒性验证严重不足,使其宣称的泛化能力打了折扣。 ...

2026-07-04 · 更新于 2026-07-30 · 3 min · 570 words

SURF: Separation via Unsupervised Remixing Flow

📄 SURF: Separation via Unsupervised Remixing Flow #语音分离 #生成模型 #自监督学习 #无监督学习 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.2/10 | 前50% | #语音分离 | #流匹配 | #生成模型 #自监督学习 | arxiv 👥 作者与机构 第一作者:Henry Li (Google), 共同一作:Robin Scheibler (Google DeepMind) 通讯作者:Henry Li (lihenry@google.com) 作者列表:Henry Li (Google)、Robin Scheibler (Google DeepMind)、Efthymios Tzinis (Google)、Matt Shannon (Google DeepMind)、Arnaud Doucet (Google DeepMind)、John R. Hershey (Google DeepMind) 备注:Arnaud Doucet 与 John R. Hershey 为共同高级作者 (equal senior contribution) 💡 毒舌点评 这篇论文用Wake-Sleep给“借鸡生蛋”的Remixing套上了一层概率外衣,又将Flow Matching的生成能力引入无监督分离,想法很漂亮,画面很美好。但现实很骨感:AudioSet上三四个源的场景直接“掉链子”,理论分析的强假设(人口极限B→∞)在实际中脆弱得像纸糊,加上代码闭源、关键超参数缺失,让人严重怀疑这套花哨的pipeline复现起来是不是一场工程噩梦。 ...

2026-07-04 · 更新于 2026-07-30 · 5 min · 1043 words

T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

📄 T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation #基准测试 #多模态模型 #音视频生成 7.9/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.7/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.9/10 | 前25% | #音视频生成 | #多模态模型 | #基准测试 | arxiv 👥 作者与机构 第一作者:Zhe Cao, Tao Wang, Jiaming Wang, Yanghai Wang(并列一作,均标注为南京大学) 通讯作者:Jiaheng Liu(南京大学) 其他作者:Yuanxing Zhang(快手科技 Kling Team)、Jiahao Wang(南京大学)、Jialu Chen(快手科技 Kling Team)、Miao Deng(南京大学)、Chenxi Liao(南京大学)、Yize Zhang(南京大学)、Yubin Guo(南京大学)、Zhaoxiang Zhang(中国科学院自动化研究所) 💡 毒舌点评 这篇论文在 T2AV 评估领域迈出了扎实的一步:500条高复杂度prompt配合同一框架下的双层级评估,确实暴露了SOTA模型在“音频真实感”和“长时叙述”上的系统性瓶颈,诊断价值明确。但MLLM-as-a-Judge的可靠性验证仅覆盖50个样本且音频Realism一致性较弱(L1高达1.420),若不能规模化解决judge bias,这套框架的权威性就只能停留在“参考级”而非“标准级”。 ...

2026-07-04 · 更新于 2026-07-30 · 4 min · 663 words

TextME: Bridging Unseen Modalities Through Text Descriptions

📄 TextME: Bridging Unseen Modalities Through Text Descriptions 6.6/10 | 创新 1.3/2 | 严谨 0.9/1.5 | 实验 0.7/1.5 | 清晰 0.9/1 | 影响 0.4/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 6.6/10 | 前50% | #对比学习 | arxiv 👥 作者与机构 第一作者:Soyeon Hong(Ajou University, Department of Artificial Intelligence) 通讯作者:Seungtaek Choi(Hankuk University of Foreign Studies, Division of Language & AI)、Suha Kwak(POSTECH, Graduate School of AI)、Hyunsouk Cho(Ajou University, Department of Software) 作者列表:Soyeon Hong(Ajou University, Department of Artificial Intelligence)、Jinchan Kim(Ajou University, Department of Artificial Intelligence)、Jaegook You(Ajou University, Department of Artificial Intelligence)、Seungtaek Choi(Hankuk University of Foreign Studies, Division of Language & AI)、Suha Kwak(POSTECH, Graduate School of AI)、Hyunsouk Cho(Ajou University, Department of Software) 💡 毒舌点评 这篇论文试图用一个廉价的几何戏法绕过模态扩展中昂贵的数据墙——利用“模态间隙”这一已知属性,仅靠文本数据就将新模态投影到大语言模型空间中。想法有趣且务实,但就像用纸板搭桥:在结构完美的“3D”和“视频”编码器上走得挺稳,一到“分子”就塌了。实验广度足够,但深度像纸片,尤其是其宣称要颠覆的利基领域(医疗影像、分子)恰恰是性能最拉胯的地方,却只给了蜻蜓点水般的验证。这更像一个优美的实验室玩具,离解决真实世界利基领域的模态接入问题还隔着几个落地鸿沟。 ...

2026-07-04 · 更新于 2026-07-30 · 3 min · 615 words

The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning

📄 The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning #知识蒸馏 #流式处理 #大语言模型 7/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0.1/1.5 | 复现 0.2/0.5 | 工程 1.3/1.5 ✅ 7/10 | 前50% | #知识蒸馏 | #知识蒸馏 | #流式处理 #大语言模型 | arxiv 👥 作者与机构 第一作者:Donghang Wu(Nanyang Technological University, College of Computing and Data Science) 通讯作者:Chen Chen(Nanyang Technological University, College of Computing and Data Science) 作者列表:Donghang Wu(Nanyang Technological University)、Tianyu Zhang(Mila, Quebec Artificial Intelligence Institute, Université de Montréal)、Yuxin Li(Nanyang Technological University)、Hexin Liu(Nanyang Technological University)、Chen Chen(Nanyang Technological University)、Eng Siong Chng(Nanyang Technological University)、Yoshua Bengio(Mila, Quebec Artificial Intelligence Institute, Université de Montréal) 💡 毒舌点评 本文巧妙地将连续空间中的“隐式推理”概念迁移到全双工语音对话模型,用 ELBO 和全局专家蒸馏优雅地解决了“边听边想”的标注难题,在推理类任务上的涨点证明了隐式计算的潜力。但硬伤同样刺眼:一是所有 SFT 和评估均在自建合成数据上闭环完成,严重缺乏公开基准(如 Fisher、DailyTalk)上的通用语音交互结果,模型的真实场景泛化性完全未知;二是在同等数据条件下与显式 CoT 方法的直接对比缺失,其宣称的“优于显式 CoT”更像是修辞而非经过实验证实的结论。此外,声称“零额外推理延迟”,却在全文中看不到任何具体的延迟或计算量分析,这一核心优势远未得到量化。泛化能力、可解释性、以及宣称优势的可信度,构成了这篇论文的三大阿喀琉斯之踵。 ...

2026-07-04 · 更新于 2026-07-30 · 4 min · 782 words

TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

📄 TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions #音视频理解 #音频字幕生成 #多模态模型 #数据集 #基准测试 #强化学习 9.4/10 | 创新 1.7/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.4/1.5 🔥 9.4/10 | 前10% | #音视频理解 | #多模态模型 | #音频字幕生成 #数据集 | arxiv 👥 作者与机构 第一作者:Linli Yao(北京大学计算机学院,快手科技Kling团队) 通讯作者:Xu Sun(北京大学计算机学院) 作者列表:Linli Yao(北京大学,快手科技Kling团队)、Yuancheng Wei(华南理工大学)、Yaojie Zhang(电子科技大学)、Lei Li(香港大学)、Xinlong Chen(中国科学院自动化研究所,快手科技Kling团队)、Feifan Song(北京大学)、Ziyue Wang(北京大学)、Kun Ouyang(北京大学)、Yuanxin Liu(北京大学)、Lingpeng Kong(香港大学)、Qi Liu(香港大学)、Pengfei Wan(快手科技Kling团队)、Kun Gai(快手科技Kling团队)、Yuanxing Zhang(快手科技Kling团队)、Xu Sun(北京大学) 💡 毒舌点评 该工作在音视频密集字幕生成领域投下了一枚“定义即创新”的炸弹。其提出的OmniDenseCaptioning任务和SodaM评估指标,直击当前音视频理解缺乏时间粒度和结构化描述的痛点,堪称一次教科书式的任务重塑。7B开源模型在精细定义的子任务上干翻Gemini-2.5-Pro,工程整合能力令人叹服,为社区贡献了完整的开原语料。然而,剥开任务定义与指标的糖衣,模型本身是Qwen2.5-Omni与GRPO的精心调配,缺乏算法层面的范式突破。更令人警惕的是,其引以为傲的SodaM指标和训练数据完全由Gemini系列模型闭环驱动,这种“以子之矛攻子之盾”的策略虽精彩,但也埋下了系统性偏见的隐患,评估的可信度也因此被蒙上一层阴影。 ...

2026-07-04 · 更新于 2026-07-30 · 3 min · 503 words

TMD-Bench: A Multi-Level Evaluation Paradigm for Music–Dance Co-Generation

📄 TMD-Bench: A Multi-Level Evaluation Paradigm for Music–Dance Co-Generation 7.7/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ✅ 7.7/10 | 前25% | #音视频生成 | #流匹配 | arxiv 👥 作者与机构 第一作者:Xiaoda Yang(浙江大学)、Majun Zhang(浙江大学)(标注为同等贡献) 通讯作者:Zhou Zhao(浙江大学,zhaozhou@zju.edu.cn) 其余作者:Changhao Pan(浙江大学)、Nick Huang(Tecent, China)、Yuguang Yang(Tecent, China)、Fan Zhuo(浙江大学)、Pengfei Zhou(新加坡国立大学)、Jin Zhou(Tecent, China)、Sizhe Shan(浙江大学)、Shan Yang(Tecent, China)、Miles Yang(Tecent, China)、Yang You(新加坡国立大学) 💡 毒舌点评 这篇工作为音乐–舞蹈联合生成量身打造了一个多级评测范式 TMD-Bench,其中 MDAlign 将节拍-运动重音对齐拆解为物理度量与 MLLM 感知判决,思路务实且填补了该方向评测的空白。然而,10k 的数据集体量偏小,自研基线 RhyJAM 在关键的视频指令遵循和 MLLM 感知对齐上仍明显落后于 Sora 2 等商业模型,离真正的“卡准拍”和“听懂指令”还有明显距离。此外,声称的“统一基线”更像是一个为了验证评测基准而存在的基础模型,并未在方法架构上展现足够的新颖性。 ...

2026-07-04 · 更新于 2026-07-30 · 3 min · 636 words

Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer

📄 Towards Streaming Synchronized Spatial Audio Generation via Autoregressive Diffusion Transformer #空间音频 #音视频生成 #扩散模型 #流式处理 #自回归模型 #对比学习 6.6/10 | 创新 1.3/2 | 严谨 0.9/1.5 | 实验 0.7/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.8/1.5 | 复现 0.2/0.5 | 工程 1.1/1.5 ✅ 6.6/10 | 前50% | #音视频生成 | #扩散模型 | #空间音频 #流式处理 | arxiv 👥 作者与机构 第一作者(共同一作):Ke Lei(浙江大学) 共同一作:Yu Zhang(字节跳动) 共同一作:Changhao Pan(浙江大学) 作者列表:Xueyi Pu(浙江大学)、Wenxiang Guo(浙江大学)、Ruiqi Li(字节跳动)、Zhou Zhao(浙江大学,通讯作者) 💡 毒舌点评 这篇文章在流式空间音频生成上做出了明确的架构贡献——自回归做全局规划、扩散做局部渲染的思路干净利落,SVAC的空间负样本设计也很有物理感知能力。但整体evaluation偏弱,尤其是缺少与最近强基线(如MovieGen-Audio、Frieren)的直接对比,且ablation中只展示了去掉某组件的退化程度,缺少为什么这套组合设计优于其他可能组合(如AR-only或Diffusion-only变体)的深度分析。另外,伪FOA预训练策略的随意性以及对总生成时长的回避讨论,让人觉得像一份扎实的工程系统报告而非有深刻洞察的顶会文章。 ...

2026-07-04 · 更新于 2026-07-30 · 2 min · 399 words

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

📄 Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition #多模态模型 #可解释性 5.3/10 | 创新 1.1/2 | 严谨 0.9/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.3/10 | 后50% | #音视频理解 | #参数高效微调 | #多模态模型 #可解释性 | arxiv 👥 作者与机构 第一作者:Wanlong Fang(Nanyang Technological University, Interdisciplinary Graduate Programme, AI-X & College of Computing and Data Science) 通讯作者:Alvin Chan(Nanyang Technological University, College of Computing and Data Science, Lee Kong Chian School of Medicine, Centre of AI in Medicine) 作者列表:Wanlong Fang(Nanyang Technological University)、Tianle Zhang(Nanyang Technological University, College of Computing and Data Science)、Wen Tao(Nanyang Technological University, College of Computing and Data Science)、Alvin Chan(Nanyang Technological University, College of Computing and Data Science & Lee Kong Chian School of Medicine & Centre of AI in Medicine) 💡 毒舌点评 本文将部分信息分解(PID)引入多模态决策分析,提出Sensory PID处理三模态问题,框架自身具有新颖的洞察力,并辅以大规模的实验揭示模型的行为剖面。然而,整个分析严重依赖校准掩码近似单模态条件分布,却未对由此引入的估计偏差做严格的理论或实证分析;此外,完全不开源使得其宣称的“诊断与引导训练”对于实践者的即时价值基本为零,复现门槛极高。 ...

2026-07-04 · 更新于 2026-07-30 · 2 min · 389 words