ParaJSCC: A Parameterized Framework for Reusable Multimodal Joint Source-Channel Coding

📄 ParaJSCC: A Parameterized Framework for Reusable Multimodal Joint Source-Channel Coding 标签:#音频编码 #多模态模型 #音视频 #鲁棒性 #高效推理 6.6/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频编码 | #多模态模型 | #音视频 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Kemi Chen(福州大学) 通讯作者:Tiesong Zhao(福州大学) 作者列表:Kemi Chen(福州大学)、Mingkai Chen(南京邮电大学)、Youjia Chen(福州大学)、Qian Liu(大连理工大学)、Wei Gao(北京大学)、Tiesong Zhao(福州大学) 💡 毒舌点评 论文把重复访问的多模态资产服务从按请求编码中抽象出来,问题定义有应用价值,shared-private 渐进参数包、请求感知传输和 break-even 分析是清晰的亮点,实验结果也覆盖图像、音频、触觉三类信号。但作为顶会投稿,核心组件基本是已有范式(INR 实例优化、FiLM、渐进表示、JSCC)的组合式重构;两个数据集规模小,缺少方差/统计检验,没有直接对比最接近的 Implicit-JSCC 类方法,触觉基线多为分离式编码加 16-QAM,音频侧也缺少表面交互音频专用 JSCC 基线,公平性和泛化性支撑不足。此外完全未开源,量化、固定映射和网络细节不透明,使“统一可复用服务框架”的结论偏强。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 669 words

Separate First, Then Associate: A Two-Stage Approach for Real-World Audio-Visual Speech Enhancement

📄 Separate First, Then Associate: A Two-Stage Approach for Real-World Audio-Visual Speech Enhancement 标签:#音视频语音分离 #对比学习 #语音增强 #自监督学习 #音视频 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频语音分离 | #对比学习 | #语音增强 #自监督学习 | arxiv 👥 作者与机构 第一作者:Tongtao Ling(未说明) 通讯作者:未说明 作者列表:Tongtao Ling(未说明)、Zhong-Qiu Wang(未说明) 论文中未提供作者所属机构、实验室或公司信息。 💡 毒舌点评 两阶段“先分离、后关联”是一个务实且有效的工程解耦:把不可靠视觉特征从语音分离前端中剥离,实验结果较官方基线大幅提升,证明了思路在真实录制条件下的可行性。但方法本质仍是现成 TF-GridNet 分离器加 AV-CLIP 相似度匹配器,关联模块对同步偏差、静音段和视觉退化的鲁棒性没有被真正检验;且无代码、无权重、无模型开源,学术纵深和可验证性不足。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 738 words

LoopVSR: A Loop Engineering Framework for Automated Repair of Visual Speech Recognition Inference Pipelines

📄 LoopVSR: A Loop Engineering Framework for Automated Repair of Visual Speech Recognition Inference Pipelines 标签:#音视频语音识别 #大语言模型 #音视频 #多语言 6.6/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频语音识别 | #大语言模型 | #音视频 #多语言 | arxiv 👥 作者与机构 第一作者:Fei Qin(Shanghai Police College, Department of Traffic and Public Security Detention Facilities Administration) 通讯作者:未说明 作者列表: Fei Qin:Shanghai Police College, Department of Traffic and Public Security Detention Facilities Administration Bowen Zhang:Ningbo Artificial Intelligence Institute, Shanghai Jiao Tong University;School of Automation and Intelligent Sensing, Shanghai Jiao Tong University Chao Fan:Ningbo Artificial Intelligence Institute, Shanghai Jiao Tong University;School of Automation and Intelligent Sensing, Shanghai Jiao Tong University Pengcheng Luo:Ningbo Artificial Intelligence Institute, Shanghai Jiao Tong University;School of Automation and Intelligent Sensing, Shanghai Jiao Tong University Genke Yang:Ningbo Artificial Intelligence Institute, Shanghai Jiao Tong University;School of Automation and Intelligent Sensing, Shanghai Jiao Tong University 💡 毒舌点评 这篇工作抓住了一个真实但很窄的工程痛点:VSR 推理链路中,上游 loader 或 detector API 的运行时失败会掩盖下游归一化、ROI、时间采样等质量故障,因此只修首个可见异常不够。LoopVSR 把 LLM 代码代理放进受限工作区,用外部真机推理、失败数+CER 的接受/回滚和隐藏集保护来阻止代理改指标、硬编码标签或换权重,这套审计闭环比一次性代码修复更有说服力。但验证规模小到只有一个 CMLR 系统、20 个开发视频、210 个参考字符;最强基线只是静态规则,完全没有 SWE-agent、AutoCodeRover、RepairAgent 等 LLM-based APR/agent 基线;隐藏集也只是对两个代表性修复做冻结评估,不是对 11 个故障逐一泛化。总的来说,它证明了机制能工作,但还远未证明它比现有代理修复方案更有效或可跨系统部署。 ...

2026-08-17 · 更新于 2026-09-04 · 4 min · 690 words

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

📄 EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory 标签:#音视频问答 #大语言模型 #多模态模型 #音视频 #基准测试 7.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频问答 | #大语言模型 | #多模态模型 #音视频 | arxiv 👥 作者与机构 第一作者:Le Zhang(University of Michigan, Ann Arbor) 通讯作者:未说明 作者列表:Le Zhang(University of Michigan, Ann Arbor)、Ke Sun(University of Michigan, Ann Arbor) 💡 毒舌点评 这项工作把“索引条目本身不完整”和“检索只看语义、不看时间意图”这两个真实瓶颈讲得很清楚。EgoScheme 在写入索引前用局部多模态上下文消解指代和省略,EgoIndex 用动作、活动、言语、对话四个视图做多粒度划分,EgoRetrv 用软时间衰减和双智能体把“last / usually / this morning”从 prompt 修辞变成检索分数,三个基准上的准确率和证据命中率提升也基本连贯,成本账算得漂亮。短板是,它高度依赖 EgoLife 的人工 dense captions、身份先验,以及 GPT-5.4、Gemini-3.1-Pro 等闭源模型,不少领先数字锁定在特定 API 版本和定价结构上;对语音/音频领域读者来说,它仍更接近一个以视频多模态记忆与检索为中心的系统。 ...

2026-08-14 · 更新于 2026-09-04 · 4 min · 777 words

Modeling turn-taking with distant viewing: investigating silence thresholds in human and AI-generated discourse

📄 Modeling turn-taking with distant viewing: investigating silence thresholds in human and AI-generated discourse 标签:#多模态模型 #音视频 #基准测试 #音频理解 #Transformer 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频 | #多模态模型 | #基准测试 #音频理解 | arxiv 👥 作者与机构 第一作者:Taylor Arnold(University of Richmond, Data Science and Statistics) 通讯作者:未说明 作者列表:Taylor Arnold(University of Richmond, Data Science and Statistics)、Nicolas Ballier(Université Paris Cité, ALTAE)、Artem Saloev(Université Paris Cité, ALTAE) 💡 毒舌点评 论文的核心洞察——音频-only的说话人日志化会错误地将视频编辑节奏归因于说话人时序——相当敏锐且具有方法论启示。它成功地将电影/电视研究中的“物质性”概念引入了计算分析。然而,整个研究在实验设计上显得过于“安全”甚至保守,满足于展示现象差异,未能构建起坚实的方法论优势或实践价值:1)未评估核心工具pyannote在其电视语料上的说话人日志化准确性,使得基于错误分割的间隙测量结论根基不稳;2)视觉分析的镜头分类(仅S/M)过于粗糙,未能捕捉更精细的剪辑语法;3)“±0.5秒”窗口的选择缺乏任何理论或消融实验支撑;4)核心结论“编辑节奏主导间隙”可能过度泛化,仅对高度编辑的情景喜剧成立。论文搭建了一个有趣的分析框架,却未能将其打磨成一个可靠的、可被社区验证、复用和推进的基线或工具。 ...

2026-07-21 · 更新于 2026-09-04 · 3 min · 503 words

HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition

📄 HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition 标签:#多任务学习 #多模态模型 #模型集成 #音视频 #音频理解 7.9/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1.5/1.5 ✅ 7.9/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频 | #多任务学习 | #多模态模型 #模型集成 | arxiv 👥 作者与机构 第一作者:Aleksei Bakin 通讯作者:Andrey V. Savchenko (av savchenko@hse.ru) 作者列表:Aleksei Bakin(Sber AI Lab, Moscow, Russia / HSE University, Laboratory of Algorithms and Technologies for Network Analysis, Nizhny Novgorod, Russia)、Andrey V. Savchenko(Central University, Moscow, Russia) 💡 毒舌点评 这篇论文堪称竞赛驱动型工程研究的模范生,它用“冻结主干、精调后处理”的哲学,在ABAW-11挑战赛中打出了极其高效且可复现的成绩单。其系统化地验证了,在有限数据和资源下,投资于预测校准(平滑、偏差、阈值)和智能融合,其收益可能超过盲目增大骨干模型。然而,这种“调参炼丹术”的胜利,掩盖了方法学内核的薄弱:所有后处理技术(高斯平滑、坐标搜索阈值)均为经典技巧的组合,缺乏对“为何有效”的理论洞察或数据驱动发现。论文的结论声称“可媲美更重的端到端方法”,但在MTL任务上,其验证集分数(1.56)并未超越ABAW-7冠军Netease Fuxi(1.53)在相同验证集上的结果,且对比的基线是过时的ConvNeXt,而非最新SOTA;影响力也仅限于ABAW竞赛的窄众圈子,对更广阔的音频/语音研究领域几乎没有方法论层面的启发。 ...

2026-07-15 · 更新于 2026-09-04 · 4 min · 669 words

SAM Audio: Segment Anything in Audio

📄 SAM Audio: Segment Anything in Audio #音频分离 #流匹配 #多模态模型 #基准测试 #音视频 9.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.4/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.4/1.5 🔥 9.2/10 | 前10% | #音频分离 | #流匹配 | #多模态模型 #基准测试 | arxiv 👥 作者与机构 第一作者:Bowen Shi(Meta SuperIntelligence Labs) 通讯作者:Bowen Shi(Meta SuperIntelligence Labs)、Andros Tjandra(Meta SuperIntelligence Labs) 作者列表:Bowen Shi、Andros Tjandra、John Hoffman、Helin Wang、Yi-Chiao Wu、Luya Gao、Julius Richter、Matthew Le、Apoorv Vyas、Sanyuan Chen、Christoph Feichtenhofer、Piotr Dollár、Wei-Ning Hsu、Ann Lee(均来自 Meta SuperIntelligence Labs) 💡 毒舌点评 SAM AUDIO以统一架构首次整合文本、视觉和时间跨度提示,在通用音频分离任务上取得了令人瞩目的SOTA,其精心设计的伪标签数据流水线和大规模评测体系颇具工程借鉴价值。然而,视觉提示的实际表现远逊于文本提示,且整个系统严重依赖大规模预训练和高性能硬件,在实时性或低资源场景下的适用性仍存疑。 ...

2026-07-04 · 更新于 2026-09-04 · 4 min · 651 words

M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

📄 M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition #多模态模型 #自监督学习 #语音识别 #音视频 9/10 | 创新 1.6/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 9/10 | 前25% | #语音识别 | #自监督学习 | #多模态模型 #音视频 | arxiv 👥 作者与机构 作者:Fei Su, Cancan Li, Ming Li, Juan Liu。 机构:武汉大学人工智能学院与计算机科学学院;香港中文大学(深圳)人工智能学院;武汉大学人工智能学院。 💡 毒舌点评 这篇论文工作扎实,动机明确,旨在解决真实世界AVSR中视角变化和模态退化的核心痛点。方法上,将多视角自监督学习(MVL编码器)与细粒度的模态感知融合(同时考虑质量和同步性)相结合,思路清晰且有新意。新发布的AISHELL8-RealScene数据集(室外、多视角)填补了部分空白,实验也较为全面。主要问题在于:1)部分实验对比可能受限于特定设置(如LLM基线未完全对齐训练数据规模),使得“最优”结论需谨慎解读;2)模态感知模块的计算开销和实际部署时的延迟未充分讨论;3)合成多视角数据的真实性和多样性可能限制MVL编码器的泛化上限。总体是一篇达到顶会门槛的工作,但部分细节的论证和工程实践考量有待加强。 📌 核心摘要 本文提出了M2S-AVSR,一个用于鲁棒音视觉语音识别(AVSR)的模态感知多视角自监督表征框架。该框架针对真实场景下常见的视角变化、音频失真和视觉遮挡等问题,主要包含两个核心创新:1)一个多视角表征学习(MVL)编码器,通过结合真实与合成视角的多视角自监督学习策略,学习视角不变的视觉表征;2)一个模态感知融合机制,在解码时显式建模视觉模态质量与跨模态同步性,实现细粒度的自适应信息注入。此外,论文发布了新的公开数据集AISHELL8-RealScene,包含多场景(室内/室外)、多视角的真实世界对话数据,用于建立更贴近现实的基准。在LRS3、MISP2021-AVSR和AISHELL8-RealScene上的实验表明,M2S-AVSR在应对视角扰动和视觉退化时显著优于现有方法,并在MISP2021-AVSR测试集上取得了新的最先进性能。 🔗 开源详情 代码:论文中未提及代码链接。 模型权重:论文中未提及模型权重链接。 数据集:AISHELL8-RealScene。论文中明确声明该数据集公开可用,并提供了具体链接和开源协议。 名称:AISHELL8-RealScene 获取链接:https://huggingface.co/datasets/SMIIP-lab/AISHELL8-RealScene 开源协议:CC BY-NC-SA 4.0 Demo:论文中未提及在线演示链接。 复现材料:论文中未提及完整的复现配置包或检查点下载链接,但提供了详细的实验设置(如网络配置、学习率、批大小、GPU型号等)。 论文中引用的开源项目: Whisper:OpenAI的开源语音识别模型。GitHub: https://github.com/openai/whisper;HuggingFace模型库: https://huggingface.co/openai/whisper-large-v3 AV-HuBERT:Facebook AI Research的音视频自监督表征学习模型。GitHub: https://github.com/facebookresearch/av_hubert LRS3:大规模的视听语音识别数据集。项目主页: https://www.robots.ox.ac.uk/~vgg/data/lip_reading/lrs3.html VoxCeleb2:大规模的视听人物识别数据集。项目主页: https://www.robots.ox.ac.uk/~vgg/data/voxceleb/vox2.html MISP2021-AVSR:多模态远场语音识别挑战赛数据集。项目主页: https://mispchallenge.github.io/ OuluVS2:多视角视听语音数据集。论文中未提供具体链接,但为已知公开数据集。 MUSAN:用于噪声增强的开源噪声数据集。论文中未提供具体链接,但为已知公开数据集。 WPE:加权预测误差法(盲解混响算法)。论文中未提供具体链接,但为已知公开工具。 GSS:引导源分离法。论文中未提供具体链接,但为已知公开工具。 ResNet-18:深度残差网络模型,广泛使用。论文中未提供具体链接,但为已知开源模型。 LLaMA:Meta的大语言模型系列。论文中未提供具体链接,但为已知开源模型。 Fun-ASR:阿里云达摩院的开源语音识别框架。GitHub: https://github.com/modelscope/FunASR FireRed-ASR:论文中提及为LLM-based ASR模型。论文中未提供具体链接。 Qwen3-ASR:论文中提及为LLM-based ASR模型。论文中未提供具体链接。 🏗️ 方法概述和架构 M2S-AVSR的整体框架如图2所示。其核心思想是分别从音频和视觉模态中提取鲁棒表征,并通过模态感知机制在解码器中进行融合。 ...

2026-06-05 · 更新于 2026-09-04 · 1 min · 195 words

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

📄 EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation #音视频 #基准测试 #模型评估 #多模态模型 ✅ 7.1/10 | 前50% | #音视频 | #专家校准VLM评分 | #基准测试 #模型评估 | arxiv 学术质量 5.9/7 | 影响力 1/2 | 可复现性 0.2/2 | 置信度 High 👥 作者与机构 作者:Songlin Yang, Haobin Zhong, Ruilin Zhang, Xiaotong Zhao, Shuai Li, Kai Zheng, Xuyi Yang, Zhe Wang, Zhenchen Tang, Yang Li, Bohai Gu, Zhengwei Peng, Yidan Huang, Mengzhou Luo, Yihang Bo, Dalu Feng, Yujia Zhang, Juntao Ma, Ruiqi Wang, Lvmin Zhang, Yuwei Guo, Frank Guan, Maneesh Agrawala, Hongbo Fu, Alan Zhao, Anyi Rao. 机构:香港科技大学,腾讯,清华大学,中国科学院自动化研究所,北京电影学院,斯坦福大学,香港中文大学,新加坡技术设计大学。 ...

2026-05-25 · 更新于 2026-09-04 · 3 min · 454 words

CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation

📄 CounterFlow: A Two-Phase Inference-Time Sampling for Counterfactual Video Foley Generation #音频生成 #流匹配 #音视频 #生成模型 #模型评估 🔥 8.7/10 | 前50% | #音频生成 | #流匹配 | #音视频 #生成模型 | arxiv 学术质量 5.6/7 | 影响力 1.5/2 | 可复现性 1.6/2 | 置信度 高 👥 作者与机构 第一作者:Gyubin Lee(Kim Jaechul Graduate School of AI, KAIST) 通讯作者:未明确说明(论文中作者列表无明确标注,但通常最后一位作者为通讯作者) 作者列表:Gyubin Lee(Kim Jaechul Graduate School of AI, KAIST)、Junwon Lee(Kim Jaechul Graduate School of AI, KAIST)、Juhan Nam(Kim Jaechul Graduate School of AI, KAIST;Graduate School of Cultural Technology, KAIST) 💡 毒舌点评 亮点:论文精准定义了“反事实视频拟音”这一具体且有工业需求的任务,并提出了一个无需重新训练、仅在推理时操作的轻量级解决方案。核心的两阶段采样设计思路清晰,分解引导公式(Eq.1)有效对抗视觉主导问题,实验在精心构建的冲突数据集上明确证明了其优越性。短板:实验的基线对比虽然包含了SOTA方法(CAFA),但本质上仍是现有技术组件的巧妙组合,缺乏在模型架构或训练范式上的根本创新。对“视觉特征如何编码声音身份信息”这一核心假设的分析主要依赖间接证据(消融实验),缺乏更深入的探讨。 ...

2026-05-21 · 更新于 2026-09-04 · 2 min · 401 words