Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

📄 Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation 标签:#音视频交互 #大语言模型 #多模态模型 5.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 📝 5.7/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频交互 | #大语言模型 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Ziyun Xu(Meta Platforms, Menlo Park, California, USA) 通讯作者:未说明(论文未标注通讯作者) 作者列表:Ziyun Xu(Meta Platforms)、Bosen Ding(Meta Platforms)、Yue Zhang(Meta Platforms)、Ji Qi(Meta Platforms)、Qingyuan Song(Meta Platforms)、Jizhou Huang(Meta Platforms)、Liwei Wang(Meta Platforms)、Jeffrey Santelli(Meta Platforms)、Yue Weng(Meta Platforms)、Qichao Que(Meta Platforms)、Zhenheng Yang(Meta Platforms)、Junfeng Pan(Meta Platforms)、Linhong Zhu(Meta Platforms) 💡 毒舌点评 用真实生产流量完成了闭环验证,76.02%的上下文感知Pill使用率与“Pills Only vs Full System”的在线消融,把“界面收集信号”和“服务流执行信号”拆得足够干净。但整篇论文在可复现性上近乎封闭:α/τ取值缺失、Semantic Profile的schema缺失、prompt模板缺失;更关键的是,LLM-as-a-Judge不仅用于SFT标注,还参与了DPO偏好对构造和离线评估集的构建,独立人工集只有1029条,循环评估风险并未真正消除。真正值得行业关注的是“减少政治类短剧”这类实时负向约束能在工业线上生效,这本身就是对被动行为表征的一次清晰否定——可惜论文没有把负向约束如何编码进列表式打分和剪枝的细节讲透。 ...

2026-08-10 · 更新于 2026-08-14 · 2 min · 413 words

EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot

📄 EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot 标签:#音视频交互 #大语言模型 #语音合成 #语音情感识别 #多模态模型 7.1/10 | 创新 1.1/2 | 严谨 0.9/1.5 | 实验 0.7/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.1/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频交互 | #大语言模型 | #语音合成 #语音情感识别 | arxiv 👥 作者与机构 第一作者:Jie Yang(新加坡国立大学,National University of Singapore) 通讯作者:Hao Fei(牛津大学,University of Oxford;论文中标注为 Corresponding author) 作者列表:Jie Yang(新加坡国立大学)、Wenhao Xu(新加坡国立大学)、Shuhui Lin(清华大学,Tsinghua University)、Hao Fei(牛津大学,University of Oxford) 💡 毒舌点评 把 ASR/SER/TTS/3DGS 这些开源模块用 LLM 编排成一个可运行的 empathetic avatar 系统,工程完成度和开源诚意值得肯定,尤其在“Response Planning”将情感意图显式传给语音和渲染模块这一点上设计清晰。但论文把“Tri-Agent”和“Response Planning”讲得很重,实际更像分层提示词与 JSON 合约,实验也没有对这两项做任何组件消融;45.8 秒的平均端到端延迟更让它离“live chatbot”还有实质性距离。整体是一个有价值的工程基线和测试平台,但不是论文所暗示的智能突破。 ...

2026-08-06 · 更新于 2026-08-14 · 5 min · 1043 words

Do Visual Features Improve Other-Initiated Repair Detection? A Dyadic Multimodal Approach

📄 Do Visual Features Improve Other-Initiated Repair Detection? A Dyadic Multimodal Approach 标签:#音视频交互 #多模态模型 #音频理解 #Transformer #模型评估 5.9/10 | 创新 1.2/2 | 严谨 0.9/1.5 | 实验 0.7/1.5 | 清晰 0.7/1 | 影响 0.7/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.4/1.5 📝 5.9/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频交互 | #多模态模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Anh Ngo(ALMAnaCH, INRIA Paris; ISIR, Sorbonne University, Paris, France) 通讯作者:未说明 作者列表:Anh Ngo(ALMAnaCH, INRIA Paris; ISIR, Sorbonne University)、Nicolas Rollet(ALMAnaCH, INRIA Paris; Télécom Paris, SES, Institut Polytechnique de Paris, I3-CNRS)、Catherine Pelachaud(CNRS, ISIR, Sorbonne University)、Chloé Clavel(ALMAnaCH, INRIA Paris; Télécom Paris, LTCI, Institut Polytechnique de Paris) 💡 毒舌点评 这篇论文做了一件对话分析和计算语言学早该有人做的事:把视觉行为系统地编码进OIR检测模型。特征工程有CA理论底子,不是拍脑袋凑的。但致命伤是数据规模——47个OIR正例,配上30多个特征、三窗口拆分和Transformer编码器,这是标准的"用小数据玩深度学习"高危操作。分类F1标准差13.2个百分点,说明模型在不同fold上表现像过山车,核心主张"视觉特征有用"的统计基础有多脆弱,各位自行判断。跨语料分析发现了场景依赖性,总算贡献了点insight,但整体仍是个理论驱动的小规模概念验证,离"对话系统可用模块"这条线还差得远。 ...

2026-07-28 · 更新于 2026-08-14 · 2 min · 387 words

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

📄 FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications 标签:#端到端 #音视频生成 #音视频交互 #高效推理 #音频理解 7.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音视频生成 | #端到端 | #音视频交互 #高效推理 | arxiv 👥 作者与机构 第一作者:Krish Agarwal(Carnegie Mellon University, Infini-AI-Lab) 通讯作者:Beidi Chen(Carnegie Mellon University, Infini-AI-Lab) 作者列表:Krish Agarwal(Carnegie Mellon University, Infini-AI-Lab)、Zhuoming Chen(Carnegie Mellon University, Infini-AI-Lab)、Yanyuan Qin(AMD)、Zhenyu Gu(AMD)、Atri Rudra(University at Buffalo)、Beidi Chen(Carnegie Mellon University, Infini-AI-Lab) 💡 毒舌点评 这篇论文的亮点在于其巧妙的系统设计,将AI代理作为编排者,解决多模态应用部署的NP难题,方法新颖且实验结果令人印象深刻(如~70x延迟降低)。但短板同样明显:其性能高度依赖昂贵的顶级推理模型(Claude Opus 4.8),且对模型内部优化(如算子融合、内核优化)基本无能为力,本质上是“用一个黑盒AI代理去编排其他黑盒模型的部署”,工程鲁棒性和可预测性存疑。对于语音/音频领域的读者,此工作的核心贡献(自动化部署框架)是系统层面的,不直接解决算法或建模问题,实用价值有限。 ...

2026-07-21 · 更新于 2026-08-14 · 3 min · 524 words

Vidu S1: A Real-Time Interactive Video Generation Model

📄 Vidu S1: A Real-Time Interactive Video Generation Model 标签:#音视频交互 #扩散模型 #多模态模型 #语音识别 #音频理解 5.2/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 📝 5.2/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频交互 | #扩散模型 | #多模态模型 #语音识别 | arxiv 👥 作者与机构 作者列表:Jintao Zhang, Kai Jiang, Jintao Chen, et al. 机构信息:论文摘要中未提供任何机构信息,无法确认作者所属机构,均写为“未说明”。 💡 毒舌点评 这篇所谓的“论文”更像一份精心包装的产品技术白皮书,而非严谨的学术贡献。它成功地将一个具有巨大应用潜力的系统(实时语音驱动数字人)推向市场,但代价是完全牺牲了学术论文的基本准则:透明性与可复现性。通篇充斥着性能声明(如“最佳性能”、“42FPS”),却吝啬于提供任何可验证的数据、对比基线或技术细节。其核心组件“TurboDiffusion”和“TurboServe”被当作营销黑话而非可理解的算法,这使得整个工作沦为一个无法被学术界学习、验证和跟进的黑箱。审稿人只能为其在应用前景和工程集成度上鼓掌,但必须因其对科学可验证性的漠视而给予严厉的批评。 📌 核心摘要 本文介绍了Vidu S1,一个声称支持通过语音指令实时控制数字角色、并生成无限长度高质量视频的交互式系统。该系统基于名为“TurboDiffusion”的生成模型和“TurboServe”的推理服务框架构建。论文宣称其能在普通消费级GPU上实现540p分辨率下高达42FPS的实时生成,解决了长时间视频生成中常见的模糊、漂移和视觉失真问题。此外,系统支持用户上传自定义角色图像并选择语音音色以实现个性化。论文声称实验表明Vidu S1在所有测试指标上均达到最佳性能,并提供了一个在线Demo。然而,摘要中未提供任何关于具体实验指标、数值、对比基线、模型架构细节或训练方法的信息,其所有技术声明均缺乏证据支撑。 ...

2026-07-10 · 更新于 2026-08-14 · 1 min · 203 words

Wan-Streamer v0.2: Higher Resolution, Same Latency

📄 Wan-Streamer v0.2: Higher Resolution, Same Latency #音视频交互 #流匹配 #实时处理 #流式处理 5.4/10 | 创新 1/2 | 严谨 0.6/1.5 | 实验 0.5/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.2/0.5 | 工程 1.2/1.5 📝 5.4/10 | 后50% | #音视频交互 | #流匹配 | #实时处理 #流式处理 | arxiv 👥 作者与机构 第一作者/核心贡献者:Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou(均为Alibaba Group) 通讯作者:未说明 贡献者(按名字首字母排序):Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi(均为Alibaba Group) 机构:Alibaba Group,具体部门未说明 💡 毒舌点评 这篇技术报告以一份清晰的工程蓝图,展示了如何在不碰模型formulation、不增加用户感知延迟的前提下,将实时音视频交互的分辨率从192p拉到640p。Thinker-Performer的部署拓扑拆分、Ulysses并行的流式应用,设计简洁且动机明确,对于要堆硬件保延迟的工业系统有直接参考价值。然而,作为一份声称“升级”的报告,它竟然完全没有提供任何定量对比结果——没有与v0.1的视觉质量数值比较、没有消融实验、没有用户研究,甚至连生成样本的客观指标都没有。整篇论文的证据链仅靠“定性观察”和一张部署架构图支撑,这使其科学说服力无限趋近于零。更糟糕的是,所有训练策略、模型配置、超参数等复现关键信息全部缺失,这将论文的定位从“研究”进一步推向“产品发布简报”。一句话总结:工程思路清晰,科学验证缺席。 ...

2026-07-07 · 更新于 2026-08-14 · 2 min · 381 words

语音/音乐/音频论文速递 2026-07-06

语音/音乐/音频论文速递 2026-07-06 共分析 1 篇论文 ⚡ 今日概览 📥 抓取 1 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音视频交互 1篇 █ 📊 论文评分排行榜(1 篇,按分数降序) 排名 论文 总分 分档 主任务 🥇 VisionAId: An Offline-First Multimodal Android Assistan 6.6分 前50% #音视频交互 📋 论文列表 🥇 VisionAId: An Offline-First Multimodal Android Assistant for People with Visual Impairment, Featuring Personalized Object Retrieval 6.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.5/1.5 | 清晰 0.8/1 | 影响 0.3/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 ...

2026-07-06 · 更新于 2026-08-14 · 1 min · 157 words