How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures

📄 How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures 标签:#音频伪造检测 #CNN #模型评估 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.3/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频伪造检测 | #CNN | #模型评估 | arxiv 👥 作者与机构 第一作者:Fernando Garcia de la Cruz(未说明) 通讯作者:未说明 作者列表:Fernando Garcia de la Cruz(未说明)、David López-Ayala(未说明)、Pablo Zinemanas(未说明)、Emilio Molina(未说明)、Martín Rocamora(未说明) 💡 毒舌点评 将"AI音乐检测"从二元判断推向连续能量比回归,并用EnCodec伪影构造可控混合数据,问题意识和方法论都切中混合音乐生产的真实需求。可惜"AI stem"只是codec重建而非真实生成器输出,实验完全在自建pipeline中闭环,回归模型也仅是同一CNN换了输出头,距离部署级检测系统还差一次跨生成器的验证与模型校准。 ...

2026-08-10 · 更新于 2026-08-14 · 2 min · 348 words

LSEAD: A Privacy-Preserving LLM-Based Speech Analysis Framework for Early Alzheimer's Disease Screening

📄 LSEAD: A Privacy-Preserving LLM-Based Speech Analysis Framework for Early Alzheimer’s Disease Screening 标签:#医疗音频 #大语言模型 #语音识别 #自监督学习 6.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.6/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音识别 | #大语言模型 | #医疗音频 #自监督学习 | arxiv 👥 作者与机构 Xin Wang:Saskatchewan Polytechnic,Faculty of Digital Innovation, Arts & Sciences Yingchao Huang(通讯作者):Saskatchewan Polytechnic,Faculty of Digital Innovation, Arts & Sciences Yuhan Su:河北大学,基础医学院 Shanshan Yao:阿尔伯塔大学,土木与环境工程系及采矿与石油工程学院 Wei Peng:里贾纳大学,工程与应用科学学院 💡 毒舌点评 论文整体像一篇“把积木拼起来”的工程报告:取来开源的Zephyr-7B-β做嵌入、PCA降个维,再用经典分类器一顶,冠以“Privacy-Preserving”之名便宣称框架创新。故事讲得比技术本身漂亮。所谓“至少5%提升”其实只在单次分割的独立测试集上较Mortensen et al.(84.9%)高出5.1个百分点;PCA被称作提升稳定性的核心组件,却连一张“有PCA vs. 无PCA”的数值消融表都拿不出来。MMSE分层分析说“对早期检测更敏感”,实际上只是画了两张直方图,未做任何统计检验,结论全靠肉眼。宣称“本地部署保护隐私”,却又在开源详情里只留一个“将在未来提供”的GitHub占位链接。作为临床筛查的可行性验证尚可阅读;作为一篇标榜方法创新的论文,其技术增量与严谨性均显薄弱。 ...

2026-08-10 · 更新于 2026-08-14 · 2 min · 233 words

MI-MIDI: Mechanistic Interpretability of Text-to-MIDI Generation Models via Probing, Lenses and Steering

📄 MI-MIDI: Mechanistic Interpretability of Text-to-MIDI Generation Models via Probing, Lenses and Steering 标签:#音乐生成 #自回归模型 #可解释性 #模型评估 7.1/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐生成 | #自回归模型 | #可解释性 #模型评估 | arxiv 👥 作者与机构 第一作者:Jakub Poćwiardowski(华沙理工大学计算机科学研究所) 第二作者:Mateusz Modrzejewski(华沙理工大学计算机科学研究所) 通讯作者:论文未标注通讯作者 💡 毒舌点评 这篇工作把线性探针、logit/tuned lens、activation patching 和 steering 成套搬到文本到 MIDI 的符号音乐生成模型上,跨模型对比和双向干预分解是明显亮点,确实补了一个此前空白的方向。但它本质上是成熟可解释性工具的领域迁移与组合,且“架构决定预测形成方式”的核心判断建立在每种架构只有一个模型的基础上,无法排除分词、预训练数据和条件注入方式的混杂,作为因果结论仍然偏弱。更有经验的研究者会期待至少一个同架构不同 tokenizer/conditioning 的对照,或对 steering 方向做随机方向基线。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 834 words

MMAG: A Multi-Control Mixed Audio Generation Benchmark

📄 MMAG: A Multi-Control Mixed Audio Generation Benchmark 标签:#音频生成 #大语言模型 #基准测试 #数据集 #模型评估 6.8/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音频生成 | #大语言模型 | #基准测试 #数据集 | arxiv 👥 作者与机构 第一作者:Zihao Zheng(上海交通大学 MoE 人工智能重点实验室 / X-LANCE 实验室;上海人工智能实验室) 通讯作者:Mengyue Wu(上海交通大学 MoE 人工智能重点实验室 / X-LANCE 实验室) 其他作者:Xuenan Xu(上海人工智能实验室)、Jiahao Mei(上海交通大学 X-LANCE 实验室)、Yixuan Li(上海交通大学 X-LANCE 实验室;上海人工智能实验室)、Minghao Lv(上海交通大学 X-LANCE 实验室)、Wen Wu(上海人工智能实验室)、Chao Zhang(上海人工智能实验室) 💡 毒舌点评 MMAG 踩中了“混合音频生成缺少统一多控制评测基准”这个真实空缺,3,974 条主集、691 条 voice cloning 子集、约 1,828 条 timestamp 子集以及声学/语音/语义/时间四维评测协议都有实际参考价值。但作为 benchmark 论文,正文始终没有给出数据集或评测脚本的明确下载路径,只有项目主页;标注质量仅用“约 90% 抽查通过率”概括,未提供标注者间一致性或错误类型分布。更关键的是,所有模型在 timestamp 控制上都接近“弱可控”,AuDirector 最高也只有 SpeechF1=0.72、SoundF1=0.57。因此 MMAG 目前更像一个诊断工具,而不是一个能直接下载复现的公共评测资产。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 743 words

Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing

📄 Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing 标签:#语音编辑 #扩散模型 #音频修复 #Transformer #零样本 7.3/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音编辑 | #扩散模型 | #音频修复 #Transformer | arxiv 👥 作者与机构 第一作者:Iftach Shoham(Ben-Gurion University of the Negev)与 Tali Dror(Ben-Gurion University of the Negev),论文标注为共同一作 作者列表:Iftach Shoham、Tali Dror、Oren Gal(University of Haifa)、Haim Permuter(Ben-Gurion University of the Negev)、Gilad Katz(Ben-Gurion University of the Negev)、Eliya Nachmani(Ben-Gurion University of the Negev) 通讯作者:未说明 💡 毒舌点评 把 RVQ 码本的粗到细层级显式编码进离散扩散的条件因子化,是比直接 flatten 所有码本更贴合语音 codec 结构的建模选择;代码仓库也给了。但语音编辑任务上相对 VoiceCraft 的 WER 只从 0.124 降到 0.121,差距几乎落在标准差范围内;实验只用了 RealEdit 一个基准,没有对比任何扩散/流匹配类非自回归方法,也没有人工听感评测。修复任务在短 gap 上的 MCD 优势很突出,但整体说服力仍配不上方法设计的优雅度。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 842 words

Objects as Audio-Visual Modal Sound Fields

📄 Objects as Audio-Visual Modal Sound Fields 标签:#音频生成 #多模态模型 #自监督学习 7.6/10 | 创新 1.4/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频生成 | #多模态模型 | #自监督学习 | arxiv 👥 作者与机构 共同一作:Zisen Shao(马里兰大学)、Zihao Wei(马里兰大学),论文脚注标注 “Equal contribution” 作者列表:Zisen Shao、Zihao Wei、Derong Jin、Ruohan Gao(马里兰大学,College Park) 通讯作者:未标注 💡 毒舌点评 把视觉语义先验注入模态声场重建,方向聪明,实验也比一般短文扎实:两个真实数据集、四组消融、非对称子集案例、甚至补了 N-shot 和输入视图数扫描。但审稿人不能忽略两个硬伤:第一,在 ObjectFolder Real 完整数据集上,KNN 的 L1 Log(0.930)实际上好于本方法(0.951),“显著优于强基线"这个结论只在部分指标上成立;第二,论文明确写"对每个物体运行 single-damping 和 spatial-damping 两个变体,根据 ENV 指标选最好的模型”——这是在测试集上做模型选择,所报数字存在系统性高估。代码仓库藏在项目主页里,正文连链接都不给,开源姿态不够大方。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 729 words

SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation

📄 SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation 标签:#语音合成 #自回归模型 #歌唱生成 #流匹配 #零样本 7.0/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音合成 | #自回归模型 | #歌唱生成 #流匹配 | arxiv 👥 作者与机构 第一作者:Hanke Xie(机构编号 1/2,机构名称未说明;论文脚注标注实习期间于 Soul AI Lab 完成部分工作) 共同第一作者:Haopeng Lin(机构编号 2,机构名称未说明) 通讯作者:Lei Xie(机构编号 1)、Xinsheng Wang(机构编号 2) 作者列表: Hanke Xie Haopeng Lin Jiale Qian Dake Guo Yuepeng Jiang Zhichao Wang Wenxiao Cao Jingbin Hu Guobin Ma Wenhao Li Huakang Chen Chengyou Wang Ming Tao Zhonghua Fu Lei Xie Xinsheng Wang 机构名称未在论文中说明;仅能从编号区分两组机构。 💡 毒舌点评 把离散语义 token 当作“训练期状态锚点”而不是“推理期生成目标”,这个定位确实比连续特征对齐更干净:它不要求隐藏状态复刻 teacher 表示的完整几何,只要求状态能够线性分类出语义类别。但论文的最强系统对比并不与受控消融完全同条件:系统级模型改用 120K 小时联合 TTS-SVS 训练且使用 Anchor@24,而受控消融默认 Anchor@32。VoxCPM2 在 Seed-TTS-Eval 中文硬子集上仍以 8.13 CER / 0.753 SIM 同时压过 SemBridge 的 9.79 CER / 0.717 SIM,说明 SemBridge 的价值更多在于“用更小模型获得有竞争力的内容-音色平衡”,而不是全面 SOTA。 ...

2026-08-10 · 更新于 2026-08-14 · 5 min · 1046 words

Separating Decision-Rule Misalignment from Readout-Coverage Limitations in Speech Language Models

📄 Separating Decision-Rule Misalignment from Readout-Coverage Limitations in Speech Language Models 标签:#语音情感识别 #语音大模型 #模型评估 #可解释性 6.8/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音情感识别 | #语音大模型 | #模型评估 #可解释性 | arxiv 👥 作者与机构 第一作者:Linkai Peng(University of Connecticut, Institute for the Brain and Cognitive Sciences) 第二作者:Baorian Nuchged(University of Texas at Austin, Department of Linguistics) 通讯作者:未说明 💡 毒舌点评 论文的最大价值在于把“生成准确率低”拆成可定位的接口故障,而不是笼统归因于模型能力不足。诊断阶梯本身设计严谨,logit 校正和最小配对干预也确实把“信息可用”与“信息被使用”分开了。但全篇没有作者提供的代码、模型或数据产物,实验又局限在英文表演情感语料的四分类单选题上,外部研究者想把这套框架搬到自己的模型和语料上,几乎需要从头实现一遍。作为一篇方法研究,这种封闭性很伤可信度和实际影响力。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 650 words

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

📄 Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation 标签:#音视频交互 #大语言模型 #多模态模型 5.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.3/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 📝 5.7/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音视频交互 | #大语言模型 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Ziyun Xu(Meta Platforms, Menlo Park, California, USA) 通讯作者:未说明(论文未标注通讯作者) 作者列表:Ziyun Xu(Meta Platforms)、Bosen Ding(Meta Platforms)、Yue Zhang(Meta Platforms)、Ji Qi(Meta Platforms)、Qingyuan Song(Meta Platforms)、Jizhou Huang(Meta Platforms)、Liwei Wang(Meta Platforms)、Jeffrey Santelli(Meta Platforms)、Yue Weng(Meta Platforms)、Qichao Que(Meta Platforms)、Zhenheng Yang(Meta Platforms)、Junfeng Pan(Meta Platforms)、Linhong Zhu(Meta Platforms) 💡 毒舌点评 用真实生产流量完成了闭环验证,76.02%的上下文感知Pill使用率与“Pills Only vs Full System”的在线消融,把“界面收集信号”和“服务流执行信号”拆得足够干净。但整篇论文在可复现性上近乎封闭:α/τ取值缺失、Semantic Profile的schema缺失、prompt模板缺失;更关键的是,LLM-as-a-Judge不仅用于SFT标注,还参与了DPO偏好对构造和离线评估集的构建,独立人工集只有1029条,循环评估风险并未真正消除。真正值得行业关注的是“减少政治类短剧”这类实时负向约束能在工业线上生效,这本身就是对被动行为表征的一次清晰否定——可惜论文没有把负向约束如何编码进列表式打分和剪枝的细节讲透。 ...

2026-08-10 · 更新于 2026-08-14 · 2 min · 413 words

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

📄 StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding 标签:#多模态模型 #大语言模型 #基准测试 7.6/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.3/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #多模态模型 | #大语言模型 | #基准测试 | arxiv 👥 作者与机构 第一作者:Xichen Zhang(The Hong Kong University of Science and Technology; Xiaohongshu Inc.) 通讯作者:未说明 作者列表:Xichen Zhang(The Hong Kong University of Science and Technology; Xiaohongshu Inc.)、Guankai Li(Xiaohongshu Inc.)、Yinghao Zhu(The University of Hong Kong)、Shijian Wang(Xiaohongshu Inc.)、Sitong Wu(The Chinese University of Hong Kong)、Shaozuo Yu(The Chinese University of Hong Kong)、Meng Chu(The Hong Kong University of Science and Technology)、Yuan Lu(Xiaohongshu Inc.)、Jiaya Jia(The Hong Kong University of Science and Technology) 💡 毒舌点评 把流式视频评测从短视频/选择题推向“小时级+开放问答+主动监测”,并给出前端/后端两层 worker 的系统方案,工程量和开放材料都很完整,这是明显亮点。但系统级比较的核心结论被骨干规模差异污染:StreamMind 用 Qwen3.5-397B-A17B 对比多个 3B/7B/8B 流式基线,且没有组件消融,因此“架构带来增益”的归因并不牢靠。Tool 的 228.1% 相对提升只建立在 MiniCPM-o 17.1% 的弱基准上,绝对准确率仍与人类参考 95.2% 差距巨大,不能据此宣称工具调用能力已接近实用。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 759 words