Frame-Level Pansori Mode Classification with Complementary Audio Representations

📄 Frame-Level Pansori Mode Classification with Complementary Audio Representations 标签:#音乐理解 #模型集成 #数据集 #基准测试 7.6/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.6/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音乐理解 | #模型集成 | #数据集 #基准测试 | arxiv 👥 作者与机构 第一作者:Sangheon Park(机构未说明) 通讯作者:未说明 作者列表:Sangheon Park(未说明)、Seonguk Ju(未说明)、Suin Chung(未说明)、Danbinaerin Han(未说明)、Dasaem Jeong(未说明) 💡 毒舌点评 把长期被 MIR 忽视的韩国传统说唱体裁做成 46 小时帧级标注加多表征框架,数据与双划分协议是实打实的贡献,跨模态分歧分析也有音乐学说服力;但集成模型在更严苛的 Work-level Split 下打不过单一 Mel 特征,且标注只由一位专家完成、缺少信度统计,再加上模型权重未公开,整体叙事只能算“有洞察的基准工作”而非“高精度系统”。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 674 words

MMAG: A Multi-Control Mixed Audio Generation Benchmark

📄 MMAG: A Multi-Control Mixed Audio Generation Benchmark 标签:#音频生成 #大语言模型 #基准测试 #数据集 #模型评估 6.8/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.8/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音频生成 | #大语言模型 | #基准测试 #数据集 | arxiv 👥 作者与机构 第一作者:Zihao Zheng(上海交通大学 MoE 人工智能重点实验室 / X-LANCE 实验室;上海人工智能实验室) 通讯作者:Mengyue Wu(上海交通大学 MoE 人工智能重点实验室 / X-LANCE 实验室) 其他作者:Xuenan Xu(上海人工智能实验室)、Jiahao Mei(上海交通大学 X-LANCE 实验室)、Yixuan Li(上海交通大学 X-LANCE 实验室;上海人工智能实验室)、Minghao Lv(上海交通大学 X-LANCE 实验室)、Wen Wu(上海人工智能实验室)、Chao Zhang(上海人工智能实验室) 💡 毒舌点评 MMAG 踩中了“混合音频生成缺少统一多控制评测基准”这个真实空缺,3,974 条主集、691 条 voice cloning 子集、约 1,828 条 timestamp 子集以及声学/语音/语义/时间四维评测协议都有实际参考价值。但作为 benchmark 论文,正文始终没有给出数据集或评测脚本的明确下载路径,只有项目主页;标注质量仅用“约 90% 抽查通过率”概括,未提供标注者间一致性或错误类型分布。更关键的是,所有模型在 timestamp 控制上都接近“弱可控”,AuDirector 最高也只有 SpeechF1=0.72、SoundF1=0.57。因此 MMAG 目前更像一个诊断工具,而不是一个能直接下载复现的公共评测资产。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 743 words

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

📄 StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding 标签:#多模态模型 #大语言模型 #基准测试 7.6/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.3/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.6/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #多模态模型 | #大语言模型 | #基准测试 | arxiv 👥 作者与机构 第一作者:Xichen Zhang(The Hong Kong University of Science and Technology; Xiaohongshu Inc.) 通讯作者:未说明 作者列表:Xichen Zhang(The Hong Kong University of Science and Technology; Xiaohongshu Inc.)、Guankai Li(Xiaohongshu Inc.)、Yinghao Zhu(The University of Hong Kong)、Shijian Wang(Xiaohongshu Inc.)、Sitong Wu(The Chinese University of Hong Kong)、Shaozuo Yu(The Chinese University of Hong Kong)、Meng Chu(The Hong Kong University of Science and Technology)、Yuan Lu(Xiaohongshu Inc.)、Jiaya Jia(The Hong Kong University of Science and Technology) 💡 毒舌点评 把流式视频评测从短视频/选择题推向“小时级+开放问答+主动监测”,并给出前端/后端两层 worker 的系统方案,工程量和开放材料都很完整,这是明显亮点。但系统级比较的核心结论被骨干规模差异污染:StreamMind 用 Qwen3.5-397B-A17B 对比多个 3B/7B/8B 流式基线,且没有组件消融,因此“架构带来增益”的归因并不牢靠。Tool 的 228.1% 相对提升只建立在 MiniCPM-o 17.1% 的弱基准上,绝对准确率仍与人类参考 95.2% 差距巨大,不能据此宣称工具调用能力已接近实用。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 759 words

语音/音乐/音频论文速递 2026-08-10

语音/音乐/音频论文速递 2026-08-10 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音情感识别 2篇 ██ #音乐理解 2篇 ██ #音频伪造检测 2篇 ██ #音频生成 2篇 ██ #多模态模型 1篇 █ #歌唱生成 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 How Much AI Is in This Track? Quantifying the Proportio 8.3分 前25% 方法研究 #音频伪造检测 🥈 Objects as Audio-Visual Modal Sound Fields 7.6分 前25% 方法研究 #音频生成 🥉 StreamArena: Toward Continuous, Interactive, and Long-H 7.6分 前25% 数据集与基准 #多模态模型 4. Frame-Level Pansori Mode Classification with Complement 7.6分 前25% 数据集与基准 #音乐理解 5. Multi Codec Discrete Diffusion Model for Text Guided Sp 7.3分 前50% 方法研究 #语音编辑 6. MI-MIDI: Mechanistic Interpretability of Text-to-MIDI G 7.1分 前50% 方法研究 #音乐生成 7. SemBridge: Semantic Token Anchoring for Continuous-Late 7.0分 前50% 方法研究 #语音合成 8. Do Audio Language Models Use Paralinguistic Evidence? C 6.9分 前50% 数据集与基准 #语音情感识别 9. Separating Decision-Rule Misalignment from Readout-Cove 6.8分 前50% 方法研究 #语音情感识别 10. MMAG: A Multi-Control Mixed Audio Generation Benchmark 6.8分 前50% 数据集与基准 #音频生成 11. Assessing AI-generated music detection in real-world br 6.8分 前50% 数据集与基准 #音频伪造检测 12. LSEAD: A Privacy-Preserving LLM-Based Speech Analysis F 6.6分 前50% 系统技术报告 #语音识别 13. Cloud-Boosted Low-Compute Multi-Channel Speech Enhancem 6.0分 前50% 方法研究 #语音增强 14. Shape Your Feed: An LLM-based Agentic System for Conver 5.7分 前50% 系统技术报告 #音视频交互 15. From Prompting to Describing: A Cross-Cultural Study of 5.5分 前50% 应用研究 #音乐理解 16. Beyond Call and Response: Modelling Reciprocal Coordina 5.5分 前50% 方法研究 #歌唱生成 📋 论文列表 🥇 How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-10 · 更新于 2026-08-14 · 14 min · 2864 words

AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks

📄 AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks 标签:#语音伪造检测 #基准测试 #语音合成 #语音转换 #音频理解 8.4/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.4/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #语音伪造检测 | #基准测试 | #语音合成 #语音转换 | arxiv 👥 作者与机构 第一作者:Aurosweta Mahapatra(Johns Hopkins University) 通讯作者:Berrak Sisman(Johns Hopkins University) 作者列表:Aurosweta Mahapatra(Johns Hopkins University)、Xiutian Zhao(Johns Hopkins University)、Shreeram Suresh Chandra(Johns Hopkins University)、Zihan Zhang(Johns Hopkins University)、Zongyang Du(Johns Hopkins University)、Ismail Rasim Ulgen(Johns Hopkins University)、Kong Aik Lee(Hong Kong Polytechnic University)、Nicholas Andrews(Johns Hopkins University)、Carlos Busso(Carnegie Mellon University)、Berrak Sisman(Johns Hopkins University) 💡 毒舌点评 AffectDF 在情感伪造攻击的覆盖广度上确实做出了有分量的贡献:21种攻击、约260小时、五种情绪、同时含表演性与自发性语音,直接填补了现有情感伪造基准规模小、攻击范式单一的空白。但训练集仅有4个说话人、LALM微调只验证了Voxtral一个模型、所有EER均为点估计且无置信区间,基准的"全面性"尚未完全转化为结论的"稳健性"。更关键的是,“情感训练无法一致提升跨域鲁棒性"这一核心反直觉发现主要建立在少数模型的行为分歧之上,论文未能说明训练数据变化为何会反转表演/自发风格的难度方向。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 805 words

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

📄 Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset 标签:#音乐转录 #Transformer #预训练 #数据集 #基准测试 7.7/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音乐转录 | #Transformer | #预训练 #数据集 | arxiv 👥 作者与机构 第一作者:Eoin Cummins(University College Dublin) 通讯作者:Yaolong Ju(Great Bay University),电子邮箱:juyaolong@gbu.edu.cn 作者列表:Eoin Cummins(University College Dublin)、Zhongyi Huang(Guangxi Normal University)、Alexandre D’Hooge(Great Bay University)、Zhuoro Mo(Shenzhen University)、Yaolong Ju(Great Bay University) 💡 毒舌点评 SheetSage-A2S 数据集本身是 A2S 走向流行音乐真实录音的重要资产,61 小时、9,468 个片段的规模填补了该方向的数据空白;但模型侧本质是“换预训练编码器 + 扩大 FFN + 数据增强”的组合,实验虽然完整,却既未量化 MuQ 预训练数据与评估集的潜在重叠,也未与 MERT/MusicFM 等其他音乐基础模型做公平对比,因此“MuQ 是合适选择”的结论仍缺乏足够说服力。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 717 words

C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

📄 C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models 标签:#音视频问答 #多模态模型 #基准测试 #数据集 #可解释性 5.5/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.5/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 📝 5.5/10 | 前50% | 文档类型:数据集与基准 | 评分置信度:中 | #音视频问答 | #多模态模型 | #基准测试 #数据集 | arxiv 👥 作者与机构 第一作者:Swapnanil Mukherjee(Microsoft Research India) 通讯作者:Swapnanil Mukherjee(Microsoft Research India,论文提供联系邮箱为 swapnanil.mukherjee12@gmail.com) 作者列表:Swapnanil Mukherjee(Microsoft Research India)、Agyeya Negi(IIIT Hyderabad)、Tanuja Ganu(Microsoft Research India)、Ponnurangam Kumaraguru(IIIT Hyderabad) 💡 毒舌点评 用自动管道造了一个看似覆盖全模态、实际由 Gemini 单方生成并单方审计的 C3PO 基准,再用这个基准宣称“Gemini-3.1-Pro 最强”,存在明显的循环评价风险。不过其 IC/CC 双轴设计与注意力熵分析确实触碰到了多模态模型“过早承诺单模态”这一真问题,且模板粒度很细,值得后续工作修正生成偏差后复用。如果作者不公开生成产物和完整模板逻辑,这个基准的实际影响力会大打折扣。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 690 words

FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India

📄 FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India 标签:#语音交互 #大语言模型 #语音识别 #鲁棒性 #基准测试 7.0/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.0/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #语音交互 | #大语言模型 | #语音识别 #鲁棒性 | arxiv 👥 作者与机构 作者列表:Aman Dalmia、Sanskriti Midha、Jigar Doshi 机构信息:论文未说明作者所属机构 通讯作者:论文未标明通讯作者 💡 毒舌点评 把“LLM 只做语义提取和话术生成、校验与跳转完全交给规则层”的混合架构做到可部署粒度,并给出成本—延迟—准确率的 Pareto 选择流程,这是工程洞察上的亮点;但整个 benchmark 全部来自脚本化模拟用户和单次录音,所谓 pilot 没有给出任何真实通话数据,端到端结论的生态效度仍然存疑。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 768 words

Rethinking Automatic Music Mixing as Sequential Stem Blending

📄 Rethinking Automatic Music Mixing as Sequential Stem Blending 标签:#音乐生成 #流匹配 #Transformer #基准测试 #音频理解 6.5/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐生成 | #流匹配 | #Transformer #基准测试 | arxiv 👥 作者与机构 第一作者:Yen-Tung Yeh(机构未说明) 通讯作者:未说明 作者列表:Yen-Tung Yeh(机构未说明)、Chung-Jui Chan(机构未说明)、Yun-Ning Hung(机构未说明)、Yi-Hsuan Yang(机构未说明) 💡 毒舌点评 把 AMM 从“并行一次性输入全部干声”重构为“逐条干声融入既有 submix”,这个范式转换确实有启发性,也符合混音师实际工作方式。用 submix 条件流匹配配合退化数据合成,技术路线自洽,并且给出了 stem blending 新基准、客观指标和主观听感测试。但最核心的客观基准是用同一套退化策略构造的,存在“自己出题自己考”的风险;主观测试仅 18 人、6 个样本,未报告显著性和置信区间;代码、模型权重和 benchmark 数据均未公开,也没有组件级消融,因此该工作的可验证性和可传播性明显受限。 ...

2026-08-07 · 更新于 2026-08-14 · 4 min · 746 words

语音/音乐/音频论文速递 2026-08-07

语音/音乐/音频论文速递 2026-08-07 共分析 21 篇论文 ⚡ 今日概览 📥 抓取 21 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音属性识别 2篇 ██ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频生成 2篇 ██ #音频生成 2篇 ██ #声源定位 1篇 █ #语音交互 1篇 █ #语音伪造检测 1篇 █ 📊 论文评分排行榜(21 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AffectDF: The Most Comprehensive Benchmark for Speech D 8.4分 前25% 数据集与基准 #语音伪造检测 🥈 LILAC: An Idempotent Neural Speech Codec 8.1分 前25% 方法研究 #语音编码 🥉 KVAE: Family of Tokenizers for Multimodal Generative Mo 8.1分 前25% 模型报告 #音频编码 4. Decolonizing Linguistic Policies in Automated Speech Re 7.8分 前25% 理论研究 #语音识别 5. Audio-to-Score Transcription using Pre-trained Features 7.7分 前25% 数据集与基准 #音乐转录 6. Diff2Mix: Controllable Music Mixing via Diffusion Model 7.5分 前25% 方法研究 #音频生成 7. Vorch-Streamer: Extending Human Audio-Visual Generation 7.4分 前50% 方法研究 #音视频生成 8. EG-VAE: A Unified Framework for Electric Guitar Tone Tr 7.3分 前50% 方法研究 #音频生成 9. Explicit and Stable Pseudospectral Time-Domain Method f 7.2分 前50% 方法研究 #音频理解 10. FormBharo: Designing and Evaluating a Voice Agent for C 7.0分 前50% 系统技术报告 #语音交互 11. Whence the Voice? Self-supervised Dual-source Audio-Vis 6.8分 前50% 方法研究 #声源定位 12. Bias Analysis of L2 Speaking Assessment Systems Using C 6.7分 前50% 方法研究 #语音质量评估 13. Diff-Symbo: Text-Controlled Long-Duration Symbolic Musi 6.5分 前50% 方法研究 #音乐生成 14. Rethinking Automatic Music Mixing as Sequential Stem Bl 6.5分 前50% 方法研究 #音乐生成 15. How to Recognize New Words: A Comparison Between Contex 6.4分 前50% 方法研究 #语音识别 16. Beyond Residual Connections: Manifold-Constrained Hyper 6.0分 前50% 方法研究 #说话人验证 17. A Study of ASR Adaptation and Representation Dimensiona 5.7分 前50% 方法研究 #语音情感识别 18. PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Hea 5.6分 前50% 方法研究 #音视频生成 19. The interface of intonation and lexical tone: Boundary 5.6分 前50% 综述 #语音属性识别 20. C\(^3\)PO: Evaluating Cross-Modal Composition and Counter 5.5分 前50% 数据集与基准 #音视频问答 21. ECHO: A Locally-Deployable Agentic Health Assistant wit 5.5分 前50% 系统技术报告 #语音属性识别 📋 论文列表 🥇 AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks 8.4/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-07 · 更新于 2026-08-14 · 17 min · 3544 words