MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques

📄 MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques 标签:#音频质量评估 #音频大模型 #SFT #强化学习 #音乐生成 6.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频质量评估 | #音频大模型 | #SFT #强化学习 | arxiv 👥 作者与机构 第一作者:Jiabao Zhuang(复旦大学 Fudan NLP Group) 并列一作:Changhao Jiang、Hanchen Wang、Jiahao Chen、Zhixiong Yang、Zhenghao Xiang(均复旦大学 Fudan NLP Group) 通讯作者:Tao Gui(复旦大学 Fudan NLP Group) 作者列表:Jiabao Zhuang(复旦大学 Fudan NLP Group)、Changhao Jiang(复旦大学 Fudan NLP Group)、Hanchen Wang(复旦大学 Fudan NLP Group)、Jiahao Chen(复旦大学 Fudan NLP Group)、Zhixiong Yang(复旦大学 Fudan NLP Group)、Zhenghao Xiang(复旦大学 Fudan NLP Group)、Yifei Cao(复旦大学 Fudan NLP Group)、Jiajun Sun(复旦大学 Fudan NLP Group)、Hui Li(复旦大学 Fudan NLP Group)、Ming Zhang(复旦大学 Fudan NLP Group)、Tao Ji(复旦大学 Fudan NLP Group)、Tao Gui(复旦大学 Fudan NLP Group,通讯作者)、Qi Zhang(复旦大学 Fudan NLP Group)、Xuanjing Huang(复旦大学 Fudan NLP Group) 💡 毒舌点评 把文本生成式奖励模型里的“先写 critique 再打分”范式迁移到长歌曲多维度美学评估,并用自生成 critique 缓解训练/推理分布偏移,这一点做得比较完整,消融证据也清楚。但整体新颖性更接近领域迁移而非本质突破,且 Music Arena 相对 SongEval 的领先只有 0.55 个百分点,没有统计显著性或多 seed 验证,下游 GRPO 效果也缺少人类听感评估来兜底。人工 critique 审核的样本量、接受率与一致性均未量化,进一步削弱了数据构建可靠性。 ...

2026-08-13 · 更新于 2026-08-14 · 2 min · 406 words

语音/音乐/音频论文速递 2026-08-13

语音/音乐/音频论文速递 2026-08-13 共分析 18 篇论文 ⚡ 今日概览 📥 抓取 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 4篇 ████ #语音识别 4篇 ████ #语音增强 3篇 ███ #音视频生成 2篇 ██ #音乐生成 1篇 █ #音视频问答 1篇 █ #音频事件检测 1篇 █ #音频生成 1篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM 8.0分 前25% 方法研究 #音频生成 🥈 UniSwap: Streaming Audio-Visual Identity Swapping for T 7.8分 前25% 方法研究 #音视频生成 🥉 Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot 7.7分 前25% 系统技术报告 #语音合成 4. The SLT 2026 SmartGlasses Challenge: Benchmarking Egoce 7.5分 前25% 数据集与基准 #语音识别 5. Dialogue-Aware Video-to-Music Generation Using Public D 7.1分 前50% 数据集与基准 #音视频生成 6. Rethinking Language Model-Based Generative Speech Enhan 7.1分 前50% 方法研究 #语音增强 7. Easper: An Accessible ASR Pipeline for Language Documen 7.0分 前50% 系统技术报告 #语音识别 8. On-Policy Self-Distillation for Multi-Dialect ASR: Mast 7.0分 前50% 方法研究 #语音识别 9. Luna-TTS Family Technical Report 6.9分 前50% 系统技术报告 #语音合成 10. Do Text-to-Music Models Really Follow Instructions? A C 6.8分 前50% 数据集与基准 #音乐生成 11. Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-V 6.6分 前50% 方法研究 #音视频问答 12. DonorRank: Donor Language Selection for Low-Resource Cr 6.6分 前50% 方法研究 #语音识别 13. RT-SEMamba: Real-Time Speech Enhancement Mamba via Prog 6.6分 前50% 方法研究 #语音增强 14. Phoenix TTS: High-Fidelity Synthesis and Voice Conversi 6.5分 前50% 系统技术报告 #语音合成 15. MuseCritic: Learning Multi-Aspect Song Rewards through 6.5分 前50% 方法研究 #音频质量评估 16. Robust Multi-Tier Infant-Centered Audio Understanding w 6.0分 前50% 方法研究 #音频事件检测 17. CookVoice: Unified Framework for Style Controllable Mul 6.0分 前50% 模型报告 #语音合成 18. Deep Learning Based Relative Transfer Matrix Estimation 5.1分 后50% 方法研究 #语音增强 📋 论文列表 🥇 MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching 8.0/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-13 · 更新于 2026-08-14 · 20 min · 4212 words

Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training

📄 Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training #音乐生成 #预训练 #自监督学习 #Transformer #SFT 8.1/10 | 创新 1.1/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 8.1/10 | 前25% | #音乐生成 | #预训练 | #自监督学习 #Transformer | arxiv 👥 作者与机构 第一作者:Hong-Jie You(南京大学 计算机软件新技术国家重点实验室、人工智能学院) 通讯作者:Yu-Feng Li(南京大学 计算机软件新技术国家重点实验室、人工智能学院) 作者列表:Hong-Jie You(南京大学)、Jie-Jing Shao(南京大学 人工智能学院)、Xiao-Wen Yang(南京大学 人工智能学院)、Lin-Han Jia(南京大学 人工智能学院)、Lan-Zhe Guo(南京大学 智能科学与技术学院)、Yu-Feng Li(南京大学 人工智能学院) 💡 毒舌点评 本文将一个在NLP/CV中已被验证的预训练范式成功迁移到钢琴演奏渲染这一小众领域,并用漂亮的客观/主观双料SOTA数据说明了其有效性,故事逻辑完整。但“范式转变”的帽子扣得略大,本质上仍是“Masked Token Prediction + SFT”的标准配方,且10B-token预训练带来的性能增益在消融中仅依赖“有/无预训练”的二值比较,缺乏更细致的scaling law分析,使得“10B”这个数字更像一个资源配置的结果而非深刻的科学洞察。局限性讨论过于温和,对为何在踏板维度上未能全面领先SOTA避而不谈。 ...

2026-07-04 · 更新于 2026-08-14 · 1 min · 161 words

Speech-Audio Compositional Attacks on Multimodal LLMs and Their Defense with SALMONN-Guard

📄 Speech-Audio Compositional Attacks on Multimodal LLMs and Their Defense with SALMONN-Guard #音频理解 #SFT #基准测试 #内容审核 #数据集 8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 🔥 8.3/10 | 前25% | #音频理解 | #SFT | #基准测试 #内容审核 | arxiv 👥 作者与机构 第一作者:Yudong Yang(清华大学) 通讯作者:Guangzhi Sun(剑桥大学)、Chao Zhang(清华大学) 作者列表:Yudong Yang(清华大学)、Xuezhen Zhang(清华大学)、Zhifeng Han(清华大学)、Siyin Wang(清华大学)、Jimin Zhuang(清华大学)、Zengrui Jin(清华大学)、Jing Shao(上海人工智能实验室)、Guangzhi Sun(剑桥大学)、Chao Zhang(清华大学) 💡 毒舌点评 本文亮点在于首次系统性地将语音-非语音音频的语义和语境组合引入多模态LLM安全红队评测,攻击方式真实且具有现实威胁性,提出的SALMONN-Guard联合模态守卫设计也展现了防御此类攻击的可行性。然而,攻击构造仍依赖人工预设的声学参数与对话脚本,缺乏自适应的攻击策略优化,使得benchmark的攻击上限不明确;防御仅使用SFT,未与对抗训练等更强基线对比,说服力不足;MSD评估将“理解错误”也计入攻击成功,该设定存在争议,可能高估了实际威胁。 ...

2026-07-04 · 更新于 2026-08-14 · 4 min · 738 words