LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity

📄 LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity #音频水印 #音频生成 #语音合成 8/10 | 创新 1.6/2 | 严谨 1.1/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 8/10 | 前25% | #音频水印 | #生成对抗网络 | #音频生成 #语音合成 | arxiv 👥 作者与机构 Kexin Li, Xiao Hu, Ilya Grishchenko, David Lie University of Toronto, Canada *Equal contributions, BCorresponding author 💡 毒舌点评 本文首次将“放射性”水印概念系统化地引入音频领域,并通过语义潜在空间嵌入提出了一个新颖的框架LambdaMark,实验结果看起来非常漂亮,声称在所有评估的攻击下都保持了鲁棒性。然而,审稿人必须指出几个严重关切。首先,该方法的“通用性”高度依赖于一个特定的、未开源的语义编码器(Dasheng)和声码器(SemanticVocoder)骨干网络,这使得其声称的通用性打了折扣。其次,论文在理论深度上有所欠缺,主要贡献是架构设计和实证验证,缺乏对为何“语义嵌入”比“波形嵌入”更鲁棒的严格数学分析或理论证明。第三,尽管实验全面,但评估完全依赖于作者自己提出的“HarmonicAttack”,且该攻击的泛化性和威胁强度是否代表最先进水平有待商榷。论文的局限性部分诚实,但更多地描述了方法适用范围,而非对方法内在缺陷的深入剖析。总体而言,这是一篇不错的工程导向论文,但距离顶会论文所要求的理论创新和深度分析仍有差距。 ...

2026-06-23 · 更新于 2026-07-30 · 5 min · 922 words

Learning from Audio-Dependency Errors: Data Curation Strategies Based on Model Confusion Patterns in Audio Question Answering

📄 Learning from Audio-Dependency Errors: Data Curation Strategies Based on Model Confusion Patterns in Audio Question Answering #音频问答 #大语言模型 #参数高效微调 6.9/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 ✅ 6.9/10 | 前50% | #音频问答 | #参数高效微调 | #大语言模型 | arxiv 👥 作者与机构 未提及 💡 毒舌点评 这篇论文像是给DCASE竞赛交了一份很认真的“赛后总结报告”。作者很诚实,把所有试过的、没用的方法都列出来了(比如各种RL和CoT),这种开源精神值得点赞。但问题是,核心创新点——用反事实输入给数据“分桶”——更像是一个精心设计的工程trick,而非一个能推广的理论。性能从65.9%提到67.3%,在绝对数字上提升甚微,很难让人兴奋。论文花大量篇幅描述各种“失败实验”,固然体现了严谨,但也暴露了主方法在提升上限上的无力。它更像证明了“做减法比做加法更有用”,而不是提供了一个强大的新武器。对于追求突破性进展的顶会来说,这个贡献的“甜度”不够。 📌 核心摘要 本文针对音频问答任务,提出一种基于诊断数据整理的微调策略。核心思想是,先利用一个强大的基础模型(Qwen3-Omni)在“正常”、“空音频”和“乱序音频”三种条件下对训练样本进行探针测试,根据模型在不同条件下的正确性模式(\(N, E, S\)),将样本分为“强音频依赖”、“文本先验”、“困难样本”等类别。作者发现,仅使用“强音频依赖”样本(即正常条件下正确,但空音频和乱序音频条件下均失败)进行监督微调,能最有效地提升模型对音频证据的依赖性。进一步,通过加入少量(如5%)的“空音频负样本”(目标回答为“无法确定”)来抑制模型的无根据猜测。最终,该策略在ADQA-Bench开发集上取得了优于基线的准确率。 🔗 开源详情 代码:训练和评估代码计划发布于:https://github.com/frednam93/adqa_nam 模型权重:论文中未提及具体模型权重链接(论文使用了 Qwen3-Omni-30B-A3B-Instruct 和 Gemma-4-E4B-it,但未提供其下载链接)。 数据集:论文中提及 ADQA-Bench 数据集(DCASE 2026 Task 5),但未提供具体获取链接。 Demo:论文中未提及。 复现材料:论文中提供了详细的微调训练配置(基于 LLaMA-Factory,使用 4-bit bitsandbytes 量化和 LoRA),包括具体的超参数设置、训练数据构建变体(如 “Strong”、“Strong+empty 5%” 等)及其比例,以及提交的四个候选系统的详细描述。 论文中引用的开源项目: LLaMA-Factory:用于微调(论文引用[15])。 bitsandbytes:用于 4-bit 量化(论文引用[15])。 LoRA:用于参数高效微调(论文引用[8])。 Gemma-4-E4B-it:作为三模型集成的响应正常化器使用。 SimPO:作为偏好优化目标之一进行评估(论文引用[9])。 DPO:作为偏好优化目标之一进行评估(论文引用[12])。 GRPO:作为强化学习目标之一进行评估(论文引用[13])。 DAPO (lite):作为强化学习目标之一进行评估(论文引用[14])。 FunAudioChat:作为基线模型之一进行评估(论文引用[2, 1])。 AudioFlamingo3:作为基线模型之一进行评估(论文引用[5])。 🏗️ 方法概述和架构 本文方法的核心是一个基于模型行为的数据整理与微调流程,主要分为诊断分析、数据选择、微调和推理后处理四个阶段。 ...

2026-06-23 · 更新于 2026-07-30 · 3 min · 446 words

Learning to Evade: Adaptive Attacks on Audio Watermarking

📄 Learning to Evade: Adaptive Attacks on Audio Watermarking #音频水印 #假设检验 7.6/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 ✅ 7.6/10 | 前50% | #音频水印 | #假设检验 | arxiv 👥 作者与机构 Weikang Ding (密苏里大学堪萨斯城分校), Hanqing Guo (夏威夷大学马诺阿分校), Rui Duan (密苏里大学堪萨斯城分校), Guangjing Wang (南佛罗里达大学), Yuanda Wang (密歇根州立大学), Mingzhe Chen (迈阿密大学), Qiben Yan (密歇根州立大学)。研究在密歇根州立大学完成。 💡 毒舌点评 本文直面音频水印防御中的一个关键盲点:检测模型依赖的统计假设。作者敏锐地发现解码概率的正态分布特性,并巧妙地设计了一个“伪装”攻击,让扰动后的概率分布“看起来正常”,从而骗过检测器。这个思路清晰、动机明确,实验也扎实地证明了其方法在特定场景下的有效性。然而,论文的“自适应”依赖于一个较强的攻击者模型——需要能够访问编码器生成估计样本,这在现实世界中可能受限。此外,所谓的“检测方法”本身更像是一个基于假设检验的防御框架,而非一个经过严格验证的强健检测器,其对抗更复杂攻击的鲁棒性存疑。文章写作清晰,但贡献更多是应用层面的巧妙组合,理论深度稍显不足。 ...

2026-06-23 · 更新于 2026-07-30 · 7 min · 1403 words

Libretto: Giving LLM Agents a Sense of Musical Structure

📄 Libretto: Giving LLM Agents a Sense of Musical Structure #音乐生成 9.2/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 9.2/10 | 前50% | #音乐生成 | #音乐生成 | arxiv 👥 作者与机构 作者:Yichen Xu 机构:University of California, Berkeley 💡 毒舌点评 这篇论文聪明地避开了训练一个新音乐模型的深坑,转而给现有的LLM套上了一个精心设计的“音乐脚手架”。思路值得肯定,但“评估体系”和“人类验证”这两个点被作者自己也承认是弱点,审稿时会在这里被反复追问。更麻烦的是,整个大厦建立在Claude这个商业API上,这就像把论文的根基打在了别人家的地皮上,可复现性和通用性都要打个大大的问号。不过,槽式语法和统计指纹的概念确实清晰实用,算是给符号音乐生成提供了一个不错的工程化参考范式。对于NeurIPS级别的会议来说,技术新颖性和理论深度稍显不足,更像是一个扎实的系统工作。 📌 核心摘要 本文提出了Libretto,一个面向LLM代理的符号音乐生成与修订框架。该框架的核心是解决两个问题:1) 如何为LLM提供一种可直接读写和编辑音乐结构的文本接口;2) 如何提供一种可解释的、基于音乐结构的评估标准,以指导代理进行迭代优化。为此,Libretto设计了三项关键组件:首先,一种基于网格槽(onset slots)的符号音乐语法,将绝对时序编码为离散槽位,使音符起止时间显式化,支持局部编辑;其次,一个从314首MIDI文件中统计提取的29维结构指纹空间,涵盖节奏、和声、旋律、织体、曲式和变奏,用于量化生成结果与真实音乐分布的偏离程度;最后,一个“生成-测量-修订”的代理循环,代理在生成后接收基于指纹偏差的音乐性反馈(如“降低和声不稳定性”),并可结合检索到的知识库概念与示例进行迭代优化。在补缺、全曲生成、渐进变形、教育生成四个任务上,该框架通过结构门控和抄袭风险检测,验证了检索机制和修订循环能有效提升生成结果的通过率和质量。 🔗 开源详情 代码:https://github.com/Xyc-arch/Libretto 模型权重:论文中未提及 数据集:论文中提及使用314个MIDI文件作为原始音乐语料库,策划自Lakh MIDI Dataset (LMD)。LMD的开源信息为:Raffel, C. (2016). lakh-midi-dataset. GitHub. https://github.com/craffel/lmd。论文未提供此策划子集的独立下载链接。 Demo:项目主页为 https://libretto.site/ ,包含生成结果示例。 复现材料:论文在附录A中提供了多个语法示例,在附录B中详细定义了所有29个结构轴、百分位指纹、复制风险得分和校准门限的具体计算公式。论文中未提及提供额外的训练配置文件或检查点。 论文中引用的开源项目: Lakh MIDI Dataset (LMD): https://github.com/craffel/lmd 🏗️ 方法概述和架构 Libretto 是一个完整的代理作曲系统,其架构围绕“表示-评估-循环”展开,旨在将符号音乐转化为LLM可操作的可测量对象。系统主要由以下五个相互关联的部分构成,数据流和交互关系如下: ...

2026-06-23 · 更新于 2026-07-30 · 4 min · 696 words

LISE : Listenable Interpretable Speaker Embeddings

📄 LISE : Listenable Interpretable Speaker Embeddings #说话人验证 #说话人识别 #语音合成 6.8/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0.1/1.5 | 复现 0.4/0.5 | 工程 0.3/1.5 ✅ 6.8/10 | 前50% | #说话人验证 | #说话人识别 | #语音合成 | arxiv 👥 作者与机构 Xiaoliang Wu:University of Southampton, United Kingdom; The Hong Kong Polytechnic University, Hong Kong SAR, China Chongxin Gan:The Hong Kong Polytechnic University, Hong Kong SAR, China Ke Liu:University of Edinburgh, United Kingdom Peter Bell:University of Edinburgh, United Kingdom Jennifer Williams:University of Southampton, United Kingdom 💡 毒舌点评 这篇论文试图解决一个真实且重要的问题:让黑盒的说话人嵌入变得“可听”(Listenable),即人类可以通过听觉验证其组件的含义。这个想法很有价值,尤其是设计了严谨的感知实验来验证,这比多数只做自动指标的可解释性工作要扎实。然而,方法的创新性稍显不足,核心是现有非负矩阵分解(NMF)技术在特定约束下的应用。作者很诚实地讨论了局限,但部分讨论(如语言混淆)可能比实际影响更值得强调。总的来说,这是一篇工整、动机明确、实验设计用心的入门级可解释性论文,离顶级会议(如NeurIPS)对方法创新或理论深度的要求还有距离,但是一篇质量不错的领域会议(如Interspeech)论文。 ...

2026-06-23 · 更新于 2026-07-30 · 3 min · 515 words

LK Jam: System Architecture and Implementation of a Real-Time Human-AI Interactive Music Generation System using Role-Aware GRU

📄 LK Jam: System Architecture and Implementation of a Real-Time Human-AI Interactive Music Generation System using Role-Aware GRU #音乐生成 7.0/10 ✅ 7.0/10 | 前50% | #音乐生成 | #音乐生成 | arxiv 👥 作者与机构 论文标题: LK Jam: System Architecture and Implementation of a Real-Time Human-AI Interactive Music Generation System using Role-Aware GRU 作者: Yakun Liu, Z. Jin, Dong Liu, and Hai Luan 作者单位: Yakun Liu, Dong Liu, and Hai Luan 来自沈阳音乐学院。Z. Jin 为独立合作者。通讯作者: Dong Liu。 ...

2026-06-23 · 更新于 2026-07-30 · 2 min · 246 words

MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

📄 MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data #语音识别 #低资源 #数据增强 #多模态模型 #自监督学习 #参数高效微调 5.8/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.4/1.5 | 开源 0.1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.8/10 | 前50% | #语音识别 | #数据增强 | #低资源 #多模态模型 | arxiv 👥 作者与机构 作者:Muxuan Liu, Ichiro Kobayashi, Satoshi Nishida。第一作者Muxuan Liu和第二作者Ichiro Kobayashi隶属于日本御茶水女子大学(Ochanomizu University)人文与科学研究生院;第三作者Satoshi Nishida隶属于日本国立信息通信技术研究所(NICT)先进ICT研究所信息与神经网络中心(CiNet)。 ...

2026-06-23 · 更新于 2026-07-30 · 1 min · 163 words

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

📄 MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios 9/10 | 创新 1.2/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 9/10 | 前10% | arxiv 👥 作者与机构 论文作者包括Zhaokai Sun, Shuai Wang, Zhennan Lin, Chengyou Wang, Dehui Gao, Yuang Cao, Chunjiang He, Lei Pan, Zhaokai Zhou, Shuai Xie。主要机构为西北工业大学软件学院音频、语音与语言处理组(ASLP@NPU)、南京大学智能科学与技术学院、深圳湾区研究院以及理想汽车基础模型部门。 💡 毒舌点评 这篇论文做了一件必要的脏活累活:为“多说话人对话理解”这个模糊的概念,建立了一个看起来还不错的评估标尺。它清晰地划分了任务层级,用2300个诊断性QA实例进行了实测,算是给社区提供了一个统一的“考试卷”。不过,作为“审稿人”必须指出,这本质上是一项评估工作,而非方法创新。所谓的“方法”主要是QA构建流程,核心是依赖Gemini生成和人工校验。实验部分详实,但结论略显平淡——无非是“闭源模型强于开源”,“时间定位和细粒度归因是难题”。最大的遗憾是数据集未完全公开,这极大削弱了其作为“Benchmark”的即时可用性和影响力。对于一篇旨在提出新基准的论文来说,这有点像发布了一个考试制度,但试卷却不让人复印。 📌 核心摘要 本文针对现有大音频语言模型(LALMs)评估体系在多说话人对话场景下的缺失,提出了MSU-Bench,一个用于诊断“以说话人为中心的理解”能力的基准。MSU-Bench采用两层框架:Tier 1聚焦于说话人识别与属性感知(如说话人检索、属性识别),Tier 2专注于多说话人对话推理(如对话结构分析、情境推理)。该基准包含16个任务,共构建了2300个经过人工验证的多选题问答实例。通过对9个模型(6个开源,3个闭源Gemini)的评估,论文揭示:1)当前模型在复杂说话人定位(尤其是基于时间戳的定位)和多说话人推理方面存在明显短板;2)随着模型能力提升,其错误模式从“未知”(不敢答)转变为“错认说话人”(答错);3)提供更丰富的上下文线索(如时间+文本的复合引用)能有效提升性能。 🔗 开源详情 代码:https://github.com/ASLP-lab/MSU-Bench (论文中提及将提供评估脚本)。 模型权重:未提及。论文评估了多个开源模型(Qwen2.5-Omni、Qwen3-Omni、AudioFlamingo-3、Kimi-Audio、StepAudio2、MiMoAudio)和闭源模型(Gemini系列),但未提供其权重下载链接。 数据集:论文使用的数据源(如MagicHub中文/英文电话语料、AliMeeting、CHiME-6等)为公开语料,但MSU-Bench本身(含2300个QA实例)的完整数据集未提供公开下载链接,仅说明将在GitHub仓库发布。 Demo:未提及。 复现材料:未提及训练配置或检查点。仅提到评估脚本将开源。 论文中引用的开源项目:Volcano API(用于生成说话人分段和转录标注,论文中未提供该API的链接)。 标签 #多说话人语音识别 语音理解 语音合成 音频问答 语音分类 主任务标签:#语音识别 #语音合成 主方法标签:#评估与统计 补充标签:#多说话人 #对话系统 #多任务学习 #人机交互 #低资源 ...

2026-06-23 · 更新于 2026-07-30 · 2 min · 371 words

Noise-Driven Instrument Based on Coherent Quantum and Stochastic Oscillator Models

📄 Noise-Driven Instrument Based on Coherent Quantum and Stochastic Oscillator Models 3.8/10 | 清晰 论文结构清晰,写作流畅。但部分概念性论述(如量子类比的精确作用)稍显宽泛。/1 | 复现 未提供。论文描述了仪器设计的关键参数(如线圈尺寸、导线规格、电阻值),但未提供完整的复现所需材料清单、详细电路图、白噪声信号的具体参数(如带宽、幅度分布)以及频谱分析的具体设置(如FFT长度、窗函数等)。/0.5 📝 3.8/10 | 后50% | arxiv 🔗 开源详情 代码:论文中未提及代码链接 模型权重:论文中未提及 数据集:论文中未提及 Demo:论文中未提及 复现材料:论文中未提及 论文中引用的开源项目:未提及 📷 论文图片 ← 返回 2026-06-23 语音/音乐/音频论文速递

2026-06-23 · 更新于 2026-07-30 · 1 min · 38 words

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

📄 On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models #语音合成 #语音生成 #自监督学习 #低资源 #数据增强 7.4/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7.4/10 | 前25% | #语音合成 | #自监督学习 | #语音生成 #低资源 | arxiv 👥 作者与机构 Shunsuke Kando (东京大学) Wataru Nakata (庆应义塾大学) Shinnosuke Takamichi (东京大学) Yusuke Miyao (庆应义塾大学) ...

2026-06-23 · 更新于 2026-07-30 · 3 min · 608 words