Opening mind by opening architecture: analysis strategies

📄 打开黑盒之前,先学会搭一间混响小屋 英文题目:Opening mind by opening architecture: analysis strategies 一句话:这篇教学报告以 1962 年 Schroeder 混响为标本,用 Faust 先搭原型再移植到 Csound 并配脉冲响应检验链,唯一的实证只是一张反馈延迟线衰减图,代价是缺参数、缺对比与缺听感验证。 标签:#音频生成 | #端到端 | #开源工具 | #可解释性 评分:4.5/10 | 创新 0.5/2 | 技术严谨 0.8/1.5 | 实验充分 0.2/1.5 | 清晰度 0.6/1 | 影响力 0.3/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Francesco Vitucci:Conservatorio “N. Piccinni” - Bari Giuseppe Silvi:Conservatorio “N. Piccinni” - Bari Daniele Giuseppe Annese:Conservatorio “N. Piccinni” - Bari Francesco Scagliola:Conservatorio “N. Piccinni” - Bari Anthony Di Furia:Conservatorio “N. Piccinni” - Bari 💬 毒舌点评 把 1962 年 Schroeder 混响用 Faust 再抄一遍到 Csound 还能包装成开放架构宣言,教学诚意可嘉,研究增量约等于课程作业。全文无一个可核对的声学数字、无基线、无听感评估,却大谈黑盒批判与创意未来,投顶会只会被以证据不足秒拒。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 760 words

Evoking Harmony via Convolution

📄 在噪声里听见和弦:一次卷积如何让田野录音带上调性色彩 英文题目:Evoking Harmony via Convolution 一句话:用覆盖全听觉范围的和弦约束对数周期脉冲响应做一次分区卷积,在 click 与白噪声上呈现稀疏和弦晶格并在田野录音中实现可作曲的和声染色,代价是缺乏主观听感与量化基线验证。 标签:#音乐生成 #生成模型 #音频生成 #数据集 评分:5.9/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Michael Gogins:Irreducible Productions, New York 💬 毒舌点评 把 12 音级和弦做成对数周期滤波器并塞进单次分区卷积的思路优雅且极具作曲可用性,短时因果半余弦窗与等能量加等响度校正的推导也显示出作者对听觉细节的尊重。短板在于验证几乎完全停留在作者自录的黄昏田野录音与 click / 白噪声的定性频谱图上,既无听感主观评测也无与可比基线的量化对比,顶会审稿人很难据此判断该效果是否超越一个调参精致的和弦受限滤波器组。 📌 核心摘要 论文旨在弥合非音调电声与音调音乐实践的割裂,解决如何让任意宽带声源隐约呈现指定和弦音级内容而不引入外加音高错觉的问题。核心机制是将声源与单一有限长脉冲响应做卷积,该响应由覆盖 20 Hz 至 0.95 倍奈奎斯特频率范围内全部八度的半余弦窗正弦晶粒叠加而成,每个晶粒对应和弦音级并叠加干路 Dirac 分量后做整体 ℓ2 归一化,通过分区卷积(partitioned convolution)一次完成。相较于线性频率等距的梳状滤波器(comb filter)和按固定半音间隔铺瓦的通用恒 Q(constant-Q)库,该设计在对数频率坐标上以八度为周期平铺和弦单元,并以频率相关的窗长实现高频恒 Q、低频恒带宽的混合时频折中。与已有方法的差异在于滤波晶格受和弦约束且以卷积而非持续滤波实现,从而保证输出频谱仅在输入有能量处显现。实验以 Csound opcode chord_convolver 在 click、白噪声及约 149 秒的 Lagarde 城堡田野录音上演示,显示其频谱呈稀疏和弦晶格且在高频仍保持清晰,而梳状与通用恒 Q 分别呈现线性等距与密集网格。作者声称该效果在 50 ms 响应驱动 3 Hz 脉冲串时仅有约 3% 能量泄露到干声之外,适于保持瞬态融合。局限在于缺乏形式化听感评估、客观度量与可重复的对比基准,结论的外推主要依赖作者主观音乐性判断。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1341 words

PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation

📄 把声学公式写进损失:PhysWave 如何让扩散模型不再猜方向 英文题目:PhysWave: Physics-Guided Latent Diffusion Models for Controllable Spatial Audio Generation 一句话:针对文本到 FOA 生成中方向与距离失真且自然语言与数值控制割裂的问题,PhysWave 用统一航点-标题条件与两项可微物理损失约束潜扩散,在合成动态数据上将静态与运动方向误差降至 1.73 °与 4.65 °并保持可比音质,代价是仅限单声源自由场且未验证真实房间泛化。 标签:#音频生成 #扩散模型 #空间音频 #变分自编码器 #数据集 评分:6.6/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Lingfeng Yao:University of Houston Chenpei Huang:University of Houston Xingke Yang:University of Houston Ziye Geng:University of Houston Changqing Luo:University of Houston Hao Wang:Stevens Institute of Technology Jiang Liu:Waseda University Miao Pan:University of Houston 💬 毒舌点评 亮点在于把一阶 Ambisonics(First-Order Ambisonics,FOA)已知的球谐编码与反平方衰减显式做成可微损失并同时用于训练与推理时引导,统一了自然语言与航点轨迹控制,思路干净且有效;短板是物理先验仅限自由场直达声,300K 规模数据集完全依赖合成渲染且缺乏真实房间混响与多源评估,基线复现而非官方权重对比也削弱了 SOTA 说服力。 ...

2026-09-01 · 更新于 2026-09-04 · 9 min · 1764 words

A Frequency-Domain Artificial Reverberator Plug-In

📄 当混响不再模仿房间:用声码器思路把噪声织成尾响 英文题目:A Frequency-Domain Artificial Reverberator Plug-In 一句话:FDverb 把稀疏时域早期反射与频域噪声载波尾响解耦,用逐频带包络跟随直接塑造噪声来生成高密度混响,并以可实时交互的开源插件证明了大块尺寸下仍可低 CPU 运行,代价是缺乏与现有混响的音质对比且大块带来数十毫秒固有延迟。 标签:#音频生成 #生成模型 #空间音频 #实时处理 #开源工具 评分:7.2/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.5/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 1.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Jonas Roth:机构信息未在 arXiv HTML 中可靠披露 Nishanth Kumar:机构信息未在 arXiv HTML 中可靠披露 Silvan Krebs:机构信息未在 arXiv HTML 中可靠披露 David Wieland:机构信息未在 arXiv HTML 中可靠披露 Christoph Studer:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把相位声码器式频域噪声载波混响做成了可实时交互的 JUCE 插件,并加入了非物理的非线性衰减与音高漂移等声音设计玩法,工程完整度远超一般算法短文。短板是全文几乎没有可验证的声学或主观评价证据,创新停留在对 [2][3] 类经典频域衰减思路的工程化重组与参数化,学术增量与严谨性难以支撑顶会方法论文标准。 ...

2026-08-31 · 更新于 2026-09-04 · 4 min · 814 words

Evaluating Loss Functions in Differentiable Out-of-Domain Sound-Matching with Partial Parameter Distance

📄 当目标永远无法被完美复刻,我们该如何评判模仿的好坏? 英文题目:Evaluating Loss Functions in Differentiable Out-of-Domain Sound-Matching with Partial Parameter Distance 一句话:为了解决域外声音匹配中参数空间不一致导致无法自动评估的难题,论文用共享关键参数的部分参数距离搭配七组极简失配合成器对做受控筛选,证明损失函数的优劣始终跟合成方式绑定,且该距离在七组场景中有五组与盲听的最优选择一致,但结论仍受限于一秒玩具信号和内部小规模听感。 标签:#音频生成 #生成模型 #音频质量评估 #模型比较 评分:6.4/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Amir Salimi:机构信息未在 arXiv HTML 中可靠披露 Daniel Penner:机构信息未在 arXiv HTML 中可靠披露 Kalvin Eng:机构信息未在 arXiv HTML 中可靠披露 Abram Hindle:机构信息未在 arXiv HTML 中可靠披露 Osmar R. Zaïane:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用最小可控合成器刻意制造失配来让域外声音匹配可自动评估,部分参数距离 Partial Parameter Distance (PPD) 的提法巧妙绕开了全参数不可比的死结。短板是所有结论都锁在 1 秒玩具信号与作者自评听感上,声称验证人耳一致性却用 4 人作者小组盲评,外部有效性与真实录音泛化几乎未触及。 ...

2026-08-31 · 更新于 2026-09-04 · 4 min · 693 words

StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation

📄 边播边改:当音视频生成从片段走向持续世界 英文题目:StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation 一句话:StreamAV-Bench 用 180 秒双轨与 32 维指标把流式音视频生成拉到边播边改的真实时间轴上,用 13 个系统的横评揭示视觉质量与交互达成难以兼得,且所有系统都在长程漂移与状态复用上集体失效。 标签:#音频生成 #多模态模型 #基准测试 #流式处理 评分:8.2/10 | 创新 1.6/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Kaiqi Liu:BAAI;PKU Haoxuan Zeng:PKU Jingqi Liu:BAAI;PKU Jiacong Fang:BAAI;PKU Ziqi Cai:PKU Yunyao Mao:Kling Henglin Liu:THU Yu Sheng:USTC Shuchen Weng:BAAI;PKU Boxin Shi:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 首次把流式音视频生成从“生成完再评”拉到“边播边改”的真实交互场景,320 个专家校验场景与 32 维指标把时间漂移、响应延迟、状态复用等隐蔽失效模式彻底曝光,13 系统横评揭示级联与原生联合的互补格局。短板是评估过度依赖 Gemini 3.1 Pro 等多模态大语言模型(Multimodal Large Language Model,MLLM)主观打分且未开源完整复现代码,商业系统缺失边界连续性等关键指标,32 维指标权重与冗余未做消融,结论的可信度仍受评测器偏差束缚。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 959 words

Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra

📄 Arbitrary Polygon Oscillator: Generalizing Polygonal Synthesis to Arbitrary Shapes, Morphing, and Three-Dimensional Polyhedra 标签:#音乐生成 #音频生成 #实时处理 #理论分析 #开源工具 8.7/10 | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音乐生成 | #音频生成 | #实时处理 #理论分析 | arxiv 👥 作者与机构 第一作者:Antonio Argentieri(Conservatorio Niccolò Piccinni di Bari) 通讯作者:Antonio Argentieri;Francesco Scagliola 作者列表:Antonio Argentieri、Francesco Scagliola(机构:Conservatorio Niccolò Piccinni di Bari, Bari, Italy) ...

2026-08-26 · 更新于 2026-09-04 · 1 min · 145 words

Vibrato Matching for Modulation Control and Blending in Sound Mixtures

📄 Vibrato Matching for Modulation Control and Blending in Sound Mixtures 标签:#音频生成 #端到端 #音乐源分离 8.5/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 🔥 8.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音频生成 | #端到端 | #音乐源分离 | arxiv 👥 作者与机构 第一作者:Jeremy Hyrkas(正文未明确机构) 通讯作者:正文未明确标注 作者列表:Jeremy Hyrkas(机构:正文未明确机构) 💡 毒舌点评 这是一项小而完整的音乐信号处理工作:从目标颤音抑制,到逐谐波 FM/AM,再到非谐波残差包络,链路清楚且源码、原始音频齐备。创作者可以直接尝试,研究者也能复核。唯一难以越过的界线是感知结论——CFT 分不开有别于听众听不出,真正的融合感仍需受控听觉实验。 📌 核心摘要 自然颤音不是单一的周期性音高摆动。演奏者同时改变各谐波的瞬时频率和幅度,气息、弓压等还会调制非谐波残差的谱包络。若只复制 1 条全局频率曲线,跨乐器迁移往往保留目标原颤音或丢失噪声成分的动态。本文提出的 vibrato matching 先压平目标颤音,再从源声音迁移完整调制模式。 ...

2026-08-25 · 更新于 2026-09-04 · 2 min · 283 words

Dancing Through Soundscapes: Designing a Low-Cost, Sound-Based Device for Sensing and Interpreting Movement and Dance

📄 Dancing Through Soundscapes: Designing a Low-Cost, Sound-Based Device for Sensing and Interpreting Movement and Dance 标签:#音频交互 #音频生成 #空间音频 #实时处理 5.2/10 | 创新 0.9/2 | 严谨 0.9/1.5 | 实验 0.8/1.5 | 清晰 0.7/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 5.2/10 | 后50% | 文档类型:应用研究 | 评分置信度:中 | #音频交互 | #音频生成 | #空间音频 #实时处理 | arxiv 👥 作者与机构 Swen E. Gaudl 来自瑞典哥德堡大学并兼任英国 Seam CoLab 有限公司研究员,Silvia Carderelli-Gronau 来自巴斯斯巴大学并兼任同一公司职务。研究历经四年的通过设计做研究与共同创作迭代,面向舞者与混合能力用户群体。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 254 words

FM Synthesizer Audio-Parameter Shared Embeddings

📄 FM Synthesizer Audio-Parameter Shared Embeddings 标签:#音频生成 #多模态模型 #端到端 #游戏音频 7.3/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频生成 | #多模态模型 | #端到端 #游戏音频 | arxiv 👥 作者与机构 第一作者:David Braun(机构未说明) 通讯作者:未说明 作者列表:David Braun、Adam Finkelstein(机构信息未在当前正文中完整说明) 💡 毒舌点评 把 FM 合成器的音频与参数嵌入对齐是个聪明的任务设计,但 DX7 恰恰是最「友好」的验证对象:六个算子同构,天然适合共享权重,结论难以外推到含滤波器、包络等异构模块的真实合成器。每个预设只在 C4、力度 85 单点渲染,键盘跟踪与速度响应完全未观察。更麻烦的是 DX7 存在算子置换对称性——参数不同但声音相同——而检索评测为每条查询指定唯一正确预设,这类歧义如何处理论文语焉不详。 ...

2026-08-20 · 更新于 2026-09-04 · 4 min · 660 words