论文解读

不指挥声音而照料生态:Spores 把黏菌求生逻辑做成可演奏的界面

Spores 以模拟黏菌觅食的代理生态为控制面,用照料式触屏交互驱动合成,最强的可核对证据是七分钟六段加尾声的事件结构与 960×540 网格加 MPE 通道的固定映射,代价是无食物即无声的约束与固定映射带来的可复现性限制。

 · 更新于 2026-09-25 · 约 22 分钟 · 10574 字 阅读 →
论文解读

二十只音箱包住一个甜点:在教室里装下三阶全球声场

该报告为教学与研究搭建 20 只同轴音箱的正十二面体三阶全球 Ambisonics 系统,把 16 通道 HOA 解码到 20 路输出,用机械对准加插件补偿与声压归一完成校准,四年使用报告显示定位与包围感可用但单体保真度有限。

 · 更新于 2026-09-25 · 约 17 分钟 · 8382 字 阅读 →
论文解读

把五间录音棚、一张光纤网和一间能改装的演出厅连成实验室:洗足学园的音乐与技术整合报告

该报告要解决的是如何在音乐院校内把创作、演出与聆听从传统研究框架扩展到沉浸式与技术驱动形态,方法是用五间录音棚、7.1.4 演出空间与全校光纤媒体网支撑教学科研创作一体化,最强证据是 47Trees 与杜比全景声直播等跨校跨平台项目落地,代价是报告未给出可比较的定量指标与受控实验。

 · 更新于 2026-09-25 · 约 23 分钟 · 11127 字 阅读 →
论文解读

不用钢琴也能调啸叫:拉森站如何把反馈变成可演奏的室内乐声部

针对电声反馈在室内乐中难稳定调音、依赖大钢琴的问题,拉森站用聚苯乙烯板、玻璃罐、定音鼓和低频鼓四模块加接触式激励与手势控制实现可复制的反馈乐器,其代价是低频与复音仍受限且高度依赖演奏者身体稳定性和现场校准。

 · 更新于 2026-09-25 · 约 23 分钟 · 11367 字 阅读 →
论文解读

把乐器搭建和底层数字信号处理放进同一种语言:MMMAudio 的选择与代价

MMMAudio 针对在 Max、Pure Data、SuperCollider 中做新数字信号处理要离开创作环境进入 C 或 C++ 插件流程的问题,选择以 Mojo 写音频引擎加 Python 做控制与人工智能工具链,用单采样 64 位与组合式单元生成器换来直接可改的扩展性,代价是单处理器振荡器数量报告显示低于 SuperCollider 且多引擎并行依 …

 · 更新于 2026-09-25 · 约 23 分钟 · 11178 字 阅读 →
论文解读

把效果器从脚下搬到桌上:无输入踏板网络何时从工具变成乐器

该研究以 Noise Peddler 双人无输入踏板系统为对象,用网络乐器理论解释如何以自振荡踏板取代吉他输入并以 MIDI 实现可控可重复的多声部音乐,代价是映射记忆负担大、排练与系统搭建成本高且高度依赖具体踏板组合。

 · 更新于 2026-09-25 · 约 22 分钟 · 10529 字 阅读 →
论文解读

不改速度也能听出投入度:用相位性皮电把听众变成节奏控制器

该研究把听众相位性皮肤电反应做成实时投入度信号,经滤波归一化与乐句对齐后映射为合成器低通滤波器截止频率的低频振荡器速率,在小提琴与爵士标准曲的三分钟单听众演示中跑通了表演者与听众可互相听见的反馈环,代价是仅单样本探索、无定量对照与群体验证。

 · 更新于 2026-09-25 · 约 21 分钟 · 10455 字 阅读 →
论文解读

卡曼恰琴体为何上半球一变就变声:厚度与音孔的振动证据

论文以封闭背板卡曼恰独立音箱为对象,用轴对称有限元扫参与自由悬挂锤击测频响做对照,显示上半球加厚与音孔减半抬高中低阶模态而下半球几乎不动,并把 4、5、7 阶模态指为支撑 C 弦谐波放大的主要候选,但材料离散使定量对齐仍有超过 2 比 1 的偏差代价。

 · 更新于 2026-09-25 · 约 19 分钟 · 9273 字 阅读 →
论文解读

先抹掉再贴上:用颤音匹配把齐奏混音藏成一个声源

该文研究齐奏混音中不同颤音模式暴露多声源的问题,提出先抑制目标颤音再从源信号迁移频率调制与分谐波幅度调制加残差谱包络调制的方法,以声谱图示例和同命运变换分离失效为证据,代价是尚无听音实验与客观分离指标量化。

 · 更新于 2026-09-25 · 约 18 分钟 · 8865 字 阅读 →
论文解读

一部手机如何托住一条嗓音:VoixTenue 的手势音高与力度控制

VoixTenue 把触屏纵向画线与手机俯仰横滚倾角映射为 Pink Trombone 的基频与强度,在 E2-E5 三组八度内以约 60 Hz 更新实现全机端实时嗓音合成,代价是触屏模式暂缺力度控制而倾角模式音高精度较低且未经被试实验验证。

 · 更新于 2026-09-25 · 约 21 分钟 · 10094 字 阅读 →
论文解读

成就越高越心虚:用游戏规则把冒充者体验变成可演奏的失败

该作品把冒充者现象转写为三关网格游戏,用观众喊格、故障 tile 与成就和自信双计分来演奏自我怀疑,最强的可复述证据是三段软件流水线与足部追踪校准流程,代价是每关之间必须回起点做校准步且目前没有定量听众评估。

 · 更新于 2026-09-25 · 约 22 分钟 · 11020 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-14

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 57 分钟 · 28192 字 阅读 →
论文解读

墙上的形状即乐器:用投影几何推断站位并门控离散音高的协作装置

该装置让 1 至 4 名表演者手持投影在 4 m×3 m 空间走动,用天花板相机只看墙上多边形的几何来判别 5 个空间交互点并驱动声音,离散音高经倾斜与置信度与连续帧门控后才切换,而连续音色保持约 30 fps 响应,代价是约 0.33 s 切换延迟与暗室和重标定依赖。

 · 更新于 2026-09-25 · 约 17 分钟 · 8312 字 阅读 →
论文解读

看不见的空气如何被听见:用身体移动演奏污染数据的集体聆听装置

该文以麦德林空气污染为问题,用三天工作坊沉淀的呼吸录音与 PM2.5 历史数据,结合 Pure Data 与 BELA 的八路接近传感加拍手检测与双层扩声,证明多人移动能共同改变声音,最强证据是观众把空间描述为肺与琴,代价是交互初识门槛高且无定量听感评估。

 · 更新于 2026-09-25 · 约 21 分钟 · 10342 字 阅读 →
论文解读

把非线性装进波数字滤波器:KAN 以更少参数逼近多二极管散射映射

该文在波数字滤波器框架下用神经网络显式逼近四端口非线性散射映射,对比多层感知机与柯尔莫哥洛夫-阿诺德网络,发现 KAN 以 40 对 148 个参数达到相近时域频域精度,但实时率从 1.31 升至 4.74。

 · 更新于 2026-09-25 · 约 19 分钟 · 9264 字 阅读 →
论文解读

薄板混响有数千个挤在一起的模态,双流如何同时看全局与局部衰减

针对一秒脉冲响应要估计数千个密集模态的问题,该工作用音频频谱变换器看全局结构、用动态模态分解提供局部衰减先验,在 1000 条验证上把总相对误差从 1.976 降到 0.867,但增益误差仍高达 0.907 且模态计数偏差仍大。

 · 更新于 2026-09-25 · 约 18 分钟 · 8657 字 阅读 →
论文解读

以相位为公共时钟:让声音、图形与颜色共用同一时间基准的音频激光合成

论文针对同一信号同时驱动振镜、音箱与激光二极管时跨域漂移与视觉先崩溃的问题,提出以全局相位斜坡为统一时间基础设施的架构,并以超过 40 个模块的 Phosphene 系统在 200 到 400 模块规模与 8 场演出中验证其可扩展性,代价是仍受 VCV Rack 非确定性调度与 CPU 负载限制。

 · 更新于 2026-09-25 · 约 23 分钟 · 11312 字 阅读 →
论文解读

低信噪比谐波噪声下先做循环平稳波束形成再做神经网络去噪

针对旋转机械主导的低信噪比谐波噪声,该文用单通道循环平稳最小功率无失真响应做前端抑制谐波再接轻量掩蔽网络,在合成与真实发动机噪声上报告了一致提升,但维纳滤波对照显示增益互补而非可替代,且依赖噪声频率稳定可估计。

 · 更新于 2026-09-25 · 约 17 分钟 · 8446 字 阅读 →
论文解读

跟住键盘手而不是固定磁带:Accomplice 如何把跟谱、指挥与播放拆开做现场电子伴奏

Accomplice 针对键盘 MIDI 现场表演,用分离的跟谱指挥器加可分布播放器和拍号保留的时间调度来跟随真人演奏并输出 MIDI 与 OSC 或 O2 控制,在室内歌剧实测中多数预测误差集中在正负 50 毫秒内,代价是仍需人工处理延长、装饰音与左右手错位等边界情况。

 · 更新于 2026-09-25 · 约 23 分钟 · 11156 字 阅读 →
论文解读

不用步进音序器:五个旋钮的差分如何长出切分,三个光敏电阻又如何捏住音色

该鼓机用五个旋钮的成对差分同时决定乐器选择与十六分音符休止数来生成非固定长度的确定性节奏,并用三个光敏电阻经平滑后控制调频合成的调制量与包络长度,代价是参数到节奏的映射难预测且需要外接效果器才能形成段落叙事。

 · 更新于 2026-09-25 · 约 23 分钟 · 11238 字 阅读 →