论文解读

复刻缺全流程代码的乐器分离模型:性能差距与能量代价从何而来

该文复刻频带切分循环网络用于人声贝斯鼓与其他四轨分离,在公开数据集上补齐预处理与训练细节并对比多种设计,结果显示大模型与替代增强可缩小与原报告的差距,但耐心延长与全项目试错带来数十倍于单次训练的能量开销。

 · 更新于 2026-09-24 · 约 23 分钟 · 11196 字 阅读 →
论文解读

小参数做音频问答:Samsone 用裁词表与减层数换端侧可运行

Samsone 针对端侧音频问答,用 Whisper-Tiny 编码器加 SmolLM2 解码器与非线性映射器做单阶段训练,在 MMAU 与 MMAU-Pro 上超过同级小模型并接近部分大模型,代价是通用语言能力下降且未做移动端硬件级优化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8844 字 阅读 →
论文解读

离线也要又快又准:Jarvis 用本地微调小模型做赛车语音指令分类

针对赛车高层行为指令的离线语音控制问题,Jarvis 用唤醒词加本地转写加微调 Mistral 7B 做文本到指令分类,在 17 类 1645 样本条件下报告 97.63% 准确率与 1.39 s 平均延迟,但数据集仍部分合成且指令空间严格预定义。

 · 更新于 2026-09-24 · 约 18 分钟 · 8797 字 阅读 →
论文解读

已知录音、未知变速:谐波打击分离如何在 Python 里做到逐帧可变速实时播放

论文把已知录音的谐波打击分离放在离线预处理、把相位声码器与叠加相加放在逐帧可变速的实时合成,并用预计算频谱查表把总运行时间降低约一半,代价是更小的预计算跳长需要更多预计算与内存。

 · 更新于 2026-09-24 · 约 18 分钟 · 8540 字 阅读 →
论文解读

缺口比模型阶数还短时,Etter 的双向自回归插值还能解吗

论文复活 Etter 双向自回归插值,用前后向预测残差能量最小导出线性方程组求缺口样本,并给出短缺口高阶模型和因果丢包隐藏两种扩展,在 80 毫秒内音乐缺口上与多数基线相当但弱于逐缺口 Janssen 迭代法且外插简化版更快。

 · 更新于 2026-09-24 · 约 18 分钟 · 8983 字 阅读 →
论文解读

在时域里做混叠抵消:OLAC 如何对齐 MDCT 重叠实现无缝有损无损切换

针对无线音频需在有损与无损之间无断点切换的问题,OLAC 只做可逆时域混叠抵消加窗而不做整数 MDCT 变换,用前向线性预测与 Golomb-Rice 编码实现无损压缩,在 20 毫秒帧下平均压缩到 56.8%,代价是帧间预测被切断且随机访问需先解前一帧。

 · 更新于 2026-09-24 · 约 22 分钟 · 10600 字 阅读 →
论文解读

把音高、能量和语速画在同一条线上:VIP2VIP 的三维韵律可视化管线

针对单看基频会把重音归因给音高的问题,该文选择在平滑后的基频线上同时编码瞬时强度与局部音节速率,并在意大利诗歌朗读上展示联合线索如何区分延续类边界,代价是颜色只表相对快慢且跨录音比较仍需归一化。

 · 更新于 2026-09-24 · 约 22 分钟 · 10629 字 阅读 →
论文解读

造循环器学信号处理:把录音、叠加与消咔哒声做成可跟做的课程

该文以在 Max、gen~ 与 RNBO 中逐步建造现场循环器为教学方法,让学生在录音播放、叠加与去咔哒声等真实音乐任务中学习缓冲与时序,课堂观察显示参与度和迁移能力提升,但 gen~ 与 RNBO 的转换仍受单学期时间与代码畏难情绪限制。

 · 更新于 2026-09-24 · 约 22 分钟 · 10835 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

穹顶之上的作曲笔:Zirkonium 如何把 47.4 通道的空间位置变成可写的参数

论文要解决的是作曲家无需技术人员即可在可变扬声器穹顶上精确定位与编排声音运动的问题,选择向量幅度平移加后期高阶环绕声的可移植路线,以三代软件迭代与上千场音乐会实践为证据,代价是长期依赖 macOS 与人工搭建调音链路。

 · 更新于 2026-09-24 · 约 19 分钟 · 9428 字 阅读 →
论文解读

把作曲拆成共享状态上的分工:BbMuse 的黑板式实时交互框架

针对临时拼凑的多智能体与单体黑盒难复用难实时的问题,论文用类型化共享黑板加需要与提供声明实现自动拓扑调度,并在纯 Python 加原生库加速的路线下给出模块化可增量扩展的工程方案,代价是暂无定量性能评测与图形化工具仍在开发中。

 · 更新于 2026-09-24 · 约 25 分钟 · 12191 字 阅读 →
论文解读

不会写脚本也能用 PsyToolkit:DYE 把感知评测做成图形化拼装

针对非专家用户难以编写 PsyToolkit 脚本的问题,DYE 用 R 与 Shiny 图形界面拼装强迫选择与李克特量表并生成可直接导入编译的代码与图片,代价是目前仅覆盖 PsyToolkit 有限子集且多元素需顺序呈现。

 · 更新于 2026-09-24 · 约 17 分钟 · 8118 字 阅读 →
论文解读

把建成的馆再唱出来:以直纹面几何逆转从滑音到建筑的单向路径

该研究把飞利浦馆重建为九片直纹面并提取线与点来驱动弦乐滑音、五个能量块与稀疏铜管木管事件,最强的可核对证据是 36 条弦乐线与 3357 个采样点的确定性构造,代价是均匀插值难以保留局部曲率与统一配器难以推广到其他风格。

 · 更新于 2026-09-24 · 约 23 分钟 · 11250 字 阅读 →
论文解读

把文本变成手码:TextCueS 如何让 LfPC 编码步骤可见可改

论文要解决从文本生成法语 LfPC/提示语编码的教学工具缺失问题,选择把生成引擎与语言规则分离并暴露三步可核对流程,其证据是已验证的生成引擎与用户测试过的界面,而代价是美式英语长元音三维动作在二维显示上尚未优化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8652 字 阅读 →
论文解读

多人同演不混乱:Gestalt 用分层与加权聚合保住表演者结构

Gestalt 针对 50-200 人实时共演的参与门槛与延迟问题,采用浏览器端边缘计算加双层异构架构与活动加权聚合,在本地单机实验室压力测试中报告 200 人稳定与约 60 毫秒端到端延迟,代价是公网隧道下稳定上限降至 80 人且未经过大规模公演验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10383 字 阅读 →
论文解读

抛球晚两秒才响:音乐杂耍如何记谱与仿真

针对铃球接住才发声带来的延迟与换球规划难题,论文用音乐 Siteswap 记谱加三维动画组件把整场演出算成可排练的事件序列,已能复现协奏曲等复杂曲目,但仍需补创作与训练环节的可用性验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10095 字 阅读 →
论文解读

把预训练音频网络当电路板:实时改权重参数的网络弯曲

论文把预训练神经音频模型当作可上手摆弄的乐器,用实时修改权重与偏置代替重训练,以两场约二十人工作坊与弯曲日志复用为证据,代价是大量操作只产生静音噪声且弯曲状态尚不能保存复用。

 · 更新于 2026-09-24 · 约 22 分钟 · 10701 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →