论文解读

不为每句话建分布:DriftAudio 用边际漂移做一步音频的分布后训练

针对自由文本下每条条件只有极少真实样本而难以估计条件分布的问题,DriftAudio 保留文本条件生成而在冻结特征空间匹配边际分布,从 MeanAudio 出发把 FAD 从 1.68 降到 1.11、FD 从 15.43 降到 12.71,从 FdAudio 出发把 FAD 从 1.22 降到 0.99,代价是部分起点上的 IS 与 CLAP 出现回落。

 · 约 18 分钟 · 8952 字 阅读 →
论文解读

短到长真的教会了模型吗:把排序、组批与损失归一化解开

论文把短到长训练拆成呈现顺序、批次组成与损失归一化三件事来测,在 87M 语音词元模型上发现固定组批后排序本身不降困惑度,首轮分组的增益只出现在按批平均的损失下并随词元均衡归一化而消失,而持续排序反而更差。

 · 约 7 分钟 · 3371 字 阅读 →
论文解读

已知录音、未知变速:谐波打击分离如何在 Python 里做到逐帧可变速实时播放

论文把已知录音的谐波打击分离放在离线预处理、把相位声码器与叠加相加放在逐帧可变速的实时合成,并用预计算频谱查表把总运行时间降低约一半,代价是更小的预计算跳长需要更多预计算与内存。

 · 更新于 2026-09-24 · 约 18 分钟 · 8540 字 阅读 →
论文解读

在可解码潜空间里做进化推断:祖先鸟声如何被生成出来

该文把鸟声编码到冻结语音潜空间后学习与系统发育距离对齐的低维性状投影,在性状空间做布朗运动祖先推断再经锚定逆提升解码为新波形,在两个支系上同时实现真实生成、系统发育一致与自然音质,但零空间纹理仍依赖现存录音锚点。

 · 更新于 2026-09-24 · 约 8 分钟 · 3558 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

边听边拧合成器:连续动作强化学习如何做实时音色跟随

该文把现场音色匹配做成每 0.093 秒调一次连续合成参数的强化学习控制问题,用描述符状态加五种奖励在合成器内域与跨域及真实乐器语料上验证,最强证据是同合成器内域匹配显著更准,而代价是跨域只能近似且对描述符与奖励选择高度敏感。

 · 更新于 2026-09-24 · 约 19 分钟 · 9239 字 阅读 →
论文解读

不做成像也能摸:木薯生物塑料薄壳如何变成可分类的触摸声场

该研究把木薯淀粉生物塑料做成不规则触摸面,用 8 电极电场层析扰动加支持向量机分类代替图像重建,在圆形样品与 55 厘米半球壳上验证了中等分辨率触摸词表的一小时稳定与 48 小时漂移代价,最终为一个月展期的低分辨率声音装置选择了保守映射。

 · 更新于 2026-09-24 · 约 22 分钟 · 10691 字 阅读 →
论文解读

把预训练音频网络当电路板:实时改权重参数的网络弯曲

论文把预训练神经音频模型当作可上手摆弄的乐器,用实时修改权重与偏置代替重训练,以两场约二十人工作坊与弯曲日志复用为证据,代价是大量操作只产生静音噪声且弯曲状态尚不能保存复用。

 · 更新于 2026-09-24 · 约 22 分钟 · 10701 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

不录音的磁带:用纸、磁性墨与播放机把图形变成声音

论文用磁性墨把黑白条纹印在纸环上装入标准磁带壳,以普通卡座磁头直接检出磁变化发声,展览用五盘带子验证了无录音也能演奏,但手工印刷与磁化带来每盘独有的不稳定与不可录制性。

 · 更新于 2026-09-24 · 约 19 分钟 · 9341 字 阅读 →
论文解读

不用连线也能发声:把 Pure Data 的波形逻辑搬进 C++ 类

论文把 Pure Data 的数字信号处理对象改写为 C++ 类并保留同名调用逻辑,用噪声与振荡器等实例显示声音一致的改写路径,代价是不自带音频与 MIDI 硬件客户端且线程与内存需开发者自行处理。

 · 更新于 2026-09-24 · 约 21 分钟 · 10201 字 阅读 →
论文解读

逐样本读相位、自调谐保幅度:跟踪共振器组的实时谱分析

针对实时低延迟高分辨率谱分析问题,论文用相邻样本相位差分估计瞬时频率并把估计值反馈为跟踪共振器的共振频率,以自调谐共振器组在无缓冲逐样本更新下输出每样本频率幅度列表,受控正弦与真实音乐谱图显示频率跟踪与幅度保持成立,代价是合成仍有瞬态拖尾与主导器切换相位不连续等初步局限。

 · 更新于 2026-09-24 · 约 21 分钟 · 10255 字 阅读 →
论文解读

可读脚本做中间层:Satie 让空间生成音频可逐行改

针对沉浸式空间音频意图难落实的问题,Satie 用音频优先领域专用语言加浏览器运行时承载大模型代码生成与文本生音频,行数对比显示同需求下脚本约为游戏引擎代码五分之一,而代价是依赖第三方接口与浏览器空间保真度限制。

 · 更新于 2026-09-24 · 约 21 分钟 · 10291 字 阅读 →
论文解读

离散自回归统一音频生成:以首层码本规划与残差声学补全分工控制干扰

StepAudio 3 Gen 用 12.5 Hz 共享 16 码本离散表示把语音、歌声、音效和音乐放在一个自回归流中建模,以主干预测首码本加轻量预测器补全残差码本的分工,在四阶段渐进预训练与零初始化适配下保持文本能力,并在中文人声相似度与声音设计指令遵循上报告了可核对的胜率与一致性得分,其代价是长序列声学建模与多阶段训练流程的复杂度。

 · 更新于 2026-09-24 · 约 24 分钟 · 11918 字 阅读 →
论文解读

不逐个试听,如何在 FM 参数海里找到想要的声音:VibeFM 的采样加可视总览

针对 DX7 类 FM 合成 144 参数空间难手动探索的问题,VibeFM 用 38 参数受控采样加 MFCC 相似度降维总览与四种字形辅助听觉想象,案例显示约 180 分钟做出 6 种声音并带来意外发现,代价是小样本定性评估与外部合成器带来的插值不平滑等限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 10009 字 阅读 →
论文解读

把非线性装进波数字滤波器:KAN 以更少参数逼近多二极管散射映射

该文在波数字滤波器框架下用神经网络显式逼近四端口非线性散射映射,对比多层感知机与柯尔莫哥洛夫-阿诺德网络,发现 KAN 以 40 对 148 个参数达到相近时域频域精度,但实时率从 1.31 升至 4.74。

 · 更新于 2026-09-24 · 约 19 分钟 · 9264 字 阅读 →
论文解读

参考引导的音效变体:用同一生产目标比较不同编辑能力的方法

论文把音效生产归纳为九项需求,用共享的参考到音频变体任务加原生能力分析比较五个异构基线,证据显示 AudioX 在保真与身份保持上最均衡而多样性、时序控制与局部修复各有所长且伴随效率与域外退化代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9663 字 阅读 →
论文解读

只用 5 到 10 分钟实录,如何扩出 19 小时还带逐采样标注的引擎声

该文用转角域重采样加阶次跟踪从实录提取随转速和扭矩变化的谐波指纹,再驱动谐波加噪声合成器生成带四通道嵌入标注的音频,证据是 8 个子集上阶次结构随工况对应且基线网络可收敛,代价是高阶细节为参数化改动而非逐频复刻。

 · 更新于 2026-09-24 · 约 22 分钟 · 10873 字 阅读 →
论文解读

从参数画形到按顶点走形:等弧长引擎如何统一任意多边形、形变与多面体截面

该文把多边形合成改写为等弧长遍历外部顶点缓冲的二维振荡器,用混合插值实现不等顶点数形变、用旋转多面体水平截面扩展到三维,并以四点 polyBLAMP 加自适应过采样压制混叠,最强证据是 M=5 四形状共享谐波格而格外成分低于分析底噪,代价是几何缓存、成对齐与交叉淡化的额外管理。

 · 更新于 2026-09-24 · 约 23 分钟 · 11451 字 阅读 →
论文解读

简单输入画不准、精细能量难手绘:AudioSketch 如何调制出有语义的时间能量

针对单张图像对应多种合理声音的一对多图像到音频生成问题,AudioSketch 用轻量图像到音频映射复用预训练文本到音频扩散模型并以 ControlNet 注入能量轨迹,再用语义条件能量调制器把简单时间戳转换为精炼能量,在 VisualSound 上无控制时以 16.21 的 FD 与 12.41 的 IS 领先同类,而代价是对平滑归一化选择敏感且客观起振对 …

 · 更新于 2026-09-24 · 约 18 分钟 · 8996 字 阅读 →