长叙事音频为何要先分段推理再逐段生成:AudioStory 的分工与衔接
针对长时叙事音频的时间连贯与组合推理难题,AudioStory 用大语言模型做分段规划加扩散模型逐段合成,在自建 AudioStory-10K 上以显式推理和语义加残差双桥接实现更强的指令遵循,但多段拼接与长时一致性仍受训练数据和评估条件的限制。
针对长时叙事音频的时间连贯与组合推理难题,AudioStory 用大语言模型做分段规划加扩散模型逐段合成,在自建 AudioStory-10K 上以显式推理和语义加残差双桥接实现更强的指令遵循,但多段拼接与长时一致性仍受训练数据和评估条件的限制。
针对耳蜗个体差异难以直接调参的问题,该文在可微 CARFAC 上增加后向传输与相干反射路径,以复合损失拟合瞬态诱发耳声发射波形,在传输线模型仿真与 58 耳实测数据上显示可还原不同听力损失形态,但对真实生理状态与泛化仍需更多验证。
该工作在骁龙开发板上实测五种神经音频模型的中央处理器与集成图形处理器推理,问题是流式回调期限下集成显卡何时有效,选择是统一用高通推理栈对比最优中央处理器引擎,最强证据是二维卷积声码器在最小块上图形处理器已全面领先,主要代价是小模型与循环模型的调用开销反而拖慢并需要借用大缓冲换并行。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对可调旋钮的黑盒虚拟模拟在旋钮转动时出现噪声的问题,论文用深层拼接条件 LSTM 加谱范数或无穷范数正则与 32 通道 Gammatone 滤波损失,在三块效果器数据上把正则模型的精度追近无正则基线,同时把零输入下的控制噪声压到实用底噪以下,但同等规模下正则仍有小幅精度代价。
该装置用双特雷门手势驱动水下水听器产生湍流并以此激励只在太澳与香港仔海岸环境录音约 thirty hours 上训练的 RAVE 模型,代价是约 90-250 milliseconds 的可感知延迟与激进手势对神经信号的掩蔽,只在水面平静时才让历史以时间包络形式短暂可闻。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
八名研究生在同一减法合成器作业中对比有无 GitHub Copilot,报告显示助手主要改善代码组织而非振荡器抗混叠与滤波器拓扑等领域正确性,且口试表达未见明显受损,但样本极小只能作试点参考。
论文指出波形误差是增益误差的带载波代理,易被次生效应淹没,用实测控制电压直接计算增益误差并训练灰盒模型后,直接监督在增益误差上明显优于波形代理,而波形指标对差异显著的模型给出相近分数,代价是需要同步采集控制电压并建设约 270 GB 的大规模数据集。
针对 Fulltone OCD v2 中 MOSFET 加锗二极管构成的非对称削波级难以实时求解的问题,论文把三个非线性合并为单个等效一端口并用分段线性函数显式映射,在 1 V、1 kHz 正弦和 96 kHz 采样下时域误差低至千分之量级,而显式方法实时比 0.14 约为迭代方法 3.12 的二十二分之一。
论文把虚拟模拟看作固定时长区间上的算子学习,用傅里叶域参数化加帧重叠相加实现单采样率训练、多采样率推理,在 Big Muff Pi 输入级上上采样与基线相当且可直接下采样,代价是帧缓冲结构和内部上采样带来的计算量。
本文以文献综述回答手工声音艺术如何把施密特触发器从信号调理器件转作发声振荡器,最强证据是近 450 篇英文书刊论文的编码与 20 世纪到 21 世纪案例链,代价是排除了在线论坛与非英文材料因而尚不完备。
该文把均匀波形约简为带时间戳的局部极值点并用其间距逐样本控制重叠相加的拼接时机与时长,在嵌入式算力下保住瞬态,代价是频谱对比度损失与三次样条谐波失真。
论文把一个数学纽结交叉改写为两个三端口并联结点串起的环形波导,用采样率 96 kHz 下 1.0 seconds 脉冲响应证明中段长度能重塑共振峰包络而基频平均仅偏移约几 Hz,代价是在特定中段出现约 25.0 Hz 与约 20.0 Hz 量级的估计尖峰和部分谐波抵消。
针对解码器独奏式潜空间漫游难以控制且标准多层感知机存在谱偏置的问题,论文用傅里叶特征坐标映射把音频集的潜轨迹铺成二维可交互地形,在鼓、弦乐与语音三类素材上提升映射精度且仅轻微增加实时开销,代价是高斯尺度需手工权衡欠拟合与过拟合。
论文以二维波方程与商空间拼贴推导矩形、环面、莫比乌斯带、克莱因瓶与实射影平面的闭式模态,并用有限差分时域仿真验证频率误差约 0.02% 量级、模态置信接近 1,代价是不可嵌入三维的非定向拓扑只能在平面基本域加边界规则中间接实现。
问题是用现成神经音频编解码器做可演奏的音色迁移,方法是不训练新生成器而检索调色板令牌颗粒并做连续性约束的序列选择与分组替换,最强证据是调色板扩展下中位实时系数仍低于实时,而代价是分块渲染与完整上下文不等价且缺乏听感验证。
针对波数字滤波器实时仿真中面向对象抽象与冗余状态带来的开销,论文用描述语言加静态编译生成最小状态代码,在四类电路上以每样本周期数与指令数为证据逼近理论性能界,代价是拓扑必须在编译时固定并依赖热重载维持可修改性。
针对发动机爆燃脉冲的时序本质,论文用可微脉冲串加卡普拉斯-斯特朗共振器重建声音,在三类发动机共 7.5 小时音频上把总验证损失平均降低 5.7%、谐波重建提升 21%,代价是共振器音色偶尔偏离目标且尚未在真实录音上验证。