一个旋钮管住五种距离线索:把声源推远而不推散的耦合渲染器
该演示用归一化距离参数同时驱动增益、混响比、高频吸收、预延迟和低频补偿五种线索并保持互洽,在 18 人耳机测试中把三声源距离摆放误差从手动混音的 15.3 点降到 7.3 点,代价是 48 kHz 下双耳级开启时 CPU 峰值约 10.5% 与固定 10.7 ms 分区延迟。
该演示用归一化距离参数同时驱动增益、混响比、高频吸收、预延迟和低频补偿五种线索并保持互洽,在 18 人耳机测试中把三声源距离摆放误差从手动混音的 15.3 点降到 7.3 点,代价是 48 kHz 下双耳级开启时 CPU 峰值约 10.5% 与固定 10.7 ms 分区延迟。
针对语音训练的伪造检测器在歌声上失效的问题,论文用对数梅尔谱、MFCC 与 Wav2Vec2 三专家加门控融合与 50/50 语音歌声联合微调,在 CtrSVDD 上报告 1.82% 等错误率并在 ASVspoof 2019 上保持 0.38%,代价是多分支推理开销与 SingFake 野外数据上仍高达 44.20%。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对符号音乐中音符属性被强加固定单向顺序的问题,Amadeus 采用音符级自回归加属性级双向离散扩散的两级架构并引入 CIEM,在 AMD 大规模数据上以 16.23 notes/s 实现文本条件与可控生成的提升,代价是扩散步数与速度需权衡且数据存在风格偏置。
针对长序列符号音乐自回归生成中误差累积导致结构漂移的问题,论文提出先预测块级语义再重建音符细节并用已生成块回嵌为锚的循环范式与分草图细化的层次框架,最强证据是预测特征与真值余弦距离平均降低 34.7% 且长序列主客观评价接近真值,代价是钢琴卷表示压缩可能丢失细微时值与目前主要面向钢琴。
针对文本到音乐模型的黑盒提示词窃取问题,AudioStealer 用相似度引导的启发式搜索定方向、再用沙普利值量化各语义单元贡献做精修,在 InspireMusic 上以语义 59.4%、音乐 70.1% 的可复现流程实现最强证据,代价是依赖本地影子模型的多次查询与精修计算。
针对反转式音频编辑必须用密集固定步数导致计算昂贵的问题,论文提出免训练的自适应轨迹外推框架 AdaTE,只在高曲率与高信息增益处做神经网络评估,其余用线性外推跳过,在 AudioLDM2 上以 12.8 次评估达到 3.9 倍加速且保真度基本不降,但激进阈值与极端不稳定轨迹仍会带来退化。
论文以语音、音乐、环境音和歌声四类伪造检测为问题,用单前端、双前端与蒸馏双前端对比自监督前端选择,最强证据是 XLS-R 加 EAT 十八层双前端在联合训练下取得最低平均等错误率,代价是前端参数量明显增大且混合音频仍大幅退化。
论文把问题定为给定干声吉他与目标效果标签、合成对应效果声并保留音乐内容,用同一事件序列配对的 EGFxSet 衍生数据比较四种谱变换模型,最强证据是 log 幅度 U-Net 相对复制输入基线平均改善 MSE 约 70.6% 与 FAD 约 31.8%,代价是延迟混响类 FAD 增益弱且域外真实演奏变换减弱。
针对标准 LZ 压缩倾向于整段拷贝训练数据的问题,该文用限制每棵树训练数据量来缩短平均序列长度、用多步不回根来加长平均序列长度,并在 MAESTRO 约 200 小时钢琴 MIDI 音高数据上验证了控制方向,代价是省略节奏导致机械感与长序列带来的逐字拷贝风险仍需抄袭检测来界定。
针对包含速度调性和弦的细粒度音乐检索,FIGMA 冻结 MuQ 与 E5 双编码器只训练投影头并联合全局与帧级对比损失,在 MusicBench 与 FMACaps-Eval 上报告最高 73.3% 相对提升,代价是依赖自动特征提取与单句客观描述的构造流程。
该工作把任意输入音频的频谱特征映射到在 7999 个电子舞曲鼓循环上学到的 256 个离散节奏原型,再用力度解码器恢复动态并用用户原声合成,在验证集上重建汉明距离为 0.0064、力度误差相对均值基线降低 77.4%,代价是 2000 个环境声音只激活 50% 码本且弱音表现不足。
针对巨型傅里叶变换改相位会破坏频率间时间关系并把离散事件抹成持续纹理的问题,论文把相位转成群延迟做谱峰分割与整组均匀搬移,用合成与实录四音逆序、振幅比例展开与正弦调制复制证明离散包络可保留,代价是共享频点的重叠事件无法独立重排。
针对语音、环境声、音乐三域音频幻觉缺少大规模可诊断评测的问题,HalluAudio 用 5720 对人工校验问答与对抗诱发设计做零样本评测,报告显示结构与感知幻觉普遍存在而准确率无法代替可靠性判断。
针对一次指令只给一个预设、无法在已有参数上连续修改的问题,论文用大语言模型做效果选择与初始化、再用 CLAP 引导的优化做原地微调,在 SocialFX 均衡器词对上 10 组中有 9 组的最大均值差异低于重提词基线,但非可微效果与长时间优化仍不稳定且每轮需要秒级计算。
针对单轨音乐问答无法考察跨轨比较的问题,该研究用四阶段流水线构造每对三问的比较问答集,并用统一评测显示句子级比较解释是当前模型的主要瓶颈,而其代价是严格过滤后保留高精度子集与依赖文本中间表示。
针对现场演出中传感器链路易失灵的问题,L-Bow 用腕戴六轴惯性单元加 Csound 原生 arduinoRead 直读串口,把采集、六种演奏模式与共享效果链收进单个.csd 文件,报告显示 20 次触发测试零误触发且平均延迟比 Python-OSC 桥低 22.5 ms,代价是 10 位量化和 9600 波特率下的分辨率与帧时间限制。
该文把求载波复音以产生目标二次差频谱的问题转成学习失真函数连续近似逆,用齐次结构加课程式训练换来可实时插值的合成器,代价是重建误差略高于随机牛顿迭代。
针对 MIDIBERT 做符号音乐情绪识别时调式-情感关联缺失的问题,用 Krumhansl-Kessler 提取大/小调并以 FiLM 注入第一层,在 EMOPIA 达 75.2% 准确率、VGMIDI 达 59.1% 准确率,代价是只用二分类调式并依赖自动调式估计的正确性。