作曲家主导与实时约束之间:中心 2025-2026 四个系统的分工与可复述流程
该报告研究如何在作曲家可控与实时可演之间组织计算音乐流程,以分析—规划—实现分层、数据驱动合成与前向预测节拍为方法选择,以乐团读谱与现场演出等实际呈现为证据,代价是未报告受控定量比较与可运行系统的完整参数。
该报告研究如何在作曲家可控与实时可演之间组织计算音乐流程,以分析—规划—实现分层、数据驱动合成与前向预测节拍为方法选择,以乐团读谱与现场演出等实际呈现为证据,代价是未报告受控定量比较与可运行系统的完整参数。
共分析 19 篇语音/AI 论文
论文要解决肌电信号不可听不可判导致的生成模型难调试问题,选择先用含音频的七通道数据找架构再转六通道肌电的策略加两个残差向量量化变分自编码器与交叉注意力解码器 Transformer,最强证据是七通道实验中成功配置重建多样性恢复而过大隐维度配置坍缩,代价是六秒序列限制与推理仍需音频起始符。
针对现场钢琴对话中缺力度、无明确轮次和输出延迟破坏节奏的问题,论文用四元组力度建模加 ggml 加速、脚踏开关标注的呼应微调与逐音符延迟补偿来回应,最强证据是逐音符补偿把节拍对齐中值提高到 0.7834 而无补偿仅 0.0678,代价是上下文能装的音符数从 341 降到 256 且风格仍局限于单人专家数据。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
音频时刻检索要求在数分钟录音中按自由文本返回起止时间,基线用 MS-CLAP 加 QD-DETR 在开发测试集上 Recall1@0.7 为 13.56%,前三名以更强特征与检测网络加分数校准或多分辨率集成达到 48.59%,代价是更复杂的特征组合与后处理。
TokenMapper 针对同有效帧率但码本结构不同的语音分词器做离散域直接翻译,在 GLM、Moshi、DualCodec 六个方向上把跨模型词错误率控制在接近原生重建 2.5-6.8 个百分点内,并以省去波形桥接换来 4.8-94.5% 的传输路径延迟下降,但多码本残差声学细节仍是主要代价。
共分析 27 篇语音/AI 论文
针对一秒脉冲响应要估计数千个密集模态的问题,该工作用音频频谱变换器看全局结构、用动态模态分解提供局部衰减先验,在 1000 条验证上把总相对误差从 1.976 降到 0.867,但增益误差仍高达 0.907 且模态计数偏差仍大。
该工作用注意力端到端语音识别内部后验的不确定性做全盲微观可懂度估计,在 GRID 句库上以熵和离散度指标在相关性和逻辑回归预测准确率上超过直接用识别结果的基线,代价是离散度需额外对齐与多假设打分且结论限于小词汇矩阵句。
针对 Transformer 解码器非因果交叉注意力导致的长删除与重复幻觉,该文提出只在推理时逐 token 右移注意力质心并钳制跳变的方法,在 LibriSpeech 四集上相对基线平均降低 8.9% 词错误率,代价是引入 δ、β、ν 三个需在开发集上调参的启发式阈值且不改变模型参数。
针对电影音轨要分成对白音乐音效的问题,CineSubNet 用稀疏编解码加 Transformer 分离并以 Whisper 加 BERT 字幕作语义先验,在 DnR 全系列上以 SDR 为指标超过 BandIt 等基线,多模态版本代价是参数从 23.5M 到 24.1M 而延迟基本不变。
Con Moto 针对舞蹈即兴中音乐连贯与低延迟难兼得的问题,用推理时掩码转向加 Max/MSP 与 Ableton 后渲染的双层控制连接身体与模型,并在约 70 人现场十分钟双人演出与 6 人问卷中显示可切换乐器与伙伴感知,其代价是实时多乐器密度受限且末段需离线生成。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对 3 英尺胶合板表演面上接触式传声的各向异性与极小时延难题,该工作用四通道接触麦克风加短时频谱回归直接预测笔尖坐标,最强证据是 ResNet50 在全数据上平均 L1 误差 0.191 优于轻量 Transformer 的 0.225,代价是对板 orientation 与装配变化敏感且 R1/R3 误差显著升高。
DyaDiT 针对双人对话中两路语音互相干扰和社会上下文缺失的问题,用正交化交叉注意力分离双路音频并以关系与人格为条件做扩散生成,在 Seamless Interaction 子集上报告了更低的 FD 和更高偏好度,但人格可控性仍受音频隐含线索干扰。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该文以同一 Transformer 比较六种从纯音符到全量表达的切分方式,最强证据是渲染音频的 FAD 均值中音符加速度加踏板为 1.76、全量为 1.97,均优于纯音符基线的 3.10,而节拍标注平均未带来增益且代价是类别间波动大。
论文用动作捕捉配对即兴音乐训练个人化动作到音乐系统,以两阶段压缩加跨模态预测实现实时生成,最强证据是域内重建与分布对齐可用但域外泛化与声码器质量仍是主要代价。