论文解读

作曲家主导与实时约束之间:中心 2025-2026 四个系统的分工与可复述流程

该报告研究如何在作曲家可控与实时可演之间组织计算音乐流程,以分析—规划—实现分层、数据驱动合成与前向预测节拍为方法选择,以乐团读谱与现场演出等实际呈现为证据,代价是未报告受控定量比较与可运行系统的完整参数。

 · 更新于 2026-09-24 · 约 20 分钟 · 9548 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-15

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 38 分钟 · 18639 字 阅读 →
论文解读

肌电难听难看时如何调模型:用音频通道做拐杖的跨模态信号翻译

论文要解决肌电信号不可听不可判导致的生成模型难调试问题,选择先用含音频的七通道数据找架构再转六通道肌电的策略加两个残差向量量化变分自编码器与交叉注意力解码器 Transformer,最强证据是七通道实验中成功配置重建多样性恢复而过大隐维度配置坍缩,代价是六秒序列限制与推理仍需音频起始符。

 · 更新于 2026-09-24 · 约 19 分钟 · 9367 字 阅读 →
论文解读

把力度、角色与延迟一起改写:jam_bot 如何实现可接话的音乐对话

针对现场钢琴对话中缺力度、无明确轮次和输出延迟破坏节奏的问题,论文用四元组力度建模加 ggml 加速、脚踏开关标注的呼应微调与逐音符延迟补偿来回应,最强证据是逐音符补偿把节拍对齐中值提高到 0.7834 而无补偿仅 0.0678,代价是上下文能装的音符数从 341 降到 256 且风格仍局限于单人专家数据。

 · 更新于 2026-09-24 · 约 19 分钟 · 9184 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

长音频里按文字找片段:对齐要准,时间也要准

音频时刻检索要求在数分钟录音中按自由文本返回起止时间,基线用 MS-CLAP 加 QD-DETR 在开发测试集上 Recall1@0.7 为 13.56%,前三名以更强特征与检测网络加分数校准或多分辨率集成达到 48.59%,代价是更复杂的特征组合与后处理。

 · 更新于 2026-09-24 · 约 19 分钟 · 9399 字 阅读 →
论文解读

不经过波形也能翻译语音令牌:TokenMapper 的同速率跨码本映射

TokenMapper 针对同有效帧率但码本结构不同的语音分词器做离散域直接翻译,在 GLM、Moshi、DualCodec 六个方向上把跨模型词错误率控制在接近原生重建 2.5-6.8 个百分点内,并以省去波形桥接换来 4.8-94.5% 的传输路径延迟下降,但多码本残差声学细节仍是主要代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9232 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-14

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 57 分钟 · 28192 字 阅读 →
论文解读

薄板混响有数千个挤在一起的模态,双流如何同时看全局与局部衰减

针对一秒脉冲响应要估计数千个密集模态的问题,该工作用音频频谱变换器看全局结构、用动态模态分解提供局部衰减先验,在 1000 条验证上把总相对误差从 1.976 降到 0.867,但增益误差仍高达 0.907 且模态计数偏差仍大。

 · 更新于 2026-09-24 · 约 18 分钟 · 8657 字 阅读 →
论文解读

不用干净语音和 transcript,能否用端到端识别的不确定性估计每个词的可懂度

该工作用注意力端到端语音识别内部后验的不确定性做全盲微观可懂度估计,在 GRID 句库上以熵和离散度指标在相关性和逻辑回归预测准确率上超过直接用识别结果的基线,代价是离散度需额外对齐与多假设打分且结论限于小词汇矩阵句。

 · 更新于 2026-09-24 · 约 18 分钟 · 8802 字 阅读 →
论文解读

自回归交叉注意力丢了时间因果:用质心右移把对齐拉回来

针对 Transformer 解码器非因果交叉注意力导致的长删除与重复幻觉,该文提出只在推理时逐 token 右移注意力质心并钳制跳变的方法,在 LibriSpeech 四集上相对基线平均降低 8.9% 词错误率,代价是引入 δ、β、ν 三个需在开发集上调参的启发式阈值且不改变模型参数。

 · 更新于 2026-09-24 · 约 18 分钟 · 8609 字 阅读 →
论文解读

字幕能帮耳朵分轨吗:CineSubNet 用文本先验做电影对白音乐音效分离

针对电影音轨要分成对白音乐音效的问题,CineSubNet 用稀疏编解码加 Transformer 分离并以 Whisper 加 BERT 字幕作语义先验,在 DnR 全系列上以 SDR 为指标超过 BandIt 等基线,多模态版本代价是参数从 23.5M 到 24.1M 而延迟基本不变。

 · 更新于 2026-09-24 · 约 15 分钟 · 7049 字 阅读 →
论文解读

舞者身体如何实时转向音乐 Transformer:Con Moto 的可配置代理

Con Moto 针对舞蹈即兴中音乐连贯与低延迟难兼得的问题,用推理时掩码转向加 Max/MSP 与 Ableton 后渲染的双层控制连接身体与模型,并在约 70 人现场十分钟双人演出与 6 人问卷中显示可切换乐器与伙伴感知,其代价是实时多乐器密度受限且末段需离线生成。

 · 更新于 2026-09-24 · 约 20 分钟 · 9644 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

在胶合板上听笔尖位置:小数据声源定位为何不用时延估计

针对 3 英尺胶合板表演面上接触式传声的各向异性与极小时延难题,该工作用四通道接触麦克风加短时频谱回归直接预测笔尖坐标,最强证据是 ResNet50 在全数据上平均 L1 误差 0.191 优于轻量 Transformer 的 0.225,代价是对板 orientation 与装配变化敏感且 R1/R3 误差显著升高。

 · 更新于 2026-09-24 · 约 17 分钟 · 8103 字 阅读 →
论文解读

双人对话手势为何要先分清谁在说话:DyaDiT 用解耦音频与社会条件生成可控动作

DyaDiT 针对双人对话中两路语音互相干扰和社会上下文缺失的问题,用正交化交叉注意力分离双路音频并以关系与人格为条件做扩散生成,在 Seamless Interaction 子集上报告了更低的 FD 和更高偏好度,但人格可控性仍受音频隐含线索干扰。

 · 更新于 2026-09-24 · 约 19 分钟 · 9490 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

表现力从哪里来:速度、踏板与节拍标注谁真正改变了钢琴生成

该文以同一 Transformer 比较六种从纯音符到全量表达的切分方式,最强证据是渲染音频的 FAD 均值中音符加速度加踏板为 1.76、全量为 1.97,均优于纯音符基线的 3.10,而节拍标注平均未带来增益且代价是类别间波动大。

 · 更新于 2026-09-24 · 约 19 分钟 · 9019 字 阅读 →
论文解读

动作生音乐为何先学压缩再学对齐:个性化舞蹈乐器的取舍

论文用动作捕捉配对即兴音乐训练个人化动作到音乐系统,以两阶段压缩加跨模态预测实现实时生成,最强证据是域内重建与分布对齐可用但域外泛化与声码器质量仍是主要代价。

 · 更新于 2026-09-24 · 约 22 分钟 · 10778 字 阅读 →