不重建人体动作:把音频当风格信号直接驱动人形机器人跳舞与演讲
论文把音乐与语音当作隐式风格控制信号,用音频-动作对齐加残差混合专家教师与内容加风格扩散学生实现免重定向的音频到关节动作映射,在 FineDance 与 BEAT2 上报告了检索与跟踪指标,但跨仿真与真机泛化仍受数据集与物理条件限制。
论文把音乐与语音当作隐式风格控制信号,用音频-动作对齐加残差混合专家教师与内容加风格扩散学生实现免重定向的音频到关节动作映射,在 FineDance 与 BEAT2 上报告了检索与跟踪指标,但跨仿真与真机泛化仍受数据集与物理条件限制。
Ehecatl 把 Voladores 仪式的 Quincunx 空间逻辑做成可演奏的映射,用磁罗盘方位交叉淡化四个加法振荡器、用风车气流同时控制幅度与滤波、用倾斜与触键做精细修饰,原型已实现独立发声与开源复现,但方位对比度与结构稳定性仍待加强。
论文把小提琴琴桥导纳看作有限维线性系统,用特征系统实现算法从实测脉冲响应直接做汉克尔矩阵奇异值分解得到降阶状态空间,并在六把小提琴上以时域频域与能量衰减三类误差对比两版模态拟合基线,代价是高阶近似与尚无听感实验。
该文要解决现场表演中表达意图与听众感受难以对齐记录的问题,选择设计一套从练习曲到即兴的可重复多模态采集协议,用 16 场录音的阶段与表达性对照趋势验证流程可行,代价是商用低通道传感器保真度有限且样本存在西方与人口偏斜。
针对和弦标注稀缺与分布不平衡问题,该工作先用预训练 BTC 教师在 1000 多小时无标注音频上生成伪标签训练学生,再用少量真值标签加选择性知识蒸馏做数据增量持续训练,最强 BTC 学生在七个 mir_eval 指标上超过教师与监督基线,代价是依赖教师质量并需保存完整软目标带来额外显存开销。
Ephemerides 把跨性别声音训练中的共鸣操控变成乐器演奏法,用喉头贴片换能器把振荡器组送进声道再用话筒拾取反馈选音,实践表明它能绕开声带发声并重塑听觉意象,代价是需要长期练习且目前只能做等距微分音阶。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该文以同一 Transformer 比较六种从纯音符到全量表达的切分方式,最强证据是渲染音频的 FAD 均值中音符加速度加踏板为 1.76、全量为 1.97,均优于纯音符基线的 3.10,而节拍标注平均未带来增益且代价是类别间波动大。
针对 Fulltone OCD v2 中 MOSFET 加锗二极管构成的非对称削波级难以实时求解的问题,论文把三个非线性合并为单个等效一端口并用分段线性函数显式映射,在 1 V、1 kHz 正弦和 96 kHz 采样下时域误差低至千分之量级,而显式方法实时比 0.14 约为迭代方法 3.12 的二十二分之一。
该工作以微分音杠杆竖琴 Harp-E 为起点,用配重鱼线和悬挂织物做机械扩展,再让合成延续拨弦、持续激励与杠杆弯音的发声逻辑,在多媒体即兴演出 De-dimension 中实现可参与的多模态乐器环境,代价是未做定量评估与延迟测量,仅为概念验证。
针对纯音频反馈音高难控的问题,论文把传声器放进可变开孔的亥姆霍兹球腔以约束反馈频率,并用白噪声、反馈啸叫与贴耳听辨三组开孔峰值贴近证明腔体主导,但换音箱与拉距离仍会破坏音高一致性。
针对新手三人走近即玩时难对拍难感知同伴的问题,研究用鼓键风箱管三角色加地板与乐器振动做展品,并在 21 人实验室对照中发现节拍脉冲最稳而混合反馈易增加负荷。
论文针对双算子 FM 同时估计载波与调制频率易陷局部极小的问题,提出把频率比约束在相邻低阶有理边界之间的多起点梯度优化,在 90 组受控合成测试中把成功率提高到 96.7%,代价是每个用例要并行跑 9 个候选且真值恰在边界上仍会失败。
针对给定目标音色从预设库中找回最接近 DX7 预设的问题,论文用 SLAP 式音频参数联合嵌入加仿真调制信号流的 DX7-GNN 编码器,在未见拓扑上以 52.2% R@1 超过 Transformer 与 Highway 基线,代价是依赖算子交换增强与单音高单力度渲染条件。
论文把虚拟模拟看作固定时长区间上的算子学习,用傅里叶域参数化加帧重叠相加实现单采样率训练、多采样率推理,在 Big Muff Pi 输入级上上采样与基线相当且可直接下采样,代价是帧缓冲结构和内部上采样带来的计算量。
论文报告在巴西累西腓 Paço do Frevo 为期两周驻留中四位音乐舞蹈艺术家探索可穿戴乐器 Giromin v0.5 的过程,用六次访谈的反思性主题分析提炼六个主题,最强证据是双重音乐舞蹈能力构成结构性准入,而代价是 Max 补丁的集中式改参流程反复打断具身探索状态。
该研究把演出中实时声音做音高检测并每轮生成 12 度动态音阶去重调键盘、合成与房间反馈,其最强证据是两年现场与房间反馈系统的可演奏性,代价是调音映射不稳定且无定量听感或稳定性评估。
该文把音乐风格迁移拆成视觉文本联合定风格与色度约束保旋律两件事,用无反演流直接搬运隐变量并以内层梯度拉回音高结构,代价是旋律锚定越强时目标风格贴合会轻微下降。
针对联合扩散中双路噪声导致的对齐漂移,Harmony 用音频驱动与视频驱动辅助任务提供干净锚点,并以全局局部解耦交互与同步增强引导提升细粒度同步,主结果报告 Sync-C 为 5.61、Sync-D 为 7.53,代价是三阶段训练与双分支推理开销。
针对固体共振物体声音恢复弱且染色重的问题,该工作用模态形状梯度与二阶模态传递函数建立多点双轴散斑位移到声源的前向模型并做正则优化反演,在鼓等多物体上比单点、平均与固定延迟融合更干净,但高频模态漏检仍是主要代价。