用极值点间距决定拼接长短的关键帧时间拉伸
该文把均匀波形约简为带时间戳的局部极值点并用其间距逐样本控制重叠相加的拼接时机与时长,在嵌入式算力下保住瞬态,代价是频谱对比度损失与三次样条谐波失真。
该文把均匀波形约简为带时间戳的局部极值点并用其间距逐样本控制重叠相加的拼接时机与时长,在嵌入式算力下保住瞬态,代价是频谱对比度损失与三次样条谐波失真。
针对单模态压缩器重复部署与大模型压缩器过重的问题,OmniZip 用统一可逆分词加双路模态路由的轻量序列模型预测概率再算术编码,在 16 个数据集上接近专用方法并在笔记本与手机上接近实时,代价是自然图像与基因等难例仍弱于专用大模型。
该研究用树莓派加 MIDI 连接现成乐器的智能乐器平台和小数据混合密度循环网络做两年第一人称演出,报告显示最便宜硬件推理小于 5 毫秒且重映射可替代重训,但证据限于作者一人 15 场演出而未做对照听感评估。
该研究用市售游戏手柄加本地 3D 打印辅助件加安卓开源应用解决无障碍乐器难以持续复制的问题,在印度北部非营利组织的 7 人部署中验证了可本地采购组装和约 15 分钟上手,但未做正式效果评估且存在音频格式与配件适配代价。
论文把作曲从指定事件改为设定条件,用三层架构与成对射频加声学校准推断相对拓扑来参数化局部耦合,合成验证显示双模态距离误差降到 10.03 cm 左右而位置误差方差仍大,代价是真实房间性能尚未验证。
针对切分学习中 ViT 中间激活传输开销大的问题,论文提出先按 CLS 注意力聚类合并样本再按簇质心保留 Top-k 令牌的 ADC,在固定通信预算下用更少样本和更短序列完成前后向,并在 DeiT-T/S 上以更低压缩比保持精度,代价是客户端约 5.1% 的 K-means 聚类开销。
针对已知说话人提取任务,论文提出掩码加深滤波的 DualDF 并用逐块特征蒸馏把块数与隐层压缩,教师约 12 块 224 维、学生在 6 块 120 维等配置下仍保持目标音质,代价是背景抑制主要依赖掩码分支且轻量学生仍需教师监督。
论文研究如何在低功耗乐器内嵌入可调映射学习,让演奏者在演奏中用奖惩塑造神经网络映射,报告显示可高速探索大参数空间但精调困难且依赖预设偏置。
该工作用迭代局部幅度剪枝去掉 90% 可剪枝权重,并以只遍历非零权重的自研中央处理器稀疏引擎在 48 kHz 与 256 采样块下把实时因子压到约 0.6 实现实时运行,代价是超出感受野的长混响尾音误差增大与高增益下和输入无关的噪声嗡声无法复现。
针对单乐器身份未知的乐器无关转录,Harmonica 以 CQT 输入与多深度谐波卷积在多源温度采样训练下实现 26.3K 至 15.1M 的规模化,x-large 在多数测试集上取得最高帧 F1,medium 以 848.5 倍实时保持可比精度,nano 以 1622.5 倍实时仍显著超过同量级基线。