从音频到可弹指法:手部分离与指法标注为何必须联合建模
该文把钢琴音频转录后的音符序列当作手与手指联合标注问题,用双向卡尔曼加分手隐马尔可夫的合成模型与四元三元语言模型在 PIG 上分别达到 90.8% 手部分离与 56.6% 联合准确率,而端到端管线召回降至 65.7% 与 37.0%,代价是统计模型仍受古典数据与合成音频评估限制。
该文把钢琴音频转录后的音符序列当作手与手指联合标注问题,用双向卡尔曼加分手隐马尔可夫的合成模型与四元三元语言模型在 PIG 上分别达到 90.8% 手部分离与 56.6% 联合准确率,而端到端管线召回降至 65.7% 与 37.0%,代价是统计模型仍受古典数据与合成音频评估限制。
SE-MSB 用扩散薛定谔桥在干净与退化语音分布之间学习双向随机输运,并以端到端 Mamba 波形模型实现,在去混响与混合退化上报告可比拟配对方法的效果,同时保持少步采样与低计算量。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对管乐谱到音频缺少可控可复现数据的问题,论文用 311 首四部圣咏的 MEI 编码加规则表情模型加物理建模合成构建对齐的多轨数据,最强证据是 86 小时隔离音轨与 640000 种组合的完全对齐标注,代价是合成音色不及真实录音且不追求数据驱动最优音质。
该研究把长语音切成片段并编码为与法语句向量对齐的语音片段向量,直接送入改造后的法语编码器解码器生成法语摘要,在呼叫中心对话和小规模跨语言合成语音上报告了与级联和音频大模型对照的可核对结果,但大模型对照为零样本且跨语言语音为合成。
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该文把线性链条件随机场中的硬维特比解码换成温度控制的软最大值近似得到可微模块 dCRF,并在双声部干扰下的音高类别估计中显示 Toeplitz 约束的 dCRF-T 接近双向长短期记忆网络精度但参数少得多,而全参数 dCRF 提升有限。
该研究用可微扩展 Karplus-Strong 做事件级声音匹配,证明时域拉格朗日插值梯度可用且无时间混叠,揭示频谱损失无法给出多事件起音方向梯度,仅用合成参数损失能学到音高音色与起音但难泛化,真机上外部检测器加音频损失最稳,而谐波加噪声基线多数重建指标更高。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
针对马普敦贡语到西班牙语的极低资源语音翻译,论文冻结 Canary-1B-v2 并只训练约 589k 参数的线性适配器、用英语源语言占位实现翻译方向劫持,开发集上时长过滤版本取得 1.56 的词错率和 3.7 的 BLEU,测试集上过滤版本取得 0.82 的 BLEU 和 14.31 的 chrF2++,代价是仍存在重复解码和极低的绝对分数。
针对转写文本丢失语气与环境线索且难以拆解分层话术的问题,SAFE-QAQ 用端到端音频大模型加三阶段规则奖励强化学习做慢思考推理,在 TeleAntiFraud-Bench 上以 SAFE-LS 取得场景 84.64、欺诈 89.61、类型 88.23 的加权 F1,代价是仍依赖单一数据集且实时版类型精度有所下降。
VocalCap 把一次浏览器录音拆成原生对象、客户端无损 WAV 与服务端规范 WAV 三份互补文件并全程留证,在确定性破坏测试、39 例试点复检与 Chromium/WebKit 双端到端中验证了采集与变换契约,但声学校准、可用性与生物标志物有效性仍需独立研究。
论文把 RIR 压缩从通用音频重建转向房间结构约束,用 EnCodec 单码本加 EDC 与局部能量加混响语音监督,在 375 bps 上把 T60 误差降到 1.14 s、ViSQOL 做到 4.11,但 46.875 bps 时容量明显不够。
StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。
声源定位 | 6.4/10
语音增强 | 6.3/10
语音编码 | 8.3/10