论文解读

谁在演奏:当姿态追踪、映射网络与神经音频合成共同分配控制权

该文以手势驱动的计算机音乐乐器为任务,用姿态追踪加监督映射加 RAVE 潜空间合成的串联链条研究关系性代理,报告了 66 维与 8 维输入、77 维合成控制加 12 对声像坐标的真实系统与第一人称演奏观察,代价是数据集一致性难维持与音色多样性受限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9181 字 阅读 →
论文解读

把长相交给参考图:参考引导深度压缩如何让说话人像视频实时可流式生成

针对语音驱动说话人像需要同时满足实时流式、高保真和大范围躯干动态的问题,该工作用参考图引导的因果视频 VAE 把压缩率做到 768 并用块自回归整流流 Transformer 生成潜变量,在单卡实现 512×512 下 42 FPS,代价是强依赖参考图质量与训练数据分布且本次未能确认代码模型可达。

 · 更新于 2026-09-24 · 约 20 分钟 · 9937 字 阅读 →
论文解读

把广播档案馆装进乐器:TECHNO-UTOPIA 如何让交响乐团与嵌入式 AI 互相改写

该研究以约 35 分钟协奏曲为载体,用 BBC 爱乐广播档案训练 RAVE 与拼接合成乐器来驱动作曲与现场演奏,报告显示嵌入式 AI 塑造了全曲结构而非仅 moment 声音,代价是记谱、延迟与排练可信度需专门设计。

 · 更新于 2026-09-24 · 约 18 分钟 · 8548 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
论文解读

保留弹奏、只换效果:Clean2FX 用标签条件让同一段干琴长出十种音色

论文把问题定为给定干声吉他与目标效果标签、合成对应效果声并保留音乐内容,用同一事件序列配对的 EGFxSet 衍生数据比较四种谱变换模型,最强证据是 log 幅度 U-Net 相对复制输入基线平均改善 MSE 约 70.6% 与 FAD 约 31.8%,代价是延迟混响类 FAD 增益弱且域外真实演奏变换减弱。

 · 更新于 2026-09-24 · 约 18 分钟 · 8747 字 阅读 →
论文解读

不做离散量化:KALL-E 以逐帧分布预测实现低帧率连续语音合成

KALL-E 针对离散语音切分的信息损失与高帧率不稳定问题,用 Flow-VAE 提取 512 维 12.5 Hz 连续隐分布并让自回归 Transformer 逐帧预测均值方差,以 KL 散度为目标在 Seed-TTS 上取得 0.96 中文 CER 与 1.94 英文 WER,代价是保留强 KL 约束与单样本测试时微调的额外开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8462 字 阅读 →
论文解读

从局部连乘到全局直测:用三层约束补回骨骼结构的可懂复述

针对随语音生成全身动作时末端抖动与误差沿骨骼链放大的问题,论文把扩散建模搬到全局旋转空间并用关节、骨骼、时序三层约束补回结构,消融表显示完整约束取得最低分布距离,但节奏对齐仍有基线未被全面超越的代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9461 字 阅读 →
论文解读

把共有的病和各自的信号分开:DIVINE 的多模态解耦评估

针对口面部神经疾病的音视频联合诊断与严重度估计问题,DIVINE 用分层变分瓶颈分离共享与私有表征并做稀疏门控融合,在 Toronto NeuroFace 上以 DeepSeek-VL2 加 TRILLsson 达到双模态高精度,但缺模态与跨库泛化仍受限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9146 字 阅读 →
论文解读

把病理性语音拉回正常编码:EA-VAE 用三处对齐做重构

针对构音障碍语音与正常语音特征空间差异大的问题,EA-VAE 只用变分自编码器加嵌入对齐、分布对齐和时长对齐做重构,在 UASpeech 上把平均词错误率降到 62.19% 并取得平均 MOS 4.48,代价是仍需平行语料预训练与波形级时间拉伸来保证帧数条件。

 · 更新于 2026-09-24 · 约 22 分钟 · 10883 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

固定模长换可预测性:SphereVAE 把连续语音表示压到球面上治自回归漂移

针对连续语音表示自回归预测中误差沿时间累积导致的隐变量漂移问题,SphereVAE 用单位超球面 Power Spherical 隐空间固定模长只留方向变化,在重建指标低于标准 VAE 的代价下,在 VoxCPM 零样本合成中取得英文 5.305% 词错误率与中文 1.141% 字错误率的最低内容错误并在长文本中保持更高的说话人相似度。

 · 更新于 2026-09-24 · 约 20 分钟 · 9812 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-11

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 69 分钟 · 34318 字 阅读 →
论文解读

双耳相位不可丢:从 Mel 模糊到复数 VAE 的空间音频重建

为解决视觉遮挡下世界模型缺乏空间听觉的问题,BinauralVAE 对比三种 VAE 在 0.2 秒双耳片段上的重建能力,显示保留相位的复数 VAE 在低频段实现可听的空间保真,而幅值-only 与四通道实数 VAE 分别因 ITD 丢失与相位塌缩而失效。

 · 更新于 2026-09-24 · 约 23 分钟 · 11495 字 阅读 →
论文解读

用 125k 探针在 VAE 潜空间里拨动音高:扩散音乐生成的可控性不在自回归独占

针对 Stable Audio Open 的 VAE 潜空间可解码音高类别这一可验证性质,论文用冻结的微型卷积探针在去噪后 40% 窗口内以 RMS 归一化梯度轻推潜变量,在 27 次配对试验中将旋律一致性从 0.112 提升至 0.274 且未报告音质代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8971 字 阅读 →
论文解读

单麦克风里拆出心跳与呼吸:小波、时序与可解释潜空间为何要一起工作

音频分离 | 6.6/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12996 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-02

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 69 分钟 · 34077 字 阅读 →
论文解读

在一条潜流里同时生成两条音轨:解耦语义与声学后的少步分离

音乐源分离 | 5.3/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11167 字 阅读 →
论文解读

把咳嗽声拆开:用高斯对齐让模型忘记敏感属性

音频分类 | 5.5/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10348 字 阅读 →
论文解读

当发言意愿也需要先验:用 Beta 倾向补全多通道日志的贝叶斯闭环

说话人日志 | 6.6/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11955 字 阅读 →
论文解读

把声学公式写进损失:PhysWave 如何让扩散模型不再猜方向

音频生成 | 6.6/10

 · 更新于 2026-09-24 · 约 28 分钟 · 13764 字 阅读 →