论文解读

把证据运到情绪空间再验算:BiCFlow-MER 的条件输运识别

针对音频文本情绪证据被说话风格与词汇内容纠缠且两模态可能冲突的问题,BiCFlow-MER 用解耦后的冲突感知条件把样本输运到 64 维情绪端点再做前后向几何打分,在 IEMOCAP 与 MELD 及零样本 CASE 上报告最好值,代价是三阶段流程与多模块超参数。

 · 约 20 分钟 · 9794 字 阅读 →
论文解读

不改唇形只定静音时刻:用二值语音活动信号约束配音合成

该文用帧级二值语音活动掩码约束补画式语音合成以对齐源语言静音结构,在 mTEDx 上把帧对齐准确率从约 73% 提升到约 96%,而主观自然度无显著下降,代价是在翻译时长严重失配时出现可复述的删词、重复与重排。

 · 约 19 分钟 · 9244 字 阅读 →
论文解读

把逐帧检索换成一步速度场:在 WavLM 空间学习 kNN 传输

该研究用条件流匹配网络回归 kNN 生成的源到伪目标位移,以交叉注意力与 FiLM 注入目标说话人条件并比较三条高斯路径,在 LibriSpeech 上以单步推理改善可懂度与估计质量,代价是目标说话人验证相似度低于 kNN 与音素幻觉器。

 · 约 14 分钟 · 6862 字 阅读 →
论文解读

修音准节奏又不换嗓:整流流如何把遮罩补全做成风格保持的美化

针对业余歌声跑调抢拍又要保留歌词与本嗓风格的问题,论文用整流流做梅尔谱补全并以业余谱作上下文约束,最强证据是中英双测试集上音准与音色相似度同时领先,代价是英文内容错误率略升与发音清晰度偶发受损。

 · 约 17 分钟 · 8144 字 阅读 →
论文解读

训练走解析路径、推理走自生轨迹:纠正性强制如何统一后训练扩散与流

针对解析训练态与自生 rollout 态的暴露偏差,纠正性强制用动态 rollout 纠正加反事实转移一致性统一后训练 SB-VE 与 OT-CFM,在 VoiceBank 上把 SB-VE 的 PESQ 从 3.07 提升到 3.21 并稳定多步 SI-SDR,代价是 UTMOS 提升有限且需额外 rollout 开销。

 · 更新于 2026-09-24 · 约 23 分钟 · 11351 字 阅读 →
论文解读

混响下高阶缺失难定解:把上采样做成条件生成的取舍

该文把一阶到三阶上采样定义为给定低阶信号生成缺失高阶通道的条件分布,用流匹配与得分扩散同骨干对比,在混响语音上流匹配信号与听感占优但参数与采样代价明显更大。

 · 更新于 2026-09-24 · 约 17 分钟 · 8343 字 阅读 →
论文解读

文本定意图、空间音频定方位与时机:MoSAT 的分层条件动作生成

MoSAT 针对空间音频加文本联合驱动人体动作的新任务,用运动 VAE 压缩加变换器流匹配分层融合条件,在 STAM 联合评测中对齐与分布质量占优,但强噪声与模态错位时仍会退化。

 · 更新于 2026-09-24 · 约 22 分钟 · 10891 字 阅读 →
论文解读

极端缺频下补高频:音素先验与分频渐进如何分工

针对 1 或 2 kHz 到 16 kHz 的极端语音超分,P2Flow 用音素后验引导缺失高频包络、用 3 段渐进恢复 0-2、2-4、4-8 kHz 速度场并对声码器做后训练,在 TIMIT 与 VCTK 上报告了谱失真、感知质量与可懂度同步改善,代价是 3 阶段流水线与额外分类器依赖。

 · 更新于 2026-09-24 · 约 21 分钟 · 10474 字 阅读 →
论文解读

在 25 Hz 潜变量上修音符:标量量化与 MIDI 跨度如何支撑多乐器混合的再合成

针对多乐器混合中只改部分音符又要保留其余音色与 concurrent 内容的问题,该文用冻结 HeartCodec 的标量量化潜变量做流匹配生成,用 MIDI Span 把帧内时刻保留为连续属性并做置换不变池化,最强证据是转录与重建误差分解显示量化只带来约 0.45 个百分点损失而转录本身带来 21.60 个百分点损失,主要代价是对 1-5 ms 微小起音偏 …

 · 更新于 2026-09-24 · 约 21 分钟 · 10289 字 阅读 →
论文解读

快推理不等于能对话:AVTR-1 把双人音频、连续渲染与延迟调度做进同一系统

AVTR-1 用 153M 参数的双音频条件流匹配模型生成头部与表情动作,再用常开的渲染与调度循环把外部语音智能体的可变语音片段变成同步音视频,并用延迟分解与 R-DGG 验证了可交互性与说话人依赖,代价是仍依赖外部语音智能体与固定的窗口节拍。

 · 更新于 2026-09-24 · 约 18 分钟 · 8808 字 阅读 →
论文解读

连续自回归做钢琴渲染:全局作曲、局部演奏与全序列精修如何分工

针对给定提示音色与目标 MIDI 的钢琴渲染任务,论文用 Composer 自回归预测连续隐状态、Performer 做局部流匹配生成 24 kHz 声学特征、Refiner 上采样到 48 kHz,并报告目标 MIDI 跟随提升 2.7 个百分点的证据,代价是音色相似度仍略低于全序列流匹配基线。

 · 更新于 2026-09-24 · 约 18 分钟 · 8939 字 阅读 →
论文解读

强音频压住弱情绪时:EMODY Flow 用辅助分类器找回情绪可控性

EMODY Flow 复用冻结 Qwen-3 Omni Talker 的 Mimi 音频嵌入驱动两个并行 DiT 流匹配模型分别生成身体与面部动作,在 BEAT2 上以 FGD 0.302 报告手势质量最优,并以 FGD 升至 0.362 的小幅代价换取身体动作的情绪可分性。

 · 更新于 2026-09-24 · 约 22 分钟 · 10738 字 阅读 →
论文解读

加一段文本流,语音续写的语义缺口能补多少:匹配数据下的生成模态差

论文在匹配数据与匹配生成设置下比较纯语音、语音文本与纯文本模型,显示内部文本流大幅降低生成困惑度但说话人相似度和预测质量偏向纯语音模型,且联合模型能逼近大得多数据规模纯语音模型的语义水平。

 · 更新于 2026-09-24 · 约 17 分钟 · 8471 字 阅读 →
论文解读

以重建代替配对:SongCraft 用条件密度统一歌曲生成与细粒度编辑

论文把生成与编辑看作稀疏到稠密的条件谱,用同一潜在流匹配模型在生成分支与重建分支间随机切换训练,以词级音素对齐、节拍条件和变分自编码器表征对齐提升可懂度,并用残差瓶颈容量换取重建保真度与可编辑性,最强证据是分离人声词错误率做到 0.133 但感知质量仍落后于偏好优化基线。

 · 更新于 2026-09-24 · 约 23 分钟 · 11229 字 阅读 →
论文解读

先规划后演奏:StepAudio 3 Music 用单码本与 ABC 计划平衡长曲连贯与音质

StepAudio 3 Music 针对完整歌曲的长程结构与高保真渲染矛盾,采用 50 赫兹 65536 表项单码本离散表示加混合专家自回归组织音乐序列再由流匹配扩散渲染 48 千赫音频,并以 ABC 记谱作显式编曲计划,在 339 条歌词到歌曲与 316 条人声条件上取得内容享受 7.7086 与文本相似 0.4465 的最高均值,代价是自回归序列翻倍与符 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10836 字 阅读 →
论文解读

瓶颈不断搬家:从 CosyVoice 到 Qwen-Audio-3.0-TTS 的接口契约与分阶段对齐

该回顾把四代系统的进步归因于规划器与渲染器之间接口契约的四次搬迁,用同篇消融支持表示与归属判断,以分阶段联合训练解决低码率与跨模块协同问题,代价是更长的训练流水线与更复杂的条件控制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8722 字 阅读 →
论文解读

稀疏舞蹈线索到稠密音乐之间:用分层专家监督补上中间表示

针对舞蹈线索稀疏而作曲需要稠密结构的问题,CMA-OT 用 Jukebox 多尺度专家对 DiT 隐表示做由粗到细的课程对齐与尺度自适应 FGW 软对齐,并以流匹配生成损失联合训练,在 AIST++ 与 TikTok 上报告了节奏与质量提升,代价是训练侧引入多尺度 OT 与课程调度。

 · 更新于 2026-09-24 · 约 21 分钟 · 10119 字 阅读 →
论文解读

用一次算好的键值记忆,给冻结的音乐大模型加上可组合的音频控制

针对文字难以规定节拍、旋律与演绎细节的问题,该工作用与主干同构的模板把控制音频转成逐层键值记忆注入冻结的生成分支,在单控制评测中把五类控制依从指标推到基线之上,同时自动音质与文本对齐分数与基线大体相当但存在指标级回落。

 · 更新于 2026-09-24 · 约 18 分钟 · 8540 字 阅读 →
论文解读

把平均速度换成梅尔预测:少步数与有界上下文如何同进一个解码器

针对离散语音 token 到梅尔谱的低延迟合成问题,论文用梅尔空间重参数化的平均流把 2 到 3 步推理的声学目标直接化,并用层选择的分块掩码把每包计算限定在滑动窗内,代价是需要未来块的前视延迟和多步细化开销。

 · 更新于 2026-09-24 · 约 17 分钟 · 8291 字 阅读 →
论文解读

在嘴型与动作抢注意力时,如何让化身在正确时间做正确动作

ActAvatar 针对说话化身中文本动作控制粗糙与时间错位问题,采用分阶段提示与分层音视频调制,在保持口型同步的同时实现相位级动作控制,最强证据是动作基准上命中率与时间正确性领先,但深层调制与两阶段训练带来实现与数据构造代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10172 字 阅读 →