Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec Representations

📄 一次解完还是逐帧死磕:在连续编解码空间里数着步子去噪 英文题目:Masked Autoregressive Speech Enhancement with Continuous Neural Audio Codec Representations 一句话:论文把语音增强写成连续编解码隐空间上的掩码自回归块解码,用同一 Conformer 公平比较因果与非因果策略,证明 10 步迭代能在质量与可懂度之间取得可调折中,但随机非因果并未超越因果且高斯假设偏弱。 标签:#语音增强 | #自回归模型 | #语音质量评估 评分:6.4/10 | 创新 1/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5 👥 作者与机构 Yoto Fujita:机构信息未在 arXiv HTML 中可靠披露 Simon Leglaive:机构信息未在 arXiv HTML 中可靠披露 Laurent Girin:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用同一 Conformer、同一 DAC 连续表征和同一训练流程把单步非自回归、块级因果自回归、帧级因果自回归和随机与 oracle 非因果放在同一标尺下比较,权衡曲线干净可信。短板是所谓统一框架只是高斯均值回归下的掩码均方误差重训,原掩码自回归 Masked Autoregressive / MAR 中的扩散头被简化为单高斯,表达力自认较弱;非因果随机策略无实用增益,oracle 增益不可落地,方法增量感偏重。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 971 words

Test-time adaptation for speech enhancement with an autoregressive speech prior

📄 一句话没有干净答案时,让干净语音的记忆来校准耳朵 英文题目:Test-time adaptation for speech enhancement with an autoregressive speech prior 一句话:针对训练与测试噪声失配导致增强失效的问题,该文冻结编解码器潜空间上的自回归干净语音先验并以 KL 散度做单句测试时微调,在 DNS V5 上事后最优提升整体质量 0.18 与背景抑制 0.23,但预测早停仅保留约三分之一增益且对本来已干净的样本可能退化。 标签:#语音增强 | #测试时自适应 | #自回归模型 | #鲁棒性 评分:7.5/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Sofiene Kammoun:机构信息未在 arXiv HTML 中可靠披露 Simon Leglaive:机构信息未在 arXiv HTML 中可靠披露 Xavier Alameda-Pineda:机构信息未在 arXiv HTML 中可靠披露 Timo Gerkmann:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用神经音频编解码器潜空间上的干净语音先验做单句测试时自适应,思路干净且与回归型增强任务适配性好。短板在于缺少与主流测试时自适应基线的同条件对比,且最优停止严重依赖事后挑选,实际落地时的无监督早停仍未解决。 ...

2026-09-04 · 更新于 2026-09-04 · 4 min · 839 words

Artificial Rosetta Stone: Constrained Maximum A Posteriori (MAP) Reconstruction of Symbolic Raga Sequences via Order-k Markov Models

📄 把拉格从玄学拉回有限状态:当重建变成约束 MAP 的精确动态规划 英文题目:Artificial Rosetta Stone: Constrained Maximum A Posteriori (MAP) Reconstruction of Symbolic Raga Sequences via Order-k Markov Models 一句话:论文把受损哼唱的符号补全定义为带观测一致与语法可行的约束 MAP 优化,用对称狄利克雷平滑的 k 阶马尔可夫核与有限记忆动态规划求全局最优,在真实 Yaman 录音衍生序列上二阶模型取得 0.470/0.414/0.371 的缺失准确率,代价是丢弃连续音高与甘马克且仅在 6 条测试序列的小样本流水线自洽意义上成立。 标签:#音乐理解 | #自回归模型 | #音乐生成 | #理论分析 评分:6.8/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Saanvi Raghavendran:Abstract Math Institute Abhishek Bhattacharjee:Abstract Math Institute 💬 毒舌点评 亮点在于把印度古典音乐中常被混为一谈的概率建模、硬约束满足与历史真实性做了清晰切割,并对有限记忆约束下的约束最大后验(Constrained Maximum A Posteriori, Constrained MAP)给出了可验证的动态规划最优性证明,数学写作比多数计算音乐学论文更自律。短板是实证部分仅基于 6 条测试序列的 Yaman 自动转录流水线,且符号真值本身由同一套基频跟踪与主音估计产生,所谓真实数据评估本质是流水线自洽性检验,离档案级重建的证据标准差距很大。 ...

2026-09-02 · 更新于 2026-09-04 · 7 min · 1374 words

Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction

📄 从一次性生成到先诊断再重做:LoopTTS 如何让语音大模型当韵律医生 英文题目:Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction 一句话:针对自回归语音合成中重音错位与停顿失当等局部韵律缺陷,LoopTTS 用 Filter-Judge-Refiner 三级离线闭环让 AudioLLM 先打分再开处方,并以约 42K 对比弱标签训练 Refiner 做指令引导重合成,在被判低分的约 7.9% 样本上把 MOS 从 3.2 左右拉回 4.1 以上,代价是仅对疑似缺陷样本生效且依赖闭源 AudioLLM 的弱标签质量。 标签:#语音合成 #自回归模型 #语音大模型 #指令微调 评分:7.0/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0.5/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Zeyang Song:National University of Singapore;Tencent Tianchi Liu:LIGHTSPEED Tianrui Wang:Nanyang Technological University Chenglin Xu:LIGHTSPEED Steven Y. Guo:Independent Researcher Haizhou Li:The Chinese University of Hong Kong, Shenzhen;Shenzhen Loop Area Institute 💬 毒舌点评 把 AudioLLM 从只会打分的裁判升级为能下处方的韵律医生,用约 42K 对比弱标签让 Refiner 学会听懂“重读这个词、在这里停顿”的指令,闭环思路在离线质检场景很务实。短板是闭环只在被 Judge 判为低分的约 7.9% 样本上生效,全量增益被大量已通过样本稀释,且 Gemini 标注的弱标签 F1 仅 0.673/0.532 却直接当真值训练,天花板明显受限于闭源模型的稳定性、成本与漂移风险。 ...

2026-09-01 · 更新于 2026-09-04 · 10 min · 1982 words

Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans

📄 别等整句说完:把数字人的手势变成一条受因果约束的数据流 英文题目:Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans 一句话:Super Star 的价值在于把离线动作质量与在线因果约束分给不同的数据流:用非因果合成器造训练数据,却让部署端只从截至当前的语音和动作历史预测下一步。 标签:#音视频交互 #自回归模型 #Transformer #流式处理 #实时处理 评分:6.9/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.9/1.5 💬 毒舌点评 Super Star 最扎实的地方,是没有把“流式”只当成演示词:在线端把 audio-conditioned cross-attention 的因果约束同时放进训练和推理,并用四部位 motion token 把局部动作动力学与全身历史接起来。Table 1 与 Table 2 的 FGD、BC、Diversity 和单步延迟是同一口径下的联合证据,尤其 JIYI 上的 mask 消融确实让因果对齐这一机制有了可反驳的抓手。 该泼冷水的地方也很具体:1.623 ms 是 gesture generation module 的每步数,不是用户说话到可见数字人反应的端到端实测;响应模块首 audio token 约 234 ms,渲染和网络却没有被纳入同一延迟表。self-evolution 的 2 轮结果很诱人,但 preferred online 样本规模、真实部署覆盖和长期负反馈行为都未报告,不能把固定 120 帧历史窗下的稳定手势延迟升级成已验证的全系统实时陪伴。 ...

2026-08-27 · 更新于 2026-09-04 · 3 min · 543 words

X2Streaming-TTS: Causal Token-Level Text-to-Speech from Streaming Text with Speech-State Inheritance

📄 X2Streaming-TTS: Causal Token-Level Text-to-Speech from Streaming Text with Speech-State Inheritance 标签:#语音合成 #自回归模型 #流式处理 #高效推理 7.9/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.9/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #语音合成 | #自回归模型 | #流式处理 #高效推理 | arxiv 👥 作者与机构 第一作者:Rime Wen(机构未说明) 通讯作者:未说明 作者列表:Rime Wen、Zehan Liu、Shawn Qin、Lights Shi、Roy Gan、Hao Wang、Qian Wang(机构信息未在当前正文中完整说明) 💡 毒舌点评 流式文本到语音的因果 token 解码设计思路清晰,边界处理也讲究,但两个假设值得推敲:其一,受控实验以固定速率送入文本 token,真实语言模型的突发、停顿与自我修正会让延迟估计变得不稳定;其二,方法能延迟读音未定的后缀,却不能撤回已被上游语义性改写的内容——严格因果的代价是某些错误只能靠等待规避。分段不溢出的保证建立在固定预测容量假设上,最终仍要依赖实测健康门禁。中文为主的评测材料也让跨语言的数字与代码混读能力存疑。 ...

2026-08-20 · 更新于 2026-09-04 · 3 min · 489 words

Architecture and Affordances of PLAUD: Performative Latents and Unsupervised DDSP

📄 Architecture and Affordances of PLAUD: Performative Latents and Unsupervised DDSP 标签:#音乐生成 #变分自编码器 #生成对抗网络 #自回归模型 #实时处理 5.0/10 | 创新 1.1/2 | 严谨 0.8/1.5 | 实验 0.5/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1/1.5 📝 5.0/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐生成 | #变分自编码器 | #生成对抗网络 #自回归模型 | arxiv 👥 作者与机构 第一作者:Błażej Kotowski(Music Technology Group, Universitat Pompeu Fabra, Barcelona) 通讯作者:未标注 作者列表:Błażej Kotowski(Music Technology Group, Universitat Pompeu Fabra, Barcelona)、Frederic Font(Music Technology Group, Universitat Pompeu Fabra, Barcelona) 💡 毒舌点评 这篇文章更像一个面向现场电子音乐的神经乐器系统报告,而不是通常意义上的机器学习方法研究。它把 NoiseBandNet、beta-VAE、MelGAN 风格对抗训练和自回归 Transformer prior 组合成可演奏的 Max for Live 乐器,并用“affordance note”把架构决定和演奏行为联系起来,这一点在神经音频合成方向里有一定实践趣味。但作为顶会投稿,其证据链高度依赖第一作者的四场演出经验和主观反思,没有音频质量、延迟、吞吐、MOS/FAD、RTF 或与 RAVE/NoiseBandNet 的系统性对比。更严重的是,代码、权重、训练语料和可下载设备均未公开,读者几乎无法验证其核心贡献,也无法在此基础上做后续研究。 ...

2026-08-17 · 更新于 2026-09-04 · 4 min · 674 words

Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Visual Avatar Generation

📄 Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Visual Avatar Generation 标签:#音视频生成 #知识蒸馏 #自回归模型 #扩散模型 #实时处理 7.7/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #知识蒸馏 | #自回归模型 #扩散模型 | arxiv 👥 作者与机构 第一作者:Lunjie Zhu(未说明) 通讯作者:Jun Zhang(未说明) 作者列表:Lunjie Zhu(未说明)、Xingtong Ge(未说明)、Fangyu Lin(未说明)、Yi Zhang(未说明)、Zhening Liu(未说明)、Mengfei Li(未说明)、Yumeng Zhang(未说明)、Guanglu Song(未说明)、Yu Liu(未说明)、Jun Zhang(未说明) 💡 毒舌点评 亮点在于作者抓住了关键病理:DMD 蒸馏会改变逐点去噪轨迹,因此用 few-step teacher 重新生成 ODE 对来初始化 causal student,这一 insight 比单纯叠加音频 sink token 或奖励模型更有解释力。短板也很明显:实验完全建立在内部 35K prompt 上,模型权重与推理 delay 均未公开;所谓“实时”只给了 FPS 吞吐,并未给出端到端延迟或播放帧率假设。60 秒下部分消融增益较小,尤其是 async LTM 与同步 LTM 的 Sync-C 差距仅 0.15,且无方差或多次运行报告。整体上,这是一篇有明确训练洞察、但可复现性与实时边界仍未闭合的工作。 ...

2026-08-17 · 更新于 2026-09-04 · 4 min · 796 words

Alignment Drift in Single-Model Speculative Decoding for ASR: Mechanism, Correction, and Cost

📄 Alignment Drift in Single-Model Speculative Decoding for ASR: Mechanism, Correction, and Cost 标签:#语音识别 #自回归模型 #高效推理 #多语言 7.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #自回归模型 | #高效推理 #多语言 | arxiv 👥 作者与机构 第一作者:Xinyu Wang(机构未说明;论文给出邮箱 xinyu@boson.ai) 通讯作者:未说明 作者列表:Xinyu Wang、Huapeng Zhou、Ziyu Zhao、Silin Meng、Ke Bai、Dongming Shen、Xiao-Wen Chang、Alex Smola(机构均未明确标注) 💡 毒舌点评 这篇文章的真正贡献不是“投机解码能加速 ASR”,而是把 ASR 单模型投机解码的失败定位到了浅层草稿在无 target 干预期间丢失音频位置。它用 restart/continuation 分解、固定宽度窗口干预、验证注意力读出和 AnchorDraft 训练目标形成了一套机制证据链。短板是证据链部分依赖离线强制对齐 oracle,运行时修正在 clean 上净收益不显著,训练修正数据量小,且没有可访问代码、权重或 demo;因此方法价值大于直接可复现价值。 ...

2026-08-14 · 更新于 2026-09-04 · 6 min · 1095 words

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

📄 VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching 标签:#音频生成 #流匹配 #自回归模型 #强化学习 #数据集 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #流匹配 | #自回归模型 #强化学习 | arxiv 👥 作者与机构 第一作者:Wenxiang Guo(浙江大学) 通讯作者:Zhou Zhao(浙江大学) 作者列表:Wenxiang Guo(浙江大学)、Changhao Pan(浙江大学)、Ziyue Jiang(浙江大学)、Fei Wu(浙江大学)、Zhou Zhao(浙江大学) 💡 毒舌点评 VoxAudio 用“随机 chunk 边界 + 异步流匹配 + 多奖励 NFT”这一套组合拳,确实把 vocalized audio synthesis 从一个被 T2A/TTS 各管一段的尴尬地带推进到了可流式、可控时序的 unified 方案,尤其在 WER 和区间定位上提升明显。然而,这篇工作更像是一次高质量的工程集成而非方法级突破:VoxCorpus 的模拟+清洗管线和 RL 奖励设计虽然完整,但很多结论依赖单 baselines 和外部模型评估,跨域泛化性与真实噪声鲁棒性仍欠说服力。更令人担心的是,该方法在 MECAT 上的分布指标大幅落后于 Dasheng-AudioGen,作者却以“领域差异”轻轻带过,审稿人不应放过这一点。 ...

2026-08-14 · 更新于 2026-09-04 · 5 min · 1017 words