Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

📄 Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming 标签:#音视频生成 #后训练 #扩散模型 #流式处理 #音频理解 7.4/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.4/1.5 ✅ 7.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #后训练 | #扩散模型 #流式处理 | arxiv 👥 作者与机构 共同第一作者:Menglin Han(Vorch Team;同济大学)、Yang Ding(Vorch Team),均标注 * 通讯作者:Zhangkai Ni(同济大学)、Lin Ma(机构未说明)、Yaohui Wang(Vorch Team),均标注 † 作者列表:Menglin Han(Vorch Team;同济大学)、Yang Ding(Vorch Team)、Yulei Lu(Vorch Team)、Haoran Yu(Vorch Team;哈尔滨工业大学(深圳))、Xin Ma(Vorch Team)、Junyi Chen(Vorch Team;上海交通大学)、Zhangkai Ni(同济大学)、Lin Ma(机构未说明)、Yaohui Wang(Vorch Team) 💡 毒舌点评 亮点是把双向 LTX2.3 的短片段生成能力拆成“因果块 + 稳定前缀窗口 + 显式 LLM 语音规划”,在两分钟 T2AV 上做到 27.12 FPS 并维持较低 WER,工程完成度很高。短板是训练语料和分布蒸馏教师都来自同一双向 LTX2.3,存在明显自举闭环;对比的流式基线只能跑到 30 秒,且论文没有提供代码、权重或数据,验证可信度被削弱 ...

2026-08-07 · 更新于 2026-08-14 · 3 min · 538 words

语音/音乐/音频论文速递 2026-08-07

语音/音乐/音频论文速递 2026-08-07 共分析 21 篇论文 ⚡ 今日概览 📥 抓取 21 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音属性识别 2篇 ██ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频生成 2篇 ██ #音频生成 2篇 ██ #声源定位 1篇 █ #语音交互 1篇 █ #语音伪造检测 1篇 █ 📊 论文评分排行榜(21 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AffectDF: The Most Comprehensive Benchmark for Speech D 8.4分 前25% 数据集与基准 #语音伪造检测 🥈 LILAC: An Idempotent Neural Speech Codec 8.1分 前25% 方法研究 #语音编码 🥉 KVAE: Family of Tokenizers for Multimodal Generative Mo 8.1分 前25% 模型报告 #音频编码 4. Decolonizing Linguistic Policies in Automated Speech Re 7.8分 前25% 理论研究 #语音识别 5. Audio-to-Score Transcription using Pre-trained Features 7.7分 前25% 数据集与基准 #音乐转录 6. Diff2Mix: Controllable Music Mixing via Diffusion Model 7.5分 前25% 方法研究 #音频生成 7. Vorch-Streamer: Extending Human Audio-Visual Generation 7.4分 前50% 方法研究 #音视频生成 8. EG-VAE: A Unified Framework for Electric Guitar Tone Tr 7.3分 前50% 方法研究 #音频生成 9. Explicit and Stable Pseudospectral Time-Domain Method f 7.2分 前50% 方法研究 #音频理解 10. FormBharo: Designing and Evaluating a Voice Agent for C 7.0分 前50% 系统技术报告 #语音交互 11. Whence the Voice? Self-supervised Dual-source Audio-Vis 6.8分 前50% 方法研究 #声源定位 12. Bias Analysis of L2 Speaking Assessment Systems Using C 6.7分 前50% 方法研究 #语音质量评估 13. Diff-Symbo: Text-Controlled Long-Duration Symbolic Musi 6.5分 前50% 方法研究 #音乐生成 14. Rethinking Automatic Music Mixing as Sequential Stem Bl 6.5分 前50% 方法研究 #音乐生成 15. How to Recognize New Words: A Comparison Between Contex 6.4分 前50% 方法研究 #语音识别 16. Beyond Residual Connections: Manifold-Constrained Hyper 6.0分 前50% 方法研究 #说话人验证 17. A Study of ASR Adaptation and Representation Dimensiona 5.7分 前50% 方法研究 #语音情感识别 18. PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Hea 5.6分 前50% 方法研究 #音视频生成 19. The interface of intonation and lexical tone: Boundary 5.6分 前50% 综述 #语音属性识别 20. C\(^3\)PO: Evaluating Cross-Modal Composition and Counter 5.5分 前50% 数据集与基准 #音视频问答 21. ECHO: A Locally-Deployable Agentic Health Assistant wit 5.5分 前50% 系统技术报告 #语音属性识别 📋 论文列表 🥇 AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks 8.4/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-07 · 更新于 2026-08-14 · 17 min · 3544 words

Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning

📄 Reinforcement Learning with Evolving Rubrics as Rewards for Audio Reasoning 标签:#音频理解 #强化学习 #多模态模型 #后训练 #Transformer 7.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ✅ 7.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频理解 | #强化学习 | #多模态模型 #后训练 | arxiv 👥 作者与机构 第一作者:Fangxu Yu(University of Maryland, College Park) 通讯作者:未说明 作者列表:Fangxu Yu(University of Maryland, College Park)、Tao Feng(University of Illinois Urbana-Champaign)、Dehai Min(University of Illinois Chicago)、Zinan Lin(Microsoft Research)、Weijia Xu(Microsoft Research)、Michael Xu(Microsoft Research)、Philip S. Yu(University of Illinois Chicago)、Ge Liu(University of Illinois Urbana-Champaign)、Tianyi Zhou(MBZUAI) 💡 毒舌点评 这篇论文把“进化评分标准”引入音频推理的RL训练,想法确实漂亮,用模型自己的rollout来动态生成新标准,解决了静态奖励信号饱和的老大难问题。实验数据看着也扎实,在多个基准上刷到了同级最优。但整个框架本质上是在“用魔法打败魔法”,把核心的评判权交给了一个外部的、可能更黑盒的大模型,导致整个训练信号链路的健壮性存疑。作者虽承认这一点,但分析浅尝辄止,没有深入挖掘这种依赖可能带来的系统性偏差和失效模式,这让方法的可靠性打了个问号。 ...

2026-08-05 · 更新于 2026-08-14 · 2 min · 389 words

语音/音乐/音频论文速递 2026-08-05

语音/音乐/音频论文速递 2026-08-05 共分析 32 篇论文 ⚡ 今日概览 📥 抓取 32 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 6篇 ██████ #语音合成 3篇 ███ #音频生成 3篇 ███ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频理解 2篇 ██ #音视频问答 2篇 ██ #多任务学习 1篇 █ 📊 论文评分排行榜(32 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Multi-Task Multi-Frame Visual Piano Transcription 8.8分 前25% 系统技术报告 #音乐转录 🥈 Efficient Audio Enhancement with a Differentiable Psych 8.2分 前25% 系统技术报告 #音频超分辨 🥉 GROW: Group-Relative Advantage-Weighted On-Policy Reinf 8.0分 前25% 方法研究 #语音合成 4. Reinforcement Learning with Evolving Rubrics as Rewards 7.6分 前25% 方法研究 #音频理解 5. Cross-cultural evaluation of taste-sound correspondence 7.5分 前25% 应用研究 #音乐理解 6. dots.tts.edit: Precisely Controlled Speech Editing with 7.4分 前50% 模型报告 #语音编辑 7. Anomalous Sound Detection Meets Noise-Aware Self-Superv 7.2分 前50% 方法研究 #音频事件检测 8. Towards More Expressive Spoken LLMs: Fine-Grained Inten 7.2分 前50% 方法研究 #语音交互 9. CLASVS: Continuous-Latent Autoregression for Melody-Pre 7.1分 前50% 方法研究 #自回归模型 10. Music Restoration via Latent Operator Optimization and 7.0分 前50% 方法研究 #音频修复 11. DDSynth-RL: Audio Synthesizer Inversion via Discrete Di 7.0分 前50% 方法研究 #音频生成 12. Language-Specialized Multi-Teacher On-Policy Distillati 6.9分 前50% 方法研究 #语音识别 13. AI-Based Sound Effect Generation: A Narrative Review of 6.9分 前50% 综述 #音频生成 14. Hear to See: Discerning Stateful Listening for Audio-Vi 6.8分 前50% 方法研究 #音频理解 15. On the Geometry of Music Bandwidth Extension in Latent 6.7分 前50% 方法研究 #音频理解 16. Learning Music Style for Piano Arrangement Through Cros 6.6分 前50% 方法研究 #音乐生成 17. Adaptive Modality Reliability Diagnosis and Restoration 6.4分 前50% 方法研究 #音视频理解 18. Latent Softmax for Data-Efficient Phoneme-Based Multili 6.3分 前50% 方法研究 #语音识别 19. Echo-Aware Modulation for Compact-Latent Frequency-Time 6.3分 前50% 方法研究 #语音增强 20. Geometric Cross-Modal Token Selection for Latency-Const 6.2分 前50% 方法研究 #音视频问答 21. Rethinking Modality Reliability in Multimodal Sentiment 6.2分 前50% 方法研究 #音视频理解 22. Towards Real-world Environment-aware Zero-shot Text-to- 6.1分 前50% 方法研究 #语音合成 23. MeloCodec: Harnessing Melodic Priors for High-Fidelity 6.1分 前50% 方法研究 #歌唱生成 24. Speaker Verification Under Real Classroom Conditions fo 5.7分 前50% 应用研究 #说话人验证 25. Band-Count Dense Modal Estimation with Fixed-Frequency 5.6分 前50% 方法研究 #音频理解 26. Simulation-Based Plate-Reverb Parameter Estimation from 5.5分 前50% 方法研究 #音频理解 27. MEMS Microphones as Ultrasonic Transducers: Nonlinear E 5.5分 前50% 系统技术报告 #音频生成 28. Beyond One-Size-Fits-All: Personalized and Culturally A 5.2分 后50% 方法研究 #语音合成 29. Deep Learning-Based Active Trim Panels for Enhanced Air 5.0分 后50% 方法研究 #多任务学习 30. Calliphony: A Calligraphy-Driven Interface for Real-Tim 5.0分 后50% 系统技术报告 #音乐生成 31. Evidence-Grounded Multimodal Knowledge Graph Constructi 4.7分 后50% 系统技术报告 #音视频问答 32. What Is Sonification? Toward a Philosophy of Sonificati 3.8分 后50% 理论研究 #音频理解 📋 论文列表 🥇 Multi-Task Multi-Frame Visual Piano Transcription 8.8/10 | 创新 1.4/2 | 严谨 1.4/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ...

2026-08-05 · 更新于 2026-08-14 · 24 min · 4991 words

OPOD: On-Policy Omni Distillation

📄 OPOD: On-Policy Omni Distillation 标签:#多模态模型 #知识蒸馏 #后训练 #强化学习 #自监督学习 7.1/10 | 创新 1.8/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #多模态模型 | #知识蒸馏 | #后训练 #强化学习 | arxiv 👥 作者与机构 第一作者:Tong Zhao(工作于腾讯实习期间完成) 通讯作者:Zhicheng Dou 作者列表:Tong Zhao(腾讯)、Yuyang Hu(腾讯)、Reed Li(腾讯)、Yu Lu(腾讯)、Haibo Shi(腾讯)、Yutao Zhu(腾讯)、Zhicheng Dou(腾讯)。所有作者机构均标注为腾讯,但未说明具体实验室或部门。 💡 毒舌点评 论文将“多教师路由”与“精细过程奖励”结合,提出了一个逻辑自洽的框架来解决全模态模型融合中的能力冲突问题,在多个骨干网络上均取得了显著提升,实验设计和消融分析扎实。然而,其核心贡献——三个专项教师模型及其训练流程——完全未开源,训练数据、代码、模型权重均未公开,关键训练细节(如优化器、学习率、完整超参数)也缺失,这使得这项工作的“可复现性”和“实际影响力”大打折扣,更像是一份缺乏透明度的技术报告,而非一项可复现的学术研究。 📌 核心摘要 要解决什么问题:在训练能够处理文本、图像和音频的全模态大模型时,简单地将多模态数据混合进行强化学习(如GRPO)训练,会导致不同模态能力相互冲突,难以达到各模态专项教师模型的性能水平。 方法核心是什么:提出“On-Policy Omni Distillation (OPOD)”框架,通过一个基于输入模态标签的路由机制,将学生模型的生成轨迹分发到对应模态(文本/图像/音频)的专项教师模型进行评估。教师的评估信号被转化为三个互补的损失组件:单边token级指导、模态自适应权重控制以及教师验证的推理过程奖励,共同更新学生模型。 与已有方法相比新在哪里:相较于标准的On-Policy Distillation (OPD)和ExOPD,OPOD通过路由解决了教师冲突;通过单边引导(仅保留教师比学生自信的token指导)避免了学生超越教师后被拉回;通过模态自适应控制(为每种模态维护独立的约束预算和权重)避免了不同模态训练速度不一致导致的性能此消彼长;并通过教师作为验证器,设计了“答案置信度”和“推理增益”两个过程奖励,提供了超越最终答案正确性的密集监督信号。 主要实验结果如何:在Qwen3-Omni-30B-A3B、Qwen2.5-Omni-7B和3B三个骨干上进行了评估。在30B模型上,OPOD的12个基准测试平均得分为70.8,比最强的基线(ExOPD,68.6)高2.2分,在所有12个基准上均优于基础模型和混合数据GRPO,且在11个基准上排名第一或第二(包含单独教师对比)。跨尺度实验显示,OPOD在3B和7B骨干上也分别以46.2和51.7的平均分领先,优势明显。 实际意义是什么:提供了一种有效的方法,将多个在不同模态上表现优异的专家模型的能力,整合到一个统一的、可部署的模型中,避免了推理时的集成开销。 主要局限性是什么:论文未开源任何代码、模型或数据,使得完整复现极为困难。实验主要在特定系列模型(Qwen-Omni)上进行,对其他架构的泛化性有待验证。方法对教师模型的质量有强依赖。评估基准主要集中在知识问答和推理任务上,对开放生成任务的效果未知。验证奖励的计算增加了训练时的计算开销。 论文观察到,不同模态的专项教师具有互补优势,但直接混合数据训练会导致冲突。 ...

2026-07-24 · 更新于 2026-08-14 · 3 min · 622 words

语音/音乐/音频论文速递 2026-07-24

语音/音乐/音频论文速递 2026-07-24 共分析 18 篇论文 ⚡ 今日概览 📥 抓取 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 4篇 ████ #语音交互 2篇 ██ #语音情感识别 2篇 ██ #多模态模型 1篇 █ #数据集 1篇 █ #语音伪造检测 1篇 █ #语音分离 1篇 █ #语音合成 1篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 DONDO: Open w2v-BERT Speech-Recognition Base Models for 8.1分 前25% 系统技术报告 #语音识别 🥈 Designed Vocalizations Dataset: Sound-Designed Human an 7.9分 前25% 数据集与基准 #语音转换 🥉 VibeVoice-ASR-BitNet Technical Report 7.8分 前25% 系统技术报告 #语音识别 4. Faster IndexTTS-2: Accelerating and Streaming Autoregre 7.6分 前25% 系统技术报告 #语音合成 5. From Read Speech to Spoken Digits: A Task-Specific Eval 7.5分 前25% 应用研究 #语音识别 6. Instruct-FD: Can Your Full-Duplex Speech System Follow 7.2分 前50% 数据集与基准 #语音交互 7. OPOD: On-Policy Omni Distillation 7.1分 前50% 方法研究 #多模态模型 8. X\(^3\)-OPD: Distilling Reasoning into Large Audio-Langua 7.1分 前50% 方法研究 #音频理解 9. Toward Interpretable Speech Deepfake Detection using Ar 7.0分 前50% 方法研究 #语音伪造检测 10. Toward Generalizable Cognitive Impairment Detection wit 7.0分 前50% 方法研究 #语音情感识别 11. Safeguards for Speech2Speech LLM-Assistants: A Case Stu 6.5分 前50% 系统技术报告 #语音交互 12. Investigating Codec-Internal Latent Audio Watermarking 6.4分 前50% 系统技术报告 #音频水印 13. TF-MossFormer: Integrating Convolution Gated Local-Glob 6.3分 前50% 模型报告 #语音分离 14. Phonetic forced alignment for low-resource language var 6.2分 前50% 方法研究 #语音识别 15. SCoPE: Shift-Aware Speaker-Conditioned Priors for Emoti 6.0分 前50% 方法研究 #语音情感识别 16. Word meaning co-determines vowel-inherent spectral chan 5.9分 前50% 方法研究 #语音属性识别 17. An Evaluation Framework for Structured Audio Captions V 5.3分 后50% 数据集与基准 #数据集 18. Improving the performance of an ASV system using hybrid 5.0分 后50% 方法研究 #说话人验证 📋 论文列表 🥇 DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages 8.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ...

2026-07-24 · 更新于 2026-08-14 · 14 min · 2973 words

FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation

📄 FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation 标签:#音频生成 #后训练 #流匹配 #生成模型 #高效推理 8.6/10 | 创新 1.7/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 🔥 8.6/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #后训练 | #流匹配 #生成模型 | arxiv 👥 作者与机构 第一作者/通讯作者:Kuan-Po Huang(论文作者列表中带有⋆标注,按学术惯例通常为通讯作者或等同贡献) 作者列表:Kuan-Po Huang(⋆标注,未说明机构)、Bo-Ru Lu(†标注,论文注明“This work is unrelated to the author’s position at Amazon”,未说明研究时所属机构)、Ho-Lam Chung(⋆标注,未说明机构)、Shih-Hsin Wang(⋆标注,未说明机构)、Hung-yi Lee(⋆标注,未说明机构) 💡 毒舌点评 论文敏锐地发现了FD后训练与流匹配模型多步生成能力之间的根本矛盾,并用一个轻巧的MeanFlow锚点漂亮地解决了它。工作逻辑自洽,实验立竿见影,堪称一次成功的“微调手术”。然而,这柄手术刀只在120M参数的“小手术台”和8万样本的“微型数据集”上挥舞,其有效性在真正的大规模(数十亿参数)、海量数据场景下是否依然成立,是一个亟待回答的“X光片”问题。论文标题声称“一步文本到音频生成”,但实验局限在10秒音频和单一数据集,其泛化能力有待更严格的拷问。 ...

2026-07-14 · 更新于 2026-08-14 · 4 min · 848 words

语音/音乐/音频论文速递 2026-07-14

语音/音乐/音频论文速递 2026-07-14 共分析 53 篇论文 ⚡ 今日概览 📥 抓取 53 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 5篇 █████ #音乐生成 5篇 █████ #音频理解 5篇 █████ #音频生成 4篇 ████ #多模态模型 3篇 ███ #语音伪造检测 3篇 ███ #语音分离 3篇 ███ #语音质量评估 3篇 ███ 📊 论文评分排行榜(53 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Simple Features and Honest Calibration for Ambivalence 9.0分 前10% 系统技术报告 #模型集成 🥈 PC-Mix: Partial-Component Audio Spoofing Detection unde 8.9分 前25% 数据集与基准 #音频伪造检测 🥉 BeatEdit: Symbolic Music Generation as Explicit Editing 8.9分 前25% 方法研究 #音乐生成 4. CHARM: Charge Calibration and Acoustic Rescue for LLM-b 8.8分 前25% 方法研究 #提示学习 5. FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Traini 8.6分 前25% 方法研究 #音频生成 6. Evaluating SSL and ViViT Architectures for Cross-Corpus 8.3分 前25% 系统技术报告 #语音质量评估 7. ECHOv2: Two-Level Band-Splitting Representation Learnin 8.2分 前25% 方法研究 #音频事件检测 8. GigaAM Multilingual: Foundation Model for Underrepresen 8.1分 前25% 系统技术报告 #语音识别 9. Evidence Subspace Projection: Measuring How Much Eviden 8.1分 前25% 方法研究 #语音伪造检测 10. VoxENES 2026: Benchmarking Generalization of Speech Spo 8.1分 前25% 数据集与基准 #语音伪造检测 11. WaveNet-Style Guitar Amplifier Model Pruning for Real-T 8.0分 前25% 系统技术报告 #音频生成 12. TabPFN beyond Tabular Data: Calibration and Accuracy on 7.9分 前25% 应用研究 #音频分类 13. ARIMA: Reconstruction-Grounded Predictive Representatio 7.7分 前25% 方法研究 #自监督学习 14. Qwen-Audio-VAE Technical Report 7.7分 前25% 系统技术报告 #音频编码 15. Local Multimodal Music Alignment from Global Supervisio 7.6分 前25% 方法研究 #对比学习 16. MeloBottleneck: Self-Supervised Melody Skeleton Extract 7.5分 前25% 方法研究 #音乐理解 17. Dance to Music Generation leveraging Pre-training with 7.5分 前25% 方法研究 #音乐生成 18. GigaChat Audio: Time-aware Large Audio Language Model 7.4分 前50% 系统技术报告 #音频理解 19. Difference-Driven Gating: Adaptive Feature Fusion for U 7.4分 前50% 方法研究 #语音分离 20. BackgroundMellow: A Multi-Modal Cohesive Framework for 7.4分 前50% 系统技术报告 #音频生成 21. Qwen-Music Technical Report 7.4分 前50% 系统技术报告 #音乐生成 22. CoFi-Lite: Pushing the Limits of Ultra-Lightweight Spee 7.3分 前50% 方法研究 #语音增强 23. MusicMark: A Robust Generative Watermarking Framework f 7.3分 前50% 方法研究 #音频水印 24. Unified Gradient Projection: Language-Balanced Continua 7.2分 前50% 方法研究 #语音识别 25. Data Augmentation for L2 English Speaking Assessment us 7.0分 前50% 方法研究 #语音质量评估 26. A Production-Oriented Framework for Evaluation of SFX G 6.9分 前50% 系统技术报告 #音频生成 27. Learn2Chat: Rethinking Dyadic Talking Heads via Interac 6.8分 前50% 方法研究 #音视频生成 28. Tight-Frame Reconstruction for Acoustic Intensity Estim 6.8分 前50% 理论研究 #声源定位 29. The SonicAGI System for the REAL-TSE Challenge 6.8分 前50% 系统技术报告 #语音分离 30. Anysynth:Zero-Shot Instrument Cloning via In-Context Le 6.8分 前50% 方法研究 #音乐生成 31. Where Speech Enhancement Hurts Recognition: An Inferenc 6.7分 前50% 方法研究 #语音识别 32. Teaching Speech Enhancement Models to Sing: Domain Adap 6.7分 前50% 方法研究 #音乐源分离 33. What You Train Is What You Get: Gender Bias, Training C 6.6分 前50% 应用研究 #语音伪造检测 34. Listen to the Features: Voice Anonymization Driven by C 6.5分 前50% 方法研究 #语音克隆 35. Efficiently Adapting Spoken Language Models for the Sin 6.5分 前50% 系统技术报告 #语音交互 36. Which Languages Transfer Best to Warlpiri? A Similarity 6.5分 前50% 应用研究 #语音识别 37. Encoder-Side Neuron Identification and Amplification fo 6.4分 前50% 方法研究 #音频理解 38. Breaking the Quality–Intelligibility Trade-off in Stre 6.3分 前50% 方法研究 #语音分离 39. An Objective Intelligibility Metric Evaluation on Spani 6.2分 前50% 数据集与基准 #语音质量评估 40. Hearing Like Humans? Sound Symbolism and Perceptual Ali 6.1分 前50% 方法研究 #多模态模型 41. Anamnesis: An Open-Source Platform for Large-Scale Back 6.1分 前50% 系统技术报告 #提示学习 42. LOGOS: A Living Logic for AI Agent Teams That Evolve Wi 6.1分 前50% 系统技术报告 #多模态模型 43. Verifier-Guided Twelve-Tone Composition: A Generate-Ver 6.0分 前50% 系统技术报告 #音乐生成 44. MRUF: Multi-granularity Routing with Uncertainty-Aware 5.9分 前50% 方法研究 #多模态模型 45. Omni-Decision: A Progressive Evidence-State Agent Syste 5.9分 前50% 系统技术报告 #音频理解 46. Graph Representation of RaagBase: A Unique Dataset for 5.7分 前50% 数据集与基准 #音乐理解 47. Synchronized Three-Dimensional Vocal-Tract Motion for S 5.7分 前50% 系统技术报告 #语音合成 48. LightMem-Ego: Your AI Memory for Everyday Life 5.6分 前50% 系统技术报告 #流式处理 49. Casting Everything to Online API Services? A Survey of 5.4分 后50% 综述 #语音识别 50. A Closed-Form Noise-Sensitivity Asymmetry for Causal Br 5.3分 后50% 理论研究 #音频理解 51. Semantic Sampling via Learnable Observation Front Ends 5.1分 后50% 方法研究 #音频理解 52. Transcript-Free Lightweight Detection of Alzheimer’s Di 4.9分 后50% 方法研究 #语音属性识别 53. Perceived Annoyance in Multi-source Electric Vehicle AV 3.5分 后50% 应用研究 #音频质量评估 📋 论文列表 🥇 Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video 9.0/10 | 创新 1.2/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 0.5/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 ...

2026-07-14 · 更新于 2026-08-14 · 44 min · 9279 words

Fréchet Distance Loss on Speech Representations for Text-to-Speech Synthesis

📄 Fréchet Distance Loss on Speech Representations for Text-to-Speech Synthesis #语音合成 #流匹配 #后训练 #参数高效微调 6.5/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.5/10 | 前50% | #语音合成 | #流匹配 | #后训练 #参数高效微调 | arxiv 👥 作者与机构 第一作者:Ho-Lam Chung(未说明机构,作者编号1) 通讯作者:未说明 作者列表:Ho-Lam Chung (1)、Kuan-Po Huang (1)、Bo-Ru Lu (2)、Hung-yi Lee (1),机构1和2未详细说明 💡 毒舌点评 将Fréchet距离从离线评估指标改造为可微训练损失,思路简洁有效,用多个精心设计的锚点约束少步采样的内容漂移,在VoxCPM2上以零推理开销换来了可信的WER下降和感知等价性。但只在单一模型上跑通,未与一致性模型、渐进蒸馏等主流加速方案正面对比,泛化性缺乏实证;协方差估计的队列偏差和高斯假设在语音空间中的合理性均未深入讨论;完全闭源使得社区验证和工程复用的价值大打折扣。 📌 核心摘要 本文解决少步流匹配TTS在推理步数压缩后因分布漂移导致内容错误(WER升高)的问题。核心方法是SR-FD损失:微调时使用四步部署采样器生成语音,通过冻结的Whisper和CTC编码器提取句级特征,并与离线预计算的三组互补参考矩(低步成功锚、教师十步、真实语音)计算Fréchet距离,作为正则项驱动生成分布靠近高质量语音分布,无需对抗训练且推理时零额外开销。在Seed-TTS英文测试集上,四步SR-FD微调将WER从原四步基线的2.23%降至1.41%(相对降低36.5%),且显著优于十步基线的1.74%。盲听测试表明四步SR-FD与十步基线无可靠听感差异,TOST验证了实际等效性。消融实验证实三个参考目标均有贡献,错误分析表明改善主要源于内容替换错误的减少。实用性在于为低延迟TTS部署提供了即插即用的内容保真度提升手段。主要局限是仅在一个模型上验证、缺乏与其他少步加速方法的直接对比、完全闭源。 ...

2026-07-08 · 更新于 2026-08-14 · 2 min · 273 words

语音/音乐/音频论文速递 2026-07-08

语音/音乐/音频论文速递 2026-07-08 共分析 26 篇论文 ⚡ 今日概览 📥 抓取 26 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音属性识别 3篇 ███ #音频分类 3篇 ███ #语音合成 3篇 ███ #语音识别 3篇 ███ #声源定位 2篇 ██ #音乐生成 2篇 ██ #语音交互 1篇 █ #音频事件检测 1篇 █ 📊 论文评分排行榜(26 篇,按分数降序) 排名 论文 总分 分档 主任务 🥇 Hierarchical Acoustic-Semantic Modeling: Modality Separ 9.2分 前10% #语音交互 🥈 Propose and Attend: Training-free MLLM Grounding Confid 8.2分 前25% #音频事件检测 🥉 Music I Care About: Automated Multimodal Benchmarking o 7.8分 前25% #音乐理解 4. Escaping the Procrustean Bed: Groupwise Orthogonal Conn 7.8分 前25% #语音属性识别 5. TriA Pipeline: A Large-Scale Automatic Audio Annotation 7.4分 前50% #音频分类 6. InsideSSL: Understanding Self-Supervised Speech Represe 7.4分 前50% #语音属性识别 7. Precise Video-to-Audio Generation with Cross-Modal Alig 7.4分 前50% #音视频生成 8. WordVoice: Explicit and Decoupled Multi-Dimensional Wor 7.2分 前50% #语音合成 9. ForestIR: Physics-Informed Forest Sound Simulation for 7.2分 前50% #声源定位 10. Uncovering Latent Depression Severity for Binary Depres 7.0分 前50% #音视频理解 11. Determinantal point process sampling for bioacoustic ac 6.9分 前50% #音频分类 12. From Sinhala to Dhivehi: Cross-Lingual Transfer Learnin 6.6分 前50% #语音识别 13. Goodbye Equal Error Rate, Hello Local Information Discl 6.5分 前50% #语音转换 14. BlueMagpie-TTS: A Token-Efficient Tokenizer, Language M 6.5分 前50% #语音合成 15. Fréchet Distance Loss on Speech Representations for Tex 6.5分 前50% #语音合成 16. NAVER LABS System Re-implementation for the IWSLT 2026 6.4分 前50% #语音翻译 17. Few-Shot Class-Incremental Audio Classification Using P 6.3分 前50% #音频分类 18. Gemma 4 Technical Report 6.2分 前50% #语音识别 19. Revisiting the Relation Between Language Model Perplexi 6.0分 前50% #语音识别 20. Multimodal Video-to-Music Recommendation via Semantic R 5.4分 后50% #音乐检索 21. Designing Maintainable Hybrid Generative Systems: A Qua 5.3分 后50% #音乐生成 22. Learning-based Physics-Constrained Neural Kernel for So 5.2分 后50% #声源定位 23. Distributed Multichannel Wiener Filtering for Topology- 5.1分 后50% #语音增强 24. Flow Matching-Based Speech Source Separation with Best- 4.9分 后50% #语音分离 25. Umm… With Transformers? Insights from Filled Pause Us 4.8分 后50% #语音属性识别 26. From Textural Counterpoint to Feature Encoding: A Multi 2.1分 后50% #音乐生成 📋 论文列表 🥇 Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs 9.2/10 | 创新 1.8/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.5/1.5 ...

2026-07-08 · 更新于 2026-08-14 · 20 min · 4152 words