Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails

📄 Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails 标签:#音频事件检测 #多模态模型 #声源定位 #理论分析 #实时处理 6.6/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音频事件检测 | #多模态模型 | #声源定位 #理论分析 | arxiv 👥 作者与机构 第一作者:Cong Xu(University of South Florida, Department of Electrical Engineering, iCONS Laboratory) 通讯作者:未说明 作者列表:Cong Xu(University of South Florida, Department of Electrical Engineering, iCONS Laboratory)、Ravi Sankar(University of South Florida, Department of Electrical Engineering, iCONS Laboratory) 💡 毒舌点评 亮点是真正把“缺少预期视觉共证据”当成一种可标定的证据来推理隐蔽交通参与者,并把输出限定为校准化的风险参考变量,这在盲区碰撞预警里比只做声学检测更接近可用系统。短板也很直观:核心贡献无法复现,没有代码或模型;此外,签名分类器跨路口泛化明显不足,移动 ego 场景基本失效,说明离实际部署仍有一段距离。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 673 words

Feedforward Active Speech Suppression Based on Time Series Prediction of Speech Signals Using Neural Networks

📄 Feedforward Active Speech Suppression Based on Time Series Prediction of Speech Signals Using Neural Networks 标签:#语音增强 #主动降噪 #实时处理 5.5/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.7/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #主动降噪 | #实时处理 | arxiv 👥 作者与机构 第一作者:Manami Nishikata(Graduate Institute for Advanced Studies, SOKENDAI, Kanagawa, Japan) 通讯作者:未说明 作者列表:Manami Nishikata(Graduate Institute for Advanced Studies, SOKENDAI, Kanagawa, Japan)、Shoichi Koyama(National Institute of Informatics, Tokyo, Japan;Graduate Institute for Advanced Studies, SOKENDAI, Kanagawa, Japan) 💡 毒舌点评 本文的想法朴素但有一定吸引力:把语音时间序列预测注入 FxLMS 的梯度更新,试图缓解非平稳语音下自适应滤波跟踪滞后。然而,最刺眼的结果是 MLP 预测质量相当差(Pearson 相关系数仅 0.287),却与 oracle 预测的降噪效果几乎相同。这说明当前 NPR 指标或评估设计可能根本测不出预测精度带来的真实增益。更值得注意的是,论文在方法部分构建了参考与期望两个预测器,但实验只训练和使用了参考信号预测器,期望信号由已知主路径直接生成,期望信号预测器这一更大难点被完全回避。整体上,方法有参考价值,但距离主动语音抑制的实际部署仍非常遥远。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 660 words

Moving Horizon Estimation for Underwater Target Tracking Based on Time-Difference-of-Arrival Measurements

📄 Moving Horizon Estimation for Underwater Target Tracking Based on Time-Difference-of-Arrival Measurements 标签:#声源定位 #模型比较 #鲁棒性 #实时处理 6.5/10 | 创新 0.9/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.2/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #声源定位 | #模型比较 | #鲁棒性 #实时处理 | arxiv 👥 作者与机构 第一作者:Anton Tolstonogov(Institute for Systems and Robotics (ISR), LARSyS, Instituto Superior Técnico (IST), University of Lisbon, Portugal) 通讯作者:未显式标注;论文给出作者邮箱 作者列表:Anton Tolstonogov、David Cabecinhas、Pedro Batista、Antonio Pascoal(均为 Institute for Systems and Robotics (ISR), LARSyS, Instituto Superior Técnico (IST), University of Lisbon, Portugal) 💡 毒舌点评 论文在稀疏 TDoA 测量、离群值和较远初始化条件下,确实展示了 MHE 相比朴素 EKF 的显著鲁棒性优势;运行时间测试也表明该方法在 1 Hz 声学更新周期内具备实时可行性。但整体证据仍停留在 2D 合成仿真,基线只有 EKF,未与 UKF、粒子滤波、鲁棒 EKF 或带约束的滤波方案比较,也没有真实水下声学数据验证。精度 RMSE 的统计波动和离群值生成机制都未交代,落地工程证据偏弱。作为面向语音/音乐/音频领域读者的分析,其直接影响力更低。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 719 words

Architecture and Affordances of PLAUD: Performative Latents and Unsupervised DDSP

📄 Architecture and Affordances of PLAUD: Performative Latents and Unsupervised DDSP 标签:#音乐生成 #变分自编码器 #生成对抗网络 #自回归模型 #实时处理 5.0/10 | 创新 1.1/2 | 严谨 0.8/1.5 | 实验 0.5/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0.2/1.5 | 复现 0.1/0.5 | 工程 1/1.5 📝 5.0/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐生成 | #变分自编码器 | #生成对抗网络 #自回归模型 | arxiv 👥 作者与机构 第一作者:Błażej Kotowski(Music Technology Group, Universitat Pompeu Fabra, Barcelona) 通讯作者:未标注 作者列表:Błażej Kotowski(Music Technology Group, Universitat Pompeu Fabra, Barcelona)、Frederic Font(Music Technology Group, Universitat Pompeu Fabra, Barcelona) 💡 毒舌点评 这篇文章更像一个面向现场电子音乐的神经乐器系统报告,而不是通常意义上的机器学习方法研究。它把 NoiseBandNet、beta-VAE、MelGAN 风格对抗训练和自回归 Transformer prior 组合成可演奏的 Max for Live 乐器,并用“affordance note”把架构决定和演奏行为联系起来,这一点在神经音频合成方向里有一定实践趣味。但作为顶会投稿,其证据链高度依赖第一作者的四场演出经验和主观反思,没有音频质量、延迟、吞吐、MOS/FAD、RTF 或与 RAVE/NoiseBandNet 的系统性对比。更严重的是,代码、权重、训练语料和可下载设备均未公开,读者几乎无法验证其核心贡献,也无法在此基础上做后续研究。 ...

2026-08-17 · 更新于 2026-09-04 · 4 min · 674 words

H2H Music Improv: A Communication Model and Audio-Visual Dataset for Music Improvisation

📄 H2H Music Improv: A Communication Model and Audio-Visual Dataset for Music Improvisation 标签:#音乐理解 #多模态模型 #数据集 #实时处理 7.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.6/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音乐理解 | #多模态模型 | #数据集 #实时处理 | arxiv 👥 作者与机构 第一作者:Aleksandra Teng Ma(Georgia Institute of Technology, Music Informatics Group;论文标注工作完成时所属) 通讯作者:未说明 作者列表:Aleksandra Teng Ma(Georgia Institute of Technology, Music Informatics Group)、Anthony Cammarota(未说明)、Jiayi Wang(未说明)、Alexandria Smith(未说明)、Cheng-Zhi Anna Huang(未说明)、Jeffrey Albert(未说明)、Alexander Lerch(未说明) 💡 毒舌点评 亮点是把自由即兴中“演奏者意图”与“对方感知”的不对称性真正做成了一套双向标注资源,并用简明的 initiate/acknowledge 模型将前序研究中的质性讨论推进到可量化阶段。短板也很明显:离散二元动作空间和 6 小时、5 名演奏者的小样本,使得该数据集目前更像一个精挑细选的交流现象切片,而不是能直接推动生成式模型训练的大规模基准;论文也尚未用任何下游任务证明这套标注对模型改进有实际增益。协同设计过程的质性发现(如纹理优先于音高、沉默预示发起)虽有意思,但本身不构成可检验的方法贡献。 ...

2026-08-17 · 更新于 2026-09-04 · 3 min · 599 words

Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Visual Avatar Generation

📄 Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Visual Avatar Generation 标签:#音视频生成 #知识蒸馏 #自回归模型 #扩散模型 #实时处理 7.7/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #知识蒸馏 | #自回归模型 #扩散模型 | arxiv 👥 作者与机构 第一作者:Lunjie Zhu(未说明) 通讯作者:Jun Zhang(未说明) 作者列表:Lunjie Zhu(未说明)、Xingtong Ge(未说明)、Fangyu Lin(未说明)、Yi Zhang(未说明)、Zhening Liu(未说明)、Mengfei Li(未说明)、Yumeng Zhang(未说明)、Guanglu Song(未说明)、Yu Liu(未说明)、Jun Zhang(未说明) 💡 毒舌点评 亮点在于作者抓住了关键病理:DMD 蒸馏会改变逐点去噪轨迹,因此用 few-step teacher 重新生成 ODE 对来初始化 causal student,这一 insight 比单纯叠加音频 sink token 或奖励模型更有解释力。短板也很明显:实验完全建立在内部 35K prompt 上,模型权重与推理 delay 均未公开;所谓“实时”只给了 FPS 吞吐,并未给出端到端延迟或播放帧率假设。60 秒下部分消融增益较小,尤其是 async LTM 与同步 LTM 的 Sync-C 差距仅 0.15,且无方差或多次运行报告。整体上,这是一篇有明确训练洞察、但可复现性与实时边界仍未闭合的工作。 ...

2026-08-17 · 更新于 2026-09-04 · 4 min · 796 words

VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents

📄 VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents 标签:#语音合成 #语音大模型 #流式处理 #实时处理 #语音交互 8.2/10 | 创新 1.1/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 🔥 8.2/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #语音合成 | #语音大模型 | #流式处理 #实时处理 | arxiv 👥 作者与机构 第一作者:Edresson Casanova(NVIDIA Corporation) 通讯作者:Edresson Casanova(NVIDIA Corporation,论文提供邮箱 ecasanova@nvidia.com;正文未单独标注通讯作者) 作者列表:Edresson Casanova(NVIDIA Corporation)、Jaehyeon Kim(NVIDIA Corporation)、Mariana Graterol Fuenmayor(NVIDIA Corporation)、Shehzeen Hussain(NVIDIA Corporation)、Viacheslav Klimkov(NVIDIA Corporation)、Valentin Mendelev(NVIDIA Corporation)、Mikyas Desta(NVIDIA Corporation)、Paarth Neekhara(NVIDIA Corporation)、Piotr Zelasko(NVIDIA Corporation)、Chen Chen(NVIDIA Corporation)、Elena Rastorgueva(NVIDIA Corporation)、Ke Hu(NVIDIA Corporation)、Ankita Pasad(NVIDIA Corporation)、Xuesong Yang(NVIDIA Corporation)、Aya Alja’fari(NVIDIA Corporation)、Rajarshi Roy(NVIDIA Corporation)、Rohan Badlani(NVIDIA Corporation)、Jason Roche(NVIDIA Corporation)、Jason Li(NVIDIA Corporation)、Zhehuai Chen(NVIDIA Corporation) 💡 毒舌点评 这项工作把始终在线的流式语音合成从"能做"推进到"可部署"的完成度,interruption token 加确定性静音强制在 200 例中断测试中实现 100% 的 320ms 服从率和 89.9ms 停止延迟,同时 977M 模型延迟反超 1.7B 强基线,工程闭环很扎实。但论文自己承认没有组件消融,Character-Aware Subword Encoder、gated fusion、audio prompt 等多个改动绑在一起只能看总账,单个贡献无法验证;且 unseen speaker 多轮 SECS 从 0.757 滑到 0.685,长会话身份一致性仍是明显短板。 ...

2026-08-17 · 更新于 2026-09-04 · 6 min · 1174 words

Drive-to-Music: Context-Aware Generative Audio for In-Vehicle Experiences

📄 Drive-to-Music: Context-Aware Generative Audio for In-Vehicle Experiences 标签:#音乐生成 #多模态模型 #生成模型 #智能座舱 #实时处理 5.2/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.6/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 📝 5.2/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐生成 | #多模态模型 | #生成模型 #智能座舱 | arxiv 👥 作者与机构 第一作者:Cosmin Dragoiu(Mercedes-Benz Research & Development North America) 通讯作者:未说明 作者列表:Cosmin Dragoiu(Mercedes-Benz Research & Development North America)、Nooshin Nabizadeh(Mercedes-Benz Research & Development North America) 邮箱信息:cosmin.dragoiu@mercedes-benz.com、nooshin.nabizadeh@mercedes-benz.com 💡 毒舌点评 该工作把 VLM、LLM、生成式音频模型和座舱氛围灯整合成一条完整的车载音乐生成流水线,组件选型基准和 safety check 清单对工业落地有参考价值。但论文最大的硬伤是 VLM 选型结论与自己的基准数据直接矛盾:Gemini 2.5 Flash Lite 延迟更低(0.6s vs 1.2s)、CLIP 分数更高(27.25 vs 26.43),最后却选了 LiquidAI,且正文没有给出任何解释;此外"实时"“个性化"“用户正向反馈"等关键声明缺少端到端延迟、真实车辆测试和任何可量化用户研究支撑。作为顶会投稿,这更像是一份工程 demo 报告而非研究论文。 ...

2026-08-14 · 更新于 2026-09-04 · 4 min · 729 words

语音/音乐/音频论文速递 2026-08-14

语音/音乐/音频论文速递 2026-08-14 共分析 12 篇论文 ⚡ 今日概览 ✅ 筛选入选 12 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #多模态模型 1篇 █ #语音伪造检测 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ #语音属性识别 1篇 █ #语音质量评估 1篇 █ #音乐生成 1篇 █ 📊 论文评分排行榜(12 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward… 8.2分 前25% 方法研究 #音频生成 🥈 CASA: Content-Acoustic Speaking Assessment with Speech… 7.9分 前25% 方法研究 #语音质量评估 🥉 Comparative Analysis of Multilingual Pre-trained… 7.6分 前25% 数据集与基准 #语音识别 4. OmniScientist: An Omni-Modal Omni-Discipline AI… 7.6分 前25% 系统技术报告 #多模态模型 5. Alignment Drift in Single-Model Speculative Decoding… 7.3分 前50% 方法研究 #语音识别 6. EgoCITE: Context-Augmented Indexing and Time-Aware… 7.2分 前50% 系统技术报告 #音视频问答 7. CardioState-JEPA: Delay-Aware Cross-Modal Learning of… 7.2分 前50% 方法研究 #音频分类 8. FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme… 7.0分 前50% 系统技术报告 #语音合成 9. Motor, Cognitive, or Corpus? What Survives Cross… 6.1分 前50% 应用研究 #语音属性识别 10. Evaluating Pre-trained Speech Encoders for Spontaneous… 6.0分 前50% 方法研究 #语音伪造检测 11. HybridSB-MoE: Dual-Domain Schrödinger Bridges with… 5.9分 前50% 方法研究 #语音增强 12. Drive-to-Music: Context-Aware Generative Audio for In… 5.2分 后50% 系统技术报告 #音乐生成 📋 论文列表 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ...

2026-08-14 · 更新于 2026-09-04 · 12 min · 2527 words

RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation

📄 RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation 标签:#语音增强 #知识蒸馏 #流式处理 #实时处理 #模型压缩 6.6/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #知识蒸馏 | #流式处理 #实时处理 | arxiv 👥 作者与机构 论文未提供作者-机构的逐人数字映射;脚注机构列表为:Academia Sinica, Taiwan;National Taiwan University, Taiwan;Kore University of Enna, Italy;University of Palermo, Italy;NVIDIA。 ...

2026-08-13 · 更新于 2026-09-04 · 5 min · 1037 words