Drive-to-Music: Context-Aware Generative Audio for In-Vehicle Experiences

📄 Drive-to-Music: Context-Aware Generative Audio for In-Vehicle Experiences 标签:#音乐生成 #多模态模型 #生成模型 #智能座舱 #实时处理 5.2/10 | 创新 1/2 | 严谨 0.8/1.5 | 实验 0.6/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 📝 5.2/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐生成 | #多模态模型 | #生成模型 #智能座舱 | arxiv 👥 作者与机构 第一作者:Cosmin Dragoiu(Mercedes-Benz Research & Development North America) 通讯作者:未说明 作者列表:Cosmin Dragoiu(Mercedes-Benz Research & Development North America)、Nooshin Nabizadeh(Mercedes-Benz Research & Development North America) 邮箱信息:cosmin.dragoiu@mercedes-benz.com、nooshin.nabizadeh@mercedes-benz.com 💡 毒舌点评 该工作把 VLM、LLM、生成式音频模型和座舱氛围灯整合成一条完整的车载音乐生成流水线,组件选型基准和 safety check 清单对工业落地有参考价值。但论文最大的硬伤是 VLM 选型结论与自己的基准数据直接矛盾:Gemini 2.5 Flash Lite 延迟更低(0.6s vs 1.2s)、CLIP 分数更高(27.25 vs 26.43),最后却选了 LiquidAI,且正文没有给出任何解释;此外"实时"“个性化"“用户正向反馈"等关键声明缺少端到端延迟、真实车辆测试和任何可量化用户研究支撑。作为顶会投稿,这更像是一份工程 demo 报告而非研究论文。 ...

2026-08-14 · 更新于 2026-08-14 · 4 min · 733 words

语音/音乐/音频论文速递 2026-08-14

语音/音乐/音频论文速递 2026-08-14 共分析 12 篇论文 ⚡ 今日概览 📥 抓取 12 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 2篇 ██ #多模态模型 1篇 █ #语音伪造检测 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ #语音属性识别 1篇 █ #语音质量评估 1篇 █ #音乐生成 1篇 █ 📊 论文评分排行榜(12 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward Au 8.2分 前25% 方法研究 #音频生成 🥈 CASA: Content-Acoustic Speaking Assessment with Speech 7.9分 前25% 方法研究 #语音质量评估 🥉 Comparative Analysis of Multilingual Pre-trained Models 7.6分 前25% 数据集与基准 #语音识别 4. OmniScientist: An Omni-Modal Omni-Discipline AI Scienti 7.6分 前25% 系统技术报告 #多模态模型 5. Alignment Drift in Single-Model Speculative Decoding fo 7.3分 前50% 方法研究 #语音识别 6. EgoCITE: Context-Augmented Indexing and Time-Aware Retr 7.2分 前50% 系统技术报告 #音视频问答 7. CardioState-JEPA: Delay-Aware Cross-Modal Learning of a 7.2分 前50% 方法研究 #音频分类 8. FastThaiG2P: Lightning-fast Thai Grapheme-to-phoneme Co 7.0分 前50% 系统技术报告 #语音合成 9. Motor, Cognitive, or Corpus? What Survives Cross-Lingua 6.1分 前50% 应用研究 #语音属性识别 10. Evaluating Pre-trained Speech Encoders for Spontaneous 6.0分 前50% 方法研究 #语音伪造检测 11. HybridSB-MoE: Dual-Domain Schrödinger Bridges with Scen 5.9分 前50% 方法研究 #语音增强 12. Drive-to-Music: Context-Aware Generative Audio for In-V 5.2分 后50% 系统技术报告 #音乐生成 📋 论文列表 🥇 VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 ...

2026-08-14 · 更新于 2026-08-14 · 13 min · 2588 words

RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation

📄 RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation 标签:#语音增强 #知识蒸馏 #流式处理 #实时处理 #模型压缩 6.6/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #知识蒸馏 | #流式处理 #实时处理 | arxiv 👥 作者与机构 论文未提供作者-机构的逐人数字映射;脚注机构列表为:Academia Sinica, Taiwan;National Taiwan University, Taiwan;Kore University of Enna, Italy;University of Palermo, Italy;NVIDIA。 ...

2026-08-13 · 更新于 2026-08-14 · 5 min · 1037 words

DIY e-HandPan: A new DIY Low-Cost Handpan Interface based on Arduino and ESP32 Microcontrollers

📄 DIY e-HandPan: A new DIY Low-Cost Handpan Interface based on Arduino and ESP32 Microcontrollers 标签:#音频交互 #端到端 #实时处理 #开源工具 #教育 7.2/10 | 创新 1/2 | 严谨 1.1/1.5 | 实验 0.7/1.5 | 清晰 0.6/1 | 影响 0.7/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.2/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:中 | #音频交互 | #端到端 | #实时处理 #开源工具 | arxiv 👥 作者与机构 第一作者:Benoît Collin(IBISC, University of Évry Paris-Saclay) 通讯作者:论文未明确标注通讯作者,仅提供联系邮箱 dominique.fourer@univ-evry.fr 作者列表: Benoît Collin(IBISC, University of Évry Paris-Saclay) Dominique Fourer(IBISC, University of Évry Paris-Saclay) Eric Genotelle(IBISC, University of Évry Paris-Saclay) 💡 毒舌点评 作为开源硬件系统报告,工程文档完整度相当扎实:用约 80 美元做出了带力度感知、双色 LED 教学引导和双 MCU 版本的电子手碟,对音乐教育与 Maker 社区有实际价值。但论文几乎没有对端到端演奏延迟、误触发率、长期可靠性和学习效果做量化评估,与 Panduino、Lumen、Neotone 等已有系统只停留在属性表对比,摘要中“表现力可比原声手碟”的说法没有任何对比数据支撑,离顶会“证据支撑结论”的标准还差得远。此外,Arduino 版本是否支持 LED 教学在正文中自相矛盾(2.3/4.2/5.1 描述与 3.1 矛盾),需要认真修正。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 701 words

Monophonic Audio Synthesizer Using FPGAs

📄 Monophonic Audio Synthesizer Using FPGAs 标签:#音频生成 #端到端 #实时处理 4.2/10 | 创新 0.8/2 | 严谨 0.5/1.5 | 实验 0.4/1.5 | 清晰 0.7/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 📝 4.2/10 | 后50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频生成 | #端到端 | #实时处理 | arxiv 👥 作者与机构 第一作者:Michael Smith(Department of Electrical and Computer Engineering, University of Colorado Colorado Springs) 作者列表:Michael Smith、D.G. Perera,均署名 University of Colorado Colorado Springs 通讯作者:未说明 💡 毒舌点评 这篇报告最值得肯定的是它把失败的细节交代得比较清楚:UART 通信为何没调通、ADSR 和两个低通滤波器为何被移除、SMA 电压域问题如何影响输出,都有具体排查过程。但作为一篇 16 页的论文,最终真正能跑通的系统只是一个按键触发、音高固定为 A440、无包络、无滤波的方波输出;MIDI 控制链路从未工作,也没有任何量化指标支撑“合成器”这一核心声明。更糟的是,参考文献中混入大量与本文无直接关系的课题组自引,进一步削弱了报告的可信度。整体更像一份高年级 FPGA 课程项目报告,而不是 NeurIPS/ICML/ICLR 级别的可验证研究贡献。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 725 words

Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement

📄 Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement 标签:#语音增强 #知识蒸馏 #多通道 #实时处理 #高效推理 6.0/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 6.0/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #知识蒸馏 | #多通道 #实时处理 | arxiv 👥 作者与机构 第一作者:Xulin Fan(University of Illinois Urbana-Champaign, USA) 通讯作者:未说明(论文未标注通讯作者) 作者列表:Xulin Fan(University of Illinois Urbana-Champaign)、Juan Azcarreta(Meta Reality Labs Research)、Ashutosh Pandey(Meta Reality Labs Research)、Jesus Alvarez(Meta Reality Labs Research)、Ke Tan(Meta Reality Labs Research)、Jacob Donley(Meta Reality Labs Research)、Ritwik Giri(Meta Reality Labs Research)、Buye Xu(Meta Reality Labs Research) 💡 毒舌点评 把服务器端 SpatialNet 的延迟增强谱、中间层特征和空间统计量一起“搬”到边缘端,确实让 TinyGRU+MCWF 在合成低 SNR 测试集上获得 3.77 dB 和 3.49 dB 的 SI-SDR 提升,而边缘端参数只增加约 1.5%、计算量只增加约 2.4%,这个端云协作 pipeline 有工程启发。但实验基本局限于同一套 Pyroomacoustics 合成 RIR 与固定延迟仿真:没有与原始 Knowledge Boosting 直接对比,没有真实设备、动态网络延迟、丢包或带宽测试,也没有统计显著性检验。更刺眼的是 PESQ 没有随 SI-SDR 同步上升,完整模型的 PESQ 甚至低于中间消融配置。目前的结论更适合表述为“仿真环境下端云协作增强的可行性验证”,而非成熟的部署级方案。 ...

2026-08-10 · 更新于 2026-08-14 · 4 min · 712 words

语音/音乐/音频论文速递 2026-08-10

语音/音乐/音频论文速递 2026-08-10 共分析 16 篇论文 ⚡ 今日概览 📥 抓取 16 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音情感识别 2篇 ██ #音乐理解 2篇 ██ #音频伪造检测 2篇 ██ #音频生成 2篇 ██ #多模态模型 1篇 █ #歌唱生成 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(16 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 How Much AI Is in This Track? Quantifying the Proportio 8.3分 前25% 方法研究 #音频伪造检测 🥈 Objects as Audio-Visual Modal Sound Fields 7.6分 前25% 方法研究 #音频生成 🥉 StreamArena: Toward Continuous, Interactive, and Long-H 7.6分 前25% 数据集与基准 #多模态模型 4. Frame-Level Pansori Mode Classification with Complement 7.6分 前25% 数据集与基准 #音乐理解 5. Multi Codec Discrete Diffusion Model for Text Guided Sp 7.3分 前50% 方法研究 #语音编辑 6. MI-MIDI: Mechanistic Interpretability of Text-to-MIDI G 7.1分 前50% 方法研究 #音乐生成 7. SemBridge: Semantic Token Anchoring for Continuous-Late 7.0分 前50% 方法研究 #语音合成 8. Do Audio Language Models Use Paralinguistic Evidence? C 6.9分 前50% 数据集与基准 #语音情感识别 9. Separating Decision-Rule Misalignment from Readout-Cove 6.8分 前50% 方法研究 #语音情感识别 10. MMAG: A Multi-Control Mixed Audio Generation Benchmark 6.8分 前50% 数据集与基准 #音频生成 11. Assessing AI-generated music detection in real-world br 6.8分 前50% 数据集与基准 #音频伪造检测 12. LSEAD: A Privacy-Preserving LLM-Based Speech Analysis F 6.6分 前50% 系统技术报告 #语音识别 13. Cloud-Boosted Low-Compute Multi-Channel Speech Enhancem 6.0分 前50% 方法研究 #语音增强 14. Shape Your Feed: An LLM-based Agentic System for Conver 5.7分 前50% 系统技术报告 #音视频交互 15. From Prompting to Describing: A Cross-Cultural Study of 5.5分 前50% 应用研究 #音乐理解 16. Beyond Call and Response: Modelling Reciprocal Coordina 5.5分 前50% 方法研究 #歌唱生成 📋 论文列表 🥇 How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures 8.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-10 · 更新于 2026-08-14 · 14 min · 2864 words

Deep Learning for Real-Time Sound Order Recognition in Human-Robot Interaction

📄 Deep Learning for Real-Time Sound Order Recognition in Human-Robot Interaction 标签:#音频事件检测 #CNN #音频交互 #实时处理 #鲁棒性 5.2/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.7/1.5 | 清晰 0.6/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.2/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #音频事件检测 | #CNN | #音频交互 #实时处理 | arxiv 👥 作者与机构 第一作者:Rezaul Tutul(Berliner University of Applied Science, Berlin, Germany) 通讯作者:未说明;论文首页标注第一作者邮箱 rezaul.tutul@bht-berlin.de 作者列表:Rezaul Tutul、Usaid Khan、André Jakob、Ilona Buchem(均署名 Berliner University of Applied Science) 💡 毒舌点评 把“谁先发声”定义成一个可学习任务,并用多特征分支加注意力融合做到99%,是合成条件下有启发的起点。但整篇论文的核心证据只来自一张“最佳准确率”表:baseline数值缺席、注意力消融缺席、分延迟准确率缺席、真实房间验证缺席。STFT幅度谱帧移为8ms,论文却要解决0.4ms级别的onset差异,既没有给出机制分析,也没有给出随延迟变化的性能曲线。当前证据更适合支撑“合成数据上的技术报告”,而不是“可靠识别声音顺序”这一强结论。 ...

2026-08-06 · 更新于 2026-08-14 · 2 min · 249 words

Smartphone Audio Based Distress Detection

📄 Smartphone Audio Based Distress Detection 标签:#音频事件检测 #模型融合 #实时处理 #鲁棒性 #音频分类 6.3/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.2/1.5 ✅ 6.3/10 | 前50% | 文档类型:系统技术报告 | 评分置信度:高 | #音频事件检测 | #模型融合 | #实时处理 #鲁棒性 | arxiv 👥 作者与机构 第一作者:Anil Sharma(IIIT-Delhi) 作者列表:Anil Sharma、Sarthak Ahuja、Mayank Gautam、Sanjit Kaul(均为 IIIT-Delhi) 通讯作者:论文未标注 💡 毒舌点评 把现成的 MFCC+SVM 包装成“高召回前端、高精度后端、时间聚合、人工兜底”的多级流水线,工程落地 sense 很明确,也针对 Android 录音轮询、多核 null frame、隐私隐藏和能耗做了真实处理。但作为学术工作,它与已有 scream detection 工作没有任何定量比较;更关键的是,志愿者测试阶段不包含任何真实遇险叫声,所以“高检测率”只来自人工构造的 SNR 混合验证集,真实召回从未被验证。“entirely smartphone audio based 24/7 distress detection”的表述也偏强,因为最终仍依赖 friends-in-the-loop 人工确认,并非全自动闭环。 ...

2026-08-06 · 更新于 2026-08-14 · 5 min · 997 words

Deep Learning-Based Active Trim Panels for Enhanced Aircraft Interior Noise Control

📄 Deep Learning-Based Active Trim Panels for Enhanced Aircraft Interior Noise Control 标签:#多任务学习 #工业应用 #实时处理 #音频理解 #Transformer 5.0/10 | 创新 1.1/2 | 严谨 0.8/1.5 | 实验 0.5/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 📝 5.0/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #多任务学习 | #Transformer | #工业应用 #实时处理 | arxiv 👥 作者与机构 第一作者:Boxiang Wang(School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore) 通讯作者:未说明 作者列表:Boxiang Wang(Nanyang Technological University)、Malte Misol(German Aerospace Center, Institute of Lightweight Systems)、Zhengding Luo(Nanyang Technological University)、Junwei Ji(Nanyang Technological University)、Xiaoyi Shen(Nanyang Technological University)、Dongyuan Shi(Nanyang Technological University)、Woon-Seng Gan(Nanyang Technological University) 💡 毒舌点评 温度感知直击SFANC在飞机舱内应用的痛点,用轻量多任务CNN将频率和路径变化识别统一,思路直接务实。但全程依赖数值仿真,且所用路径实为从单一基线测量抽象而来的合成数据,缺乏真实硬件或物理实验验证,可复现性几乎为零。温度渐变下反被普通FxLMS超越,暴露了离散滤波器库的固有缺陷,而作者对此仅以“增加滤波器”一笔带过,缺乏深入分析与解决方案。 ...

2026-08-05 · 更新于 2026-08-14 · 2 min · 294 words