Speech Signals Complement LLMs for Predicting Interpersonal Attraction in Speed Dating

📄 Speech Signals Complement LLMs for Predicting Interpersonal Attraction in Speed Dating 标签:#语音交互 #多模态模型 #音频理解 #Transformer #模型评估 6.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.4/1.5 ✅ 6.9/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #语音交互 | #多模态模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Yuriko Kikuchi(Japan Advanced Institute of Science and Technology) 通讯作者:未明确标注,但从机构和贡献推断为 Shogo Okada(Japan Advanced Institute of Science and Technology) 作者列表:Yuriko Kikuchi、Takato Hayashi、Ryusei Kimura、Naoya Inoue(以上均为 Japan Advanced Institute of Science and Technology)、Ryo Ishii(NTT, Inc.)、Shogo Okada(Japan Advanced Institute of Science and Technology) 💡 毒舌点评 本文找到了一个真正的开放问题——语音信号在 LLM 已经看过全部文字后究竟还能提供多少额外信息——并给出了诚实、有条件的答案,而非鼓吹“多模态必胜”的粗浅结论。然而,数据规模极小(仅 147 人)、语种单一(日语)、场景特殊(异性速配),使结论远未形成泛化证据;核心的 per-participant r 增益全部未通过多重比较校正,作者虽然坦率地不为这些不显著的增益背书,但整篇论文的说服力也因此几乎全部押注在 pairwise accuracy 的提升上,而 pairwise accuracy 的提升幅值和模式并不统一。 ...

2026-07-28 · 更新于 2026-08-14 · 4 min · 764 words

StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech

📄 StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech 标签:#语音属性识别 #多模态模型 #可解释性 #音频理解 #Transformer 8.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.6/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:高 | #语音属性识别 | #多模态模型 | #可解释性 #音频理解 | arxiv 👥 作者与机构 第一作者:Yuzhe Wang(约翰霍普金斯大学电气与计算机工程系) 通讯作者:Yuzhe Wang (ywang792@jhu.edu) 作者列表:Yuzhe Wang(约翰霍普金斯大学电气与计算机工程系)、Thomas Thebaud(亚马逊AGI)、Jennifer Hu(约翰霍普金斯大学认知科学系)、Jesús Villalba-Lopez(约翰霍普金斯大学电气与计算机工程系)、Venkatesh Ravichandran(亚马逊AGI)、Georgi Tinchev(亚马逊研究)、Najim Dehak(约翰霍普金斯大学电气与计算机工程系)、Laureano Moro-Velázquez(约翰霍普金斯大学电气与计算机工程系) 💡 毒舌点评 本文精准地切入语音交互社会意图评估的空白,通过标准化9个维度和LLM-as-a-judge范式,为S2S模型的“社会智能”提供了首个系统性基准,实验工程扎实,多模型鲁棒性诊断颇有深度。然而,其根本软肋在于“立场真实性”问题始终悬而未决:全基准的“金标准”仅是基于角色提示的弱监督标签,却未提供任何来自第三方听众感知的数据来验证这些立场是否真的在语音中被成功表达和识别。这使得整个评测体系的有效性建立在一个未经证实的假设之上,AUROC再高也可能只是在拟合一个虚构的构造。 ...

2026-07-28 · 更新于 2026-08-14 · 2 min · 290 words

语音/音乐/音频论文速递 2026-07-28

语音/音乐/音频论文速递 2026-07-28 共分析 31 篇论文 ⚡ 今日概览 📥 抓取 31 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 5篇 █████ #语音交互 3篇 ███ #语音属性识别 3篇 ███ #声源定位 2篇 ██ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频生成 2篇 ██ #对比学习 1篇 █ 📊 论文评分排行榜(31 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 StanceBench: A Benchmark for Audio LLM-Based Interperso 8.6分 前25% 数据集与基准 #语音属性识别 🥈 Expose Your Disguise: Recovering Source Speaker Identit 7.5分 前25% 方法研究 #对比学习 🥉 Leveraging Gradient Reversal Loss and Multitask Learnin 7.3分 前50% 方法研究 #语音伪造检测 4. PathRIR: Physics-Guided Acoustic Path Selection and Lat 7.2分 前50% 方法研究 #空间音频 5. Indic DiarBench: A Multilingual Joint Diarization and A 7.1分 前50% 数据集与基准 #说话人日志 6. Earnings25: A Comprehensive 500-Hour Speech Benchmark f 7.1分 前50% 数据集与基准 #语音识别 7. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment 7.1分 前50% 方法研究 #音视频生成 8. Revisiting Vocos: That Phasiness Business in Time-Frequ 7.1分 前50% 方法研究 #语音合成 9. Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robu 7.0分 前50% 系统技术报告 #语音合成 10. Towards High-Level Semantic Intelligence 7.0分 前50% 综述 #音视频理解 11. Speech Signals Complement LLMs for Predicting Interpers 6.9分 前50% 应用研究 #语音交互 12. Let Me Look at You: Advanced Facial Expression Modeling 6.9分 前50% 模型报告 #语音合成 13. Simple Language Normalization Wins: Cross-Lingual Speak 6.8分 前50% 系统技术报告 #说话人验证 14. Memory Efficient Audio Synthesis with Decoupled Tempora 6.8分 前50% 系统技术报告 #语音合成 15. Explainable AI through the Lens of Material Agency: Ena 6.7分 前50% 应用研究 #音乐生成 16. MoLGE: Mixture of Language Group Experts for Efficient 6.7分 前50% 方法研究 #语音识别 17. Mind the Microphone Gap: Benchmarking Array Upsampling 6.6分 前50% 方法研究 #声源定位 18. Multimodal Domain Generalization for Depression Detecti 6.4分 前50% 方法研究 #音频分类 19. Infinite Canons: Maximally Self-Similar Melodic Lines a 6.4分 前50% 理论研究 #音乐生成 20. Singlish, Can or Not? Fine-Tuning and Evaluating Zero-S 6.3分 前50% 应用研究 #语音合成 21. JarvisHub: An Open Harness for Canvas-Native Multimodal 6.2分 前50% 系统技术报告 #音视频生成 22. Low-Latency Turn-Taking via Context-Aware Preface Gener 6.1分 前50% 系统技术报告 #语音交互 23. Do Visual Features Improve Other-Initiated Repair Detec 5.9分 前50% 方法研究 #音视频交互 24. Automatic Audio Equalization with Semantic Embeddings 5.8分 前50% 方法研究 #语音增强 25. Music-Source-Separation-Training (MSST): A Unified Fram 5.7分 前50% 系统技术报告 #音乐源分离 26. Disentangling Acoustic Cues in Alzheimer’s Pathology an 5.4分 后50% 应用研究 #语音属性识别 27. Speech Entrainment in Multi-Party Conversations with a 5.3分 后50% 应用研究 #语音交互 28. Improving Zero-Shot Phonetic Classification through Lan 5.3分 后50% 方法研究 #语音属性识别 29. Looking for Affect in Spontaneous Finnish Speech throug 5.3分 后50% 应用研究 #语音情感识别 30. Modeling Stylistic Co-evolution in Symbolic Music Herit 4.9分 后50% 方法研究 #音乐理解 31. Resource-Aware Topology Management for ISAC-Enabled TDO 4.1分 后50% 方法研究 #声源定位 📋 论文列表 🥇 StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech 8.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ...

2026-07-28 · 更新于 2026-08-14 · 26 min · 5365 words

CODA: Cascaded Online Discontinuity-Aware Alignment for Real-Time Image-Based Score Following

📄 CODA: Cascaded Online Discontinuity-Aware Alignment for Real-Time Image-Based Score Following 标签:#音频理解 #Transformer #实时处理 #流式处理 #基准测试 8.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | 文档类型:方法研究 | 评分置信度:高 | #音频理解 | #Transformer | #实时处理 #流式处理 | arxiv 👥 作者与机构 第一作者:Yining Yang(未说明) 通讯作者:未说明 作者列表:Yining Yang(未说明)、Ruogu Chen(未说明)、Jie Han(University of Alberta) 💡 毒舌点评 本文以优雅的级联选择和静默驱动的跳转恢复,巧妙地将乐谱跟随从“目标检测”重构为“候选选择”,在合成数据上取得了显著提升。然而,其过度依赖合成音频训练,在真实钢琴录音上性能骤降(≤0.10s误差下从0.914降至0.743),且依赖精确的乐谱布局先验,泛化至手写谱或不规则现代乐谱的能力存疑。总体看,洞察清晰,工程扎实,但“通用”乐谱跟随的愿景尚显遥远。 ...

2026-07-27 · 更新于 2026-08-14 · 3 min · 544 words

How Meta-Learning Shapes LoRA Adapter Geometry in Speech Deepfake Detection

📄 How Meta-Learning Shapes LoRA Adapter Geometry in Speech Deepfake Detection 标签:#语音伪造检测 #模型评估 #音频理解 #Transformer 5.2/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.2/1.5 📝 5.2/10 | 后50% | 文档类型:方法研究 | 评分置信度:高 | #语音伪造检测 | #Transformer | #模型评估 #音频理解 | arxiv 👥 作者与机构 第一作者:Ivan Kukanov(未说明) 通讯作者:未说明 作者列表:Ivan Kukanov(未说明)、Janne Laakkonen(未说明)、Ville Hautamäki(未说明) 💡 毒舌点评 这篇文章想得很美:冻结骨干、只换训练目标,读出适配器里的几何花纹。Fisher有效秩确实把故事讲圆了——query/key集中、output分散,跨语料库跨种子稳得像教科书插图。但问题来了:这到底是MLDG必然会留下的指纹,还是这套特定超参、特定骨干上的巧合?六页纸把2个目标的1个差异图案翻来覆去画了五张图,可一问到因果就“留待未来工作”。没有新方法、没有新模型、没有代码,只有一通好看但不知能拿来干什么的测量。说重了就是一封漂亮的推荐信,说轻了——一个有趣但悬在半空的假说。 📌 核心摘要 本文不设计新检测器,而是提出一套描述性诊断工具,用于比较实证风险最小化(ERM)和元学习域泛化(MLDG)在冻结的Wav2Vec 2.0–AASIST骨干上训练出的LoRA适配器(秩r=16)所留下的几何差异。核心思路是将训练后的适配器参数位移与经验Fisher信息结合,构建Fisher加权重要性分布,用熵有效秩等指标量化“损失敏感容量”在适配器内部的集中/分散程度。该诊断在6个评测语料库和5个种子上进行。结果显示:MLDG适配器在query/key投影上Fisher有效秩下降约19%,在output投影上上升约29%,此模式在合并更新ΔW中依然成立,排除了因子坐标伪影。分解实验表明,query/key的集中效应并非源自更新幅度的缩减,而是Fisher权重的重新分配;局部扰动敏感性亦显示MLDG适配器输出更稳定。作者将此解释为MLDG学到了更紧致的注意力路由和更分散的内容变换。 ...

2026-07-27 · 更新于 2026-08-14 · 2 min · 332 words

MemNMF: Memory-Augmented NMF on LPC Spectra for Anomalous Sound Detection

📄 MemNMF: Memory-Augmented NMF on LPC Spectra for Anomalous Sound Detection 标签:#音频事件检测 #生成模型 #音频理解 #Transformer #模型评估 5.3/10 | 创新 1.2/2 | 严谨 0.8/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.3/10 | 后50% | 文档类型:方法研究 | 评分置信度:中 | #音频事件检测 | #生成模型 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Phurich Saengthong(Institute of Science Tokyo) 通讯作者:未说明 作者列表:Phurich Saengthong(Institute of Science Tokyo)、Takahiro Shinozaki(Institute of Science Tokyo) 💡 毒舌点评 把LPC谱包络和NMF初始化的记忆模块嫁接在一起,思路清晰且在非平稳噪声下确实有肉眼可见的增益。但实验设计避重就轻,不与MemAE等真正的记忆增强基线正面交锋,BatchNorm在异常数据上的行为风险避而不谈,开源更是为零,让整篇文章的价值停在了一场自娱自乐的消融实验里。 ...

2026-07-27 · 更新于 2026-08-14 · 6 min · 1067 words

Music-JEPA: Learning a World Model of Sound from Action

📄 Music-JEPA: Learning a World Model of Sound from Action 标签:#音乐转录 #自监督学习 #音频理解 #Transformer #模型评估 6.2/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.6/1.5 ✅ 6.2/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐转录 | #自监督学习 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Ziyu Wang (未说明) 通讯作者:未说明 作者列表:Ziyu Wang (未说明)、Kun Fang (未说明)、Yann LeCun (未说明) 注:原文未明确标注作者具体所属机构。根据Yann LeCun的常见单位和论文致谢信息推断,其隶属于New York University / Meta AI,但论文本身未在作者列表中明确标出。 💡 毒舌点评 本文以“动作条件”为Music-JEPA注入了一个清晰的物理直觉——钢琴声就是演奏动作的产物。然而,它目前仍是一颗精致的纽扣:只在MAESTRO这一个古典钢琴独奏的封闭花园里跳舞,规划出的音符虽然连贯,却远不如专门的有监督转录模型精确,离真实世界音乐的无标注、多乐器、非结构化动作还有漫长的距离。更遗憾的是,论文承诺的代码和模型至今杳无音信,这让它的可复现性大打折扣。 ...

2026-07-27 · 更新于 2026-08-14 · 3 min · 612 words

Phylogenetic signal in marine mammal and bird vocalizations captured by audio foundation models: the limited benefit of domain-specific pretraining

📄 Phylogenetic signal in marine mammal and bird vocalizations captured by audio foundation models: the limited benefit of domain-specific pretraining 标签:#音频理解 #零样本 #模型比较 #Transformer #模型评估 7.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.7/10 | 前25% | 文档类型:应用研究 | 评分置信度:高 | #音频理解 | #Transformer | #零样本 #模型比较 | arxiv 👥 作者与机构 第一作者:Víctor Rincón Yepes,Independent Researcher 通讯作者:Víctor Rincón Yepes,Independent Researcher 💡 毒舌点评 论文首次将音频基础模型的嵌入用于系统发育信号分析,并得出领域特定预训练不增反降的反直觉结论,跨类群验证是最大亮点。但鸟类实验样本量过小且类群分布严重偏斜,对“为何领域模型更弱”的讨论仅停留在不可区分的三种假设层面,缺少对照实验,使核心发现从“洞察”滑向“观察”。 ...

2026-07-27 · 更新于 2026-08-14 · 3 min · 521 words

Probing Speaker Identity Sensitivity in Audio Deepfake Detectors

📄 Probing Speaker Identity Sensitivity in Audio Deepfake Detectors 标签:#语音伪造检测 #测试时自适应 #音频理解 #Transformer #模型评估 6.5/10 | 创新 1.3/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #语音伪造检测 | #测试时自适应 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Daniyal Kabir Dar(Michigan State University, USA) 通讯作者:Arun Ross(Michigan State University, USA) 作者列表:Daniyal Kabir Dar(Michigan State University)、Arun Ross(Michigan State University) 💡 毒舌点评 亮点:将说话人身份这一被长期忽略的捷径问题提炼为可量化的诊断指标ISS,思路干净利落,在deepfake检测的可信度评估上迈出了一步。短板:方法核心只是logit空间的线性扰动加IQR统计,技术深度有限;完全未开源代码或模型,复现成本高;仅在两款较老检测器和有限的说话人池上验证,复杂检测器和大规模、多变的现实场景下的普适性存疑。 ...

2026-07-27 · 更新于 2026-08-14 · 2 min · 401 words

Reflector: Arrangement-Aware Harmonic Retrieval for Sample-Based Composition

📄 Reflector: Arrangement-Aware Harmonic Retrieval for Sample-Based Composition 标签:#音乐检索 #对比学习 #音乐生成 #音频理解 #Transformer 7.7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 7.7/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:中 | #音乐检索 | #对比学习 | #音乐生成 #音频理解 | arxiv 👥 作者与机构 第一作者:Austin Rockman(Independent Researcher) 通讯作者:Austin Rockman(Independent Researcher,邮箱 research@austinrockman.com) 作者列表:Austin Rockman(Independent Researcher) 💡 毒舌点评 这篇系统报告的核心洞察——直接使用音程类打分表会在检索时退化为“万能陪衬”样本霸榜,而嵌入空间的归一化几何恰好能滤除这一退化成分——相当漂亮,为蒸馏式检索设计提供了有力的分析证据。但软肋同样明显:所有表征分析仅在一套 631 样本的私人库上完成,未与任何商用或已发表检索系统进行横向对比,也没有任何形式的主观听感实验,使得“系统可用”的结论高度依赖作者自身的编曲习惯。此外,将所有表征分析局限在单一小规模库上,那些漂亮的覆盖率和相关性数字究竟有多大普适性,是个悬而未决的问题。 ...

2026-07-27 · 更新于 2026-08-14 · 3 min · 445 words