Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection

📄 别再只调大模型:用 88 行文字把声音的破绽说给 LLM 听 英文题目:Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection 一句话:针对伪造语音在未见攻击与信道上泛化差的问题,论文把检测重做为问答任务,通过微调音频编码器配合冻结的指令大模型,并用 openSMILE 的 88 维声学特征文本化来弥合模态鸿沟,在 In-the-Wild 与 MLAAD 上取得显著域外提升,代价是约 1500 token 的提示开销与尚未开源的复现成本。 标签:#语音伪造检测 #多模态模型 #大语言模型 #参数高效微调 #鲁棒性 评分:6.4/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yassine El Kheir:机构信息未在 arXiv HTML 中可靠披露 Xin Wang:机构信息未在 arXiv HTML 中可靠披露 Wanqing Ge:机构信息未在 arXiv HTML 中可靠披露 Tim Polzehl:机构信息未在 arXiv HTML 中可靠披露 Sebastian Moeller:机构信息未在 arXiv HTML 中可靠披露 Junichi Yamagishi:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用 openSMILE eGeMAPSv2 88维特征的文本序列化显式锚定大语言模型(Large Language Model, LLM)语义空间,解决了音频大模型(Audio Large Language Model, ALLM)中连续音频嵌入与文本推理的模态鸿沟,并在 In-the-Wild 与 MLAAD 上把冻结 LLM 的泛化瓶颈撕开一道口子。短板则是正文与表格数值多处自相矛盾、1500 token 的提示开销被轻描淡写为可忽略,且未提供代码仓库与权重链接,可验证性与统计严谨性均有明显欠缺。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1600 words

VIBE: Video Instruction-aligned Background music gEneration

📄 当视频自己听不见节拍:VIBE 如何让背景音乐既对上画面,又听懂文字指令 英文题目:VIBE: Video Instruction-aligned Background music gEneration 一句话:针对视频到音乐生成中静态条件瓶颈与指令违背无惩罚的难题,VIBE 用逐层动态条件连接与硬软奖励分解的五阶段偏好优化,在 ReelBench 上以 FD 10.13 与 IS 2.36 等指标超越 Video-Robin,并在速度与调性指令跟随上实现可验证提升,代价是依赖冻结 VAE 与外部裁判模型带来的偏差与开销。 标签:#音乐生成 #扩散模型 #音视频生成 #强化学习 #多模态模型 评分:7.1/10 | 创新 1.6/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Aryan Vijay Bhosale:机构信息未在 arXiv HTML 中可靠披露 Vaibhavi Lokegaonkar:机构信息未在 arXiv HTML 中可靠披露 Vishnu Raj:Dolby Laboratories, USA Gouthaman KV:Dolby Laboratories, USA Sreyan Ghosh:University of Maryland, College Park, USA Ramani Duraiswami:University of Maryland, College Park, USA Lie Lu:Dolby Laboratories, USA Dinesh Manocha:University of Maryland, College Park, USA 💬 毒舌点评 亮点在于把视频到音乐的条件瓶颈和指令违背问题拆成架构与训练两条线一起治,Conditioning Connection 的层级路由和硬可验证奖励 + 软跨模态奖励的分解确实让指令跟随可被优化而非仅靠重构。短板是评测过度依赖自家训练的 CMI-RM 与 Qwen2.5-Omni 作为奖励与裁判,且人类评估仅 18 人、20 个视频、Fleiss κ 0.249 的一致性偏低,却仍宣称全方位优于基线。 ...

2026-09-01 · 更新于 2026-09-04 · 9 min · 1819 words

When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection

📄 模型听见的是期待的语调:当讽刺检测依赖高音与停顿的刻板印象 英文题目:When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection 一句话:论文用五模态分解与 PSOLA 因果操纵证明,多模态大模型在中英讽刺检测中并未学会真实韵律线索,而是依赖高基频与不规则停顿的跨语言刻板印象,仅改这两个维度就能在独立样本上诱发最高 60.5% 的假阳性。 标签:#语音情感识别 #多模态模型 #可解释性 #模型评估 评分:7.4/10 | 创新 1.6/2 | 技术严谨 1.3/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Yongjian Chen:Magellan Technology Research Institute (MTRI);Center for Language and Cognition, University of Groningen, the Netherlands Pengfei Wei:Magellan Technology Research Institute (MTRI) Yiqun Sun:Magellan Technology Research Institute (MTRI) Zhu Li:Center for Language and Cognition, University of Groningen, the Netherlands Lawrence B. Hsieh:Magellan Technology Research Institute (MTRI) 💬 毒舌点评 亮点在于把讽刺检测从拼 F1 的基准游戏拉回到因果诊断,用五模态分解加 PSOLA 定向操纵实锤了模型依赖高音调与不规则停顿的跨语言刻板印象,证据链罕见地完整。短板是全程零样本黑盒探针却未触及融合层定位,且两套语料均为电视表演语音,所谓跨语言泛化更像是跨表演风格泛化,离真实对话的落地还有距离。 ...

2026-09-01 · 更新于 2026-09-04 · 9 min · 1801 words

When Vocal Tone and Literal Meaning Diverge: An Acoustic-Semantic Incongruity Study for Large Audio-Language Models

📄 当声音在笑、文字在哭:大音频语言模型为何听不见讽刺 英文题目:When Vocal Tone and Literal Meaning Diverge: An Acoustic-Semantic Incongruity Study for Large Audio-Language Models 一句话:针对大音频语言模型重文字轻声音、在讽刺等声学-语义矛盾语音上失灵的问题,论文用 IndexTTS2 音色克隆合成 77,559 条矛盾可控的 CREMA-ASIS 数据,通过双任务评测与层级线性探测定位语义主导,并以秩为 4 的 rsLoRA 微调将双条件准确率从约 20% 提升至 68% 且保持转写能力。 标签:#语音情感识别 #参数高效微调 #语音合成 #数据集 #多模态模型 评分:8.1/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yu-Wen Chen:The Fu Foundation School of Engineering and Applied Science, Columbia University, USA William Ho:The Fu Foundation School of Engineering and Applied Science, Columbia University, USA Maxim Topaz:School of Nursing, Columbia University, USA Zoran Kostic:The Fu Foundation School of Engineering and Applied Science, Columbia University, USA Julia Hirschberg:The Fu Foundation School of Engineering and Applied Science, Columbia University, USA 💬 毒舌点评 用 IndexTTS2 的音色克隆把声学情绪与语义情感正交解耦,补上了大音频语言模型(Large Audio-Language Model,LALM)评测中最缺的矛盾样本,并以层级线性探测将语义主导从现象描述推进到表征定位,诊断清晰。代价是数据仍基于 CREMA-D 的夸张表演语音与合成语音,真实自发情绪与细粒度情绪的泛化存疑;基座模型在矛盾样本上双条件准确率仅 15.3% 至 32.0%,问题暴露充分但解法仅停留在秩为 4 的秩稳定 LoRA(rank-stabilized LoRA,rsLoRA)小规模微调,工程增益明显而方法学突破有限。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1610 words

A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls

📄 文字答得滴水不漏,声音却露了怯:财报电话会里的双重规避 英文题目:A Shaky Voice Is Not Always a Dodge: Benchmarking Textual and Vocal Evasion Detection in Earnings Calls 一句话:论文把财报问答的规避拆成文字是否答到点上与声音是否听起来自信两个独立维度,用 505 条双标注样本证明三成以上的回答存在跨模态不一致,并以文本接近人类而声音非自信类 F1 仅 38 左右的落差揭示现有音频大模型不会做说话人基线校准。 标签:#语音情感识别 #多模态模型 #音频理解 #基准测试 评分:6.2/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Mirae Kim:Financial Tech Lab, KakaoBank Corp. Seonghun Jeong:Financial Tech Lab, KakaoBank Corp.;Yonsei University Youngjun Kwak:Financial Tech Lab, KakaoBank Corp. 💬 毒舌点评 亮点在于首次将财报电话会中的文本规避与声音自信度解耦标注,并用32.1%的跨模态不一致比例有力证明单看文本会系统性漏掉关键信号。短板是505条样本撑起的基准规模过小且声音维度被压缩为二分类自信度,所谓市场波动回归更像用60次电话会硬做叙事,模型在非自信类上38左右的F1也暴露了当前音频大模型对说话人基线校准的无力。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 863 words

Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict

📄 对齐做得更紧,模型却更早替你做决定:音视频矛盾下的晚期先验固化 英文题目:Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict 一句话:论文把语义矛盾的音视频配对当作组合推理探针,用三级时序对齐与对数透镜审计检验 VideoLLaMA 2-7B-AV,发现时序对齐只会搬运答案偏置而无法把准确率抬离随机线,承诺层稳定在 25.5±1 层的晚期固化覆盖了 15 至 18 层已出现的冲突检测信号。 标签:#音视频理解 #多模态模型 #参数高效微调 #可解释性 评分:6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Adarsh Sudheer:Independent Researcher David Li:Independent Researcher Omar Elbanna:Independent Researcher Ishaan Kodarapu:Independent Researcher Arjun Bahuguna:Independent Researcher Vasu Sharma:Independent Researcher 💬 毒舌点评 把音视频矛盾包装为组合泛化探针并用对数透镜定位到 25.5±1 层的晚期固化,为先验主导提供了可复现的机制叙事;代价是行为评估依赖精确字符串匹配的 Yes/No 子集且机制审计仅在 100 样本上以未校准阈值完成,对齐流水线又未做序列长度等混淆因素对照,结论更多是相关性描述而非因果验证。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 969 words

MuSP-Bench: Advanced Multimodal Benchmarking of Music Understanding across Score and Performance

📄 看得懂谱,听得出演奏,才算懂音乐:MuSP-Bench 为何要把乐谱与演奏放在一起考 英文题目:MuSP-Bench: Advanced Multimodal Benchmarking of Music Understanding across Score and Performance 一句话:MuSP-Bench 用 490 道由音乐家围绕完整作品编写的长程题目,把乐谱意图与演奏实现之间的诠释性推理做成可控对比的基准,并用四种等价输入证明结构化符号在分析上最强而原始音频与图像的联合推理仍大幅失效。 标签:#音乐理解 #多模态模型 #基准测试 #模型评估 评分:6.2/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Milan Liessens Dujardin:机构信息未在 arXiv HTML 中可靠披露 Song-Ze Yu:机构信息未在 arXiv HTML 中可靠披露 Kevin Miao:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用490道人工长程题把乐谱意图(Score)与演奏实现(Performance)的诠释性推理做成可测基准,精准命中既有基准只做单图短ABC或只做音频感知的盲区,设计洞察到位。短板是仅18首古典钢琴+6段管弦乐、490题切分子集后统计功效薄弱,且仅测5个前沿模型、缺人类天花板与显著性检验,标注一致性与难度校准亦未量化,导致区分度与外推性仍模糊。 📌 核心摘要 既有音乐理解基准多孤立评估乐谱或音频感知,缺乏对乐谱意图与演奏实现之间跨模态、长时程诠释性推理的系统检验。为此论文提出MuSP-Bench(Multimodal Score-Performance Benchmark),由2名专业音乐家围绕18部完整古典钢琴作品/乐章与6段管弦乐摘录人工编写490道题目,其中460道为开放式预定义格式(音高、小节号、和弦进行、时间戳、乐句等,允许多答案以容纳歧义)、30道为选择题,覆盖音高、织体、和声、曲式、演奏技法与诠释等层级。基准按四维标注:模态(Modality,S/P/S&P/S/P)、时域跨度(Horizon,短19.2%/中25.1%/长36.1%/任意19.6%)、内容层级与操作类型,并支持音频(Audio)、演奏MIDI文本化(MIDI-as-text,ABC音名渲染)、ABC记谱与乐谱图像(Score Image)四种等价输入的对齐对比。实验评估GPT-5.6 Sol、Qwen3.6-Plus、Audio Flamingo Next、Muse Spark 1.2、Qwen3.5-Omni-Plus共5个前沿多模态大模型,发现结构化符号输入在分析类任务上最强,而图像与音频仅在调性、风格、作曲家等全局属性上占优,跨模态联合推理(S&P)仍大幅失效。该基准为面向教育与艺术实践的真实音乐智能提供了稀缺的长程跨模态评估基础,但样本局限于古典、题量与模型覆盖有限。 ...

2026-08-31 · 更新于 2026-09-04 · 3 min · 621 words

SETU: An Agentic Ecosystem for Multilingual, Persona-Aware Communication Coaching

📄 把销售话术拆成可审计的流水线:SETU 为何用多智能体而非一个大模型打分 英文题目:SETU: An Agentic Ecosystem for Multilingual, Persona-Aware Communication Coaching 一句话:面对多语言、码混、角色敏感的销售话术辅导,SETU 选择把视觉、语音、文本与相关性拆成可替换智能体并用信任加权编排做可追溯聚合,在 18 条内部视频上取得教练一致性 0.78 与可解释性 4.3/5 的试点效果,代价是小样本、闭源与未校准阈值带来的外推局限。 标签:#音视频理解 #多模态模型 #语音质量评估 #大语言模型 评分:5.5/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.6/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Jonnalagadda Maruthi Tejas:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com Uponika Barman Roy:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com Tilottama Goswami:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com Samir Goswami:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com Mousita Dhar:Quanta People Solutions Pvt. Ltd., Hyderabad, India Panorama AI Solutions, London, Canada;University College of Engineering, Osmania University, Hyderabad, India;jmtejas.work@gmail.com, uponika@panoramaai.org, goswami.tilottama@gmail.com samirgoswami@tminetwork.com, mousitad@quantapeople.com 💬 毒舌点评 把销售话术辅导拆成可审计的多智能体流水线并显式引入买家角色与信任加权,对多语言码混的工程痛点有针对性;但仅用 18 条内部视频就敢报 0.78 相关性与 40.9% 提效,形式化公式与阈值多为描述性定义而无标定与统计支撑,可复现性与外推性均不足。 ...

2026-08-31 · 更新于 2026-09-04 · 4 min · 833 words

语音/音乐/音频论文速递 2026-08-31

语音/音乐/音频论文速递 2026-08-31 共分析 22 篇论文 ⚡ 今日概览 ✅ 筛选入选 22 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音乐理解 3 篇 ███ #语音交互 2 篇 ██ #语音增强 2 篇 ██ #语音识别 2 篇 ██ #音视频理解 2 篇 ██ #音频分类 2 篇 ██ #音频生成 2 篇 ██ #语音情感识别 1 篇 █ 📊 论文评分排行榜(22 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Phoneme- and Word-Level Metrics Using Self-Supervised… 9.1 前10% 方法研究 #语音识别 🥈 Not all generalisation failures can be bought back… 8.5 前25% 方法研究 #音频理解 🥉 SURE-Challenge: Evaluating Speech Evidence Before… 8.3 前25% 数据集与基准 #语音识别 4. Exploring the Design Space of Representation Learning… 8.0 前25% 方法研究 #音频检索 5. Alias-Free Oscillator Synchronization via Additive… 7.9 前25% 系统技术报告 #音乐生成 6. PolyMap: A 64-Channel Polyphonic Guitar Pickup System 7.7 前25% 系统技术报告 #音乐源分离 7. Multirate State Space Models for End-to-End Processing… 7.5 前25% 方法研究 #语音增强 8. A Mixed-Behavior Vote Model for Multimedia Subjective… 7.4 前50% 方法研究 #语音质量评估 9. A Frequency-Domain Artificial Reverberator Plug-In 7.2 前50% 系统技术报告 #音频生成 10. Low-Power End-to-End Cochlear Implant Speech Denoising… 6.7 前50% 方法研究 #语音增强 11. Compositional Failure in Audio-Visual LLMs: Late-Layer… 6.5 前50% 方法研究 #音视频理解 12. Evaluating Loss Functions in Differentiable Out-of… 6.4 前50% 方法研究 #音频生成 13. A Shaky Voice Is Not Always a Dodge: Benchmarking… 6.2 前50% 数据集与基准 #语音情感识别 14. MuSP-Bench: Advanced Multimodal Benchmarking of Music… 6.2 前50% 数据集与基准 #音乐理解 15. Effects of HRTF Augmentation on Predicted Spatial… 6.1 前50% 方法研究 #音乐理解 16. Auditing Generative Audio Calls for Known-Task Audio… 6.0 前50% 方法研究 #音频分类 17. Is Prosody Lost in Translation? Fine-Grained Cross… 6.0 前50% 数据集与基准 #语音翻译 18. Predicting Turn-Taking Outcomes in Multi-Party… 6.0 前50% 方法研究 #语音交互 19. SETU: An Agentic Ecosystem for Multilingual, Persona… 5.5 前50% 系统技术报告 #音视频理解 20. Klangfarbenakkord and Klangfarbenharmonien Metric… 5.5 前50% 理论研究 #音乐理解 21. Effectiveness of IoT and Deep Learning for Detection… 5.1 后 50% 应用研究 #音频分类 22. When Robots Mishear Us: Mapping the Safety Risks of… 5.1 后 50% 应用研究 #语音交互 📋 论文列表 🥇 没有金标准时,怎么判断对齐切得准不准 英文题目:Phoneme- and Word-Level Metrics Using Self-Supervised Speech Representations for Forced Alignment Evaluation ...

2026-08-31 · 更新于 2026-09-04 · 24 min · 4916 words

A Reranker for Orchestrating Heterogeneous Speech and Text Retrievers

📄 当语音和文本各说各话,重排器如何当翻译官? 英文题目:A Reranker for Orchestrating Heterogeneous Speech and Text Retrievers 一句话:面对语音与文本检索分数不可比的模态鸿沟,STeReO 用 Z-score 归一化加音频大模型统一标注构建跨模态排序监督,再以 Yes/No 词元差值做统一打分,用 pointwise 微调在混合池上把 Spoken SQuAD 的 Hit@1 从 0.527 拉到 0.763 并带动问答 EM 提升约 12 个点,代价是验证仍局限于 TTS 合成的小规模混合库。 标签:#参数高效微调 #多模态模型 #语音大模型 评分:5.8/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Inho Kim:机构信息未在 arXiv HTML 中可靠披露 Sumyeong Ahn:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于直面异构检索分数不可比的模态鸿沟,用 Z-score 归一化加音频大模型(Audio Language Model, ALM)统一标注来构建跨模态排序监督,思路务实且工程链路完整;短板是评估完全依赖文本合成语音(Text-to-Speech, TTS)生成的 Spoken SQuAD 与文本库的简单拼接,缺乏真实自发语音与更强的跨模态基线,所谓超越单模态 reranker 的结论在真实场景中的可信度有限。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 1059 words