Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection

📄 别再只调大模型:用 88 行文字把声音的破绽说给 LLM 听 英文题目:Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection 一句话:针对伪造语音在未见攻击与信道上泛化差的问题,论文把检测重做为问答任务,通过微调音频编码器配合冻结的指令大模型,并用 openSMILE 的 88 维声学特征文本化来弥合模态鸿沟,在 In-the-Wild 与 MLAAD 上取得显著域外提升,代价是约 1500 token 的提示开销与尚未开源的复现成本。 标签:#语音伪造检测 #多模态模型 #大语言模型 #参数高效微调 #鲁棒性 评分:6.4/10 | 创新 1.4/2 | 技术严谨 1/1.5 | 实验充分 1/1.5 | 清晰度 0.7/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yassine El Kheir:机构信息未在 arXiv HTML 中可靠披露 Xin Wang:机构信息未在 arXiv HTML 中可靠披露 Wanqing Ge:机构信息未在 arXiv HTML 中可靠披露 Tim Polzehl:机构信息未在 arXiv HTML 中可靠披露 Sebastian Moeller:机构信息未在 arXiv HTML 中可靠披露 Junichi Yamagishi:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于用 openSMILE eGeMAPSv2 88维特征的文本序列化显式锚定大语言模型(Large Language Model, LLM)语义空间,解决了音频大模型(Audio Large Language Model, ALLM)中连续音频嵌入与文本推理的模态鸿沟,并在 In-the-Wild 与 MLAAD 上把冻结 LLM 的泛化瓶颈撕开一道口子。短板则是正文与表格数值多处自相矛盾、1500 token 的提示开销被轻描淡写为可忽略,且未提供代码仓库与权重链接,可验证性与统计严谨性均有明显欠缺。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1600 words

What Are You Listening to? Temporal Music Grounding for Audio-to-Text Large Language Models

📄 听见了,就要指得出来:用可验证的时间证据检验音乐大模型的耳朵 英文题目:What Are You Listening to? Temporal Music Grounding for Audio-to-Text Large Language Models 一句话:论文把“是否真的听见”形式化为按自然语言查询返回时间区间的定位任务,并用全合成钢琴渲染构建 MusicGroundingBench 来精确评测,发现现有音频大模型零样本几乎无法定位而任务微调后可达高精度,但合成单声部短片段的代价限制了向真实音乐的泛化。 标签:#音乐理解 #参数高效微调 #基准测试 评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.1/1.5 | 实验充分 0.9/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.5/1.5 | 可复现 0.1/0.5 | 工程/实践 1/1.5 👥 作者与机构 Kun Fang:机构信息未在 arXiv HTML 中可靠披露 Ziyu Wang:机构信息未在 arXiv HTML 中可靠披露 Ichiro Fujinaga:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把音乐 grounding 从空洞的 caption 正确率拉回到可验证的时间证据上,用全合成 MIDI 渲染实现符号到音频的精确对齐,任务定义清晰且可控。短板也同样源于这种可控:严格单声部钢琴、PianoTeq 9 Stage 合成、时长不超过 10 秒,与真实多声部、多音色音乐距离过远,零样本基线几乎全失效也让对比缺乏说服力,定位监督对理解的增益仅在单一骨干上显现,结论只能算探索性。 ...

2026-09-01 · 更新于 2026-09-04 · 6 min · 1216 words

When Vocal Tone and Literal Meaning Diverge: An Acoustic-Semantic Incongruity Study for Large Audio-Language Models

📄 当声音在笑、文字在哭:大音频语言模型为何听不见讽刺 英文题目:When Vocal Tone and Literal Meaning Diverge: An Acoustic-Semantic Incongruity Study for Large Audio-Language Models 一句话:针对大音频语言模型重文字轻声音、在讽刺等声学-语义矛盾语音上失灵的问题,论文用 IndexTTS2 音色克隆合成 77,559 条矛盾可控的 CREMA-ASIS 数据,通过双任务评测与层级线性探测定位语义主导,并以秩为 4 的 rsLoRA 微调将双条件准确率从约 20% 提升至 68% 且保持转写能力。 标签:#语音情感识别 #参数高效微调 #语音合成 #数据集 #多模态模型 评分:8.1/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Yu-Wen Chen:The Fu Foundation School of Engineering and Applied Science, Columbia University, USA William Ho:The Fu Foundation School of Engineering and Applied Science, Columbia University, USA Maxim Topaz:School of Nursing, Columbia University, USA Zoran Kostic:The Fu Foundation School of Engineering and Applied Science, Columbia University, USA Julia Hirschberg:The Fu Foundation School of Engineering and Applied Science, Columbia University, USA 💬 毒舌点评 用 IndexTTS2 的音色克隆把声学情绪与语义情感正交解耦,补上了大音频语言模型(Large Audio-Language Model,LALM)评测中最缺的矛盾样本,并以层级线性探测将语义主导从现象描述推进到表征定位,诊断清晰。代价是数据仍基于 CREMA-D 的夸张表演语音与合成语音,真实自发情绪与细粒度情绪的泛化存疑;基座模型在矛盾样本上双条件准确率仅 15.3% 至 32.0%,问题暴露充分但解法仅停留在秩为 4 的秩稳定 LoRA(rank-stabilized LoRA,rsLoRA)小规模微调,工程增益明显而方法学突破有限。 ...

2026-09-01 · 更新于 2026-09-04 · 8 min · 1610 words

语音/音乐/音频论文速递 2026-09-01

语音/音乐/音频论文速递 2026-09-01 共分析 49 篇论文 ⚡ 今日概览 ✅ 筛选入选 49 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 8 篇 ████████ #语音情感识别 5 篇 █████ #音乐生成 5 篇 █████ #语音合成 4 篇 ████ #语音增强 4 篇 ████ #音乐理解 4 篇 ████ #说话人日志 2 篇 ██ #音乐转录 2 篇 ██ 📊 论文评分排行榜(49 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Anchoring Speech with Semantics: A Multimodal Adapter… 8.4 前25% 方法研究 #语音识别 🥈 Playability-Aware Audio-to-Tablature Guitar… 8.2 前25% 方法研究 #音乐转录 🥉 When Vocal Tone and Literal Meaning Diverge: An… 8.1 前25% 数据集与基准 #语音情感识别 4. Self-Supervised Pretext Tasks for Infant Cry Analysis… 8.1 前25% 方法研究 #音频分类 5. ImageEval 2026: Culturally Grounded Arabic Multimodal… 8.1 前25% 数据集与基准 #语音识别 6. Perceptually Better, Semantically Worse: Measuring… 8.0 前25% 数据集与基准 #语音增强 7. Vocal Music under Phoneme-Conditional Analysis 8.0 前25% 方法研究 #音乐理解 8. Likelihood-Constrained Acoustic Reranking for Training… 7.8 前25% 方法研究 #语音识别 9. Using Prosody to Predict Syntactic Structure 7.6 前25% 方法研究 #Transformer 10. When Does Predictor-Based RL Align with Human… 7.6 前25% 方法研究 #语音合成 11. V2TATC: A Joint Voice-Trajectory Embedding Framework… 7.5 前25% 方法研究 #对比学习 12. Sequential Trajectories and Simultaneous Blending… 7.5 前25% 方法研究 #语音合成 13. No Detectable Change in Side-Level WER from Prompt… 7.4 前50% 应用研究 #语音识别 14. VocalAffectBench: Evaluating Vocal Emotion Recognition… 7.4 前50% 数据集与基准 #语音情感识别 15. When Models Hear What They Expect: Diagnosing Prosodic… 7.4 前50% 方法研究 #语音情感识别 16. Context-Aware Interleaved Batching for WhisperX 7.4 前50% 方法研究 #语音识别 17. Enabling Proactive Spoken Turns via a Generalized… 7.3 前50% 方法研究 #语音交互 18. MusGU+: Toward a Musician-Centered Evaluation… 7.3 前50% 数据集与基准 #音乐生成 19. Stride-k Subsampling: Train-Free Audio Token Reduction… 7.2 前50% 方法研究 #语音识别 20. TEMPO: Temporally-grounded Multi-task Post-training… 7.1 前50% 方法研究 #音频事件检测 21. VIBE: Video Instruction-aligned Background music… 7.1 前50% 方法研究 #音乐生成 22. Diagnose, Then Refine: A Closed-Loop TTS System with… 7.0 前50% 方法研究 #语音合成 23. HEAR Who Said What: Unlocking Speaker-Attributed… 7.0 前50% 数据集与基准 #说话人日志 24. Evidence-Bounded Mental Health Reasoning from… 7.0 前50% 数据集与基准 #语音情感识别 25. SPHERE: Automatic Music Upmixing via Audio Language… 6.9 前50% 方法研究 #音乐生成 26. Linguistic Distance Segregates Latent Representations… 6.9 前50% 应用研究 #语音识别 27. Closing the Verification Loop: Self-Check Captioning… 6.8 前50% 方法研究 #音频字幕生成 28. Conjoint Audio-to-Spikes Encoding and Processing for… 6.8 前50% 方法研究 #语音识别 29. Neural Multichannel Distant Speaker Diarization and… 6.6 前50% 方法研究 #说话人日志 30. PhysWave: Physics-Guided Latent Diffusion Models for… 6.6 前50% 方法研究 #音频生成 31. What Are You Listening to? Temporal Music Grounding… 6.5 前50% 数据集与基准 #音乐理解 32. CoJEPA: Combining Contrastive Learning and JEPA for… 6.5 前50% 方法研究 #音乐理解 33. Ouroboros: Self-Referential Backdoor Attacks on Speech… 6.4 前50% 方法研究 #语音增强 34. Textual Acoustic Grounding for Generalizable LLM-Based… 6.4 前50% 方法研究 #语音伪造检测 35. Towards Balanced Spectral Reconstruction: Spectrally… 6.4 前50% 方法研究 #语音增强 36. Accurate Plate Reverb Parameter Estimation Using Two… 6.3 前50% 方法研究 #音乐理解 37. Beyond Speech: Dual-Domain SSL Fusion for Unified All… 6.3 前50% 系统技术报告 #音频伪造检测 38. Weakly Supervised Tabla Stroke Transcription via an… 6.3 前50% 方法研究 #音乐转录 39. Language-Statistical Analysis of Neural Audio Codec… 6.3 前50% 方法研究 #语音编码 40. Parallel Time-Band Mixing with Learned Observation… 6.2 前50% 方法研究 #语音增强 41. How Well Do Generative Music Models Follow Emotion… 6.0 前50% 数据集与基准 #音乐生成 42. Multimodal Adaptive Expert Selection with Text Routing… 6.0 前50% 方法研究 #音视频理解 43. Evoking Harmony via Convolution 5.9 前50% 方法研究 #音乐生成 44. DreamX-Creator: Democratizing Native Audio-Video… 5.9 前50% 模型报告 #扩散模型 45. Leveraging Bayesian Optimization for Array Shape Self… 5.7 前50% 方法研究 #声源定位 46. Opinionated, Hesitant and Stressed: Three Studies of… 5.6 前50% 应用研究 #语音情感识别 47. Disentangling Representation using Attributes-based… 5.5 前50% 方法研究 #音频分类 48. Decoupled Latent Flow Matching for Few-Step Joint… 5.3 后 50% 方法研究 #音乐源分离 49. Audio-Driven Adversarial Defense for 3D Talking Face… 4.3 后 50% 方法研究 #语音合成 📋 论文列表 🥇 当解码器缺的不是声音,而是下一词的语义证据 英文题目:Anchoring Speech with Semantics: A Multimodal Adapter Mechanism for Automatic Speech Recognition in Low-Resource Languages ...

2026-09-01 · 更新于 2026-09-04 · 55 min · 11646 words

Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict

📄 对齐做得更紧,模型却更早替你做决定:音视频矛盾下的晚期先验固化 英文题目:Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict 一句话:论文把语义矛盾的音视频配对当作组合推理探针,用三级时序对齐与对数透镜审计检验 VideoLLaMA 2-7B-AV,发现时序对齐只会搬运答案偏置而无法把准确率抬离随机线,承诺层稳定在 25.5±1 层的晚期固化覆盖了 15 至 18 层已出现的冲突检测信号。 标签:#音视频理解 #多模态模型 #参数高效微调 #可解释性 评分:6.5/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 1/1.5 | 可复现 0.1/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Adarsh Sudheer:Independent Researcher David Li:Independent Researcher Omar Elbanna:Independent Researcher Ishaan Kodarapu:Independent Researcher Arjun Bahuguna:Independent Researcher Vasu Sharma:Independent Researcher 💬 毒舌点评 把音视频矛盾包装为组合泛化探针并用对数透镜定位到 25.5±1 层的晚期固化,为先验主导提供了可复现的机制叙事;代价是行为评估依赖精确字符串匹配的 Yes/No 子集且机制审计仅在 100 样本上以未校准阈值完成,对齐流水线又未做序列长度等混淆因素对照,结论更多是相关性描述而非因果验证。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 969 words

语音/音乐/音频论文速递 2026-08-31

语音/音乐/音频论文速递 2026-08-31 共分析 22 篇论文 ⚡ 今日概览 ✅ 筛选入选 22 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音乐理解 3 篇 ███ #语音交互 2 篇 ██ #语音增强 2 篇 ██ #语音识别 2 篇 ██ #音视频理解 2 篇 ██ #音频分类 2 篇 ██ #音频生成 2 篇 ██ #语音情感识别 1 篇 █ 📊 论文评分排行榜(22 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Phoneme- and Word-Level Metrics Using Self-Supervised… 9.1 前10% 方法研究 #语音识别 🥈 Not all generalisation failures can be bought back… 8.5 前25% 方法研究 #音频理解 🥉 SURE-Challenge: Evaluating Speech Evidence Before… 8.3 前25% 数据集与基准 #语音识别 4. Exploring the Design Space of Representation Learning… 8.0 前25% 方法研究 #音频检索 5. Alias-Free Oscillator Synchronization via Additive… 7.9 前25% 系统技术报告 #音乐生成 6. PolyMap: A 64-Channel Polyphonic Guitar Pickup System 7.7 前25% 系统技术报告 #音乐源分离 7. Multirate State Space Models for End-to-End Processing… 7.5 前25% 方法研究 #语音增强 8. A Mixed-Behavior Vote Model for Multimedia Subjective… 7.4 前50% 方法研究 #语音质量评估 9. A Frequency-Domain Artificial Reverberator Plug-In 7.2 前50% 系统技术报告 #音频生成 10. Low-Power End-to-End Cochlear Implant Speech Denoising… 6.7 前50% 方法研究 #语音增强 11. Compositional Failure in Audio-Visual LLMs: Late-Layer… 6.5 前50% 方法研究 #音视频理解 12. Evaluating Loss Functions in Differentiable Out-of… 6.4 前50% 方法研究 #音频生成 13. A Shaky Voice Is Not Always a Dodge: Benchmarking… 6.2 前50% 数据集与基准 #语音情感识别 14. MuSP-Bench: Advanced Multimodal Benchmarking of Music… 6.2 前50% 数据集与基准 #音乐理解 15. Effects of HRTF Augmentation on Predicted Spatial… 6.1 前50% 方法研究 #音乐理解 16. Auditing Generative Audio Calls for Known-Task Audio… 6.0 前50% 方法研究 #音频分类 17. Is Prosody Lost in Translation? Fine-Grained Cross… 6.0 前50% 数据集与基准 #语音翻译 18. Predicting Turn-Taking Outcomes in Multi-Party… 6.0 前50% 方法研究 #语音交互 19. SETU: An Agentic Ecosystem for Multilingual, Persona… 5.5 前50% 系统技术报告 #音视频理解 20. Klangfarbenakkord and Klangfarbenharmonien Metric… 5.5 前50% 理论研究 #音乐理解 21. Effectiveness of IoT and Deep Learning for Detection… 5.1 后 50% 应用研究 #音频分类 22. When Robots Mishear Us: Mapping the Safety Risks of… 5.1 后 50% 应用研究 #语音交互 📋 论文列表 🥇 没有金标准时,怎么判断对齐切得准不准 英文题目:Phoneme- and Word-Level Metrics Using Self-Supervised Speech Representations for Forced Alignment Evaluation ...

2026-08-31 · 更新于 2026-09-04 · 24 min · 4916 words

A Reranker for Orchestrating Heterogeneous Speech and Text Retrievers

📄 当语音和文本各说各话,重排器如何当翻译官? 英文题目:A Reranker for Orchestrating Heterogeneous Speech and Text Retrievers 一句话:面对语音与文本检索分数不可比的模态鸿沟,STeReO 用 Z-score 归一化加音频大模型统一标注构建跨模态排序监督,再以 Yes/No 词元差值做统一打分,用 pointwise 微调在混合池上把 Spoken SQuAD 的 Hit@1 从 0.527 拉到 0.763 并带动问答 EM 提升约 12 个点,代价是验证仍局限于 TTS 合成的小规模混合库。 标签:#参数高效微调 #多模态模型 #语音大模型 评分:5.8/10 | 创新 1.3/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.9/1.5 👥 作者与机构 Inho Kim:机构信息未在 arXiv HTML 中可靠披露 Sumyeong Ahn:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于直面异构检索分数不可比的模态鸿沟,用 Z-score 归一化加音频大模型(Audio Language Model, ALM)统一标注来构建跨模态排序监督,思路务实且工程链路完整;短板是评估完全依赖文本合成语音(Text-to-Speech, TTS)生成的 Spoken SQuAD 与文本库的简单拼接,缺乏真实自发语音与更强的跨模态基线,所谓超越单模态 reranker 的结论在真实场景中的可信度有限。 ...

2026-08-29 · 更新于 2026-09-04 · 5 min · 1059 words

语音/音乐/音频论文速递 2026-08-29

语音/音乐/音频论文速递 2026-08-29 共分析 29 篇论文 ⚡ 今日概览 ✅ 筛选入选 29 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音识别 5 篇 █████ #语音交互 3 篇 ███ #音视频理解 3 篇 ███ #音频检索 2 篇 ██ #音频理解 2 篇 ██ #LoRA 1 篇 █ #多模态模型 1 篇 █ #空间音频 1 篇 █ 📊 论文评分排行榜(29 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AudioSpan: Spanning the Duration and Depth of Audio… 8.7 前25% 数据集与基准 #音频理解 🥈 StreamAV-Bench: A Comprehensive Benchmark for… 8.2 前25% 数据集与基准 #音频生成 🥉 AfriSwitch: A Benchmark for In-the-Wild African Code… 8.1 前25% 数据集与基准 #语音识别 4. Said Aloud, Read Different: Cross-Modal Instability in… 8.1 前25% 数据集与基准 #音视频问答 5. Your Voice Cloning System is Secretly a Voice… 8.0 前25% 方法研究 #语音转换 6. Vagdhenu: A Vrutta (Meter) Aware Shloka-to-Chant (TTS)… 7.9 前25% 系统技术报告 #语音合成 7. Modality Maturity Index: A benchmark for assessing… 7.8 前25% 数据集与基准 #音视频理解 8. Emotion Understanding in Streaming Video with… 7.7 前25% 方法研究 #音视频理解 9. SpeechGym: An Audio-Native Gym for Training Voice… 7.6 前25% 系统技术报告 #语音交互 10. Omni-Interactive Universal Embedder 7.5 前25% 方法研究 #音频检索 11. Multi2AV-Safety: Benchmarking Safety in Multimodal-to… 7.3 前50% 数据集与基准 #音视频生成 12. Mapping Written Words to Spoken Words in a Different… 7.3 前50% 方法研究 #音频检索 13. Towards Interpretable Depression Detection: Linking… 7.1 前50% 系统技术报告 #语音情感识别 14. Letters hide the truth from our eyes: English… 6.8 前50% 方法研究 #语音识别 15. Interpretable, Fairly Evaluated Automated L2 Speaking… 6.7 前50% 方法研究 #语音质量评估 16. When Text Misleads: Inconsistent-Aware Reasoning for… 6.6 前50% 数据集与基准 #语音交互 17. From Sound to Symptom: Real-Time Respiratory Signal… 6.4 前50% 系统技术报告 #音频事件检测 18. Scaling phoneme-based TTS augmentation for ASR: A… 6.2 前50% 方法研究 #语音识别 19. Direct or Mediated? Task-Dependent Audio Information… 6.1 前50% 方法研究 #音频理解 20. Attention-Guided Reliability Scaling for Contrastive… 6.0 前50% 方法研究 #语音识别 21. Soft Active Electromyography Interface for Machine… 5.9 前50% 系统技术报告 #语音识别 22. A Reranker for Orchestrating Heterogeneous Speech and… 5.8 前50% 方法研究 #LoRA 23. Decay-Region Group Delay as a Forensic Cue for AI… 5.8 前50% 方法研究 #音频伪造检测 24. Recovering Expert Critic-Sourced Network Adjacency… 5.8 前50% 方法研究 #音乐推荐 25. Benchmarking_Fast_Domain_Adaptation_for_Unsupervised_S… 5.5 前50% 数据集与基准 #语音编码 26. GAN-based Joint Dereverberation and Directional… 5.3 后 50% 方法研究 #空间音频 27. Real-TurnTurk: A Multimodal Turkish Corpus for Turn… 5.1 后 50% 数据集与基准 #多模态模型 28. A Safety-Gated Multimodal AI Backend for Mental-Health… 5.0 后 50% 系统技术报告 #语音交互 29. How AI Experiences Art: Emergent Aesthetic Structure… 4.0 后 50% 方法研究 #音视频理解 📋 论文列表 🥇 长音频不是更长的短音频:AudioSpan 如何逼模型证明它真的听见了 英文题目:AudioSpan: Spanning the Duration and Depth of Audio Comprehension ...

2026-08-29 · 更新于 2026-09-04 · 29 min · 5993 words

Speech-to-SOAP: End-to-End Summarization of Medical Dialogues: KIT@BeTraC 2026

📄 Speech-to-SOAP: End-to-End Summarization of Medical Dialogues: KIT@BeTraC 2026 标签:#音频理解 #语音大模型 #医疗音频 #端到端 #参数高效微调 7.7/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.7/10 | 前25% | 文档类型:系统技术报告 | 评分置信度:高 | #音频理解 | #语音大模型 | #医疗音频 #端到端 | arxiv 👥 作者与机构 第一作者:Enes Yavuz Ugan(ISL, Karlsruhe Institute of Technology) 通讯作者:正文未明确标注;仅列 Enes Yavuz Ugan 的联系邮箱 作者列表:Enes Yavuz Ugan、Fabian Retkowski、Yuka Ko、Thai-Binh Nguyen、Maike Züfle、Jan Niehues、Alexander Waibel(机构:ISL, Karlsruhe Institute of Technology;AI4LT, Karlsruhe Institute of Technology;InterACT, Carnegie Mellon University) ...

2026-08-26 · 更新于 2026-09-04 · 4 min · 798 words

语音/音乐/音频论文速递 2026-08-26

语音/音乐/音频论文速递 2026-08-26 共分析 26 篇论文 ⚡ 今日概览 ✅ 筛选入选 26 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 7 篇 ███████ #空间音频 3 篇 ███ #语音交互 2 篇 ██ #语音合成 2 篇 ██ #音乐生成 2 篇 ██ #音视频理解 2 篇 ██ #声源定位 1 篇 █ #语音伪造检测 1 篇 █ 📊 论文评分排行榜(26 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions… 9.6 前10% 方法研究 #语音合成 🥈 LAION-BVD: A 10-Million-Hour Open Video Dataset for… 9.4 前10% 数据集与基准 #音视频理解 🥉 The ISCSLP 2026 Real-World Audio-Visual Speech… 8.8 前25% 数据集与基准 #音视频语音分离 4. EM-KalmanNet: Learned Expectation-Maximization for… 8.8 前25% 方法研究 #声源定位 5. EXAM\(^2\): \(\underline{Ex}tending\) \(\underline{A}udio\)… 8.7 前25% 数据集与基准 #音频理解 6. FireRedAudio: A General-Purpose Audio Language Model… 8.7 前25% 模型报告 #音频理解 7. Arbitrary Polygon Oscillator: Generalizing Polygonal… 8.7 前25% 方法研究 #音乐生成 8. Relative Time Intervals Representation for Word-level… 8.6 前25% 方法研究 #语音识别 9. REDnet: Recursive Encoder and Decoder for Speech… 8.2 前25% 方法研究 #语音分离 10. From local kernels to global form: modeling the… 8.2 前25% 理论研究 #音乐理解 11. Lost in Speech: Trilingual Spoken Hallucination… 8.2 前25% 数据集与基准 #音频理解 12. Weakly Supervised Seafloor Segmentation for Seagrass… 8.1 前25% 方法研究 #音频理解 13. SonarLLM: A Native Sonar–Optical Multimodal Large… 8.0 前25% 方法研究 #音频理解 14. CoSTALA: Compositional Spatio-Temporal Audio-Language… 7.9 前25% 方法研究 #空间音频 15. Don’t Just Listen, Try Planning: Graph-based Retrieval… 7.8 前25% 方法研究 #音频理解 16. On the Robustness of Audio Deepfake Detection under… 7.7 前25% 方法研究 #音频伪造检测 17. Speech-to-SOAP: End-to-End Summarization of Medical… 7.7 前25% 系统技术报告 #音频理解 18. Array-Agnostic Ambisonics Encoding via Diffusion… 7.5 前25% 方法研究 #空间音频 19. OmniJudge or OmniBias? Diagnosing Multimodal Judges… 7.4 前50% 数据集与基准 #音频质量评估 20. Task-disentangled Low-Rank Adaptation for Versatile… 7.4 前50% 方法研究 #音视频理解 21. Anatomy of a Scam Call: What 10,000 real scam and spam… 7.3 前50% 应用研究 #语音交互 22. Preference Optimization for Non-Verbal Vocalization… 7.1 前50% 方法研究 #语音合成 23. One Timeline, Many Renderings: A Wolfram Language… 7.0 前50% 系统技术报告 #音乐生成 24. Visually-Guided Spatial Audio Generation for… 6.9 前50% 方法研究 #空间音频 25. Benchmarking LLM Judges for Voice-Agent Evaluation… 6.6 前50% 数据集与基准 #语音交互 26. Investigating voiced and unvoiced regions of speech… 6.4 前50% 方法研究 #语音伪造检测 📋 论文列表 🥇 EmoTra-TTS: Smooth Intra-Utterance Emotion Transitions for Speech Synthesis 9.6/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 ...

2026-08-26 · 更新于 2026-09-04 · 22 min · 4543 words