Pitch Contour Tokenization using VQ-VAE and Its Application on Korean Traditional Music Analysis

📄 Pitch Contour Tokenization using VQ-VAE and Its Application on Korean Traditional Music Analysis 标签:#音乐理解 #变分自编码器 #无监督学习 #可解释性 7.1/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 0.9/1.5 | 开源 1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音乐理解 | #变分自编码器 | #无监督学习 #可解释性 | arxiv 👥 作者与机构 第一作者:Seonguk Ju(机构未说明) 通讯作者:未说明(论文未标注通讯作者) 作者列表:Seonguk Ju(机构未说明)、Seola Cho(机构未说明)、Sooin Chung(机构未说明)、Danbinaerin Han(机构未说明)、Dasaem Jeong(机构未说明) 💡 毒舌点评 用 VQ-VAE 给连续音高轮廓学一套离散词表,并把“相位、时长、音高、幅度略不同但形状相似”的装饰音压成同一个 token,这个对齐鲁棒重建损失是全文最有价值的想法,且代码和 demo 均公开,算得上诚实工作。但验证盘太小:唯一可比基线是自编码器+UMAP+K-Means,没有和任何其他无监督或自监督音频表征对比;sigimsae 探针离监督模型仍差一大截;模式分析也只是几个 token 的零散案例,没有整体统计或显著性检验。作为方法研究报告成立,但距离“可直接用于语料级音乐学分析”的强声明还有明显证据缺口。 ...

2026-08-12 · 更新于 2026-08-14 · 4 min · 669 words

语音/音乐/音频论文速递 2026-08-12

语音/音乐/音频论文速递 2026-08-12 共分析 27 篇论文 ⚡ 今日概览 📥 抓取 27 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音交互 4篇 ████ #语音识别 4篇 ████ #音乐理解 4篇 ████ #扩散模型 1篇 █ #端到端 1篇 █ #语音分离 1篇 █ #语音合成 1篇 █ #语音增强 1篇 █ 📊 论文评分排行榜(27 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 DuplexWorld: Can voice agents help you get through the 8.5分 前25% 数据集与基准 #语音交互 🥈 A Dataset and Benchmark for Optical Music Recognition o 8.5分 前25% 数据集与基准 #端到端 🥉 Measuring Cross-Cultural Style Diffusion Through Era Cl 8.3分 前25% 方法研究 #音乐理解 4. Training Set Synthesis for Bioacoustic Denoising: A Cas 8.0分 前25% 应用研究 #语音增强 5. Modeling and Interpreting Correlations, Null Distributi 8.0分 前25% 方法研究 #音频理解 6. Seeds Before Objectives: Rethinking Evaluation for Low- 7.9分 前25% 数据集与基准 #语音识别 7. Beyond Dry References: Learning Relative Audio Effects 7.7分 前25% 方法研究 #音乐理解 8. MAJEPPA: Morphing and Assessing in a Unified Piano Perf 7.5分 前25% 方法研究 #音乐理解 9. DIY e-HandPan: A new DIY Low-Cost Handpan Interface bas 7.2分 前50% 系统技术报告 #音频交互 10. Rationale-Guided Learning for Multimodal Emotion Recogn 7.2分 前50% 方法研究 #语音情感识别 11. The GENEA Challenge 2026: A Large-Scale Disentangled Ev 7.2分 前50% 数据集与基准 #语音交互 12. Beyond Naturalness: Probing Automated Text-To-Speech Ev 7.1分 前50% 数据集与基准 #语音质量评估 13. In Defense of Using Worst-case Privacy Disclosure as Pr 7.1分 前50% 理论研究 #说话人验证 14. Pitch Contour Tokenization using VQ-VAE and Its Applica 7.1分 前50% 方法研究 #音乐理解 15. VoxSumm: A Multilingual Corpus of Long-Form Spoken News 6.9分 前50% 数据集与基准 #语音翻译 16. myMediWhisper: Construction of Burmese Medical Speech C 6.7分 前50% 数据集与基准 #语音识别 17. MazzikaAI: A knowledge-based performance-to-prompt comp 6.6分 前50% 系统技术报告 #音乐生成 18. ASR-Roundtrip Evaluation Can Mask Context- and Conventi 6.5分 前50% 方法研究 #语音合成 19. Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with 6.5分 前50% 系统技术报告 #音视频生成 20. TimeRoute: Time-Aware Modality Routing and Diffusion fo 6.5分 前50% 方法研究 #扩散模型 21. X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint 6.4分 前50% 方法研究 #语音交互 22. Edge Phoneme Recognition for Children’s Speech through 6.3分 前50% 模型报告 #语音识别 23. DINO-A: Adapting Self-Distillation Vision Transformers 6.2分 前50% 方法研究 #音频分类 24. Whisper-Aware LLM: Self-Supervised Uncertainty Learning 6.1分 前50% 方法研究 #语音识别 25. Never Stop Speaking: a Denial-of-Service Attack on End- 5.4分 后50% 方法研究 #语音交互 26. BiTSE: Binaural Target Speaker Extraction in Noisy Mult 5.0分 后50% 方法研究 #语音分离 27. Monophonic Audio Synthesizer Using FPGAs 4.2分 后50% 系统技术报告 #音频生成 📋 论文列表 🥇 DuplexWorld: Can voice agents help you get through the day? 8.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ...

2026-08-12 · 更新于 2026-08-14 · 24 min · 4909 words

EG-VAE: A Unified Framework for Electric Guitar Tone Transfer and Removal

📄 EG-VAE: A Unified Framework for Electric Guitar Tone Transfer and Removal 标签:#音频生成 #变分自编码器 #多任务学习 #音频理解 #Transformer 7.3/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.9/1.5 ✅ 7.3/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音频生成 | #变分自编码器 | #多任务学习 #音频理解 | arxiv 👥 作者与机构 第一作者:Yen-Tung Yeh(National Taiwan University) 通讯作者:未说明 作者列表:Yen-Tung Yeh(National Taiwan University)、Yun-Ning (Amy) Hung(Moises)、Yi-Hsuan Yang(National Taiwan University) 💡 毒舌点评 用“掩码前向”统一训练解耦与推理移除的切入点很巧,且 seen/unseen 双设置、主观+客观+消融全套证据使得“统一优于分离”的结论基本站得住。但全文只给 demo 页、不给代码/权重/数据,且“unseen”仅来自同一厂商 Neural DSP 的另一套插件,实际泛化边界被明显高估。对最相关的 ST-ITO 只字未做实验对比,是审稿意见里躲不开的一刀。 ...

2026-08-07 · 更新于 2026-08-14 · 5 min · 920 words

KVAE: Family of Tokenizers for Multimodal Generative Models

📄 KVAE: Family of Tokenizers for Multimodal Generative Models 标签:#多模态模型 #变分自编码器 #音频编码 #音频理解 #Transformer 8.1/10 | 创新 1.3/2 | 严谨 1.3/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 1.3/1.5 🔥 8.1/10 | 前25% | 文档类型:模型报告 | 评分置信度:中 | #音频编码 | #变分自编码器 | #多模态模型 #音频理解 | arxiv 👥 作者与机构 第一作者:Andrey Shutkin(Kandinsky Lab) 通讯作者:未说明 作者列表:Andrey Shutkin、Denis Parkhomenko、Ivan Kirillov、Kirill Chernyshev、Kirill Malakhov、Ilia Vasiliev、Ilia Trushkin、Valeriya Kobenko、David Chikovani、Alexander Ivanov、Azat Saginbaev、Egor Silvestrov、Ivan Mikheev、Konstantin Zakharov,均署名 Kandinsky Lab 💡 毒舌点评 把 tokenizer 当作影响扩散生成的第一公民来做,跨图像、视频、音频统一评估 diffusability,并用 tokenizer-swap 和主观评测证明“重建好不等于生成好”,这是很实用的工程视角。但最关键的音频对齐目标、感知损失具体配置和大量精确超参数被推到“后续 publication”,导致读者很难独立复现。更值得注意的是,客观指标上并非处处 SOTA:音乐域 FAD/CLAP 仍落后于 MMAudio,语音域 SI-SDR 仍落后于 MovieGen DACVAE;最终“全面超越”的结论主要靠 side-by-side 主观胜率撑住,而主观评测又没有给出标注者数量、一致性和置信区间。 ...

2026-08-07 · 更新于 2026-08-14 · 5 min · 887 words

语音/音乐/音频论文速递 2026-08-07

语音/音乐/音频论文速递 2026-08-07 共分析 21 篇论文 ⚡ 今日概览 📥 抓取 21 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音属性识别 2篇 ██ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频生成 2篇 ██ #音频生成 2篇 ██ #声源定位 1篇 █ #语音交互 1篇 █ #语音伪造检测 1篇 █ 📊 论文评分排行榜(21 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 AffectDF: The Most Comprehensive Benchmark for Speech D 8.4分 前25% 数据集与基准 #语音伪造检测 🥈 LILAC: An Idempotent Neural Speech Codec 8.1分 前25% 方法研究 #语音编码 🥉 KVAE: Family of Tokenizers for Multimodal Generative Mo 8.1分 前25% 模型报告 #音频编码 4. Decolonizing Linguistic Policies in Automated Speech Re 7.8分 前25% 理论研究 #语音识别 5. Audio-to-Score Transcription using Pre-trained Features 7.7分 前25% 数据集与基准 #音乐转录 6. Diff2Mix: Controllable Music Mixing via Diffusion Model 7.5分 前25% 方法研究 #音频生成 7. Vorch-Streamer: Extending Human Audio-Visual Generation 7.4分 前50% 方法研究 #音视频生成 8. EG-VAE: A Unified Framework for Electric Guitar Tone Tr 7.3分 前50% 方法研究 #音频生成 9. Explicit and Stable Pseudospectral Time-Domain Method f 7.2分 前50% 方法研究 #音频理解 10. FormBharo: Designing and Evaluating a Voice Agent for C 7.0分 前50% 系统技术报告 #语音交互 11. Whence the Voice? Self-supervised Dual-source Audio-Vis 6.8分 前50% 方法研究 #声源定位 12. Bias Analysis of L2 Speaking Assessment Systems Using C 6.7分 前50% 方法研究 #语音质量评估 13. Diff-Symbo: Text-Controlled Long-Duration Symbolic Musi 6.5分 前50% 方法研究 #音乐生成 14. Rethinking Automatic Music Mixing as Sequential Stem Bl 6.5分 前50% 方法研究 #音乐生成 15. How to Recognize New Words: A Comparison Between Contex 6.4分 前50% 方法研究 #语音识别 16. Beyond Residual Connections: Manifold-Constrained Hyper 6.0分 前50% 方法研究 #说话人验证 17. A Study of ASR Adaptation and Representation Dimensiona 5.7分 前50% 方法研究 #语音情感识别 18. PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Hea 5.6分 前50% 方法研究 #音视频生成 19. The interface of intonation and lexical tone: Boundary 5.6分 前50% 综述 #语音属性识别 20. C\(^3\)PO: Evaluating Cross-Modal Composition and Counter 5.5分 前50% 数据集与基准 #音视频问答 21. ECHO: A Locally-Deployable Agentic Health Assistant wit 5.5分 前50% 系统技术报告 #语音属性识别 📋 论文列表 🥇 AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks 8.4/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ...

2026-08-07 · 更新于 2026-08-14 · 17 min · 3544 words

MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation

📄 MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation 标签:#歌唱生成 #变分自编码器 #语音合成 #音频理解 #Transformer 6.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 0.7/1.5 ✅ 6.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #歌唱生成 | #变分自编码器 | #语音合成 #音频理解 | arxiv 👥 作者与机构 第一作者:Yizhong Geng(未说明) 通讯作者:Ya Li(未说明),Wei Chen(未说明) 作者列表:Yizhong Geng、Wenxin Fu、Kecan Mao、Qifei Li、Yingming Gao、Ruimin Wang、Chunfeng Wang、Hao Li、Ya Li(通讯)、Wei Chen(通讯) 💡 毒舌点评 这篇论文在将显式旋律先验融入神经音频编解码器上的尝试是扎实且动机清晰的,用“先离散再融合”的信息瓶颈来解决捷径学习的设计颇具巧思,两阶段训练策略也提供了稳定的优化方案。然而,实验评估严重局限在单一的中文歌唱测试集上,缺乏与更多近期歌唱或音乐专用编解码器的直接对比;论文宣称服务于LLM生成,却在自回归歌唱生成等下游任务上零验证,让核心动机悬在半空。此外,关键训练细节的缺失不仅削弱了可复现性,也让两阶段训练的实际成本和收敛难度无从评估。 ...

2026-08-05 · 更新于 2026-08-14 · 3 min · 469 words

语音/音乐/音频论文速递 2026-08-05

语音/音乐/音频论文速递 2026-08-05 共分析 32 篇论文 ⚡ 今日概览 📥 抓取 32 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 6篇 ██████ #语音合成 3篇 ███ #音频生成 3篇 ███ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频理解 2篇 ██ #音视频问答 2篇 ██ #多任务学习 1篇 █ 📊 论文评分排行榜(32 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Multi-Task Multi-Frame Visual Piano Transcription 8.8分 前25% 系统技术报告 #音乐转录 🥈 Efficient Audio Enhancement with a Differentiable Psych 8.2分 前25% 系统技术报告 #音频超分辨 🥉 GROW: Group-Relative Advantage-Weighted On-Policy Reinf 8.0分 前25% 方法研究 #语音合成 4. Reinforcement Learning with Evolving Rubrics as Rewards 7.6分 前25% 方法研究 #音频理解 5. Cross-cultural evaluation of taste-sound correspondence 7.5分 前25% 应用研究 #音乐理解 6. dots.tts.edit: Precisely Controlled Speech Editing with 7.4分 前50% 模型报告 #语音编辑 7. Anomalous Sound Detection Meets Noise-Aware Self-Superv 7.2分 前50% 方法研究 #音频事件检测 8. Towards More Expressive Spoken LLMs: Fine-Grained Inten 7.2分 前50% 方法研究 #语音交互 9. CLASVS: Continuous-Latent Autoregression for Melody-Pre 7.1分 前50% 方法研究 #自回归模型 10. Music Restoration via Latent Operator Optimization and 7.0分 前50% 方法研究 #音频修复 11. DDSynth-RL: Audio Synthesizer Inversion via Discrete Di 7.0分 前50% 方法研究 #音频生成 12. Language-Specialized Multi-Teacher On-Policy Distillati 6.9分 前50% 方法研究 #语音识别 13. AI-Based Sound Effect Generation: A Narrative Review of 6.9分 前50% 综述 #音频生成 14. Hear to See: Discerning Stateful Listening for Audio-Vi 6.8分 前50% 方法研究 #音频理解 15. On the Geometry of Music Bandwidth Extension in Latent 6.7分 前50% 方法研究 #音频理解 16. Learning Music Style for Piano Arrangement Through Cros 6.6分 前50% 方法研究 #音乐生成 17. Adaptive Modality Reliability Diagnosis and Restoration 6.4分 前50% 方法研究 #音视频理解 18. Latent Softmax for Data-Efficient Phoneme-Based Multili 6.3分 前50% 方法研究 #语音识别 19. Echo-Aware Modulation for Compact-Latent Frequency-Time 6.3分 前50% 方法研究 #语音增强 20. Geometric Cross-Modal Token Selection for Latency-Const 6.2分 前50% 方法研究 #音视频问答 21. Rethinking Modality Reliability in Multimodal Sentiment 6.2分 前50% 方法研究 #音视频理解 22. Towards Real-world Environment-aware Zero-shot Text-to- 6.1分 前50% 方法研究 #语音合成 23. MeloCodec: Harnessing Melodic Priors for High-Fidelity 6.1分 前50% 方法研究 #歌唱生成 24. Speaker Verification Under Real Classroom Conditions fo 5.7分 前50% 应用研究 #说话人验证 25. Band-Count Dense Modal Estimation with Fixed-Frequency 5.6分 前50% 方法研究 #音频理解 26. Simulation-Based Plate-Reverb Parameter Estimation from 5.5分 前50% 方法研究 #音频理解 27. MEMS Microphones as Ultrasonic Transducers: Nonlinear E 5.5分 前50% 系统技术报告 #音频生成 28. Beyond One-Size-Fits-All: Personalized and Culturally A 5.2分 后50% 方法研究 #语音合成 29. Deep Learning-Based Active Trim Panels for Enhanced Air 5.0分 后50% 方法研究 #多任务学习 30. Calliphony: A Calligraphy-Driven Interface for Real-Tim 5.0分 后50% 系统技术报告 #音乐生成 31. Evidence-Grounded Multimodal Knowledge Graph Constructi 4.7分 后50% 系统技术报告 #音视频问答 32. What Is Sonification? Toward a Philosophy of Sonificati 3.8分 后50% 理论研究 #音频理解 📋 论文列表 🥇 Multi-Task Multi-Frame Visual Piano Transcription 8.8/10 | 创新 1.4/2 | 严谨 1.4/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ...

2026-08-05 · 更新于 2026-08-14 · 24 min · 4991 words

Explainable AI through the Lens of Material Agency: Enabling Musical Interface Design with Neural Audio Models

📄 Explainable AI through the Lens of Material Agency: Enabling Musical Interface Design with Neural Audio Models 标签:#音乐生成 #变分自编码器 #音频理解 #Transformer #模型评估 6.7/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.5/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.5/1.5 | 复现 0.1/0.5 | 工程 1/1.5 ✅ 6.7/10 | 前50% | 文档类型:应用研究 | 评分置信度:中 | #音乐生成 | #变分自编码器 | #音频理解 #Transformer | arxiv 👥 作者与机构 第一作者:Shuoyang Jasper Zheng(Queen Mary University of London, Centre for Digital Music) 通讯作者:未明确指定(按惯例可能为第一作者) 作者列表:Shuoyang Jasper Zheng, Anna Xambó Sedó(Queen Mary University of London, Centre for Digital Music), Nick Bryan-Kinns(University of the Arts London, Creative Computing Institute) 💡 毒舌点评 论文试图从“材料能动性”视角重新包装“工具包+教程”的工作,概念嫁接的野心值得肯定。但作为一篇学术论文,其核心贡献——即“物质可解释性”框架——完全基于对自家工具包开发经验的自我反思,缺乏任何形式的方法论验证。仅凭4位受邀请艺术家的轶事反馈,就得出三条普适性的设计建议,论证逻辑如同空中楼阁。工程上,将研究模型封装成Max/MSP外部对象的流水线工作,在NIME社区虽有实用价值,但技术深度和创新性均有限,更适合作为Demo或Short Paper发表,而非作为提出新概念框架的完整研究。 ...

2026-07-28 · 更新于 2026-08-14 · 2 min · 269 words

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

📄 OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation 标签:#音视频生成 #变分自编码器 #对比学习 #知识蒸馏 #音频理解 7.1/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 1/1.5 | 开源 1.2/1.5 | 复现 0.1/0.5 | 工程 0.8/1.5 ✅ 7.1/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #音视频生成 | #变分自编码器 | #对比学习 #知识蒸馏 | arxiv 👥 作者与机构 第一作者:Jun Zhan(复旦大学, 上海创新研究院, MOSI Intelligence) 通讯作者:Xipeng Qiu(复旦大学, 上海创新研究院, MOSI Intelligence) 作者列表:Jun Zhan(复旦大学, 上海创新研究院, MOSI Intelligence)、Chen Yang(复旦大学, 上海创新研究院, MOSI Intelligence)、Yitian Gong(复旦大学, MOSI Intelligence)、Donghua Yu(复旦大学, MOSI Intelligence)、Kuangwei Chen(复旦大学, MOSI Intelligence)、Wenbo Zhang(复旦大学, MOSI Intelligence)、Kexin Huang(复旦大学, MOSI Intelligence)、Qi Luo(复旦大学, MOSI Intelligence)、Zhe Xu(复旦大学, MOSI Intelligence)、Ying Zhu(MOSI Intelligence, 上海交通大学)、Jin Wang(复旦大学, MOSI Intelligence)、Tengyue Zhang(上海创新研究院, 上海交通大学)、Qi Chen(上海创新研究院, 上海交通大学)、Cheng Chang(复旦大学, MOSI Intelligence)、Songlin Wang(MOSI Intelligence)、Junqi Dai(复旦大学)、Jiasheng Ye(复旦大学)、Xiaogui Yang(MOSI Intelligence)、Tianyi Liang(上海创新研究院, MOSI Intelligence)、Xiangyu Peng(MOSI Intelligence)、Zhaoye Fei(复旦大学, 上海创新研究院, MOSI Intelligence)、Shimin Li(复旦大学, MOSI Intelligence)、Qinyuan Cheng(复旦大学, MOSI Intelligence)、Xie Chen(上海创新研究院, 上海交通大学)、Xinchi Chen(复旦大学)、Xipeng Qiu(复旦大学, 上海创新研究院, MOSI Intelligence) 💡 毒舌点评 这项工作精准地抓住了当前音频-视频生成模型中的一个关键痛点:独立训练的VAE缺乏跨模态对齐,导致下游生成器需要从零开始学习同步。提出的两种训练期目标(语义蒸馏和对比对齐)设计合理,消融实验令人信服地展示了二者的互补效果。然而,重建质量的下滑(尤其是音频侧)暴露了多目标联合训练的固有张力,论文虽然在工程上通过分阶段训练和损失加权予以缓解,但缺乏对这种张力更深入的机制分析,略显“头痛医头”。 ...

2026-07-28 · 更新于 2026-08-14 · 4 min · 834 words

语音/音乐/音频论文速递 2026-07-28

语音/音乐/音频论文速递 2026-07-28 共分析 31 篇论文 ⚡ 今日概览 📥 抓取 31 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #语音合成 5篇 █████ #语音交互 3篇 ███ #语音属性识别 3篇 ███ #声源定位 2篇 ██ #语音识别 2篇 ██ #音乐生成 2篇 ██ #音视频生成 2篇 ██ #对比学习 1篇 █ 📊 论文评分排行榜(31 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 StanceBench: A Benchmark for Audio LLM-Based Interperso 8.6分 前25% 数据集与基准 #语音属性识别 🥈 Expose Your Disguise: Recovering Source Speaker Identit 7.5分 前25% 方法研究 #对比学习 🥉 Leveraging Gradient Reversal Loss and Multitask Learnin 7.3分 前50% 方法研究 #语音伪造检测 4. PathRIR: Physics-Guided Acoustic Path Selection and Lat 7.2分 前50% 方法研究 #空间音频 5. Indic DiarBench: A Multilingual Joint Diarization and A 7.1分 前50% 数据集与基准 #说话人日志 6. Earnings25: A Comprehensive 500-Hour Speech Benchmark f 7.1分 前50% 数据集与基准 #语音识别 7. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment 7.1分 前50% 方法研究 #音视频生成 8. Revisiting Vocos: That Phasiness Business in Time-Frequ 7.1分 前50% 方法研究 #语音合成 9. Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robu 7.0分 前50% 系统技术报告 #语音合成 10. Towards High-Level Semantic Intelligence 7.0分 前50% 综述 #音视频理解 11. Speech Signals Complement LLMs for Predicting Interpers 6.9分 前50% 应用研究 #语音交互 12. Let Me Look at You: Advanced Facial Expression Modeling 6.9分 前50% 模型报告 #语音合成 13. Simple Language Normalization Wins: Cross-Lingual Speak 6.8分 前50% 系统技术报告 #说话人验证 14. Memory Efficient Audio Synthesis with Decoupled Tempora 6.8分 前50% 系统技术报告 #语音合成 15. Explainable AI through the Lens of Material Agency: Ena 6.7分 前50% 应用研究 #音乐生成 16. MoLGE: Mixture of Language Group Experts for Efficient 6.7分 前50% 方法研究 #语音识别 17. Mind the Microphone Gap: Benchmarking Array Upsampling 6.6分 前50% 方法研究 #声源定位 18. Multimodal Domain Generalization for Depression Detecti 6.4分 前50% 方法研究 #音频分类 19. Infinite Canons: Maximally Self-Similar Melodic Lines a 6.4分 前50% 理论研究 #音乐生成 20. Singlish, Can or Not? Fine-Tuning and Evaluating Zero-S 6.3分 前50% 应用研究 #语音合成 21. JarvisHub: An Open Harness for Canvas-Native Multimodal 6.2分 前50% 系统技术报告 #音视频生成 22. Low-Latency Turn-Taking via Context-Aware Preface Gener 6.1分 前50% 系统技术报告 #语音交互 23. Do Visual Features Improve Other-Initiated Repair Detec 5.9分 前50% 方法研究 #音视频交互 24. Automatic Audio Equalization with Semantic Embeddings 5.8分 前50% 方法研究 #语音增强 25. Music-Source-Separation-Training (MSST): A Unified Fram 5.7分 前50% 系统技术报告 #音乐源分离 26. Disentangling Acoustic Cues in Alzheimer’s Pathology an 5.4分 后50% 应用研究 #语音属性识别 27. Speech Entrainment in Multi-Party Conversations with a 5.3分 后50% 应用研究 #语音交互 28. Improving Zero-Shot Phonetic Classification through Lan 5.3分 后50% 方法研究 #语音属性识别 29. Looking for Affect in Spontaneous Finnish Speech throug 5.3分 后50% 应用研究 #语音情感识别 30. Modeling Stylistic Co-evolution in Symbolic Music Herit 4.9分 后50% 方法研究 #音乐理解 31. Resource-Aware Topology Management for ISAC-Enabled TDO 4.1分 后50% 方法研究 #声源定位 📋 论文列表 🥇 StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech 8.6/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ...

2026-07-28 · 更新于 2026-08-14 · 26 min · 5365 words