Playability-Aware Audio-to-Tablature Guitar Transcription via Diffusion Models

📄 同一音高多条路:用扩散与可演奏约束把吉他谱写对、写得能弹 英文题目:Playability-Aware Audio-to-Tablature Guitar Transcription via Diffusion Models 一句话:针对吉他同一音高对应多弦品位置的歧义,Noise2Fret 把离散指板谱嵌入连续空间做条件扩散去噪,并以五项可微音乐物理损失联合约束,在 GuitarSet 与 GOAT 上同时提升音高与指板 F 值并保持 0.67 实时因子,代价是仍局限于标准调弦短窗干净录音。 标签:#音乐转录 #扩散模型 #多任务学习 #高效推理 评分:8.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Riccardo Simionato:Univ. Bordeaux;CNRS, Bordeaux INP, LaBRI;Talence, France Louis Bigo:Univ. Bordeaux;CNRS, Bordeaux INP, LaBRI;Talence, France 💬 毒舌点评 把离散指板选择搬进连续扩散空间并用五项可微音乐物理损失做软约束,思路比统计共现抑制更可解释,且在 GOAT 上的召回与可演奏性平衡确有说服力。短板是 100 ms 窗口与事件级聚合的时序建模过短、评测仍局限于标准调弦的干净录音,且对圆圈五度等较弱先验缺乏统计显著性与真实演奏容错分析。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1430 words

Task-disentangled Low-Rank Adaptation for Versatile Audio-visual Multi-modal Learning Tasks within a Unified Framework

📄 Task-disentangled Low-Rank Adaptation for Versatile Audio-visual Multi-modal Learning Tasks within a Unified Framework 标签:#音视频理解 #LoRA #多任务学习 #多模态模型 7.4/10 | 创新 1.7/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 ✅ 7.4/10 | 前50% | 文档类型:方法研究 | 评分置信度:高 | #音视频理解 | #LoRA | #多任务学习 #多模态模型 | arxiv 👥 作者与机构 第一作者:Hanyu Xuan(School of Big Data and Statistics, Anhui University, Hefei 230039, China) 通讯作者:Junjun Mao;Zhiliang Wu 作者列表:Hanyu Xuan、Mengqi Zhang、Junjun Mao、Fei Wang、Kun Li、Guanghui Yue、Zhiliang Wu、Hehe Fan(机构:School of Big Data and Statistics, Anhui University, Hefei 230039, China;Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, Hefei 230026, China;College of Information Technology, United Arab Emirates University, Abu Dhabi 15551, United Arab Emirates;School of Biomedical Engineering, Shenzhen University, Shenzhen 518060, China;College of Computing and Data Science, Nanyang Technological University, Singapore 639798, Singapore;School of Artificial Intelligence, Zhejiang University, Hangzhou 310007, China) ...

2026-08-26 · 更新于 2026-09-04 · 6 min · 1097 words

DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization

📄 DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization 标签:#语音质量评估 #自监督学习 #多任务学习 #模型评估 8.2/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音质量评估 | #自监督学习 | #多任务学习 #模型评估 | arxiv 👥 作者与机构 第一作者:Naiyuan Li(Ningbo University,College of Information Science and Engineering) 通讯作者:Diqun Yan 作者列表:Naiyuan Li、Li Dong、Diqun Yan(机构:Ningbo University,College of Information Science and Engineering;Ningbo University of Finance and Economics,College of Artificial Intelligence;浙江省大宗商品数字供应链与人工智能协同创新中心) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 506 words

Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation

📄 Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation 标签:#语音情感识别 #自监督学习 #多任务学习 #说话人日志 8.4/10 | 创新 1.7/2 | 严谨 1.4/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 0.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8.4/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音情感识别 | #自监督学习 | #多任务学习 #说话人日志 | arxiv 👥 作者与机构 第一作者:Guan-Hua Wen(Department of Computer Science and Information Engineering / Graduate Institute of Digital Learning and Education, National Taiwan University of Science and Technology, Taipei, Taiwan) 通讯作者:正文未明确标注 作者列表:Guan-Hua Wen、Kuan-Yu Chen、Hou-Chiang Tseng(机构:Department of Computer Science and Information Engineering;Graduate Institute of Digital Learning and Education, National Taiwan University of Science and Technology, Taipei, Taiwan) ...

2026-08-25 · 更新于 2026-09-04 · 3 min · 555 words

Multi-Task Learning for Non-Canonical Phoneme Recognition via Articulatory Feature Decomposition

📄 Multi-Task Learning for Non-Canonical Phoneme Recognition via Articulatory Feature Decomposition 标签:#语音识别 #多任务学习 #自监督学习 #低资源 8.2/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 1.3/1.5 🔥 8.2/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音识别 | #多任务学习 | #自监督学习 #低资源 | arxiv 👥 作者与机构 第一作者:Sophia Riaz(Kaliber AI,San Mateo,California) 通讯作者:Aneesh Jonelagadda 作者列表:Sophia Riaz、Haoze Zheng、Amos Roche、Miyu Zhang、Anamika Ragu、Salvatore Penachio、Kaustav Mukherjee、Aneesh Jonelagadda(机构:Kaliber AI,San Mateo,California) ...

2026-08-25 · 更新于 2026-09-04 · 2 min · 347 words

Explainability by Design: Structured Kolmogorov-Arnold Networks over Probabilistic Attributes for Speech Deepfake Source Tracing

📄 Explainability by Design: Structured Kolmogorov-Arnold Networks over Probabilistic Attributes for Speech Deepfake Source Tracing 标签:#语音伪造检测 #多任务学习 #可解释性 7.5/10 | 创新 1.2/2 | 严谨 1.3/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.7/1.5 ✅ 7.5/10 | 前25% | 文档类型:方法研究 | 评分置信度:中 | #语音伪造检测 | #多任务学习 | #可解释性 | arxiv 👥 作者与机构 Hoang H. Pham(通信作者)、Manasi Chhibber、Tomi H. Kinnunen 均来自东芬兰大学计算学院(约恩苏)。研究为芬兰科学院资助的 SPEECHFAKES 项目成果,代码库已公开以支持透明性与复现。 💡 毒舌点评 这篇论文把「可解释」从口号做成了结构:概率属性嵌入让每个维度对应一个人类可读的合成器子组件,结构化 KAN 的拓扑直接按攻击与属性的生成关系连线,特征重要性由 KAN 内生机制给出而不再依赖 SHAP 事后估计——「解释即架构」的设计哲学在语音取证场景里确实切中要害,毕竟法证场景需要的是能上法庭的理由而非热力图。性能数字也漂亮:七个属性提取器全部超过 99% 平衡准确率、17 类攻击分类 99.64%,把自家两阶段基线的 84.37% 大幅甩开。但冷静看有三处必须打折。其一,全部实验限于 ASVspoof2019-attr-17 的闭集协议,作者自己承认属性提取器依赖生成器元数据、跨数据集泛化留待未来——在一个新合成器每月涌现的领域,闭集 99% 的意义相当有限。其二,基线复现加入了静音裁剪与 RawBoost 增强,与被比较的原论文设置不完全一致,「超越先前工作」的幅度因此混入了训练技巧的贡献。其三,KAN 相对 MLP 的计算复杂度更高这一实践代价只在结论里一笔带过,没有任何延迟或参数量的量化。另外论文背景部分冗长,前两节的文献综述几乎可以压缩一半而不损失信息。 ...

2026-08-21 · 更新于 2026-09-04 · 2 min · 355 words

语音/音乐/音频论文速递 2026-08-21

语音/音乐/音频论文速递 2026-08-21 共分析 18 篇论文 ⚡ 今日概览 ✅ 筛选入选 18 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #音频理解 3篇 ███ #语音交互 2篇 ██ #语音伪造检测 2篇 ██ #语音识别 2篇 ██ #音乐生成 2篇 ██ #助听器 1篇 █ #语音情感识别 1篇 █ #音乐检索 1篇 █ 📊 论文评分排行榜(18 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Listening Forward: Next Patch Embedding Prediction… 8.8分 前25% 方法研究 #音频理解 🥈 Towards Quantifying Benchmark Optimization in ASR… 8.5分 前25% 方法研究 #语音识别 🥉 \(TCP_α\): Margin-Controlled Confidence estimation for… 8.4分 前25% 方法研究 #音乐理解 4. VA-Judger: Reward Modeling from Human Preference… 8.3分 前25% 方法研究 #音视频生成 5. Unified Music Identification for Tracks and Versions 8.2分 前25% 数据集与基准 #音乐检索 6. Fourier is Frontier: Frequency-Aware Autoencoding for… 7.5分 前25% 方法研究 #音乐生成 7. Explainability by Design: Structured Kolmogorov-Arnold… 7.5分 前25% 方法研究 #语音伪造检测 8. Represented but Ignored: A Causal Account of Prosodic… 7.2分 前50% 方法研究 #音频理解 9. A Speech Corpus for Mizo Automatic Speech Recognition… 6.7分 前50% 数据集与基准 #语音识别 10. Hear2Act: Benchmarking When Prosody Should Change What… 6.4分 前50% 数据集与基准 #语音交互 11. DAVSS: Distilled Audio-Visual State Space Models 6.4分 前50% 方法研究 #音视频理解 12. A Resource-Efficient CNN-Based EEG Auditory Attention… 6.2分 前50% 系统技术报告 #助听器 13. Tracking the Trend in How Speech Synthesizers Deceive… 6.0分 前50% 应用研究 #语音伪造检测 14. Does Mapping Non-Maximal Probabilities to GMM… 5.6分 前50% 方法研究 #音频理解 15. MultiVerse: A Creator-Centered Approach to Steering… 5.4分 后50% 应用研究 #音乐生成 16. Robust Incomplete Multimodal Sentiment Analysis via… 5.4分 后50% 方法研究 #语音情感识别 17. Does Listening Matter? Backchanneling and Nodding in… 5.2分 后50% 应用研究 #语音交互 18. Dancing Through Soundscapes: Designing a Low-Cost… 5.2分 后50% 应用研究 #音频交互 📋 论文列表 🥇 Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners 8.8/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ...

2026-08-21 · 更新于 2026-09-04 · 13 min · 2651 words

Evaluating Music Context Preservation: A Multi-facet Framework for Music Editing Systems

📄 Evaluating Music Context Preservation: A Multi-facet Framework for Music Editing Systems 标签:#音乐理解 #模型评估 #数据集 #多任务学习 7.5/10 | 创新 1.4/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7.5/10 | 前25% | 文档类型:数据集与基准 | 评分置信度:中 | #音乐理解 | #模型评估 | #数据集 #多任务学习 | arxiv 👥 作者与机构 第一作者:Yash Vishe(机构未说明) 通讯作者:未说明 作者列表:Yash Vishe、Eric Xue、Xunyi Jiang、Zachary Novack、Junda Wu、Julian McAuley、Xin Xu(机构信息未在当前正文中完整说明) ...

2026-08-20 · 更新于 2026-09-04 · 3 min · 556 words

语音/音乐/音频论文速递 2026-08-20

语音/音乐/音频论文速递 2026-08-20 共分析 20 篇论文 ⚡ 今日概览 📥 抓取 20 篇 → 🔬 深度分析完成 🏷️ 热门方向 方向 数量 分布 #多模态模型 3篇 ███ #音频理解 3篇 ███ #语音交互 2篇 ██ #语音识别 2篇 ██ #音乐理解 2篇 ██ #音频分类 2篇 ██ #音频生成 2篇 ██ #语音合成 1篇 █ 📊 论文评分排行榜(20 篇,按分数降序) 排名 论文 总分 分档 文档类型 主任务 🥇 Alignment Is All You Need: Instruction-Free Training fo 8.0分 前25% 模型报告 #音频理解 🥈 Aslema at NADI 2026: Augmentation through Fewshot for S 8.0分 前25% 系统技术报告 #语音交互 🥉 X2Streaming-TTS: Causal Token-Level Text-to-Speech from 7.9分 前25% 模型报告 #语音合成 4. Generalized Audio-Driven Synthesis of Precise Drummer M 7.8分 前25% 模型报告 #音视频生成 5. Computational Features for Symbolic Melody Analysis 7.6分 前25% 系统技术报告 #音乐理解 6. Geometric Iterative Retrieval for Neural Audio Codec Re 7.6分 前25% 方法研究 #音频编码 7. Evaluating Music Context Preservation: A Multi-facet Fr 7.5分 前25% 数据集与基准 #音乐理解 8. Nine Emotion Centroids: A Label-Free Valence Axis That 7.5分 前25% 方法研究 #音频理解 9. Accurate Decoding of Natural Sentences from Non-Invasiv 7.5分 前25% 应用研究 #语音识别 10. Mitigating Spectral Bias in Neural Operators for Underw 7.3分 前50% 方法研究 #音频理解 11. FM Synthesizer Audio-Parameter Shared Embeddings 7.3分 前50% 方法研究 #音频生成 12. Low-Power, Neuromorphic, Acoustic Anomaly Detection for 7.3分 前50% 应用研究 #音频分类 13. Finetuning Strategies for Querying Sounds by Vocal Imit 7.3分 前50% 系统技术报告 #音频检索 14. Understanding Multilingual Medical ASR Adaptation Throu 7.2分 前50% 应用研究 #语音识别 15. Multimodal Rapport Estimation in Real-World HRI 7.0分 前50% 应用研究 #多模态模型 16. StocksTalk: A Voice-Enabled Conversational Agent for St 6.7分 前50% 系统技术报告 #语音交互 17. ChiroEcho: extending automated bat vocalisation classif 6.7分 前50% 方法研究 #音频分类 18. Pedagogical AI in Mental Health: A Tri-Stream Fine-Tune 6.7分 前50% 应用研究 #多模态模型 19. Sounds Uncertain: Exploring the Affective Aspects of So 6.7分 前50% 应用研究 #音频生成 20. Large Language Models in Mental Health: A Systematic Re 6.0分 前50% 综述 #多模态模型 📋 论文列表 🥇 Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models 8.0/10 | 创新 1.7/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ...

2026-08-20 · 更新于 2026-09-04 · 17 min · 3435 words

A Novel Binaural Cue Preservation Loss for DNN-Based Binaural Speech Enhancement

📄 A Novel Binaural Cue Preservation Loss for DNN-Based Binaural Speech Enhancement 标签:#语音增强 #多任务学习 #助听器 #多通道 5.6/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.7/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.6/10 | 前50% | 文档类型:方法研究 | 评分置信度:中 | #语音增强 | #多任务学习 | #助听器 #多通道 | arxiv 👥 作者与机构 第一作者:Jayteerth Amble(未说明) 通讯作者:未说明 作者列表:Jayteerth Amble(未说明)、Thomas Haubner(未说明)、Hendrik Schröter(未说明)、Christoph Hoog Antink(未说明)、Henning Puder(未说明) 机构信息:论文中未提供作者所属机构、实验室或部门信息。 💡 毒舌点评 这篇论文的两个损失函数动机清晰,尤其是 BRE 直接把掩膜对干净频谱的破坏从增强输出中拆出来,比继续堆 ILD/IPD 误差更有意思。短板也很明显:全文只有合成消声环境,Figure 2 全是曲线而正文没有关键数值表;BRE 既当训练目标又当评估指标,循环验证风险不小;BC 声称联合 ILD/IPD,却连 IPD 误差都没有单列。整体是小而精的损失设计,但距离真实助听器场景还有不少距离。 ...

2026-08-18 · 更新于 2026-09-04 · 4 min · 751 words