论文解读

Pro-KLShampoo: Projected KL-Shampoo with Whitening Recovered by Orthogonalization

大语言模型 | 7.5/10

 · 更新于 2026-09-10 · 约 10 分钟 · 4572 字 阅读 →
论文解读

Quantum Kernels for Audio Deepfake Detection Using Spectrogram Patch Features

音频深度伪造检测 | 6.5/10

 · 更新于 2026-09-10 · 约 16 分钟 · 7805 字 阅读 →
论文解读

Task-Aware Answer Preservation under Audio Compression for Large Audio Language Models

音频问答 | 6.5/10

 · 更新于 2026-09-10 · 约 19 分钟 · 9319 字 阅读 →
论文解读

Topological Signatures of Grokking

模型可解释性 | 7.0/10

 · 更新于 2026-09-10 · 约 14 分钟 · 6853 字 阅读 →
论文解读

WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

语音生成 | 7.5/10

 · 更新于 2026-09-10 · 约 18 分钟 · 8743 字 阅读 →
论文解读

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

语音克隆 | 8.0/10

 · 更新于 2026-09-10 · 约 17 分钟 · 8272 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-08

共分析 23 篇语音/AI 论文

 · 更新于 2026-09-10 · 约 90 分钟 · 44915 字 阅读 →
论文解读

Adaptive Diagonal Loading for Norm Constrained Beamforming

波束成形 | 7.0/10

 · 更新于 2026-09-10 · 约 8 分钟 · 3730 字 阅读 →
论文解读

APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music

音乐评估 | 7.5/10

 · 更新于 2026-09-10 · 约 12 分钟 · 6001 字 阅读 →
论文解读

AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner

视频编辑 | 8.0/10

 · 更新于 2026-09-10 · 约 13 分钟 · 6198 字 阅读 →
论文解读

Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)

音频分类 | 7.0/10

 · 更新于 2026-09-10 · 约 5 分钟 · 2190 字 阅读 →
论文解读

Beyond Seeing Is Believing: On Crowdsourced Detection of Audiovisual Deepfakes

音频深度伪造检测 | 7.0/10

 · 更新于 2026-09-10 · 约 10 分钟 · 4636 字 阅读 →
论文解读

Empirical Study of Pop and Jazz Mix Ratios for Genre-Adaptive Chord Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-10 · 约 11 分钟 · 5401 字 阅读 →
论文解读

Hearing the Ocean: Bio-inspired Gammatone-CNN framework for Robust Underwater Acoustic Target Classification

音频分类 | 7.5/10

 · 更新于 2026-09-10 · 约 10 分钟 · 4734 字 阅读 →
论文解读

JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions

音频质量评估 | 8.5/10

 · 更新于 2026-09-10 · 约 14 分钟 · 6589 字 阅读 →
论文解读

Library learning with e-graphs on jazz harmony

音乐信息检索 | 6.5/10

 · 更新于 2026-09-10 · 约 13 分钟 · 6079 字 阅读 →
论文解读

MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model

语音对话系统 | 7.5/10

 · 更新于 2026-09-10 · 约 16 分钟 · 7885 字 阅读 →
论文解读

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

音频分类 | 7.5/10

 · 更新于 2026-09-10 · 约 9 分钟 · 4468 字 阅读 →
论文解读

PHALAR: Phasors for Learned Musical Audio Representations

音乐信息检索 | 8.5/10

 · 更新于 2026-09-10 · 约 14 分钟 · 6876 字 阅读 →
论文解读

RenCon 2025: Revival of the Expressive Performance Rendering Competition

音乐生成 | 7.0/10

 · 更新于 2026-09-10 · 约 10 分钟 · 4621 字 阅读 →