论文解读

From Prompting to Describing: A Cross-Cultural Study of Language for AI-Generated Music

音乐理解 | 5.5/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7605 字 阅读 →
论文解读

How Much AI Is in This Track? Quantifying the Proportion of AI-Generated Stems in Hybrid Music Mixtures

音频伪造检测 | 8.3/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6888 字 阅读 →
论文解读

LSEAD: A Privacy-Preserving LLM-Based Speech Analysis Framework for Early Alzheimer's Disease Screening

语音识别 | 6.6/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7355 字 阅读 →
论文解读

MI-MIDI: Mechanistic Interpretability of Text-to-MIDI Generation Models via Probing, Lenses and Steering

音乐生成 | 7.1/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6408 字 阅读 →
论文解读

MMAG: A Multi-Control Mixed Audio Generation Benchmark

音频生成 | 6.8/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7097 字 阅读 →
论文解读

Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing

语音编辑 | 7.3/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6259 字 阅读 →
论文解读

Objects as Audio-Visual Modal Sound Fields

音频生成 | 7.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6923 字 阅读 →
论文解读

SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7896 字 阅读 →
论文解读

Separating Decision-Rule Misalignment from Readout-Coverage Limitations in Speech Language Models

语音情感识别 | 6.8/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7558 字 阅读 →
论文解读

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

音视频交互 | 5.7/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8051 字 阅读 →
论文解读

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

多模态模型 | 7.6/10

 · 更新于 2026-09-06 · 约 14 分钟 · 7003 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-10

共分析 16 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 45 分钟 · 22351 字 阅读 →
论文解读

A Study of ASR Adaptation and Representation Dimensionality Reduction in Persian Speech Emotion Recognition Using Whisper

语音情感识别 | 5.7/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4924 字 阅读 →
论文解读

AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks

语音伪造检测 | 8.4/10

 · 更新于 2026-09-06 · 约 24 分钟 · 11604 字 阅读 →
论文解读

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

音乐转录 | 7.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5987 字 阅读 →
论文解读

Beyond Residual Connections: Manifold-Constrained Hyper-Connections for Robust Speaker Representation Learning

说话人验证 | 6.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4473 字 阅读 →
论文解读

Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors

语音质量评估 | 6.7/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7166 字 阅读 →
论文解读

C^3PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

音视频问答 | 5.5/10

 · 更新于 2026-09-06 · 约 16 分钟 · 7600 字 阅读 →
论文解读

Decolonizing Linguistic Policies in Automated Speech Recognition: A Framework for Cross-Culturally Competent Speech AI

语音识别 | 7.8/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3465 字 阅读 →
论文解读

Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model

音乐生成 | 6.5/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6469 字 阅读 →