论文解读

Modeling and Interpreting Correlations, Null Distributions and Significance Levels in Neural Tracking of Natural Stimuli

音频理解 | 8.0/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8620 字 阅读 →
论文解读

Monophonic Audio Synthesizer Using FPGAs

音频生成 | 4.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5225 字 阅读 →
论文解读

myMediWhisper: Construction of Burmese Medical Speech Corpus and Whisper Fine-Tuning for Clinical Dialogue ASR

语音识别 | 6.7/10

 · 更新于 2026-09-06 · 约 17 分钟 · 8115 字 阅读 →
论文解读

Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models

语音交互 | 5.4/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7305 字 阅读 →
论文解读

Pitch Contour Tokenization using VQ-VAE and Its Application on Korean Traditional Music Analysis

音乐理解 | 7.1/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6409 字 阅读 →
论文解读

Rationale-Guided Learning for Multimodal Emotion Recognition

语音情感识别 | 7.2/10

 · 更新于 2026-09-06 · 约 15 分钟 · 7248 字 阅读 →
论文解读

Seeds Before Objectives: Rethinking Evaluation for Low-Resource Garhwali ASR

语音识别 | 7.9/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9335 字 阅读 →
论文解读

The GENEA Challenge 2026: A Large-Scale Disentangled Evaluation of Speech-Driven Gesture Generation on the Seamless Interaction Dataset

语音交互 | 7.2/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9423 字 阅读 →
论文解读

TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation

扩散模型 | 6.5/10

 · 更新于 2026-09-06 · 约 19 分钟 · 9515 字 阅读 →
论文解读

Training Set Synthesis for Bioacoustic Denoising: A Case Study With Mice

语音增强 | 8.0/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8643 字 阅读 →
论文解读

VoxSumm: A Multilingual Corpus of Long-Form Spoken News for Joint Summarization and Translation

语音翻译 | 6.9/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5820 字 阅读 →
论文解读

Whisper-Aware LLM: Self-Supervised Uncertainty Learning for Robust Whispered Speech Recognition

语音识别 | 6.1/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6535 字 阅读 →
论文解读

X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction

语音交互 | 6.4/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5797 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-12

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 76 分钟 · 37591 字 阅读 →
论文解读

A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies

音频生成 | 6.5/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8964 字 阅读 →
论文解读

AI-Guided Learning: Research on Knowledge and Skill Acquisition Support Methods Using Deep Learning Audio-Video Processing Techniques

音视频理解 | 6.3/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6962 字 阅读 →
论文解读

AudioMap: Cloze-and-Choice Reinforcement Learning for Time-Aware Dense Audio Captioning

音频字幕生成 | 7.9/10

 · 更新于 2026-09-06 · 约 5 分钟 · 2475 字 阅读 →
论文解读

AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward

音频字幕生成 | 8.4/10

 · 更新于 2026-09-06 · 约 24 分钟 · 11629 字 阅读 →
论文解读

BAMU: Bitstream-Aware Marginal-Utility Allocation for Frozen Pretrained Neural Speech Codecs

语音编码 | 7.1/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6455 字 阅读 →
论文解读

Beyond Piano: Cross-Instrument MIDI Velocity Estimation via Differentiable SoundFont Proxies

音乐理解 | 7.3/10

 · 更新于 2026-09-06 · 约 18 分钟 · 8783 字 阅读 →