论文解读

Toward Natural Emotional Text-To-Speech System with Fine-Grained Non-Verbal Expression Control

语音合成 | 5.0/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5339 字 阅读 →
论文解读

Ultra-Low-Bitrate Mel-Spectrogram-based Neural Speech Coding with Flow-Matching-based Refinement and Vocoding-driven Reconstruction

语音编码 | 9.9/10

 · 更新于 2026-09-09 · 约 17 分钟 · 8226 字 阅读 →
论文解读

WaveNeXt 2: ConvNeXt-Based Fast Neural Vocoders With Residual Denoising and Sub-Modeling for GAN and Diffusion Models

语音合成 | 9.4/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5426 字 阅读 →
论文解读

Zero-Shot Parkinson's Disease Detection from Speech: Comparing Large Audio and Language Models

大语言模型 | 5/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6830 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-26

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-09 · 约 70 分钟 · 34648 字 阅读 →
论文解读

6G Communication Networks Enabling Embodied Agents: Architecture and Prototype

信号处理 | 2.7/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6088 字 阅读 →
论文解读

A study on weakly-supervised training approaches for phoneme-level pronunciation scoring

语音识别 | 9.7/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6438 字 阅读 →
论文解读

AffectCodec: Emotion-Preserving Neural Speech Codec with Block-Diagonal Residual FSQ

语音编码 | 10/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6917 字 阅读 →
论文解读

Articulatory strategy as a source of variation in acoustic vowel dynamics

语音识别 | 8.5/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5549 字 阅读 →
论文解读

Broad learning system with robust adaptive kernel

信号处理 | 8.7/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7434 字 阅读 →
论文解读

Comprehensive Dataset and Signal Processing Framework for Phonocardiogram-Based Heart Rate and Blood Pressure Estimation

医疗音频 | 8/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6431 字 阅读 →
论文解读

Convex Low-resource Accent-Robust Language Detection in Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6301 字 阅读 →
论文解读

Copula-Induced Correntropy for Robust Conjugate Gradient Learning

信号处理 | 7/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7942 字 阅读 →
论文解读

Cost-Effective Model Evaluation with Meta-Learning

迁移学习 | 5.4/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7948 字 阅读 →
论文解读

Diffusion Domain Expansion: Learning to Coordinate Pre-trained Diffusion Models

扩散模型 | 7.4/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5697 字 阅读 →
论文解读

Evaluating the Temporal Detection Capability of Integrated Gradients Applied on Sound Classifier

音频分类 | 10/10

 · 更新于 2026-09-09 · 约 12 分钟 · 5831 字 阅读 →
论文解读

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

音视频 | 7.1/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6541 字 阅读 →
论文解读

Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech

语音质量评估 | 10/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6946 字 阅读 →
论文解读

MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio

音频深度伪造检测 | 10/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7102 字 阅读 →
论文解读

Natural Yet Challenging to Detect: Robust In-the-Wild TTS through EMA and Dual-Scoring Prompt Selection -- Submission for WildSpoof 2026 TTS Track

语音合成 | 5.2/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5445 字 阅读 →