论文解读

MELA-TTS: Joint Transformer-Diffusion Model with Representation Alignment for Speech Synthesis

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5124 字 阅读 →
论文解读

Mixture of Experts for Recognizing Depression from Interview and Reading Tasks

语音生物标志物 | 6.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5201 字 阅读 →
论文解读

MSANET: Multi-Scale Semantic Aggregation Network for Brain-Assisted Speech Enhancement in Multi-Speaker Conditions

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4444 字 阅读 →
论文解读

Musicdetr: A Position-Aware Spectral Note Detection Model for Singing Transcription

歌唱语音转录 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4470 字 阅读 →
论文解读

Peeking Into the Future for Contextual Biasing

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5086 字 阅读 →
论文解读

Polynomial Mixing for Efficient Self-Supervised Speech Encoders

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4653 字 阅读 →
论文解读

Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4265 字 阅读 →
论文解读

QFOCUS: Controllable Synthesis for Automated Speech Stress Editing to Deliver Human-Like Emphatic Intent

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 4 分钟 · 1766 字 阅读 →
论文解读

Revisiting Direct Speech-to-Text Translation with Speech LLMS: Better Scaling than Cot Prompting?

语音翻译 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4766 字 阅读 →
论文解读

RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3657 字 阅读 →
论文解读

SAASDNet: An EEG-Based Streaming Auditory Attention Switch Decoding Network for Self-Initiated Attention Switching in Mixed Speech

脑机接口 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4824 字 阅读 →
论文解读

Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4626 字 阅读 →
论文解读

Semantic Anchor Transfer from Short to Long Speech in a Distillation-Based Summarization Framework

语音摘要 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5537 字 阅读 →
论文解读

Session-Level Spoken Language Assessment with A Multimodal Foundation Model Via Multi-Target Learning

语音评估 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4959 字 阅读 →
论文解读

SpatialNet-Echo: Real-Time Acoustic Echo Cancellation via Integrated Narrow-Band and Cross-Band Processing

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4681 字 阅读 →
论文解读

Streaming Speech Recognition with Decoder-Only Large Language Models and Latency Optimization

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4706 字 阅读 →
论文解读

StreamMark: A Deep Learning-Based Semi-Fragile Audio Watermarking for Proactive Deepfake Detection

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4723 字 阅读 →
论文解读

Sunac: Source-Aware Unified Neural Audio Codec

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4495 字 阅读 →
论文解读

T-Mimi: A Transformer-Based Mimi Decoder for Real-Time On-Phone TTS

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3841 字 阅读 →
论文解读

Task-Oriented Sound Privacy Preservation for Sound Event Detection Via End-to-End Adversarial Multi-Task Learning

音频事件检测 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5739 字 阅读 →