论文解读

Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4265 字 阅读 →
论文解读

QFOCUS: Controllable Synthesis for Automated Speech Stress Editing to Deliver Human-Like Emphatic Intent

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 4 分钟 · 1766 字 阅读 →
论文解读

Revisiting Direct Speech-to-Text Translation with Speech LLMS: Better Scaling than Cot Prompting?

语音翻译 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4766 字 阅读 →
论文解读

RLBR: Reinforcement Learning with Biasing Rewards for Contextual Speech Large Language Models

语音识别 | 8.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3657 字 阅读 →
论文解读

SAASDNet: An EEG-Based Streaming Auditory Attention Switch Decoding Network for Self-Initiated Attention Switching in Mixed Speech

脑机接口 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4824 字 阅读 →
论文解读

Scaling Multi-Talker ASR with Speaker-Agnostic Activity Streams

语音识别 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4626 字 阅读 →
论文解读

Semantic Anchor Transfer from Short to Long Speech in a Distillation-Based Summarization Framework

语音摘要 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5537 字 阅读 →
论文解读

Session-Level Spoken Language Assessment with A Multimodal Foundation Model Via Multi-Target Learning

语音评估 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4959 字 阅读 →
论文解读

SpatialNet-Echo: Real-Time Acoustic Echo Cancellation via Integrated Narrow-Band and Cross-Band Processing

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4681 字 阅读 →
论文解读

Streaming Speech Recognition with Decoder-Only Large Language Models and Latency Optimization

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4706 字 阅读 →
论文解读

StreamMark: A Deep Learning-Based Semi-Fragile Audio Watermarking for Proactive Deepfake Detection

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4723 字 阅读 →
论文解读

Sunac: Source-Aware Unified Neural Audio Codec

音频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4495 字 阅读 →
论文解读

T-Mimi: A Transformer-Based Mimi Decoder for Real-Time On-Phone TTS

语音合成 | 7.0/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3841 字 阅读 →
论文解读

Task-Oriented Sound Privacy Preservation for Sound Event Detection Via End-to-End Adversarial Multi-Task Learning

音频事件检测 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5739 字 阅读 →
论文解读

TextlessRAG: End-to-End Visual Document RAG by Speech without Text

语音问答 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4218 字 阅读 →
论文解读

Tokenchain: A Discrete Speech Chain via Semantic Token Modeling

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6054 字 阅读 →
论文解读

Toward Robust And Efficient Beat Tracking Via Beat-Aware Attention

音乐理解 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4385 字 阅读 →
论文解读

Tpeformer: Temporal Patch Embedding Transformer

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4746 字 阅读 →
论文解读

Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio

说话人分离 | 9.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4925 字 阅读 →
论文解读

Tri-Attention Fusion: Joint Temporal-Spectral and Bidirectional Modeling for Speech Spoofing Detection

语音伪造检测 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5146 字 阅读 →