论文解读

FlowSE-GRPO: Training Flow Matching Speech Enhancement via Online Reinforcement Learning

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4353 字 阅读 →
论文解读

FOCA: Multimodal Malware Classification via Hyperbolic Cross-Attention

音频分类 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4107 字 阅读 →
论文解读

FocalCodec-Stream: Streaming Low-Bitrate Speech Coding via Causal Distillation

语音编码 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5230 字 阅读 →
论文解读

FODGE : High-Fidelity Dance Generation via Full-Body Optimization

音频生成 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4639 字 阅读 →
论文解读

FoleyBench: A Benchmark for Video-to-Audio Models

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4402 字 阅读 →
论文解读

Forward Convolutive Prediction for Frame Online Monaural Speech Dereverberation based on Kronecker Product Decomposition

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3882 字 阅读 →
论文解读

Frame-Stacked Local Transformers for Efficient Multi-Codebook Speech Generation

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 4005 字 阅读 →
论文解读

Frequency-Independent Ambisonics Upscaling Using Deep Learning

空间音频 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4704 字 阅读 →
论文解读

From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-Modal Understanding in Multimodal LLMS

音频场景理解 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4037 字 阅读 →
论文解读

From Diet to Free Lunch: Estimating Auxiliary Signal Properties Using Dynamic Pruning Masks in Speech Enhancement Networks

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5029 字 阅读 →
论文解读

From Hallucination to Articulation: Language Model-Driven Losses for Ultra Low-Bitrate Neural Speech Coding

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4405 字 阅读 →
论文解读

From Human Speech to Ocean Signals: Transferring Speech Large Models for Underwater Acoustic Target Recognition

水下声学目标识别 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4052 字 阅读 →
论文解读

Frontend Token Enhancement for Token-Based Speech Recognition

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5397 字 阅读 →
论文解读

Full Band Denoising of Room Impulse Response in the Wavelet Domain with Dictionary Learning

房间脉冲响应去噪 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4376 字 阅读 →
论文解读

FUN-SSL: Full-Band Layer Followed by U-Net With Narrow-Band Layers for Multiple Moving Sound Source Localization

声源定位 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3953 字 阅读 →
论文解读

FUSEMOS: Perceptual Evaluation of Text-to-Music Generation with Dual-Encoder Fusion and Ranking-Aware Composite Loss

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4701 字 阅读 →
论文解读

Fusion of Multimodal Estimations by Extended State Hidden Markov Model: Application to Fetal Heart Rate Monitoring

生物声学 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4013 字 阅读 →
论文解读

FxSearcher: Gradient-Free Text-Driven Audio Transformation

音频生成 | 7.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3834 字 阅读 →
论文解读

Game-Time: Evaluating Temporal Dynamics in Spoken Language Models

语音对话系统 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4572 字 阅读 →
论文解读

Gdiffuse: Diffusion-Based Speech Enhancement with Noise Model Guidance

语音增强 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4722 字 阅读 →