论文解读

FAC-FACodec: Controllable Zero-Shot Foreign Accent Conversion with Factorized Speech Codec

语音转换 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4319 字 阅读 →
论文解读

Face-Voice Association with Inductive Bias for Maximum Class Separation

说话人验证 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4756 字 阅读 →
论文解读

Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform

语音伪造检测 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4224 字 阅读 →
论文解读

Fast-ULCNet: A Fast and Ultra Low Complexity Network for Single-Channel Speech Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3534 字 阅读 →
论文解读

FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference

音频问答 | 7.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4320 字 阅读 →
论文解读

FastEnhancer: Speed-Optimized Streaming Neural Speech Enhancement

语音增强 | 8.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5043 字 阅读 →
论文解读

FD-ARL: Feature Disentanglement with Adversarial-Reconstruction Learning for Cross-Subject Auditory Attention Decoding

听觉注意力解码 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3724 字 阅读 →
论文解读

FDCNet: Frequency Domain Channel Attention and Convolution for Lipreading

视觉语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4228 字 阅读 →
论文解读

FED-PISA: Federated Voice Cloning Via Personalized Identity-Style Adaptation

语音克隆 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5699 字 阅读 →
论文解读

Feedback-Driven Retrieval-Augmented Audio Generation with Large Audio Language Models

音频生成 | 6.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5723 字 阅读 →
论文解读

Few-Shot Recognition of Audio Deepfake Generators using Graph-Based Prototype Adaptation

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4546 字 阅读 →
论文解读

FIDIC:Fine-Grained Conversational Emotion Recognition via Individual Differences in Inertia and Contagion

语音情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4155 字 阅读 →
论文解读

Fine-Grained Frame Modeling in Multi-Head Self-Attention for Speech Deepfake Detection

语音伪造检测 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4097 字 阅读 →
论文解读

Fine-Tuning Bigvgan-V2 for Robust Musical Tuning Preservation

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3887 字 阅读 →
论文解读

Fine-Tuning Large Audio-Language Models with Lora for Precise Temporal Localization of Prolonged Exposure Therapy Elements

音频事件检测 | 6.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5707 字 阅读 →
论文解读

Fine-Tuning Large Multimodal Models for Automatic Pronunciation Assessment

语音评估 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5097 字 阅读 →
论文解读

FinHuBERT: Hierarchical Feature Imitating Networks for Low-Resource Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4221 字 阅读 →
论文解读

FlashFoley: Fast Interactive Sketch2audio Generation

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4806 字 阅读 →
论文解读

Flexi-LoRA with Input-Adaptive Ranks: Efficient Finetuning for Speech and Reasoning Tasks

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3543 字 阅读 →
论文解读

Flexio: Flexible Single- and Multi-Channel Speech Separation and Enhancement

语音分离 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3940 字 阅读 →