论文解读

A Multi-Domain Feature Fusion Framework for Generalizable Deepfake Detection Across Different Generators

多模态模型 | 7.4/10

 · 更新于 2026-09-07 · 约 19 分钟 · 9515 字 阅读 →
论文解读

AudioDER: A Deduplication-Enhanced Reasoning Dataset for Post-Training Large Audio-Language Models

音频问答 | 7.3/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4791 字 阅读 →
论文解读

BayLing-Duplex: Native Full-Duplex Speech Dialogue with a Single Autoregressive LLM

语音合成 | 9/10

 · 更新于 2026-09-07 · 约 12 分钟 · 5563 字 阅读 →
论文解读

Beyond task performance: Decoding bioacoustic embeddings with speech features

Beyond task performance: Decoding bioacoustic embeddings with speech features

 · 更新于 2026-09-07 · 约 23 分钟 · 11042 字 阅读 →
论文解读

Efficiency-Performance Trade-offs in Neural Speaker Diarization via Structured Pruning and Low-Bit Quantization

说话人日志 | 5.1/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6022 字 阅读 →
论文解读

Explainable and Trustworthy Speech Emotion Recognition Using Confidence Score and Reinforcement Learning Rectified Speech Emotion Descriptors

语音情感识别 | 7/10

 · 更新于 2026-09-07 · 约 12 分钟 · 5825 字 阅读 →
论文解读

FAConformer: Frequency-Aware Convolutional Transformer for Auditory Attention Decoding

Transformer | 7.5/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6445 字 阅读 →
论文解读

FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

语音合成 | 7/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6238 字 阅读 →
论文解读

From Self-Supervised Speech Models to Mixture-of-Experts for Robust Anti-Spoofing

自监督学习 | 7.5/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5096 字 阅读 →
论文解读

HIDVAS: A Hearing Instrument Dataset in Various Acoustical Scenarios for Algorithm Evaluation and Training

语音增强 | 9/10

 · 更新于 2026-09-07 · 约 10 分钟 · 4950 字 阅读 →
论文解读

Instantaneous Pitch Estimation via Wave-U-Net-Based Fundamental Waveform Enhancement

数据增强 | 7.7/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5023 字 阅读 →
论文解读

Learning to Hear Hesitation: Continual Learning for Disfluency-Aware ASR

语音识别 | 8.3/10

 · 更新于 2026-09-07 · 约 12 分钟 · 5961 字 阅读 →
论文解读

Listening with Attention: Entropy-Guided Explainability for Transformer-Based Audio Models

语音识别 | 9.6/10

 · 更新于 2026-09-07 · 约 4 分钟 · 1866 字 阅读 →
论文解读

Mask, Sample, Revise: A Revisable CTMC Inference Stack for Guided Discrete Flow Matching Text-to-Speech

语音合成 | 6.8/10

 · 更新于 2026-09-07 · 约 18 分钟 · 8765 字 阅读 →
论文解读

MaskedFOP: Polyglot Speaker Identification under Missing Visual Modality via Cascaded Graph Label Propagation

说话人识别 | 9.2/10

 · 更新于 2026-09-07 · 约 12 分钟 · 5703 字 阅读 →
论文解读

MoDiCoL: A Modular Diagnostic Continual Learning Dataset for Robust Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-07 · 约 15 分钟 · 7026 字 阅读 →
论文解读

Moonlight in Latent Space: Chirality and Structural Correspondence Between Beethoven's Op. 27 No. 2 and Machine Learning Mechanisms

音乐信息检索 | 8.7/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6283 字 阅读 →
论文解读

Multimodal Speaker Identification in Classroom Environments

说话人识别 | 6/10

 · 更新于 2026-09-07 · 约 11 分钟 · 5508 字 阅读 →
论文解读

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

数据增强 | 8.2/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6462 字 阅读 →
论文解读

Orchestra-o1: Omnimodal Agent Orchestration

强化学习 | 8.1/10

 · 更新于 2026-09-07 · 约 13 分钟 · 6192 字 阅读 →