论文解读

Robust Spoofed Speech Detection via Temporal Pyramid Modeling

音频深度伪造检测 | 6.7/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6597 字 阅读 →
论文解读

Scaling Human and G2P Supervision for Robust Phonetic Transcription

语音识别 | 7.6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4873 字 阅读 →
论文解读

Teacher-Student Structure for Domain Adaptation in Ensemble Audio-Visual Video Deepfake Detection

多模态模型 | 7.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5649 字 阅读 →
论文解读

A Multi-Domain Feature Fusion Framework for Generalizable Deepfake Detection Across Different Generators

多模态模型 | 7.4/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9515 字 阅读 →
论文解读

FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

语音合成 | 7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6238 字 阅读 →
论文解读

From Self-Supervised Speech Models to Mixture-of-Experts for Robust Anti-Spoofing

自监督学习 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5096 字 阅读 →
论文解读

Instantaneous Pitch Estimation via Wave-U-Net-Based Fundamental Waveform Enhancement

数据增强 | 7.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5023 字 阅读 →
论文解读

Mask, Sample, Revise: A Revisable CTMC Inference Stack for Guided Discrete Flow Matching Text-to-Speech

语音合成 | 6.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8765 字 阅读 →
论文解读

MoDiCoL: A Modular Diagnostic Continual Learning Dataset for Robust Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7026 字 阅读 →
论文解读

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

数据增强 | 8.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6462 字 阅读 →
论文解读

Adaptive Turn-Taking for Real-time Multi-Party Voice Agents

数据增强 | 6.7/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5916 字 阅读 →
论文解读

Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data

语音翻译 | 8.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6061 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-06-12

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 77 分钟 · 38140 字 阅读 →
论文解读

Lung-SRAD: Spectral-Aware Regularized Audio DASS with Dual-Axis Patch-Mix Contrastive Learning for Respiratory Sound Classification

对比学习 | 6.8/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5479 字 阅读 →
论文解读

Quality Adaptive Angular Margin Learning for Respiratory Sound Classification

音频质量评估 | 9.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8931 字 阅读 →
论文解读

Optimizing 2D Input Representations and Sub-phase Fusion Strategies for Differential Diagnosis of Asthma and COPD Using CNN- and GRU-Based Networks

数据增强 | 6.8/10

 · 更新于 2026-09-25 · 约 48 分钟 · 23710 字 阅读 →
论文解读

Overview of ESDD2: Environment-Aware Speech and Sound Deepfake Detection Challenge

数据增强 | 6.3/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8529 字 阅读 →
论文解读

RAT: Reference-Augmented Training for ASV Anti-Spoofing

数据增强 | 8.8/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4995 字 阅读 →
论文解读

Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4631 字 阅读 →
论文解读

Towards Robust Arabic Speech Emotion Recognition with Deep Learning

语音情感识别 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5530 字 阅读 →