论文解读

Audience-Aware Co-speech Gesture Generation in Public Speaking via Anticipation Tokens

音频生成 | 8.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5224 字 阅读 →
论文解读

Audio Classification Models are Vulnerable to Filter Perturbations

音频分类 | 7.5/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3318 字 阅读 →
论文解读

Audio Deepfake Detection at the First Greeting: "Hi!"

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4507 字 阅读 →
论文解读

Audio Effect Estimation with DNN-Based Prediction and Search Algorithm

音频效果估计 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4017 字 阅读 →
论文解读

Audio-Conditioned Diffusion LLMs for ASR and Deliberation Processing

语音识别 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4086 字 阅读 →
论文解读

Audio-Guided Multimodal Approach for Fine-Grained Alignment and Boundary Modeling in Active Speaker Detection

说话人检测 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4161 字 阅读 →
论文解读

Audio-Text Jailbreak Attack on Large Audio-Language Models: Towards Generality and Stealthiness

音频安全 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3636 字 阅读 →
论文解读

Audio-to-Score Jazz Solo Transcription with the Rhythm Perceiver

音乐信息检索 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4493 字 阅读 →
论文解读

Audio-Visual Deepfake Generation and Detection: An Exploratory Survey

音频深度伪造检测 | 6.5/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3233 字 阅读 →
论文解读

Audio-Visual Feature Fusion for Calibrating Relevance Scores of Video Moment Retrieval

视频片段检索 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5439 字 阅读 →
论文解读

AUDIOCARDS: Structured Metadata Improves Audio Language Models for Sound Design

音频检索 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5242 字 阅读 →
论文解读

AudioFuse: Unified Spectral-Temporal Learning Via A Hybrid VIT-1D CNN Architecture for Phonocardiogram Classification

音频分类 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4254 字 阅读 →
论文解读

AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation

音频生成 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5499 字 阅读 →
论文解读

AUDIOGENIE-Reasoner: A Training-Free Multi-Agent Framework for Coarse-to-Fine Audio Deep Reasoning

音频问答 | 7.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5308 字 阅读 →
论文解读

Auditory Illusion Benchmark for Large Audio Language Models

模型评估 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3529 字 阅读 →
论文解读

Auditory-Inspired Transformer for Binaural Speech Enhancement and Spatial Cue Preservation

语音增强 | 7.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5802 字 阅读 →
论文解读

AURA: A Stegaformer-Based Scalable Deep Audio Watermark with Extreme Robustness

音频水印 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5484 字 阅读 →
论文解读

Auto-MatchCut: An Audio-Visual Retrieval Framework for Seamless Match Cutting

跨模态检索 | 7.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3899 字 阅读 →
论文解读

Automated Dysphagia Screening Using Noninvasive Neck Acoustic Sensing

音频分类 | 8.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5574 字 阅读 →
论文解读

Automatic Estimation of Speaker Diarization Error Rate Based on Features of Audio Quality and Speaker Discriminability

说话人分离 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4339 字 阅读 →