论文解读

Gelina: Unified Speech and Gesture Synthesis Via Interleaved Token Prediction

语音合成 | 7.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5600 字 阅读 →
论文解读

Gen-SER: When the Generative Model Meets Speech Emotion Recognition

语音情感识别 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3718 字 阅读 →
论文解读

Generalizability of Predictive and Generative Speech Enhancement Models to Pathological Speakers

语音增强 | 7.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4542 字 阅读 →
论文解读

Generating Localized Audible Zones Using a Single-Channel Parametric Loudspeaker

空间音频 | 6.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3300 字 阅读 →
论文解读

Generating Moving 3d Soundscapes with Latent Diffusion Models

空间音频 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4816 字 阅读 →
论文解读

Generative Audio Extension and Morphing

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5736 字 阅读 →
论文解读

GLA-GRAD++: An Improved Griffin-Lim Guided Diffusion Model for Speech Synthesis

语音合成 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4319 字 阅读 →
论文解读

GLAP: General Contrastive Audio-Text Pretraining Across Domains and Languages

音频检索 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4462 字 阅读 →
论文解读

GLoRIA: Gated Low-Rank Interpretable Adaptation for Dialectal ASR

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4800 字 阅读 →
论文解读

GLUE: Gradient-free Learning to Unify Experts

迁移学习 | 6.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5139 字 阅读 →
论文解读

GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Constrative and Generative Pretraining

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3524 字 阅读 →
论文解读

Graph-Based Emotion Consensus Perception Learning for Multimodal Emotion Recognition in Conversation

多模态情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4014 字 阅读 →
论文解读

Graph-based Modality Alignment for Robustness in Conversational Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5275 字 阅读 →
论文解读

Graph-Biased EEG Transformers for Silent Speech Decoding

语音生物标志物 | 6.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4604 字 阅读 →
论文解读

Grey-Box Prompt Tuning With Graph Alignment for Speech-Language Models

语音识别 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5713 字 阅读 →
论文解读

GRNet: Graph Reconstruction Network for Robust Multimodal Sentiment Analysis

多模态情感分析 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4441 字 阅读 →
论文解读

Group Relative Policy Optimization for Text-to-Speech with Large Language Models

语音合成 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4330 字 阅读 →
论文解读

Group-Sparse Gaussian Process Regression for Inhomogeneous Sound Field Estimation

声场估计 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4159 字 阅读 →
论文解读

H-nnPBFDAF: Hierarchical Neural Network Partitioned Block Frequency Domain Adaptive Filter with Novel Block Activation Probability

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4613 字 阅读 →
论文解读

Hair Noise Analysis and Mitigation for Smart Glasses Audio Captures

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3856 字 阅读 →