论文解读

TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling

语音生成 | 7.0/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5015 字 阅读 →
论文解读

Tell me Habibi, is it Real or Fake?

音视频深度伪造检测 | 8.5/10

 · 更新于 2026-09-11 · 约 8 分钟 · 3642 字 阅读 →
论文解读

The Deleuzian Representation Hypothesis

模型可解释性 | 8.5/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4780 字 阅读 →
论文解读

Timing is Everything: Temporal Scaffolding of Semantic Surprise in Humor

音频事件检测 | 6.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5042 字 阅读 →
论文解读

TINY BUT MIGHTY: A SOFTWARE-HARDWARE CO- DESIGN APPROACH FOR EFFICIENT MULTIMODAL IN- FERENCE ON BATTERY-POWERED SMALL DEVICES

多模态模型 | 7.0/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4229 字 阅读 →
论文解读

Token-Based Audio Inpainting via Discrete Diffusion

音乐生成 | 7.5/10

 · 更新于 2026-09-11 · 约 13 分钟 · 6091 字 阅读 →
论文解读

Toward Complex-Valued Neural Networks for Waveform Generation

语音合成 | 8.0/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5338 字 阅读 →
论文解读

Towards Improving Speaker Distance Estimation through Generative Impulse Response Augmentation

声源定位 | 8.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4493 字 阅读 →
论文解读

Towards True Speech-to-Speech Models Without Text Guidance

语音对话系统 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5080 字 阅读 →
论文解读

Transformer-based End-to-End Control Filter Generation for Active Noise Control

主动噪声控制 | 7.0/10

 · 更新于 2026-09-11 · 约 13 分钟 · 6089 字 阅读 →
论文解读

TRIBE: TRImodal Brain Encoder for whole-brain fMRI response prediction

脑编码 | 9.5/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4604 字 阅读 →
论文解读

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

视频摘要 | 8.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5060 字 阅读 →
论文解读

TTSDS2: Resources and Benchmark for Evaluating Human-Quality Text to Speech Systems

语音合成评估 | 7.5/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4384 字 阅读 →
论文解读

TVTSyn: Content-Synchronous Time-Varying Timbre for Streaming Voice Conversion and Anonymization

语音转换 语音匿名化 | 8.0/10

 · 更新于 2026-09-11 · 约 14 分钟 · 6522 字 阅读 →
论文解读

UALM: Unified Audio Language Model for Understanding, Generation and Reasoning

音频生成 | 8.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5314 字 阅读 →
论文解读

Unified Multi-Modal Interactive and Reactive 3D Motion Generation via Rectified Flow

动作生成 | 7.5/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4802 字 阅读 →
论文解读

UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice

语音翻译 | 8.0/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4434 字 阅读 →
论文解读

Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification

音频分类 | 7.5/10

 · 更新于 2026-09-11 · 约 11 分钟 · 5053 字 阅读 →
论文解读

VibeVoice: Expressive Podcast Generation with Next-Token Diffusion

语音合成 | 8.5/10

 · 更新于 2026-09-11 · 约 10 分钟 · 4511 字 阅读 →
论文解读

VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Video

基准测试 | 7.0/10

 · 更新于 2026-09-11 · 约 9 分钟 · 4193 字 阅读 →