论文解读

SNAP-UQ: Self-supervised Next-Activation Prediction for Single-Pass Uncertainty in TinyML

音频分类 | 7.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5831 字 阅读 →
论文解读

SongEcho: Towards Cover Song Generation via Instance-Adaptive Element-wise Linear Modulation

音乐生成 | 7.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5614 字 阅读 →
论文解读

SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation

数据集 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5379 字 阅读 →
论文解读

Speech World Model: Causal State–Action Planning with Explicit Reasoning for Speech

语音情感识别 语音对话系统 | 9.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5094 字 阅读 →
论文解读

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音识别 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4797 字 阅读 →
论文解读

SpeechJudge: Towards Human-Level Judgment for Speech Naturalness

模型评估 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5451 字 阅读 →
论文解读

SpeechOp: Inference-Time Task Composition for Generative Speech Processing

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5070 字 阅读 →
论文解读

Stable Video Infinity: Infinite-Length Video Generation with Error Recycling

视频生成 | 8.8/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4252 字 阅读 →
论文解读

StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs

语音分词 | 9.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4686 字 阅读 →
论文解读

STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence

音频问答 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4348 字 阅读 →
论文解读

Steering Autoregressive Music Generation with Recursive Feature Machines

音乐生成 | 8.0/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4217 字 阅读 →
论文解读

STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models

语音对话系统 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3665 字 阅读 →
论文解读

SumRA: Parameter Efficient Fine-tuning with Singular Value Decomposition and Summed Orthogonal Basis

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4653 字 阅读 →
论文解读

SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization

音频检索 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4253 字 阅读 →
论文解读

Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers

音频生成 | 7.5/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5245 字 阅读 →
论文解读

SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation

音乐生成 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5626 字 阅读 →
论文解读

TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization

音频生成 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4891 字 阅读 →
论文解读

TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling

语音对话系统 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3884 字 阅读 →
论文解读

Tell me Habibi, is it Real or Fake?

音频深度伪造检测 | 8.0/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3720 字 阅读 →
论文解读

The Deleuzian Representation Hypothesis

模型评估 | 7.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4035 字 阅读 →