论文解读

AlignAtt4LLM: Fast AlignAtt for Decoder-Only LLMs at IWSLT 2026 Simultaneous Speech Translation Task

语音翻译 | 7.3/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6725 字 阅读 →
论文解读

AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

语音合成 | 10/10

 · 更新于 2026-09-09 · 约 15 分钟 · 7367 字 阅读 →
论文解读

Audio Spotforming via Post-Filtering Using Cross-Array Non-target Estimates

维纳滤波 | 6.6/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6071 字 阅读 →
论文解读

BaltiVoice: A Speech Corpus and Fine-tuned Whisper ASR System for the Balti Language

语音识别 | 7.8/10

 · 更新于 2026-09-09 · 约 10 分钟 · 4606 字 阅读 →
论文解读

Before Fusion, Ask What to Keep: Contextual Calibration of Multimodal Signals

语音情感识别 | 7.2/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6279 字 阅读 →
论文解读

Benchmarking Speech-to-Speech Translation Models

语音合成 | 8.7/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5395 字 阅读 →
论文解读

Breaking the Pair: Evaluating Dyadic Interaction via Speaker Switching

Breaking the Pair: Evaluating Dyadic Interaction via Speaker Switching

 · 更新于 2026-09-09 · 约 12 分钟 · 5970 字 阅读 →
论文解读

C2GA: A Class-Controllable Generative Augmentation Framework for Respiratory Sound Classification

音频分类 | 7.3/10

 · 更新于 2026-09-09 · 约 6 分钟 · 2877 字 阅读 →
论文解读

Cosmos 3: Omnimodal World Models for Physical AI

音频生成 | 10/10

 · 更新于 2026-09-09 · 约 18 分钟 · 8607 字 阅读 →
论文解读

CoughSense: Five-Class Respiratory Disease Classification via Whisper Encoder Fine-Tuning and Dual-Encoder Cross-Attention Fusion with Balanced Contrastive Learning

数据增强 | 9.1/10

 · 更新于 2026-09-09 · 约 16 分钟 · 7875 字 阅读 →
论文解读

Diffusion-Based Heart Sound Generation: Evaluation with Physiological Signal Metrics, Classifiers, and Expert Listening

语音合成 | 7.1/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5364 字 阅读 →
论文解读

Domain-Agnostic Incremental Learning for Sound Classification. A DCASE 2026 Challenge task

Domain-Agnostic Incremental Learning for Sound Classification. A DCASE 2026 Challenge task

 · 更新于 2026-09-09 · 约 8 分钟 · 3548 字 阅读 →
论文解读

Efficient ASR Training with Conversations that Never Happened

语音识别 | 8/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6552 字 阅读 →
论文解读

EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement

语音合成 | 8.6/10

 · 更新于 2026-09-09 · 约 13 分钟 · 6116 字 阅读 →
论文解读

Exploiting Noise Inseparability for Weakly-Supervised Discriminative Speech Denoising Using Noisy Targets

语音增强 | 8.5/10

 · 更新于 2026-09-09 · 约 10 分钟 · 4979 字 阅读 →
论文解读

Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation

音频生成 | 7/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6522 字 阅读 →
论文解读

FSA-GRPO: Teaching Auditory LLMs to Use Few-shot Demonstrations

语音识别 | 8.1/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6820 字 阅读 →
论文解读

In-the-Loop Training of Deep Feedback Cancellation for Hearing Aids

自适应滤波 | 5.3/10

 · 更新于 2026-09-09 · 约 9 分钟 · 4222 字 阅读 →
论文解读

Inference-Time Scaling for Joint Audio-Video Generation

语音合成 | 6.9/10

 · 更新于 2026-09-09 · 约 11 分钟 · 5102 字 阅读 →
论文解读

LiveBand: Live Accompaniment Generation in the Audio Domain

音乐生成 | 8/10

 · 更新于 2026-09-09 · 约 14 分钟 · 6832 字 阅读 →