论文解读

Bandwidth-Efficient and Privacy-Preserving Edge-Cloud Many-to-Many Speech Translation

语音翻译 | 8.1/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6093 字 阅读 →
论文解读

Diffusion Large Language Models for Visual Speech Recognition

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5892 字 阅读 →
论文解读

OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation

音频检索 | 9.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5784 字 阅读 →
论文解读

SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter

语音情感识别 | 8.7/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5028 字 阅读 →
论文解读

When Helpful Context Leaks: Privacy Risks in Domain-Adapted ASR

语音识别 | 10/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6313 字 阅读 →
论文解读

Why We Need Speech to Evaluate Speech Translation

语音翻译 | 8.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6500 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-28

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 84 分钟 · 42014 字 阅读 →
论文解读

Learning When to Think While Listening in Large Audio-Language Models

语音识别 | 8.9/10

 · 更新于 2026-09-25 · 约 5 分钟 · 2186 字 阅读 →
论文解读

Rethinking Continual Learning for Speech and Audio: A Representation-Centric Taxonomy and Open Problems

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5492 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-27

共分析 39 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 121 分钟 · 60546 字 阅读 →
论文解读

Effective User-defined Keyword Spotting with Dual-stage Matching, Multi-modal Enrollment, and Continual Adaptation

关键词检测 | 7.4/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6327 字 阅读 →
论文解读

Flexi-LoRA with Input-Adaptive Ranks: Efficient Finetuning for Speech and Reasoning Tasks

大语言模型 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5782 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-05

共分析 33 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 104 分钟 · 51662 字 阅读 →
论文解读

PACE: Pretrained Audio Continual Learning

音频分类 | 9.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5856 字 阅读 →
论文解读

SumRA: Parameter Efficient Fine-tuning with Singular Value Decomposition and Summed Orthogonal Basis

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5875 字 阅读 →
论文解读

PACE: Pretrained Audio Continual Learning

音频分类 | 8.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5893 字 阅读 →
论文解读

SumRA: Parameter Efficient Fine-tuning with Singular Value Decomposition and Summed Orthogonal Basis

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4653 字 阅读 →
论文解读

Dual-LoRA: Parameter-Efficient Adversarial Disentanglement for Cross-Lingual Speaker Verification

说话人验证 | 7.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5273 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-05-01

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 70 分钟 · 35064 字 阅读 →
论文解读

Dual-LoRA: Parameter-Efficient Adversarial Disentanglement for Cross-Lingual Speaker Verification

说话人验证 | 7.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6131 字 阅读 →