论文解读

Speech-to-SOAP: End-to-End Summarization of Medical Dialogues: KIT@BeTraC 2026

音频理解 | 7.7/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6505 字 阅读 →
论文解读

Task-disentangled Low-Rank Adaptation for Versatile Audio-visual Multi-modal Learning Tasks within a Unified Framework

音视频理解 | 7.4/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6968 字 阅读 →
论文解读

The ISCSLP 2026 Real-World Audio-Visual Speech Enhancement Challenge

音视频语音分离 | 8.8/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6292 字 阅读 →
论文解读

Visually-Guided Spatial Audio Generation for 360° In-the-Wild Speech Scenes

空间音频 | 6.9/10

 · 更新于 2026-09-06 · 约 14 分钟 · 6952 字 阅读 →
论文解读

Weakly Supervised Seafloor Segmentation for Seagrass Habitat Mapping in Side-Scan Sonar Imagery

音频理解 | 8.1/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6292 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-26

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-06 · 约 68 分钟 · 33830 字 阅读 →
论文解读

A Computationally Efficient Likelihood Approximation for Target Tracking in Time-Varying Multipath Channels

声源定位 | 9.8/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4554 字 阅读 →
论文解读

A Factorial Ablation of a Speech-to-SFT Pipeline: Differential Effects on Data Quality and Downstream Transfer

语音交互 | 9.7/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5555 字 阅读 →
论文解读

A Regularized Block Diagonal RLS Algorithm for Acoustic Echo Cancellation

回声消除 | 7.2/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5120 字 阅读 →
论文解读

Adaptive Hierarchical Representation Alliance for Multimodal Learning

语音情感识别 | 8.6/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4966 字 阅读 →
论文解读

AT-ADD: A Benchmark and Challenge for Robust and All-Type Audio Deepfake Detection

音频伪造检测 | 9.6/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5822 字 阅读 →
论文解读

AudioNoisePrints: Model-free audio watermarking using spatial correlation in flow matching TTS

音频水印 | 7.9/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4737 字 阅读 →
论文解读

AudioWorldSim: Realistic Binaural Audio Datasets For World Models

空间音频 | 9.7/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4341 字 阅读 →
论文解读

Better Retrieval, Worse Robustness: How Multi-hop RAG Amplifies Upstream ASR Errors

音频理解 | 9.1/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5382 字 阅读 →
论文解读

Building and Evaluating a Synthetic Bengali Speech Resource for Telecom Customer Care

语音合成 | 7.6/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4765 字 阅读 →
论文解读

Cross-Subject Generalization in Decoding Perceived Speech from Non-Invasive Brain Recordings

语音识别 | 8.3/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5179 字 阅读 →
论文解读

DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization

语音质量评估 | 8.2/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4504 字 阅读 →
论文解读

Development and Feasibility Evaluation of an Edge AI as Medical Device System for Breast Cancer Multidisciplinary Team Meetings

语音识别 | 8.4/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4624 字 阅读 →
论文解读

DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios

语音识别 | 7.3/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4845 字 阅读 →
论文解读

Do SpeechLMs Hear Their Own Opinions? Diagnosing and Mitigating Previous-Belief Contamination in Streaming Emotion Understanding

语音情感识别 | 8.9/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4535 字 阅读 →