论文解读

为说话人日志做自监督:目标、数据与容量的分工与代价

该文以 WavLM 为骨干研究说话人日志,报告加权多层目标、10k 小时数据规模、Large 容量与 Conformer 切块调优带来可复现的 DER 下降,但 100k 小时与剪枝收益趋平且标注噪声限制可测改进。

 · 更新于 2026-09-24 · 约 19 分钟 · 9384 字 阅读 →
论文解读

说话人受控下做语种识别:用任务相关预训练压住说话人捷径,再用间隔损失拉开语种边界

针对同一说话人说多种语言时模型易依赖说话人特征走捷径的问题,该文采用在 VoxLingua107 上预训练的 ECAPA-TDNN 做编码器并比较 AAM-Softmax 与 RAM-Softmax,在 Tidy-X 上报告识别任务 85.95% 宏准确率与验证任务 16.39% 等错误率,最强证据来自与官方基线的同协议对照,代价是未充分优化未见语种验证与未 …

 · 更新于 2026-09-24 · 约 17 分钟 · 8112 字 阅读 →
论文解读

不用真谱也能学会听谱:TUTTI 用 36 万首合成曲喂饱纯 Transformer

音乐转录 | 7.4/10

 · 更新于 2026-09-24 · 约 23 分钟 · 11036 字 阅读 →
论文解读

32 分钟语料能给 Baniwa ASR 一个起点,却不能借此跳过泛化检验

语音识别 | 4.7/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4842 字 阅读 →
论文解读

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

音视频理解 | 9.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6559 字 阅读 →
论文解读

Do Time-Series Foundation Models Pay Off for Industrial Monitoring? A Cost-Aware Empirical Study

音频事件检测 | 8.8/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4802 字 阅读 →
论文解读

Listening Forward: Next Patch Embedding Prediction Enables Scalable Audio Learners

音频理解 | 8.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5976 字 阅读 →
论文解读

Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models

音频理解 | 8.0/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5610 字 阅读 →
论文解读

Target Speaker Identification: A Low-Latency Streaming Pipeline

说话人验证 | 5.6/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5075 字 阅读 →
论文解读

An Analytical-Prior Framework for Data-Efficient Prediction of Sound-Reduction Frequencies in Rectangular Side-Branch Helmholtz Resonators

预训练 | 5.8/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7170 字 阅读 →
论文解读

Navigating Speech Enhancement for Real-Time MRI: A Systematic Assessment of Signal Quality, Source Preservation, and Downstream Tasks

语音增强 | 5.7/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8798 字 阅读 →
论文解读

Evaluating Pre-trained Speech Encoders for Spontaneous Speech Detection and Out of Domain Synthetic Speech Generalisation in Indic Languages

语音伪造检测 | 6.0/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6220 字 阅读 →
论文解读

Luna-TTS Family Technical Report

语音合成 | 6.9/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7839 字 阅读 →
论文解读

DINO-A: Adapting Self-Distillation Vision Transformers to General Audio Representation Learning

音频分类 | 6.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7322 字 阅读 →
论文解读

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

音乐转录 | 7.7/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5987 字 阅读 →
论文解读

Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions

语音质量评估 | 6.0/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9539 字 阅读 →
论文解读

MERaLiON-GR: Speech Gender Recognition Model for English and SEA Languages

语音属性识别 | 7.5/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7067 字 阅读 →
论文解读

PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement

语音增强 | 8.1/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7802 字 阅读 →
论文解读

Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification

音频分类 | 6.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6641 字 阅读 →
论文解读

Self-Supervised Audio Representation Learning for Pediatric Asthma Detection in Emergency Care Using Digital Stethoscope Recordings

音频分类 | 5.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5443 字 阅读 →