论文解读

A Self-Supervised Approach for Minimal-Annotation Hydroacoustic Data Exploration

音频事件检测 | 8.1/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7365 字 阅读 →
论文解读

Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech

语音识别 | 7.0/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7440 字 阅读 →
论文解读

When Synthetic Speech Is All You Have: Better Call GRPO

语音识别 | 7.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8468 字 阅读 →
论文解读

When Synthetic Speech Is All You Have: Better Call GRPO

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8582 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-10

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 64 分钟 · 31889 字 阅读 →
论文解读

Decoupling Conversational Dynamics in Full-Duplex Spoken Models through Reinforcement Learning

语音交互 | 8.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7653 字 阅读 →
论文解读

Transformer-based segmentation of prosodic boundaries in Brazilian Portuguese

语音识别 | 4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7485 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-09

共分析 13 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 47 分钟 · 23491 字 阅读 →
论文解读

From Sinhala to Dhivehi: Cross-Lingual Transfer Learning for Low-Resource Speech Recognition

语音识别 | 6.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7890 字 阅读 →
论文解读

Learning-based Physics-Constrained Neural Kernel for Sound Field Estimation With Source-Position-Dependent Directional Weighting

声源定位 | 5.2/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6054 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-08

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 84 分钟 · 41962 字 阅读 →
论文解读

Adaptive Diversity-Uncertainty Active Learning with Redundancy Control for Bioacoustic Event Classification

音频事件检测 | 6.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5162 字 阅读 →
论文解读

CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6524 字 阅读 →
论文解读

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7847 字 阅读 →
论文解读

Evaluating the Effect of Linguistic Relatedness on Cross-Lingual Transfer in Large Multilingual Automatic Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 7010 字 阅读 →
论文解读

Jointly Improving Dialect Identification and ASR in Indian Languages using Multimodal Feature Fusion

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7082 字 阅读 →
论文解读

Listen, Think, Transcribe: Continuous Latent Test-Time Scaling for ASR

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6575 字 阅读 →
论文解读

QuaSR: Quality-Aware Sample Reweighting for Pacific Indigenous Speech Recognition

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6411 字 阅读 →
论文解读

Reinforcement Learning for Data-Efficient Code-Switched ASR

语音识别 | 5.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5883 字 阅读 →
论文解读

S-DiverSe: Spanish Diverse Speech

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7968 字 阅读 →