论文解读

The tttAI System for the TSA-ASR Task of the SmartGlasses Challenge 2026

说话人日志 | 6.5/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6496 字 阅读 →
论文解读

AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery

语音交互 | 4.8/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10217 字 阅读 →
论文解读

HeadRoom: Lightweight, Edge-deployable Pipeline for Adaptive Notification Routing

音频事件检测 | 7.2/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6561 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-07-11

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 4 分钟 · 1819 字 阅读 →
论文解读

Structural Bottlenecks on Frequency Representation in End-to-End Audio Models

音频编码 | 7.4/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8095 字 阅读 →
论文解读

Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs

语音交互 | 9.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8435 字 阅读 →
论文解读

Speaker head orientation estimation with a single microphone array using phase spectrogram features

声源定位 | 5.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5887 字 阅读 →
论文解读

DNSMOS-C: Improving End-to-end Speech Quality Models via Contrastive Learning

语音质量评估 | 9.3/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5723 字 阅读 →
论文解读

End-to-End Voice Intent Recognition for Spontaneous Human-Drone Interaction with Naive Users

端到端 | 7/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6231 字 阅读 →
论文解读

WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling

语音合成 | 9.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5546 字 阅读 →
论文解读

DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action

语音对话系统 | 7.8/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9025 字 阅读 →
论文解读

FormalASR: End-to-End Spoken Chinese to Formal Text

语音识别 | 8.2/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7790 字 阅读 →
论文解读

Synchronization and Turn-Taking in Full-Duplex Speech Dialogue Models

语音对话系统 | 7.6/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7848 字 阅读 →
论文解读

FormalASR: End-to-End Spoken Chinese to Formal Text

语音识别 | 6/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7432 字 阅读 →
论文解读

MedASR: An Open-Source Model for High-Accuracy Medical Dictation

语音识别 | 7.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8271 字 阅读 →
论文解读

Mind the Gap: Impact of Synthetic Conversational Data on Multi-Talker ASR and Speaker Diarization

语音识别 说话人分离 | 7.2/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8034 字 阅读 →
论文解读

A Calculus-Based Framework for Determining Vocabulary Size in End-to-End ASR

语音识别 | 3.9/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8601 字 阅读 →
论文解读

EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

语音对话系统 | 8.0/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9925 字 阅读 →
论文解读

Chunkwise Aligners for Streaming Speech Recognition

语音识别 | 6.3/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9896 字 阅读 →
论文解读

Dolphin-CN-Dialect: Where Chinese Dialects Matter

语音识别 | 5.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8629 字 阅读 →