论文解读

TextlessRAG: End-to-End Visual Document RAG by Speech without Text

语音问答 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4218 字 阅读 →
论文解读

Tokenchain: A Discrete Speech Chain via Semantic Token Modeling

语音识别 | 7.0/10

 · 更新于 2026-09-06 · 约 13 分钟 · 6054 字 阅读 →
论文解读

Toward Robust And Efficient Beat Tracking Via Beat-Aware Attention

音乐理解 | 8.5/10

 · 更新于 2026-09-06 · 约 9 分钟 · 4385 字 阅读 →
论文解读

Tpeformer: Temporal Patch Embedding Transformer

语音情感识别 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4746 字 阅读 →
论文解读

Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio

说话人分离 | 9.0/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4925 字 阅读 →
论文解读

Tri-Attention Fusion: Joint Temporal-Spectral and Bidirectional Modeling for Speech Spoofing Detection

语音伪造检测 | 7.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5146 字 阅读 →
论文解读

UJCodec: An End-to-end Unet-Style Codec for Joint Speech Compression and Enhancement

语音增强 | 7.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4672 字 阅读 →
论文解读

UMA-SPLIT: Unimodal Aggregation for Both English and Mandarin Non-Autoregressive Speech Recognition

语音识别 | 7.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3808 字 阅读 →
论文解读

USVexplorer: Robust Detection of Ultrasonic Vocalizations with Cross Species Generalization

音频事件检测 | 8.0/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5686 字 阅读 →
论文解读

VBx for End-to-End Neural and Clustering-Based Diarization

说话人分离 | 8.5/10

 · 更新于 2026-09-06 · 约 10 分钟 · 4816 字 阅读 →
论文解读

VChangeCodec: An Ultra Low-Complexity Neural Speech Codec with Built-In Voice Changer for Customized Real-Time Communication

语音转换 语音增强 | 8.0/10

 · 更新于 2026-09-06 · 约 11 分钟 · 5237 字 阅读 →
论文解读

WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition

语音识别 | 6.5/10

 · 更新于 2026-09-06 · 约 7 分钟 · 3139 字 阅读 →
论文解读

β-AVSDNET: A Novel End-To-End Neural Network Architecture For Audio-Visual Speaker Diarization

说话人分离 | 7.5/10

 · 更新于 2026-09-06 · 约 12 分钟 · 5853 字 阅读 →
论文解读

Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge

语音对话系统 | 6.5/10

 · 更新于 2026-09-06 · 约 8 分钟 · 3585 字 阅读 →
论文解读

Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization

1. **问题**:训练一个既能高精度离线转录又能低延迟流式识别的统一ASR模型极具挑战性,传统方法在低延迟下性能会急剧下降。 2. **方法核心**:提出一个统一的Transducer框架,结合分块注意力(含右上下文)和动态块卷积(DCConv)来适配两种模式。核心创新是引入了模式一致性正则化损失

 · 更新于 2026-09-06 · 约 8 分钟 · 3882 字 阅读 →
论文解读

Deep Supervised Contrastive Learning of Pitch Contours for Robust Pitch Accent Classification in Seoul Korean

这篇论文旨在解决将连续变化的基频(F0)曲线映射到首尔韩语中离散、不变的音高重音类别(如LHLH, HHLH)这一难题。传统方法易受F0测量噪声和说话人差异的影响。为此,作者提出了**Dual-Glob**,一个深度监督对比学习框架。其核心是通过一个**双分支(干净视图和增强视图)编码器**,在共享

 · 更新于 2026-09-06 · 约 12 分钟 · 5611 字 阅读 →
论文解读

Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation

本文针对文本转语音(TTS)任务,提出了一种名为“细节链”(Chain-of-Details, CoD)的新框架。**要解决的问题**是现有TTS方法在建模语音生成的时域动态(从粗略时序到精细声学细节的渐进过程)方面存在不足。**使用的方法**是将语音生成分解为多个时间分辨率递增的阶段,在每个阶段使

 · 更新于 2026-09-06 · 约 10 分钟 · 4525 字 阅读 →
论文解读

MUSCAT: MUltilingual, SCientific ConversATion Benchmark

本文提出了 MUSCAT,一个用于评估多语言科学对话场景下自动语音识别(ASR)性能的新基准。数据集包含 6 组双语对话录音(共约 65 分钟,9,066 词),涉及英语与德语、土耳其语、中文、越南语的配对对话;每组对话使用 Meeting Owl 3、ReSpeaker USB 麦克风阵列和 Me

 · 更新于 2026-09-06 · 约 15 分钟 · 7508 字 阅读 →
论文解读

VoxMind: An End-to-End Agentic Spoken Dialogue System

端到端语音对话模型在自然交互上进步迅速,但普遍缺乏处理复杂任务的agent能力(工具调用、规划、推理)。本文首先形式化定义了"端到端语音智能体"的四大维度——画像(Profile)、记忆(Memory)、规划(Planning)与执行(Action Execution),填补了该领域理论标准的空白。

 · 更新于 2026-09-06 · 约 16 分钟 · 8001 字 阅读 →
论文解读

An Ultra-Low Latency, End-to-End Streaming Speech Synthesis Architecture via Block-Wise Generation and Depth-Wise Codec Decoding

这篇论文旨在解决实时交互式语音合成中**推理延迟高**与**声学质量(尤其是高频细节)易受损**的核心矛盾。传统流水线依赖计算密集的神经声码器进行波形重建,且基于连续回归的声学模型易导致频谱过平滑。为

 · 更新于 2026-09-06 · 约 10 分钟 · 4673 字 阅读 →