论文解读

Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency

这篇论文针对当前全双工语音代理评估缺乏真实性(依赖合成语音)和任务简单性(单步调用)的问题,提出了**Full-Duplex-Bench-v3 (FDB-v3)** 基准。该基准的核心创新在于使用**100条真实人类录音**(含五种不流畅性注释),在四个任务域中设计了需要**多步API链式调用**的

 · 更新于 2026-09-25 · 约 8 分钟 · 3607 字 阅读 →
论文解读

Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition

这篇论文针对传统ASR的两大盲区——WER指标对语义错误不敏感、以及系统无法通过自然交互进行纠错——提出了Interactive ASR框架。首先,作者引入S²ER(Sentence-level Semantic Error Rate),利用LLM-as-a-Judge二元判断识别结果与参考文本是否

 · 更新于 2026-09-25 · 约 13 分钟 · 6288 字 阅读 →
论文解读

NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations

本文旨在解决语音合成(TTS)领域中非语言声音(NVV,如笑声、叹息、哭泣)缺乏标准化评估框架的问题。为此,作者提出了NVBench,一个双语(英/中)基准测试。其核心方法包括:1)设计了一个涵盖45种NVV类型的统一分类法;2)构建了一个类型均衡的高质量双语评估数据集;3)提出了一套多轴评估协议,

 · 更新于 2026-09-25 · 约 11 分钟 · 5061 字 阅读 →
论文解读

PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing

这篇论文旨在解决自动配音(AD)中目标语音与源语音在时长和唇形上的同步难题。其核心贡献是提出了一套两阶段的文本改写方法,并集成到TTS系统中:首先通过语言模型进行**等时性**改写,确保目标语音时长匹配源语音;其次引入**音素同步(PS)**,使用动态时间规整(DTW)和从训练数据中学习的元音距离,

 · 更新于 2026-09-25 · 约 8 分钟 · 3595 字 阅读 →
论文解读

Adaptive Test-Time Scaling for Zero-Shot Respiratory Audio Classification

本文旨在解决零样本呼吸音频分类中“一刀切”的推理计算浪费问题。为此,提出了TRIAGE框架,这是一个三层自适应推理管道:第一层(Tier-L)进行快速的标签-文本相似度匹配;若置信度不足则升级至第二层

 · 更新于 2026-09-25 · 约 11 分钟 · 5023 字 阅读 →
论文解读

Diffusion Language Models for Speech Recognition

这篇论文探索了将扩散语言模型(DLM)应用于自动语音识别(ASR)任务的新方法。其核心目标是利用扩散模型的双向注意和并行生成能力,来提升基于传统编码器(如CTC)生成的ASR候选假设的准确性。论文主要

 · 更新于 2026-09-25 · 约 9 分钟 · 4324 字 阅读 →
论文解读

Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models

本文旨在解决非侵入式语音质量评估在标注数据有限场景下的性能瓶颈。作者提出了GatherMOS框架,其核心是将大语言模型(如GPT-5)作为一个元评估器,通过精心设计的文本提示,融合多类异构信号:包括手

 · 更新于 2026-09-25 · 约 10 分钟 · 4519 字 阅读 →
论文解读

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

本文旨在解决大型音频语言模型在复杂音频场景中因感知错误导致的推理失败问题。受听觉场景分析启发,作者提出了一个感知接地的混合推理框架。首先,他们构建了一个名为PAQA的新数据集,通过层次化解耦策略(区分

 · 更新于 2026-09-25 · 约 13 分钟 · 6065 字 阅读 →
论文解读

MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models

本文提出了MoshiRAG,这是首个集成检索增强生成功能的全双工语音语言模型。**要解决的问题**是全双工语音模型在保持实时交互性的同时,事实准确性不足的挑战。**核心方法**是基于Moshi模型,设

 · 更新于 2026-09-25 · 约 11 分钟 · 5300 字 阅读 →