Why Do Speech Language Models Fail to Generate Semantically Coherent Outputs? A Modality Evolving Perspective
语音生成 | 7.0/10
语音生成 | 7.0/10
模型评估 | 6.5/10
语音生成 | 8.0/10
语音合成 | 7.5/10
共分析 2 篇语音/AI 论文
语音识别 | 7.5/10
1. **问题**:现有针对基于神经音频编解码器的语音深度伪造(CodecFake)检测的研究主要集中在英语和中文,对于语言多样性极高的印度语言缺乏大规模的基准数据集和有效的检测方法。 2. **方法**:作者构建了首个大规模印度语言CodecFake数据集(ICF),并提出了一个名为SATYA
1. **问题**:现有大型音频语言模型在副语言(如情绪、语气、音色)生成与理解能力上的评估存在特征覆盖不全、评估方法主观且不可扩展的问题。 2. **方法**:提出了SpeechParaling-Bench,一个包含1000余个中英平行语音查询、覆盖超过100个细粒度副语言特征的综合基准。基准
1. **要解决什么问题**:现有基于生成模型(如扩散模型、自回归模型)的目标说话人提取(TSE)方法依赖全局上下文,难以直接用于实时流式场景,强行适配会导致性能严重下降。 2. **方法核心是什么**:提出首个面向流式TSE的自回归(AR)框架,核心是“分块交错拼接范式”。该范式将混合语音分块
这篇论文旨在解决当前全双工语音语言模型(FD-SLMs)评测体系的一个关键缺陷:缺乏对多轮、连续对话能力的系统性评估。现有基准多关注单轮交互或特定对话特性(如打断),忽略了模型在多轮语境下维持指令遵循、安全等核心能力的一致性。为此,作者提出了**MTR-DuplexBench**,一个全新的多轮全双
本文旨在解决语音语言模型(SLM)中一个根本性矛盾:神经音频编码器以波形重建为目标进行优化,而语言模型以序列预测为目标进行优化,这种目标不匹配导致生成的离散语音令牌熵值高、难以预测。为此,作者提出了LLM-Codec训练框架,在不改变编码器和语言模型架构的前提下,通过引入两个面向语言模型的正则化目标
本文提出了NIM4-ASR,一个面向生产环境的高效、鲁棒且可定制的实时语音识别框架。该工作旨在解决现有LLM-based ASR在实际部署中的三大挑战:1) 轻量化模型性能严重下降(有限的向下扩展性);2) 在声学挑战条件下产生幻觉;3) 缺乏生产就绪的热词定制机制。为此,作者提出了一套原则性的多阶
这篇论文旨在解决当前语音语言模型(SLM)社会对齐评估不全面、不深入的问题。现有基准要么只关注基础音频理解,要么孤立地研究单一风险,无法区分模型是因“不懂”还是因“没用对地方”而失败。为此,作者提出了**VoxSafeBench**,这是首个联合评估SLM在**安全、公平、隐私**三大社会对齐维度上
本文旨在解决全双工语音语言模型(如Moshi)事实性不足的核心问题,同时不牺牲其高交互性。**问题**:全双工模型能实时打断和回应,但因训练数据规模远小于文本,其知识储备和事实准确性较弱。**方法**:提出了MoshiRAG,一个模块化框架。它在Moshi模型中引入一个特殊的``检索触发令
端到端语音对话模型在自然交互上进步迅速,但普遍缺乏处理复杂任务的agent能力(工具调用、规划、推理)。本文首先形式化定义了"端到端语音智能体"的四大维度——画像(Profile)、记忆(Memory)、规划(Planning)与执行(Action Execution),填补了该领域理论标准的空白。
这篇论文旨在解决语音大模型(SLLM)在识别训练数据中稀有或未见的“偏置词”时性能不佳的问题。传统方法依赖于为偏置词提供精确的音素序列(通过G2P系统生成),但这对用户有专业要求且工具兼容性差。为此,
这篇论文旨在解决一个关键问题:当语音大模型(SLM)进入多用户共享环境时,仅基于文本内容的安全对齐策略是不足的,说话人身份、副语言特征和声学场景等音频上下文信息会根本性地改变请求的性质。为此,作者提出