StyleBench: Evaluating Speech Language Models on Conversational Speaking Style Control
基准测试 | 8.5/10
基准测试 | 8.5/10
语音情感识别 | 7.5/10
语音合成 | 7.5/10
语音情感识别 | 7.5/10
语音情感识别 | 7.0/10
语音情感识别 | 7.5/10
语音情感识别 | 8.0/10
语音情感识别 | 8.0/10
语音情感识别 | 7.5/10
语音情感识别 | 8.0/10
语音情感识别 | 6.0/10
语音情感识别 | 8.0/10
这篇论文旨在解决语音到语音翻译(S2ST)系统普遍丢失源语音中非语言声音(如笑声、哭声)和情感信息的问题,这严重影响了跨语言交流的自然度和准确性。为此,作者提出了三项核心贡献:首先,设计了一个可扩展的自动化数据合成管道,用于生成大规模、高质量的英中富有表现力S2ST平行语料,克服了训练数据稀缺的瓶颈
这篇论文旨在解决将连续变化的基频(F0)曲线映射到首尔韩语中离散、不变的音高重音类别(如LHLH, HHLH)这一难题。传统方法易受F0测量噪声和说话人差异的影响。为此,作者提出了**Dual-Glob**,一个深度监督对比学习框架。其核心是通过一个**双分支(干净视图和增强视图)编码器**,在共享
本文旨在解决训练共情语音聊天机器人时面临的**共情语音数据稀缺、模型泛化能力弱、以及微调导致LLM通用能力退化**三大难题。作者提出了**FreezeEmpath**,一种高效的端到端训练框架。其核心方法是**冻结基础LLM**,采用**语义-情感解耦编码策略**,通过独立的语义适配器和情感提取器从
这篇论文旨在解决低资源多语言语音情感识别(SER)中标注数据稀缺的核心瓶颈。作者提出了一个颠覆性的范式:**将SER重新定义为无监督的“非言语到言语”迁移问题**。其核心假设是,非言语发声(如笑、哭)中蕴含的韵律情感线索比言语更纯粹、更跨语言,因此可以作为更好的监督源。为此,作者设计了**NOVA-
本文旨在解决对话系统中情感识别(ERC)与情感表达能力受限于高质量标注数据稀缺且静态的问题。**核心贡献**是提出了一个心理学动机的自我进化框架 **SELF-EMO**。**关键方法**是构建一个角色扮演的自博弈范式,使模型同时充当“情绪识别者”和“对话响应者”,并通过一个“生成-筛选-重用”的数
这篇论文旨在解决音频-文本多模态表示学习中的一个关键挑战:如何在低资源、长序列且模态维度严重不平衡(音频高维、文本低维)的情况下,实现有效的跨模态对齐,同时保留各自的特异性信息。为此,作者提出了HILBERT框架。该方法首先利用冻结的预训练音频(如HuBERT)和文本(如T5)编码器提取片段级特征,