论文解读

StyleBench: Evaluating Speech Language Models on Conversational Speaking Style Control

基准测试 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4238 字 阅读 →
论文解读

SURE: Synergistic Uncertainty-Aware Reasoning for Multimodal Emotion Recognition in Conversations

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4997 字 阅读 →
论文解读

Synthetic yet Striking? Assessing Vocal Charisma in TTS via Perceptual and Algorithmic Measures

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4258 字 阅读 →
论文解读

Temporal Graph Modeling for Speech Emotion Recognition Using LSTM-Aggregated Multigraph Networks

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3621 字 阅读 →
论文解读

Test Time Adaptation for Speech Emotion Recognition

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4724 字 阅读 →
论文解读

Tpeformer: Temporal Patch Embedding Transformer

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4746 字 阅读 →
论文解读

Unrequited Emotions: Investigating the Gaps in Motivation and Practice in Speech Emotion Recognition Research

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2880 字 阅读 →
论文解读

When Audio Matters: A Lightweight, Hierarchical Fusion Model for Speech and Non-Verbal Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4926 字 阅读 →
论文解读

Whisper-QF: Leveraging Dual Cross-Attention Q-Former for Speech Emotion Recognition With Multi-Task Learning

语音情感识别 | 7.5/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5139 字 阅读 →
论文解读

Psychologically-Grounded Graph Modeling for Interpretable Depression Detection

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8689 字 阅读 →
论文解读

MER 2026: From Discriminative Emotion Recognition to Generative Emotion Understanding

语音情感识别 | 6.0/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5670 字 阅读 →
论文解读

Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition

语音情感识别 | 8.0/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5231 字 阅读 →
论文解读

MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation

这篇论文旨在解决语音到语音翻译(S2ST)系统普遍丢失源语音中非语言声音(如笑声、哭声)和情感信息的问题,这严重影响了跨语言交流的自然度和准确性。为此,作者提出了三项核心贡献:首先,设计了一个可扩展的自动化数据合成管道,用于生成大规模、高质量的英中富有表现力S2ST平行语料,克服了训练数据稀缺的瓶颈

 · 更新于 2026-09-25 · 约 11 分钟 · 5030 字 阅读 →
论文解读

Deep Supervised Contrastive Learning of Pitch Contours for Robust Pitch Accent Classification in Seoul Korean

这篇论文旨在解决将连续变化的基频(F0)曲线映射到首尔韩语中离散、不变的音高重音类别(如LHLH, HHLH)这一难题。传统方法易受F0测量噪声和说话人差异的影响。为此,作者提出了**Dual-Glob**,一个深度监督对比学习框架。其核心是通过一个**双分支(干净视图和增强视图)编码器**,在共享

 · 更新于 2026-09-25 · 约 12 分钟 · 5611 字 阅读 →
论文解读

FreezeEmpath: Efficient Training for Empathetic Spoken Chatbots with Frozen LLMs

本文旨在解决训练共情语音聊天机器人时面临的**共情语音数据稀缺、模型泛化能力弱、以及微调导致LLM通用能力退化**三大难题。作者提出了**FreezeEmpath**,一种高效的端到端训练框架。其核心方法是**冻结基础LLM**,采用**语义-情感解耦编码策略**,通过独立的语义适配器和情感提取器从

 · 更新于 2026-09-25 · 约 10 分钟 · 4668 字 阅读 →
论文解读

Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition

这篇论文旨在解决低资源多语言语音情感识别(SER)中标注数据稀缺的核心瓶颈。作者提出了一个颠覆性的范式:**将SER重新定义为无监督的“非言语到言语”迁移问题**。其核心假设是,非言语发声(如笑、哭)中蕴含的韵律情感线索比言语更纯粹、更跨语言,因此可以作为更好的监督源。为此,作者设计了**NOVA-

 · 更新于 2026-09-25 · 约 13 分钟 · 6176 字 阅读 →
论文解读

SELF-EMO: Emotional Self-Evolution from Recognition to Consistent Expression

本文旨在解决对话系统中情感识别(ERC)与情感表达能力受限于高质量标注数据稀缺且静态的问题。**核心贡献**是提出了一个心理学动机的自我进化框架 **SELF-EMO**。**关键方法**是构建一个角色扮演的自博弈范式,使模型同时充当“情绪识别者”和“对话响应者”,并通过一个“生成-筛选-重用”的数

 · 更新于 2026-09-25 · 约 8 分钟 · 3893 字 阅读 →
论文解读

Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

这篇论文旨在解决音频-文本多模态表示学习中的一个关键挑战:如何在低资源、长序列且模态维度严重不平衡(音频高维、文本低维)的情况下,实现有效的跨模态对齐,同时保留各自的特异性信息。为此,作者提出了HILBERT框架。该方法首先利用冻结的预训练音频(如HuBERT)和文本(如T5)编码器提取片段级特征,

 · 更新于 2026-09-25 · 约 11 分钟 · 5095 字 阅读 →