论文解读

FLiP: Towards understanding and interpreting multimodal multilingual sentence embeddings

本文提出**FLiP**,一种**因子化线性投影模型**,旨在**理解并解释**多语言、多模态句子嵌入空间(如SONAR, LaBSE, Gemini)。核心思想是将嵌入空间的解释转化为一个**线性关键词提取任务**:通过一个简单的线性投影,从句子嵌入向量中恢复出构成该句子的词汇。实验表明,训练良好

 · 更新于 2026-09-25 · 约 8 分钟 · 3724 字 阅读 →
论文解读

MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora

这篇论文旨在解决零样本语音模仿任务中高质量平行训练数据稀缺的核心瓶颈。传统方法要么依赖复杂的解耦架构,要么使用合成语音作为训练目标,导致输出质量受限于合成系统的能力。作者提出了一种名为 **MimicLM** 的新框架,其核心创新在于**“角色交换”的数据构建策略**:使用TTS生成的语音作为**训

 · 更新于 2026-09-25 · 约 10 分钟 · 4878 字 阅读 →
论文解读

MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech

这篇论文旨在解决指令跟随文本转语音(TTS)领域缺乏系统化评估工具的问题。当前评估存在覆盖不全、诊断粒度粗、多语言支持弱等缺陷。为此,作者提出了**MINT-Bench**,一个全面的多语言基准测试。其核心方法包括:1)一个基于10种原子声学属性的**分层多轴分类法**,系统性地组织了从简单到复杂(

 · 更新于 2026-09-25 · 约 10 分钟 · 4944 字 阅读 →
论文解读

Prosody as Supervision: Bridging the Non-Verbal--Verbal for Multilingual Speech Emotion Recognition

这篇论文旨在解决低资源多语言语音情感识别(SER)中标注数据稀缺的核心瓶颈。作者提出了一个颠覆性的范式:**将SER重新定义为无监督的“非言语到言语”迁移问题**。其核心假设是,非言语发声(如笑、哭)中蕴含的韵律情感线索比言语更纯粹、更跨语言,因此可以作为更好的监督源。为此,作者设计了**NOVA-

 · 更新于 2026-09-25 · 约 13 分钟 · 6176 字 阅读 →
论文解读

VoxSafeBench: Not Just What Is Said, but Who, How, and Where

这篇论文旨在解决当前语音语言模型(SLM)社会对齐评估不全面、不深入的问题。现有基准要么只关注基础音频理解,要么孤立地研究单一风险,无法区分模型是因“不懂”还是因“没用对地方”而失败。为此,作者提出了**VoxSafeBench**,这是首个联合评估SLM在**安全、公平、隐私**三大社会对齐维度上

 · 更新于 2026-09-25 · 约 13 分钟 · 6394 字 阅读 →
论文解读

Where Do Self-Supervised Speech Models Become Unfair?

这篇论文旨在探究自监督语音模型(S3M)的不公平性究竟在模型的哪个层级产生。研究团队采用了一种轻量级的线性探针方法,在多个S3M(如WavLM, Wav2Vec2, BEST-RQ, Whisper)的每一层嵌入上,同时评估了说话人识别(SID)和自动语音识别(ASR)任务的整体性能及对不同说话人组

 · 更新于 2026-09-25 · 约 8 分钟 · 4007 字 阅读 →
论文解读

BlasBench: An Open Benchmark for Irish Speech Recognition

这篇论文旨在解决爱尔兰语语音识别(ASR)领域缺乏统一、可靠评估标准的问题。现有工作或基准要么忽略爱尔兰语特有的文本规范(如保留fada变音符号、初始辅音突变),要么在不同数据集和归一化方法下进行,导致结果无法比较。为此,作者提出了**BlasBench**,一个开放的评估框架,其核心是一个**爱尔

 · 更新于 2026-09-25 · 约 10 分钟 · 4640 字 阅读 →
论文解读

HARNESS: Lightweight Distilled Arabic Speech Foundation Models

这篇论文针对阿拉伯语语音识别、方言识别和情感识别中通用多语言/英语模型性能不足、且大模型难以部署的问题,提出了 HArnESS——一个以阿拉伯语为中心的自监督语音模型家族。作者采用 HuBERT 风格的迭代自蒸馏框架,先在大规模阿拉伯语-英语双语数据(约 23K 小时)上训练 24 层的教师模型 H

 · 更新于 2026-09-25 · 约 12 分钟 · 5602 字 阅读 →
论文解读

Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition

这篇论文针对传统ASR的两大盲区——WER指标对语义错误不敏感、以及系统无法通过自然交互进行纠错——提出了Interactive ASR框架。首先,作者引入S²ER(Sentence-level Semantic Error Rate),利用LLM-as-a-Judge二元判断识别结果与参考文本是否

 · 更新于 2026-09-25 · 约 13 分钟 · 6288 字 阅读 →
论文解读

MUSCAT: MUltilingual, SCientific ConversATion Benchmark

本文提出了 MUSCAT,一个用于评估多语言科学对话场景下自动语音识别(ASR)性能的新基准。数据集包含 6 组双语对话录音(共约 65 分钟,9,066 词),涉及英语与德语、土耳其语、中文、越南语的配对对话;每组对话使用 Meeting Owl 3、ReSpeaker USB 麦克风阵列和 Me

 · 更新于 2026-09-25 · 约 15 分钟 · 7508 字 阅读 →
论文解读

PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing

这篇论文旨在解决自动配音(AD)中目标语音与源语音在时长和唇形上的同步难题。其核心贡献是提出了一套两阶段的文本改写方法,并集成到TTS系统中:首先通过语言模型进行**等时性**改写,确保目标语音时长匹配源语音;其次引入**音素同步(PS)**,使用动态时间规整(DTW)和从训练数据中学习的元音距离,

 · 更新于 2026-09-25 · 约 8 分钟 · 3595 字 阅读 →
论文解读

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations

这篇论文旨在解决通用语音增强(USE)中生成模型面临的“高感知质量”与“低内容幻觉”难以兼得的核心矛盾。作者提出了UniPASE框架,它扩展了其先前的低幻觉PASE模型,以处理包括噪声、混响、丢包、风

 · 更新于 2026-09-25 · 约 14 分钟 · 6902 字 阅读 →