论文解读

FLiP: Towards understanding and interpreting multimodal multilingual sentence embeddings

这篇论文旨在解决对多语言、多模态句子嵌入(如SONAR, LaBSE)的可解释性问题。核心方法是提出一种称为因子化线性投影(FLiP)的模型,通过将嵌入向量线性投影到词汇表空间来提取关键词,以此作为理解嵌入内容的代理任务。与之前非因子化的线性探测方法(如LiP)和SpLiCE相比,FLiP在关键词提

 · 更新于 2026-09-18 · 约 8 分钟 · 4001 字 阅读 →
论文解读

Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages

1. **问题**:现有针对基于神经音频编解码器的语音深度伪造(CodecFake)检测的研究主要集中在英语和中文,对于语言多样性极高的印度语言缺乏大规模的基准数据集和有效的检测方法。 2. **方法**:作者构建了首个大规模印度语言CodecFake数据集(ICF),并提出了一个名为SATYA

 · 更新于 2026-09-18 · 约 10 分钟 · 4929 字 阅读 →
论文解读

MOMO: A framework for seamless physical, verbal, and graphical robot skill learning and adaptation

1. **问题**:工业机器人需要频繁适应新任务和环境,但现有技能调整方法(如手动重编程)对非专家用户不友好,且单一交互模态无法高效处理所有类型的调整需求。 2. **方法核心**:提出MOMO框架,集成三种互补交互模态:动觉接触(用于精确空间修正)、自然语言(用于高层语义修改)和图形界面(用于参数

 · 更新于 2026-09-18 · 约 9 分钟 · 4373 字 阅读 →
论文解读

MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation

这篇论文旨在解决语音到语音翻译(S2ST)系统普遍丢失源语音中非语言声音(如笑声、哭声)和情感信息的问题,这严重影响了跨语言交流的自然度和准确性。为此,作者提出了三项核心贡献:首先,设计了一个可扩展的自动化数据合成管道,用于生成大规模、高质量的英中富有表现力S2ST平行语料,克服了训练数据稀缺的瓶颈

 · 更新于 2026-09-18 · 约 11 分钟 · 5030 字 阅读 →
论文解读

ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence

1. **问题**:当前多模态大模型在音乐符号处理(Omnimodal Notation Processing, ONP)领域存在严重缺陷:研究碎片化、模型存在严重的符号偏差(偏向五线谱)、且普遍依赖不可靠的“LLM-as-a-Judge”评估方法,掩盖了模型在音乐理论推理上的系统性失败。 2.

 · 更新于 2026-09-18 · 约 9 分钟 · 4149 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

这篇论文介绍了Qwen3.5-Omni,一个支持文本、图像、音频和音频-视频输入的全模态大语言模型。为解决现有模型在实时交互、跨模态推理和工具使用上的不足,其核心方法是采用“Thinker-Talker”架构,并引入混合专家(MoE)设计以提升效率。与前代相比,主要创新在于:1)模型规模扩展至数千亿

 · 更新于 2026-09-18 · 约 10 分钟 · 4857 字 阅读 →
论文解读

Reducing the Offline-Streaming Gap for Unified ASR Transducer with Consistency Regularization

1. **问题**:训练一个既能高精度离线转录又能低延迟流式识别的统一ASR模型极具挑战性,传统方法在低延迟下性能会急剧下降。 2. **方法核心**:提出一个统一的Transducer框架,结合分块注意力(含右上下文)和动态块卷积(DCConv)来适配两种模式。核心创新是引入了模式一致性正则化损失

 · 更新于 2026-09-18 · 约 8 分钟 · 3882 字 阅读 →
论文解读

SAND: The Challenge on Speech Analysis for Neurodegenerative Disease Assessment

1. **解决的问题**:针对神经退行性疾病(特别是肌萎缩侧索硬化症ALS)的早期诊断和监测,缺乏大规模、有临床标注的语音数据集,以及标准化的算法评估框架。 2. **方法核心**:构建并发布了名为SAND的挑战赛,其核心是提供一个扩展的、包含纵向数据的ALS患者与健康对照语音数据集(VOC-A

 · 更新于 2026-09-18 · 约 9 分钟 · 4092 字 阅读 →
论文解读

Self-Noise Reduction for Capacitive Sensors via Photoelectric DC Servo: Application to Condenser Microphones

1. **问题**:电容式传感器(如ECM麦克风)的自噪声主要源于前置放大器中用于建立直流偏置的门极电阻(Rm)的热噪声。该电阻同时决定了噪声的低通截止频率和信号的高通截止频率,形成了一个难以调和的噪声-带宽权衡。 2. **方法核心**:提出PDS-Amp(光电直流伺服放大器),用基于外部光电效应

 · 更新于 2026-09-18 · 约 8 分钟 · 3858 字 阅读 →
论文解读

SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation

1. **问题**:现有大型音频语言模型在副语言(如情绪、语气、音色)生成与理解能力上的评估存在特征覆盖不全、评估方法主观且不可扩展的问题。 2. **方法**:提出了SpeechParaling-Bench,一个包含1000余个中英平行语音查询、覆盖超过100个细粒度副语言特征的综合基准。基准

 · 更新于 2026-09-18 · 约 7 分钟 · 3464 字 阅读 →
论文解读

Tadabur: A Large-Scale Quran Audio Dataset

1. **问题**:现有的古兰经语音数据集在规模、诵读者多样性、音频质量和标注深度上存在严重不足,限制了古兰经ASR、诵读者识别等任务的研究进展。 2. **方法核心**:提出Tadabur数据集及其构建流水线。流水线核心是“古兰经经文对齐模块”(AAM),它结合WhisperX进行初步转录,再利用

 · 更新于 2026-09-18 · 约 8 分钟 · 3619 字 阅读 →
论文解读

Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation

1. **问题**:现有基于离散token的TTS模型,其“粗到细”的生成范式主要体现在从语义token到声学token的转换,而对语音固有的时间动态(temporal dynamics)缺乏显式建模。 2. **方法核心**:提出Chain-of-Details (CoD)框架,将语音生成分解为多

 · 更新于 2026-09-18 · 约 9 分钟 · 4367 字 阅读 →
论文解读

Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model

1. **要解决什么问题**:现有基于生成模型(如扩散模型、自回归模型)的目标说话人提取(TSE)方法依赖全局上下文,难以直接用于实时流式场景,强行适配会导致性能严重下降。 2. **方法核心是什么**:提出首个面向流式TSE的自回归(AR)框架,核心是“分块交错拼接范式”。该范式将混合语音分块

 · 更新于 2026-09-18 · 约 11 分钟 · 5046 字 阅读 →
论文解读

Utterance-Level Methods for Identifying Reliable ASR-Output for Child Speech

1. **要解决什么问题**:儿童语音自动识别(ASR)错误率高,影响语言学习、阅读辅助等应用。传统置信度估计方法在噪声大、模式多变的儿童语音上可能失效。需要一种在转录后(utterance级别)自动识别哪些ASR输出是可靠的方法,以减少人工审核负担。 2. **方法核心是什么**:提出两种基于

 · 更新于 2026-09-18 · 约 10 分钟 · 4959 字 阅读 →
论文解读

X-VC: Zero-shot Streaming Voice Conversion in Codec Space

1. **问题**:零样本语音转换需要同时实现高质量的说话人特征迁移和低延迟的流式推理,这是一个尚未很好解决的挑战。 2. **方法核心**:提出X-VC系统,在预训练的SAC语音编解码器的潜在空间中进行一步转换。核心是一个双条件声学转换器,它联合处理源语音的编解码器潜在表示和目标参考语音的帧级梅尔

 · 更新于 2026-09-18 · 约 9 分钟 · 4441 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-04-23

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-18 · 约 73 分钟 · 36076 字 阅读 →
论文解读

APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track

这篇论文报告了APRVOS系统,一个专为MEVIS_Audio(音频条件下的指代视频对象分割)任务设计的冠军方案。**要解决的问题**是传统文本指代分割模型无法直接处理包含噪声、不完整且可能描述视频中不存在物体的语音输入。**采用的方法**是一个四阶段流水线:首先使用VibeVoice-ASR将语音

 · 更新于 2026-09-18 · 约 9 分钟 · 4115 字 阅读 →
论文解读

ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis

本文针对现有语音合成系统在生成角色驱动、情感丰富的语音时难以同时保持角色身份一致性和情感表达准确性的问题,提出了ATRIE框架。其核心是**Persona-Prosody Dual-Track (P2-DT) 架构**,将语音生成解耦为静态的**音色轨道**(通过标量量化保持身份锚点)和动态的**韵

 · 更新于 2026-09-18 · 约 11 分钟 · 5414 字 阅读 →
论文解读

Audio Spoof Detection with GaborNet

本论文旨在解决传统SincNet前端在音频伪造检测中因有限长度sinc函数截断导致的频率泄漏问题。作者提出使用可学习的Gabor滤波器组(GaborNet)替代SincNet,并将其集成到两种先进的端到端检测架构RawNet2和RawGAT-ST中。同时,论文探索了将LEAF(Learnable F

 · 更新于 2026-09-18 · 约 13 分钟 · 6015 字 阅读 →
论文解读

BEAT: Tokenizing and Generating Symbolic Music by Uniform Temporal Steps

本文针对符号音乐生成中主流的事件序列(event-based)tokenization方法隐含处理时间规律、导致模型需额外学习时间网格的问题,提出了一种名为**BEAT**的新型网格化tokenization框架。其核心思想是将音乐在时间上均匀离散化为“拍”(beat)作为基本单位,将每拍内每个音高

 · 更新于 2026-09-18 · 约 10 分钟 · 4791 字 阅读 →