论文解读

WaveSP-Net: Learnable Wavelet-Domain Sparse Prompt Tuning for Speech Deepfake Detection

语音伪造检测 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6181 字 阅读 →
论文解读

WavLink: Compact Audio–Text Embeddings with a Global Whisper Token

音频检索 | 8.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4681 字 阅读 →
论文解读

An event-based sequence modeling approach to recognizing non-triad chords with oversegmentation minimization

音乐理解 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4400 字 阅读 →
论文解读

Scaling Properties of Continuous Diffusion Spoken Language Models

语音生成 | 8.0/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6298 字 阅读 →
论文解读

DiariZen Explained: A Tutorial for the Open Source State-of-the-Art Speaker Diarization Pipeline

说话人分离 | 6.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4881 字 阅读 →
论文解读

Misinformation Span Detection in Videos via Audio Transcripts

音频安全 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4016 字 阅读 →
论文解读

Environmental Sound Deepfake Detection Using Deep-Learning Framework

1. **问题**:针对环境声音(包括声音场景和声音事件)的深度伪造检测(ESDD)任务,现有研究不足,且尚不清楚声音场景与声音事件的伪造检测是否需要不同模型。 2. **方法核心**:提出一个深度学习框架,核心是采用预训练的音频模型(BEATs)作为特征提取器,并结合一种三阶段训练策略(包含对

 · 更新于 2026-09-25 · 约 10 分钟 · 4902 字 阅读 →
论文解读

Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages

1. **问题**:现有针对基于神经音频编解码器的语音深度伪造(CodecFake)检测的研究主要集中在英语和中文,对于语言多样性极高的印度语言缺乏大规模的基准数据集和有效的检测方法。 2. **方法**:作者构建了首个大规模印度语言CodecFake数据集(ICF),并提出了一个名为SATYA

 · 更新于 2026-09-25 · 约 10 分钟 · 4929 字 阅读 →
论文解读

MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation

这篇论文旨在解决语音到语音翻译(S2ST)系统普遍丢失源语音中非语言声音(如笑声、哭声)和情感信息的问题,这严重影响了跨语言交流的自然度和准确性。为此,作者提出了三项核心贡献:首先,设计了一个可扩展的自动化数据合成管道,用于生成大规模、高质量的英中富有表现力S2ST平行语料,克服了训练数据稀缺的瓶颈

 · 更新于 2026-09-25 · 约 11 分钟 · 5030 字 阅读 →
论文解读

Environmental Sound Deepfake Detection Using Deep-Learning Framework

本文针对环境声音(如声音事件、声音场景)的深度伪造检测这一新兴任务,提出了一个系统的深度学习框架。**核心贡献**在于通过大量实验,系统评估了不同频谱图(MEL, CQT, Gammatone)、多种CNN架构(ResNet, Inception等)以及预训练模型(BEATs)在该任务上的表现,并验

 · 更新于 2026-09-25 · 约 8 分钟 · 3862 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

这篇技术报告全面介绍了Qwen3.5-Omni,一个能够统一理解与生成文本、图像、音频和音视频内容的全模态大语言模型。**要解决的问题**是现有模型在实时交互、跨模态推理和自主智能体行为方面的局限性。**采用的方法**是基于“思考者-说话者”架构,引入了多项关键创新:1)思考者和说话者均采用混合注意

 · 更新于 2026-09-25 · 约 12 分钟 · 5641 字 阅读 →
论文解读

Hard to Be Heard: Phoneme-Level ASR Analysis of Phonologically Complex, Low-Resource Endangered Languages

这篇论文针对两种音系极其复杂、资源极度匮乏的濒危东高加索语言(Archi和Rutul),首次建立了语音识别(ASR)基准。作者们整合并标准化了现有的语言学记录,创建了约50分钟和1小时20分钟的语音-文本数据集。他们评估了多种前沿ASR模型(wav2vec2, Whisper, Qwen2-Audi

 · 更新于 2026-09-25 · 约 10 分钟 · 4554 字 阅读 →
论文解读

LLM-Codec: Neural Audio Codec Meets Language Model Objectives

本文旨在解决语音语言模型(SLM)中一个根本性矛盾:神经音频编码器以波形重建为目标进行优化,而语言模型以序列预测为目标进行优化,这种目标不匹配导致生成的离散语音令牌熵值高、难以预测。为此,作者提出了LLM-Codec训练框架,在不改变编码器和语言模型架构的前提下,通过引入两个面向语言模型的正则化目标

 · 更新于 2026-09-25 · 约 11 分钟 · 5390 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

Qwen3.5-Omni 是一个旨在统一理解、推理、生成与行动的全模态大语言模型。它**解决**了现有模型在实时交互、长上下文音视频处理、流式语音生成稳定性以及多语言支持等方面的局限性。**方法上**,它基于Thinker-Talker架构,引入了Hybrid MoE以提升效率,采用显式时间戳替代稀

 · 更新于 2026-09-25 · 约 12 分钟 · 5592 字 阅读 →
论文解读

ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks

这篇论文旨在解决当前语音深度伪造检测(SDD)系统在面对富有表现力和情感的合成语音攻击时泛化能力不足的核心问题。现有方法过度依赖伪造数据,容易学习数据集特定的伪影,而非自然语音的可迁移特征。为此,作者

 · 更新于 2026-09-25 · 约 10 分钟 · 4935 字 阅读 →