论文解读

AST: Adaptive, Seamless, and Training-Free Precise Speech Editing

本文针对现有语音编辑方法依赖任务特定训练、未编辑区域时间一致性差的问题,提出了AST(Adaptive, Seamless, and Training-free),一种基于预训练AM-FM(自回归-流匹配)范式TTS模型的精确语音编辑框架。AST首先通过逆Euler ODE求解器将原始语音反演至潜空

 · 更新于 2026-10-02 · 约 13 分钟 · 6468 字 阅读 →
论文解读

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels

本文旨在解决从单向“独白”式虚拟人生成迈向自然“全双工”交互式生成的核心挑战。**核心问题**在于,现有方法要么因严格的帧对齐而反应僵硬,要么因引入全局注意力而破坏唇同步。**关键方法**是提出一个基于多头高斯核(MHGK)的统一注意力架构,该机制通过为不同的注意力头分配从窄到宽的高斯分布感受野,使

 · 更新于 2026-10-02 · 约 11 分钟 · 5110 字 阅读 →
论文解读

BlasBench: An Open Benchmark for Irish Speech Recognition

这篇论文旨在解决爱尔兰语语音识别(ASR)领域缺乏统一、可靠评估标准的问题。现有工作或基准要么忽略爱尔兰语特有的文本规范(如保留fada变音符号、初始辅音突变),要么在不同数据集和归一化方法下进行,导致结果无法比较。为此,作者提出了**BlasBench**,一个开放的评估框架,其核心是一个**爱尔

 · 更新于 2026-10-02 · 约 10 分钟 · 4640 字 阅读 →
论文解读

Discrete Token Modeling for Multi-Stem Music Source Separation with Language Models

本文提出了一种用于多轨音乐源分离的生成式框架,其核心创新在于将分离任务重新定义为**条件离散令牌生成**问题。传统方法直接在时频域估计连续信号,而本文方法首先利用**HCodec**神经音频编解码器将音频波形转换为离散的声学与语义令牌序列。然后,一个基于**Conformer**的条件编码器从混合音

 · 更新于 2026-10-02 · 约 10 分钟 · 4961 字 阅读 →
论文解读

Elucidating the SNR-t Bias of Diffusion Probabilistic Models

这篇论文的核心贡献是识别并系统分析了扩散概率模型(DPMs)中一个基础性问题——信噪比-时间步(SNR-t)偏差。该偏差指推理时去噪样本的实际SNR与其所分配时间步t所理论对应的SNR不匹配,这种错位源于训练时的严格耦合在推理时被累积误差打破。作者通过详实的实验(滑动窗口测试、前向与反向过程对比)揭

 · 更新于 2026-10-02 · 约 10 分钟 · 4541 字 阅读 →
论文解读

Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency

这篇论文针对当前全双工语音代理评估缺乏真实性(依赖合成语音)和任务简单性(单步调用)的问题,提出了**Full-Duplex-Bench-v3 (FDB-v3)** 基准。该基准的核心创新在于使用**100条真实人类录音**(含五种不流畅性注释),在四个任务域中设计了需要**多步API链式调用**的

 · 更新于 2026-10-02 · 约 8 分钟 · 3607 字 阅读 →
论文解读

Generalizable Audio-Visual Navigation via Binaural Difference Attention and Action Transition Prediction

本文旨在解决音频-视觉导航(AVN)智能体在未见环境和未闻声音类别下泛化能力差的核心问题。作者指出,现有方法性能下降主要源于两个因素:一是音频表征混淆了语义与空间信息,导致对未闻声��定位不准;二是强化学习策略过拟合于训练环境的动态和布局。为此,本文提出了一个名为BDATP的即插即用框架。在感知层面

 · 更新于 2026-10-02 · 约 11 分钟 · 5221 字 阅读 →
论文解读

HARNESS: Lightweight Distilled Arabic Speech Foundation Models

这篇论文针对阿拉伯语语音识别、方言识别和情感识别中通用多语言/英语模型性能不足、且大模型难以部署的问题,提出了 HArnESS——一个以阿拉伯语为中心的自监督语音模型家族。作者采用 HuBERT 风格的迭代自蒸馏框架,先在大规模阿拉伯语-英语双语数据(约 23K 小时)上训练 24 层的教师模型 H

 · 更新于 2026-10-02 · 约 12 分钟 · 5602 字 阅读 →
论文解读

Hierarchical Codec Diffusion for Video-to-Speech Generation

本论文针对 Video-to-Speech(VTS)生成中视觉-语音模态信息不对称的问题,提出现有方法忽略了语音从粗粒度语义到细粒度韵律的层次结构,导致视觉条件无法与语音表示精准对齐。为此,作者提出 HiCoDiT(Hierarchical Codec Diffusion Transformer),

 · 更新于 2026-10-02 · 约 12 分钟 · 5676 字 阅读 →
论文解读

Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition

这篇论文针对传统ASR的两大盲区——WER指标对语义错误不敏感、以及系统无法通过自然交互进行纠错——提出了Interactive ASR框架。首先,作者引入S²ER(Sentence-level Semantic Error Rate),利用LLM-as-a-Judge二元判断识别结果与参考文本是否

 · 更新于 2026-10-02 · 约 13 分钟 · 6288 字 阅读 →
论文解读

Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization

这篇论文旨在解决音频-文本多模态表示学习中的一个关键挑战:如何在低资源、长序列且模态维度严重不平衡(音频高维、文本低维)的情况下,实现有效的跨模态对齐,同时保留各自的特异性信息。为此,作者提出了HILBERT框架。该方法首先利用冻结的预训练音频(如HuBERT)和文本(如T5)编码器提取片段级特征,

 · 更新于 2026-10-02 · 约 11 分钟 · 5095 字 阅读 →
论文解读

MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models

本文旨在解决全双工语音语言模型(如Moshi)事实性不足的核心问题,同时不牺牲其高交互性。**问题**:全双工模型能实时打断和回应,但因训练数据规模远小于文本,其知识储备和事实准确性较弱。**方法**:提出了MoshiRAG,一个模块化框架。它在Moshi模型中引入一个特殊的``检索触发令

 · 更新于 2026-10-02 · 约 12 分钟 · 5609 字 阅读 →
论文解读

MUSCAT: MUltilingual, SCientific ConversATion Benchmark

本文提出了 MUSCAT,一个用于评估多语言科学对话场景下自动语音识别(ASR)性能的新基准。数据集包含 6 组双语对话录音(共约 65 分钟,9,066 词),涉及英语与德语、土耳其语、中文、越南语的配对对话;每组对话使用 Meeting Owl 3、ReSpeaker USB 麦克风阵列和 Me

 · 更新于 2026-10-02 · 约 15 分钟 · 7508 字 阅读 →
论文解读

NaijaS2ST: A Multi-Accent Benchmark for Speech-to-Speech Translation in Low-Resource Nigerian Languages

这篇论文旨在解决非洲低资源语言在语音翻译(S2ST和S2TT)研究中面临的高质量、多口音平行语音数据严重匮乏的核心瓶颈。为此,作者构建了**NaijaS2ST**数据集,涵盖豪萨语、伊博语、约鲁巴语和尼日利亚皮钦语与英语的平行语音,每种语言约50小时,捕获了真实的说话者与口音多样性。基于此数据集,论

 · 更新于 2026-10-02 · 约 9 分钟 · 4148 字 阅读 →
论文解读

NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations

本文旨在解决语音合成(TTS)领域中非语言声音(NVV,如笑声、叹息、哭泣)缺乏标准化评估框架的问题。为此,作者提出了NVBench,一个双语(英/中)基准测试。其核心方法包括:1)设计了一个涵盖45种NVV类型的统一分类法;2)构建了一个类型均衡的高质量双语评估数据集;3)提出了一套多轴评估协议,

 · 更新于 2026-10-02 · 约 11 分钟 · 5061 字 阅读 →
论文解读

PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing

这篇论文旨在解决自动配音(AD)中目标语音与源语音在时长和唇形上的同步难题。其核心贡献是提出了一套两阶段的文本改写方法,并集成到TTS系统中:首先通过语言模型进行**等时性**改写,确保目标语音时长匹配源语音;其次引入**音素同步(PS)**,使用动态时间规整(DTW)和从训练数据中学习的元音距离,

 · 更新于 2026-10-02 · 约 8 分钟 · 3595 字 阅读 →
论文解读

Qwen3.5-Omni Technical Report

Qwen3.5-Omni 是一个旨在统一理解、推理、生成与行动的全模态大语言模型。它**解决**了现有模型在实时交互、长上下文音视频处理、流式语音生成稳定性以及多语言支持等方面的局限性。**方法上**,它基于Thinker-Talker架构,引入了Hybrid MoE以提升效率,采用显式时间戳替代稀

 · 更新于 2026-10-02 · 约 12 分钟 · 5592 字 阅读 →
论文解读

Spatial-Aware Conditioned Fusion for Audio-Visual Navigation

本论文针对音频-视觉导航(AVN)中目标空间意图模糊、视觉特征缺乏听觉条件引导两大问题,提出了 Spatial-Aware Conditioned Fusion(SACF)框架。该框架首先设计了 Spatially Discretized Localization Descriptor(SDLD),

 · 更新于 2026-10-02 · 约 10 分钟 · 4579 字 阅读 →
论文解读

Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models

统一的大型音频-语言模型(LALMs)在自回归解码时存在“时间平滑偏差”:短暂、瞬态的声学线索(如电话铃声、乐器拨弦)容易被语言先验和时间上平滑的上下文所淹没,导致生成结果缺乏音频特异性。本文提出 Temporal Contrastive Decoding (TCD),一种完全免训练、仅在推理时生效

 · 更新于 2026-10-02 · 约 12 分钟 · 5887 字 阅读 →
论文解读

The Acoustic Camouflage Phenomenon: Re-evaluating Speech Features for Financial Risk Prediction

本研究探讨了在企业财报电话会议中,副语言声学特征(音高、抖动、停顿等)对预测灾难性股价下跌的效用。作者基于MAEC数据集,提取了两种模态的特征:文本端使用FinBERT计算脚本化开场白与即兴Q&A之间的情感极性差异(Sentiment Delta),音频端提取临床语音压力标记的方差特征(音高方差、抖

 · 更新于 2026-10-02 · 约 12 分钟 · 5556 字 阅读 →