论文解读

不用中间文本转写:以识别语义直接约束唇手到语音的统一生成

针对中文唇读辅以手编码的视频到语音任务,UniCUE 用姿态感知的识别通路提供细粒度视觉语义并经适配器条件化潜在扩散语音生成,在统一听障语料上报告了识别与生成的词错率下降,但训练只用健听者数据且推理开销未量化。

 · 更新于 2026-09-24 · 约 20 分钟 · 9918 字 阅读 →
论文解读

未知声源数下分离与提取如何共用一个分离器:USE 的吸引子与线索对齐

针对混合声源数未知且用户线索可能缺失或低质的问题,USE 用 EDA 自动估计声源数与吸引子、用多模态线索网生成可替换的线索嵌入并以对齐损失联合训练,在 AudioSet 类 2 混与 3 混上报告了分离与提取的提升,但多声源计数与跨模态对齐精度随声源数增加而下降且大混合数评估仍有限。

 · 更新于 2026-09-24 · 约 21 分钟 · 10192 字 阅读 →
论文解读

既要一字不差又要好看易读:双形式语音识别如何决定数字该不该变

针对中文语音识别中口语忠实转写与书面可读转写难以兼顾的问题,论文用成对监督加提示词选形式训练一个共享模型,并以数字关键词加权的序列优化和分开考核必须改与禁止改的协议证明其在必须规范化上达到 4.64% I-CER 与 94.85% 关键词 F1、在禁止改上达到 95.18% 保留率,而无数字控制集上未引入虚假数字。

 · 更新于 2026-09-24 · 约 10 分钟 · 4935 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-04

共分析 30 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 40 分钟 · 19562 字 阅读 →
论文解读

同一音高多条路:用扩散与可演奏约束把吉他谱写对、写得能弹

音乐转录 | 8.2/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11909 字 阅读 →
论文解读

Task-disentangled Low-Rank Adaptation for Versatile Audio-visual Multi-modal Learning Tasks within a Unified Framework

音视频理解 | 7.4/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6968 字 阅读 →
论文解读

DAMOS: Learning Distortion-Aware Speech Quality Assessment through Explicit Distortion Localization

语音质量评估 | 8.2/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4504 字 阅读 →
论文解读

Dual-Scale State-Space Modeling with Speaker-Wise Dynamic CRF for Speech Emotion Recognition in Conversation

语音情感识别 | 8.4/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4585 字 阅读 →
论文解读

Multi-Task Learning for Non-Canonical Phoneme Recognition via Articulatory Feature Decomposition

语音识别 | 8.2/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4731 字 阅读 →
论文解读

Explainability by Design: Structured Kolmogorov-Arnold Networks over Probabilistic Attributes for Speech Deepfake Source Tracing

语音伪造检测 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4938 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-21

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 60 分钟 · 29950 字 阅读 →
论文解读

Evaluating Music Context Preservation: A Multi-facet Framework for Music Editing Systems

音乐理解 | 7.5/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5074 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-20

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 47 分钟 · 23525 字 阅读 →
论文解读

A Novel Binaural Cue Preservation Loss for DNN-Based Binaural Speech Enhancement

语音增强 | 5.6/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6438 字 阅读 →
论文解读

Singer-Informed Vocal Source Separation for Multi-Singer Music Mixtures

音乐源分离 | 7.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6140 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-17

共分析 20 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 62 分钟 · 30965 字 阅读 →
论文解读

Edge Phoneme Recognition for Children's Speech through Age-Aware Training

语音识别 | 6.3/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6776 字 阅读 →
论文解读

X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction

语音交互 | 6.4/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5797 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-12

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 76 分钟 · 37591 字 阅读 →
论文解读

DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation

音视频语音分离 | 6.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6225 字 阅读 →