论文解读

按语义密度生成:SEAM 用编解码对齐弥合语音与文本的粒度差

针对语音按时长定速、文本按语义变长造成的分布失配,SEAM 用冻结编码器加可训练交叉注意力解码器做变速率对齐并分三阶段训练加首词引导,在仅用 LibriSpeech960 小时训练时取得 2.6%/5.2% 与跨域 TED-LIUM-v2 上 4.7% 词错率,代价是两段自回归带来的推理延迟。

 · 更新于 2026-09-24 · 约 16 分钟 · 7975 字 阅读 →
论文解读

合成错一个词就够了:用 ASR 交叉注意力的清晰度与单调性做词级奖励

针对自回归 TTS 整句打分太粗、难以定位个别错词的问题,论文用冻结 Whisper 交叉注意力算出注意力纯度与对齐单调性两个词级奖励,再做组内相对策略优化,在 CoSyVoice 上把域内 WER 从 5.25 降到 3.21、域外从 8.92 降到 4.54,代价是需要额外采样与 ASR 打分开销且未报告延迟。

 · 更新于 2026-09-24 · 约 18 分钟 · 8632 字 阅读 →
论文解读

先剪掉噪声再识别:语音感知的长上下文剪枝与融合

针对会议幻灯 OCR 等长而 noisy 的上下文导致识别偏置词困难的问题,论文用两阶段剪枝加语音驱动池化先筛关键词再做识别,在 SlideSpeech 上报告 WER 7.71% 并在 LibriSpeech 上报告 WER 1.12%,代价是两阶段流水线与池化压缩带来的实现复杂度。

 · 更新于 2026-09-24 · 约 21 分钟 · 10216 字 阅读 →
论文解读

先出声再等文本:用原生语音令牌在波形之前跟踪读到哪

增量文本流式语音合成需要在线知道说到原文何处,X2-NativeCursor 用原生语音令牌加局部匹配做可修正估计再输出单调光标,在 80 毫秒前视下中文平均绝对误差 0.151 字,对比在线波形基线 320 毫秒前视下 1.253 字,代价是每个主干需单独训练观察器且对未见音色敏感。

 · 更新于 2026-09-24 · 约 19 分钟 · 9189 字 阅读 →
论文解读

在熔池时序中找缺陷:多模态时序注意力如何把 GMAW 角焊缝的隐蔽缺陷检出率推到 0.99

针对 GMAW 角焊缝中难以实时发现的五类内部缺陷,论文用 16 帧图像与梅尔声谱的 3D 时序融合加跨块注意力将多模态 F1 提升至 0.99,并以 GradCAM 与 t-SNE 定位每类缺陷的图像关键区与更优模态,代价仅增加 0.1 GFLOPs。

 · 更新于 2026-09-24 · 约 21 分钟 · 10031 字 阅读 →
论文解读

跨航次重识别为何难:去重门控与原始波形选择性核的诚实评估

论文将水下舰船识别形式化为开放集跨航次重识别,用航次级音频裁决去重与源纯画廊堵住录音复用捷径,提出原始波形 4 尺度选择性核编码器 SKANN 并在 40 船 IARA 画廊上显示 rank-1 仅 0.25 且去重本身就抹掉 16 至 21 个点的虚高。

 · 更新于 2026-09-24 · 约 20 分钟 · 10002 字 阅读 →
论文解读

不对称残差融合能否替代双向跨模态 Transformer:RAFM-SER++ 的轻量化权衡

RAFM-SER++ 以文本为查询、语音为键值的单向残差注意力替代双向跨模态 Transformer,结合 BYOL 式对齐与注意力池化,在 IEMOCAP 上达到 81.10% BACC、ESD 上 95.39% BACC,同时将可训练参数从 8.9M 降至 3.6M 并提升推理吞吐。

 · 更新于 2026-09-24 · 约 20 分钟 · 9994 字 阅读 →
论文解读

从隐式注意力到可编辑的时滞轨迹:音视同步如何为发音评估提供可解释时序依据

针对仅靠音频评估无法诊断唇动与语音时序错位的问题,论文用跨模态注意力显式建模帧级对齐并导出时滞轨迹与稳定性指标,在 8 类录制条件下以线性复杂度和可视化分析实现可解释的同步性诊断。

 · 更新于 2026-09-24 · 约 23 分钟 · 11297 字 阅读 →
论文解读

音频三路特征与视频时空建模为何需要注意力来对齐:多模态情绪识别的可复述路径

针对单模态易受噪声与信息缺失影响的问题,论文用 Wav2Vec2、MFCC 与统计声学特征经 BiLSTM 建模音频、用 ResNet50-BiLSTM 建模视频,并以多头交叉注意力做特征级融合,在 MELD 上微平均 93.7% 与 IEMOCAP 上 90.3% 准确率上验证效果,但未报告训练超参细节与统计显著性。

 · 更新于 2026-09-24 · 约 22 分钟 · 10959 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-09

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 2 分钟 · 1002 字 阅读 →
论文解读

长时音视频为何不能只靠分块拼接:Encore 用参考锚点与自适应信号路由维持一致性

针对长时同步音视频生成中视频连贯、音频连贯与跨模态同步三重耦合难题,Encore 以重叠运动帧迭代与参考锚点分工配合可学习的自适应信号路由实现无限长度生成,并在扩展的 VerseBench 上以更低的时序漂移与更高的身份与同步指标验证效果,同时保留高分辨率与语音能力。

 · 更新于 2026-09-24 · 约 24 分钟 · 11802 字 阅读 →
论文解读

低码率语音编解码装不下时:用语义与唇动补上高层信息

针对低码率下仅靠语音表示难以保留上下文与发音信息的问题,论文在 MDCTCodec 上增加语义与图像两个辅助分支并用交叉注意力融合,以直接拼接的融合模式和蒸馏后纯语音推理的蒸馏模式组织实验,在 TaL80 上把 ViSQOL 从 3.86 提升到 4.01,代价是融合模式推理需要额外的唇部图像与预训练语义输入。

 · 更新于 2026-09-24 · 约 22 分钟 · 10955 字 阅读 →
论文解读

多人声场叠加下如何用声音同时还原三维姿态:SoundMHPE 的多尺度与时序解耦

针对多人运动导致声学特征叠加与互反射延迟混叠的问题,SoundMHPE 用多尺度 STFT 编码器与每帧每人独立查询的时序解码器在 6 小时 AMP 数据集上实现多人 3D 姿态估计,并在 MPJPE 等指标上优于声学与 WiFi 基线,代价是需在受控室内采集与同步动捕数据。

 · 更新于 2026-09-24 · 约 23 分钟 · 11142 字 阅读 →
论文解读

从听见写入选项到用选项做决定:音频大模型中声学证据的两阶段路径

在必须依赖声音的选择题上训练能提升准确率并同步增强对真实音频的行为敏感度,其内部机制是早期到中层先让音频塑造选项表征、再在中层到晚层强化选项对最终答案的贡献,而可学习的 LoRA 更新在模型特定的层带上起决定作用。

 · 更新于 2026-09-24 · 约 24 分钟 · 11722 字 阅读 →
论文解读

Word-Level Modeling with Alignment-Aware Acoustic Fusion for Text-Assisted Intelligibility Prediction in Listeners with Hearing Loss

语音质量评估 | 7.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6639 字 阅读 →
论文解读

Ordering Matters: Rank-Aware Selective Fusion for Blended Emotion Recognition

多模态情感识别 | 5.0/10

 · 更新于 2026-09-24 · 约 14 分钟 · 7000 字 阅读 →
论文解读

ChladniSonify: A Visual-Acoustic Mapping Method for Chladni Patterns in New Media Art Creation

音频生成 | 6.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8585 字 阅读 →
论文解读

Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration

音乐生成 | 7.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8830 字 阅读 →
论文解读

TARNet: A Temporal-Aware Multi-Scale Architecture for Closed-Set Speaker Identification

TARNet: A Temporal-Aware Multi-Scale Architecture for Closed-Set Speaker Identification

 · 更新于 2026-09-24 · 约 18 分钟 · 8941 字 阅读 →
论文解读

When Attention Collapses: Residual Evidence Modeling for Compositional Inference

音频分离 | 7.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5820 字 阅读 →