论文解读

带底噪也要无缝改口:先分离再压残留噪声的语音编辑

针对带环境噪声的插入与替换编辑问题,SeamlessEdit 选择先用分离模型分出人声与噪声、再用稀疏贝叶斯与滤波压残留噪声并做语境精修,在 EARS-WHAM 上把插入自然度做到 3.78 而基线 VoiceCraft 仅 2.93,代价是仍需依赖现成分离与编辑模型且对女声高频与重叠说话人保留残留问题。

 · 更新于 2026-09-25 · 约 17 分钟 · 8091 字 阅读 →
论文解读

先分清冗余与噪声,再按输入调节瓶颈:SeD-UD 的分层解耦信息瓶颈

针对多模态意图识别中固定维度信息瓶颈难以适应样本级冗余与噪声、且把两者混在一起压缩的问题,SeD-UD 用影响因子驱动的自适应瓶颈做单模态去冗余与融合后统一去噪,在 MIntRec 加权精度 73.96% 等指标上报告最优,但文本增强基线与情感泛化边界仍是代价与限制。

 · 更新于 2026-09-25 · 约 18 分钟 · 8924 字 阅读 →
论文解读

循环脉冲网络不必全连接:用一维卷积加可学习轴突延迟做语音建模

针对循环脉冲网络中稠密循环矩阵参数平方增长的问题,该工作用核长为 3 的一维卷积替代全连接循环并保留每个神经元可学习的轴突延迟,在 SHD 上达到 91.51% 精度并把单层循环参数从 65792 降到 259,代价是在 SSC 上落后 DelRec 约 4 个百分点且 SSC 未做超参搜索。

 · 更新于 2026-09-25 · 约 19 分钟 · 9139 字 阅读 →
论文解读

只用单阵列相位谱估计说话人朝向:混响为何反而有帮助

该工作用短时傅里叶变换相位的正弦余弦作输入,结合卷积、双向门控循环和自注意力估计 0-360 度方位角,在仿真混响干净条件下平均角度误差 19.9 度、个性化到说话人与房间后降到 11.3 度,代价是仍需仿真预训练和少量目标域微调才能泛化。

 · 更新于 2026-09-25 · 约 18 分钟 · 8677 字 阅读 →
论文解读

移动脑电跨被试解码注意说话人:对比学习为何比只重建包络更稳

该研究用三模型对比学习加包络重建做跨被试听觉注意解码,在 24 人移动脑电三种自然范式上 2 秒窗 61.4% 到 30 秒窗 79.1%,代价是依赖 5 秒训练窗与多特征音频编码且短窗绝对精度仍有限。

 · 更新于 2026-09-25 · 约 20 分钟 · 9769 字 阅读 →
论文解读

干扰比忽高忽低时,如何既压住间歇干扰又不放大噪声:子空间投影修正黎曼平均 RTF

针对混响噪声下有多个间歇强干扰时的多通道语音增强问题,论文用黎曼平均的首席特征向量抗干扰、再向样本相关矩阵的子空间投影来抑制噪声,并以 MVDR 波束形成器验证,在所报告的 SIR、SNR、混响和阵元数条件下取得更低的 NMSE 与更高的 PESQ 和 STOI,但低维投影阈值选择与高 SIR 下黎曼分支的退化仍是代价与边界。

 · 更新于 2026-09-25 · 约 23 分钟 · 11153 字 阅读 →
论文解读

活动范围已知时,把导向矢量更新压进低维子空间做半盲分离

针对声源活动范围大致已知但精确位置未知的多通道分离问题,论文把导向矢量约束在预测导向矢量张成的低维子空间内并扩展迭代源导向框架,用固定与灵活两种子空间维度配置在四声源混响仿真中对照标准 ISS 与平均导向矢量 MVDR,代价是仍依赖预测网格与混响条件且原文未给出可复述的逐点数值。

 · 更新于 2026-09-25 · 约 21 分钟 · 10084 字 阅读 →
论文解读

语音一说就信?SVHalluc 检验语音与画面是否真的对上

论文针对语音内容与视频画面的语义和时间对齐问题,构造 2405 个问答的 SVHalluc 基准并测试多款音视频大模型,最强证据是 Gemini-2.5-Pro 在全局语义对齐上达到 93.10% 而多数开源模型徘徊在 50% 附近,代价是开源模型跨模态绑定能力仍接近随机且需额外的人工核验构造流程。

 · 更新于 2026-09-25 · 约 19 分钟 · 9059 字 阅读 →
论文解读

不靠姿态骨架:用文本管动作、用音频管节奏的说话人像生成

SyncDreamer 针对只有离散情绪标签和依赖姿态中间表示导致动作僵硬的问题,用视觉适配器保身份、音频动态编码器抓节奏能量、跨模态提示增强器把文本变成动作指令,在 HDTF、AVSpeech 人像和 EMTD 半身基准上报告了最优的真实感与同步指标,代价是两阶段扩散训练与更长的提示构造链路。

 · 更新于 2026-09-25 · 约 24 分钟 · 11529 字 阅读 →
论文解读

语系相近是否可迁移:以新拉丁语族检验跨语言语音情感识别的边界

该文以固定 Wav2Vec2-XLSR 基线检验语系分组对跨语言语音情感识别的影响,最强证据是同语系内留一语言泛化优于跨语系泛化,而代价是跨语系直接迁移大幅掉点且受数据量与标注不一致制约。

 · 更新于 2026-09-25 · 约 22 分钟 · 10809 字 阅读 →
论文解读

从一路混合音频生成面对面双人 3D 对话:空间、注视与轮流如何被建模

该研究用一路混合音频同时生成同处一室的双人 3D 表情、头姿、位移和眼球注视,以共享权重的双流扩散加跨说话人注意力解耦轮流,用两阶段数据策略兼顾交互与口型,并在用户研究中获得约 73 至 78% 的偏好,但推理依赖声纹分离出的说话概率与首帧空间条件。

 · 更新于 2026-09-25 · 约 21 分钟 · 10319 字 阅读 →
论文解读

二分容器装不下成对线索:用三子空间为模态对单独留位置

针对只有全局共有与单模态私有两类表示会漏掉仅在两个模态之间成立的情感协同的问题,论文把表示分成公共、两两共享、私有三路并用子空间感知交叉注意力融合,在对齐与非对齐条件下报告了更低的平均绝对误差与更高的细粒度准确率,代价是更多分支与正则项需要逐项验证。

 · 更新于 2026-09-25 · 约 20 分钟 · 9615 字 阅读 →
论文解读

双模态变差、三模态恢复:用聚合标记锚定含噪转写的流利度评估

针对二语流利度评估中声学加文本的朴素双模态融合在转写含噪时会低于纯声学基线的问题,论文用声学自监督嵌入加 BERT 文本加六维心理语言学标记的三模态投影加 BiLSTM 融合恢复并超过基线,在 Speechocean762 上达到 82.60% F1、在 Avalinguo 上达到 95.84% F1,代价是依赖转写与三编码器拼接带来的额外计算量。

 · 更新于 2026-09-25 · 约 24 分钟 · 11966 字 阅读 →
论文解读

人声与人脸为何总对不上:用不对称时间窗口重建音画同步

针对以人为中心联合生成中唇同步偏差与语义情绪脱节,UniAVGen 采用对称双分支加不对称跨模态交互、面部感知调制与模态感知引导实现单模型多任务生成,论文报告在更少联合样本下取得音色与情绪一致性优势,同时存在主体一致性未胜出与大模型打分客观性不足等边界。

 · 更新于 2026-09-25 · 约 20 分钟 · 9864 字 阅读 →
论文解读

倾听塌缩的拆解:先学自发先验再用双轨音频调制的 UniLS

针对直接联合训练让倾听分支塌缩为静态表情的问题,UniLS 用无音频自回归预训练学习内在运动先验,再用双轨音频交叉注意力微调实现端到端说听生成,在 Seamless Interaction 测试与 25 人偏好比较中报告说话对齐与倾听分布同时改善,代价是更大算量与仍缺语义理解。

 · 更新于 2026-09-25 · 约 19 分钟 · 9260 字 阅读 →
论文解读

强监督从哪里来:用高质量描述重建语音音乐环境声的统一标签

该文把预训练瓶颈定位为监督源弱而散,用高保真描述器加统一标签系重建强监督,并在同量音频上比较多种目标,显示数据质量与覆盖决定泛化而目标决定任务分化,但域内事件任务仍需更大规模验证。

 · 更新于 2026-09-25 · 约 16 分钟 · 8011 字 阅读 →
论文解读

不重训语音大模型,用无声图文与门控交叉注意力教它看图说话

MoshiVis 冻结 Moshi 语音主干与 PaliGemma 图像编码器,只训练约 206M 门控交叉注意力适配层,并用无声图文加少量语音的单阶段混合训练实现看图对话,最强证据是语音提问下 OCR-VQA 与 VQAv2 接近微调 PaliGemma 而 L4 上每步只增加约 7 ms,代价是纯无声训练会破坏语音质量且长无关上下文仍会干扰切换。

 · 更新于 2026-09-25 · 约 20 分钟 · 9950 字 阅读 →
论文解读

通用音频模型靠什么泛化:类特异神经元的覆盖、共享与因果检验

论文以 M2D 自监督 ViT 为对象,用音频激活概率熵找出类特异神经元,报告其在未见任务上接近全类别覆盖与跨任务共享,并以不足 1% 神经元的失活验证其对分类的功能影响与局限。

 · 更新于 2026-09-25 · 约 17 分钟 · 8247 字 阅读 →
论文解读

语音自监督表示为何能做音系加减法:方向与尺度的双重证据

论文以 96 个语言的类比成功率与声码器重合成声学测量为证据,说明自监督语音模型以线性方向编码音系特征并以向量尺度连续控制实现程度,但合成效果仍受声码器与上下文切分条件限制。

 · 更新于 2026-09-25 · 约 16 分钟 · 7785 字 阅读 →
论文解读

多而不杂才有用:用来源与生成器多样性重组语音伪造检测训练数据

该文研究未见伪造方法下的泛化问题,选择先量化来源与生成器多样性的扩展规律再做异构数据混合,用 12k 小时 DOSS 加权训练在公开集和商用 API 集上超过 74k 小时基线,但大 Nc 与极端温度仍会退化且多语覆盖有限。

 · 更新于 2026-09-25 · 约 20 分钟 · 9633 字 阅读 →