论文解读

把水印藏进编解码器保留的潜变量方向:DeltaMark 对神经编解码重合成的鲁棒性

针对波形水印经神经编解码重合成后易失效的问题,论文用冻结 EnCodec 连续潜变量上的前馈加性扰动做 16 比特水印,在重复与低码率 EnCodec 重合成下退化更平缓,但端到端音质受限于编解码器载体本身。

 · 更新于 2026-09-25 · 约 20 分钟 · 9672 字 阅读 →
论文解读

把无条件分支换成可学习的向量:语音合成中更稳的引导基线

该研究把固定零向量换成每个条件各学一个无条件嵌入,并在相同训练步数与数据下比较固定与可学习两种做法,最强证据是可学习基线在大引导权重下更稳定,代价是说话人保真提升时绝对质量分可能下降且需要分别调节两个权重。

 · 更新于 2026-09-25 · 约 21 分钟 · 10440 字 阅读 →
论文解读

先压缩时间再做全局融合:MambaVoice 的轻量视听歌声分离

针对多人演唱与密集伴奏下的目标歌声分离,MambaVoice 用对数分频音频编码加面部动作门控做条件,再以先 Mamba 后 Transformer 的混合主干建模,报告在 Acappella 未见未闻测试上以 16.2M 参数取得 14.18 dB SDR,并在 URSing 跨域与推理耗时上给出对照,代价是强干扰下仍略低于 VoViT 基线且主观评测样本 …

 · 更新于 2026-09-25 · 约 18 分钟 · 8736 字 阅读 →
论文解读

跑调的人声如何借伴奏找回调:MIDIBack 的联合符号建模

MIDIBack 把自动音高校正做成在统一符号序列上结合伴奏预测人声音符的任务,报告显示完整训练下总体 RPA 为 78.6%,而去掉伴奏后 Outshift 下 RPA 从 81.5% 降到 35.8%,代价是评估仍基于转录伪目标和合成走音而非人耳听感。

 · 更新于 2026-09-25 · 约 17 分钟 · 8452 字 阅读 →
论文解读

门控只在新模态上打开:在冻结嵌入模型里加音频与热成像而不改动旧输出

该文把瓶颈适配器装进冻结解码器每一层并用输入成分做二进制门控,使旧模态走原计算图实现逐位不变,同时用对照实验显示音频检索提升与热成像包的可组合性,代价是新增模态的文本混排输入属于新行为且双门同开不在保证内。

 · 更新于 2026-09-25 · 约 16 分钟 · 7898 字 阅读 →
论文解读

用一帧延迟换真流式:TinyCall 在 2.3 kbps 下的因果编码与标量量化安排

TinyCall 针对窄带应急语音在 2.3 kbps 下采用因果 SEANet 编码器加 Vocos 式频谱解码器与残差有限标量量化实现流式重建,流式相对离线仅从 PESQ 1.3197 降到 1.2994,但伪前视引入一帧算法延迟且未完全消除边界失真。

 · 更新于 2026-09-25 · 约 20 分钟 · 9662 字 阅读 →
论文解读

沉默与重叠都不是错:轮换时机要按说话人意图打分

论文针对固定窗口把延迟与重叠一律判错的问题,用六类意图后验与人类轮换偏移分布加权连续打分,在 9728 个回合上显示最强系统综合分 0.47 远低于人类 0.86 且与人评一致性更高,但代价是需要多标注者意图标注与分人群拟合的参考分布。

 · 更新于 2026-09-25 · 约 20 分钟 · 9716 字 阅读 →
论文解读

把水印藏进编码器能保住的结构:NeuMark 对神经编解码器重合成的应对

针对神经编解码器重合成会抹掉波形域水印的问题,NeuMark 把 16 比特消息分布嵌入 SpeechTokenizer 的 8 路残差量化潜变量并用失真增强训练检测与解码,其代价是潜变量方法的透明度受限于编解码器自身重建质量并需区分原始参考与重建参考。

 · 更新于 2026-09-25 · 约 21 分钟 · 10520 字 阅读 →
论文解读

不改唇形只定静音时刻:用二值语音活动信号约束配音合成

该文用帧级二值语音活动掩码约束补画式语音合成以对齐源语言静音结构,在 mTEDx 上把帧对齐准确率从约 73% 提升到约 96%,而主观自然度无显著下降,代价是在翻译时长严重失配时出现可复述的删词、重复与重排。

 · 更新于 2026-09-25 · 约 19 分钟 · 9244 字 阅读 →
论文解读

只拼模态不够:用静态属性与动态事件补上物理监督

针对通用多模态只学语义对齐而缺物理量监督的问题,OmniFysics-Nano-V2 用静态属性 grounding 与动态视听事件对齐的双分支数据加两阶段 GRPO,在 21 项中 17 项领先同类全模态模型,代价是依赖商用大模型标注与多阶段训练流程。

 · 更新于 2026-09-25 · 约 22 分钟 · 10584 字 阅读 →
论文解读

把逐帧检索换成一步速度场:在 WavLM 空间学习 kNN 传输

该研究用条件流匹配网络回归 kNN 生成的源到伪目标位移,以交叉注意力与 FiLM 注入目标说话人条件并比较三条高斯路径,在 LibriSpeech 上以单步推理改善可懂度与估计质量,代价是目标说话人验证相似度低于 kNN 与音素幻觉器。

 · 更新于 2026-09-25 · 约 14 分钟 · 6862 字 阅读 →
论文解读

不另加音频塔:共享主干如何统一文本图像视频音频检索

论文把文本图像视频音频放进同一个共享主干做任意到任意检索,用四阶段对比训练与同源采样和蒸馏优化,在 MMEB-v3 等基准上取得领先,但多条件文本与记忆检索仍有短板且低维压缩在细粒度任务上损失更大。

 · 更新于 2026-09-25 · 约 19 分钟 · 9289 字 阅读 →
论文解读

当时间轴变成可以斜切的体:Passing 如何把单段车窗录像走成无尽旅程

Passing 把一段多摩单轨车窗连续录像堆成时空体并沿非线性截面重采样出无尽画面,再用去掉视觉语义分支、只留时间对齐与车内环境声语义锚定的 SpecMaskFoley 实时生成同步声,代价是最终展览声景没有可复算的客观正确性指标,只能靠现场稳定性和艺术协商来收敛。

 · 更新于 2026-09-25 · 约 20 分钟 · 9829 字 阅读 →
论文解读

可见不等于送达:只给留存下来的译文记功的流式语音翻译

针对可修订流式语音到文本翻译中可见草稿会奖励随后被撤回内容的问题,论文提出持续交付优化,用留存前缀的参考覆盖累积中间奖励并单独计最终质量,在 7.49 小时 FLEURS 适配下相对 History-SFT 降低平均与 P90 终结感知延迟 10.8% 与 11.3% 并降低归一化擦除 15.8%,代价是需要完整轨迹回放计算回报且中间奖励依赖词面覆盖。

 · 更新于 2026-09-25 · 约 17 分钟 · 8029 字 阅读 →
论文解读

长期照护肺炎听诊:X 线监督与三通道前胸协议的稳定判别

针对日本长期照护高龄有症状人群的六通道前胸数字听诊任务,论文用 X 线监督训练共享权重 ARP-N 卷积网络并在病人级重复交叉验证下比较临床诊断监督,最强证据是听诊单模态 XRAY 模型 F1 为.729、准确率为.783 而融合模型 AUC 为.791,代价是单中心 185 例与域漂移限制外推。

 · 更新于 2026-09-25 · 约 19 分钟 · 9465 字 阅读 →
论文解读

舞者姿态能给希腊传统音乐打标签补上音频听不到的那部分吗

该文在 Lyra 舞蹈子集上用音频、视频、骨架三模态做 28 标签自动打标,报告最强三模态门控融合宏 ROC-AUC 为 0.864,超过最强音频单模态 0.821,但骨架单模态仅 0.586 且约半数片段缺有效姿态。

 · 更新于 2026-09-25 · 约 21 分钟 · 10380 字 阅读 →
论文解读

在一直开着的麦克风下藏攻击:在编码瓶颈处对齐掩蔽的平滑防御

针对全双工语音对话持续暴露声学通道的问题,论文用掩蔽阈值约束的不可闻扰动形式化劫持、静默与越狱三类攻击,并以码本几何与掩蔽匹配的潜变量平滑加一致性训练把劫持从 91.7% 降到 8.3%,代价是 UTMOS 相对下降 2.3% 且认证半径只到 0.616 的保底水平。

 · 更新于 2026-09-25 · 约 20 分钟 · 9850 字 阅读 →
论文解读

开放收集为何仍数不出酷儿声音:六个语音数据集审计与四组实践张力

论文审计六个英语语音技术数据集,发现可测量的酷儿占比仅 0–1.4% 而不足以做稳健差异度量,并以两个酷儿社群语音库为对照,提出规模化与包容、效率与参与、开放与自主、静态类别与流动身份四组张力,且代价是现有众包与开放流程难以覆盖小而易受污名群体。

 · 更新于 2026-09-25 · 约 19 分钟 · 9464 字 阅读 →
论文解读

暂停更安静却漂移更大:语音编码器表示漂移与任务损失的错位

该研究冻结八个语音编码器并在整段、仅语音、仅暂停三种放置下加入非语音干扰,用余弦漂移与四项下游任务损失对比,显示整段干扰下漂移可按声音排序任务损失,而安静到中等强度下暂停干扰漂移更大但语音干扰任务损失更大,且低于估计背景的干扰已可达到重复录制级别的漂移。

 · 更新于 2026-09-25 · 约 23 分钟 · 11094 字 阅读 →
论文解读

从能说话到能办事:Qwen-Audio-3.1-Realtime 如何把推理、执行与说话时机分开训练

该工作把实时语音交互拆为思考、行动与说话协调三层,用文本教师蒸馏加可执行环境强化学习提升多轮约束跟踪与工具执行,在半双工语音版 τ-Voice 上总成功率从 78.4% 升至 82.0%,代价是部分流畅性与延迟指标并未同步最优且长时程口语任务仍未验证。

 · 更新于 2026-09-25 · 约 23 分钟 · 11201 字 阅读 →