论文解读

把做乐器的扩散模型拿去换嗓:统一条件如何同时管住音高、音素与演唱者

论文把多乐器音乐合成的注意力扩散模型改造为语音与歌声转换,用音素后验、基频与演唱者嵌入做条件,在自然度与演唱者相似度上追平专用转换模型,但音素保真下降且加入器乐数据会拉低人声质量。

 · 更新于 2026-09-25 · 约 18 分钟 · 8901 字 阅读 →
论文解读

把谱质心压进全极点模型:用搬运代价对齐频移峰

针对小频移下谱平均被抹糊的问题,该文把熵正则 Wasserstein 重心约束为给定阶数全极点谱,用 Sinkhorn 加反射系数参数化梯度下降求解,在 TIMIT 五音素上以平衡准确率与 F1 略优于非参数重心,但优化非凸只能得到次优平稳点。

 · 更新于 2026-09-25 · 约 19 分钟 · 9195 字 阅读 →
论文解读

长脉冲响应拆成两个短滤波器:RLS-NKP 如何用两个可变遗忘因子兼顾精度与跟踪

针对长回声路径辨识问题,论文把长度为 L 的脉冲响应拆成两个短分量滤波器并为各自设计可变遗忘因子,在网络与声学回声消除仿真中报告了比固定遗忘因子 RLS-NKP 更低失调与更快跟踪,但未给出失调数值的表格且依赖对角协方差等简化假设。

 · 更新于 2026-09-25 · 约 17 分钟 · 8143 字 阅读 →
论文解读

只用朗读时的停顿和用词,能反推中风病灶在哪、有多大吗

该研究用图片描述语音的声学流畅性与文本流畅性双路特征加注意力多示例学习,在 742 人 SONIVA 语料上不依赖影像预测中风状态、偏侧、体积三分级和 12 个半球脑叶受累,并报告左半球偏文本、右半球偏声学的特征依赖梯度与定位性能差距。

 · 更新于 2026-09-25 · 约 18 分钟 · 8882 字 阅读 →
论文解读

同向干扰难分开时:用跨阵列非目标估计做后置滤波的声点形成

针对目标与干扰在单个阵列看来同方向而波束形成失效的问题,该研究用几何约束线性解混做空间滤波、再用跨阵列非目标估计构建多通道维纳后置滤波,在三阵列混响实验中多数指标超过 NMF 与 NTF 基线,但稀疏先验强度与混响条件会带来失真与抑制的权衡。

 · 更新于 2026-09-25 · 约 21 分钟 · 10154 字 阅读 →
论文解读

绕开姿态瓶颈:用音频直驱三维高斯粒子的全身说话人

针对单图全身会话化身中音频到姿态再到渲染的误差累积与口手细节丢失问题,论文用音频直接调制三维高斯粒子变形场并蒸馏大视频扩散先验,消融显示轨迹对齐与分数蒸馏分别控制同步与平滑,但自建评测与合成监督带来泛化边界。

 · 更新于 2026-09-25 · 约 18 分钟 · 8866 字 阅读 →
论文解读

不用直接拖舌头位置:用弹簧力产生平滑的双元音舌轨迹

针对几何直拖难以产生平滑非线性双元音轨迹的问题,论文用二维弹簧-质量-阻尼器把键盘输入映射为作用力再耦合 Pink Trombone 合成, pilot 显示曲线轨迹的弯曲能量由 1191.1 降到 211.6 而直线定位精度基本相当,代价是样本仅为作者且未做统计检验。

 · 更新于 2026-09-25 · 约 17 分钟 · 8355 字 阅读 →
论文解读

不靠攻击仿真堆料:用对抗嵌入与时间无关读出做音频水印

针对剪切拼接易失同步的问题,AWARE 用时频域对抗优化嵌入水印并以时间无关检测器解码,在保持 PESQ 约 4.26 与 STOI 约 0.99 的同时在多种编辑下保持低误码率,代价是逐样本迭代嵌入开销与神经压缩等条件仍有残留误差。

 · 更新于 2026-09-25 · 约 17 分钟 · 8149 字 阅读 →
论文解读

一个通用扰动为何能在不同 ASR 上都让转写偏向同一目标

该文研究针对 Whisper 系列的通用、有迁移性的目标性声学攻击,提出 MuteOut 随机掩码优化,以较大的扰动预算换取跨模型的目标词成功率,同时用词错率和语义分数量化通用性与迁移性之间的折中。

 · 更新于 2026-09-25 · 约 20 分钟 · 9635 字 阅读 →
论文解读

不用干净语音和 transcript,能否用端到端识别的不确定性估计每个词的可懂度

该工作用注意力端到端语音识别内部后验的不确定性做全盲微观可懂度估计,在 GRID 句库上以熵和离散度指标在相关性和逻辑回归预测准确率上超过直接用识别结果的基线,代价是离散度需额外对齐与多假设打分且结论限于小词汇矩阵句。

 · 更新于 2026-09-25 · 约 18 分钟 · 8802 字 阅读 →
论文解读

自回归交叉注意力丢了时间因果:用质心右移把对齐拉回来

针对 Transformer 解码器非因果交叉注意力导致的长删除与重复幻觉,该文提出只在推理时逐 token 右移注意力质心并钳制跳变的方法,在 LibriSpeech 四集上相对基线平均降低 8.9% 词错误率,代价是引入 δ、β、ν 三个需在开发集上调参的启发式阈值且不改变模型参数。

 · 更新于 2026-09-25 · 约 18 分钟 · 8609 字 阅读 →
论文解读

电影混音三轨分离:用脸与场景两路视觉约束生成式分离

针对电影混音需分离对白、音效、音乐且缺乏带干净分轨的视听电影数据问题,该工作用条件流匹配同时生成三路频谱并以面部与场景双路视觉为条件,合成数据训练后在合成与真实电影片段上获得更干净的主观与分布指标,但多步采样与预测模型在信噪比类指标上的差距仍是代价。

 · 更新于 2026-09-25 · 约 18 分钟 · 8648 字 阅读 →
论文解读

字幕能帮耳朵分轨吗:CineSubNet 用文本先验做电影对白音乐音效分离

针对电影音轨要分成对白音乐音效的问题,CineSubNet 用稀疏编解码加 Transformer 分离并以 Whisper 加 BERT 字幕作语义先验,在 DnR 全系列上以 SDR 为指标超过 BandIt 等基线,多模态版本代价是参数从 23.5M 到 24.1M 而延迟基本不变。

 · 更新于 2026-09-25 · 约 15 分钟 · 7049 字 阅读 →
论文解读

把命名识别改成音频文本配对:CLAP 如何绕开失语症转写的脆弱环节

针对卒中后失语命名中发音变异和多重尝试导致转写不可靠的问题,论文把判断改成音频与提示文本在共享空间的配对,用两组法语命名数据在留一说话人评估下报告最高 0.90 准确率,代价是仍需在失语数据上微调且重度损伤集上降到 0.85。

 · 更新于 2026-09-25 · 约 17 分钟 · 8130 字 阅读 →
论文解读

用颜色说情绪:把语音情绪变成可回归、可解释的色相、饱和度与明度

针对类别标签难表混合情绪、维度分数难直观解释的问题,该研究把日语表演性情绪语音标注为色相、饱和度、明度并用回归直接预测,留一说话人交叉验证下多任务学习在色相角误差约 29.7 度、饱和度与明度一致性相关系数约 0.560 与 0.803、六分类准确率 90.8% 上同时优于单任务,但结论限于表演性日语与小规模众包标注条件。

 · 更新于 2026-09-25 · 约 17 分钟 · 8482 字 阅读 →
论文解读

模态吵架时别硬拉齐:冲突加权交叉重构的共享语义对齐

针对同一视频中语言、视觉、音频情感极性不一致时相似性对齐会扭曲共享语义的问题,论文提出冲突感知自适应交叉重构 CACR,用共享空间冲突分数加权交叉重构实现隐式对齐并以视听线索精炼文本,在 MOSI 上报告 ACC7 为 48.69、ACC2 为 87.04,代价是需要多组重构解码器与多项正则损失协同训练。

 · 更新于 2026-09-25 · 约 18 分钟 · 8759 字 阅读 →
论文解读

没有文字转写时,如何用图像字幕把语音和书面词连起来

该文用图像字幕先建视觉词表再过滤语音,用无监督词发现做两两对齐与堆叠评分定位关键词,在视觉监督下超过神经基线,但共现词与字幕噪声仍带来明显定位损失与计算代价。

 · 更新于 2026-09-25 · 约 19 分钟 · 9158 字 阅读 →
论文解读

高阶全通 warping 下 DCT 合成滤波器为何能用凸最小二乘做到完全重建

针对高阶全通变换 DCT 分析合成滤波器组相位与混叠失真难以同时补偿的问题,论文用凸最小二乘直接求解 FIR 合成子滤波器系数,以完全重建设计实现全局最优,并以混叠受限的近完全重建设计换取更好的合成滤波器频率选择性。

 · 更新于 2026-09-25 · 约 21 分钟 · 10396 字 阅读 →
论文解读

用手势字幕补上语义:CoordSpeaker 如何让说话人边说边做指定动作

针对手势数据缺描述文本导致的语义先验缺口与音频加描述难以协调控制的问题,CoordSpeaker 先用动作语言模型离线生成多粒度手势字幕,再用统一表示的潜在扩散加分层去噪器实现语音节奏与字幕语义的联合生成,最强证据是推理耗时大幅下降与文本对齐指标领先,代价是部分重建指标未占优且长序列时序感知仍有限。

 · 更新于 2026-09-25 · 约 19 分钟 · 9508 字 阅读 →
论文解读

解码器才是瓶颈:冻结语音编码器与印度大模型做印英混读识别

针对印地语英语代码切换中声音对但文字错的问题,论文冻结语音编码器与指示大模型只训练 27.8M 瓶颈适配器,以 21.56% 词错误率与 20.69% 转写词错误率超过解码器微调基线,代价是依赖大模型词表与干净盲测集。

 · 更新于 2026-09-25 · 约 15 分钟 · 7235 字 阅读 →