论文解读

混合不分离直接估计合成参数:扩散先验如何压住时间抖动

针对和声乐器混合的逐帧合成参数估计易出现时间抖动的问题,该文用乐谱条件扩散模型学习参数轨迹分布并以多尺度频谱重构误差引导逆扩散,在木管与弦乐合奏上改善了响度与音色特征并保留可复述的实验条件。

 · 更新于 2026-09-25 · 约 24 分钟 · 11741 字 阅读 →
论文解读

低延迟下还要能转向:FiLM-OSN 如何保住指向性与双耳关系

针对助听器 10 ms 延迟与头影效应下的可转向增强问题,论文提出 FiLM 条件化的 OnlineSpatialNet 与 IPD 相位保持损失,在 8 ms 窗条件下恢复指向性并在 PESQ/ESTOI/SI-SDR 上接近 32 ms 基线,代价是仍需固定主瓣宽度与衰减上限且依赖仿真 HARTF 训练。

 · 更新于 2026-09-25 · 约 19 分钟 · 9372 字 阅读 →
论文解读

把静态 NCERT 课本变成问答式视频:检索接地,生成管讲法与画面

该系统针对 NCERT 课本问答做个性化教学视频,用检索增强生成锁定课本依据并写出多场景脚本,再经 Stable Diffusion 配图、DynamiCrafter 做动效、Google TTS 配音并由 MoviePy 对齐合成,演示显示师生觉得比纯文本更易跟随,但原文只报告定性反馈而未给出可比的定量指标与对照代价。

 · 更新于 2026-09-25 · 约 21 分钟 · 10259 字 阅读 →
论文解读

一边听一边说还要实时写字:给全双工语音对话模型加一个并行流式识别头

针对全双工语音到语音模型缺用户侧流式转写的问题,论文在复用同一解码器大模型主干上并行增加轻量 ASR 头并用帧级强制对齐训练,在双工框架内报告平均 WER 为 10.21%,独立识别配置报告为 7.73%,代价是平滑轮转延迟上升与部分打断指标未占优。

 · 更新于 2026-09-25 · 约 22 分钟 · 10535 字 阅读 →
论文解读

从镜像情绪到调节情绪:ER-EDF 把感知与调节拆开做共情回复

针对语音共情对话中只做情绪识别就直接生成的问题,ER-EDF 用感知加规则调节再提示生成的链路组织回复,在 IEMOCAP 与 MELD 构造的两种共情参考上多数情况下提升共情指标,但高强度表演式对话与小模型接地能力仍是代价与边界。

 · 更新于 2026-09-25 · 约 22 分钟 · 10770 字 阅读 →
论文解读

语音大模型越靠近语言端病理线索为何越弱:编码器解码器与生成的分层核对

该工作在西班牙语德语捷克语帕金森语音上对比语音大模型的编码器表示解码器表示与零样本生成,报告编码器优于解码器而生成接近随机,并用样本自适应层聚合代替单层搜索,但跨语言绝对性能仍明显低于多语言混合训练。

 · 更新于 2026-09-25 · 约 19 分钟 · 9051 字 阅读 →
论文解读

声音已很强时,脸还能帮轮流说话预测多少

该文在约 400 小时面对面双人对话上把注视、头部、身体手部与面部动作单元接入语音活动投影模型,最优结构以交叉注意力加三帧差分与早期门控把语音活动投影损失从 2.166 降到 2.100,面部动作单元是最强的单一视觉组但全量组合仍最好,代价是需要多模态特征提取与更大的推理开销且划分不是按会话对隔离。

 · 更新于 2026-09-25 · 约 19 分钟 · 9331 字 阅读 →
论文解读

用固定维高斯包络驯服三角基:GTFLN 的局部化、优化与稳态误差

针对三角函数链非线性建模局部化不足的问题,该文用零中心高斯包络乘三角基构造固定维 GTFLN 并推导缩放参数局部优化的 OGTFLN 与稳态超量均方误差,最强证据是多组非线性系统辨识与回声对消和有源控制实验中更低的稳态误差和噪声残留,代价是 OGTFLN 求优化参数的额外计算量和对匹配次级通道等条件的依赖。

 · 更新于 2026-09-25 · 约 16 分钟 · 7590 字 阅读 →
论文解读

在可解码潜空间里做进化推断:祖先鸟声如何被生成出来

该文把鸟声编码到冻结语音潜空间后学习与系统发育距离对齐的低维性状投影,在性状空间做布朗运动祖先推断再经锚定逆提升解码为新波形,在两个支系上同时实现真实生成、系统发育一致与自然音质,但零空间纹理仍依赖现存录音锚点。

 · 更新于 2026-09-25 · 约 8 分钟 · 3558 字 阅读 →
论文解读

图注意力加什么都有用吗:LoRA 微调下语音防伪造后端的受控拆解

该研究把 AASIST2 图注意力层拆成打分对称性、温度可学习性与路由粒度三条残差分支,在统一 LoRA 条件下用五个评测集和五个随机种子检验,发现 LearnT 平均统一等错误率最优而 GATv2 与 LearnT 联用反而明显退化,说明分支之间是非可加的相互作用。

 · 更新于 2026-09-25 · 约 23 分钟 · 11325 字 阅读 →
论文解读

听不见还硬说:用冻结声学裁判在训练时管住语音大模型的插入幻觉

针对语音大模型强化学习只看文本词错率而放任语言先验补词的问题,该研究在训练期叠加冻结字符级 CTC 声学裁判做组内奖励,用一次贪心解码在 AMI 远场会议上把插入错误降低 22.3% 至 28.3%,代价是少量删除错误上升且只验证了单个 7B 策略与 0.3B 裁判组合。

 · 更新于 2026-09-25 · 约 22 分钟 · 10827 字 阅读 →
论文解读

说话人向量为何按性别国籍分层:用单链接聚类与匹配打开黑盒

该文用单链接层次聚类分析说话人向量是否形成层次结构,再以总体匹配与一一匹配加诊断性分数解释性别国籍与身份语义,最强证据是身份与性别接近完全对齐而部分国籍组合匹配明显偏低且可归因到精度不足。

 · 更新于 2026-09-25 · 约 15 分钟 · 7308 字 阅读 →
论文解读

去掉语言方向:用残差做未见语言的音频伪造检测

针对训练中完全没有目标语言的跨语言伪造检测,该文用源语言真话拟合从连续语种表征到语音表征的岭映射并取残差,在六语六骨干上报告平均 9–17% 相对收益,远距离迁移收益更大,但近距离个别组合出现反例。

 · 更新于 2026-09-25 · 约 18 分钟 · 8787 字 阅读 →
论文解读

在实测参数的琴弦上学运弓:隐式摩擦、修正的最小弓压与监督天花板的可测边界

论文用隐式求解的有限差分弓弦模型复现亥姆霍兹运动并修正最小弓压定律为一次方依赖,再以等容量的门控循环控制器在扰动下领先前馈控制器,但证明其稳态调节不超过查表教师,只在教师失效处反超。

 · 更新于 2026-09-25 · 约 19 分钟 · 9432 字 阅读 →
论文解读

气道狭窄听得出来吗:冻结语音基础模型加多任务聚合的筛查路径

该研究把气道狭窄检测做成患者级多录音分类,用冻结的 WavLM 第 15 层表示加 TransMIL 聚合,在 748 人五折交叉验证中报告 AUROC 为 0.952 与准确率为 0.924,而细粒度分型与严重度分级仍明显更难。

 · 更新于 2026-09-25 · 约 21 分钟 · 10216 字 阅读 →
论文解读

语音问答记住了不该记的事实:切断声学理解与隐私记忆的四种遗忘路径

论文在语音问答大音频语言模型上对比梯度上升、任务算术与两种拒答对齐遗忘方法,报告在中度记忆检查点上可把隐私泄露率降低约 80% 且非隐私问答基本保持,但压到接近零泄露时非隐私准确率必然明显下滑。

 · 更新于 2026-09-25 · 约 20 分钟 · 9634 字 阅读 →
论文解读

只标一个单日单点,靠无标注声音把时频框撑到新天新点:MAST 的三段做法

针对标注少且跨天跨点易失效的动物声音时频框检测,MAST 用域内掩码预训练加适配检测器再加两阶段自训练,在雨林和鸟类两域的分布外评测上提升 F1 与 mAP,代价是第二轮后域内精度波动与更大计算量。

 · 更新于 2026-09-25 · 约 19 分钟 · 9151 字 阅读 →
论文解读

不增加解码开销的领域适应:把目标域语言模型加进语音识别的参数里

针对配对语音文本不足的目标域,该研究把同一基座大模型微调得到的目标域语言模型适配器直接加到语音识别模型参数上,在日语和英语的领域适应中报告了目标域改善,且推理时只跑单个识别模型。

 · 更新于 2026-09-25 · 约 22 分钟 · 10584 字 阅读 →
论文解读

把笑声叹息放进指定位置:连续隐变量、长尾补数据与多指标选样的可控语音

为在指定文本位置可靠生成 16 类非言语发声,该工作用连续隐变量 DiTAR 加专用标签与停顿判别建模,以双语预训练加针对性合成与频率重采样补长尾,再用解码参数搜索与五选一多指标选样提升鲁棒性,最终以双语加权 62.786 获 Track 2 总分第一,代价是额外推理计算与英文控制仍待加强。

 · 更新于 2026-09-25 · 约 20 分钟 · 9653 字 阅读 →
论文解读

秒级对齐加软标签:AVNet 如何让声音与画面在缺模态时仍能互补

针对救护车、消防车、警车与道路背景四分类问题,AVNet 用逐秒对齐的视频查音频交叉注意力做融合,并用单模态教师的软分布蒸馏融合分支,在 281 个 AudioSet 测试片段上融合达到 66.6%,但消防车出现融合低于纯音频的反例且模型容量受限于 D 等于 128。

 · 更新于 2026-09-25 · 约 18 分钟 · 8553 字 阅读 →