论文解读

不为每句话建分布:DriftAudio 用边际漂移做一步音频的分布后训练

针对自由文本下每条条件只有极少真实样本而难以估计条件分布的问题,DriftAudio 保留文本条件生成而在冻结特征空间匹配边际分布,从 MeanAudio 出发把 FAD 从 1.68 降到 1.11、FD 从 15.43 降到 12.71,从 FdAudio 出发把 FAD 从 1.22 降到 0.99,代价是部分起点上的 IS 与 CLAP 出现回落。

 · 约 18 分钟 · 8952 字 阅读 →
论文解读

先压缩时间再做全局融合:MambaVoice 的轻量视听歌声分离

针对多人演唱与密集伴奏下的目标歌声分离,MambaVoice 用对数分频音频编码加面部动作门控做条件,再以先 Mamba 后 Transformer 的混合主干建模,报告在 Acappella 未见未闻测试上以 16.2M 参数取得 14.18 dB SDR,并在 URSing 跨域与推理耗时上给出对照,代价是强干扰下仍略低于 VoViT 基线且主观评测样本 …

 · 约 18 分钟 · 8736 字 阅读 →
论文解读

用一帧延迟换真流式:TinyCall 在 2.3 kbps 下的因果编码与标量量化安排

TinyCall 针对窄带应急语音在 2.3 kbps 下采用因果 SEANet 编码器加 Vocos 式频谱解码器与残差有限标量量化实现流式重建,流式相对离线仅从 PESQ 1.3197 降到 1.2994,但伪前视引入一帧算法延迟且未完全消除边界失真。

 · 约 20 分钟 · 9662 字 阅读 →
论文解读

把逐帧检索换成一步速度场:在 WavLM 空间学习 kNN 传输

该研究用条件流匹配网络回归 kNN 生成的源到伪目标位移,以交叉注意力与 FiLM 注入目标说话人条件并比较三条高斯路径,在 LibriSpeech 上以单步推理改善可懂度与估计质量,代价是目标说话人验证相似度低于 kNN 与音素幻觉器。

 · 约 14 分钟 · 6862 字 阅读 →
论文解读

不重编音频也能验声:复用编码器状态删掉无据事件提及

针对大音频语言模型在字幕中提到输入中不存在声音事件的问题,REVE 复用目标模型已算出的编码器帧状态做两尺度验证,在 AudioSet 上开发集召回约束下删掉 92.9% 无据提及,只增加 3.38M 参数和 0.57 ms 完整验证延迟。

 · 约 16 分钟 · 7925 字 阅读 →
论文解读

边想边说:用异步进度语音盖住推理静音的口语模型

针对串行先想后说导致长时间无声等待的问题,该工作用推理主路加轻量报幕支路的异步结构,在保持串行推理问答精度基本相当的同时,把用户可感知的静音大幅压低,代价是需要额外的报幕生成与动态调度。

 · 约 18 分钟 · 9015 字 阅读 →
论文解读

先分对白再分音乐音效:LiteCASS 用两级子带 U-Net 做立体声实时分离

针对立体声电影音频要同时分出对白、音乐、音效并保住空间感的问题,LiteCASS 用确定性子带重排加两级紧凑 U-Net 做掩码分离,在 DnR v3 立体声扩展上以 1.06 M 参数和 0.72 G 每秒运算量取得平均 SI-SDR 最高,代价是语音感知指标仍落后于更大基线与视觉辅助系统。

 · 更新于 2026-09-24 · 约 19 分钟 · 9469 字 阅读 →
论文解读

在只允许二维卷积的神经形态芯片上做音视融合:NAVIR 的分解与受限解码

针对工业噪声下纯音频识别崩溃的问题,NAVIR 用逐帧空间编码加时序卷积的分解结构适配 BrainChip AKD1000,在 GRID 噪声测试下量化融合模型取得未见说话人 14.0% 与重叠说话人 3.3% 词错率,代价是未见说话人纯唇读仍高达 35.3% 且音视模型在片上吞吐下降。

 · 更新于 2026-09-24 · 约 17 分钟 · 8497 字 阅读 →
论文解读

共享一块做精修:ADER 用早停深度与单专家适配省掉冗余迭代

针对固定深度对所有语音做同样多次精修的浪费,ADER 用共享 TS-Transformer 块循环精修并以深度控制器硬早停加每步单专家残差适配,在 VCTK-DEMAND 上以平均 2.15 次迭代达到 WB-PESQ 3.37,代价是相对固定 3 步共享块仍有约 2.6% 的感知质量下降。

 · 更新于 2026-09-24 · 约 17 分钟 · 8386 字 阅读 →
论文解读

不碰权重只改掩码:BLINC 用盲估计双峰分布做免训练校准

针对掩码型语音增强在域偏移下掩码双峰性退化的问题,BLINC 冻结模型并用直方图匹配把预测掩码重映射到由含噪信号盲特征决定的双峰目标分布,在几乎不增加耗时的条件下提升了感知质量,但以信号级指标下降和无法修复排序错误为代价。

 · 更新于 2026-09-24 · 约 15 分钟 · 7245 字 阅读 →
论文解读

把二次方的强制对齐压进终端设备:原地计算与可解释剪枝

针对长语音强制对齐的二次方内存与时间瓶颈,论文用分治原地计算的赫希伯格维特比算法保证结果不变,再用随机游走先验加转写精度界做剪枝,三小时音频在单核中央处理器上以兆字节级内存完成对齐,剪枝后进一步提速但依赖精度假设。

 · 更新于 2026-09-24 · 约 19 分钟 · 9476 字 阅读 →
论文解读

用圆环记时间:CircleMatch 以千级参数做关键词识别

CircleMatch 针对极小参数关键词识别,用分频带压缩编码加每类 5 个原型匹配,再以无参数圆环统计与有序路径分数汇总时序,在 GSC 与 MSWC 多词表上以约 1k-10k 参数取得可比精度,代价是大词表与大模型绝对精度仍占优且部分对比协议并不一致。

 · 更新于 2026-09-24 · 约 23 分钟 · 11158 字 阅读 →
论文解读

冻住检测器再多算一遍:CoReLoop 如何把循环输入做对

针对未见攻击泛化难且不扩充数据、不改动原参数的问题,CoReLoop 用 LoopBridge 构造循环输入、循环 LoRA 加门控更新与 ExitBridge 对齐分类器,在 14 个跨域测试集上 24 层模型以约 10M 可训练参数把池化等错误率从 4.85% 降到 3.74%,自适应停止以平均 1.18 次通过达到 3.73%,代价是第二次通过仍需完整 …

 · 更新于 2026-09-24 · 约 9 分钟 · 4181 字 阅读 →
论文解读

把帧率压到八分之一:TurboCTC 如何用块内降采样换速度

该文用 16 层 Conformer 编码器加 CTC 解决英文短语音转写,在仅公开数据与三阶段训练下以 470M 参数进入 OpenASR 速度精度前沿,代价是依赖大幅降采样与 16K 子词建模。

 · 更新于 2026-09-24 · 约 17 分钟 · 8333 字 阅读 →
论文解读

小容量不靠看得远:固定感受野与梅尔细节约束的紧凑合成

针对约 265K 参数的紧凑声学模型,论文用感受野对照证明超过 15 个音素的编码器上下文无一致收益,再用梅尔适配的梯度方差损失恢复细节,在同等预算下把 UTMOS 从 3.591 提升到 4.086,代价是大模型在可懂度和频谱失真上仍占优且结论限于 LJSpeech 自动指标。

 · 更新于 2026-09-24 · 约 21 分钟 · 10114 字 阅读 →
论文解读

两个老师教一个流式编码器:在保住健康语音的同时听懂电子喉

针对电子喉语音与健康语音域失配且大模型难流式部署的问题,论文用冻结自监督模型的离散音素目标加电子喉微调识别模型的瓶颈特征做三阶段渐进蒸馏,最好的 Mel-Conformer 把电子喉词错误率从最强零样本基线的 39.3% 降到 21.2%,代价是仍需平行语料做对齐且只用识别探测验证,ONNX 单核实时率为 0.30。

 · 更新于 2026-09-24 · 约 21 分钟 · 10171 字 阅读 →
论文解读

各层残差变化不同速,为何还要共用同一切分:LACE 的逐层压缩

针对多码本残差量化各层共享切分会留下不可消除的压缩误差问题,LACE 在每层独立压缩并用并集对齐与边界锚点解决时长不一致,重建与 TTS 实验显示其在相近码率下改善质量但对齐会抬高有效帧率。

 · 更新于 2026-09-24 · 约 17 分钟 · 8057 字 阅读 →
论文解读

数据不够时别先加模型:无人机声音分类里方法缩放胜过模型缩放

在 3100 段 31 类无人机音频上,论文系统比较卷积与 Transformer 架构加全量微调与四种参数高效微调,最强证据是 EfficientNet-B7 批归一化微调加三倍增强取得最高验证精度且只训练极小比例参数,而轻量卷积在精度与训练效率上普遍优于 Transformer。

 · 更新于 2026-09-24 · 约 22 分钟 · 10986 字 阅读 →
论文解读

对齐与开销分开算:TTM-Bench 如何让异构文本音乐系统可比

针对文本到音乐系统条件格式与访问方式不同难以直接比较的问题,TTM-Bench 用共享音乐规格加系统适配表达分别度量音乐内容对齐与计算效率,案例研究显示内容对齐更高并不系统性对应更低的计算需求。

 · 更新于 2026-09-24 · 约 18 分钟 · 8901 字 阅读 →
论文解读

全上下文能听准却不能边听边写:缓存感知与解码时浅融合如何让泰语流式识别可用

针对开放泰语识别被离线模型主导而真流式时崩溃的问题,论文用缓存感知编码器恢复流式能力并在解码时做浅融合来引导词汇,在 1 秒前视下把字符错误率降低约 4.5 倍并把关键词召回从 16.6% 提升到 20.7%,额外开销不足 3%。

 · 更新于 2026-09-24 · 约 18 分钟 · 8769 字 阅读 →