论文解读

不用教师也能学轨迹跳转:自蒸馏一致性轨迹的快速语音增强

针对扩散增强推理步数多、原有 SBCTM 依赖预训练教师的问题,该工作用学生自身的 EMA 拷贝生成轨迹目标并配合三阶段课程,在相同 NCSN++ 骨干上以两步几何调度达到 PESQ 3.01、SI-SDR 19.07 dB,代价是 PESQ 仍低于直接优化 PESQ 损失的教师模型。

 · 更新于 2026-09-24 · 约 17 分钟 · 8276 字 阅读 →
论文解读

视频推理为何仍贵:沿采样编码连接器与解码四段查开销

该综述把视频大模型开销定位到帧选择、编码器、连接器压缩与大模型预填充解码四段,显示约 25 % 视觉 token 保留下多类方法接近基线精度,而推到约 10 % 保留与流式内存时必须显式建模时间冗余并计入选择器与编码代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10163 字 阅读 →
论文解读

先出声再等文本:用原生语音令牌在波形之前跟踪读到哪

增量文本流式语音合成需要在线知道说到原文何处,X2-NativeCursor 用原生语音令牌加局部匹配做可修正估计再输出单调光标,在 80 毫秒前视下中文平均绝对误差 0.151 字,对比在线波形基线 320 毫秒前视下 1.253 字,代价是每个主干需单独训练观察器且对未见音色敏感。

 · 更新于 2026-09-24 · 约 19 分钟 · 9189 字 阅读 →
论文解读

不对称残差融合能否替代双向跨模态 Transformer:RAFM-SER++ 的轻量化权衡

RAFM-SER++ 以文本为查询、语音为键值的单向残差注意力替代双向跨模态 Transformer,结合 BYOL 式对齐与注意力池化,在 IEMOCAP 上达到 81.10% BACC、ESD 上 95.39% BACC,同时将可训练参数从 8.9M 降至 3.6M 并提升推理吞吐。

 · 更新于 2026-09-24 · 约 20 分钟 · 9994 字 阅读 →
论文解读

轻量时序建模如何兼顾精度与跨库泛化:SETEAB 的下采样、通道校准与双向加权融合

针对语音情感识别中时序依赖不稳定与计算冗余问题,SETEAB 在 TIM-Net 基础上引入深度可分离下采样、SE-Res2Block、TEAB 与全局加权双向融合,在 5 个库平均上以 0.06 - 0.12 GFLOPs 实现 47.69% UA 与 45.23% F1,并在跨库平均 WA 上达到 37.53% 且保持 0.4 - 0.5M 参数量级。

 · 更新于 2026-09-24 · 约 19 分钟 · 9189 字 阅读 →
论文解读

先定语义再补声音:TontaubeV1 用分层编解码与有界上下文做流式语音合成

TontaubeV1 把 12.5 Hz 分层编解码的语义流交给大模型定韵律与时长、三个小模型逐层补声学细节,并用配对边界与有界窗口做长文本流式合成,代价是四阶段串行与非因果解码需二次转码,在 400 段英文有声书评测中韵律与 ElevenLabs Flash v2.5 持平并领先其余三家。

 · 更新于 2026-09-24 · 约 18 分钟 · 9018 字 阅读 →
论文解读

不用时间刻度做修复:判别表示如何指示流匹配的剩余路程

论文针对修复任务中全局时间 t 无法刻画样本相关退化程度的问题,提出以冻结判别编码器表示替代时间条件来驱动流匹配速度场,在语音增强上报告了可复核的提升,并以额外编码器开销和自适应推理换取计算节省。

 · 更新于 2026-09-24 · 约 21 分钟 · 10282 字 阅读 →
论文解读

无相位也能低延迟重建语音:EffVOC 把窗长钉在 20 毫秒

EffVOC 用因果卷积加 LSTM 的上采样声码器从幅度谱或 Mel 系数直接重建宽带与全频带波形,在 20 毫秒算法延迟下宽带 MOS 达到 4.17 与 4.15、全频带达到 4.14 与 4.11,代价是更高帧率带来的计算量与对短窗高重叠的依赖。

 · 更新于 2026-09-24 · 约 17 分钟 · 8255 字 阅读 →
论文解读

在标准 vLLM 上跑实时对话语音:GEPARD 把定制算子移出解码循环的取舍

GEPARD 为实时对话把文本与 32 通道 GroupFSQ 音频在同一标准全注意力 Transformer 中联合自回归生成并用 NanoCodec 流式解码,以 vLLM 原生可服务为首要约束,通过 prefill 前缀克隆、单步并行采样与 DPO 蒸馏 CFG 实现单流 RTF 约 0.067 与 256 并发约 204 倍加速,代价是帧级并行带来的 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10716 字 阅读 →
论文解读

多深度谐波卷积如何让乐器无关转录在小参数下仍保持高帧精度

针对单乐器身份未知的乐器无关转录,Harmonica 以 CQT 输入与多深度谐波卷积在多源温度采样训练下实现 26.3K 至 15.1M 的规模化,x-large 在多数测试集上取得最高帧 F1,medium 以 848.5 倍实时保持可比精度,nano 以 1622.5 倍实时仍显著超过同量级基线。

 · 更新于 2026-09-24 · 约 21 分钟 · 10282 字 阅读 →
论文解读

把伦巴德效应拆成三层:说话人、音素与帧如何各管一摊

针对正常到伦巴德语音转换中风格与说话人、内容纠缠的问题,ProLombard 用对齐说话人编码、音素级去风格与再注入、VQ 中值下采样三层结构建模,在中英文数据上提升了可懂度和伦巴德相似度,代价是推理仍需目标噪声等级且与真实伦巴德仍有差距。

 · 更新于 2026-09-24 · 约 24 分钟 · 11554 字 阅读 →
论文解读

热启动之后再听一次:用隐状态夹角找出语义词并只在那里纠错

论文在 LoRA 适配的 ASR-LLM 中复用基座 LLM,以对应层隐状态的余弦相似度和范数比定位需语义纠错的词;单遍混合解码的平均实体错误率为 18.38%,有效搜索宽度约为贪心的 1.4 倍,双遍精修则把波束基线的 18.29% 降到 17.69%,但其总计算成本与墙钟时间未量化。

 · 更新于 2026-09-24 · 约 16 分钟 · 7795 字 阅读 →
论文解读

连续编码表示上的分块解码:在一次前向与逐帧之间调节增强代价

论文把语音增强放在连续神经音频编解码表示上做掩码自回归建模,用同一 Conformer 和同一训练比较不同解码策略,在 Libri1Mix 上以 10 步取得介于非自回归与因果自回归之间的质量与算力,并以可听度指标接近非自回归基线。

 · 更新于 2026-09-24 · 约 18 分钟 · 8929 字 阅读 →
论文解读

不看未来也能补高频:StreamWSR 的因果波形超分

StreamWSR 把低采样语音先上采样再用全因果波形网络预测残差补高频,在 VCTK 三种带宽扩展设置下以 9M 参数和 2G FLOPs 达到与非流式基线相当的失真与可懂度,并用消融证明了帧级压缩与频谱判别器的作用。

 · 更新于 2026-09-24 · 约 17 分钟 · 8454 字 阅读 →
论文解读

用最轻的耳蜗换最高的精度:HLP 脉冲编码为何在干净数据上赢、在嘈杂数据上输

语音识别 | 6.8/10

 · 更新于 2026-09-24 · 约 26 分钟 · 12869 字 阅读 →
论文解读

在并行与记忆之间找缝隙:WhisperX 如何既跑得快又记得住

语音识别 | 7.4/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10440 字 阅读 →
论文解读

同一音高多条路:用扩散与可演奏约束把吉他谱写对、写得能弹

音乐转录 | 8.2/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11909 字 阅读 →
论文解读

1500 个音频 token 真的都需要吗?用等间隔抽样戳破 Whisper 的时域冗余

语音识别 | 7.2/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10278 字 阅读 →
论文解读

把截断搬进频域:用 sinc 重采样让振荡器同步不再混叠

音乐生成 | 7.9/10

 · 更新于 2026-09-24 · 约 7 分钟 · 3105 字 阅读 →
论文解读

把去噪塞进耳蜗编码器里:用稀疏脉冲换六倍能耗

语音增强 | 6.7/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8494 字 阅读 →