论文解读

低码率下保真与语义难两全:非对称双量化如何分开处理内容与细节

针对 1.5 kbps 下多层残差量化误差累积与单码本语义稀疏问题,SACodec 用冻结 mHuBERT 语义锚定加 SimVQ 残差激活的非对称双量化,在 LibriTTS 与 LJSpeech 上取得接近真值的主观重建分并保留语义,代价是仍限于英语朗读语料与两路量化结构。

 · 更新于 2026-09-25 · 约 18 分钟 · 8761 字 阅读 →
论文解读

信息不均匀时不再平均分配:用聚类定长短、用索引记时长

针对固定帧率对静音与稳态元音浪费而对快速过渡欠分配的问题,VARSTok 用时间感知的密度峰聚类做变长切分并用扩展索引隐式编码时长,在平均 30.95 Hz 下重建 UTMOS 达 3.8949 超过 40 Hz 固定基线,但更低码率与说话人相似度上仍有代价。

 · 更新于 2026-09-25 · 约 16 分钟 · 7911 字 阅读 →
论文解读

给黑盒声码器加先验:低频子带引导与按能量加权的相位监督

针对梅尔声码器黑盒预测丢失频谱细节与相位包裹难监督的问题,SCNet 用低频子带先验耦合到逆变换主干并以幅度加权相位损失训练,在域内与跨说话人测试及 CosyVoice 合成中报告更高质量,但合成速度不及 Vocos 且通用音频能力待验证。

 · 更新于 2026-09-25 · 约 18 分钟 · 8539 字 阅读 →
论文解读

东南亚语音评测为何难做:长音频定位与低资源提示的双重缺口

针对 11 种东南亚语言语音理解评测缺失问题,论文构建 97,194 样本与 597 小时音频的 9 任务基准并统一双语提示与归一化,最强证据是时间定位与情感识别全面偏低且缅甸语等低资源提示落后英文可达 41 个百分点,代价是长音频覆盖过度与拒答等边界行为仍需专门处理。

 · 更新于 2026-09-25 · 约 20 分钟 · 9551 字 阅读 →
论文解读

按语义密度生成:SEAM 用编解码对齐弥合语音与文本的粒度差

针对语音按时长定速、文本按语义变长造成的分布失配,SEAM 用冻结编码器加可训练交叉注意力解码器做变速率对齐并分三阶段训练加首词引导,在仅用 LibriSpeech960 小时训练时取得 2.6%/5.2% 与跨域 TED-LIUM-v2 上 4.7% 词错率,代价是两段自回归带来的推理延迟。

 · 更新于 2026-09-25 · 约 16 分钟 · 7975 字 阅读 →
论文解读

先找重层再剪通道:SepPrune 为语音分离模型省算力的三步剪枝

针对语音分离模型分离网络最重、均匀剪枝易伤轻层的矛盾,SepPrune 用结构分析定位、可微掩码选通道、剪后微调恢复的分布优化,在三数据集多骨干上降低参数与计算量,而一轮微调即可恢复大部分性能,但大幅剪枝时恢复速度因结构而异。

 · 更新于 2026-09-25 · 约 17 分钟 · 8155 字 阅读 →
论文解读

从单人情绪标签转向多人声音互动场:耦合只在共同在场时出现

该文把情感计算的主单元从个人状态改为多人声音构成的互动场,用 WavLM 连续表征加零校准的格兰杰方向耦合检验,在 AMI 四人会议上显示微秒级重叠语音有约加 6.6 至加 7.4 个百分点的超额拒绝而独占语音趋近于零,代价是宏观尺度样本不足且只在 AMI 内验证。

 · 更新于 2026-09-25 · 约 18 分钟 · 8971 字 阅读 →
论文解读

先剪掉噪声再识别:语音感知的长上下文剪枝与融合

针对会议幻灯 OCR 等长而 noisy 的上下文导致识别偏置词困难的问题,论文用两阶段剪枝加语音驱动池化先筛关键词再做识别,在 SlideSpeech 上报告 WER 7.71% 并在 LibriSpeech 上报告 WER 1.12%,代价是两阶段流水线与池化压缩带来的实现复杂度。

 · 更新于 2026-09-25 · 约 21 分钟 · 10216 字 阅读 →
论文解读

固定模长换可预测性:SphereVAE 把连续语音表示压到球面上治自回归漂移

针对连续语音表示自回归预测中误差沿时间累积导致的隐变量漂移问题,SphereVAE 用单位超球面 Power Spherical 隐空间固定模长只留方向变化,在重建指标低于标准 VAE 的代价下,在 VoxCPM 零样本合成中取得英文 5.305% 词错误率与中文 1.141% 字错误率的最低内容错误并在长文本中保持更高的说话人相似度。

 · 更新于 2026-09-25 · 约 20 分钟 · 9812 字 阅读 →
论文解读

流式对齐语音切分:在块边界上把声音逐字贴到文本子词

StreamAlign 针对离线文本对齐切分必须等整句和词级复制丢失细节的问题,用词级流式识别引导字符级 RNN-T 对齐再聚合成大模型子词单元,在 LibriSpeech 上报告重建 WER 4.41 和 UTMOS 4.23,同时主动词边界判断把延迟从 560 ms 降到 270 ms,代价是说话人相似度等相似性指标未占优且仅在英语朗读类数据上验证。

 · 更新于 2026-09-25 · 约 19 分钟 · 9072 字 阅读 →
论文解读

把扩散模型变成流水线:滚动去噪如何实现连续随语音手势

该文把随语音手势生成改成随音频推进的滚动扩散窗口,用逐帧递增的噪声排布和一次性解码多帧的梯子加速,在 ZEGGS 与 BEAT 上提升连贯性与多样性,代价是梯子步长增大时在表现力强的数据上会出现平滑与抖动问题。

 · 更新于 2026-09-25 · 约 19 分钟 · 9360 字 阅读 →
论文解读

流式生成三维说话脸:用自回归条件约束轻量扩散头

针对整序列扩散在超长语音上泛化下降与延迟随长度增长的问题,该文用固定窗口历史运动加当前音频生成动态条件,再用单层扩散头逐帧去噪,在 BIWI 长序列与消融对照上显示出同步与稳定优势,但短序列口型开合仍有可比基线。

 · 更新于 2026-09-25 · 约 19 分钟 · 9053 字 阅读 →
论文解读

换一种说法、换一种声音,对齐就松动:StyleBreak 的风格化音频越狱

论文针对大音频语言模型的黑盒音频越狱问题,用两阶段语言与声学风格变换加查询自适应策略搜索 70 种风格组合,在 4 个开源模型和 2 个商用模型上验证了情感、年龄、性别扰动能提升越狱成功率,代价是需要可控 TTS 与多次查询评估。

 · 更新于 2026-09-25 · 约 20 分钟 · 9712 字 阅读 →
论文解读

不用教师也能学轨迹跳转:自蒸馏一致性轨迹的快速语音增强

针对扩散增强推理步数多、原有 SBCTM 依赖预训练教师的问题,该工作用学生自身的 EMA 拷贝生成轨迹目标并配合三阶段课程,在相同 NCSN++ 骨干上以两步几何调度达到 PESQ 3.01、SI-SDR 19.07 dB,代价是 PESQ 仍低于直接优化 PESQ 损失的教师模型。

 · 更新于 2026-09-25 · 约 17 分钟 · 8276 字 阅读 →
论文解读

文本有感情,声音不一定跟:跨模态情感相关的限度

论文用 8 个大语言模型读文本情感与 2 个音频模型听语音情感,在播客、有声书和 TED 演讲三类数据上按效价、唤醒度、优势度算皮尔逊相关,最强证据是效价相关可达 0.6 以上而唤醒度和优势度普遍偏低,且加上下文也不能稳定提升,代价是后两类数据集只能用音频模型预测代替人工标注。

 · 更新于 2026-09-25 · 约 20 分钟 · 9636 字 阅读 →
论文解读

模态吵架时别硬融合:TiCAL 用典型性估计一致性再分阶段学习

针对同一视频中文本、视觉、音频情感倾向不一致的问题,TiCAL 先用高置信锚表生成单模态伪标签并在双曲空间结构化,再用典型性和一致性做三阶段动态融合,在 MOSI 上报告 Acc-2 为 88.10,代价是需要完整三模态和多阶段调参。

 · 更新于 2026-09-25 · 约 16 分钟 · 7558 字 阅读 →
论文解读

打乱顺序仍能听对:语音模型依赖局部特征与冗余线索

针对音频对抗样本跨模型迁移弱的问题,论文先用时间打乱与可解释性热图证明三类语音模型依赖局部时序与冗余特征,再提出可叠加的时间打乱梯度增强框架,在九个模型上取得更强的迁移效果,但粒度错配与权重过大会带来波动与额外开销。

 · 更新于 2026-09-25 · 约 16 分钟 · 7967 字 阅读 →
论文解读

从直接配音到导演-演员磨合:用检索增强补情感功课的配音模型

针对仅对目标语句做跨模态建模导致情感表达不足的问题,论文用多模态参考片段库加情感相似检索与渐进图融合来模拟导演给素材、演员逐步内化的流程,在 V2C-Animation 上把情感准确率做到 47.21%,代价是需要维护检索库并做三阶段图编码。

 · 更新于 2026-09-25 · 约 19 分钟 · 9141 字 阅读 →
论文解读

用可训练插值对齐脑电、以双路编码放大目标差异的目标说话人提取

针对脑电与语音采样率不对齐且单路编码只看目标相关特征的问题,TIDENet 用可训练转置卷积做脑电重采样、用结构共享双路编码分别建模相关与无关特征,在 Cocktail Party 和 AVED 上取得最高的 SDR、SI-SDR、STOI、ESTOI 和 PESQ,但单加语音双路时增益有限且 ESTOI 最优变体不是全量模型。

 · 更新于 2026-09-25 · 约 21 分钟 · 10280 字 阅读 →
论文解读

临床抑郁评估:行为信号能判病,大模型推理为何还差一截

论文用 169 人临床确诊的多任务多模态数据比较任务与模态的判别力,并测试大模型精神科推理,报告音频与视频最有效、图片描述最能诱发标记、知识引导可提升约 10 个百分点 Macro-F1,但文本大模型仍落后于监督判别模型。

 · 更新于 2026-09-25 · 约 17 分钟 · 8236 字 阅读 →