论文解读

文字分高不等于还在听波形:一次 Qwen2-Audio 量化的三路核对

论文以 Qwen2-Audio 为案例分离词汇输出、转录不足的波形依赖行为与打包实现测量,显示 6 比特翻译选中分配在冻结重放上 chrF 提升但情绪识别下降,而反例与对照说明文本分不能替代波形使用证据。

 · 约 15 分钟 · 7118 字 阅读 →
论文解读

4 比特保翻译、3 比特现悬崖:Diet-KIT 如何把 16 GB 语音大模型压进 4 GB

针对 Qwen2-Audio-7B 语音翻译压缩到 4 GB 磁盘的问题,Diet-KIT 用 HQQ 分组量化打底、嵌入低比特加敏感度选层补足、AWQ 校准收尾,在 ACL 60/60 上以 3.98 GB 取得 en→de COMET 74.4、en→zh 77.1,代价是全模型统一 3 比特会使 BLEU 与 COMET 断崖式下跌。

 · 更新于 2026-09-24 · 约 17 分钟 · 8127 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

2 比特是膝点:说话人确认中量化误差从哪里来、如何翻转判决

该文用均匀 K 均值量化感知训练在 ResNet-36 与 ResNet-200 上定位 2 比特为主要退化区间,以分数漂移与阈值附近有害翻转解释退化,并用 2/3/4 比特校准级联在接近 FP32 性能下降低平均计算代价,但三模型常驻带来内存代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10370 字 阅读 →
论文解读

加密音频也要算频谱:用近似短时傅里叶把量化误差让给比特预算

论文把短时傅里叶、Mel、倒谱和 Gammatone 直接搬到全同态加密上,用膨胀、贫民变换等近似降低累加器位宽,在 VocalSet 和 OxVoc 上把描述符统计错误率从常规方法的 5.9% 和 6.5% 降到膨胀 4 倍时的 4.7% 和 1.9%,代价是 64 毫秒音频加密计算约 12970 秒且高频谐波丢失。

 · 更新于 2026-09-24 · 约 17 分钟 · 8157 字 阅读 →
论文解读

压哪里比压多少更关键:只压 MLP 投影的编解码压缩

该研究固定 Qwen2-Audio-7B-Instruct 做受限英译中语音翻译,只对 gate_proj、up_proj 和 down_proj 做有损量化加无损 Zstandard 压缩,本地 416 条对比中 q3 加 Zstd 以 0.7767 的 COMET 最接近 0.7792 的基线而体积降到 10.312 GB,q2 加 Zstd 以 …

 · 更新于 2026-09-24 · 约 17 分钟 · 8375 字 阅读 →
论文解读

Data Scale, Not Latency, Shapes Cross-Lingual Encoder Transfer in Streaming ASR

语音识别 | 9/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6751 字 阅读 →
论文解读

FormalASR: End-to-End Spoken Chinese to Formal Text

语音识别 | 8.2/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7790 字 阅读 →
论文解读

FormalASR: End-to-End Spoken Chinese to Formal Text

语音识别 | 6/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7432 字 阅读 →
论文解读

Adaptive Regularization for Sparsity Control in Bregman-Based Optimizers

Adaptive Regularization for Sparsity Control in Bregman-Based Optimizers

 · 更新于 2026-09-24 · 约 16 分钟 · 7952 字 阅读 →