小参数做音频问答:Samsone 用裁词表与减层数换端侧可运行
Samsone 针对端侧音频问答,用 Whisper-Tiny 编码器加 SmolLM2 解码器与非线性映射器做单阶段训练,在 MMAU 与 MMAU-Pro 上超过同级小模型并接近部分大模型,代价是通用语言能力下降且未做移动端硬件级优化。
Samsone 针对端侧音频问答,用 Whisper-Tiny 编码器加 SmolLM2 解码器与非线性映射器做单阶段训练,在 MMAU 与 MMAU-Pro 上超过同级小模型并接近部分大模型,代价是通用语言能力下降且未做移动端硬件级优化。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
针对班巴拉语 32 小时监督数据的离线解码任务,BaldWhisper 先把 Whisper-base 解码器 6 层按相邻对加权融合为 3 层并做知识蒸馏,再把共享输入输出嵌入矩阵做秩 96 低秩分解加特征蒸馏,最终在保持基线约九成性能的同时把体积缩小约一半并把解码速度提高到两倍以上,代价是词错误率从基线水平上升数个百分点。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对全模态大模型音频加视频序列过长问题,OmniZip 用免训练的音频引导加交错时空压缩做推理时剪枝,最强证据是在 Qwen2.5-Omni 上保持接近满词元精度的同时实现 2.51-3.42×预填充加速与约 10G 显存下降,代价是剪枝率需按任务平衡且依赖音频编码器注意力。
论文以 Whisper-small 为对象,用梯度与 Fisher 灵敏度定位可剪部位并做无微调一次幅度剪枝,最强证据是解码器自注意力 50% 稀疏度在 LibriSpeech test-other 上绝对词错误率下降 2.38%,代价是解码器前馈与早期解码器层在同等稀疏度下灾难性退化且全局均匀剪枝在 40% 附近崩溃。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对基于扩散变换器的语音合成推理太慢的问题,论文用时间跳过与分支跳过复用已算结果,并经三阶段校准在保持可懂度和相似度下把计算量与实时率明显压低,而代价是阈值过高后音质会退化。
把文本解码器的 DiscoGP 搬到 HuBERT 与 Wav2Vec 2.0 上做分类电路发现,用冻结与随机对照验证预训练计算的作用,并以砍掉 QKV 残差把边发现显存从四次降到三次,代价是部分任务仍需保留 MLP 残差与早停。
该工作用迭代局部幅度剪枝去掉 90% 可剪枝权重,并以只遍历非零权重的自研中央处理器稀疏引擎在 48 kHz 与 256 采样块下把实时因子压到约 0.6 实现实时运行,代价是超出感受野的长混响尾音误差增大与高增益下和输入无关的噪声嗡声无法复现。
针对 Qwen3-ASR-0.6B 的 18 层音频编码器,X-AuT 用短预算行为探针选择可恢复层组合,再经表示对齐、跨尺度蒸馏与 LoRA 微调分两跳压到 14 层,单次运行显示 16 层宏平均误差从 5.61% 降到 5.27%,14 层为 5.75% 且音频塔参数减少 20.7%。
针对语音分离模型分离网络最重、均匀剪枝易伤轻层的矛盾,SepPrune 用结构分析定位、可微掩码选通道、剪后微调恢复的分布优化,在三数据集多骨干上降低参数与计算量,而一轮微调即可恢复大部分性能,但大幅剪枝时恢复速度因结构而异。
模型剪枝 | 8.4/10
音视频理解 | 8.1/10
说话人验证 | 6.0/10
音频生成 | 7.6/10
模型剪枝 | 5.9/10