论文解读

小参数做音频问答:Samsone 用裁词表与减层数换端侧可运行

Samsone 针对端侧音频问答,用 Whisper-Tiny 编码器加 SmolLM2 解码器与非线性映射器做单阶段训练,在 MMAU 与 MMAU-Pro 上超过同级小模型并接近部分大模型,代价是通用语言能力下降且未做移动端硬件级优化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8844 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
论文解读

只有 32 小时班巴拉语数据时,把解码器对折而不砍掉

针对班巴拉语 32 小时监督数据的离线解码任务,BaldWhisper 先把 Whisper-base 解码器 6 层按相邻对加权融合为 3 层并做知识蒸馏,再把共享输入输出嵌入矩阵做秩 96 低秩分解加特征蒸馏,最终在保持基线约九成性能的同时把体积缩小约一半并把解码速度提高到两倍以上,代价是词错误率从基线水平上升数个百分点。

 · 更新于 2026-09-24 · 约 19 分钟 · 9131 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

听音再剪视频:OmniZip 用音频保留率动态分配视频剪枝

针对全模态大模型音频加视频序列过长问题,OmniZip 用免训练的音频引导加交错时空压缩做推理时剪枝,最强证据是在 Qwen2.5-Omni 上保持接近满词元精度的同时实现 2.51-3.42×预填充加速与约 10G 显存下降,代价是剪枝率需按任务平衡且依赖音频编码器注意力。

 · 更新于 2026-09-24 · 约 21 分钟 · 10273 字 阅读 →
论文解读

剪掉反而更准:解码器自注意力与深层编码器的冗余在哪里

论文以 Whisper-small 为对象,用梯度与 Fisher 灵敏度定位可剪部位并做无微调一次幅度剪枝,最强证据是解码器自注意力 50% 稀疏度在 LibriSpeech test-other 上绝对词错误率下降 2.38%,代价是解码器前馈与早期解码器层在同等稀疏度下灾难性退化且全局均匀剪枝在 40% 附近崩溃。

 · 更新于 2026-09-24 · 约 17 分钟 · 8301 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

不训练也能加速语音扩散模型:先标出冗余再逐对校准

针对基于扩散变换器的语音合成推理太慢的问题,论文用时间跳过与分支跳过复用已算结果,并经三阶段校准在保持可懂度和相似度下把计算量与实时率明显压低,而代价是阈值过高后音质会退化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8816 字 阅读 →
论文解读

语音编码器里也有极小电路:联合找权重与边并把显存从四次降到三次

把文本解码器的 DiscoGP 搬到 HuBERT 与 Wav2Vec 2.0 上做分类电路发现,用冻结与随机对照验证预训练计算的作用,并以砍掉 QKV 残差把边发现显存从四次降到三次,代价是部分任务仍需保留 MLP 残差与早停。

 · 更新于 2026-09-24 · 约 14 分钟 · 6997 字 阅读 →
论文解读

九成权重归零仍能弹:稀疏 WaveNet 音箱如何挤进 iPhone 中央处理器

该工作用迭代局部幅度剪枝去掉 90% 可剪枝权重,并以只遍历非零权重的自研中央处理器稀疏引擎在 48 kHz 与 256 采样块下把实时因子压到约 0.6 实现实时运行,代价是超出感受野的长混响尾音误差增大与高增益下和输入无关的噪声嗡声无法复现。

 · 更新于 2026-09-24 · 约 17 分钟 · 8037 字 阅读 →
论文解读

剪层扰动解码接口后如何恢复:X-AuT 的渐进压缩与跨尺度蒸馏

针对 Qwen3-ASR-0.6B 的 18 层音频编码器,X-AuT 用短预算行为探针选择可恢复层组合,再经表示对齐、跨尺度蒸馏与 LoRA 微调分两跳压到 14 层,单次运行显示 16 层宏平均误差从 5.61% 降到 5.27%,14 层为 5.75% 且音频塔参数减少 20.7%。

 · 更新于 2026-09-24 · 约 8 分钟 · 3529 字 阅读 →
论文解读

先找重层再剪通道:SepPrune 为语音分离模型省算力的三步剪枝

针对语音分离模型分离网络最重、均匀剪枝易伤轻层的矛盾,SepPrune 用结构分析定位、可微掩码选通道、剪后微调恢复的分布优化,在三数据集多骨干上降低参数与计算量,而一轮微调即可恢复大部分性能,但大幅剪枝时恢复速度因结构而异。

 · 更新于 2026-09-24 · 约 17 分钟 · 8155 字 阅读 →
论文解读

Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

模型剪枝 | 8.4/10

 · 更新于 2026-09-24 · 约 16 分钟 · 7856 字 阅读 →
论文解读

Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

音视频理解 | 8.1/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6640 字 阅读 →
论文解读

QR-Erase: Efficient Subspace-Based Machine Unlearning with Layer Localization

说话人验证 | 6.0/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5438 字 阅读 →
论文解读

Efficient Text-to-Audio Generation via Pruning

音频生成 | 7.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5635 字 阅读 →
论文解读

Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

模型剪枝 | 5.9/10

 · 更新于 2026-09-24 · 约 11 分钟 · 5098 字 阅读 →