参数减三成而精度不掉:低秩频率卷积把噪声范围调对再谈边缘实时
针对单帧变 Q 输入的单音高估计,论文把频率轴空洞卷积拆成秩 9 瓶颈使参数从 17787 降到 11397 且三库精度持平,并证明训练噪声下限从 +6.02 dB 压到 -20 dB 能把 -20 dB 处 RPA50 从 2.44 提到 22.41,代价是干净集掉 0.35 点,自研 C 内核以 83 kB 在四款 CPU 上快于 …
针对单帧变 Q 输入的单音高估计,论文把频率轴空洞卷积拆成秩 9 瓶颈使参数从 17787 降到 11397 且三库精度持平,并证明训练噪声下限从 +6.02 dB 压到 -20 dB 能把 -20 dB 处 RPA50 从 2.44 提到 22.41,代价是干净集掉 0.35 点,自研 C 内核以 83 kB 在四款 CPU 上快于 …
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对切分学习中 ViT 中间激活传输开销大的问题,论文提出先按 CLS 注意力聚类合并样本再按簇质心保留 Top-k 令牌的 ADC,在固定通信预算下用更少样本和更短序列完成前后向,并在 DeiT-T/S 上以更低压缩比保持精度,代价是客户端约 5.1% 的 K-means 聚类开销。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对整块循环把语言表示回灌到底层造成语音到语言反复的问题,BiCycle 用累积注意力对角性划分语音组与语言组并只在组内递归,在英语与法语数据上以约一半物理参数报告更低词错率,代价是仍需预训练教师与先蒸馏 30 轮再识别训练 100 轮的两阶段成本。
针对沃洛夫语音查法语文本的跨语言跨模态检索问题,论文比较晚融合与双编码器路线,最强证据是晚融合在自然口语检索与未见意图任务上保持可复述的优势,代价是依赖合成文档与较高维度推理开销。
该文用 k-稀疏自编码器把三种语音自监督特征压成不同稀疏度,再在 SUPERB 六任务上测出最优 k 各不相同,并用信息瓶颈解释为说话人与情感偏压缩、音素与识别偏保留,而输入层质量只能小幅移动该权衡。
论文用单词对齐的逐层干预揭示浅层保留声学细节而深层可大幅压缩的层级冗余,并提出训练无关的相似度合并与双阶段压缩,在三类语义任务上减少约 27.48% 预填充计算量,但中间过渡层敏感且细粒度声学影响尚未充分验证。
针对音视频大模型推理时 KV 缓存过大问题,AccKV 按层自适应聚焦关键模态并先模态内合并再跨模态校准,在 MVBench 与 AVSD 上用 10% 缓存与 120 词元预算维持接近全缓存精度,但未测量延迟与吞吐提升。
该文只训练窄而深的学生编码器逐帧回归教师预量化潜变量,在 2.8 倍参数压缩下六组配对中五组相对词错误率退化不超过 1.9%,同容量独立训练对照优 3.9% 相对,而联合训练的 J3 退化 7.7% 揭示教师与阶段边界。
语音增强 | 7.5/10
语音识别 | 7.2/10
回声消除 | 8.5/10
回声消除 | 7.2/10
音频分类 | 10.0/10
语音合成 | 10.0/10
语音增强 | 7.6/10
语音增强 | 8.3/10
音视频理解 | 6.4/10