论文解读

参数减三成而精度不掉:低秩频率卷积把噪声范围调对再谈边缘实时

针对单帧变 Q 输入的单音高估计,论文把频率轴空洞卷积拆成秩 9 瓶颈使参数从 17787 降到 11397 且三库精度持平,并证明训练噪声下限从 +6.02 dB 压到 -20 dB 能把 -20 dB 处 RPA50 从 2.44 提到 22.41,代价是干净集掉 0.35 点,自研 C 内核以 83 kB 在四款 CPU 上快于 …

 · 更新于 2026-09-25 · 约 19 分钟 · 9110 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 247 分钟 · 123292 字 阅读 →
论文解读

切分学习传不动 ViT:用注意力先并批再剪令牌的双重压缩

针对切分学习中 ViT 中间激活传输开销大的问题,论文提出先按 CLS 注意力聚类合并样本再按簇质心保留 Top-k 令牌的 ADC,在固定通信预算下用更少样本和更短序列完成前后向,并在 DeiT-T/S 上以更低压缩比保持精度,代价是客户端约 5.1% 的 K-means 聚类开销。

 · 更新于 2026-09-25 · 约 17 分钟 · 8315 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 433 分钟 · 216709 字 阅读 →
论文解读

整块循环打乱先听后写的流水线:BiCycle 用分组递归保留语音识别机制

针对整块循环把语言表示回灌到底层造成语音到语言反复的问题,BiCycle 用累积注意力对角性划分语音组与语言组并只在组内递归,在英语与法语数据上以约一半物理参数报告更低词错率,代价是仍需预训练教师与先蒸馏 30 轮再识别训练 100 轮的两阶段成本。

 · 更新于 2026-09-25 · 约 21 分钟 · 10296 字 阅读 →
论文解读

沃洛夫语音查法语文本:把语音拼进冻结文本检索模型为何更稳

针对沃洛夫语音查法语文本的跨语言跨模态检索问题,论文比较晚融合与双编码器路线,最强证据是晚融合在自然口语检索与未见意图任务上保持可复述的优势,代价是依赖合成文档与较高维度推理开销。

 · 更新于 2026-09-25 · 约 19 分钟 · 9345 字 阅读 →
论文解读

稀疏度不是越稀越好:六个语音任务在压缩与保留之间的分岔

该文用 k-稀疏自编码器把三种语音自监督特征压成不同稀疏度,再在 SUPERB 六任务上测出最优 k 各不相同,并用信息瓶颈解释为说话人与情感偏压缩、音素与识别偏保留,而输入层质量只能小幅移动该权衡。

 · 更新于 2026-09-25 · 约 16 分钟 · 7919 字 阅读 →
论文解读

语音 token 不必个个不同:大语音模型的分层冗余与亲和合并

论文用单词对齐的逐层干预揭示浅层保留声学细节而深层可大幅压缩的层级冗余,并提出训练无关的相似度合并与双阶段压缩,在三类语义任务上减少约 27.48% 预填充计算量,但中间过渡层敏感且细粒度声学影响尚未充分验证。

 · 更新于 2026-09-25 · 约 17 分钟 · 8248 字 阅读 →
论文解读

高层偏向视频、跨模态不宜直并:AccKV 按层聚焦再校准压缩音视频 KV

针对音视频大模型推理时 KV 缓存过大问题,AccKV 按层自适应聚焦关键模态并先模态内合并再跨模态校准,在 MVBench 与 AVSD 上用 10% 缓存与 120 词元预算维持接近全缓存精度,但未测量延迟与吞吐提升。

 · 更新于 2026-09-25 · 约 16 分钟 · 7861 字 阅读 →
论文解读

只抄最后一层表示:预量化潜变量蒸馏压缩流式音频前端

该文只训练窄而深的学生编码器逐帧回归教师预量化潜变量,在 2.8 倍参数压缩下六组配对中五组相对词错误率退化不超过 1.9%,同容量独立训练对照优 3.9% 相对,而联合训练的 J3 退化 7.7% 揭示教师与阶段边界。

 · 更新于 2026-09-25 · 约 20 分钟 · 9661 字 阅读 →
论文解读

开耳助听器里漏进来的噪声,为何要让扬声器自己去抵消?

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 27 分钟 · 13172 字 阅读 →
论文解读

1500 个音频 token 真的都需要吗?用等间隔抽样戳破 Whisper 的时域冗余

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10278 字 阅读 →
论文解读

把教师的回声残差教给小模型:AEC 蒸馏到底补回了什么

回声消除 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4423 字 阅读 →
论文解读

A Regularized Block Diagonal RLS Algorithm for Acoustic Echo Cancellation

回声消除 | 7.2/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5120 字 阅读 →
论文解读

PolyChirp: Multi-Species Birdsong Classification Using TinyML on Low-Power Acoustic Sensors

音频分类 | 10.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4900 字 阅读 →
论文解读

sanoTTS: The Smallest Real-Time Neural TTS on a General-Purpose Microcontroller

语音合成 | 10.0/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4848 字 阅读 →
论文解读

SlimDiffuSE: Towards Efficient Diffusion-Based Speech Enhancement using Slimmable Networks

语音增强 | 7.6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4594 字 阅读 →
论文解读

μNet: Ultra-Low-Memory and Low-Complexity Speech Enhancement for Embedded Digital Signal Processors

语音增强 | 8.3/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5258 字 阅读 →
论文解读

DAVSS: Distilled Audio-Visual State Space Models

音视频理解 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5722 字 阅读 →