PACodec: A Low-bitrate Neural Speech Codec with Parallel Additive Vector Quantization

📄 不排队,各自说话再相加:PACodec 把量化从接力改成合唱 英文题目:PACodec: A Low-bitrate Neural Speech Codec with Parallel Additive Vector Quantization 一句话:针对低码率下残差量化分支耦合难压缩的问题,PACodec 用四个并行小码本独立量化同一全局特征再相加,在 1.4 与 4.2 kbps 下打平更高码率基线,代价是分工机制仍是观测推断而非显式可控解耦。 标签:#语音编码 | #生成对抗网络 | #语音转换 | #高效推理 评分:7.1/10 | 创新 1.5/2 | 技术严谨 1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Fei Liu:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Xiao-Hang Jiang:机构信息未在 arXiv HTML 中可靠披露 Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 并行加性量化摆脱残差依赖的思路干净且与解耦分析形成了呼应,低码率下能打平更高码率基线颇具实用价值。但量化损失对所有分支同等约束全局特征的设定在理论上略显粗糙,消融更多是事后解读而非可控解耦的证明。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 874 words

StreamWSR: Streamable and Lightweight Waveform-Domain Neural Speech Super-Resolution

📄 不看未来,也要补出高频:StreamWSR 的零前视波形赌局 英文题目:StreamWSR: Streamable and Lightweight Waveform-Domain Neural Speech Super-Resolution 一句话:针对低延迟语音超分辨率需要零前视流式推理的难题,StreamWSR 选择全因果波形域直接映射加训练期多分辨率 MDCT 谱监督,在 VCTK 2 kHz 到 16 kHz 上以 9.03 M 参数和 2.12 G 计算量取得 ViSQOL 3.81 的感知质量,代价是验证仍局限于干净英文朗读且缺乏实测延迟与主观听感。 标签:#语音增强 | #生成对抗网络 | #流式处理 | #高效推理 评分:7.2/10 | 创新 1.5/2 | 技术严谨 1.1/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5 👥 作者与机构 Yuan Tian:机构信息未在 arXiv HTML 中可靠披露 Yang Ai:机构信息未在 arXiv HTML 中可靠披露 Hui-Peng Du:机构信息未在 arXiv HTML 中可靠披露 Zhen-Hua Ling:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把波形域直接建模与零前视因果约束真正做成了可流式部署的轻量系统,避免了声码器和显式相位预测的复杂管线。短板在于仅在单一英文干净数据集上验证且缺少延迟实测与主观听感评估,零前视优势更多停留在结构因果层面而非系统级验证。 ...

2026-09-04 · 更新于 2026-09-04 · 5 min · 1015 words

Conjoint Audio-to-Spikes Encoding and Processing for Efficient Neuromorphic Speech Recognition

📄 用最轻的耳蜗换最高的精度:HLP 脉冲编码为何在干净数据上赢、在嘈杂数据上输 英文题目:Conjoint Audio-to-Spikes Encoding and Processing for Efficient Neuromorphic Speech Recognition 一句话:论文用仅靠阈值调控脉冲密度的可编程 Butterworth 滤波器组与 IF 神经元构成非可学习 HLP 编码器,配合 100 步累积器与前馈 SNN 联合优化,在 Heidelberg Digits 上以 13 通道 100k 参数达到 99.77% 超越同类流水线,却在多说话人 GSC 上暴露对异构噪声鲁棒性不足的代价,并以 Zynq-7000 定点化 LLP 实现验证在线可行性。 标签:#语音识别 #端到端 #音频分类 #高效推理 评分:6.8/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Valentin M. Meunier:机构信息未在 arXiv HTML 中可靠披露 Amélie Gruel:机构信息未在 arXiv HTML 中可靠披露 Pierre Lewden:机构信息未在 arXiv HTML 中可靠披露 Adrien F. Vincent:机构信息未在 arXiv HTML 中可靠披露 Sylvain Saïghi:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把高层可编程滤波器组与积分发放神经元绑定的轻量编码器做到了可在 FPGA 上端到端跑通,并在受控的 Heidelberg Digits 上以极简前馈脉冲网络刷出超高精度,工程闭环完整。短板是复杂多说话人场景下泛化明显掉队,NTIMIT 仅 63.98% 且 GSC 远落后于 Lauscher 与 Speech2Spikes 的同类流水线,却未给出每通道阈值或更强时序建模等实质补救验证,效率指标也停留在脉冲计数层面。 ...

2026-09-01 · 更新于 2026-09-04 · 10 min · 2109 words

Context-Aware Interleaved Batching for WhisperX

📄 在并行与记忆之间找缝隙:WhisperX 如何既跑得快又记得住 英文题目:Context-Aware Interleaved Batching for WhisperX 一句话:面对长音频转写中并行速度与跨段上下文不可兼得的矛盾,论文用 VAD 固定声学边界并以轮询交错批处理恢复 224 词元滚动上下文,在 Earnings-21 上以 8.4 倍于串行 Whisper 的速度将 WER 降至 8.2%、专有名词分数提至 79.3%,代价是首批重转的一次额外前向与小规模评测的不确定性。 标签:#语音识别 #语音大模型 #长音频处理 #高效推理 #医疗音频 评分:7.4/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Carlos Bain:机构信息未在 arXiv HTML 中可靠披露 Max Bain:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 用语音活动检测(Voice Activity Detection,VAD)外置边界加流间轮询批处理把 Whisper 的 224 词元历史条件从串行枷锁里解放出来,思路巧妙且可直接插进任意分段式流水线。问题在于评测仅靠 15 条 Earnings-21 与 6 条自建 MedicalLessons,基于 GPT-5.1 的 LPS 与 Pn 均无人工一致性校准,8.4 倍加速背后首批重转的额外前向与 N≤B 时退化为近串行的代价也被轻描淡写。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1342 words

Playability-Aware Audio-to-Tablature Guitar Transcription via Diffusion Models

📄 同一音高多条路:用扩散与可演奏约束把吉他谱写对、写得能弹 英文题目:Playability-Aware Audio-to-Tablature Guitar Transcription via Diffusion Models 一句话:针对吉他同一音高对应多弦品位置的歧义,Noise2Fret 把离散指板谱嵌入连续空间做条件扩散去噪,并以五项可微音乐物理损失联合约束,在 GuitarSet 与 GOAT 上同时提升音高与指板 F 值并保持 0.67 实时因子,代价是仍局限于标准调弦短窗干净录音。 标签:#音乐转录 #扩散模型 #多任务学习 #高效推理 评分:8.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Riccardo Simionato:Univ. Bordeaux;CNRS, Bordeaux INP, LaBRI;Talence, France Louis Bigo:Univ. Bordeaux;CNRS, Bordeaux INP, LaBRI;Talence, France 💬 毒舌点评 把离散指板选择搬进连续扩散空间并用五项可微音乐物理损失做软约束,思路比统计共现抑制更可解释,且在 GOAT 上的召回与可演奏性平衡确有说服力。短板是 100 ms 窗口与事件级聚合的时序建模过短、评测仍局限于标准调弦的干净录音,且对圆圈五度等较弱先验缺乏统计显著性与真实演奏容错分析。 ...

2026-09-01 · 更新于 2026-09-04 · 7 min · 1430 words

Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper

📄 1500 个音频 token 真的都需要吗?用等间隔抽样戳破 Whisper 的时域冗余 英文题目:Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper 一句话:针对 Whisper 固定 1500 token 接口的时域冗余,论文用无训练的等间隔 stride-k 索引在卷积茎后与编码器后两处降采样,证明 k=2 在多数任务上接近基线且复合后可削减 75% 音频 token、降低约 52-58% GFLOPs 并在语音大模型上兑现 19-28% 延迟收益,但代价在困难语料与细粒度时序任务上显著放大。 标签:#语音识别 #模型压缩 #音频理解 #高效推理 评分:7.2/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.3/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5 👥 作者与机构 Chanhee Cho:Department of Artificial Intelligence Junhyuk Choi:Chung-Ang University, Seoul, Republic of Korea Bugeun Kim:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把 Whisper 固定 1500 token 接口的冗余用最朴素的等间隔索引一次性捅破,并用感受野计算与中心核对齐(Centered Kernel Alignment,CKA)衰减曲线把输入侧与输出侧的不对称讲清楚,工程上零训练零额外计算即可复用。短板是所有结论都锁死在重叠窗口加卷积茎这一前端假设上,对原始波形编码器直接失效,且 Common Voice 等困难场景下复合降采样仍带来近 10 个点的词错率(Word Error Rate,WER)恶化,却未给出任何自适应回退策略。 ...

2026-09-01 · 更新于 2026-09-04 · 9 min · 1729 words

Alias-Free Oscillator Synchronization via Additive Synthesis

📄 把截断搬进频域:用 sinc 重采样让振荡器同步不再混叠 英文题目:Alias-Free Oscillator Synchronization via Additive Synthesis 一句话:论文把硬同步的时域重置重写为傅里叶系数上的 sinc/versinc 线性重采样,再用带限加法合成直接生成无混叠波形,并以 65nm 的 HASY 芯片在 42 微秒内完成 512 阶变换来证明实时可行,但代价是面积与功耗翻倍且 P<1 时精度系统性下降。 标签:#音乐生成 #生成模型 #实时处理 #高效推理 评分:7.9/10 | 创新 1.6/2 | 技术严谨 1.2/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.9/1.5 | 开源 1/1.5 | 可复现 0.3/0.5 | 工程/实践 1.3/1.5 👥 作者与机构 Jonas Roth:机构信息未在 arXiv HTML 中可靠披露 Domenic Keller:机构信息未在 arXiv HTML 中可靠披露 Oscar Castañeda:机构信息未在 arXiv HTML 中可靠披露 Christoph Studer:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 亮点在于把硬同步的时域截断重写为频域线性重采样,用 \(sinc\) / \(versinc\) 闭式变换统一处理任意波形并直接给出无混叠加法合成,理论干净且可扩展到 mirrored 与 pulsar 两种软同步。短板是验证仅靠与浮点黄金模型和解析截断的 SINAD 对比,缺乏与 BLEP / BLIT 等主流抗混叠基线的听感或频谱对比,且流片芯片存在控制逻辑错误导致无法全功能实测,系统报告的说服力被大幅削弱。 ...

2026-08-31 · 更新于 2026-09-04 · 2 min · 253 words

Low-Power End-to-End Cochlear Implant Speech Denoising with Spiking Neural Networks

📄 把去噪塞进耳蜗编码器里:用稀疏脉冲换六倍能耗 英文题目:Low-Power End-to-End Cochlear Implant Speech Denoising with Spiking Neural Networks 一句话:为解决人工耳蜗在噪声下可懂度骤降而深度网络又太费电的矛盾,论文把整条 ACE 编码流水线脉冲化为 Spiking Deep ACE,用稀疏加法替代稠密乘累加,在 VSTOI 仅落后约 1 个百分点、SNRi 基本持平的前提下把估算能耗从 2461 降至 372 μJ/s,代价是评估仍停留在声码器客观指标与 45nm 公式估算。 标签:#语音增强 #高效推理 #医疗音频 评分:6.7/10 | 创新 1.2/2 | 技术严谨 1/1.5 | 实验充分 0.8/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5 👥 作者与机构 Ludovic Boulanger:机构信息未在 arXiv HTML 中可靠披露 Sean U. N. Wood:机构信息未在 arXiv HTML 中可靠披露 💬 毒舌点评 把 Conv-TasNet 底座的 Deep ACE 整体脉冲化并用 ParaLIF-Threshold 实现时间并行训练的工程取舍清晰,6 倍以上能耗下降对植入体场景确有吸引力。但评估仅在 28 人英语数据上做 ICRA 两类噪声的电极图域指标,无统计检验、无真实 CI 受试者主观验证、无神经拟态硬件实测,能耗也停留在 45 nm CMOS 估算且未计访存,离可植入部署仍有距离。 ...

2026-08-31 · 更新于 2026-09-04 · 5 min · 1047 words

Knowledge Distillation for Efficient Acoustic Echo Control

📄 把教师的回声残差教给小模型:AEC 蒸馏到底补回了什么 英文题目:Knowledge Distillation for Efficient Acoustic Echo Control 一句话:这项工作把大 CGGN16 增强输出作为可学习目标,用频域蒸馏接 GT 微调,在不改变小学生推理规模的前提下挽回近端语音保真与回声抑制的部分损失。 标签:#回声消除 #知识蒸馏 #RNN #模型压缩 #高效推理 评分:8.5/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1.1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1/1.5 💬 毒舌点评 本文没有把更小网络偷换成更差但便宜的网络,而是把教师增强输出变成学生学习目标,并用频域 KD→GT 的 2 阶段路径检验它。开发集和测试集都把近端保真与残余回声拆开看,0.2 M、0.25 G 的学生在双讲指标上整体回升,论证的是明确数据流,不是含混地宣称蒸馏有效。 需要保留的边界是:高效主要是参数量、FLOPS 与 40 ms 算法延迟账本,没有端侧实测功耗、峰值内存、实时因子或整机延迟;训练也只做回声抑制。编码器和 recurrent bottleneck 特征匹配没有超过无 KD 基线,说明 2 阶段 KD 的收益不能泛化成任意层级蒸馏都值得加入,部署收益也不能从 0.25 G FLOPS 自动推出。 ...

2026-08-27 · 更新于 2026-09-04 · 4 min · 661 words

SPECTRA: Subspace-Preserving Embedding Calibration, Transport, and Replay for Fully Few-Shot Class-Incremental Audio Classification

📄 别把旧类压成一个点:SPECTRA 用低秩几何给 5-shot 音频增量学习留住记忆 英文题目:SPECTRA: Subspace-Preserving Embedding Calibration, Transport, and Replay for Fully Few-Shot Class-Incremental Audio Classification 一句话:SPECTRA 的关键选择是让冻结 PENGI 保持通用稳定性、让残差 adapter 承担任务可塑性 标签:#音频分类 #少样本 #持续学习 #Adapter #高效推理 评分:7.2/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.9/1 | 影响 1.1/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.7/1.5 💬 毒舌点评 作者没有用“冻结 encoder”把问题粗暴地冻住,而是承认 adapter 会让旧类失去参照,再以低秩子空间 replay 把旧类的局部几何带回训练。最扎实的是 Table 5:匹配总方差的 Gaussian replay 没能复现收益,subspace replay 才把 NSynth-100 的 AA/PD 推到 96.5/3.2,说明这里有被消融钉住的结构性主张,而非给 replay 换个名字。 ...

2026-08-27 · 更新于 2026-09-04 · 4 min · 810 words