论文解读

用一帧延迟换真流式:TinyCall 在 2.3 kbps 下的因果编码与标量量化安排

TinyCall 针对窄带应急语音在 2.3 kbps 下采用因果 SEANet 编码器加 Vocos 式频谱解码器与残差有限标量量化实现流式重建,流式相对离线仅从 PESQ 1.3197 降到 1.2994,但伪前视引入一帧算法延迟且未完全消除边界失真。

 · 约 20 分钟 · 9662 字 阅读 →
论文解读

在只允许二维卷积的神经形态芯片上做音视融合:NAVIR 的分解与受限解码

针对工业噪声下纯音频识别崩溃的问题,NAVIR 用逐帧空间编码加时序卷积的分解结构适配 BrainChip AKD1000,在 GRID 噪声测试下量化融合模型取得未见说话人 14.0% 与重叠说话人 3.3% 词错率,代价是未见说话人纯唇读仍高达 35.3% 且音视模型在片上吞吐下降。

 · 更新于 2026-09-24 · 约 17 分钟 · 8497 字 阅读 →
论文解读

参数减三成而精度不掉:低秩频率卷积把噪声范围调对再谈边缘实时

针对单帧变 Q 输入的单音高估计,论文把频率轴空洞卷积拆成秩 9 瓶颈使参数从 17787 降到 11397 且三库精度持平,并证明训练噪声下限从 +6.02 dB 压到 -20 dB 能把 -20 dB 处 RPA50 从 2.44 提到 22.41,代价是干净集掉 0.35 点,自研 C 内核以 83 kB 在四款 CPU 上快于 …

 · 更新于 2026-09-24 · 约 19 分钟 · 9110 字 阅读 →
论文解读

小参数做音频问答:Samsone 用裁词表与减层数换端侧可运行

Samsone 针对端侧音频问答,用 Whisper-Tiny 编码器加 SmolLM2 解码器与非线性映射器做单阶段训练,在 MMAU 与 MMAU-Pro 上超过同级小模型并接近部分大模型,代价是通用语言能力下降且未做移动端硬件级优化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8844 字 阅读 →
论文解读

把二次方的强制对齐压进终端设备:原地计算与可解释剪枝

针对长语音强制对齐的二次方内存与时间瓶颈,论文用分治原地计算的赫希伯格维特比算法保证结果不变,再用随机游走先验加转写精度界做剪枝,三小时音频在单核中央处理器上以兆字节级内存完成对齐,剪枝后进一步提速但依赖精度假设。

 · 更新于 2026-09-24 · 约 19 分钟 · 9476 字 阅读 →
论文解读

离线也要又快又准:Jarvis 用本地微调小模型做赛车语音指令分类

针对赛车高层行为指令的离线语音控制问题,Jarvis 用唤醒词加本地转写加微调 Mistral 7B 做文本到指令分类,在 17 类 1645 样本条件下报告 97.63% 准确率与 1.39 s 平均延迟,但数据集仍部分合成且指令空间严格预定义。

 · 更新于 2026-09-24 · 约 18 分钟 · 8797 字 阅读 →
论文解读

小容量不靠看得远:固定感受野与梅尔细节约束的紧凑合成

针对约 265K 参数的紧凑声学模型,论文用感受野对照证明超过 15 个音素的编码器上下文无一致收益,再用梅尔适配的梯度方差损失恢复细节,在同等预算下把 UTMOS 从 3.591 提升到 4.086,代价是大模型在可懂度和频谱失真上仍占优且结论限于 LJSpeech 自动指标。

 · 更新于 2026-09-24 · 约 21 分钟 · 10114 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

不是每句被听清的话都是叫你:用事后反馈纠正误唤醒

针对 ASR 转写正确但唤醒意图错误的问题,论文提出在响应前加一层融合声学、语言和设备上下文并从用户后续行为中提炼纠正模式的 ASCIL,在 3667 次交互上将会话不相交失败子集错误相对降低 54.27%,在阈值 0.90 的问题标记切片上相对降低 24.39%,代价是在低阈值和干净音频上存在接受与拦截的权衡且依赖历史交互。

 · 更新于 2026-09-24 · 约 18 分钟 · 8817 字 阅读 →
论文解读

装得进低功耗音频芯片的实时音乐分离:预算先行,深滤波补精度

针对嵌入式音频芯片同时卡住内存与单帧算力的问题,该研究用因果声谱分离主干加门控深滤波实现可部署分离,在芯片实测单帧 10.43 ms 内达到 4.70 dB cSDR,代价是比装不进芯片的最强基线低约 0.5 至 0.7 dB 且连续上下文训练不可省略。

 · 更新于 2026-09-24 · 约 21 分钟 · 10127 字 阅读 →
论文解读

拿掉按钮和屏幕之后:用动作模糊换取可探索性的手持环境声音盒

SonoCube 把 70mm 立方体作为全部界面,用触摸触发旋律、用朝向选择音高、用摇晃与旋转调制混响延迟滤波,并以约 10 人每次 5 至 7 分钟的非正式演示报告了触摸难发现与持续动作更易投入的观察,代价是触摸发现率低与重力触发路径约 107 ms 延迟。

 · 更新于 2026-09-24 · 约 23 分钟 · 11070 字 阅读 →
论文解读

一部手机如何托住一条嗓音:VoixTenue 的手势音高与力度控制

VoixTenue 把触屏纵向画线与手机俯仰横滚倾角映射为 Pink Trombone 的基频与强度,在 E2-E5 三组八度内以约 60 Hz 更新实现全机端实时嗓音合成,代价是触屏模式暂缺力度控制而倾角模式音高精度较低且未经被试实验验证。

 · 更新于 2026-09-24 · 约 21 分钟 · 10094 字 阅读 →
论文解读

时变全通滤波器为何会削波:把系数增量关进阈值笼子

针对一阶与二阶时变全通滤波器在系数快速变化时输出超过限幅阈值的问题,论文用静态对照输出加系数增量界把输出约束在阈值内,正弦与音乐片段实验显示其在标准结构和能量保持结构各自削波的方向上均不削波,代价是短暂偏离目标系数轨迹并引入少量逐样本判断与除法运算。

 · 更新于 2026-09-24 · 约 26 分钟 · 12570 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

把身体转成轴心:Ehecatl 如何用方位、倾斜与风车气流驱动合成

Ehecatl 把 Voladores 仪式的 Quincunx 空间逻辑做成可演奏的映射,用磁罗盘方位交叉淡化四个加法振荡器、用风车气流同时控制幅度与滤波、用倾斜与触键做精细修饰,原型已实现独立发声与开源复现,但方位对比度与结构稳定性仍待加强。

 · 更新于 2026-09-24 · 约 21 分钟 · 10289 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

级联不拆相位、并行不抢状态:多级线性相位八度滤波器组的吞吐与能耗折中

该文不改滤波器设计,只把拉伸有限冲激响应级联做成块流加环形状态的串行基线,再用开放多处理任务流水线并行,在英伟达 Jetson Orin Nano 上以串行超每秒 118 万采样、6 线程加速超 4.5 倍为证据,代价是最小能耗点不在最高性能点。

 · 更新于 2026-09-24 · 约 18 分钟 · 8551 字 阅读 →
论文解读

把空间接进电路:可穿戴激光反馈乐器 FO2 如何让身体动作变成声音

FO2 用线激光做光扬声器、太阳能板做光麦克风加 Bela Gem 与 SuperCollider 构成光反馈回路,靠距离角度反射控制反馈状态,但代价是高度依赖暗空间与反射条件且无定量声学评估。

 · 更新于 2026-09-24 · 约 21 分钟 · 10510 字 阅读 →
论文解读

从外接电脑到装进鼓里:混合鼓如何把合成声再送回木腔

该研究以旅行卡洪鼓为腔体、用压电拾取驱动 Daisy Seed 上的 Karplus-Strong 合成,并经两轮迭代实现锂电池供电与内置激励器回路,探索性试奏显示交互直观但致动器与拾取间的结构耦合仍需抗反馈控制。

 · 更新于 2026-09-24 · 约 21 分钟 · 10416 字 阅读 →