用一帧延迟换真流式:TinyCall 在 2.3 kbps 下的因果编码与标量量化安排
TinyCall 针对窄带应急语音在 2.3 kbps 下采用因果 SEANet 编码器加 Vocos 式频谱解码器与残差有限标量量化实现流式重建,流式相对离线仅从 PESQ 1.3197 降到 1.2994,但伪前视引入一帧算法延迟且未完全消除边界失真。
TinyCall 针对窄带应急语音在 2.3 kbps 下采用因果 SEANet 编码器加 Vocos 式频谱解码器与残差有限标量量化实现流式重建,流式相对离线仅从 PESQ 1.3197 降到 1.2994,但伪前视引入一帧算法延迟且未完全消除边界失真。
针对工业噪声下纯音频识别崩溃的问题,NAVIR 用逐帧空间编码加时序卷积的分解结构适配 BrainChip AKD1000,在 GRID 噪声测试下量化融合模型取得未见说话人 14.0% 与重叠说话人 3.3% 词错率,代价是未见说话人纯唇读仍高达 35.3% 且音视模型在片上吞吐下降。
针对单帧变 Q 输入的单音高估计,论文把频率轴空洞卷积拆成秩 9 瓶颈使参数从 17787 降到 11397 且三库精度持平,并证明训练噪声下限从 +6.02 dB 压到 -20 dB 能把 -20 dB 处 RPA50 从 2.44 提到 22.41,代价是干净集掉 0.35 点,自研 C 内核以 83 kB 在四款 CPU 上快于 …
Samsone 针对端侧音频问答,用 Whisper-Tiny 编码器加 SmolLM2 解码器与非线性映射器做单阶段训练,在 MMAU 与 MMAU-Pro 上超过同级小模型并接近部分大模型,代价是通用语言能力下降且未做移动端硬件级优化。
针对长语音强制对齐的二次方内存与时间瓶颈,论文用分治原地计算的赫希伯格维特比算法保证结果不变,再用随机游走先验加转写精度界做剪枝,三小时音频在单核中央处理器上以兆字节级内存完成对齐,剪枝后进一步提速但依赖精度假设。
针对赛车高层行为指令的离线语音控制问题,Jarvis 用唤醒词加本地转写加微调 Mistral 7B 做文本到指令分类,在 17 类 1645 样本条件下报告 97.63% 准确率与 1.39 s 平均延迟,但数据集仍部分合成且指令空间严格预定义。
针对约 265K 参数的紧凑声学模型,论文用感受野对照证明超过 15 个音素的编码器上下文无一致收益,再用梅尔适配的梯度方差损失恢复细节,在同等预算下把 UTMOS 从 3.591 提升到 4.086,代价是大模型在可懂度和频谱失真上仍占优且结论限于 LJSpeech 自动指标。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
针对 ASR 转写正确但唤醒意图错误的问题,论文提出在响应前加一层融合声学、语言和设备上下文并从用户后续行为中提炼纠正模式的 ASCIL,在 3667 次交互上将会话不相交失败子集错误相对降低 54.27%,在阈值 0.90 的问题标记切片上相对降低 24.39%,代价是在低阈值和干净音频上存在接受与拦截的权衡且依赖历史交互。
针对嵌入式音频芯片同时卡住内存与单帧算力的问题,该研究用因果声谱分离主干加门控深滤波实现可部署分离,在芯片实测单帧 10.43 ms 内达到 4.70 dB cSDR,代价是比装不进芯片的最强基线低约 0.5 至 0.7 dB 且连续上下文训练不可省略。
SonoCube 把 70mm 立方体作为全部界面,用触摸触发旋律、用朝向选择音高、用摇晃与旋转调制混响延迟滤波,并以约 10 人每次 5 至 7 分钟的非正式演示报告了触摸难发现与持续动作更易投入的观察,代价是触摸发现率低与重力触发路径约 107 ms 延迟。
VoixTenue 把触屏纵向画线与手机俯仰横滚倾角映射为 Pink Trombone 的基频与强度,在 E2-E5 三组八度内以约 60 Hz 更新实现全机端实时嗓音合成,代价是触屏模式暂缺力度控制而倾角模式音高精度较低且未经被试实验验证。
针对一阶与二阶时变全通滤波器在系数快速变化时输出超过限幅阈值的问题,论文用静态对照输出加系数增量界把输出约束在阈值内,正弦与音乐片段实验显示其在标准结构和能量保持结构各自削波的方向上均不削波,代价是短暂偏离目标系数轨迹并引入少量逐样本判断与除法运算。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
Ehecatl 把 Voladores 仪式的 Quincunx 空间逻辑做成可演奏的映射,用磁罗盘方位交叉淡化四个加法振荡器、用风车气流同时控制幅度与滤波、用倾斜与触键做精细修饰,原型已实现独立发声与开源复现,但方位对比度与结构稳定性仍待加强。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
该文不改滤波器设计,只把拉伸有限冲激响应级联做成块流加环形状态的串行基线,再用开放多处理任务流水线并行,在英伟达 Jetson Orin Nano 上以串行超每秒 118 万采样、6 线程加速超 4.5 倍为证据,代价是最小能耗点不在最高性能点。
FO2 用线激光做光扬声器、太阳能板做光麦克风加 Bela Gem 与 SuperCollider 构成光反馈回路,靠距离角度反射控制反馈状态,但代价是高度依赖暗空间与反射条件且无定量声学评估。
该研究以旅行卡洪鼓为腔体、用压电拾取驱动 Daisy Seed 上的 Karplus-Strong 合成,并经两轮迭代实现锂电池供电与内置激励器回路,探索性试奏显示交互直观但致动器与拾取间的结构耦合仍需抗反馈控制。