论文解读

三点脉冲响应如何撑起一条隧道的可走动混响:Bunkervik 共极点模态引擎

针对长条形隧道内接收位置连续变化时混响特征平滑过渡的问题,该演示用三位置实测脉冲响应构造 6300 个共享极点的模态合成引擎并做残差插值,时域归一化误差低于 3.5%,代价是仅覆盖纵轴一维移动且高频需外推补偿。

 · 更新于 2026-09-24 · 约 22 分钟 · 10990 字 阅读 →
论文解读

从可微分训练到实时插件:用中间表示锁住反馈延迟网络的等价与稳定

论文针对可微音频模型难以自动部署为实时效果器的问题,选择以框架无关的 JSON 中间表示解耦提取与发射,用反馈延迟网络验证脉冲响应一致到单精度噪声级,代价是目前仅在整数延迟线性时不变设定下给出等价与稳定性保证。

 · 更新于 2026-09-24 · 约 19 分钟 · 9047 字 阅读 →
论文解读

用对数级递归保持无损:可调克罗内克反馈矩阵如何划分混响网络

该文用 M 个 2×2 旋转或反射核的递归克罗内克积构造 2^M 维正交反馈矩阵,以 O(N log2 N) 就地迭代完成反馈运算,并用单个核角度连续控制立体声耦合、奇偶冻结与时变调制,代价是只覆盖正交矩阵的一个参数子空间且听感验证依赖示例音频。

 · 更新于 2026-09-24 · 约 19 分钟 · 9314 字 阅读 →
论文解读

直接在可运行网络上优化混响:模块化反馈延迟网络的实时拆解与调参

该工作把反馈延迟网络拆成可替换模块并用图形界面直接优化真实网络,在 128 采样块下随通道数扩大仍快于基线且回声密度更快建立的证据下,代价是用有限差分代替可微分梯度并依赖手工设计的平坦度与衰减损失。

 · 更新于 2026-09-24 · 约 19 分钟 · 9190 字 阅读 →
论文解读

用一块入门 FPGA 同时做鼓采样、效果器与 16 轨录音:并行与确定延迟如何压住成本

针对电子鼓多轨采样与录音的算力与成本问题,该工作用单块 Artix-7 实现 10 路鼓采样加 4 路外部输入、可变速率重采样、五种效果与以太网 16 轨录音,报告采样处理链约 1.33 ms 与 512 采样环形缓冲下无欠载过载,同时占用约一半逻辑资源并控制整机成本在 500 美元以下。

 · 更新于 2026-09-24 · 约 19 分钟 · 9248 字 阅读 →
论文解读

在二维平面上连续试听脉冲响应集合:IRIS 用高斯加权与有界卷积做轻量导航

IRIS 把已测或自定义脉冲响应集合排成二维可导航平面,用高斯距离加权与最多 8 路有界卷积做实时试听,在 Apple M4 Pro 上 512 采样缓冲下 16 路 1 秒 IR 平均 2.87 毫秒等三组条件保持在 10.67 毫秒预算内,代价是只做简化时域混合而不保证物理最优与感知透明。

 · 更新于 2026-09-24 · 约 15 分钟 · 7356 字 阅读 →
论文解读

手腕不动琴:把传感、映射与效果链收进同一个 Csound 文件的 L-Bow

针对现场演出中传感器链路易失灵的问题,L-Bow 用腕戴六轴惯性单元加 Csound 原生 arduinoRead 直读串口,把采集、六种演奏模式与共享效果链收进单个.csd 文件,报告显示 20 次触发测试零误触发且平均延迟比 Python-OSC 桥低 22.5 ms,代价是 10 位量化和 9600 波特率下的分辨率与帧时间限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9981 字 阅读 →
论文解读

从跳变的数值解到连续的 learned 逆映射:二次差频谱合成如何变得可演奏

该文把求载波复音以产生目标二次差频谱的问题转成学习失真函数连续近似逆,用齐次结构加课程式训练换来可实时插值的合成器,代价是重建误差略高于随机牛顿迭代。

 · 更新于 2026-09-24 · 约 19 分钟 · 9361 字 阅读 →
论文解读

流式音视频不同步、该不该开口难判断:ROMA 用对齐单元与说话头统一反应与主动

针对连续音视频流中被动问答与主动触发难以统一的问题,ROMA 用一秒多模态单元加分块时间位置编码与独立说话头做对齐与时机判断,在主动提醒与实时解说上报告最优并保持被动问答竞争力,代价是每秒决策粒度和有限上下文。

 · 更新于 2026-09-24 · 约 17 分钟 · 8355 字 阅读 →
论文解读

九成权重归零仍能弹:稀疏 WaveNet 音箱如何挤进 iPhone 中央处理器

该工作用迭代局部幅度剪枝去掉 90% 可剪枝权重,并以只遍历非零权重的自研中央处理器稀疏引擎在 48 kHz 与 256 采样块下把实时因子压到约 0.6 实现实时运行,代价是超出感受野的长混响尾音误差增大与高增益下和输入无关的噪声嗡声无法复现。

 · 更新于 2026-09-24 · 约 17 分钟 · 8037 字 阅读 →
论文解读

把混响时间锁在目标附近:感知加控制的自调节厅堂闭环

该文要解决厅堂在人员与声源变化下混响时间漂移的问题,选择用卷积神经网络估计当前混响时间再由强化学习调节面板吸声系数的闭环路线,给出的最强证据是动态条件下把混响时间维持在目标 0.15 秒以内,代价是全过程依赖仿真反馈且未报告真实厅堂部署的延迟与能耗实测。

 · 更新于 2026-09-24 · 约 20 分钟 · 9903 字 阅读 →
论文解读

把口型与情绪放在同一运动空间里采样:情绪子空间加十步流匹配的实时说话头

该文把语音驱动的人脸运动看作情绪条件下的运动隐空间分布,用正交运动字典加情绪子空间保留发音与情感耦合,再用逐层跨注意力融合音频与情绪去调制流匹配速度场,在 MEAD 上取得 82.05% 情绪准确率与 22.58 dB PSNR 并以十步采样实现实时推理,代价是仅覆盖英语与七类基本情绪且对大角度头部转动验证不足。

 · 更新于 2026-09-24 · 约 23 分钟 · 11091 字 阅读 →
论文解读

压缩对齐与异步去噪:READ 如何把扩散说话头做到实时

针对扩散说话头推理慢与长视频接缝断裂问题,READ 用 32×32×8 时空压缩加 SpeechAE 对齐音频与 A2V-DiT 生成,并在 HDTF 上以 4.421 骨干耗时取得 Sync-C 8.658 的竞争精度,代价是需 8 步采样与 Split-CFG 增加约 50% 耗时。

 · 更新于 2026-09-24 · 约 18 分钟 · 8991 字 阅读 →
论文解读

当打击乐手拿起鼓刷:用持续手势对抗鼓机映射的技术俘获

本研究通过与职业鼓手四个月的协同设计,将仅支持离散打击检测的映射扩展为连续手势 RNN 与离散分类协同的 Max4Live 工具包,并以十首曲目录制检验其在真实创作中能否抵御技术俘获,代价是连续特征时域精度与循环稳定性仍有限。

 · 更新于 2026-09-24 · 约 22 分钟 · 10805 字 阅读 →
论文解读

不用先转文字:音素瓶颈加单调对齐如何把尝试发声的脑信号直接变成可懂语音

针对尝试发声下无对齐声学目标且数据只有约 5 小时伪语音的问题,Brain2Speech-Net 用可微音素瓶颈加深度隐马尔可夫模型对齐到预训练语音合成隐空间做单遍合成,闭集语音词错率做到 0.068 并以约 0.5 实时因子运行,代价是开集词错率升至 0.472 且仍依赖合成伪语音目标。

 · 更新于 2026-09-24 · 约 18 分钟 · 8960 字 阅读 →
论文解读

在标准 vLLM 上跑实时对话语音:GEPARD 把定制算子移出解码循环的取舍

GEPARD 为实时对话把文本与 32 通道 GroupFSQ 音频在同一标准全注意力 Transformer 中联合自回归生成并用 NanoCodec 流式解码,以 vLLM 原生可服务为首要约束,通过 prefill 前缀克隆、单步并行采样与 DPO 蒸馏 CFG 实现单流 RTF 约 0.067 与 256 并发约 204 倍加速,代价是帧级并行带来的 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10716 字 阅读 →
论文解读

轮次向真实语音学,语义向可配文本学:有限状态机全双工的解耦数据路线

针对合成文本同时学轮次与语义不可靠的问题,该工作用真实人与人语音学轮次、用可改写的人与智能体文本保语义,配合规则化事件转磁带与来源感知校准损失,在等量 token 下把轮次 F1 从约 0.34 提升到约 0.65 并把语义恢复到接近基座上限,代价是暂停处理仍弱于保守系统且单带离散化会丢信息。

 · 更新于 2026-09-24 · 约 18 分钟 · 8979 字 阅读 →
论文解读

说了是谁还不够:全双工语音智能体能否在正确时刻做对地板动作

论文用同一段用户语音只换提示词的方法,测显式规则与角色暗示下的抢话、倾听与让出行为,发现内容像角色不等于动作像角色,且良性冲突会跟、安全冲突仍难覆盖。

 · 更新于 2026-09-24 · 约 17 分钟 · 8224 字 阅读 →
论文解读

严重程度拉开差距时仍要可用:用严重程度混合微调 Whisper-small 并在 Jetson 上实测

针对唇腭裂语音随严重程度差异大的识别难题,论文用不同严重程度组合微调 Whisper-small 并在 Jetson 上实测,NOMIMOSE 把合并词错误率从 62.46% 降到 22.72%,NOMIMO 把合并音素错误率降到 18.44%,CLP-only 拿到最接近零的公平性得分 -22.85,而微调模型保持 0.167-0.171 实时系数和约 …

 · 更新于 2026-09-24 · 约 18 分钟 · 8602 字 阅读 →
论文解读

当混响不再模仿房间:用声码器思路把噪声织成尾响

音频生成 | 7.2/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9147 字 阅读 →