每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

不重训模型也能玩两年:用重映射和小数据打开智能乐器设计空间

该研究用树莓派加 MIDI 连接现成乐器的智能乐器平台和小数据混合密度循环网络做两年第一人称演出,报告显示最便宜硬件推理小于 5 毫秒且重映射可替代重训,但证据限于作者一人 15 场演出而未做对照听感评估。

 · 更新于 2026-09-24 · 约 19 分钟 · 9108 字 阅读 →
论文解读

先猜手势再发声:用投机执行把扩散音频生成挤进指挥手势的微观时间

针对手势完成后才识别再生成导致 213 ms 级感知延迟的问题,论文用提前预测手部落点并预生成音频加猜错回滚的方法,在 16 选 1 受限实验中把 Top-15 预测做到手势完成前发声、Top-16 做到 77 ms 微观尺度,代价是 Top-1 单猜错误率高达 66 %。

 · 更新于 2026-09-24 · 约 19 分钟 · 9266 字 阅读 →
论文解读

循环脉冲网络不必全连接:用一维卷积加可学习轴突延迟做语音建模

针对循环脉冲网络中稠密循环矩阵参数平方增长的问题,该工作用核长为 3 的一维卷积替代全连接循环并保留每个神经元可学习的轴突延迟,在 SHD 上达到 91.51% 精度并把单层循环参数从 65792 降到 259,代价是在 SSC 上落后 DelRec 约 4 个百分点且 SSC 未做超参搜索。

 · 更新于 2026-09-24 · 约 19 分钟 · 9139 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

不做频谱,直接读波形:用 CNN-GRU 从板混响脉冲响应反推六个可辨识物理参数

针对 DAFx 参数估计挑战 Task A 从未归一化位移脉冲响应恢复板混响物理参数的问题,论文用三层一维卷积加双向 GRU 的时域回归器直接预测六个可辨识参数,在 150 例开发测试集上以参数归一化均方误差 0.0499 优于粒子群优化基线的 0.0618,并把单条推理时间从 36.46 秒降到 1.10 秒,代价是面密度一项略差且最优检查点早在第 5 轮 …

 · 更新于 2026-09-24 · 约 16 分钟 · 7913 字 阅读 →
论文解读

无声时肌肉还在说话:用通道协方差把肌电直接译成音素

该文只用静默构音肌电与文本转写、用对称正定矩阵表示通道间相关再接门控循环网络与联结时序分类损失做音素级序列转换,在大词表单被试上报告音素错误率 48.47% 与词错误率 73.53%,代价是仍需双向整句解码且主要证据来自单名健康被试。

 · 更新于 2026-09-24 · 约 19 分钟 · 9104 字 阅读 →
论文解读

先对齐多帧运动、再用声音补嘴部细节:GAVN 的时域与身份互补修复

针对带声音的人脸视频在压缩、模糊和低分辨率下的退化,GAVN 用低分辨率空间的帧间时域特征做粗修复、用高分辨率空间的音频加关键点身份特征补细节,在 VoxCeleb2 和 Obama 两种说话人场景下取得最优的图像质量与唇音同步分数,但代价是两阶段训练与多模块推理成本。

 · 更新于 2026-09-24 · 约 16 分钟 · 7903 字 阅读 →
论文解读

当打击乐手拿起鼓刷:用持续手势对抗鼓机映射的技术俘获

本研究通过与职业鼓手四个月的协同设计,将仅支持离散打击检测的映射扩展为连续手势 RNN 与离散分类协同的 Max4Live 工具包,并以十首曲目录制检验其在真实创作中能否抵御技术俘获,代价是连续特征时域精度与循环稳定性仍有限。

 · 更新于 2026-09-24 · 约 22 分钟 · 10805 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-10

共分析 44 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 93 分钟 · 46170 字 阅读 →
论文解读

音频三路特征与视频时空建模为何需要注意力来对齐:多模态情绪识别的可复述路径

针对单模态易受噪声与信息缺失影响的问题,论文用 Wav2Vec2、MFCC 与统计声学特征经 BiLSTM 建模音频、用 ResNet50-BiLSTM 建模视频,并以多头交叉注意力做特征级融合,在 MELD 上微平均 93.7% 与 IEMOCAP 上 90.3% 准确率上验证效果,但未报告训练超参细节与统计显著性。

 · 更新于 2026-09-24 · 约 22 分钟 · 10959 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-09

共分析 1 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 2 分钟 · 1002 字 阅读 →
论文解读

只给顺序不给时间:用会遗忘的节奏记忆补上塔布拉转录的弱监督缺口

音乐转录 | 6.3/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11985 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-01

共分析 49 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 151 分钟 · 75584 字 阅读 →
论文解读

把教师的回声残差教给小模型:AEC 蒸馏到底补回了什么

回声消除 | 8.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4423 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-27

共分析 21 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 54 分钟 · 26637 字 阅读 →
论文解读

EM-KalmanNet: Learned Expectation-Maximization for Adaptive Tracking in Partially Known, Block-Wise Time-Varying State-Space Models

声源定位 | 8.8/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5988 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-26

共分析 26 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 68 分钟 · 33830 字 阅读 →
论文解读

Training DeepFilterNet with Accurate Room Acoustic Simulations Improves Single-Channel Speech Enhancement

语音增强 | 9.0/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4932 字 阅读 →