论文解读

不重放历史声音:用水扰动驱动神经合成的克制式记忆装置

该装置用双特雷门手势驱动水下水听器产生湍流并以此激励只在太澳与香港仔海岸环境录音约 thirty hours 上训练的 RAVE 模型,代价是约 90-250 milliseconds 的可感知延迟与激进手势对神经信号的掩蔽,只在水面平静时才让历史以时间包络形式短暂可闻。

 · 更新于 2026-09-24 · 约 18 分钟 · 8896 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

只做整段分类的模型,能否用积分梯度找回声音何时出现

论文用带精确起止时间的合成复调音频检验片段级分类器的事后积分梯度时间定位能力,最强证据是积分梯度达到平均交并比 0.39 与帧级 F1 值 0.52,接近弱监督帧级模型,但峰值定位一致性代价明显。

 · 更新于 2026-09-24 · 约 15 分钟 · 7240 字 阅读 →
论文解读

FoleySet:用两层动作 taxonomy 把拟音从宽泛标签拉回制作现场

针对拟音数据缺乏动作与材质细粒度标注的问题,论文用两层人工分类体系组织 10000 段拟音并给出可复现基线,最强证据是大类准确率 0.82 而 73 类降至 0.64,代价是长尾分布与单标注者带来的细类混淆。

 · 更新于 2026-09-24 · 约 19 分钟 · 9179 字 阅读 →
论文解读

未见声音总被判成熟悉声音:用属性生成补数据,再用分布检测先分流

针对广义零样本声事件分类中未见类被大量判为已见类的问题,论文用属性条件 GAN 生成未见类隐特征训练分类器,再以类级分布外检测做分流与概率融合,在 RWCP-SSD 上把调和平均从 36.2 提高到 78.7,代价是类级检测器数量与阈值调节成本增加。

 · 更新于 2026-09-24 · 约 15 分钟 · 7495 字 阅读 →
论文解读

扇子为中心、社群为尺度:中越扇舞互动乐器的社区知情设计

该研究以 18 位中越散居社群扇舞者访谈为依据,提炼文化、社群、个体三层身份协商框架,并据此做出单把短尾传感折扇原型,以加速度控水声音量、握力控音色、按键触发水花声做初步验证,代价是仅 2 人即兴试用且未做正式演出与听众评估。

 · 更新于 2026-09-24 · 约 22 分钟 · 10772 字 阅读 →
论文解读

只重建正常包络:用 LPC 谱加 NMF 记忆约束异常声音检测的重建

针对仅用正常录音训练时自编码器会重建异常输入的问题,该研究把每段音频压缩为一条 LPC 谱包络并只用正常字典的记忆加权来重建,在 MIMII 上以 90.6% 平均 AUC 超过 GRLNet 的 77.2%,代价是 Toy-conveyor 这类依赖细粒度时频线索的机器类型上 LPC 平滑可能削弱区分性。

 · 更新于 2026-09-24 · 约 15 分钟 · 7474 字 阅读 →
论文解读

不追紧同步的混音台:Mezcal 用浏览器 MCU 把远距离合奏做成电台

Mezcal 要解决多人随时随地用浏览器做协作电台的问题,选择 Janus 网关的 MCU 集中混音加 N-1 返送与档案代理,最强的实践证据是持续 6 年的 Conduction Series 等跨国直播,代价是放弃紧同步演奏并承担集中带宽与代理成本。

 · 更新于 2026-09-24 · 约 21 分钟 · 10469 字 阅读 →
论文解读

画面内外都要出声:OmniSonic 如何把语音和环境声放在同一视频里生成

针对视频配音只做可见环境声、做不了语音与画外声共存的问题,OmniSonic 用视频加文本联合条件的流匹配扩散与三路交叉注意力加门控融合,在自建的三场景基准上同时生成语音与环境声,主观与客观指标报告全面领先,但时间同步仍弱于带细粒度同步视觉特征的基线。

 · 更新于 2026-09-24 · 约 19 分钟 · 9217 字 阅读 →
论文解读

不拟合频谱而是重放点火脉冲:脉冲串加共振器的发动机声建模

针对发动机爆燃脉冲的时序本质,论文用可微脉冲串加卡普拉斯-斯特朗共振器重建声音,在三类发动机共 7.5 小时音频上把总验证损失平均降低 5.7%、谐波重建提升 21%,代价是共振器音色偶尔偏离目标且尚未在真实录音上验证。

 · 更新于 2026-09-24 · 约 17 分钟 · 8068 字 阅读 →
论文解读

一次生成一小段连续潜块:SCAPES 如何用轻量流模型做语义可控的环境声

针对环境声语义描述粗疏而波形稠密、离散量化破坏连续性、非因果编解码拼接易产生边界伪影的问题,SCAPES 冻结 EnCodec 连续潜空间并用条件连续归一化流做段级自回归生成,在约 34 分钟 10 类数据上以约 36M 参数单卡约 1 小时训练实现长稳可控合成,代价是对语音音乐等长结构建模不足且部分类别指标未胜出。

 · 更新于 2026-09-24 · 约 18 分钟 · 8698 字 阅读 →
论文解读

带底噪也要无缝改口:先分离再压残留噪声的语音编辑

针对带环境噪声的插入与替换编辑问题,SeamlessEdit 选择先用分离模型分出人声与噪声、再用稀疏贝叶斯与滤波压残留噪声并做语境精修,在 EARS-WHAM 上把插入自然度做到 3.78 而基线 VoiceCraft 仅 2.93,代价是仍需依赖现成分离与编辑模型且对女声高频与重叠说话人保留残留问题。

 · 更新于 2026-09-24 · 约 17 分钟 · 8091 字 阅读 →
论文解读

学新声会改旧解释:类增量音频分类中的解释漂移如何被遗忘与竞争推高

该文在 ESC-50 的 5 任务类增量设置下用 Integrated Gradients 跟踪任务级解释漂移,报告含回放的混合方法同时获得最高平均准确率 0.4400 与最低遗忘 0.3896 并压低解释漂移,而正则化方法遗忘高且漂移大。

 · 更新于 2026-09-24 · 约 17 分钟 · 8514 字 阅读 →
论文解读

骑行发声:在城市里移动演奏如何同时触及个人、群体与环境

论文用四辆联网电动货运自行车组成可移动演奏系统,在亚特兰大 11 km 群骑中验证个人聆听、共在群体与城市环境三种声音互动尺度的切换,代价是无定量声学测量、依赖社区领骑保障安全且重型硬件仍需迭代。

 · 更新于 2026-09-24 · 约 19 分钟 · 9267 字 阅读 →
论文解读

标签各说各话时,用工业分类把三个音效库拼成一个可训练语料

针对音效数据集标签体系互不兼容导致无法合并与比较的问题,论文用通用类别系统做共享标签空间,以规则四级流水线加冲突消解完成重标注与分层划分,最强证据是三库自动映射率达 98.49% 至 100% 并建成 58057 条的 EnvSound-UCS,代价是混合训练并未超越单库训练且存在标注噪声与划分泄漏风险。

 · 更新于 2026-09-24 · 约 19 分钟 · 9296 字 阅读 →
论文解读

听到鸟叫不画鸟:为环境声景生成地理一致的街景

论文把问题定为地理上下文的声音景到景观生成,用声景加可选场景词生成街景级图像,以 SounDiT 三模块注入地理条件,在自建两套大数据集上以通用指标和三层地点相似度验证,代价是依赖预训练编码器与场景标注并需较多算力训练。

 · 更新于 2026-09-24 · 约 19 分钟 · 9353 字 阅读 →
论文解读

强监督从哪里来:用高质量描述重建语音音乐环境声的统一标签

该文把预训练瓶颈定位为监督源弱而散,用高保真描述器加统一标签系重建强监督,并在同量音频上比较多种目标,显示数据质量与覆盖决定泛化而目标决定任务分化,但域内事件任务仍需更大规模验证。

 · 更新于 2026-09-24 · 约 16 分钟 · 8011 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

转写之外还要听见什么:用统一音频模式补上感知的短板

论文把自动语音识别为中心的监督视为感知弱的原因,用转写、副语言、非语言事件三部分的结构化统一音频模式组织监督,在保持推理的同时把 MMSU 感知从 44.8% 提升到 55.7%,代价是需要多阶段对齐与合成标注的质量控制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8979 字 阅读 →