不重放历史声音:用水扰动驱动神经合成的克制式记忆装置
该装置用双特雷门手势驱动水下水听器产生湍流并以此激励只在太澳与香港仔海岸环境录音约 thirty hours 上训练的 RAVE 模型,代价是约 90-250 milliseconds 的可感知延迟与激进手势对神经信号的掩蔽,只在水面平静时才让历史以时间包络形式短暂可闻。
该装置用双特雷门手势驱动水下水听器产生湍流并以此激励只在太澳与香港仔海岸环境录音约 thirty hours 上训练的 RAVE 模型,代价是约 90-250 milliseconds 的可感知延迟与激进手势对神经信号的掩蔽,只在水面平静时才让历史以时间包络形式短暂可闻。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
论文用带精确起止时间的合成复调音频检验片段级分类器的事后积分梯度时间定位能力,最强证据是积分梯度达到平均交并比 0.39 与帧级 F1 值 0.52,接近弱监督帧级模型,但峰值定位一致性代价明显。
针对拟音数据缺乏动作与材质细粒度标注的问题,论文用两层人工分类体系组织 10000 段拟音并给出可复现基线,最强证据是大类准确率 0.82 而 73 类降至 0.64,代价是长尾分布与单标注者带来的细类混淆。
针对广义零样本声事件分类中未见类被大量判为已见类的问题,论文用属性条件 GAN 生成未见类隐特征训练分类器,再以类级分布外检测做分流与概率融合,在 RWCP-SSD 上把调和平均从 36.2 提高到 78.7,代价是类级检测器数量与阈值调节成本增加。
该研究以 18 位中越散居社群扇舞者访谈为依据,提炼文化、社群、个体三层身份协商框架,并据此做出单把短尾传感折扇原型,以加速度控水声音量、握力控音色、按键触发水花声做初步验证,代价是仅 2 人即兴试用且未做正式演出与听众评估。
针对仅用正常录音训练时自编码器会重建异常输入的问题,该研究把每段音频压缩为一条 LPC 谱包络并只用正常字典的记忆加权来重建,在 MIMII 上以 90.6% 平均 AUC 超过 GRLNet 的 77.2%,代价是 Toy-conveyor 这类依赖细粒度时频线索的机器类型上 LPC 平滑可能削弱区分性。
Mezcal 要解决多人随时随地用浏览器做协作电台的问题,选择 Janus 网关的 MCU 集中混音加 N-1 返送与档案代理,最强的实践证据是持续 6 年的 Conduction Series 等跨国直播,代价是放弃紧同步演奏并承担集中带宽与代理成本。
针对视频配音只做可见环境声、做不了语音与画外声共存的问题,OmniSonic 用视频加文本联合条件的流匹配扩散与三路交叉注意力加门控融合,在自建的三场景基准上同时生成语音与环境声,主观与客观指标报告全面领先,但时间同步仍弱于带细粒度同步视觉特征的基线。
针对发动机爆燃脉冲的时序本质,论文用可微脉冲串加卡普拉斯-斯特朗共振器重建声音,在三类发动机共 7.5 小时音频上把总验证损失平均降低 5.7%、谐波重建提升 21%,代价是共振器音色偶尔偏离目标且尚未在真实录音上验证。
针对环境声语义描述粗疏而波形稠密、离散量化破坏连续性、非因果编解码拼接易产生边界伪影的问题,SCAPES 冻结 EnCodec 连续潜空间并用条件连续归一化流做段级自回归生成,在约 34 分钟 10 类数据上以约 36M 参数单卡约 1 小时训练实现长稳可控合成,代价是对语音音乐等长结构建模不足且部分类别指标未胜出。
针对带环境噪声的插入与替换编辑问题,SeamlessEdit 选择先用分离模型分出人声与噪声、再用稀疏贝叶斯与滤波压残留噪声并做语境精修,在 EARS-WHAM 上把插入自然度做到 3.78 而基线 VoiceCraft 仅 2.93,代价是仍需依赖现成分离与编辑模型且对女声高频与重叠说话人保留残留问题。
该文在 ESC-50 的 5 任务类增量设置下用 Integrated Gradients 跟踪任务级解释漂移,报告含回放的混合方法同时获得最高平均准确率 0.4400 与最低遗忘 0.3896 并压低解释漂移,而正则化方法遗忘高且漂移大。
论文用四辆联网电动货运自行车组成可移动演奏系统,在亚特兰大 11 km 群骑中验证个人聆听、共在群体与城市环境三种声音互动尺度的切换,代价是无定量声学测量、依赖社区领骑保障安全且重型硬件仍需迭代。
针对音效数据集标签体系互不兼容导致无法合并与比较的问题,论文用通用类别系统做共享标签空间,以规则四级流水线加冲突消解完成重标注与分层划分,最强证据是三库自动映射率达 98.49% 至 100% 并建成 58057 条的 EnvSound-UCS,代价是混合训练并未超越单库训练且存在标注噪声与划分泄漏风险。
论文把问题定为地理上下文的声音景到景观生成,用声景加可选场景词生成街景级图像,以 SounDiT 三模块注入地理条件,在自建两套大数据集上以通用指标和三层地点相似度验证,代价是依赖预训练编码器与场景标注并需较多算力训练。
该文把预训练瓶颈定位为监督源弱而散,用高保真描述器加统一标签系重建强监督,并在同量音频上比较多种目标,显示数据质量与覆盖决定泛化而目标决定任务分化,但域内事件任务仍需更大规模验证。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
论文把自动语音识别为中心的监督视为感知弱的原因,用转写、副语言、非语言事件三部分的结构化统一音频模式组织监督,在保持推理的同时把 MMSU 感知从 44.8% 提升到 55.7%,代价是需要多阶段对齐与合成标注的质量控制。