在可解码潜空间里做进化推断:祖先鸟声如何被生成出来
该文把鸟声编码到冻结语音潜空间后学习与系统发育距离对齐的低维性状投影,在性状空间做布朗运动祖先推断再经锚定逆提升解码为新波形,在两个支系上同时实现真实生成、系统发育一致与自然音质,但零空间纹理仍依赖现存录音锚点。
该文把鸟声编码到冻结语音潜空间后学习与系统发育距离对齐的低维性状投影,在性状空间做布朗运动祖先推断再经锚定逆提升解码为新波形,在两个支系上同时实现真实生成、系统发育一致与自然音质,但零空间纹理仍依赖现存录音锚点。
该研究用同一冻结编码器流程与 1501 事件配额比较四种嗓音库,发现抹香鲸类型积累最快而孟加拉雀局部顺序依赖最强,且加长历史会把比较推向鲸,代价是结论只在原生事件尺度与档案录音条件下成立。
针对两头同龄雄性幼鲸近距离身体接触时连续重叠喀哒声串难以归属的问题,论文用单通道恒 Q 变换谱加步间间隔节律做声学解交织,再用三元紧凑阵列到达时差定位投影到视频验证,在简单场景聚类误差为 0.0%、最难场景达 25.79%,并以 10 度容限实现主要发射者最高 100% 水平视觉一致,代价是垂直方向系统性偏差与近平面阵列几何盲区导致两个场景无法最终归属。
论文以 2021 年专辑《Amazônia Verde Viva》与 2024 年对 Thiago 的访谈为证据,说明先解码动物发声结构再作曲的 transmorphic 路线,并以常用音频软件的挪用讨论技术殖民与多物种共作的代价与边界。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该研究用分布外海洋哺乳动物叫声构造感知与认知两类选择题,测低层听觉,最强证据是人类 Remember 达 97.1% 而模型仅 57.1% 左右,代价是题型限于单选题且只覆盖单一生态域。
针对海豚发声时长伸缩与连续频谱难以直接比较的问题,论文将 ClustalW 的离散替换得分改为高斯核平均相似度并配合微调 Whisper 的 128 维嵌入做渐进式多序列比对,在成体攻击与幼体游戏攻击两类精细策展数据上以间隙结构与列方差等指标验证了对齐能恢复同步化爆脉冲等时序母题,但代价是领域适配与早停阈值仍需人工校准且过度拉伸会稀释时间分辨率。
音频分类 | 8.7/10
音频分类 | 7.2/10
声源定位 | 4.0/10
生物声学 | 7.2/10
音频分类 | 8.5/10
生物声学 音频事件检测 | 8.1/10
BeeVe: Unsupervised Acoustic State Discovery in Honey Bee Buzzing
生物声学 | 8.0/10
生物声学 | 7.5/10
生物声学 | 7.5/10
生物声学 | 7.0/10
音频分类 | 6.5/10