论文解读

给波形编码器补上频谱课:JASPER 的时频联合掩码预训练

针对语音模型泛化不到环境音、频谱模型保不住语音时序的问题,JASPER 在共享 Transformer 上联合预测时域伪标签与频域块标签,原文报告 2000 小时下平均准确率 81.74% 与 XARES-LLM 两轨 0.66 和 0.50 的领先均值,但频谱权重极偏向 0.01 且推理仍只用波形输入。

 · 约 18 分钟 · 8958 字 阅读 →
论文解读

暂停更安静却漂移更大:语音编码器表示漂移与任务损失的错位

该研究冻结八个语音编码器并在整段、仅语音、仅暂停三种放置下加入非语音干扰,用余弦漂移与四项下游任务损失对比,显示整段干扰下漂移可按声音排序任务损失,而安静到中等强度下暂停干扰漂移更大但语音干扰任务损失更大,且低于估计背景的干扰已可达到重复录制级别的漂移。

 · 约 23 分钟 · 11094 字 阅读 →
论文解读

录音很多不等于见过很多海域:被动声监测中空间异质性如何抬高验证分数

论文用 908072 段 AIS 标注录音说明部署间先验差超 200 倍、随机窗口验证比未见站点验证高出配对 0.049 的 ROC-AUC,因而主张按站点分组验证并扩大独立空间采样,空间专家模型仍只是待验证假设。

 · 约 22 分钟 · 10750 字 阅读 →
论文解读

误识别还是抽象化:置信度不足时声音识别该输出什么

论文把声音事件识别的输出从单一确定标签改为类别加置信度加拟声词描述,用冻结编码器加可训练投影器与分类器实现分类与检索联合训练,在 31 类子集上保持分类能力,并在约 85% 准确率的模拟不确定条件下用大模型评价与 310 人听评显示拟声输出更有助于环境理解,代价是拟声不匹配会损害自然度。

 · 更新于 2026-09-24 · 约 20 分钟 · 9637 字 阅读 →
论文解读

只给一次提醒意图,让音频大模型自己决定何时开口:中断与静默建模

论文把连续音频监护形式化为四态打断或静默决策,用两个特殊词嵌入解码,在 ESC-50 上报告 99.6% 中断 F1 与 100.0% 去重召回,在未训练的 Epic-Sounds 上保持 96.7% 起始召回,代价是嘈杂域静默召回仅 10.1% 与平均 3.5 秒流式延迟。

 · 更新于 2026-09-24 · 约 18 分钟 · 8551 字 阅读 →
论文解读

在可解码潜空间里做进化推断:祖先鸟声如何被生成出来

该文把鸟声编码到冻结语音潜空间后学习与系统发育距离对齐的低维性状投影,在性状空间做布朗运动祖先推断再经锚定逆提升解码为新波形,在两个支系上同时实现真实生成、系统发育一致与自然音质,但零空间纹理仍依赖现存录音锚点。

 · 更新于 2026-09-24 · 约 8 分钟 · 3558 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

把打断与背景声做成可听的监督:DuplexDrama 四阶段合成管线解读

DuplexDrama 针对全双工对话训练数据稀缺问题,用四阶段管线同时合成人设场景、三种全双工行为、表情语音与剧本对齐的声音事件,最强证据是相同语音加背景仅带来 UTMOSv2 与 NISQA 的可控下降,主要代价是全双工轮次占比仅 3.8% 且剧本合理性依赖 LLM 判断。

 · 更新于 2026-09-24 · 约 16 分钟 · 7540 字 阅读 →
论文解读

同一份自然声景为何实验室听得准、博物馆听得散:房间与阵列如何重塑沉浸

该研究用 2 阶录制加 3 阶解码把 5 段自然声景放在实验室与博物馆的 16 只 Genelec 阵列上对比,报告显示存在感较稳而深度、包围感、清晰度与稳定性在混响展厅中下降,代价是房间与垂直阵列构形混在一起无法分离。

 · 更新于 2026-09-24 · 约 16 分钟 · 7868 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

在机房里吹哨:把生成式 AI 的噪音与污染摆到台前的声音宣言

作者针对 2025 年 IEEE Big Data AI 音乐生成研讨会音乐比赛的浅层话语,用两人气鸣乐器在 GPU 机房的约一小时现场表演与录音构成抵抗行动,报告显示作品最终因赛后追加的 AI 方法与时长限制而落选,而代价是高参会费与规则不透明使抗议难以进入正式评审。

 · 更新于 2026-09-24 · 约 19 分钟 · 9209 字 阅读 →
论文解读

手势进机器之后还剩什么:拉美赛博格主义的三次智利实践

论文追问手势在新乐器与机器共创中如何被数据化与操控,提出以拉美赛博格主义重嵌社会语境,并以抗议分析、 telematic 拼贴与生态工作坊三例显示情境化方法的收益,其代价是缺乏可比指标与可复用系统评估。

 · 更新于 2026-09-24 · 约 22 分钟 · 11004 字 阅读 →
论文解读

把运球变成叙事:篮球身体动作如何被转写为六段式电声音乐

该研究以室内篮球场实地录音为唯一主体材料,用颗粒拉伸、频谱变换、动态滤波与空间运动把运球、滑步、撞击转写为怀疑、挣扎与救赎的六段叙事,其代价是全程依赖感知判断而无可复测的定量指标与对照实验。

 · 更新于 2026-09-24 · 约 16 分钟 · 7891 字 阅读 →
论文解读

年轮作穹顶:把生态录音与语言痕迹做成同心的时间尺度

该作品以树木年轮为结构隐喻,用颗粒与频谱处理、VBAP 穹顶空间化与文本到三维扩散生成,把约八分半钟的微观到宏观生态时间做成穹顶声像层,其代价是垂直声像不如水平声像清晰且缺乏可量化的听众评估。

 · 更新于 2026-09-24 · 约 21 分钟 · 10513 字 阅读 →
论文解读

参考引导的音效变体:用同一生产目标比较不同编辑能力的方法

论文把音效生产归纳为九项需求,用共享的参考到音频变体任务加原生能力分析比较五个异构基线,证据显示 AudioX 在保真与身份保持上最均衡而多样性、时序控制与局部修复各有所长且伴随效率与域外退化代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9663 字 阅读 →
论文解读

场景决定何为噪声:自动上下文去噪如何先判场景再去异物

该文把去噪目标改为随声场景变化的界内与界外事件,用先做声场景分类再做条件掩蔽去噪的两阶段网络,在六类场景配对数据上以可运行的 UNet 为基线对比,学习到的上下文取得最高 SI-SDR 但合成混合的统计失配仍是主要代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9951 字 阅读 →
论文解读

看不见的生成器:用通用音频语义加图结构抓环境音伪造痕迹

针对未见过文本到音频与音频到音频生成器的环境音伪造检测,论文用高效音频 Transformer 做前端加图注意力后端,配合差分微调与编解码增广,在 EnvSDD 上报告测试等错误率 2.48%,代价是依赖大规模预训练与特定增广组合。

 · 更新于 2026-09-24 · 约 19 分钟 · 9357 字 阅读 →
论文解读

电影混音三轨分离:用脸与场景两路视觉约束生成式分离

针对电影混音需分离对白、音效、音乐且缺乏带干净分轨的视听电影数据问题,该工作用条件流匹配同时生成三路频谱并以面部与场景双路视觉为条件,合成数据训练后在合成与真实电影片段上获得更干净的主观与分布指标,但多步采样与预测模型在信噪比类指标上的差距仍是代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8648 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →