论文解读

声调写不出来时,让词素先把语法说清楚:Morpho-VITS 的形态建模

针对卢旺达语正字法省略声调与音节时长导致端到端合成语调难的问题,该工作用词素编码器加音素到词素交叉编码器替换 VITS 文本编码,在 10 千句可懂度与 21 人主观评测上提升自然度与语调,但以 169M 词素参数与训练时长增加为代价且对未见词素敏感。

 · 更新于 2026-09-24 · 约 18 分钟 · 8926 字 阅读 →
论文解读

文本定意图、空间音频定方位与时机:MoSAT 的分层条件动作生成

MoSAT 针对空间音频加文本联合驱动人体动作的新任务,用运动 VAE 压缩加变换器流匹配分层融合条件,在 STAM 联合评测中对齐与分布质量占优,但强噪声与模态错位时仍会退化。

 · 更新于 2026-09-24 · 约 22 分钟 · 10891 字 阅读 →
论文解读

在可解码潜空间里做进化推断:祖先鸟声如何被生成出来

该文把鸟声编码到冻结语音潜空间后学习与系统发育距离对齐的低维性状投影,在性状空间做布朗运动祖先推断再经锚定逆提升解码为新波形,在两个支系上同时实现真实生成、系统发育一致与自然音质,但零空间纹理仍依赖现存录音锚点。

 · 更新于 2026-09-24 · 约 8 分钟 · 3558 字 阅读 →
论文解读

以重建代替配对:SongCraft 用条件密度统一歌曲生成与细粒度编辑

论文把生成与编辑看作稀疏到稠密的条件谱,用同一潜在流匹配模型在生成分支与重建分支间随机切换训练,以词级音素对齐、节拍条件和变分自编码器表征对齐提升可懂度,并用残差瓶颈容量换取重建保真度与可编辑性,最强证据是分离人声词错误率做到 0.133 但感知质量仍落后于偏好优化基线。

 · 更新于 2026-09-24 · 约 23 分钟 · 11229 字 阅读 →
每日研究速递

icmc-2026 论文深度解读

共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 123 分钟 · 61526 字 阅读 →
论文解读

肌电难听难看时如何调模型:用音频通道做拐杖的跨模态信号翻译

论文要解决肌电信号不可听不可判导致的生成模型难调试问题,选择先用含音频的七通道数据找架构再转六通道肌电的策略加两个残差向量量化变分自编码器与交叉注意力解码器 Transformer,最强证据是七通道实验中成功配置重建多样性恢复而过大隐维度配置坍缩,代价是六秒序列限制与推理仍需音频起始符。

 · 更新于 2026-09-24 · 约 19 分钟 · 9367 字 阅读 →
论文解读

用坐标找配乐:手工聚类守住可解释基线,深度生成模型换来连续检索

该文在 FME-24 上比较手工特征 k-Means 与 VaDE 加对比学习的情感检索,前者聚类更紧致而后者支持按坐标连续取歌,但两类结果都受样本少与情感区间压缩的限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9590 字 阅读 →
论文解读

把高斯方差换成重尾假设,远场多人日志为何更稳

针对远场多通道会议中混响噪声与重叠语音的日志难题,该工作把神经 FCASA 的高斯源方差模型推广为瘦峰广义高斯与学生 t 分布的重尾模型并统一为高斯尺度混合训练目标,在 AMI、AliMeeting 和 CHiME-6 上报告了日志错误率与 Jaccard 错误率下降,但部分形状参数会退化且跨语料直接迁移仍明显变差。

 · 更新于 2026-09-24 · 约 17 分钟 · 8093 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

用手势字幕补上语义:CoordSpeaker 如何让说话人边说边做指定动作

针对手势数据缺描述文本导致的语义先验缺口与音频加描述难以协调控制的问题,CoordSpeaker 先用动作语言模型离线生成多粒度手势字幕,再用统一表示的潜在扩散加分层去噪器实现语音节奏与字幕语义的联合生成,最强证据是推理耗时大幅下降与文本对齐指标领先,代价是部分重建指标未占优且长序列时序感知仍有限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9508 字 阅读 →
论文解读

不追求更像人脸,而是生成对判别更有用的视觉特征:跨模态引导的抑郁识别训练框架

针对临床访谈数据少导致视觉编码器学不好,该工作用音频文本为条件合成视觉特征并与识别器联合优化,在 DAIC-WOZ 上 F1 达到 0.86、在 E-DAIC 上 CCC 达到 0.69,代价是依赖词级对齐与端到端联合训练的复杂度。

 · 更新于 2026-09-24 · 约 21 分钟 · 10499 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

谁在即兴?当小提琴与单簧管各带一个 AI 同台

两位演奏者用自选小数据集分别训练神经音频合成与语料库合成乐器并同台即兴,现象学回看法显示能动性分散在策展、架构与实时协商之中,代价是系统美学冲突时必须停奏、重配或回到档案重做。

 · 更新于 2026-09-24 · 约 21 分钟 · 10021 字 阅读 →
论文解读

不重放历史声音:用水扰动驱动神经合成的克制式记忆装置

该装置用双特雷门手势驱动水下水听器产生湍流并以此激励只在太澳与香港仔海岸环境录音约 thirty hours 上训练的 RAVE 模型,代价是约 90-250 milliseconds 的可感知延迟与激进手势对神经信号的掩蔽,只在水面平静时才让历史以时间包络形式短暂可闻。

 · 更新于 2026-09-24 · 约 18 分钟 · 8896 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

大规模与噪声下还要控准基频:VAE-SiFiGAN 用重合成误差筛掉 F0 提取错误

针对 F0 可控声码器在大规模多说话人训练和噪声下是否仍可控的问题,论文用概率潜变量替代确定性特征并以重合成谱误差做数据筛选,报告显示筛选能阻止错误数据拖累训练、上移 F0 时清浊判断更准而下移与高频区仍有挑战、噪声下优于基线,但筛选阈值仍需人工设定。

 · 更新于 2026-09-24 · 约 19 分钟 · 9402 字 阅读 →
论文解读

动作生音乐为何先学压缩再学对齐:个性化舞蹈乐器的取舍

论文用动作捕捉配对即兴音乐训练个人化动作到音乐系统,以两阶段压缩加跨模态预测实现实时生成,最强证据是域内重建与分布对齐可用但域外泛化与声码器质量仍是主要代价。

 · 更新于 2026-09-24 · 约 22 分钟 · 10778 字 阅读 →
论文解读

不对齐就硬解码会塌到同一团声音:舞者用身体投票校准的跨模态对齐

该文要解决固定映射跟不上舞者个体与动作质感变化的问题,选择把动作变分自编码器编码器与 RAVE 音频解码器冻结后只学一个轻量对齐层并由舞者二值反馈门控更新,探索性会话显示连续性动作的感知连贯性有所改善而重音与停顿仍常失配。

 · 更新于 2026-09-24 · 约 19 分钟 · 9342 字 阅读 →
论文解读

把高维潜轨迹铺成可走的地形:Latent Terrain 如何驯服神经音频自编码器

针对解码器独奏式潜空间漫游难以控制且标准多层感知机存在谱偏置的问题,论文用傅里叶特征坐标映射把音频集的潜轨迹铺成二维可交互地形,在鼓、弦乐与语音三类素材上提升映射精度且仅轻微增加实时开销,代价是高斯尺度需手工权衡欠拟合与过拟合。

 · 更新于 2026-09-24 · 约 21 分钟 · 10117 字 阅读 →