论文解读

按语音层级拆开看:低层管内容音色、高层管韵律的视频到语音生成

针对无声视频生成语音时视觉稀疏而语音稠密的不对称问题,HiCoDiT 用残差向量量化的 12 层离散 token 层级先验把唇动身份与表情解耦注入低层和高层扩散块,在未训练的 LRS3 与 LRS2 上以 A/B 偏好 57.0% 对 38.1% 胜过 AlignDiT 等基线,代价是身份多样性受限且部分客观指标未全面领先。

 · 更新于 2026-09-24 · 约 17 分钟 · 8430 字 阅读 →
论文解读

不用重训练也能拧动音高与时值:残差流线性方向与正交解耦

论文在预训练多轨音乐 Transformer 上用均值差提取音高与时值方向并以系数加偏做推理期操控,以无条件与强条件延续实验验证线性可控性,并用格拉姆施密特正交缓解双属性纠缠,但大强度与极端下行仍带来质量退化。

 · 更新于 2026-09-24 · 约 16 分钟 · 7555 字 阅读 →
论文解读

采集条件会改变声音:用元数据调制音频 Transformer 的内部表示

针对听诊设备、听诊位置和病人特征带来的系统性偏移,该研究用门控残差、FiLM、TAFiLM 和 SoftFiLM 四种元数据调制机制改造音频频谱 Transformer,在 ICBHI 上 SoftFiLM 取得 4 类 64.11% 和 2 类 72.40%,代价是全层调制与全量微调及额外掩码正则。

 · 更新于 2026-09-24 · 约 18 分钟 · 8615 字 阅读 →
论文解读

在 24 平均律里学恰哈尕:PerFormer 如何把微分音、节拍位置和调式库存一起建模

针对波斯单声部微分音旋律生成问题,PerFormer 用位置—音高—时值事件序列加编解码 Transformer 与主音参考建模长程调式关系,在可调性准确率 90.18% 对 34.71% 和听感四项指标上超过一阶马尔可夫基线,代价是数据集仅 33 首原曲并集中于单一调式与 6/8 节拍且节奏有拉长简化倾向。

 · 更新于 2026-09-24 · 约 18 分钟 · 8535 字 阅读 →
论文解读

声音停了之后还怎么找:连续环境语义视听导航与记忆增强目标推理

论文提出连续环境语义视听导航任务 SAVN-CE 与记忆增强模型 MAGNet,用自运动线索加情景记忆维持静音后目标推理,直接报告最高 12.1 个百分点成功率提升,代价是 128 线程加 4 卡约 14 天训练与干扰声下增益收窄。

 · 更新于 2026-09-24 · 约 19 分钟 · 9454 字 阅读 →
论文解读

何时才该移动声音对象:SEND 把混音师的克制听感做成双流事件检测

论文把沉浸式混音中的对象移动形式化为音乐空间事件检测,用目标与背景双流加 Spec-TNT 与 TCN 和 CTGI 门控预测帧级移动概率,在 1000 个专业工程上报告 Frame-F1 为 0.7675 和 Event-IoU 为 0.6305,代价是仍有零星抖动且只预测何时动而不生成连续三维轨迹。

 · 更新于 2026-09-24 · 约 18 分钟 · 8695 字 阅读 →
论文解读

听到鸟叫不画鸟:为环境声景生成地理一致的街景

论文把问题定为地理上下文的声音景到景观生成,用声景加可选场景词生成街景级图像,以 SounDiT 三模块注入地理条件,在自建两套大数据集上以通用指标和三层地点相似度验证,代价是依赖预训练编码器与场景标注并需较多算力训练。

 · 更新于 2026-09-24 · 约 19 分钟 · 9353 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

整块循环打乱先听后写的流水线:BiCycle 用分组递归保留语音识别机制

针对整块循环把语言表示回灌到底层造成语音到语言反复的问题,BiCycle 用累积注意力对角性划分语音组与语言组并只在组内递归,在英语与法语数据上以约一半物理参数报告更低词错率,代价是仍需预训练教师与先蒸馏 30 轮再识别训练 100 轮的两阶段成本。

 · 更新于 2026-09-24 · 约 21 分钟 · 10296 字 阅读 →
论文解读

数模态个数再估计参数:计数密度网络如何把板混响脉冲变成模态三元组

任务是从合成板混响位移脉冲响应中恢复未知个数的频率、衰减和增益三元组,方法用 1/20 倍频程计数密度加固定槽位回归同时估计总数与属性,在 100 条独立脉冲的对比集上两个神经估计器的总相对误差约为 0.32,低于最强经典基线的约 1.10,但增益误差仍是主要误差来源。

 · 更新于 2026-09-24 · 约 19 分钟 · 9053 字 阅读 →
论文解读

长参考切短再选优:跨语言音色克隆如何兼顾内容与音色

针对中法跨语言音色克隆,该工作用 Qwen3-TTS-12 Hz-1.7B-Base 做零样本批量合成,配合 10 秒窗 5 秒步长的滑动切分与 ECAPA-TDNN 余弦选优,在中文 CER 低至 1.39% 至 2.25%、法语 WER 多为 4.40% 至 8.52% 的条件下得到中文最高 0.7052 与法语最高 0.7173 的余弦相似度,代价是保 …

 · 更新于 2026-09-24 · 约 18 分钟 · 8929 字 阅读 →
每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

把推理也当训练来扩展:掩码流匹配如何一步步重写音频

针对文本到音频中推理扩展不足与偏好错位问题,论文用连续掩码流匹配加迭代掩码重预测扩展推理计算,并用奖励加权微调对齐文本对应与审美,主证据是在 AudioCaps 上 FAD 为 1.10、KL 为 1.30、MOS-Q 为 78.87,代价是需要多步 ODE 求解与多轮掩码迭代。

 · 更新于 2026-09-24 · 约 18 分钟 · 8555 字 阅读 →
论文解读

一步跨越整条轨迹:MeanAudio 以平均速度实现单步文本转音频

针对流式与扩散式文本转音频需数十至数百步积分导致延迟高的问题,MeanAudio 以均值流回归区间平均速度并配合双文本编码与瞬时到平均课程,在 AudioCaps 上用 120M 参数实现单步 FD 14.30 与 RTF 0.013,代价是长音频与语音生成仍受限。

 · 更新于 2026-09-24 · 约 18 分钟 · 8822 字 阅读 →
论文解读

从局部连乘到全局直测:用三层约束补回骨骼结构的可懂复述

针对随语音生成全身动作时末端抖动与误差沿骨骼链放大的问题,论文把扩散建模搬到全局旋转空间并用关节、骨骼、时序三层约束补回结构,消融表显示完整约束取得最低分布距离,但节奏对齐仍有基线未被全面超越的代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9461 字 阅读 →
论文解读

每秒给出群体氛围单值并标记分歧:连续群体情绪的滑动窗口多模态建模

该研究把三人对话的群体情绪定义为每秒的唤醒与效价连续估计,用混合状态平行标记成员分歧,以冻结编码器加时序 Transformer 的因果滑动窗口建模,最强证据是音视频融合在一致性与误差上超过单模态,而高混合区间更大的误差揭示了单值表示的边界。

 · 更新于 2026-09-24 · 约 22 分钟 · 10579 字 阅读 →
论文解读

SegTune:把歌曲控制从整首描述下沉到分段时间窗

针对全局提示无法刻画配器情绪能量随段落演变的问题,SegTune 用全局加分段层级条件与大模型句级时长预测做非自回归扩散生成,在 15 首中文流行歌测试中把音素错误率降到 14.5% 并把音乐性主观分做到 4.57,代价是偏好优化后性别年龄跟随出现下滑。

 · 更新于 2026-09-24 · 约 19 分钟 · 9487 字 阅读 →
论文解读

在二值脉冲上做长短时序建模:SpikCommander 的多视角注意力与上下文 MLP

针对脉冲神经网络在语音命令识别中时序建模弱的问题,论文提出多视角脉冲时间感知注意力与上下文精炼 MLP 构成的 SpikCommander,在 SHD、SSC、GSC 上以 100 时间步取得更高精度,代价是更长的时序展开与更复杂的分支结构。

 · 更新于 2026-09-24 · 约 20 分钟 · 9683 字 阅读 →
论文解读

从波形到可弹指法:TART 如何把音高、技巧与弦品分四步拼成谱

TART 把吉他音频转谱拆成音频转 MIDI、九类技巧分类、音频条件弦品指派和 MusicXML 生成四步,用 81.35% 的平均音频转 MIDI F50 与 71.8% 的弦品 Tab F1 实现零样本领先,代价是第一步误差会向后传播约 17.75 个百分点。

 · 更新于 2026-09-24 · 约 19 分钟 · 9037 字 阅读 →