改音色不改骨架:Melodia 只替换自注意力查询与键来保住旋律
针对改乐器风格情绪时旋律节奏易丢失的问题,Melodia 在冻结的 AudioLDM 2 上做部分逆向并只替换 8 到 14 层自注意力图来保结构,探测分类与三数据集主客观实验支持其在文本贴合和结构保持间的平衡,但综合分依赖跨方法归一化且未报告延迟与误改成本。
针对改乐器风格情绪时旋律节奏易丢失的问题,Melodia 在冻结的 AudioLDM 2 上做部分逆向并只替换 8 到 14 层自注意力图来保结构,探测分类与三数据集主客观实验支持其在文本贴合和结构保持间的平衡,但综合分依赖跨方法归一化且未报告延迟与误改成本。
针对语音内容音色情感纠缠与控制粗糙问题,MF-Speech 用三流编码器提纯离散因子再用动态融合与分层风格归一化组合生成,在多因子组合任务上报告 WER 为 4.67% 与 SECS 为 0.5685,但重建自然度与部分解耦指标仍有代价与边界。
针对自由文本到 MIDI 语义对齐不足与调号速度拍号结构失配问题,MIDILM 采用前缀条件加共享掩码自注意力与文本 MLP 加 MIDI 混合专家双路前馈,在 MidiCaps 上相对最强基线在 CLAP 到 TB 上提升 6.07% 到 144.77%,代价是调性建模仍弱且复杂转调下降,未公开代码链接当前不可用。
MMAU-Pro 用 5305 组野外音频与 49 项技能考查长时、多音频、空间与文化理解,最强模型仅 59.2% 准确率,暴露感知到推理的断层与指令遵循短板。
针对同音替换、字形拆解、缩写与中英混写等伪装使纯文本失效的问题,MMBERT 把文本、合成语音与字形图像经对齐器送入共享自注意力加混合专家结构,并用三阶段渐进训练稳定优化,在 ToxiCloakCN 上报告 F1 为 95.2,代价是依赖合成多模态输入与较重的分阶段调参。
针对闭集说话人识别的投毒后门问题,论文用时域上的频率调制与幅度调制构造全局平滑触发,在中毒率 0.05 等条件下报告数字与物理场景的高攻击成功率,同时保持良性准确率下降有限,但干净标签等更难设置的性能明显走弱。
针对多语言端到端语音翻译中共用单组低秩更新导致语言间干扰的问题,MoLoRA 把多个低秩适配模块当作专家并辅以多粒度语音融合,在 MuST-C 八语言平均 32.2 与 CoVoST-2 三语言平均 36.3 的 BLEU 下超过同量级单 LoRA,代价是路由与负载均衡等额外机制和调参成本。
针对只有音乐输入而缺乏动机控制的问题,MotivDance 用文本生成关键姿态作动机、自适应定位到音乐节拍再做扩散补间,在 AIST++ 稀疏关键帧上取得 FIDk 64.36 与关键帧误差 0.1211,但无关键帧时节拍对齐仍弱于部分基线。
论文把音乐诱发绘画评估定义为直接预测感知一致性分数,用音乐调制视觉的 MPJudge 结合回归与偏好优化学习,在自建专家标注集上报告 SRCC 0.86 与 MAE 0.04,代价是更大的绘画编码器与对专家标注的依赖。
针对音素到词到语句单向建模不足与分层加深导致初始编码遗忘问题,论文提出双向交互注意力加残差分层的 HIA 框架,在 speechocean762 上以音素词句多指标领先为证据,代价是小数据下增大容量反而难优化。
针对生成式语音修复中似然目标与听感偏好错位及单指标奖励作弊问题,论文用四维一致投票构造约 8 万偏好对并做 DPO 对齐,在 AR、掩码生成与流匹配三范式上报告了一致的客观与主观增益,代价是依赖自动指标代理与同范式数据更有效。
该提案要把语音感知大语言模型从只做转写扩展到原生联合完成自动语音识别与说话人切分,做法是冻结大语言模型主干、分两阶段训练音频编码器与适配器并加入上下文提示,证据是所列开源切分数据的时长与语言分布以及词错率与切分错率的明确定义,代价是切分标注数据少且尚未给出可运行系统的定量主结果。
针对单模态指令在相似物体环境中易歧义的问题,论文提出 MINav 任务与 NaVLA2 个模型,用空间语义双分支音频编码与边想边做解码实现多模态接地,最强证据是在 MINav 上达到 27.2% 成功率与 19.6% 路径加权成功率,代价是仍需三阶段训练与连续仿真渲染。
针对全模态大模型忽略视听证据与视频音频互相对不齐的问题,OmniDPO 用文本偏好对与加噪模态偏好对做条件偏好优化,在 Qwen2.5-Omni 与 MiniCPM-o-2.6 上降低幻觉并提升推理,但仍受基座视觉能力限制。
针对情感、性别、年龄、语言等多副语言任务互相干扰的问题,ParaMETA 用共享 META 正则加任务独立子空间与原型对齐同时做分类与可控合成,最强证据是 LSTM 等骨干上 12/16 个骨干-任务组合最优与性别操控 100% 准确,代价是 META 正则增益不稳定且语言操控几乎无效。
针对听诊数据稀缺且正常与异常声音频谱特性不同,PASA 把增强选择建模为马尔可夫决策过程并用混合批量-样本策略执行,在三个基准上提升诊断分数,但个性化依赖验证集奖励与样本统计积累,计算代价高于固定增强。
针对严重噪声下生成式增强容易编造内容与音色的问题,PASE 把预训练 WavLM 蒸馏成去噪专家并用高低层双流重建波形,在自建 LibriTTS 低信噪比集上把内容错误压到更低,同时以双流声学条件把说话人相似度拉回可用水平,代价是浅层声学流会带入残留噪声并拉低部分感知分。
针对文本主导压制音频与视觉的模态竞争问题,PaSE 用模态内原型校准与熵正则最优传输对齐语义,再用双阶段融合与 Shapley 梯度调制平衡优化,在 MOSI、MOSEI 和 IEMOCAP 上报告最优结果,但缺失代码可用性与显著性检验等复现细节。
论文针对视觉-语言-动作模型的摄像头与麦克风输入,研究用激光、电磁、超声等物理信号注入的八种攻击如何导致任务失败,并用先干净训练再混入攻击数据的对抗训练在保持干净性能的同时提升中强度攻击下的鲁棒性,代价是干净集平均约 3% 的下降与部分强攻击仍难完全防住。
针对端到端语音翻译只对齐文字内容而丢失重音与情绪的问题,论文用语音编码器与风格编码器双分支加分层最优传输和注意力检索来分离并再融合两类信息,在 ContraProST 上提升方向性约 5.0 点、全局约 4.5 点,在 CoVoST-2 上 2B 平均提升 0.43 BLEU、8B 提升 0.98 BLEU,代价是两阶段训练与额外风格编码器开销。