音频提示词为何难偷:先做启发式锚定,再用沙普利值解开纠缠
针对文本到音乐模型的黑盒提示词窃取问题,AudioStealer 用相似度引导的启发式搜索定方向、再用沙普利值量化各语义单元贡献做精修,在 InspireMusic 上以语义 59.4%、音乐 70.1% 的可复现流程实现最强证据,代价是依赖本地影子模型的多次查询与精修计算。
针对文本到音乐模型的黑盒提示词窃取问题,AudioStealer 用相似度引导的启发式搜索定方向、再用沙普利值量化各语义单元贡献做精修,在 InspireMusic 上以语义 59.4%、音乐 70.1% 的可复现流程实现最强证据,代价是依赖本地影子模型的多次查询与精修计算。
针对音频问答依赖短线索和文本捷径的问题,AUDITA 用 9690 个人类撰写的真实音频 trivia 题加项目反应理论分析,显示人类自由作答 32.13% 而模型平均仅 8.86%,代价是题源偏英语 trivia 且人类基线为非专家抽样而非能力上限。
AV-Dialog 针对多人干扰下跟丢目标说话人与抢话时机错乱问题,用声学码加唇部视觉做流式理解与轮次预测,在干扰下把轮次预测准确率从 54% 提升到 79%,代价是双模型并行与视觉前视带来的额外延迟与显存开销。
针对可控语音合成中指令理解与语音生成耦合导致标注昂贵的问题,该文把外部大语言模型定为指挥家生成逐段音高能量音色数值计划、把 BatonTTS 定为乐团按计划合成,最强证据是 1.7B 模型在英文情感准确率 57.6% 并零样本迁移到中文 56.2%,代价是依赖外部大模型生成计划并引入约 20 秒级计划延迟与两阶段推理链条。
针对全模态情感推理中模型过度依赖视觉而忽视声音与文本的模态坍缩问题,该工作用带引导词的结构化推理数据做冷启动,再用基于引导词熵的奖励做强化学习校准模态使用,在四个情感基准上取得多项最优并保留通用能力,代价是对极端长尾类别与强模态冲突仍敏感。
论文把自动语音识别为中心的监督视为感知弱的原因,用转写、副语言、非语言事件三部分的结构化统一音频模式组织监督,在保持推理的同时把 MMSU 感知从 44.8% 提升到 55.7%,代价是需要多阶段对齐与合成标注的质量控制。
论文把音频章节切分从句子序列搬到时间轴上,对比文本加声学特征、纯音频 AudioSeg 与多模态大模型,报告 AudioSeg 在 YTSeg 上显著领先而停顿是最有效的手工特征,同时揭示长音频与多说话人下的衰减与评估不可比问题。
该综述把印度语言 NLP 按六大组十七个细粒度任务重组,用 200 余数据集、50 余评测和 100 余模型工具的覆盖来暴露语言与任务的不均衡,并以可核对的资源清单支撑后续复用。
BoYaEval 用 3175 张原貌古谱图像把考题分成认符号、译指法、推旋律三层,报告显示 21 个主流多模态大模型在基础识别尚可但在旋律推理仅约 27% 到 30%,而把示例从零增至多示例也不能打通跨谱式推理瓶颈。
针对多模态大模型做音视频语音识别时视觉时间建模粗糙且深层解码逐渐丢失时序的问题,论文用编码端时间感知注意力和解码端分层时间 token 堆叠来补时间信息,在 LRS2 与 LRS3 上把纯视觉识别词错率做到更低,代价是只在英语离线句子级条件下验证且增加了投影与注意力模块的开销。
针对反转式音频编辑必须用密集固定步数导致计算昂贵的问题,论文提出免训练的自适应轨迹外推框架 AdaTE,只在高曲率与高信息增益处做神经网络评估,其余用线性外推跳过,在 AudioLDM2 上以 12.8 次评估达到 3.9 倍加速且保真度基本不降,但激进阈值与极端不稳定轨迹仍会带来退化。
针对对话中模态缺失切断细粒度跨模态因果链的问题,CaM-HG 采用先由历史条件混合专家补全再由非对称因果动态超图挖掘的路线,在 IEMOCAP 等 3 套基准上报告了高缺失率下更慢的衰减,但连续极端缺失与结构因果解耦仍是边界。
针对中文儿童语音数据少、方言覆盖窄、缺少完整对话的问题,论文构建 112.5 小时 498 名 2-8 岁儿童与 500 名看护人的 ChildTalk 语料,并在同库与跨库上证明微调能稳定降低字错率,而加入上文提示可进一步减少替换与删除错误,但低资源方言与低龄段仍很困难。
CIS-BWE 针对带限语音缺失高频的问题,用双流 ConformerNeXt 生成器并行恢复幅度和相位,再用李雅普诺夫与去趋势涨落两类混沌判别器约束非线性动态,在 VCTK 与 MLS 上以约一半生成参数取得更优感知质量,代价是训练期李雅普诺夫特征计算使单轮训练时间明显增加。
论文用固定文字、只改声音的合成对照测音频语言模型能否把可听症状用于分诊,最强证据是高风险声音配安心文字时多数模型仍跟文字走,而代价是大量平局与无效输出且声学敏感度随疾病和模型剧烈波动。
针对语音输入推理明显弱于文本的模态推理鸿沟,论文提出非对称奖励的在线轨迹对齐框架 TARS,用表示对齐约束层间隐状态、用行为对齐约束输出语义,在 MMSU 与 OBQA 上把语音恢复率提升到 98.89 到 100.45 区间,代价是约 27.5 小时基线之上的在线强化学习与约 4.4% 额外奖励计算开销。
CMTD 针对纯文本与浅层推理在对话情绪识别中误判复杂思维模式的问题,用多智能体分别提取大五人格特质、四步认知扭曲、表情与语音描述再融合预测,在 MELD 与 IEMOCAP 零样本条件下报告优于同条件基线的准确率,同时以多轮大模型调用带来明显更高的时间与费用开销。
针对长语音与对话生成的评测缺口,该工作构建 1101 样本、17 场景的 SwanBench-Speech 并提出 7 个解耦指标,用人类一致性验证支撑其发现的混响一致性与表现力层次短板,但高表现力场景与多说话人声场统一仍代价明显。
该文把有声书按叙述与人物直接引语切分并构建 LibriQuote,再用引文微调与从头训练检验自回归与流匹配两类语音合成基座的表现力与可懂度变化,主要代价是小数据从头训练会损失可懂度和域外泛化。
ControlAudio 把定时可控与可懂语音生成拆成文本、定时、音素三级条件,用结构化提示、三阶段训练和两段采样实现统一控制,在 AudioCondition 与 AC-Filtered 上提升时间精度与可懂度,代价是更依赖标注与仿真数据的分布假设和更长的多阶段训练。