英文题目:Do What I Say: A Spoken Prompt Dataset for Instruction-Following

会议身份:conference:interspeech:2026:conference-paper-id:zufle26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #数据集构建 #多语言 #语音 #口语理解

评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Maike Züfle:机构信息未能从会议 PDF 纯文本可靠映射
  • Sara Papi:机构信息未能从会议 PDF 纯文本可靠映射
  • Fabian Retkowski:机构信息未能从会议 PDF 纯文本可靠映射
  • Szymon Mazurek:机构信息未能从会议 PDF 纯文本可靠映射
  • Marek Kasztelnik:机构信息未能从会议 PDF 纯文本可靠映射
  • Alexander Waibel:机构信息未能从会议 PDF 纯文本可靠映射
  • Luisa Bentivogli:机构信息未能从会议 PDF 纯文本可靠映射
  • Jan Niehues:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

语音大语言模型需在真实口语交互中理解多风格、多语言指令并执行转写、翻译、问答、摘要与合成等任务,难点在于文本提示评估掩盖了口语变体、录音条件与跨语言泛化的失效。作者构建DoWhatISay的链条为先由各任务专家撰写2条英文基础提示并按正式、非正式、详细、简短四种风格各改写2条形成每任务10条,再由母语者翻译本地化为德、英、意、捷、西、法、匈、荷、葡、俄、瑞共11种语言形成990条独特文本提示,最后由19名说话人用手机或笔记本电脑模拟对AI下指令录制并经响度语音活动检测裁剪成总计3小时17分钟的并行语音文本对。该设计与已有工作的关键机制差异在于指令与任务音频来自不同说话人且与下游基准解耦,配接时再组合而非预拼接合成指令,可复用于任意数据集。在FLEURS与MCIF等基准上以Qwen2.5-Omni评估,自动语音识别词错误率文本提示为12.60%,口语提示升至17.08%,机器翻译CometKiwi从81.41降至70.97,证实文本评估系统性高估。该结论在文本输出任务上稳定成立,在语音输出任务上差距消失或反转,且低资源语言与非正式、简短风格下退化更重。该结论适用边界受限于仅在Qwen与Phi两模型上验证,语音输出与跨设备噪声下的外推仍属尚未验证范围。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

为什么只用文字指令测语音模型会失真?

输入是用户的一句话指令加一段待处理语音或文本,目标是让语音大语言模型完成识别、翻译、问答、摘要、合成等任务。本文必须保留的信息是数据集规模与构造方式、评测模型与指标、文本与口语指令的对比结论。输出是一套可与任意已有基准拼接的口语指令集。当前主流做法是用文字指令评测语音模型,例如在屏幕上输入请转写这段语音,然后把测试音频拼在后面。这对初学者容易产生误解,以为模型读懂文字就等于听懂人话。

论文指出两个缺口。第一,真实使用是开口说,把会议录音转成文字吧或把刚才那个人说的话翻一下,指令本身也是语音,会带口音、录音设备和房间混响。第二,只用一种措辞评测会掩盖风格敏感性,正式说法与随口一说对模型难度不同。已有口语指令基准多用语音合成生成指令,且指令与测试内容焊死在一起,不能换数据集复用,只覆盖英语和中文,也只做单语问答。因此需要人录的、多语言的、与内容解耦的指令集。

指令跟随 × 口语指令: 指令跟随指模型不靠专用任务标签而靠自然语言描述决定做什么,口语指令指同一段描述以人声录音形式输入;前者负责定义任务语义,后者负责改变输入通道,两者搭配才能检验模型在真实开口交互下是否仍能正确映射语义到动作,而不只是读懂文字。

按一个样本走一遍更直观。假设你要测语音翻译,测试内容是一段法语演讲录音,指令是请把这段话翻译成英语。文字评测时指令是字符,模型只需做文本理解加语音编码。口语评测时指令变成另 1 位说话人用手机录的请把这段话翻译成英语,模型必须先从连续声波中恢复指令语义,再处理演讲音频,最后生成译文。两段音频说话人不同,这正是论文刻意保留的真实条件。

同类评测路线缺了哪一块?

按同输入、同目标、同监督来对照。文本指令跟随评测路线输入是文字指令加语音内容,目标是测多任务泛化,代表是 Speech-IFEval、AIR-Bench、MMSU、Dynamic-SUPERB 等。它们用大语言模型批量生成文字指令或人工写少量模板,优点是便宜、可扩展,缺点是没有口语通道。合成口语指令路线输入是合成语音指令,目标是补上口语通道,代表是 SpeechInstructBench 与 URO-Bench。它们用文本转语音系统朗读指令,优点是有了语音形式,缺点是合成音缺少真实录音的设备与口语变化,且指令与任务输入预先拼接,换一个下游数据集就要重做。

多语言口语问答路线如 SpokenNativQA 关注日常口语提问,但只做问答 1 个任务。跨语言指令路线 MCIF 做了多模态跨语言指令,但论文明确说 MCIF 只提供书面问题,因此作者还需让录制英语指令的标注者补录 MCIF 的问题录音,才能做口语提问评测。DOWIS 的定位不是再做一个下游内容基准,而是只做指令侧的可插拔模块,与上述内容基准互补。

论文到底要解决什么可复述的问题?

问题可以复述为三问。第一,当把同一条指令从文字换成人声,模型在 9 种输入输出组合下的成绩变化多少。第二,当措辞在基本、正式、非正式、详细、简短之间变化,成绩如何波动。第三,上述变化是否与语言和任务类型交互,例如低资源语言和跨语言任务是否更敏感,语音输出任务是否例外。教学例子是:把总结一下这次会议这句话分别打字和开口说给模型,比较摘要质量,这只是帮助理解的例子,不代表论文测过该具体会议。

论文实际覆盖的任务包括语音转文字方向的自动语音识别、语音问答、音频章节生成、语音翻译、语音摘要,文本到文本的机器翻译与文本摘要,文本到语音的语音合成,以及语音到语音的翻译,共 9 个任务,覆盖语音大模型全部输入输出模态。语言覆盖德语、英语、意大利语、捷克语、西班牙语、法语、匈牙利语、荷兰语、葡萄牙语、俄语、瑞典语共 11 种。

语音大语言模型 × 文本输出任务: 语音大语言模型指能同时处理语音与文本输入并生成文本或语音的模型,文本输出任务指自动语音识别、翻译、问答、摘要等最终交出文字的任务;前者提供跨模态能力,后者是检验指令通道影响的主战场,搭配理由是若指令通道改变而输出仍是文字,就能分离出指令理解的损失而不被语音合成质量干扰。

DOWIS 的全景是什么:指令与内容如何分开?

方法是先写好指令,再翻译,再人录,最后留出标准接口与任意内容基准拼接。全景分 4 步。第一步由熟悉各任务的研究者写英语基本指令,即他们平时做研究会用的自然说法,再改写出正式、非正式、详细、简短 4 种风格,每种风格两条,每任务共 10 条。第二步请母语者把英语指令翻译成其余 10 种语言,要求听起来自然,不是逐字直译。第三步请 19 位母语或高水平说话人用手机或笔记本电脑朗读,模拟真实开会时对着模型说话的场景,再做响度检测剪掉首尾静音。第 4 步评测时把一条 DOWIS 指令音频或文本与下游数据集的一条测试样本拼接输入模型,指令说话人与内容说话人天然不同。

解耦指令 × 下游基准: 解耦指令指指令文本与具体测试样本的语音内容分开存放,下游基准指 FLEURS、MCIF、YTSeg 等提供待识别、待翻译、待摘要内容的已有数据集;前者负责可复用的提示部分,后者负责待处理的内容部分,搭配后任意基准可即插即换一套口语指令,从而把口语评测成本从重建基准降为替换指令。

这种解耦带来两个好处。一是语言多样性与自然度由人保证,二是评测者不用为每个新基准重新录指令。论文强调这是首个多语言平行口语与文本指令数据集,平行指每条文字都有对应人声录音,可直接做模态对照。

五种风格具体怎么写?差别在哪里?

5 种风格各有分工。基本风格是研究者日常会用的自然说法。正式风格用职业化、打磨过的措辞。非正式风格是口语化、随意说法,论文举例的英文大意是嘿,你能把这段音频里说的话写出来吗。详细风格给出更明确的操作步骤,例如输出格式要求。

简短风格是在不产生歧义前提下最精简。每个风格每任务两条,避免单条措辞的偶然性。

提示风格 × 提示模态: 提示风格指 basic、formal、informal、detailed、short 5 种措辞方式,提示模态指同一句话以文字还是录音给出;前者负责措辞明确度与正式度,后者负责通道鲁棒性,两者正交组合才能区分成绩下降到底是因为说法太随意,还是因为模型听不懂人声指令。

对初学者要强调,风格与模态是两个正交维度。同一条详细指令可以打字也可以朗读。论文后文的热力图正是按风格切分再比较文字与口语的差值,从而判断非正式口语是否双重困难。

录音与剪辑流水线做了什么具体动作?

录音动作是请每种语言的标注者朗读该语言全部 90 条指令,即 9 任务乘 10 条。设备是个人手机或笔记本,刻意保留真实信道差异。格式统一转成 wav。剪辑动作是用基于响度的语音活动检测去掉首尾静音。具体是 10 毫秒滑窗计算响度,超过负 40 分贝相对满刻度即判为非静音,保留首尾非静音区外加前后各 500 毫秒,避免切掉起音和尾音。

统计上平均每条指令 4 到 5 秒,音频章节生成任务因包含详细格式要求平均约 16 秒。总量为 3 小时 17 分钟。下表整理数据集规模,表中数字与单位均来自原文连续句,裸值不擅自加单位,时长保留原文写法。

表前比较问题是:DOWIS 到底有多大规模、多少人录、每人录多久,能否支撑多语言多风格对照?公平条件是按任务语言对计数,文本与语音一一平行。

本研究训练了什么?没有训练时实际计算是什么?

本研究没有训练任何新模型,也没有微调 Phi 与 Qwen,这是数据集论文加评测分析,不是建模论文。因此不存在梯度路径、参数冻结与更新、优化器、学习率等训练要素,原文也未报告这些,缺项即缺项,不从模型名称推定实现。实际计算是构造流水线加推理评测。构造侧计算是响度检测、裁剪、补 500 毫秒、转 wav。推理侧是调用已有开源权重,以默认推理参数、批大小 1,在单张英伟达 A100-SXM4-40 GB 上跑全部任务语言风格组合。

跨语言任务的指令用目标语言表述。需要语音输出的任务只测 Qwen,因为 Phi 不支持音频生成。不能把未训练等同于确定性求解,解码仍有采样与模型内在随机性,默认参数不保证输出完全确定。复现时先做的是拿到指令音频文本对与下游内容,再按相同拼接方式送入相同模型权重,而不是重新训练。

评测用什么内容、什么指标、方向如何看?

按测什么、与谁比、条件是否一致来组织。内容选择是自动语音识别、机器翻译、语音翻译用 FLEURS,语音到语音翻译与文本转语音也用 FLEURS 但语音输出只限英语,因为 Qwen 只支持英语语音生成。文本摘要、语音摘要、语音问答、音频章节用 MCIF 与 YTSeg,其中 MCIF 的英文问题由录制者补录成口语问题,以支持口语提问。指标方向是词错率越低越好,CometKiwi 质量估计越高越好,BERTScore 语义相似度越高越好,Collar-F1 正负 3 秒越高越好,UTMOS 语音质量越高越好。语音输出任务先用 Whisper Large V3 转写生成语音,再算词错率或 CometKiwi,同时报 UTMOS。比较基线是同一模型、同一风格、同一语言下的文本指令,口语指令是待测条件,其余内容与解码参数一致。

内容准确率 × 语音质量: 内容准确率指转写后用 WER 或 CometKiwi 衡量的说了什么对不对,语音质量指用 UTMOS 衡量的听起来自然不自然;前者由语义解码决定,后者由声学合成决定,搭配评价才能避免把字说对但声音差与声音好但内容错混为一谈,这对文本转语音与语音到语音翻译尤为关键。

来源证据量化值一量化值二量化值三量化值四
来源句一2340——
来源句二500 ms———
来源句三26%18%13%5

表后解释是剪辑参数保守,500 毫秒留白与负 40 分贝阈值兼顾去静音与保真。整体 12.72% 的转写词错率表明指令本身可懂,分语言 16% 到 26% 也不足以解释后文几十个点的性能差,因此支持把落差归因于模型跟随口语指令困难。代价是该核验只用一个转写模型,未做人工听写,声学细节仍待验证。未评测边界是真实噪声、重叠说话、远场混响未覆盖。

模型调用与语言覆盖还有哪些必须对齐的细节?

为便于核对后文关于条件透明与适用边界的论证,下面先以来源句对照整理关键量化要点,再展开差异与局限讨论。

来源证据量化值一量化值二量化值三量化值四
来源句二1———

表后解释是主要收益是条件透明、可重放,代价是只测 2 个模型,不能推广到所有语音大模型。未胜出项是 Phi 在口语指令下自动语音识别词错率超过 100,表面看极差,但部分原因是语言支持与任务适配问题,需结合文本基线一起看,不能单看绝对值定生死。

文字换成口语后,哪些任务掉得最多?

核心发现是文本输出任务中文字指令一致更好,语音输出任务中两者打平或口语略好。论文报告显示,Qwen 与 Phi 在自动语音识别、机器翻译、语音翻译、语音摘要、文本摘要、音频章节上文本指令领先,只有文本摘要与语音问答在 Qwen 上差距较小。Phi 在口语自动语音识别上出现灾难性失败,词错率超 100,说明完全没跟上指令,尽管其文本指令成绩与 Qwen 可比。语音合成与语音到语音翻译上口语与文本相当,有时口语略好。

性别对照显示部分任务偏好男声或女声,但不稳定,且转写可懂度男女相近,例如文本摘要男女转写词错率均为 12%,成绩仍有差距,提示可能是模型内在说话人偏置,而非录音清晰度驱动,因此需要同时测两种性别。

图前导读覆盖图 1 的完整对象与条件:该图比较 Qwen 在文本与口语指令下的绝对性能差,正值紫色表示文本更好,负值表示口语更好,左侧为自动语音识别词错率差,右侧为机器翻译与语音翻译的 Comet 质量估计差,横轴为 11 种语言,时间范围为全量风格与样本平均。

看图路径: 1. 先看左侧 ASR 面板横轴 11 种语言与纵轴任务格的紫色深浅分布;2. 再对比右侧 MT 与 ST 面板中 cs、nl、sv 三列的深紫格;3. 最后核对色条含义:正值紫色表示文本指令更好,零附近浅色表示打平

原论文 Figure 1:Performance comparison for Qwen: Text Prompt vs Speech Prompts with respect to different target…

论文图 1。原论文 Figure 1:“Performance comparison for Qwen: Text Prompt vs Speech Prompts with respect to different target languages.”。

图后解释针对可见内容:左侧自动语音识别面板中捷克语与瑞典语格为最深紫色,数值分别达 35.74 与 40.00,葡萄牙语与荷兰语也明显偏紫,分别为 28.35 与 19.17,而西班牙语接近零甚至略负。右侧机器翻译与语音翻译面板中捷克语同样深紫,分别为 41.42 与 39.67,荷兰语与瑞典语次之。结合正文可知捷克语与瑞典语文本基线本身已接近随机,词错率超 100,因此大差值不全是模态损失;荷兰语与葡萄牙语文本基线可用,词错率 31 到 37,Comet 在 76 到 82 之间,此时口语仍大跌,才真正支持低资源与跨语言下口语泛化难的判断。像素不能精确辨别的中间浅色格不硬读具体数值,只看颜色趋势。

来源证据量化值一量化值二量化值三量化值四
来源句一911106;16;18;13
来源句三911106;16;18;13
来源句四122835s—

该表把来源中的主结果数值按原文证据句整理,数值和方向只适用于当前验证条件,不能外推到其他数据。

风格与语言交互时,非正式说法为何最危险?

总体趋势是不正式与简短指令在多数任务上最差,正式与详细指令较好,说明模型更吃结构化明确指令。但模态与风格有交互。对自动语音识别、机器翻译、语音翻译,文本在所有风格下都赢口语。对语音合成,正式与详细风格下口语更好,基本、非正式、简短风格下文本更好,呈现 nuanced 模式。对语言,捷克语、荷兰语、葡萄牙语、瑞典语的口语落差最大。

论文用 Whisper 核验强调这些语言指令可懂,分语言词错率仅 16%、26%、18%、13%,远小于任务落差,因此不是录音糊,而是模型听指令能力弱。重提结果时增加适用条件:该结论基于 Qwen 全语言分析,Phi 因严重失败与语言支持窄,不宜直接套用语言趋势。

把风格固定后,模态差距还剩多少?

把风格作为切分变量可看作一种消融式对照:固定措辞,只换通道。图前导读覆盖图 2 的完整对象与条件:该图比较 Qwen2.5-Omni 在 5 种风格下文本减口语的差值,正值紫色表示文本更好,黄色负值表示口语更好,左侧为单语任务含自动语音识别、问答、语音合成、章节、语音摘要、文本摘要,右侧为跨语言任务含机器翻译、语音翻译、语音到语音、摘要,指标随任务而变,时间范围为全语言平均。

看图路径: 1. 先沿左侧面板横轴五种风格看 ASR 行是否全为紫色正值;2. 再看 TTS 行中 formal 与 detailed 两格出现的浅黄色负值;3. 最后对比右侧 MT、ST 全紫与 S2ST 接近零的差异,确认输出模态的作用

原论文 Figure 2:Performance comparison for Qwen2.5-Omni: Text Prompt vs Speech Prompts with respect to different…

论文图 2。原论文 Figure 2:“Performance comparison for Qwen2.5-Omni: Text Prompt vs Speech Prompts with respect to different prompt types.”。

图后解释针对可见内容:左侧自动语音识别行全为紫色正值,基本风格达 25.72,非正式为 13.43,说明换通道必掉分。机器翻译与语音翻译右侧全紫,数值多在 10 到 16 之间,风格改变不了方向。关键反例在语音合成行,正式为负 7.41,详细为负 7.72,出现黄色格,表示口语反超文本,而非正式为正 11.31,说明风格翻转了模态优劣。语音到语音行接近零,数值为负 0.23 到正 0.36,支持语音输出任务对指令通道不敏感。文本摘要行接近零,说明该任务模态差距小,不能把总体趋势推广到每组。未胜出项是非正式与简短在多数任务仍最差,即使在文本模态下也偏低,表明措辞本身也有独立难度。

哪些边界没有测?什么推论还不能下?

论文直接报告的是 2 个模型、九任务、11 个语言、五风格下的文本与口语差距,支持文本评测高估能力的判断。有限解释是性别差异可能反映模型偏置,因为可懂度相近但成绩仍差,但这只是相关性,不是因果证明,未做说话人表征或训练数据审计,须用可能、待验证表达。未验证的是延迟、推理成本、误判率、多轮对话、远场噪声、口音覆盖,原文未测量这些,不能承诺口语指令改善这些量。每种语言仅 1 到 2 位说话人,不能代表该语言全部口音与年龄。

语音输出只测英语生成,不能推广到多语合成。资源状态方面,本次收到的证据未绑定完成 HTTPS 验证的资源,不得声称代码、模型或数据已公开,只能按论文脚注的占位理解为作者意向,复现前需自行确认链接可达。

要复现与复用,先做什么、记什么参数?

复现先做三件事。第一,按 9 个任务 11 个语言 10 条的清单准备指令文本与对应 wav,保持平行命名,核对总数 990 与总时长 3 小时 17 分钟。第二,用 10 毫秒滑窗、负 40 分贝阈值、首尾各 500 毫秒留白的流程重做剪辑,保证可比。第三,用相同下游内容切分,FLEURS 做识别与翻译,MCIF 做摘要问答并补录口语问题,YTSeg 做章节,指标分别用 jiwer 词错率、CometKiwi、归一化 BERTScore 配 DeBERTa XLarge MNLI、chunkseg 的 Collar-F1 与全局拼接 BERTScore、Whisper Large V3 转写加 UTMOS。运行条件记默认推理参数、批大小 1、单张 A100-SXM4-40 GB,跨语言指令用目标语言写,语音输出只跑支持语音生成的模型。何时值得尝试是当你要发布语音助手或多语会议工具,且用户会开口下指令时,必须加测口语指令与非正式风格,否则文本单模板评测会给出乐观假象。

一句话收束:什么时候必须加测口语指令?

当模型要被人开口指挥且输出是文字时,必须加测人录口语指令与多种风格,因为文本指令成绩不可直接外推。DOWIS 的价值在于把指令做成可插拔模块,让任何内容基准都能低成本补上口语对照。记住两个特例:语音输出任务中口语指令可打平或略优,非正式随口说法在多数任务上最难。对初学者的误解纠正是,词错率超 100 不是算错,而是插入错误过多导致的溢出,表示模型已偏离任务;CometKiwi 是无参考质量估计,高不代表译文与参考完全一致。

UTMOS 高只代表听感好,不代表内容对。下一步待验证是扩大每语言说话人数、覆盖噪声与口音、审计性别偏置来源,并补测延迟与成本后再谈部署收益。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总