<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Audio-Language Models on 语音/音乐/音频论文速递</title>
    <link>https://nanless.github.io/audio-paper-digest-blog/tags/audio-language-models/</link>
    <description>每日 AI 自动生成的语音/AI 领域论文深度分析</description>
    <language>zh-cn</language>
    <lastBuildDate>Thu, 27 Aug 2026 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://nanless.github.io/audio-paper-digest-blog/tags/audio-language-models/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>让同一组录音按用户视角重新分组：AudioLens 如何把语音聚类变成集合推理</title>
      <link>https://nanless.github.io/audio-paper-digest-blog/posts/2026-08-27-audiolens-multi-perspective-speech-clustering-2608-25177/</link>
      <pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate>
      <guid>https://nanless.github.io/audio-paper-digest-blog/posts/2026-08-27-audiolens-multi-perspective-speech-clustering-2608-25177/</guid>
      <description>&lt;h1 id=&#34;让同一组录音按用户视角重新分组audiolens-如何把语音聚类变成集合推理&#34;&gt;让同一组录音按用户视角重新分组：AudioLens 如何把语音聚类变成集合推理&lt;/h1&gt;
&lt;blockquote&gt;
&lt;p&gt;英文题目：&lt;em&gt;AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models&lt;/em&gt;
arXiv：&lt;a href=&#34;https://arxiv.org/abs/2608.25177&#34;&gt;2608.25177&lt;/a&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;标签：&lt;/strong&gt; #speech clustering #audio-language models #reasoning distillation #preference optimization&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;评分：&lt;/strong&gt; &lt;strong&gt;7.45/10&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;八维分项：&lt;/strong&gt; 创新 1.7/2 ｜ 技术严谨 1.25/1.5 ｜ 实验充分 1.35/1.5 ｜ 清晰度 0.9/1 ｜ 影响力 1.2/1.5 ｜ 开源 0/1.5 ｜ 可复现 0.3/0.5 ｜ 工程/实践 0.75/1.5&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;作者与机构：&lt;/strong&gt; Wenjun Huang, Qiaosong Chu, Tiger Shao, Pengfei Zhang, Yutong Song, Hanning Chen, Yezi Liu, Weiyi Wu, SungHeon Jeong, Ryozo Masukawa, Sanggeon Yun, Yang Ni, Jiang Gui, Mohsen Imani&lt;/p&gt;</description>
      <content:encoded><![CDATA[<h1 id="让同一组录音按用户视角重新分组audiolens-如何把语音聚类变成集合推理">让同一组录音按用户视角重新分组：AudioLens 如何把语音聚类变成集合推理</h1>
<blockquote>
<p>英文题目：<em>AudioLens: Multi-Perspective Speech Clustering with Reasoning Audio-Language Models</em>
arXiv：<a href="https://arxiv.org/abs/2608.25177">2608.25177</a></p>
</blockquote>
<p><strong>标签：</strong> #speech clustering #audio-language models #reasoning distillation #preference optimization</p>
<p><strong>评分：</strong> <strong>7.45/10</strong></p>
<p><strong>八维分项：</strong> 创新 1.7/2 ｜ 技术严谨 1.25/1.5 ｜ 实验充分 1.35/1.5 ｜ 清晰度 0.9/1 ｜ 影响力 1.2/1.5 ｜ 开源 0/1.5 ｜ 可复现 0.3/0.5 ｜ 工程/实践 0.75/1.5</p>
<p><strong>作者与机构：</strong> Wenjun Huang, Qiaosong Chu, Tiger Shao, Pengfei Zhang, Yutong Song, Hanning Chen, Yezi Liu, Weiyi Wu, SungHeon Jeong, Ryozo Masukawa, Sanggeon Yun, Yang Ni, Jiang Gui, Mohsen Imani</p>
<p><strong>机构：</strong> University of California, Irvine（Wenjun Huang、Pengfei Zhang、Yutong Song、Hanning Chen、Yezi Liu、SungHeon Jeong、Ryozo Masukawa、Sanggeon Yun、Mohsen Imani）；Independent Researcher（Qiaosong Chu）；Dartmouth College（Tiger Shao、Weiyi Wu、Jiang Gui）；Purdue University Northwest（Yang Ni）</p>
<p><strong>一句话概括：</strong> 把“按什么视角聚类”交给自然语言指令，并让音频语言模型直接输出完整分区。</p>
<h2 id="-毒舌点评">💬 毒舌点评</h2>
<p>指标够漂亮，但没有代码、权重、数据入口和许可证，复现门槛仍主要靠想象力。</p>
<h2 id="-核心摘要">📌 核心摘要</h2>
<p>论文以受控合成英语语音基准检验视角条件化分区；RD+DPO 组合取得强结果，但自然录音、多语言与部署外推仍未被验证。</p>
<h2 id="-开源与复现资源">🔗 开源与复现资源</h2>
<p>未发现代码 URL、模型权重、可下载数据入口或许可证。</p>
<h2 id="-深度解读">🧭 深度解读</h2>
<h3 id="同一组录音为何会同时拥有多种正确分区">同一组录音为何会同时拥有多种正确分区</h3>
<p>设想一个客服录音库：同一批来电可以按“客户最想解决什么”归类，也可以按情绪、说话人数或背景环境归类。前一种划分依赖说话内容，后三种依赖语速、音色、重叠说话和环境声等副语言线索；它们都可能是正确答案。这里的任务不是把每段音频贴上一个预先给定的类别，而是给定一条自然语言视角和一组编号录音，输出互不重叠、覆盖全部编号的簇，并自己推断簇数。</p>
<p>传统做法有两条常见路线。第一条是“ASR—文本嵌入—聚类”：自动语音识别（ASR）先把语音变成文字，句向量模型把文字映射为向量，再用 K-Means 或高斯混合模型（GMM）按距离分组。它的监督或归纳偏好来自文本表征与固定聚类算法，擅长文字足以区分的主题，却会把情绪、说话人数量和噪声场景等声音事实压扁。第二条是“转写—大语言模型直接分簇”：语言模型能阅读用户给出的视角，但它仍只看转写文本；原生音频语言模型虽然能直接接收波形，却未必会同时比较多段录音、推断簇数，并交出一个每个编号恰好出现一次的合法分区。</p>
<p>AudioLens 的可证伪判断因此很具体：若把原始音频和分组视角一起交给经任务化训练的模型，它应当比文字中转路线更能按指定视角组织集合，并且这种收益不应只出现在文字语义任务，也应出现在情绪、说话人数、性别和背景噪声等声音侧视角。反过来，如果优势只在见过的文本类别中出现，或模型不能稳定给出完整分区，这个解释就站不住。</p>
<p>读图任务：下图的三栏不是性能比较，而是辨认信息在何处丢失。左栏把语音压成转写和向量；中栏让 LLM 按指令处理转写；右栏把原始音频与视角共同送入模型。因此它支持“输入接口保留副语言信息”的设计动机，但不单独证明模型已经学会聚类。</p>
<p><img alt="原论文 Figure 1：三种音频聚类范式" loading="lazy" src="https://arxiv.org/html/2608.25177v1/crop_teaser-2.svg"></p>
<p>图中右栏所承诺的输出仍必须接受后面的 ARI 与 V-measure 检验；仅仅能接收音频，不等于已经在未见视角上可靠分区。</p>
<h3 id="先把分区写成约束才能知道模型究竟要答什么">先把分区写成约束，才能知道模型究竟要答什么</h3>
<p>论文把输入录音集合记为 \(\mathcal{D}=\{a_1,a_2,\ldots,a_n\}\)，把用户的自然语言分组要求记为 \(p\)。输出是簇集合 \(\mathcal{C}=\{C_1,C_2,\ldots,C_K\}\)：每个 \(C_k\) 非空，不同簇不共享录音，所有簇合在一起又必须正好覆盖 \([n]\)。也就是说，模型不是猜一个主题词，而是给出 \((K,\mathcal{C})=f_\theta(\mathcal{D},p)\)。簇名和簇的排列顺序不重要；重要的是任何两个编号被分到一起还是分开，以及没有重复或遗漏。</p>
<p>这三个定义对应原文公式（1）—（3）：第一个定义候选簇集，第二个给出“不重叠且全覆盖”的合法性，第三个明确 \(K\) 也由模型推断。它把“同一组音频按不同问题有不同正确答案”变成可测任务，而不是把聚类误当作单一、固定的声学距离。</p>
<h3 id="端到端路线先看五个环节再拆数据和训练">端到端路线先看五个环节，再拆数据和训练</h3>
<p>在进入基准和任何数字前，可以把 AudioLens-R1 的整条路线压缩为：<strong>视角 \(p\) + 编号音频集合 → 7B Audio Flamingo 3 基座的 LoRA 适配 → 推理蒸馏（RD）比较轨迹 → 合法但错误分区的 DPO 偏好训练 → 推断 \(K\) 与全覆盖分区</strong>。这里的“编号”让输出可以逐项检查；音频路径让模型保留语义与副语言证据；文本路径提供自然语言视角；训练的两个阶段分别处理“怎样比较”和“在多个合法答案格式中偏好哪一个”。</p>
<table>
	<thead>
			<tr>
					<th>训练环节</th>
					<th>是否显式负例</th>
					<th>直接优化什么</th>
					<th>预期改善</th>
					<th>仍可能混杂什么</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>RD（推理蒸馏）</td>
					<td>否</td>
					<td>生成比较过程和规范答案的自回归概率</td>
					<td>学会按视角比较多个录音、推断 \(K\)</td>
					<td>教师轨迹质量与合成训练分布</td>
			</tr>
			<tr>
					<td>DPO（直接偏好优化）</td>
					<td>是，且为合法错误分区</td>
					<td>选中答案相对拒绝答案的概率差</td>
					<td>在格式已合法时减少错合并、错拆分等错误</td>
					<td>负例筛选和偏好集合覆盖</td>
			</tr>
	</tbody>
</table>
<p>论文明确报告 RD 从 7B Audio Flamingo 3 初始化，以 LoRA 做参数高效微调；并非从零训练音频编码器。文中没有逐层展开音频特征如何进入基座的内部实现，因此不能把“原始音频输入”进一步臆测成某一种未报告的帧级融合结构。</p>
<h3 id="基准用控制合成检验视角而不是字面捷径">基准用控制合成检验“视角”而不是字面捷径</h3>
<p>AudioLens-Bench 由 ECHR 法律案例、S&amp;P 500 年报、Banking77 银行业请求和 MultiWOZ 任务型对话构成。它们原本是文字或对话材料，论文先诱导并精炼互斥的分组视角，再把视角写成不泄露类别名的自然语言指令。短银行请求被扩写成口语脚本；长法律和财务文本先压缩为保留判别证据的摘要，再改写为口语；MultiWOZ 保留原生对话。每个脚本要再次被分类并保持原标签，随后才由 Qwen3-TTS 合成为音频。</p>
<p>读图任务：图 2 中应从左到右定位“源语料—视角/类别精炼—转写验证—TTS 合成”的分支；生成文本若直接泄露视角名、类别名或近似指令会被过滤。图里的控制分支也说明：对语义视角，情绪、说话人和噪声尽量在类别间均衡；对副语言视角，目标属性才定义标签，其余属性随机化。它支持该基准在设计上抑制捷径，却不能替代自然录音或多语言场景上的外部验证。</p>
<p><img alt="原论文 Figure 2：AudioLens-Bench 构造流程" loading="lazy" src="https://arxiv.org/html/2608.25177v1/crop_benchmark_pipeline-3.png"></p>
<p>原文还报告三名作者独立审阅视角相关性、转写准确性、音频可懂度、语义标签正确性与注入属性的可感知性；不一致样本会丢弃并重生成。这个流程使“声音侧收益”更容易解释，但评测材料仍是合成的英语语音，控制严格不等于部署环境已经覆盖。</p>
<h3 id="l0l1l2-分别在问重组新录音还是新视角">L0、L1、L2 分别在问重组、新录音还是新视角</h3>
<p>Held-in（训练内）视角的指令和分类体系参与训练；Held-out（训练外）视角、类别和录音都为 L2 保留。L0 是见过视角、见过录音、但未见过这次类别/音频组合的重组鲁棒性；L1 是见过视角、未见录音；L2 则同时是未见视角、未见录音和未见组合。因而 Held-in 不是“更容易的随机测试集”，而是视角体系已参与训练；L2 才直接检验跨视角泛化。</p>
<p><strong>表 1 的问题是：四个来源在训练和三种测试层级各有多少独立录音与聚类实例？</strong> 每个 #Audio 是唯一录音数，#Data 是聚类实例数；它描述基准规模，不是模型分数。</p>
<table>
	<thead>
			<tr>
					<th>语料</th>
					<th style="text-align: right">训练 #Audio</th>
					<th style="text-align: right">训练 #Data</th>
					<th style="text-align: right">L0 #Audio</th>
					<th style="text-align: right">L0 #Data</th>
					<th style="text-align: right">L1 #Audio</th>
					<th style="text-align: right">L1 #Data</th>
					<th style="text-align: right">L2 #Audio</th>
					<th style="text-align: right">L2 #Data</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Banking77</td>
					<td style="text-align: right">641</td>
					<td style="text-align: right">4110</td>
					<td style="text-align: right">584</td>
					<td style="text-align: right">1863</td>
					<td style="text-align: right">519</td>
					<td style="text-align: right">1800</td>
					<td style="text-align: right">599</td>
					<td style="text-align: right">1849</td>
			</tr>
			<tr>
					<td>MultiWOZ</td>
					<td style="text-align: right">466</td>
					<td style="text-align: right">1571</td>
					<td style="text-align: right">479</td>
					<td style="text-align: right">1617</td>
					<td style="text-align: right">440</td>
					<td style="text-align: right">1574</td>
					<td style="text-align: right">499</td>
					<td style="text-align: right">1578</td>
			</tr>
			<tr>
					<td>ECHR</td>
					<td style="text-align: right">519</td>
					<td style="text-align: right">3795</td>
					<td style="text-align: right">478</td>
					<td style="text-align: right">1735</td>
					<td style="text-align: right">453</td>
					<td style="text-align: right">1665</td>
					<td style="text-align: right">478</td>
					<td style="text-align: right">1670</td>
			</tr>
			<tr>
					<td>S&amp;P 500</td>
					<td style="text-align: right">472</td>
					<td style="text-align: right">3907</td>
					<td style="text-align: right">404</td>
					<td style="text-align: right">1784</td>
					<td style="text-align: right">373</td>
					<td style="text-align: right">1700</td>
					<td style="text-align: right">396</td>
					<td style="text-align: right">1689</td>
			</tr>
	</tbody>
</table>
<p>表 1 说明四个来源都被纳入 L0/L1/L2，但它不能说明这些来源的难度相同，也不能证明合成过程没有残留未被发现的捷径。</p>
<p><strong>表 5 的问题是：四个来源的口语化、标签保持验证与TTS路径究竟如何不同？</strong> 这是构造协议的一部分，不是模型结果表。为方便窄屏逐项对应，按语料拆成四个两列表；每张子表保留原表的转写/脚本生成、验证和 TTS 路径。</p>
<p><strong>Banking77</strong></p>
<table>
	<thead>
			<tr>
					<th>步骤</th>
					<th>做法</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>转写/脚本生成</td>
					<td>将每个短意图请求先按精炼分类体系归类，再扩写为自然口语独白或短对话。</td>
			</tr>
			<tr>
					<td>验证</td>
					<td>在同一分类体系下重新分类扩写脚本；仅当全部转写层标签与原查询层分配完全一致才保留。</td>
			</tr>
			<tr>
					<td>TTS路径</td>
					<td>对验证脚本采样情绪和说话人身份；独白用一名说话人，对话用多名说话人，并加入背景噪声条件。</td>
			</tr>
	</tbody>
</table>
<p><strong>ECHR</strong></p>
<table>
	<thead>
			<tr>
					<th>步骤</th>
					<th>做法</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>转写/脚本生成</td>
					<td>给长法律案例分配分类体系标签，压缩为保留证据的摘要，再改写成口语脚本。</td>
			</tr>
			<tr>
					<td>验证</td>
					<td>源文本标签需双模型一致；压缩文本重新分类，只有此前接受的所有维度仍可恢复才保留。</td>
			</tr>
			<tr>
					<td>TTS路径</td>
					<td>合成一至四名说话人的脚本，采样情绪和背景噪声；在语义层内近似均衡副语言因素。</td>
			</tr>
	</tbody>
</table>
<p><strong>S&amp;P 500</strong></p>
<table>
	<thead>
			<tr>
					<th>步骤</th>
					<th>做法</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>转写/脚本生成</td>
					<td>给10-K披露片段分配分类体系标签，压缩为保留证据的摘要，再改写成口语脚本。</td>
			</tr>
			<tr>
					<td>验证</td>
					<td>源文本标签需双模型一致；仅当所有接受的维度均在压缩后保留才接受。</td>
			</tr>
			<tr>
					<td>TTS路径</td>
					<td>合成脚本并采样情绪、说话人数和背景噪声；在语义层内采用均衡分配。</td>
			</tr>
	</tbody>
</table>
<p><strong>MultiWOZ</strong></p>
<table>
	<thead>
			<tr>
					<th>步骤</th>
					<th>做法</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>转写/脚本生成</td>
					<td>在分配分类体系标签后，直接复用采样的人写对话作为转写。</td>
			</tr>
			<tr>
					<td>验证</td>
					<td>仅保留两个独立分类器在所有分类体系维度上给出相同标签的对话。</td>
			</tr>
			<tr>
					<td>TTS路径</td>
					<td>将验证对话按轮次合成，不同角色用不同说话人，并注入情绪和背景噪声变化。</td>
			</tr>
	</tbody>
</table>
<p>表 5 使“合成”不再是一个笼统词：Banking77 是扩写，ECHR/S&amp;P 500 是压缩再口语化，MultiWOZ 是原生对话转语音。它支持构造过程在各来源中有不同的标签保持检查，却也意味着文本重写、TTS声音和噪声素材仍是评测分布的一部分。</p>
<p><strong>表 6 的问题是：哪些自然语言视角参与训练，哪些只留给L2？</strong> 原表完整列出每个来源的 Held-in 与 Held-out 视角；以下按语料拆成连续的两列表，逐项保留原表文字，方便在手机上从训练内逐条对照训练外。</p>
<p><strong>Banking77</strong></p>
<table>
	<thead>
			<tr>
					<th>状态</th>
					<th>视角</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Held-in</td>
					<td>客户主要意图结果</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>主要银行问题或请求类别</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>主导紧急性、严重性或风险</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>语音主导情绪</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>确切说话人数</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>现实背景噪声场景</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>最直接涉及的银行能力或产品域</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>问题解决的主要路径</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>主导说话人性别模式</td>
			</tr>
	</tbody>
</table>
<p><strong>ECHR</strong></p>
<table>
	<thead>
			<tr>
					<th>状态</th>
					<th>视角</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Held-in</td>
					<td>导致所称侵害的主导国家作为/不作为</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>争议的程序或情境背景</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>争议与当事人配置结构</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>语音主导情绪</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>确切说话人数</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>现实背景噪声场景</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>受影响的主要受保护利益</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>所称主要伤害或结果</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>影响权力不平衡或风险的最显著申请人身份</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>主导说话人性别模式</td>
			</tr>
	</tbody>
</table>
<p><strong>S&amp;P 500</strong></p>
<table>
	<thead>
			<tr>
					<th>状态</th>
					<th>视角</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Held-in</td>
					<td>关键财产受控制的主要方式</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>财产的地理广度和集中度</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>讨论的主要法律事项类型</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>法律事项状态与潜在财务影响的主导信号</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>语音主导情绪</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>确切说话人数</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>现实背景噪声场景</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>运营中核心实体财产的主要类型</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>股东回报的主导方式</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>回购或股权结构的主导方式</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>主导说话人性别模式</td>
			</tr>
	</tbody>
</table>
<p><strong>MultiWOZ</strong></p>
<table>
	<thead>
			<tr>
					<th>状态</th>
					<th>视角</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Held-in</td>
					<td>明确修复轮次的存在及来源</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>用户如何提供、累积、修正或确认约束</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>信息查询与交易执行内容的平衡</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>任务直接成功、部分成功、失败或回退恢复</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>语音主导情绪</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>确切说话人数</td>
			</tr>
			<tr>
					<td>Held-in</td>
					<td>现实背景噪声场景</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>早期信息需要被记忆并在后续复用的程度</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>谁驱动交互及协商如何塑造对话</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>交互局限于窄目标还是耦合多个领域/子目标</td>
			</tr>
			<tr>
					<td>Held-out</td>
					<td>主导说话人性别模式</td>
			</tr>
	</tbody>
</table>
<p>这张表解释了为何L2的难点不是仅换录音：连视角指令背后的分类体系也从训练中保留。它不证明Held-out视角与Held-in在语义难度上完全等价。</p>
<h3 id="rd-让模型学习跨片比较而非逐条贴标签">RD 让模型学习跨片比较，而非逐条贴标签</h3>
<p>RD 的训练集写作 \(\mathcal{D}_{\mathrm{RD}}=\{(x^{(i)},y_{\mathrm{trace}}^{(i)})\}_{i=1}^{M}\)（原文公式（4））：\(x^{(i)}\) 包含编号音频集与视角，目标 \(y_{\mathrm{trace}}^{(i)}\) 是比较型推理轨迹加最终分区。其自回归目标是原文公式（5）</p>
\[
\mathcal{L}_{\mathrm{RD}}(\theta)=-\sum_{(x,y)\in\mathcal{D}_{\mathrm{RD}}}\sum_{t=1}^{|y|}\log p_\theta(y_t\mid x,y_{<t}).
\]<p>
这表示模型对目标序列中每个 token 预测正确的条件概率；它不是直接对 ARI 求导。语义视角的教师轨迹基于转写内容，副语言视角的教师轨迹基于可听线索；二者都要求跨项目比较、简洁且最后覆盖所有编号。规则解析先检查最终分区是否与金标一致，独立评判再检查推理的完整性、比较质量、简洁性与模态一致性。</p>
<p>附录 B 的训练单位叫“监督微调样本回合（SFT episode）”：一次回合是一条视角加 4–10 段编号音频，而不是单段分类样本。下表保留原表所有统计；最后三列是均值（95 分位数，最大值）。</p>
<table>
	<thead>
			<tr>
					<th>来源</th>
					<th style="text-align: right">Episodes</th>
					<th style="text-align: right">唯一音频</th>
					<th>每回合 clips</th>
					<th>金标 \(K\)</th>
					<th>时长（秒）</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>All SFT train</td>
					<td style="text-align: right">1,876</td>
					<td style="text-align: right">2,008</td>
					<td>5.64 (7, 10)</td>
					<td>3.37 (6, 9)</td>
					<td>373.5 (524.6, 539.9)</td>
			</tr>
			<tr>
					<td>ECHR</td>
					<td style="text-align: right">539</td>
					<td style="text-align: right">501</td>
					<td>5.51 (7, 7)</td>
					<td>3.37 (6, 7)</td>
					<td>452.8 (531.4, 539.9)</td>
			</tr>
			<tr>
					<td>S&amp;P 500</td>
					<td style="text-align: right">571</td>
					<td style="text-align: right">455</td>
					<td>5.69 (7, 9)</td>
					<td>3.45 (6, 9)</td>
					<td>411.4 (525.2, 539.2)</td>
			</tr>
			<tr>
					<td>Banking77</td>
					<td style="text-align: right">523</td>
					<td style="text-align: right">618</td>
					<td>5.88 (8, 10)</td>
					<td>3.66 (7, 9)</td>
					<td>306.3 (431.1, 538.1)</td>
			</tr>
			<tr>
					<td>MultiWOZ</td>
					<td style="text-align: right">243</td>
					<td style="text-align: right">434</td>
					<td>5.33 (7, 7)</td>
					<td>2.56 (4, 5)</td>
					<td>253.0 (372.3, 445.3)</td>
			</tr>
	</tbody>
</table>
<p>原文进一步给出 1,876 个回合、2,008 个唯一录音，约 10.6K 次 clip 出现；单例簇占 52.3%，但 \(K=1\) 的回合仅占 4.7%，94.1% 至少含一个非单例簇。这表明任务大量要求同时找到同簇关系和跨簇边界，不能把单例比例误读成“多数回合无需聚类”。</p>
<h3 id="dpo-只比较合法答案把错误类型变成训练信号">DPO 只比较合法答案，把错误类型变成训练信号</h3>
<p>RD 后，论文从模型生成结果中挑选困难负例（hard negative，即格式仍合法、却容易与金标混淆的错误分区）。拒绝答案必须可解析、每个编号只出现一次，并且与金标分区不同；这样 DPO 不会把训练预算浪费在漏编号、重复编号等纯格式失败上。</p>
<p>原文公式（11）按答案 token 的平均对数概率定义初始边际 \(m(x,y^+,y^-)\)，公式（12）定义质量差 \(g=s(y^+)-s(y^-)\)。小或负边际意味着初始模型同样甚至更偏好错误答案；极小质量差会被去除。公式（13）再把负例分成 near-miss、over-merge、over-split、\(K\)-wrong 和 wrong-assignment：前者簇数相同但成员不全对；中间两类分别把不同金标簇并在一起、或把一个金标簇拆开；其余再记录簇数或成员分配错误。该公式是筛选规则，不是单独的性能结论。</p>
<p>读图任务：图 3 的关键是沿箭头找到“RD 模型生成—合法性过滤—金标/拒绝答案配对—DPO”四个节点。图中合法性筛选解释为何负例可以是困难聚类错误，而不是坏格式；它不能告诉我们每种错误类别的实际数量，也不能证明所有困难错误都被覆盖。</p>
<p><img alt="原论文 Figure 3：偏好优化流程" loading="lazy" src="https://arxiv.org/html/2608.25177v1/crop_benchmark_dpo-4.png"></p>
<p>最终 DPO 使用原文公式（6）—（8），附录又以公式（14）—（17）重复同一组定义：\(\Delta_\pi\) 与 \(\Delta_{\mathrm{ref}}\) 分别是策略和冻结参考模型对选中、拒绝答案的对数概率差，\(z=\beta L_{\mathrm{ref}}(\Delta_\pi-\Delta_{\mathrm{ref}})\)，\(\mathcal{L}_{\mathrm{DPO}}=-\log\sigma(z)\)。\(\beta\) 控制偏好强度，\(L_{\mathrm{ref}}\) 是 DPO 训练集的平均答案长度。所有概率只在最终 answer token 上计算，排除 prompt、padding 和非答案 token；因此 RD 负责中间比较监督，DPO 直接校准最后的分区决策，而不是奖励一段写得漂亮的长推理。</p>
<h3 id="训练配置已给出缺的是公开材料而不是超参数">训练配置已给出，缺的是公开材料而不是超参数</h3>
<p>附录 E 给出了比“用了四张 GPU”更细的配置。RD 使用 1,876 个蒸馏样本，从 7B Audio Flamingo 3 初始化，LoRA 微调，bfloat16、梯度检查点、FlashAttention 和 DeepSpeed 内存优化；micro-batch 为 1，余弦学习率调度峰值 \(5\times10^{-5}\)，训练 6 个 epoch。DPO 在 Held-in 视角构造的 1,075 个筛选过的 on-policy 偏好对上运行，使用官方 <code>trl.DPOTrainer</code>、1 个节点 4 张 GPU、每设备 batch 1、梯度累积 3，有效全局 batch 12；训练 500 steps（epoch 上限 20.0）、5 个 warmup steps、常数加 warmup 调度、学习率 \(5\times10^{-6}\)。</p>
<p>DPO 同样使用 bfloat16 和梯度检查点，最大梯度范数 1.0；LoRA 加在最后 16 层的 attention 模块，rank 32、alpha 32、dropout 0。策略与参考模型都从 RD checkpoint 初始化，参考模型冻结，scaled-mean DPO 取 \(\beta=0.5\) 和 \(L_{\mathrm{ref}}=34.0\)。这些是可复核的训练超参数，不能称为“未披露”。但论文没有给出代码入口、权重、可下载的数据入口、许可证，也没有报告推理延迟、吞吐、内存或成本；这些不同于超参数缺失，分别限制公开复跑与工程部署判断。</p>
<h3 id="读-ari-和-v-measure-前先理解它们惩罚哪种错法">读 ARI 和 V-measure 前，先理解它们惩罚哪种错法</h3>
<p>ARI（Adjusted Rand Index）看所有样本对是否同时被预测为同簇或异簇，并扣除随机一致；原文公式（21）给出其组合计数形式。它通常在 \([-1,1]\) 内，越高越好，0 约对应随机水平。V-measure 则把簇纯度和类别完整性合在一起：原文公式（18）定义同质性 \(h=1-H(C\mid K)/H(C)\)，公式（19）定义完整性 \(c=1-H(K\mid C)/H(K)\)，公式（20）给出 \(V=(1+\beta)hc/(\beta h+c)\)，通常 \(\beta=1\)。混入不同金标类会伤害同质性；把同类拆散会伤害完整性。两者均为越高越好，但它们不是同一张奖牌。</p>
<p>主比较有四种语料、L0/L1/L2 三种层级。嵌入式基线得到金标簇数，这给了它们 oracle \(K\) 优势；LLM/LALM 直接输出分区，需自己同时猜 \(K\) 和分配。下面将原表 2 按语料拆成连续子表，保留每个方法、聚类设置和 ARI 数值。<strong>表 2 的问题是：在 oracle \(K\) 的文本嵌入基线与自行推断 \(K\) 的生成式模型并列时，谁的成对分组更接近金标？</strong></p>
<p>表 2a（ARI↑，ECHR）</p>
<table>
	<thead>
			<tr>
					<th>路线/方法</th>
					<th>聚类</th>
					<th style="text-align: right">L0</th>
					<th style="text-align: right">L1</th>
					<th style="text-align: right">L2</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Whisper + Text Embedding + Clustering</td>
					<td>K-Means</td>
					<td style="text-align: right">4.98</td>
					<td style="text-align: right">4.24</td>
					<td style="text-align: right">8.82</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>GMM</td>
					<td style="text-align: right">1.58</td>
					<td style="text-align: right">2.56</td>
					<td style="text-align: right">9.06</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>K-Means</td>
					<td style="text-align: right">12.18</td>
					<td style="text-align: right">15.40</td>
					<td style="text-align: right">26.51</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>GMM</td>
					<td style="text-align: right">8.44</td>
					<td style="text-align: right">9.68</td>
					<td style="text-align: right">17.30</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>K-Means</td>
					<td style="text-align: right">11.70</td>
					<td style="text-align: right">9.89</td>
					<td style="text-align: right">15.37</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>GMM</td>
					<td style="text-align: right">9.53</td>
					<td style="text-align: right">6.97</td>
					<td style="text-align: right">13.68</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>K-Means</td>
					<td style="text-align: right">12.93</td>
					<td style="text-align: right">14.32</td>
					<td style="text-align: right">24.95</td>
			</tr>
			<tr>
					<td>all-MiniLM-L6-v2</td>
					<td>GMM</td>
					<td style="text-align: right">4.79</td>
					<td style="text-align: right">7.63</td>
					<td style="text-align: right">15.99</td>
			</tr>
			<tr>
					<td>Whisper + GPT-4o</td>
					<td>直接分区</td>
					<td style="text-align: right">14.80</td>
					<td style="text-align: right">20.26</td>
					<td style="text-align: right">32.75</td>
			</tr>
			<tr>
					<td>GPT-4o-audio-preview</td>
					<td>直接分区</td>
					<td style="text-align: right">19.34</td>
					<td style="text-align: right">21.82</td>
					<td style="text-align: right">38.26</td>
			</tr>
			<tr>
					<td>GPT-audio-1.5</td>
					<td>直接分区</td>
					<td style="text-align: right">18.76</td>
					<td style="text-align: right">20.20</td>
					<td style="text-align: right">40.24</td>
			</tr>
			<tr>
					<td>Qwen3-omni-instruct-30B</td>
					<td>直接分区</td>
					<td style="text-align: right">7.38</td>
					<td style="text-align: right">8.72</td>
					<td style="text-align: right">11.32</td>
			</tr>
			<tr>
					<td>Audio Flamingo 3</td>
					<td>直接分区</td>
					<td style="text-align: right">0.00</td>
					<td style="text-align: right">0.00</td>
					<td style="text-align: right">0.00</td>
			</tr>
			<tr>
					<td>Qwen2.5-omni</td>
					<td>直接分区</td>
					<td style="text-align: right">6.30</td>
					<td style="text-align: right">8.37</td>
					<td style="text-align: right">5.59</td>
			</tr>
			<tr>
					<td>AudioLens-R1</td>
					<td>直接分区</td>
					<td style="text-align: right">41.91</td>
					<td style="text-align: right">38.05</td>
					<td style="text-align: right">46.11</td>
			</tr>
	</tbody>
</table>
<p>表 2b（ARI↑，S&amp;P 500）</p>
<table>
	<thead>
			<tr>
					<th>路线/方法</th>
					<th>聚类</th>
					<th style="text-align: right">L0</th>
					<th style="text-align: right">L1</th>
					<th style="text-align: right">L2</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Whisper + Text Embedding + Clustering</td>
					<td>K-Means</td>
					<td style="text-align: right">9.90</td>
					<td style="text-align: right">5.71</td>
					<td style="text-align: right">5.42</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>GMM</td>
					<td style="text-align: right">2.89</td>
					<td style="text-align: right">2.15</td>
					<td style="text-align: right">3.73</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>K-Means</td>
					<td style="text-align: right">16.19</td>
					<td style="text-align: right">18.79</td>
					<td style="text-align: right">15.56</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>GMM</td>
					<td style="text-align: right">9.37</td>
					<td style="text-align: right">9.46</td>
					<td style="text-align: right">6.98</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>K-Means</td>
					<td style="text-align: right">11.20</td>
					<td style="text-align: right">11.92</td>
					<td style="text-align: right">7.26</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>GMM</td>
					<td style="text-align: right">8.63</td>
					<td style="text-align: right">5.73</td>
					<td style="text-align: right">3.77</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>K-Means</td>
					<td style="text-align: right">16.19</td>
					<td style="text-align: right">14.36</td>
					<td style="text-align: right">13.89</td>
			</tr>
			<tr>
					<td>all-MiniLM-L6-v2</td>
					<td>GMM</td>
					<td style="text-align: right">7.57</td>
					<td style="text-align: right">6.81</td>
					<td style="text-align: right">8.01</td>
			</tr>
			<tr>
					<td>Whisper + GPT-4o</td>
					<td>直接分区</td>
					<td style="text-align: right">26.19</td>
					<td style="text-align: right">27.78</td>
					<td style="text-align: right">26.30</td>
			</tr>
			<tr>
					<td>GPT-4o-audio-preview</td>
					<td>直接分区</td>
					<td style="text-align: right">28.01</td>
					<td style="text-align: right">26.93</td>
					<td style="text-align: right">24.57</td>
			</tr>
			<tr>
					<td>GPT-audio-1.5</td>
					<td>直接分区</td>
					<td style="text-align: right">25.56</td>
					<td style="text-align: right">27.75</td>
					<td style="text-align: right">26.71</td>
			</tr>
			<tr>
					<td>Qwen3-omni-instruct-30B</td>
					<td>直接分区</td>
					<td style="text-align: right">14.57</td>
					<td style="text-align: right">16.13</td>
					<td style="text-align: right">13.07</td>
			</tr>
			<tr>
					<td>Audio Flamingo 3</td>
					<td>直接分区</td>
					<td style="text-align: right">0.00</td>
					<td style="text-align: right">0.00</td>
					<td style="text-align: right">0.00</td>
			</tr>
			<tr>
					<td>Qwen2.5-omni</td>
					<td>直接分区</td>
					<td style="text-align: right">6.31</td>
					<td style="text-align: right">6.36</td>
					<td style="text-align: right">4.87</td>
			</tr>
			<tr>
					<td>AudioLens-R1</td>
					<td>直接分区</td>
					<td style="text-align: right">42.20</td>
					<td style="text-align: right">44.86</td>
					<td style="text-align: right">41.12</td>
			</tr>
	</tbody>
</table>
<p>表 2c（ARI↑，Banking77）</p>
<table>
	<thead>
			<tr>
					<th>路线/方法</th>
					<th>聚类</th>
					<th style="text-align: right">L0</th>
					<th style="text-align: right">L1</th>
					<th style="text-align: right">L2</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Whisper + Text Embedding + Clustering</td>
					<td>K-Means</td>
					<td style="text-align: right">8.29</td>
					<td style="text-align: right">6.83</td>
					<td style="text-align: right">6.83</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>GMM</td>
					<td style="text-align: right">5.20</td>
					<td style="text-align: right">8.11</td>
					<td style="text-align: right">9.57</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>K-Means</td>
					<td style="text-align: right">23.57</td>
					<td style="text-align: right">24.68</td>
					<td style="text-align: right">18.18</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>GMM</td>
					<td style="text-align: right">14.79</td>
					<td style="text-align: right">13.13</td>
					<td style="text-align: right">14.65</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>K-Means</td>
					<td style="text-align: right">16.94</td>
					<td style="text-align: right">16.62</td>
					<td style="text-align: right">16.90</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>GMM</td>
					<td style="text-align: right">8.38</td>
					<td style="text-align: right">11.39</td>
					<td style="text-align: right">12.36</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>K-Means</td>
					<td style="text-align: right">19.72</td>
					<td style="text-align: right">23.28</td>
					<td style="text-align: right">18.51</td>
			</tr>
			<tr>
					<td>all-MiniLM-L6-v2</td>
					<td>GMM</td>
					<td style="text-align: right">10.52</td>
					<td style="text-align: right">12.76</td>
					<td style="text-align: right">15.67</td>
			</tr>
			<tr>
					<td>Whisper + GPT-4o</td>
					<td>直接分区</td>
					<td style="text-align: right">32.53</td>
					<td style="text-align: right">31.05</td>
					<td style="text-align: right">32.04</td>
			</tr>
			<tr>
					<td>GPT-4o-audio-preview</td>
					<td>直接分区</td>
					<td style="text-align: right">32.32</td>
					<td style="text-align: right">32.12</td>
					<td style="text-align: right">40.42</td>
			</tr>
			<tr>
					<td>GPT-audio-1.5</td>
					<td>直接分区</td>
					<td style="text-align: right">29.77</td>
					<td style="text-align: right">29.57</td>
					<td style="text-align: right">46.79</td>
			</tr>
			<tr>
					<td>Qwen3-omni-instruct-30B</td>
					<td>直接分区</td>
					<td style="text-align: right">26.27</td>
					<td style="text-align: right">28.40</td>
					<td style="text-align: right">20.54</td>
			</tr>
			<tr>
					<td>Audio Flamingo 3</td>
					<td>直接分区</td>
					<td style="text-align: right">0.00</td>
					<td style="text-align: right">0.00</td>
					<td style="text-align: right">0.00</td>
			</tr>
			<tr>
					<td>Qwen2.5-omni</td>
					<td>直接分区</td>
					<td style="text-align: right">6.37</td>
					<td style="text-align: right">7.68</td>
					<td style="text-align: right">-0.79</td>
			</tr>
			<tr>
					<td>AudioLens-R1</td>
					<td>直接分区</td>
					<td style="text-align: right">52.23</td>
					<td style="text-align: right">50.24</td>
					<td style="text-align: right">47.07</td>
			</tr>
	</tbody>
</table>
<p>表 2d（ARI↑，MultiWOZ）</p>
<table>
	<thead>
			<tr>
					<th>路线/方法</th>
					<th>聚类</th>
					<th style="text-align: right">L0</th>
					<th style="text-align: right">L1</th>
					<th style="text-align: right">L2</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Whisper + Text Embedding + Clustering</td>
					<td>K-Means</td>
					<td style="text-align: right">4.73</td>
					<td style="text-align: right">4.77</td>
					<td style="text-align: right">8.81</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>GMM</td>
					<td style="text-align: right">5.43</td>
					<td style="text-align: right">3.92</td>
					<td style="text-align: right">7.16</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>K-Means</td>
					<td style="text-align: right">10.55</td>
					<td style="text-align: right">11.41</td>
					<td style="text-align: right">11.09</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>GMM</td>
					<td style="text-align: right">7.30</td>
					<td style="text-align: right">7.66</td>
					<td style="text-align: right">6.48</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>K-Means</td>
					<td style="text-align: right">8.55</td>
					<td style="text-align: right">12.66</td>
					<td style="text-align: right">8.34</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>GMM</td>
					<td style="text-align: right">3.96</td>
					<td style="text-align: right">5.88</td>
					<td style="text-align: right">5.07</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>K-Means</td>
					<td style="text-align: right">9.81</td>
					<td style="text-align: right">9.96</td>
					<td style="text-align: right">14.47</td>
			</tr>
			<tr>
					<td>all-MiniLM-L6-v2</td>
					<td>GMM</td>
					<td style="text-align: right">6.84</td>
					<td style="text-align: right">7.08</td>
					<td style="text-align: right">8.10</td>
			</tr>
			<tr>
					<td>Whisper + GPT-4o</td>
					<td>直接分区</td>
					<td style="text-align: right">36.32</td>
					<td style="text-align: right">35.50</td>
					<td style="text-align: right">24.99</td>
			</tr>
			<tr>
					<td>GPT-4o-audio-preview</td>
					<td>直接分区</td>
					<td style="text-align: right">34.90</td>
					<td style="text-align: right">34.90</td>
					<td style="text-align: right">28.27</td>
			</tr>
			<tr>
					<td>GPT-audio-1.5</td>
					<td>直接分区</td>
					<td style="text-align: right">37.99</td>
					<td style="text-align: right">37.21</td>
					<td style="text-align: right">40.82</td>
			</tr>
			<tr>
					<td>Qwen3-omni-instruct-30B</td>
					<td>直接分区</td>
					<td style="text-align: right">14.30</td>
					<td style="text-align: right">18.54</td>
					<td style="text-align: right">10.53</td>
			</tr>
			<tr>
					<td>Audio Flamingo 3</td>
					<td>直接分区</td>
					<td style="text-align: right">0.57</td>
					<td style="text-align: right">1.17</td>
					<td style="text-align: right">0.98</td>
			</tr>
			<tr>
					<td>Qwen2.5-omni</td>
					<td>直接分区</td>
					<td style="text-align: right">13.97</td>
					<td style="text-align: right">15.25</td>
					<td style="text-align: right">8.58</td>
			</tr>
			<tr>
					<td>AudioLens-R1</td>
					<td>直接分区</td>
					<td style="text-align: right">47.28</td>
					<td style="text-align: right">44.14</td>
					<td style="text-align: right">42.08</td>
			</tr>
	</tbody>
</table>
<p>表 2e（ARI↑，Average 与 Overall）</p>
<table>
	<thead>
			<tr>
					<th>路线/方法</th>
					<th>聚类</th>
					<th style="text-align: right">Average L0</th>
					<th style="text-align: right">Average L1</th>
					<th style="text-align: right">Average L2</th>
					<th style="text-align: right">Overall</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Whisper + Text Embedding + Clustering</td>
					<td>K-Means</td>
					<td style="text-align: right">6.97</td>
					<td style="text-align: right">5.39</td>
					<td style="text-align: right">7.47</td>
					<td style="text-align: right">6.61</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>GMM</td>
					<td style="text-align: right">3.77</td>
					<td style="text-align: right">4.18</td>
					<td style="text-align: right">7.38</td>
					<td style="text-align: right">5.11</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>K-Means</td>
					<td style="text-align: right">15.62</td>
					<td style="text-align: right">17.57</td>
					<td style="text-align: right">17.84</td>
					<td style="text-align: right">17.01</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>GMM</td>
					<td style="text-align: right">9.97</td>
					<td style="text-align: right">9.98</td>
					<td style="text-align: right">11.35</td>
					<td style="text-align: right">10.44</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>K-Means</td>
					<td style="text-align: right">12.10</td>
					<td style="text-align: right">12.77</td>
					<td style="text-align: right">11.97</td>
					<td style="text-align: right">12.28</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>GMM</td>
					<td style="text-align: right">7.62</td>
					<td style="text-align: right">7.49</td>
					<td style="text-align: right">8.72</td>
					<td style="text-align: right">7.95</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>K-Means</td>
					<td style="text-align: right">14.66</td>
					<td style="text-align: right">15.48</td>
					<td style="text-align: right">17.96</td>
					<td style="text-align: right">16.03</td>
			</tr>
			<tr>
					<td>all-MiniLM-L6-v2</td>
					<td>GMM</td>
					<td style="text-align: right">7.43</td>
					<td style="text-align: right">8.57</td>
					<td style="text-align: right">11.94</td>
					<td style="text-align: right">9.31</td>
			</tr>
			<tr>
					<td>Whisper + GPT-4o</td>
					<td>直接分区</td>
					<td style="text-align: right">27.46</td>
					<td style="text-align: right">28.65</td>
					<td style="text-align: right">29.02</td>
					<td style="text-align: right">28.38</td>
			</tr>
			<tr>
					<td>GPT-4o-audio-preview</td>
					<td>直接分区</td>
					<td style="text-align: right">28.64</td>
					<td style="text-align: right">28.94</td>
					<td style="text-align: right">32.88</td>
					<td style="text-align: right">30.16</td>
			</tr>
			<tr>
					<td>GPT-audio-1.5</td>
					<td>直接分区</td>
					<td style="text-align: right">28.02</td>
					<td style="text-align: right">28.68</td>
					<td style="text-align: right">38.64</td>
					<td style="text-align: right">31.78</td>
			</tr>
			<tr>
					<td>Qwen3-omni-instruct-30B</td>
					<td>直接分区</td>
					<td style="text-align: right">15.63</td>
					<td style="text-align: right">17.95</td>
					<td style="text-align: right">13.87</td>
					<td style="text-align: right">15.81</td>
			</tr>
			<tr>
					<td>Audio Flamingo 3</td>
					<td>直接分区</td>
					<td style="text-align: right">0.14</td>
					<td style="text-align: right">0.29</td>
					<td style="text-align: right">0.25</td>
					<td style="text-align: right">0.23</td>
			</tr>
			<tr>
					<td>Qwen2.5-omni</td>
					<td>直接分区</td>
					<td style="text-align: right">8.24</td>
					<td style="text-align: right">9.42</td>
					<td style="text-align: right">4.56</td>
					<td style="text-align: right">7.41</td>
			</tr>
			<tr>
					<td>AudioLens-R1</td>
					<td>直接分区</td>
					<td style="text-align: right">45.91</td>
					<td style="text-align: right">44.32</td>
					<td style="text-align: right">44.10</td>
					<td style="text-align: right">44.77</td>
			</tr>
	</tbody>
</table>
<p>原表 2 的视觉注释是“每列最佳值以蓝色粗体标出、第二佳以下划线标出”；为移动端可读性，这里保留全部数值与设置，不以颜色或下划线承担比较含义。</p>
<p>表 2 的最强文本嵌入基线是 InBedder + K-Means，overall ARI 为 17.01；GPT-audio-1.5 是整体最强的非本方法原生 LALM，31.78；AudioLens-R1 为 44.77，较它高 12.99 个绝对点。12 个语料—层级 ARI 格中 AudioLens-R1 都最高。这个对照支持“端到端后训练模型在该受控基准上更准”的系统层结论，却不能隔离出每一项收益分别来自音频输入、RD、DPO 或基座选择。</p>
<h3 id="v-measure-的例外提醒整体领先不等于每一列都第一">V-measure 的例外提醒：整体领先不等于每一列都第一</h3>
<p><strong>表 3 的问题是：同一批方法在簇同质性和完整性的折中上表现如何？</strong> 下列连续子表保留原表全部设置和数值。特别需要纠正提取文本的空白续行：55.50/57.76/…/52.66 是 <strong>InBedder + K-Means</strong>，55.68/57.33/…/52.19 是 <strong>Qwen3-Embedding + K-Means</strong>；不能错标为 Instructor 或 all-MiniLM。指标均为 V-measure↑。</p>
<p>表 3a（V-measure↑，ECHR）</p>
<table>
	<thead>
			<tr>
					<th>路线/方法</th>
					<th>聚类</th>
					<th style="text-align: right">L0</th>
					<th style="text-align: right">L1</th>
					<th style="text-align: right">L2</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Whisper + Text Embedding + Clustering</td>
					<td>K-Means</td>
					<td style="text-align: right">50.71</td>
					<td style="text-align: right">51.51</td>
					<td style="text-align: right">57.84</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>GMM</td>
					<td style="text-align: right">49.19</td>
					<td style="text-align: right">50.79</td>
					<td style="text-align: right">58.20</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>K-Means</td>
					<td style="text-align: right">55.50</td>
					<td style="text-align: right">57.76</td>
					<td style="text-align: right">67.36</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>GMM</td>
					<td style="text-align: right">53.50</td>
					<td style="text-align: right">55.07</td>
					<td style="text-align: right">62.85</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>K-Means</td>
					<td style="text-align: right">55.12</td>
					<td style="text-align: right">54.87</td>
					<td style="text-align: right">61.72</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>GMM</td>
					<td style="text-align: right">54.34</td>
					<td style="text-align: right">53.33</td>
					<td style="text-align: right">61.20</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>K-Means</td>
					<td style="text-align: right">55.68</td>
					<td style="text-align: right">57.33</td>
					<td style="text-align: right">66.83</td>
			</tr>
			<tr>
					<td>all-MiniLM-L6-v2</td>
					<td>GMM</td>
					<td style="text-align: right">51.43</td>
					<td style="text-align: right">53.67</td>
					<td style="text-align: right">62.37</td>
			</tr>
			<tr>
					<td>Whisper + GPT-4o</td>
					<td>直接分区</td>
					<td style="text-align: right">55.41</td>
					<td style="text-align: right">59.70</td>
					<td style="text-align: right">69.98</td>
			</tr>
			<tr>
					<td>GPT-4o-audio-preview</td>
					<td>直接分区</td>
					<td style="text-align: right">55.13</td>
					<td style="text-align: right">58.51</td>
					<td style="text-align: right">72.79</td>
			</tr>
			<tr>
					<td>GPT-audio-1.5</td>
					<td>直接分区</td>
					<td style="text-align: right">53.73</td>
					<td style="text-align: right">53.60</td>
					<td style="text-align: right">73.52</td>
			</tr>
			<tr>
					<td>Qwen3-omni-instruct-30B</td>
					<td>直接分区</td>
					<td style="text-align: right">15.69</td>
					<td style="text-align: right">16.88</td>
					<td style="text-align: right">23.51</td>
			</tr>
			<tr>
					<td>Audio Flamingo 3</td>
					<td>直接分区</td>
					<td style="text-align: right">0.00</td>
					<td style="text-align: right">0.00</td>
					<td style="text-align: right">0.00</td>
			</tr>
			<tr>
					<td>Qwen2.5-omni</td>
					<td>直接分区</td>
					<td style="text-align: right">30.66</td>
					<td style="text-align: right">33.74</td>
					<td style="text-align: right">32.07</td>
			</tr>
			<tr>
					<td>AudioLens-R1</td>
					<td>直接分区</td>
					<td style="text-align: right">72.77</td>
					<td style="text-align: right">75.30</td>
					<td style="text-align: right">78.08</td>
			</tr>
	</tbody>
</table>
<p>表 3b（V-measure↑，S&amp;P 500）</p>
<table>
	<thead>
			<tr>
					<th>路线/方法</th>
					<th>聚类</th>
					<th style="text-align: right">L0</th>
					<th style="text-align: right">L1</th>
					<th style="text-align: right">L2</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Whisper + Text Embedding + Clustering</td>
					<td>K-Means</td>
					<td style="text-align: right">53.69</td>
					<td style="text-align: right">50.88</td>
					<td style="text-align: right">48.79</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>GMM</td>
					<td style="text-align: right">50.64</td>
					<td style="text-align: right">49.54</td>
					<td style="text-align: right">48.81</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>K-Means</td>
					<td style="text-align: right">57.81</td>
					<td style="text-align: right">59.13</td>
					<td style="text-align: right">54.67</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>GMM</td>
					<td style="text-align: right">54.41</td>
					<td style="text-align: right">53.58</td>
					<td style="text-align: right">50.40</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>K-Means</td>
					<td style="text-align: right">55.11</td>
					<td style="text-align: right">54.51</td>
					<td style="text-align: right">50.05</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>GMM</td>
					<td style="text-align: right">54.18</td>
					<td style="text-align: right">51.45</td>
					<td style="text-align: right">48.67</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>K-Means</td>
					<td style="text-align: right">57.97</td>
					<td style="text-align: right">56.61</td>
					<td style="text-align: right">53.83</td>
			</tr>
			<tr>
					<td>all-MiniLM-L6-v2</td>
					<td>GMM</td>
					<td style="text-align: right">53.29</td>
					<td style="text-align: right">52.22</td>
					<td style="text-align: right">51.26</td>
			</tr>
			<tr>
					<td>Whisper + GPT-4o</td>
					<td>直接分区</td>
					<td style="text-align: right">56.03</td>
					<td style="text-align: right">56.80</td>
					<td style="text-align: right">57.39</td>
			</tr>
			<tr>
					<td>GPT-4o-audio-preview</td>
					<td>直接分区</td>
					<td style="text-align: right">56.47</td>
					<td style="text-align: right">57.96</td>
					<td style="text-align: right">60.86</td>
			</tr>
			<tr>
					<td>GPT-audio-1.5</td>
					<td>直接分区</td>
					<td style="text-align: right">54.54</td>
					<td style="text-align: right">53.39</td>
					<td style="text-align: right">62.09</td>
			</tr>
			<tr>
					<td>Qwen3-omni-instruct-30B</td>
					<td>直接分区</td>
					<td style="text-align: right">22.95</td>
					<td style="text-align: right">24.06</td>
					<td style="text-align: right">27.33</td>
			</tr>
			<tr>
					<td>Audio Flamingo 3</td>
					<td>直接分区</td>
					<td style="text-align: right">0.00</td>
					<td style="text-align: right">0.00</td>
					<td style="text-align: right">0.00</td>
			</tr>
			<tr>
					<td>Qwen2.5-omni</td>
					<td>直接分区</td>
					<td style="text-align: right">23.55</td>
					<td style="text-align: right">23.79</td>
					<td style="text-align: right">20.79</td>
			</tr>
			<tr>
					<td>AudioLens-R1</td>
					<td>直接分区</td>
					<td style="text-align: right">75.02</td>
					<td style="text-align: right">73.32</td>
					<td style="text-align: right">71.61</td>
			</tr>
	</tbody>
</table>
<p>表 3c（V-measure↑，Banking77）</p>
<table>
	<thead>
			<tr>
					<th>路线/方法</th>
					<th>聚类</th>
					<th style="text-align: right">L0</th>
					<th style="text-align: right">L1</th>
					<th style="text-align: right">L2</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Whisper + Text Embedding + Clustering</td>
					<td>K-Means</td>
					<td style="text-align: right">52.13</td>
					<td style="text-align: right">52.87</td>
					<td style="text-align: right">50.09</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>GMM</td>
					<td style="text-align: right">50.71</td>
					<td style="text-align: right">54.13</td>
					<td style="text-align: right">53.02</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>K-Means</td>
					<td style="text-align: right">60.18</td>
					<td style="text-align: right">61.91</td>
					<td style="text-align: right">57.21</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>GMM</td>
					<td style="text-align: right">56.26</td>
					<td style="text-align: right">57.21</td>
					<td style="text-align: right">55.96</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>K-Means</td>
					<td style="text-align: right">57.61</td>
					<td style="text-align: right">58.61</td>
					<td style="text-align: right">56.49</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>GMM</td>
					<td style="text-align: right">53.03</td>
					<td style="text-align: right">56.43</td>
					<td style="text-align: right">54.61</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>K-Means</td>
					<td style="text-align: right">58.34</td>
					<td style="text-align: right">61.16</td>
					<td style="text-align: right">57.07</td>
			</tr>
			<tr>
					<td>all-MiniLM-L6-v2</td>
					<td>GMM</td>
					<td style="text-align: right">53.81</td>
					<td style="text-align: right">57.34</td>
					<td style="text-align: right">56.69</td>
			</tr>
			<tr>
					<td>Whisper + GPT-4o</td>
					<td>直接分区</td>
					<td style="text-align: right">67.81</td>
					<td style="text-align: right">66.29</td>
					<td style="text-align: right">70.85</td>
			</tr>
			<tr>
					<td>GPT-4o-audio-preview</td>
					<td>直接分区</td>
					<td style="text-align: right">65.65</td>
					<td style="text-align: right">65.94</td>
					<td style="text-align: right">78.73</td>
			</tr>
			<tr>
					<td>GPT-audio-1.5</td>
					<td>直接分区</td>
					<td style="text-align: right">66.59</td>
					<td style="text-align: right">64.10</td>
					<td style="text-align: right">84.12</td>
			</tr>
			<tr>
					<td>Qwen3-omni-instruct-30B</td>
					<td>直接分区</td>
					<td style="text-align: right">40.83</td>
					<td style="text-align: right">40.76</td>
					<td style="text-align: right">36.28</td>
			</tr>
			<tr>
					<td>Audio Flamingo 3</td>
					<td>直接分区</td>
					<td style="text-align: right">0.00</td>
					<td style="text-align: right">0.00</td>
					<td style="text-align: right">0.00</td>
			</tr>
			<tr>
					<td>Qwen2.5-omni</td>
					<td>直接分区</td>
					<td style="text-align: right">18.79</td>
					<td style="text-align: right">19.80</td>
					<td style="text-align: right">18.30</td>
			</tr>
			<tr>
					<td>AudioLens-R1</td>
					<td>直接分区</td>
					<td style="text-align: right">79.88</td>
					<td style="text-align: right">78.79</td>
					<td style="text-align: right">78.64</td>
			</tr>
	</tbody>
</table>
<p>表 3d（V-measure↑，MultiWOZ）</p>
<table>
	<thead>
			<tr>
					<th>路线/方法</th>
					<th>聚类</th>
					<th style="text-align: right">L0</th>
					<th style="text-align: right">L1</th>
					<th style="text-align: right">L2</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Whisper + Text Embedding + Clustering</td>
					<td>K-Means</td>
					<td style="text-align: right">30.24</td>
					<td style="text-align: right">29.38</td>
					<td style="text-align: right">29.55</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>GMM</td>
					<td style="text-align: right">31.49</td>
					<td style="text-align: right">29.43</td>
					<td style="text-align: right">28.97</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>K-Means</td>
					<td style="text-align: right">34.75</td>
					<td style="text-align: right">34.41</td>
					<td style="text-align: right">31.18</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>GMM</td>
					<td style="text-align: right">32.98</td>
					<td style="text-align: right">32.15</td>
					<td style="text-align: right">28.51</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>K-Means</td>
					<td style="text-align: right">33.51</td>
					<td style="text-align: right">35.38</td>
					<td style="text-align: right">29.19</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>GMM</td>
					<td style="text-align: right">30.92</td>
					<td style="text-align: right">30.75</td>
					<td style="text-align: right">27.60</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>K-Means</td>
					<td style="text-align: right">34.22</td>
					<td style="text-align: right">33.67</td>
					<td style="text-align: right">33.55</td>
			</tr>
			<tr>
					<td>all-MiniLM-L6-v2</td>
					<td>GMM</td>
					<td style="text-align: right">32.83</td>
					<td style="text-align: right">31.83</td>
					<td style="text-align: right">30.10</td>
			</tr>
			<tr>
					<td>Whisper + GPT-4o</td>
					<td>直接分区</td>
					<td style="text-align: right">57.75</td>
					<td style="text-align: right">55.59</td>
					<td style="text-align: right">51.47</td>
			</tr>
			<tr>
					<td>GPT-4o-audio-preview</td>
					<td>直接分区</td>
					<td style="text-align: right">55.53</td>
					<td style="text-align: right">54.16</td>
					<td style="text-align: right">53.94</td>
			</tr>
			<tr>
					<td>GPT-audio-1.5</td>
					<td>直接分区</td>
					<td style="text-align: right">57.68</td>
					<td style="text-align: right">57.11</td>
					<td style="text-align: right">61.23</td>
			</tr>
			<tr>
					<td>Qwen3-omni-instruct-30B</td>
					<td>直接分区</td>
					<td style="text-align: right">18.98</td>
					<td style="text-align: right">21.81</td>
					<td style="text-align: right">14.11</td>
			</tr>
			<tr>
					<td>Audio Flamingo 3</td>
					<td>直接分区</td>
					<td style="text-align: right">0.66</td>
					<td style="text-align: right">1.31</td>
					<td style="text-align: right">1.10</td>
			</tr>
			<tr>
					<td>Qwen2.5-omni</td>
					<td>直接分区</td>
					<td style="text-align: right">23.29</td>
					<td style="text-align: right">24.64</td>
					<td style="text-align: right">19.13</td>
			</tr>
			<tr>
					<td>AudioLens-R1</td>
					<td>直接分区</td>
					<td style="text-align: right">68.91</td>
					<td style="text-align: right">67.19</td>
					<td style="text-align: right">61.67</td>
			</tr>
	</tbody>
</table>
<p>表 3e（V-measure↑，Average 与 Overall）</p>
<table>
	<thead>
			<tr>
					<th>路线/方法</th>
					<th>聚类</th>
					<th style="text-align: right">Average L0</th>
					<th style="text-align: right">Average L1</th>
					<th style="text-align: right">Average L2</th>
					<th style="text-align: right">Overall</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>Whisper + Text Embedding + Clustering</td>
					<td>K-Means</td>
					<td style="text-align: right">46.69</td>
					<td style="text-align: right">46.16</td>
					<td style="text-align: right">46.57</td>
					<td style="text-align: right">46.47</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>GMM</td>
					<td style="text-align: right">45.51</td>
					<td style="text-align: right">45.97</td>
					<td style="text-align: right">47.25</td>
					<td style="text-align: right">46.24</td>
			</tr>
			<tr>
					<td>InBedder</td>
					<td>K-Means</td>
					<td style="text-align: right">52.06</td>
					<td style="text-align: right">53.30</td>
					<td style="text-align: right">52.61</td>
					<td style="text-align: right">52.66</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>GMM</td>
					<td style="text-align: right">49.29</td>
					<td style="text-align: right">49.50</td>
					<td style="text-align: right">49.43</td>
					<td style="text-align: right">49.41</td>
			</tr>
			<tr>
					<td>Instructor</td>
					<td>K-Means</td>
					<td style="text-align: right">50.34</td>
					<td style="text-align: right">50.84</td>
					<td style="text-align: right">49.36</td>
					<td style="text-align: right">50.18</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>GMM</td>
					<td style="text-align: right">48.12</td>
					<td style="text-align: right">47.99</td>
					<td style="text-align: right">48.02</td>
					<td style="text-align: right">48.04</td>
			</tr>
			<tr>
					<td>Qwen3-Embedding</td>
					<td>K-Means</td>
					<td style="text-align: right">51.55</td>
					<td style="text-align: right">52.19</td>
					<td style="text-align: right">52.82</td>
					<td style="text-align: right">52.19</td>
			</tr>
			<tr>
					<td>all-MiniLM-L6-v2</td>
					<td>GMM</td>
					<td style="text-align: right">47.84</td>
					<td style="text-align: right">48.77</td>
					<td style="text-align: right">50.10</td>
					<td style="text-align: right">48.90</td>
			</tr>
			<tr>
					<td>Whisper + GPT-4o</td>
					<td>直接分区</td>
					<td style="text-align: right">59.25</td>
					<td style="text-align: right">59.60</td>
					<td style="text-align: right">62.42</td>
					<td style="text-align: right">60.42</td>
			</tr>
			<tr>
					<td>GPT-4o-audio-preview</td>
					<td>直接分区</td>
					<td style="text-align: right">58.19</td>
					<td style="text-align: right">59.14</td>
					<td style="text-align: right">66.58</td>
					<td style="text-align: right">61.30</td>
			</tr>
			<tr>
					<td>GPT-audio-1.5</td>
					<td>直接分区</td>
					<td style="text-align: right">58.14</td>
					<td style="text-align: right">57.05</td>
					<td style="text-align: right">70.24</td>
					<td style="text-align: right">61.81</td>
			</tr>
			<tr>
					<td>Qwen3-omni-instruct-30B</td>
					<td>直接分区</td>
					<td style="text-align: right">24.61</td>
					<td style="text-align: right">25.88</td>
					<td style="text-align: right">25.31</td>
					<td style="text-align: right">25.27</td>
			</tr>
			<tr>
					<td>Audio Flamingo 3</td>
					<td>直接分区</td>
					<td style="text-align: right">0.17</td>
					<td style="text-align: right">0.33</td>
					<td style="text-align: right">0.28</td>
					<td style="text-align: right">0.26</td>
			</tr>
			<tr>
					<td>Qwen2.5-omni</td>
					<td>直接分区</td>
					<td style="text-align: right">24.07</td>
					<td style="text-align: right">25.49</td>
					<td style="text-align: right">22.57</td>
					<td style="text-align: right">24.05</td>
			</tr>
			<tr>
					<td>AudioLens-R1</td>
					<td>直接分区</td>
					<td style="text-align: right">74.15</td>
					<td style="text-align: right">73.65</td>
					<td style="text-align: right">72.50</td>
					<td style="text-align: right">73.43</td>
			</tr>
	</tbody>
</table>
<p>原表 3 同样以蓝色粗体标每列最佳、以下划线标第二佳；连续子表保留这些比较所依赖的全部数值，但不要求读者依赖颜色辨识。</p>
<p>AudioLens-R1 overall V-measure 为 73.43，比 GPT-audio-1.5 的 61.81 高 11.62 个绝对点，并在 12 格中赢下 11 格；例外是 Banking77 L2，GPT-audio-1.5 的 84.12 高于 AudioLens-R1 的 78.64。这个例外很重要：论文能主张广泛而非逐格无条件领先，不能把“11/12”改写成“全部领先”。</p>
<h3 id="rd-与-dpo-合在一起才出现主要增益单独使用也有退化">RD 与 DPO 合在一起才出现主要增益，单独使用也有退化</h3>
<p><strong>表 4 的问题是：相同基座下，answer-only SFT、RD SFT、answer-only+DPO 和 RD+DPO 各改变多少？</strong> \(\Delta\) 为相对 answer-only SFT 的绝对提升，指标方向均为↑。</p>
<table>
	<thead>
			<tr>
					<th>指标</th>
					<th>语料/汇总</th>
					<th style="text-align: right">Answer-only SFT</th>
					<th style="text-align: right">RD SFT</th>
					<th style="text-align: right">Answer-only + DPO</th>
					<th style="text-align: right">RD + DPO</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>ARI</td>
					<td>ECHR</td>
					<td style="text-align: right">33.17</td>
					<td style="text-align: right">33.85</td>
					<td style="text-align: right">35.38</td>
					<td style="text-align: right">42.02</td>
			</tr>
			<tr>
					<td>ARI</td>
					<td>S&amp;P 500</td>
					<td style="text-align: right">33.30</td>
					<td style="text-align: right">38.23</td>
					<td style="text-align: right">37.58</td>
					<td style="text-align: right">42.73</td>
			</tr>
			<tr>
					<td>ARI</td>
					<td>Banking77</td>
					<td style="text-align: right">39.50</td>
					<td style="text-align: right">39.48</td>
					<td style="text-align: right">41.26</td>
					<td style="text-align: right">49.85</td>
			</tr>
			<tr>
					<td>ARI</td>
					<td>MultiWOZ</td>
					<td style="text-align: right">33.34</td>
					<td style="text-align: right">32.34</td>
					<td style="text-align: right">34.07</td>
					<td style="text-align: right">44.50</td>
			</tr>
			<tr>
					<td>ARI</td>
					<td>Overall</td>
					<td style="text-align: right">34.83</td>
					<td style="text-align: right">35.97</td>
					<td style="text-align: right">37.07</td>
					<td style="text-align: right">44.77</td>
			</tr>
			<tr>
					<td>ARI</td>
					<td>\(\Delta\)</td>
					<td style="text-align: right">–</td>
					<td style="text-align: right">+1.14</td>
					<td style="text-align: right">+2.24</td>
					<td style="text-align: right">+9.94</td>
			</tr>
			<tr>
					<td>V-measure</td>
					<td>ECHR</td>
					<td style="text-align: right">69.30</td>
					<td style="text-align: right">69.20</td>
					<td style="text-align: right">70.96</td>
					<td style="text-align: right">75.38</td>
			</tr>
			<tr>
					<td>V-measure</td>
					<td>S&amp;P 500</td>
					<td style="text-align: right">66.27</td>
					<td style="text-align: right">69.88</td>
					<td style="text-align: right">69.90</td>
					<td style="text-align: right">73.32</td>
			</tr>
			<tr>
					<td>V-measure</td>
					<td>Banking77</td>
					<td style="text-align: right">71.21</td>
					<td style="text-align: right">72.51</td>
					<td style="text-align: right">74.13</td>
					<td style="text-align: right">79.10</td>
			</tr>
			<tr>
					<td>V-measure</td>
					<td>MultiWOZ</td>
					<td style="text-align: right">55.94</td>
					<td style="text-align: right">52.26</td>
					<td style="text-align: right">54.56</td>
					<td style="text-align: right">65.92</td>
			</tr>
			<tr>
					<td>V-measure</td>
					<td>Overall</td>
					<td style="text-align: right">65.68</td>
					<td style="text-align: right">65.96</td>
					<td style="text-align: right">67.39</td>
					<td style="text-align: right">73.43</td>
			</tr>
			<tr>
					<td>V-measure</td>
					<td>\(\Delta\)</td>
					<td style="text-align: right">–</td>
					<td style="text-align: right">+0.28</td>
					<td style="text-align: right">+1.71</td>
					<td style="text-align: right">+7.75</td>
			</tr>
	</tbody>
</table>
<p>RD 单独使 Banking77 ARI 从 39.50 降到 39.48，也使 MultiWOZ V-measure 从 55.94 降到 52.26；DPO 单独也没有证明每个来源都获益。这些反证防止把 RD 写成单一魔法。相反，RD+DPO 在四个语料的两项指标上均高于 answer-only SFT，整体 ARI/V-measure 分别提高 9.94/7.75 个绝对点。它支持两阶段组合在该基准中有效，却仍不能从这张整机消融单独推断“困难负例类别”或“某条教师推理”分别造成了多少收益。</p>
<h3 id="换成-qwen25-omni-后dpo-并非每个视角都上涨">换成 Qwen2.5-omni 后，DPO 并非每个视角都上涨</h3>
<p>附录 G 以 Qwen2.5-omni 为基座复做 RD SFT 与 RD+DPO。BG、Emo.、Spk.、Gen.、Reason 分别是背景噪声、情绪、说话人数、性别、语言推理视角平均。原表 8 的斜杠式宽单元格被拆为两张连续表；所有数值保留，指标方向均为↑。</p>
<p>表 8a（ARI↑，Qwen2.5-omni 基座）</p>
<table>
	<thead>
			<tr>
					<th>训练</th>
					<th>语料</th>
					<th style="text-align: right">BG</th>
					<th style="text-align: right">Emo.</th>
					<th style="text-align: right">Spk.</th>
					<th style="text-align: right">Gen.</th>
					<th style="text-align: right">Reason</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>RD SFT</td>
					<td>ECHR</td>
					<td style="text-align: right">0.2947</td>
					<td style="text-align: right">0.2809</td>
					<td style="text-align: right">0.2682</td>
					<td style="text-align: right">0.2806</td>
					<td style="text-align: right">0.3872</td>
			</tr>
			<tr>
					<td>RD+DPO</td>
					<td>ECHR</td>
					<td style="text-align: right">0.3163</td>
					<td style="text-align: right">0.2882</td>
					<td style="text-align: right">0.2727</td>
					<td style="text-align: right">0.2993</td>
					<td style="text-align: right">0.3821</td>
			</tr>
			<tr>
					<td>RD SFT</td>
					<td>S&amp;P 500</td>
					<td style="text-align: right">0.3754</td>
					<td style="text-align: right">0.3096</td>
					<td style="text-align: right">0.3212</td>
					<td style="text-align: right">0.3539</td>
					<td style="text-align: right">0.3968</td>
			</tr>
			<tr>
					<td>RD+DPO</td>
					<td>S&amp;P 500</td>
					<td style="text-align: right">0.3965</td>
					<td style="text-align: right">0.3169</td>
					<td style="text-align: right">0.3293</td>
					<td style="text-align: right">0.3554</td>
					<td style="text-align: right">0.4014</td>
			</tr>
			<tr>
					<td>RD SFT</td>
					<td>Banking77</td>
					<td style="text-align: right">0.3380</td>
					<td style="text-align: right">0.2616</td>
					<td style="text-align: right">0.3025</td>
					<td style="text-align: right">0.3803</td>
					<td style="text-align: right">0.4749</td>
			</tr>
			<tr>
					<td>RD+DPO</td>
					<td>Banking77</td>
					<td style="text-align: right">0.3818</td>
					<td style="text-align: right">0.2437</td>
					<td style="text-align: right">0.3448</td>
					<td style="text-align: right">0.3786</td>
					<td style="text-align: right">0.4507</td>
			</tr>
			<tr>
					<td>RD SFT</td>
					<td>MultiWOZ</td>
					<td style="text-align: right">0.3127</td>
					<td style="text-align: right">0.3664</td>
					<td style="text-align: right">0.0000</td>
					<td style="text-align: right">0.3823</td>
					<td style="text-align: right">0.4067</td>
			</tr>
			<tr>
					<td>RD+DPO</td>
					<td>MultiWOZ</td>
					<td style="text-align: right">0.3407</td>
					<td style="text-align: right">0.3557</td>
					<td style="text-align: right">0.0000</td>
					<td style="text-align: right">0.3724</td>
					<td style="text-align: right">0.4010</td>
			</tr>
			<tr>
					<td>RD SFT</td>
					<td>Overall</td>
					<td style="text-align: right">0.3302</td>
					<td style="text-align: right">0.3046</td>
					<td style="text-align: right">0.2230</td>
					<td style="text-align: right">0.3493</td>
					<td style="text-align: right">0.4164</td>
			</tr>
			<tr>
					<td>RD+DPO</td>
					<td>Overall</td>
					<td style="text-align: right">0.3588</td>
					<td style="text-align: right">0.3012</td>
					<td style="text-align: right">0.2367</td>
					<td style="text-align: right">0.3514</td>
					<td style="text-align: right">0.4088</td>
			</tr>
	</tbody>
</table>
<p>表 8b（V-measure↑，Qwen2.5-omni 基座）</p>
<table>
	<thead>
			<tr>
					<th>训练</th>
					<th>语料</th>
					<th style="text-align: right">BG</th>
					<th style="text-align: right">Emo.</th>
					<th style="text-align: right">Spk.</th>
					<th style="text-align: right">Gen.</th>
					<th style="text-align: right">Reason</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>RD SFT</td>
					<td>ECHR</td>
					<td style="text-align: right">0.6135</td>
					<td style="text-align: right">0.6772</td>
					<td style="text-align: right">0.6212</td>
					<td style="text-align: right">0.5756</td>
					<td style="text-align: right">0.8025</td>
			</tr>
			<tr>
					<td>RD+DPO</td>
					<td>ECHR</td>
					<td style="text-align: right">0.6221</td>
					<td style="text-align: right">0.6827</td>
					<td style="text-align: right">0.6223</td>
					<td style="text-align: right">0.5864</td>
					<td style="text-align: right">0.8000</td>
			</tr>
			<tr>
					<td>RD SFT</td>
					<td>S&amp;P 500</td>
					<td style="text-align: right">0.6460</td>
					<td style="text-align: right">0.6879</td>
					<td style="text-align: right">0.6294</td>
					<td style="text-align: right">0.5866</td>
					<td style="text-align: right">0.7717</td>
			</tr>
			<tr>
					<td>RD+DPO</td>
					<td>S&amp;P 500</td>
					<td style="text-align: right">0.6595</td>
					<td style="text-align: right">0.6920</td>
					<td style="text-align: right">0.6329</td>
					<td style="text-align: right">0.5837</td>
					<td style="text-align: right">0.7689</td>
			</tr>
			<tr>
					<td>RD SFT</td>
					<td>Banking77</td>
					<td style="text-align: right">0.5475</td>
					<td style="text-align: right">0.6769</td>
					<td style="text-align: right">0.4725</td>
					<td style="text-align: right">0.5801</td>
					<td style="text-align: right">0.8592</td>
			</tr>
			<tr>
					<td>RD+DPO</td>
					<td>Banking77</td>
					<td style="text-align: right">0.5834</td>
					<td style="text-align: right">0.6660</td>
					<td style="text-align: right">0.4921</td>
					<td style="text-align: right">0.5779</td>
					<td style="text-align: right">0.8485</td>
			</tr>
			<tr>
					<td>RD SFT</td>
					<td>MultiWOZ</td>
					<td style="text-align: right">0.5115</td>
					<td style="text-align: right">0.7023</td>
					<td style="text-align: right">0.0000</td>
					<td style="text-align: right">0.5134</td>
					<td style="text-align: right">0.6240</td>
			</tr>
			<tr>
					<td>RD+DPO</td>
					<td>MultiWOZ</td>
					<td style="text-align: right">0.5384</td>
					<td style="text-align: right">0.6985</td>
					<td style="text-align: right">0.0000</td>
					<td style="text-align: right">0.5141</td>
					<td style="text-align: right">0.6238</td>
			</tr>
			<tr>
					<td>RD SFT</td>
					<td>Overall</td>
					<td style="text-align: right">0.5796</td>
					<td style="text-align: right">0.6861</td>
					<td style="text-align: right">0.4308</td>
					<td style="text-align: right">0.5639</td>
					<td style="text-align: right">0.7643</td>
			</tr>
			<tr>
					<td>RD+DPO</td>
					<td>Overall</td>
					<td style="text-align: right">0.6008</td>
					<td style="text-align: right">0.6848</td>
					<td style="text-align: right">0.4368</td>
					<td style="text-align: right">0.5655</td>
					<td style="text-align: right">0.7603</td>
			</tr>
	</tbody>
</table>
<p>这个诊断既给出改善也给出退化：overall ARI 的背景噪声从 0.3302 升到 0.3588、说话人数从 0.2230 升到 0.2367；但情绪从 0.3046 降到 0.3012，语言推理从 0.4164 降到 0.4088。V-measure 的 overall BG 和 Spk. 上升，Emo. 与 Reason 下降；MultiWOZ 的 Spk. 两种训练都是 0.0000。它表明“RD+DPO 一定改善每种模型、每个视角”的说法不成立，也说明原主基座的综合增益不能自动外推到其他基座。</p>
<h3 id="能力边界应按证据类型分开而不要把案例当成定量结论">能力边界应按证据类型分开，而不要把案例当成定量结论</h3>
<p>论文的 Figure 4 是五个视角的雷达图，文本报告 AudioLens-R1 在背景噪声、情绪和语言推理的两项指标上均有最高平均表现；其中背景噪声为 ARI/V-measure \(41.45/60.35\)，情绪为 \(39.00/69.00\)，语言推理为 \(48.38/77.10\)。图的极坐标无法表示 Whisper+GPT-4o 在情绪 ARI 的 \(-1.50\)，该点被画成 0；因此应以数值表而非图形半径做精确比较。</p>
<p>读图任务：先沿训练步数观察总输出 token 与 <code>&lt;think&gt;</code>、<code>&lt;answer&gt;</code> 两条受字段约束的长度。要找的是起始处总长度的短暂尖峰，以及尖峰后这三条曲线是否趋于稳定；不要把某一时刻的绝对长度当成聚类准确率。</p>
<p><img alt="原论文 Figure 5a：总输出、<code>&lt;think&gt;</code> 与 <code>&lt;answer&gt;</code> token 长度随训练步数的变化" loading="lazy" src="https://arxiv.org/html/2608.25177v1/response_token_curve.png"></p>
<p>图上可见总输出长度在早期短暂冲高，而被计入 <code>&lt;think&gt;</code> 与 <code>&lt;answer&gt;</code> 的长度较低；随后三者稳定，且 <code>&lt;think&gt;</code> 占多数、<code>&lt;answer&gt;</code> 保持紧凑。论文据此解释为格式外 token 在适应期被抑制、输出格式趋于稳定。它只能支持这一次训练中的格式行为变化，不能证明分区正确、跨视角泛化、推理延迟或生产可靠性因此改善。</p>
<p>读图任务：再看训练和验证的 scaled preference margin 是否从负值越过零线并上升，同时看 policy-reference KL 是否平滑增加。重点是两类曲线的方向、过零和是否出现突变，而不是把它们误当成最终 ARI 或 V-measure。</p>
<p><img alt="原论文 Figure 5b：训练/验证偏好边际与策略—参考模型 KL 散度随训练步数的变化" loading="lazy" src="https://arxiv.org/html/2608.25177v1/margin_kl_combined_curve.svg"></p>
<p>图上可见训练与验证边际从负值越过零线并继续增长，验证曲线总体跟随训练曲线，KL 从近零平滑上升。论文将其解释为 DPO 逐步提高对选中答案相对拒绝答案的偏好，同时以受控方式偏离参考模型。图不能单独识别是哪一项训练设计造成变化，也没有多随机种子或误差条，因而不能推出稳健的因果效应、外部泛化或任意基座上的同样轨迹。</p>
<p>Figure 6 给出 SFT 回合的来源与簇结构画像；Figure 7 是 ECHR 案例：七个案件按申请人与责任主体关系被分为行政/监管、直接国家强制、私人纠纷中的司法保护和拘押条件四组。案例有助于理解“按视角而非表面主题分组”，但没有对应的人工案例评分，仍是能力示意。ArtifactIndex 还记录了 Figure 4 的三个子图、Figure 5 的两个子图、Figure 6、Figure 7 共七项；本篇可直接嵌入的原始 URL 为 Figure 1—3 及 Figure 5a/5b，后两者已在上文嵌入。Figure 4、6、7 的可验证资源未提供可嵌入 URL，本文仅以上述原文文字和数值说明其论证角色，不伪造或重绘图像。</p>
<table>
	<thead>
			<tr>
					<th>能力</th>
					<th>证据类型</th>
					<th>可以判断</th>
					<th>不能推出</th>
			</tr>
	</thead>
	<tbody>
			<tr>
					<td>受控四语料上的分区准确性</td>
					<td>表 2、表 3</td>
					<td>主模型在 ARI 12/12、V-measure 11/12 设定领先</td>
					<td>自然、多语言、真实业务录音同样领先</td>
			</tr>
			<tr>
					<td>RD+DPO 组合</td>
					<td>表 4 同基座消融</td>
					<td>组合相对 answer-only SFT 的整体增益最大</td>
					<td>每个子机制或负例类别的独立因果份额</td>
			</tr>
			<tr>
					<td>更换 Qwen2.5-omni 基座</td>
					<td>表 8</td>
					<td>某些声学视角提升、部分视角退化</td>
					<td>训练配方对所有基座都稳健</td>
			</tr>
			<tr>
					<td>输出格式稳定化</td>
					<td>Figure 5 训练曲线</td>
					<td>该次训练中格式外 token 下降、边际上升</td>
					<td>推理延迟、吞吐、成本或生产可靠性</td>
			</tr>
	</tbody>
</table>
<h3 id="复跑时先复现受控任务再把缺口写清楚">复跑时先复现受控任务，再把缺口写清楚</h3>
<p>研究者可以把下一步做成可证伪实验：在自然录音、多语言语料和未合成的噪声条件下重复 L0/L1/L2 切分，并单独消融原始音频、RD 教师质量、困难负例筛选和 LoRA 层选择。复现者有论文报告的四来源构造路线、Qwen3-TTS、SFT 回合统计和附录 E 超参数，可先复做受控训练；最大风险变量是语料构造所用的 LLM 提示、教师轨迹、TTS/噪声素材、筛选后的 1,075 个偏好对和实际脚本均未作为公开资源给出。产品读者则不应从本文直接推断可部署性：论文没有报告延迟、吞吐、GPU 内存、成本、鲁棒性、安全或隐私评估。</p>
<p>最后保留六个互不重复的记忆点：第一，AudioLens 的单位是“视角加集合”的分区，不是单条音频分类；第二，ASR 路线和转写 LLM 路线都可能在声音侧视角丢失信息；第三，基准通过文本验证和属性均衡来控制捷径，但仍是合成英语音频；第四，RD 教比较轨迹，DPO 在合法分区间偏好较好决策；第五，主结果很强但 Banking77 L2 的 V-measure 不是第一，替代基座也出现局部退化；第六，附录 E 已公开相当具体的训练超参数，真正阻碍独立复跑的是未公开代码、权重、数据入口和许可证。</p>
<h2 id="-评分依据与证据">⚖️ 评分依据与证据</h2>
<p>独立技术复审给出 1.7/1.25/1.35/0.9/1.2/0/0.3/0.75 八维分项：受控四语料、L0/L1/L2、消融与替代基座诊断充分，但评测仍是合成英语语音，且没有公开代码、权重、数据入口或许可证。</p>
]]></content:encoded>
      <category>Speech Clustering</category>
      <category>Audio-Language Models</category>
      <category>Reasoning Distillation</category>
      <category>Preference Optimization</category>
    </item>
  </channel>
</rss>
