英文题目:TamilEOT: A Dataset and Model for Semantic End-of-Turn Detection in Tamil Telephone Speech

标签:#轮次切换 | #SFT | #数据集 | #语音 | #单通道

评分:8.7/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 1.5/1.5 | 可复现 0.5/0.5 | 工程/实践 1.2/1.5

👥 作者与机构

  • Santhoshkumar V:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

语音智能体需在每次停顿判断用户是否说完,输入为用户单通道8秒音频,输出为完整或未完整的二值 verdict,难点在于无文本时仅靠韵律区分句中思考停顿与句末结束。作者先以Silero语音活动检测切出候选边界并用转写文本过滤串音得到18485条边界,其输出直接作为待标样本进入下一步。接着用音频大模型重标完整性标签替代规则标签得到训练集,该标签输出直接作为监督信号进入微调。然后微调Smart Turn v3的Whisper编码器加注意力池化分类头,并经动态int8量化与真实VAD回放做服役校验。该链条把有行为见证的换人边界与无见证的转写分段暂停区分开来,避免把转写员分段习惯误当语义完结,这是相对零样本直接沿用英文阈值的关键差异。在30个未见通话组成的4168条测试集下,微调后base模型相对零样本基线的准确率从70.30%提升至86.13%,ROC-AUC从0.751提升至0.921。结论适用边界受限于窄带泰米尔电话对话,宽带噪声与泰英混用等场景尚未验证,且标签噪声天花板约97.1%构成失败条件。重标全量数据花费5.69美元,单线程笔记本CPU推理延迟低于150毫秒,base动态量化模型仅21MB。

🔗 开源与复现资源

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要保留哪些信息?

本文解读的对象是泰米尔语电话语音的语音助手打断问题。输入是用户单通道的窄带电话音频,目标是在每 1 次停顿处回答用户是否说完,以便决定立刻接话还是继续等待。

必须保留的信息包括数据来源与切分方式、标注如何从规则换成音频大模型、微调前后在同一封闭测试集上的准确率与排序指标、运行条件与延迟测量方式,以及生产切窗带来的额外损耗。输出是一套可核对、可复述的方法说明,不做超出证据的效果承诺。

语音助手最先被用户感知到的错误往往是抢话或拖沓。如果只用声音有无来判断,系统就只能再加一个固定静音超时。超时设短,句中思考停顿会被打断。设长,每一轮说完都要等满计时。

论文要解决的是去掉这个单一旋钮,用最近几秒音频的韵律直接预测完整性,且在没有转写结果时就能开火。这种预测只用音频,不等转写。

语音活动检测 × 语义轮次终点检测: 语音活动检测分工是回答有没有声音,输出语音起止;语义轮次终点检测分工是回答停顿处是否说完,依据韵律是否完整给出完整或未完整 verdict;两者搭配的理由是前者决定何时切窗送检,后者决定是否接话,组合新增的作用是用 1 次语义判断替代固定静音超时,避免短则打断、长则每轮空等。

需要先固定正负类的含义。正类是完整,模型判完整意味着可以接话。误报即把未说完判成说完,是抢话方向的昂贵错误。

论文通篇用这个定义组织误报率,因此读表时要先确认分母是全集还是仅负类。作者特别提醒两种误报率相差约 3 倍,Smart Turn 公布的口径是误报数除以全集,而标准误报率分母仅为负类。

已有路线在同输入同目标下差在哪里?

同输入同目标的直接前任是 Smart Turn v3。它取用户单通道最近 8 秒音频,给出二分类 verdict。主体是 Whisper tiny 编码器加分类头,参数约八百万,整型量化后可在中央处理器上数十毫秒运行。

权重数据与训练代码都开放。论文选择在其上微调而不是另起架构,理由是缺的不是架构而是泰米尔数据。已发布权重覆盖 23 种语言,其中 3 个印度语言都属印欧语系印地雅利安语支,不含任何南印度语言。

另一条路线是双通道自监督的话轮预测,代表是语音活动投影。它需要同时看到说话双方未来的语音活动来学习轮次事件,与部署时只见用户上行流的设定不一致,因此不构成同运行阶段的可比基线。

还有一条是泰语终点检测研究,做法基于字幕转写文本在词边界分类,属于文本路线,依赖自动语音识别先吐词。而本文是纯音频路线,在转写存在之前运行。两者互补,不能把文本模型的分数直接当成音频模型的胜负。

数据集侧,首个直接面向终点检测的公开语料混合了语音合成对话与真实会话,Smart Turn 自带训练语料也以合成为主,两者都不含泰米尔,也不是窄带电话条件。而印度语音助手实际运行最多的正是窄带电话,这决定了论文必须从真实电话语料重新切边界。

为什么边界不能直接拿转写分段当真值?

源语料是 SPRING 实验室发布的 SPRING-INX 泰米尔 R1,116 通双人泰米尔电话对话,每通对话按说话人存成左右两个独立音频文件,各自由人工分别转写。说话人标签即文件归属,无需声纹分割。

作者核对 116 对全部完整且两腿时长零毫秒错位。每个样本只取说话人本腿最近音频,这与部署时助手只见用户上行流一致。

话轮转换 × 同说话人保持: 话轮转换指对方接管地板,天然带有说完的见证;同说话人保持指同一人在停顿后继续说,是超时策略处理不了的真正难点;两者搭配的理由是前者可用行为规则高精度标注,后者必须听韵律,组合意义是把评估重心放到同说话人停顿上,而不是被容易的话轮转换平均数掩盖。

直接用转写分段边缘找边界会失败。把两腿分段时长加总,约为通话墙钟的 107%,只有分段自带前后静音才可能超过 100%。这说明分段边缘膨胀了重叠并错置了间隙。

于是论文改用 Silero 语音活动检测在每腿独立跑出语音起止,转写只做两件事:确认该语音段确有转写覆盖以排除对方漏音,以及为过滤语气词提供文本。词到时间的分配按语音秒而非流逝秒摊,因为中位分段含较多静音,线性插值会把词分给无人说话的区间。

从一条停顿到一个标签再到一次预测,全景如何走通?

沿一条样本走完全程有助于建立依赖顺序。起点是某说话人腿上一个语音偏置时刻,构造器向前取 8 秒并向后留 200 毫秒静音,形成待判窗口。接着看该边界的来源,以及对方行为与转写分段两个见证是否一致。

来源字段只记录如何被发现与见证是否一致,不作特征,因为推理时不可得。然后由验证过的音频大模型给出完整或未完整 verdict,覆盖来源初判,写入发布标签。训练时该窗口进编码器输出完整概率,阈值默认取 0.5。

服务时同一逻辑位置的窗口改由生产语音活动检测实时闭合后送入,模型只见 VAD 交出的内容。因此离线切窗与生产切窗是两个不同条件,必须分别测量。

下面的第一张表提出待核对的构成问题:在发布集中 4 类来源各占多少,是否以同说话人停顿为主。公平条件是来源只记录发现方式,不参与推理。指标方向是看主体是否落在真正需要韵律判断的桶中。

provenancedetected asnn
hold_intranegative10,402
changepositive4,660
hold_internegative2,343
change_midsegpositive1,080
total18,485

该表显示数据主体是同说话人句内停顿与地板转换两大块,外加两类见证不一致而曾被暂扣的边界。暂扣的两类在获得第三方验证见证后才放行,另有放宽两道闸门后 2 次回收的 2272 行。总量是训练开发测试划分之和,划分按通话而非按条。

编码器与分类头各自做什么,为什么这样搭配?

模型架构完全沿用 Smart Turn v3,不做结构改动。编码器是开放的 Whisper tiny 或 Whisper base,负责把 8 秒对数梅尔窗口编码为韵律表示。分类头是注意力池化后接线性二分类器,负责把变长表示压成完整与否的一个概率。

损失用带每批次正类权重的二元交叉熵,使占比约 1.88 比一的类别在梯度上大致等权。选择该搭配的理由是编码器已能听见泰米尔韵律排序信号,缺的只是决策边界,因此微调比从零训练更省且可直接替换上游件。

训练与导出链条只有一处字符串差异。编码器字符串取 tiny 或 base,6 轮、学习率 5 乘 10 的负 5 次方、批量三十二、种子零,在开发集准确率上选最优轮,通常是第三或第四轮。导出走浮点 ONNX 再转动态整型量化,全程在中央处理器上完成。

训练硬件是谷歌协作平台上一块 T4,无多卡步骤。作者做了两层一致性核对:发布的 ONNX 在封闭测试集上重打分复现训练数字,重导出 base 检查点得到逐比特一致的图。因此正文数字对应可下载件而非训练日志。

阈值 0.5 是训练沿袭而非优选,模型峰值并不在此。后文会说明按开发集选阈在测试集上反而掉点,而按误报率定操作点则方向可迁移但水平会漂移。

规则标签错在哪里,音频大模型如何被选中接管?

首版标签是规则:地板转换落在分段末即完整,停顿完全落在一段转写内即未完整。这种构造便宜且常见,但论文没有默认它正确,而是做了 197 条按来源与标签分层的盲听,一条只听 1 次,不给标签与元数据,只听音频。

规则衍生标签 × 音频大模型标注: 规则衍生标签分工是用转写分段边与地板变化低成本批量打标;音频大模型标注分工是只听音频判断句法是否完整;搭配理由是盲听发现规则在负类只有 44.4% 一致,回答的是是否想继续而非是否说完,组合新增的作用是以 97.5% 人听一致的第三方见证替换无见证负类,并保留管线字段以便重算。

下面的第二张表提出待核对的标注质量问题:规则标签与盲听一致率在正负类上是否对称。公平条件是听者只听音频,不见标签与元数据。指标方向是一致率越高说明规则越接近人听的完整性判断。

classgrounded inagreement with listener
change (positive)the other person took the floor95.9%
hold_intra (negative)a pause fell inside a segment44.4%
overall70.1%

该表显示正类因有对方接管地板这一已记录行为作见证,一致率达 95.9%。负类所依据的停顿落在一段内只是转写员何处换行的判断,没有关于是否说完的见证,一致率只有 44.4%,低于随机。

作者把分歧命名为两个问题之别。问题一是该话语在句法上是否完整,这是听者、提示词与 Smart Turn 数据所问。问题二是说话人是否打算继续,这是暂停预言机与转写衍生标签所问。规则负类回答的是问题二,而待微调的预训练模型学的是问题一。

把评估改写成问题二也被否决,理由是混在一起等于教两个问题。进一步证据是管线算出的全部结构文本与元数据特征合在一起,也只能以 0.637 的曲线下面积预测人工 verdict,说明不是特征工程能救的。

下面的第三张表提出替代者的选择问题:7 个能听的模型在同样盲听集上谁与人听最一致,价格差多少。公平条件是同样 197 条、同样提示、纯音频、无转写、无先验标签。指标方向是一致率越高且全池价格越低越值得选中。

labelleragreementon hold_intraest. cost, full pool
gemini-3.7-flash97.5%97.0%5.77 美元
gemini-3.1-pro-preview96.4%93.9%41.17 美元
gemini-3.6-flash96.4%97.0%9.10 美元
gemini-3.5-flash93.9%92.9%11.82 美元
gemini-3-flash-preview93.4%90.9%17.09 美元
gemini-2.5-flash91.8%90.8%13.50 美元
gemini-3.5-flash-lite66.5%68.7%1.18 美元
the rule-derived labels70.1%44.4%—

该表显示前 3 名经统计检验不可分,于是按价格打破平局,选中在该负类上达 97.0%、总体 97.5% 的模型。全池重标花费 5.69 美元,另加后期 2272 行约 0.78 美元。2 次独立测量相互印证,重标翻转了负类约一半,盲听中规则错约一半以上。

重标还顺带收敛了一处已知结构缺陷。句内保持要求段内有停顿,负类按构造取自更长话语,漏到音频里就是浊音占比偏差,闸门在决定标签,闸门的偏置就跟着标签走。重标后两个泄漏特征的效应量降到接近零,捷径探针停在近随机带。

下面的第四张表提出残余噪声的估计问题:双见证一致与争议子集各占测试集多少,标签准确率各是多少。公平条件是按行记录的见证划分,不用模型预测划分。指标方向是加权准确率即标签噪声上限。

subsetshare of testlabel accuracy
both witnesses agree62.3%99.3%
disputed37.7%93.5%
weighted97.1%

该表加权得 97.1%,超过该线就是在拟合标注误差,而最优模型在 86.13%,仍有约十一点空间,说明当前瓶颈不是标签质量。另有 3 条人工标签经 7 个模型一致反驳后复听确认是人工错,修正 verdict 存文件并重算下游数字。

数据如何划分,指标与硬件条件如何固定?

划分按通话执行,训练七十一通 11992 条,开发十五通 2325 条,测试三十通 4168 条,测试集在任何训练前 1 次切定且事后未改。按通话的意义是测试嗓音在训练中从未出现,避免学嗓音代替学韵律。

作者点名源语料另一版本按话语划分会把同一录音放两侧,甚至五百余条录音同时出现在训练与评估,这是轮次检测必须避开的泄漏。按通话划分是本实验可复述的关键条件。

指标方向需要先统一。正类恒为完整,误报即抢话。Smart Turn 口径的误报数除以全集与漏报数除以全集相加等于错误率。标准误报率分母仅负类。阈值默认 0.5,延迟是批量一、单线程、仅推理的百分位五十。

延迟在同一台空闲英特尔 i5-12450H 笔记本上同法计时,另加约 12 毫秒梅尔前端。作者强调该列只在内部可比,不是部署规格,服务器芯片、编解码与框架调度都会移动绝对值。

训练预算很小。编码器字符串是 tiny 与 base 的唯一差别,6 轮固定,开发集选轮,单卡 T4 完成。评估除核心准确率与排序指标外,还按来源分桶报告相对多数类策略的得失,并用配对回放度量服务损耗。

微调带来多大可运行增益,代价落在何处?

先立可复现基线。零样本 v3.2 在测试集上准确率 70.30%,排序指标 0.751。在阈值 0.5 处把约三分之一未说完判成说完。v3.0 更保守,准确率更低但误报减半,排序指标 0.779。

直接在测试集上扫阈值上限为 74.23%,这是事后上限而非可部署修复,说明编码器已有排序信号、错的是边界。阈值本身不能替代微调。

离线切窗准确率 × 服务侧回放准确率: 离线切窗准确率分工是度量数据集构造器在语音偏置后 200 毫秒处切好的窗口上的判别力;服务侧回放准确率分工是度量同一标注边界经真实 VAD 与流式适配器在 20 毫秒帧下实际交到模型的窗口上的表现;搭配理由是两者配对回放才能隔离切窗位移,组合意义是揭示约 2.60 点的系统损耗与部分零覆盖边界,这是离线表看不到的部署成本。

下面的第五张表提出核心比较问题:在同一封闭测试集上,零样本与两个可下载的动态量化模型谁的准确率与排序指标更高,体积与单线程延迟是否可运行。公平条件是同一 4168 条、同一阈值 0.5、同一台笔记本计时。指标方向是准确率与排序指标越高越好,延迟越低越好。

条件指标基线本方法可运行含义
4168 条 30 通未见来电,阈值 0.5准确率70.30%83.71%,86.13%tiny 8.7 MB 与 base 21 MB 均可直接替换
同上ROC-AUC0.7510.921排序信号被决策边界修正兑现
同一笔记本单线程批量 1推理延迟未报告150 ms 内含前端约再加 12 ms,仍留预算

该表显示发布件是 tiny 动态量化版 8.7 兆与 base 动态量化版二十一兆,测试准确率分别为 83.71% 与 86.13%,排序指标分别为 0.905 与 0.921。相对零样本增益 15.83 点,排序指标从 0.751 到 0.921。

延迟上 tiny 动态量化单线程 83 毫秒、base 143 毫秒,均在 150 毫秒内,多核可再降,但作者以单线程为先,因为并发服务无法给每路 12 核。收益集中在同说话人停顿,这正是超时处理不了的主体。

表后需要同时读代价。阈值 0.5 并非峰值,按开发集极大值选阈在测试集上反而掉点。把开发集误报率压到 10% 可将误报数除以全集减半,但约丢三点准确率且水平漂到测试集 10% 二到十四。

静态量化在 tiny 上掉 4.03、在 base 上掉 12.76 且排序指标崩到 0.792,校准集覆盖不了大模型的激活范围。tiny 静态量化虽有全表最优的误报数除以全集,却是倒数第二差的模型,这是单指标选型的反例。

下面的第六张表提出服务损耗问题:同一批已标注边界经生产 VAD 与流式适配器后,准确率掉多少,多少边界根本不被送达。公平条件是同行配对回放,唯一变量是窗口在哪里结束。指标方向是损耗越小、覆盖越高越接近离线分。

场景边界规模窗口位移与覆盖准确率代价可运行含义
预切窗对照500按标注切分基准离线分
直播窗回放461VAD 闭合 92.2%2.60 点系统属性非模型属性
未覆盖边界39完整 94%,未完整 89%不计入模型误框架不请求即无预测

该表显示 500 条只闭合 461 条,92.2%,完整类 94%、未完整类 89%,低于最小静音加 50 毫秒的边界根本不会唤起模型。原因可测:VAD 中位闭合比构造器多 90 毫秒拖尾静音,这是训练从未见过的位移。配对一致率约 90%,检验未达显著,应读作两到三点、小而可能为真。

六个训练旋钮中哪一个真正移动了结果?

在谈任何增量前,论文先立可复现性下限。同配置同种子跑 3 次 base,得 86.23%、85.63、85.36,极差 0.87 点。原因是确定性开关只约束部分算子,注意力走的高速内核用原子加。

非结合浮点加在约两千余步优化后发散,再经按开发集选轮放大。作者要求把约一点以下都当噪声读,这是阅读其余数字最重要的标尺。

6 个旋钮中唯一走出噪声的是编码器容量。tiny 换 base 在测试准确率上加 2.88,排序指标加 0.018。蒸馏 base 到 tiny 只加 0.41,落在极差内,且增益全在地板转换桶而需听韵律的句内桶反而变差。

误报数除以全集恶化 1.41,说明记住训练集的教师只剩结构正则可传。放宽漏斗多取约 10% 9.9 训练行只加 0.03,学习率重调与数据从半量到全量在 tiny 上分别只动 0.003 与 0.001。

阈值按开发集调参在测试集上掉 1.13,静态量化在 base 上掉 12.76。诊断并不跨架构迁移。tiny 上学习曲线从半量到全量几乎平坦,属容量受限。base 上仍在爬升且训练开发差拉到 11.81 点,已转入数据受限。

同算力下 4 倍数据带来 3.32 增益,同数据下 4 倍轮数几乎零增益,因此缺的是数据而非步数。类别不平衡不是问题:每批正权约 0.53 已使两类等权,决定分数的句内桶本身接近平衡。

编码器容量 × 动态整型量化: 编码器容量分工是决定韵律表示上限,从 Whisper tiny 换到 base 带来可复现增益;动态整型量化分工是把体积与单线程延迟压下来而不重排决策面;搭配理由是容量解决欠拟合、动态量化解决可部署性,组合意义是 tiny 与 base 的动态量化版都可发布为直接替换件,而静态量化在 base 上崩溃则不能只看误打断率单指标选用。

哪些边界尚未被测量,不能直接推广?

第一是单语料单域。全部 116 通来自同一窄带电话语料,未测宽带、噪声、泰米尔英语码切换与语料外人群。三十通测试未见但同分布,不能当跨分布泛化证据。

第二是标签为人验而非人产。97.5% 一致基于 197 条与单一听者,样本小且听者单一,残余噪声估计依赖双见证划分,争议子集标签准确率 93.5% 仍有误差。

第三是复现下限宽。0.87 的极差使表中多个小增量不可证伪,作者如实标为噪声而非发现。确定性算法开关未验证且昂贵。第四是直播对照非受控。7 组话语块、单说话人、语言模型与合成器非确定,两臂是不同对话不同时钟。

只有按话语计的碎片率可比,总量与墙钟不可比。固定超时对照报告的中位端点加 120 毫秒与碎片降 35% 是方向性存在证明,承载 serving 主张的仍是已标注配对回放。

已知开放项还包括正则化未试、短缓冲未测。base 重度记忆而 SpecAugment、更高丢弃与早停都未探索。每轮首个预测因窗口清零右补零而处于分布外,训练中短于 8 秒的仅数十条,3 次直播的受影响率波动极大。

复现先做什么,需要哪些可运行条件?

先按调用顺序准备四样东西。代码与管线取公开仓库,权重取动态量化 ONNX,数据集取 18485 边界发布版,推理包取包索引上的发行版。本次核验中代码与第三方包返回可用,模型与数据集链接本次未能确认可达。

因此不要把权重下载当成已验证步骤,优先用仓库内去文本标签表复现标注质量与竞标报告,这两步被设计为无语料、无显卡、无云账单即可逐字节复现。

复现顺序建议与论文依赖一致。第一步重跑弱探针与泄漏特征效应量,确认拖尾等长且近随机。第二步用已提交的人听 197 条重算规则与大模型的一致率,确认负类翻转比例。

第三步在封闭测试集上重打分发布 ONNX,核对 tiny 与 base 的准确率与排序指标。第四步跑配对回放,用同行双列确认两到三点损耗与覆盖率,而不是直接做直播对照。阈值保持 0.5,延迟只在同一机器同法下比相对顺序。

超参数与信息条件要原样保留。6 轮、学习率、批量、种子、按开发集选轮、每批正权、8 秒窗加 200 毫秒拖尾、VAD 最小静音 0.25 秒、20 毫秒帧推进,缺一即不可比。框架计数器只在助手已开麦后才计误打断,句中已提交导致的碎片对其不可见。

因此直播必须报碎片率而非自带计数器。回放泵若跑过 VAD 会让缓冲越过闭合点,模型看到直播时还没有的未来音频,曾 1 次造成二十六点假性崩溃,配对同行重算已知离线数是捕捉此类 harness 缺陷的唯一办法。

何时值得尝试这条管线,还需补哪项验证?

当任务是单通道、无转写、先于识别开火的完整性判断,且手头有双通道会话语料可借行为见证时,这条管线值得尝试。它的可移植部分是结构而非语言:用对方接管作正类见证,用盲听度量规则负类。

用能听的第三方作仲裁,用配对回放度量系统损耗。预期收益是把零样本约三分之一的句中抢话压到可用区间,预期代价是容量换数据、阈值换误报、动态量化换体积延迟,以及生产切窗的两到三点与部分零覆盖。

还需补的验证很具体。跨域至少要测宽带、噪声与码切换。标注至少要扩听者数与条数并报告分桶一致。容量变化后重跑训练开发差以确认受限类型。短缓冲按 0.5 秒到 4 秒截断在全量测试集上补测。

直播若要当基准,必须同提交路径、固定随机性、按话语计碎片。做完这些,才能把方向性存在证明升级为可部署结论。论文的价值正在于把能走的路与走不通的路都留下可重跑的证据,而不是只留一个峰值数字。

📎 论文与评分元数据

排名:前25% | 文档类型:数据集与基准 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-10 语音/音乐/音频论文速递