📄 当八成轮替都重叠时,静音阈值为什么会失灵?
英文题目:Real-TurnTurk: A Multimodal Turkish Corpus for Turn-Taking Prediction
一句话:针对土耳其语自然对话缺乏重叠可归因的多模态轮替语料,论文构建了 11 段同步视音文语料并用遗传算法在 2 秒窗口上搜索可读的 AND-OR 规则,在对话级交叉验证中以 57.0% F1 超过全正基线 7 个点,代价是语料规模小、说话人高度不均衡且未与现代分类器对比。
标签:#多模态模型 #低资源 #数据集
评分:5.1/10 | 创新 1.1/2 | 技术严谨 1/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
👥 作者与机构
- Ahmet Tuğrul Bayrak:机构信息未在 arXiv HTML 中可靠披露
- Fatma Nur Korkmaz:机构信息未在 arXiv HTML 中可靠披露
- Bekir Berker Türker:机构信息未在 arXiv HTML 中可靠披露
- Mustafa Sertaç Türkel:机构信息未在 arXiv HTML 中可靠披露
- Alper Kaplan:机构信息未在 arXiv HTML 中可靠披露
💬 毒舌点评
亮点在于坦诚地把土耳其自然对话中81.4%重叠与12.4%静音的残酷现实摆上台面,并用可检查的AND-OR规则让预测逻辑可审计。短板是11段对话、2个hub说话人撑起的4.23小时语料上只比全正基线高7.0个F1点,却未与任何现代神经基线对比,离可部署的轮替预测仍有明显距离。
📌 核心摘要
论文针对土耳其语自然对话中轮替预测(turn-taking prediction)缺乏多模态自然语料的问题,提出填补该空白的Real-TurnTurk语料并研究可解释预测。机制上将预测建模为二分类,在2.0 s预转折窗口上抽取视觉、声学与语言三模态特征,并以遗传算法(Genetic Algorithm, GA)搜索混合AND-OR逻辑规则以捕捉多路径转折线索。相较已有依赖静音阈值或纯文本词法线索的方法,该工作以同步前视视频与分轨音频支撑重叠语音归因,并以可读规则替代黑盒分类器。核心实验证据为5折对话级交叉验证下GA规则取得57.0% F1,相对全正基线50.0%提升7.0个点。该规则可直接检查且评估代价低,适合对延迟与可解释性敏感的对话系统参考。作者亦承认语料规模小、说话人高度不均衡且未与随机森林等强基线对比,外推至未见说话人时性能应视为上界。
🔗 开源与复现资源
- 代码:论文中未提及代码链接
- 模型权重:论文中未提及
- 数据集:Real-TurnTurk子集已开源,Hugging Face链接 https://huggingface.co/datasets/tugrulbayrak/Real-TurnTurk ,包含11段无脚本双人对话共253.6分钟,5383个语音片段和35728词,含同步VTT文本、WebM音频和MP4视频,完整数据集未完全公开
- Demo:论文中未提及
- 复现材料:论文在Table III中给出28个特征的完整定义与取值范围,在Table IV和Algorithm 1中给出GA完整配置,种群大小500,最大迭代900代,锦标赛选择大小5,交叉率0.85,变异率0.10,每条规则含3到7个条件,精英保留5%,适应度为训练集F1分数,每折运行5次随机种子为1到5,若100代无提升则早停,负样本采样按对话时长分层随机采样3500个并设置正样本周围1.0秒排除缓冲,随机种子42,评估采用5折交叉验证并给出最终全量数据训练得到的可解释规则
- 论文中引用的开源项目:MediaPipe Face Mesh用于面部关键点提取,Py-Feat用于面部动作单元分析,openSMILE及其eGeMAPSv02特征集用于12个声学特征提取,Silero VAD用于静音基线检测,论文中未提供上述工具的具体URL链接
🧭 深度解读
为什么轮替预测不是等静音就够了?
想象你在和朋友视频通话,系统总在你停顿半秒后就抢话,或者在你犹豫时迟迟不接话,体验会立刻变差。轮替(turn-taking)就是对话中谁该说、谁该让的组织规则,早期理论用话轮建构单元(Turn-Constructional Units, TCUs)和过渡相关位置(Transition Relevance Places, TRPs)来描述它。
工程上最省事的做法是定一个静音阈值:超过 1 秒没声音就认为轮替发生了。但人的节奏差异很大,有人说得快、停顿短,有人边想边说、拉长尾音,固定阈值要么切得太早造成重叠,要么等得太久增加延迟。更麻烦的是,自然对话里大量轮替本身就带着重叠——这篇论文的标注显示 81.4% 的真轮替包含重叠,静音在此时根本不存在。
所以任务的难点不在于检测静音,而在于在重叠主导、噪声多、线索分散的条件下,提前判断当前说话人是否准备交出话轮,并且要快、要准、最好还能解释为什么这样判。对土耳其语而言,这个难点又叠加了资源稀缺:此前多是情感分析或合成数据,缺少带同步视频、分轨音频和毫秒级对齐转写的自然轮替语料。
已有路线走到了哪里,空白又在哪里?
一条路线把轮替当作语音活动预测的连续问题来做。多尺度循环模型从多模态流中预测下一时刻谁在说话,语音活动投影(Voice Activity Projection, VAP)则自监督地从未来语音活动学习转折,甚至被嵌入增量式对话系统;更近的全双工语音基座模型直接把轮替管理做进生成过程。这类方法追求低延迟和端到端,但往往是黑盒,且多在英语等高资源语言上验证。
另一条路线依赖语言线索。词法句法特征、语言模型对句末的判断,都能在文本层面提升轮替结束预测,加入音频、文本和手势的多模态融合也常优于单模态。但这些工作同样受限于评测:缺少标准化的多语言基准,尤其缺少对自然重叠对话的细粒度标注。
土耳其语的空白正好卡在这里。论文的定位不是再提一个更大神经网络,而是先补数据底座:采集无脚本双人对话,提供前视视频与每人一路独立音频以支撑重叠归因,再把预测形式化为可解释的二分类规则搜索,与黑盒分类器形成对照。选择可读规则而非深度模型,是为了在延迟敏感、可审计的对话系统中提供一个可直接检查的起点。
任务如何被精确定义?
给定对话中某个候选时刻 t,系统只能看到当前持有话轮的说话人在 t 之前 2.0 秒内的多模态观测,判断他是否即将让出话轮。输出是二值:1 表示即将发生轮替,0 表示继续持有。这是一个离线标注、在线可用的二分类问题,评估时允许 0.5 秒的时间容差,以抵消人工时间戳的抖动。
标注本身需要先把什么是真轮替说清楚。论文把转写中的连续同说话人片段合并,消除切分造成的伪转折,然后用 4 条件并发来判定真阳性:
\[\text{TurnChange}(t)=1\iff\begin{aligned} &(S_{i}\neq S_{i+1})\\ &\land(d_{i+1}\geq 0.5s)\\ &\land(T_{i+1}\notin\text{FillerWords})\\ &\land(\text{len}(T_{i+1})>3)\end{aligned}\]这里 t 是后一段的起始时刻,S_i 与 S_{i+1} 是前后段说话人,d_{i+1} 是后段时长,T_{i+1} 是后段文本。4 条件分别要求说话人切换、后段足够长以排除“嗯、hıhı”类回馈、非填充词且字符长度大于 3。时间锚定在后段起始,为特征窗口提供明确的 t。
一个容易误解的点是填充词。标注过滤的是后段 i+1 的填充词,而特征描述的是 t 之前 2.0 秒内前段说话人的行为,二者在说话人上解耦,因此窗口末尾出现填充词仍可作为“当前说话人在拖长、犹豫”的正向线索,而不构成标签泄漏。图 1 要回答的正是这套过滤如何把回馈与真轮替分开,读者应沿着解析、合并、检测切换、应用 4 条件这条流程看判定如何收敛。
整体流水线如何组织?
方法是一条 4 段式离线流水线:语料构建与标注产生监督信号,多模态特征窗抽取把 2 秒观测压缩为 28 维向量,遗传算法(Genetic Algorithm, GA)搜索混合 AND-OR 逻辑规则,最后按对话划分做交叉验证评估。输入是 t 之前 2.0 秒的当前说话人观测,输出是是否轮替的二值判定。
数据侧提供 11 段无脚本双人对话,同步包含 1920×1080、16 帧/秒的前视视频,每人一路 48 kHz WebM 音频,以及毫秒级 VTT 转写。9 段具备分轨音频,因而能在重叠时把语音归因到个人。负样本在非转折且满足特征抽取条件的时刻中按对话时长分层随机采样 3500 例,并在每个正样本前后 1.0 秒内禁止采样以避免窗口泄漏,正负比固定为 1:2。
特征侧刻意只描述当前说话人,不看听者画面,共 28 维:视觉 9 维、声学 12 维、语言 7 维。规则侧把每条规则编码为 3 到 7 个条件的序列,每个条件包含特征、阈值、比较算子(≥、≤、==)和连接到下一条件的逻辑算子(∧、∨),整体形如 if (f1 c1 θ1) [op] (f2 c2 θ2) … then y=1 else y=0,天然支持用 OR 表达多条独立的转折路径。图 2 要回答的是染色体如何对应这样一条规则,读者应看特征 F、比较符 C、阈值 T 与逻辑连接 L 如何串成一个可执行的 if-then 句。
28 维特征与 AND-OR 规则各自承担什么?
特征生成组件的职责是把 2 秒窗口内的行为翻译成可比较的数值,且全部来自当前说话人。视觉 9 维来自 MediaPipe Face Mesh 与 Py-Feat 在左右分裁画面上独立计算的 landmark 运动、动作单元(Action Unit, AU)强度变化、眨眼率、注视变化、口部张开变化、头部旋转与平移、眉毛位移与 AU12 唇角拉动,按 16 帧/秒聚合均值与标准差。声学 12 维来自 openSMILE 的 eGeMAPSv02 在 10 毫秒帧上抽取的 F0 均值、变异系数与尺度化变异、RMS 能量均值与标准差及每秒变化率、频谱质心、85% 滚降、带宽与对比度、浊音占比与 onset 速率,F0 与语音活动检测来自独立通道与 Silero VAD,词级对齐由 wav2vec 2.0 强制对齐提供。
语言 7 维来自对齐转写的窗内平均词时长、平均音节数、末词是否为填充词、是否含疑问词、是否含肯定词、是否即时重复词以及句法完整度分数。所有阈值采样均基于训练分区的观测范围,不做特征缩放,测试分区统计不参与搜索。
规则优化组件的职责是在组合空间中找到可读且 F1 高的判定逻辑。个体就是一条完整规则,条件数在 3 到 7 之间均匀采样,进化通过锦标赛选择、单点条件交叉和 3 类变异(阈值、特征、逻辑算子)来探索不同特征阈值与 AND-OR 组合。适应度直接取训练分区上的 F1,兼顾精确率与召回率的平衡。评估时预测落在标注转折 0.5 秒容差内算真正例,该容差同步应用于全部基线。
全量数据重训后得到的可解释实例最能说明设计意图:
\[\begin{split}(\text{word\_duration}\geq 0.60\,\mathrm{s}\land\text{energy\_rate}\geq 1.00)\\ \lor(\text{gaze\_changes}\geq 0.35\land\text{f0\_mean}\geq 120\,\mathrm{Hz})\\ \lor(\text{is\_filler}=1\land\text{word\_duration}\geq 0.80\,\mathrm{s})\end{split}\]这条规则只用了 28 维中的 5 维,形成 3 条 OR 分支:词时长与能量变化的韵律收尾、注视变化与 F0 的视听协同、填充词与词时长延长的犹豫延长。视觉仅贡献 1 个条件,说明在该语料与该搜索下 3 模态并未均等发力,但规则本身参数极少、评估代价低,可直接检查与部署。

论文图 1。这张图来自原论文 Fig. 1:,图示内容为“Turn labelling flow.”。请结合“28 维特征与 AND-OR 规则各自承担什么?”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。
没有神经网络训练,什么在被优化?
这项工作没有训练可学习的神经网络权重,也就没有反向传播与梯度更新。被优化的是符号规则本身:特征选哪几个、阈值定多少、条件之间用 AND 还是 OR 连接。优化器是遗传算法,在离散组合空间中做进化搜索。
具体配置为种群 500、最多 900 代、锦标赛选择规模 5、单点条件交叉率 0.85、每子代 0.10 变异率且在阈值、特征与逻辑算子 3 类变异中均分、精英保留 5%。每条规则条件数在 3 到 7 之间,每折独立运行 5 次取最优,100 代无提升则早停。适应度为训练分区 F1,阈值采样直接来自训练分区观测范围,避免测试信息泄漏。
推理过程是确定性的规则评估:对候选时刻 t 抽取其前 2.0 秒的 28 维特征,代入当前最优规则的若干不等式与逻辑组合,满足任一 OR 分支即判为 1,否则为 0。整个过程无需特征缩放,计算量仅为少量比较与逻辑运算,适合对延迟敏感的对话系统参考。作者也明确该流程为离线搜索与离线评估,尚未集成到流式实时智能体中。
数据、划分与评测如何搭建?
语料规模与构成是理解所有数字的前提。11 段对话总计 253.6 分钟,其中语音 222.1 分钟(87.6%)、非语音 31.5 分钟(12.4%),转写含 5383 个语音段与 35728 词。按对话时长 16.0 至 31.4 分钟不等,9 段提供分轨音频以支撑重叠归因。说话人极不均衡:user_01 参与 5 段占 26.7% 词与 28.6% 时长,user_03 参与 6 段占 34.1% 词与 31.5% 时长,二者合计占 60.8% 词与 60.1% 时长,其余 9 人各参与 1 至 2 段,且每段对话必含 user_01 或 user_03 之一。
样本构造上,满足 4 条件过滤后得到 1750 例正例,负例 3500 例按对话时长分层随机采样,种子 42,类别比 1:2,正样本前后 1.0 秒为排除缓冲。特征窗口固定为 t 之前 2.0 秒,仅描述当前说话人,28 维无缩放。评估采用 5 折对话级交叉验证,折大小为 3、2、2、2、2 段对话,训练仅在训练折上搜索规则并在未见对话上测试,预测与标注在 0.5 秒容差内匹配计为真正例,该容差对所有基线一致。
指标方向为精确率、召回率与 F1,F1 为主要适应度与报告指标。基线包括全正、随机与分层随机,以及三档静音阈值(1.0、2.0、3.0 秒,基于 Silero VAD)。论文未报告跨折方差、置信区间或统计显著性检验,也未与随机森林、XGBoost 或 Transformer 等现代分类器对比,硬件与训练预算未说明。作者特别指出由于 hub 说话人设计,无法实现完全说话人隔离,报告分数应视为对未见说话人泛化的上界。
根据论文正文与图中报告值整理 数据集与实验协议:
| 项目 | 构成与设置 | 关键取值 | 作用与含义 |
|---|---|---|---|
| 语料总量 | 11 段无脚本双人对话,同步 VTT/WebM/MP4 | 253.6 分钟,5383 段,35728 词 | 提供自然重叠对话底座 |
| 语音/非语音 | 语音 222.1 分钟,非语音 31.5 分钟 | 非语音占比 12.4% | 决定负样本多落在连续语音内 |
| 重叠特性 | 标注转折含重叠比例,分轨可归因段数 | 81.4% 含重叠,9 段可归因 | 解释静音基线失效原因 |
| 说话人分布 | hub 说话人 user_01 与 user_03 | 合计 60.8% 词、60.1% 时长 | 导致无法完全说话人隔离 |
| 正负样本 | 4 条件过滤正例,分层随机负例,1 秒排除缓冲 | 1750 正,3500 负,1:2 | 固定类别比,未调优 |
| 特征窗口 | t 前 2.0 秒,仅当前说话人,28 维 | 视觉 9、声学 12、语言 7 | 支撑可解释规则输入 |
| 划分与评估 | 5 折对话级交叉验证,0.5 秒容差 | 折大小 3/2/2/2/2,种子 42 | 消除对话级泄漏,保留说话人泄漏 |
| 优化目标 | GA 搜索 AND-OR 规则,F1 为适应度 | 种群 500,最多 900 代,早停 100 代 | 得到低代价可检查规则 |
主结果支持什么,又不能推出什么?
要回答的核心问题是:在重叠主导的自然对话中,可解释的 AND-OR 规则是否优于静音假设与平凡基线。5 折对话级平均下,GA 规则取得 57.0% F1,相对全正基线的 50.0% 提升 7.0 个点,精确率从 33.3% 提升至 46.1% 且保持 74.6% 召回率。三档静音阈值 F1 仅 14.4% 至 25.8%,在该语料上明显失效,作者将其归因于非语音占比低且 81.4% 转折含重叠,导致静音信息本身就弱。
进化过程也显示搜索是有效的:F1 随代数从 39.1%(0 代)经 47.1%(100 代)、53.6%(300 代)、55.8%(500 代)、56.6%(700 代)递增至 57.0%(900 代),精确率与召回率同步提升但后期增益收窄。这说明规则在训练分区上确实在平衡精确与召回,而非单纯偏向一端。
但不能据此推出该规则已达到可部署的轮替预测水平,也不能推出多模态已充分互补。论文未提供与随机森林、XGBoost 或 Transformer 的对比,未报告跨折方差与显著性检验,7.0 个点的优势在仅 11 段对话的规模下证据边界有限,作者亦明确不主张统计显著性。最终展示的全量重训规则仅用 5 维且视觉仅 1 条件,未细分重叠与非重叠转折的性能,也未测量真实延迟与吞吐。
根据论文正文报告值整理 关键结果与含义:
| 比较或条件 | 指标 | 明确报告值 | 这项数字支持什么 |
|---|---|---|---|
| 全正基线 | 精确率/召回率/F1 | 33.3% / 100.0% / 50.0% | 1:2 类别比下的平凡上界,作主参照 |
| 静音阈值 1.0 秒 | 精确率/召回率/F1 | 10.5% / 40.3% / 16.7% | 静音在重叠主导语料上信息弱 |
| 静音阈值 2.0 秒 | 精确率/召回率/F1 | 20.4% / 35.0% / 25.8% | 同上,阈值调大仍远低于全正 |
| 静音阈值 3.0 秒 | 精确率/召回率/F1 | 22.2% / 10.7% / 14.4% | 召回急跌,说明长静音稀少 |
| GA 规则(本文) | 精确率/召回率/F1 | 46.1% / 74.6% / 57.0% | 可解释规则超过全正与静音基线 |
| 进化 0→900 代 | F1 | 39.1%→57.0% | GA 搜索在训练 F1 上持续有效,后期收窄 |

论文图 2。这张图来自原论文 Fig. 2:,图示内容为“Simplified chromosome representation containing two features for visualization purposes.”。请结合“主结果支持什么,又不能推出什么?”的正文,按图例、坐标轴或模块连线核对;图中没有呈现的内容不作外推。
边界在哪里?哪些结论需要打折扣?
作者坦诚的局限首先是数据规模与结构。11 段对话共 4.23 小时,且由 user_01 与 user_03 作为 hub 贯穿所有对话,导致说话人高度不均衡,无法实现完全说话人隔离的交叉验证,报告的 57.0% 应理解为对未见说话人泛化的上界,而非无偏估计。
其次是特征与建模选择。视觉特征仅使用当前说话人而未使用听者画面,尽管听者注视与点头是已知的转折线索;声学特征未做说话人归一化,可能放大个体差异;最终规则仅 5 维且视觉仅 1 条件,可能低估多模态互补性。基线强度也较弱,静音阈值在重叠主导语料上天然失效,不能证明方法在更均衡语料上的优势。
还有评测与复现层面的缺口。1:2 固定类别比与 0.5 秒匹配容差缺乏敏感性分析,未报告跨折方差、置信区间或显著性检验,未细分重叠与非重叠转折的性能;全量数据重训得到的展示规则未经过交叉验证,存在过拟合展示风险;论文未提供代码,方法细节与随机性影响难以核验。未来工作指向均衡非 hub 录制、说话人归一化、与强分类器对比以及集成至实时 LLM 智能体。
若要复现,需要哪些材料与代价?
数据侧,Real-TurnTurk 子集已在 Hugging Face 公开,链接为 tugrulbayrak/Real-TurnTurk,包含 11 段对话的同步 VTT 文本、WebM 音频与 MP4 视频,共 253.6 分钟、5383 个语音片段与 35728 词,完整数据集未完全公开。复现时需注意 9 段具备分轨音频可归因重叠,其余处理需自行对齐。
方法侧,论文在表格中给出了 28 个特征的完整定义与取值范围,以及 GA 的完整配置:种群 500、最多 900 代、锦标赛规模 5、交叉率 0.85、变异率 0.10 且 3 类变异均分、精英保留 5%、每条规则 3 到 7 个条件、适应度为训练集 F1、每折运行 5 次种子 1 到 5、100 代无提升早停,负样本分层采样种子 42、1.0 秒排除缓冲,评估为 5 折对话级交叉验证并给出全量重训的可解释规则。工具链涉及 MediaPipe Face Mesh、Py-Feat、openSMILE eGeMAPSv02、Silero VAD 与 wav2vec 2.0 强制对齐,论文未提供这些工具的具体链接。
代价与可复现性上,论文未说明训练硬件与特征缩放细节,未发布核心代码、模型权重或 Demo,推理虽为低代价的 if-then 评估但未报告真实延迟与吞吐测量。按现有描述可复用离线流水线进行复现,但随机性、实现细节与说话人不均衡带来的上界效应需要在复现报告中显式讨论。
如何带走这篇论文的判断?
回到开头的问题:当八成轮替都重叠时,等静音再判断自然会失灵。这篇论文的价值在于把这一残酷现实用可检查的语料与可审计的规则摆上台面:用分轨音频保留重叠归因,用 2 秒窗口的多模态特征捕捉韵律收尾与视听协同,用 AND-OR 规则把多条转折路径写成人类可读的逻辑。
对刚进入方向的研究生而言,可学到的不只是 57.0% 这个数字,而是研究设计的取舍:选择可解释性而非黑盒精度,选择对话级划分而非样本级划分以避免泄漏,并在论文中明确承认 hub 说话人导致的上界与未做显著性检验的边界。这种坦诚比分数本身更有助于判断工作在领域中的位置。
若要在此基础上继续推进,最直接的下一步是补齐缺失的对照:用同等特征与划分去跑随机森林、XGBoost 或 Transformer,报告跨折方差与重叠/非重叠细分,尝试加入听者视觉与说话人归一化,并在均衡录制的新数据上验证规则是否仍然稀疏有效。数据底座已经搭好,下一步是让评测更硬、让结论更稳。
📎 论文与评分元数据
标签:#多模态模型 #低资源 #数据集
5.1/10 | 创新 1.1/2 | 技术严谨 1/1.5 | 实验充分 0.6/1.5 | 清晰度 0.7/1 | 影响力 0.6/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
📝 5.1/10 | 后50% | 文档类型:数据集与基准 | 评分置信度:中 | #多模态模型 | #低资源 #数据集 | arxiv
⚖️ 评分依据与证据(展开查看)
逐维得分、全文证据与扣分边界
创新性 (1.1/2):首次系统化构建土耳其语自然对话多模态轮替语料,填补低资源空白,提出 28 维窗口上混合 AND-OR 可解释规则的 GA 搜索框架,支持多路径触发,但算法组合为已有技术重组。
技术严谨性 (1.0/1.5):标注四条件并发判定与 ±1.0 s 负样本排除缓冲及对话级 5 折划分实现泄漏控制,特征窗口与标注后段说话人解耦避免 is_filler 泄漏,作者自承 hub 说话人不均衡导致无法完全说话人隔离,无推导错误。
实验充分性 (0.6/1.5):仅对比全正基线 50.0% 与 3 档静音阈值 14.4% 至 25.8%,GA 规则 57.0% 提升 7.0 个点,未与随机森林 XGBoost Transformer 等代表性基线对比,未报告跨折方差与显著性检验,11 段 4.23 小时样本限制外推。
清晰度 (0.7/1):流程分离为标注 28 维特征与 GA 规则优化,Table III 给出特征单位与范围,Algorithm 1 与 Table IV 明确种群 500 与 900 代等配置,Table VI 统一 0.5 s 容差呈现精确率召回率,结构清晰。
影响力 (0.6/1.5):为土耳其语对话系统提供首个带重叠归因的多模态基准底座,但仅 11 段对话且 user_01 与 user_03 占 60.8% 词与 60.1% 时长,泛化上界受限,对语音领域外影响有限。
开源 (0.0/1.5):论文未发布核心代码、模型权重或数据资源,也未给出明确的后续开源承诺。
可复现性 (0.3/0.5):已披露 2.0 s 窗口 28 维定义与 GA 配置种群 500 锦标赛 5 交叉率 0.85 变异率 0.10 及 5 折对话级评估,给出负样本分层采样种子 42 与每折 5 次种子 1 至 5,但未说明训练硬件与特征缩放细节。
工程/实践价值 (0.8/1.5):给出基于 MediaPipe Face Mesh Py-Feat openSMILE eGeMAPSv02 Silero VAD 与 wav2vec 2.0 的可复用离线流水线与可检查 if-then 规则,子集数据已形成公开产物,但无真实延迟吞吐测量与流式部署验证。