英文题目:The Machines Are Calling: Measuring Automated and Synthetic Voices in Unwanted Inbound Calls

标签:#语音伪造检测 | #人类参与评测 | #音频指纹 | #统计分析 | #语音

评分:7.1/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.1/1.5

👥 作者与机构

  • Xingyu Shen:Scam AI (Reality Inc.)
  • Tommy Duong:Scam AI (Reality Inc.)
  • Muduo Xu:Scam AI (Reality Inc.)
  • Xiaodong An:Scam AI (Reality Inc.)
  • Jiaqi Gan:Scam AI (Reality Inc.)
  • Haoyuan Tang:Scam AI (Reality Inc.)
  • Jamey Z. Liang:Scam AI (Reality Inc.)
  • Siyu Zhang:Scam AI (Reality Inc.)
  • Yan Zhang:Scam AI (Reality Inc.)
  • Simiao Ren:Scam AI (Reality Inc.)

📌 核心摘要

本研究测量进入交互式语音蜜罐的不受欢迎来电中有多少以机器语音开口,并区分跨呼叫重播录音与当次新鲜合成,输入是主叫独立声道开口前十秒音频,输出是重播、合成、人类、沉默与不可评分类别,实际难点是窄带电话信道导致商用合成检测器域偏移且人耳听辨一致性很低。方法链分三步衔接:先用梅尔倒谱互相关音频指纹做全量两两比对并按相似度连通成重播组,输出重播与新鲜音频划分;再对新鲜音频用商用合成语音检测器打分筛查,输出疑似合成队列;最后将疑似队列送盲听者复核并估计检测器精确率,避免直接把检测分数当作流行率。相对被动蜜罐与混合录音报告的关键机制差异是独立声道保留沉默呼叫作为分母、指纹与检测器分离录音播放污染、以及盲听只报精确率不报流行率,其实质意义是给出可复核的机器语音构成下界。在按接收号码曝光年龄划分的语料条件下,曝光六周后号码的合成占比指标为60.7%,从首周的15.2%升至60.7%。结论适用边界限于已播种诱饵号码收到的线索生成流量开口窗口,跨运营商与全网外推尚未验证,且长曝光号码依赖单一线路存在老化混杂。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

要回答的两个数是什么,为什么必须分开数?

输入是打到普通消费者手里的非期望来电,目标是回答两个可核对的量:第一,有多少是机器发声而非真人接线;第二,在机器发声里,有多少是播放录音,有多少是现场合成。必须保留的信息是分母、阈值、聚合规则与应答方式,因为换一个分母或换一个阈值,数字会整体移动。本文的输出不是一句合成很多或很少,而是一套能复述的分解:先用与厂商无关的指纹数出跨通话重放,再用商用检测器给新鲜音频打分,最后用盲听估计检测器旗标的可信度。

初学者容易把录音播放与语音合成混成一件事。白话说,播放录音是指把同一段成品音频反复放出来,不管它当初是人录的还是合成器 1 次生成的;合成语音是指每一通电话由语音合成器现场念稿,波形每次都不一样。英文分别是 playback of a recording 与 synthetic speech。只看文本相似会把二者压扁,因为人声录音被群发与合成器反复念稿在文字上都表现为话术重复。只有比较波形本身,才能把同一文件放 2 次与同一声音念 2 次分开,这正是本文先做指纹普查再谈检测器分数的原因。

政策背景决定了为什么要较真。美国联邦通信委员会 2024 年 2 月的宣告性裁决把人工智能生成的声音纳入电话消费者保护法的 artificial 范畴,附带既有的同意、身份识别与退订义务,但当时没有同行评议的实测基线说明这类声音在骚扰来电里到底占多少。论文把 unwanted 定义为接听时刻接收方不想要的电话,不等同于违法;作者的诱饵身份会在引流表单上勾选同意框,因此同意链条只能观察一半。学习时要记住,0.44% 这类披露率是尚无强制披露义务下的基线,不是合规率。

已有蜜罐量了什么,本文补的是哪块空白?

同输入的路线是电话骚扰测量。Phoneypot 记录上百万通但不接听,只留主被叫号码与时间戳;Who is Calling 最多开 6 万多线路,用固定问候接听一部分并按音频指纹聚 campaign,但作者明确说聚的是音频而非运营者;SnorCall 对 20 多万转写做弱监督,刻画说了什么;多视角 robocall 研究比较了约 300 万通的音频与文本,并区分交互式与静态 campaign,指出交互式蜜罐能拿到更多可分析音频与回拨号码。这些工作刻画了量、伪造与 campaign 结构,但没有测量声音来源。

同目标但不同方向的路线是反诈诱饵与能力研究。Lenny 问的是人类骗子能否识破防守方的机器人,约 5% 被识破;后续有仿真与离线分析;能力侧证明大语言模型智能体能执行骗术脚本,受访者自述在最有效类别中顺从率可达 36%,但都是实验室测量。RoboKA 因为没有公开的真实标注语料,自己合成了约 1200 通 4 种合成系统的非期望来电,只把 1378 段真实录音留作域外评估。唯一的竞争流行率数字是 Hiya 在 10 万级号码上的非同行评议报告,称有足够语音的 8455 通中约 25% 含人工智能生成音频,但未披露阈值、分数分布、聚合规则与应答模型。

本文的对照点因此很具体:在相同窄带电话输入上,本文披露阈值 0.85、最大聚合、双轨隔离与应答模型,并把录音重放单独计数;Hiya 的约 25% 落在本文阈值与聚合扫出的 21.8% 到 39.6% 区间内,但因对方不披露管线,无法判断共享了多少。本文的贡献不是抢优先,而是可争辩:阈值、分布、聚合与接听方式都写出来,后人能按同一规则重算。

四个研究问题各自要什么证据?

第一个问题是机器发声占多少,其中录音与合成各占多少。证据必须是分母清晰的分解:以人设打了招呼的 7233 通为分母,先数沉默,再数指纹命中的重放,最后才按检测器标签拆新鲜音频,并报告指纹阈值 0.70 与 0.85 两档下的拆分移动。第二个问题是机器发声坐落在流量的哪里。证据是按垃圾营销、欺诈、未定与合法分类的合成占比,以及以转接给己方第二个人收尾的通话是否更像合成,同时要交代长度、号码类型与暴露年龄等混杂。

第三个问题是自动化主叫多久说 1 次自己是机器。证据要求区分真正的自我披露与电话营销同意模板中的未来自动拨打授权,二者关键词相近但法律与语义含义不同,还要单独处理人工智能记笔记这类工具声明。第 4 个问题是运营中真正持久的是什么。证据是按开场话术聚出的 campaign 跨度与单个号码寿命的对比,并用置换零模型校准号码供给本身的 1 次性程度,再看录音资产与说话人向量是否跨 campaign 复用。

贯穿 4 个问题的方法学问题是蜜罐播种史。诱饵号码何时被种入引流漏斗、循环了多久,会制造出看似生态趋势的曲线。若不控制该历史,任何按周上升的合成占比都可能是仪器变老,而非外部世界变化。

管线全景:从一通来电到一行标签经过哪几站?

跟着一通电话走完全程最清楚。来电进入作者拥有的美国真实号码,大语言模型人设先说你好并持续对话,主叫音频与人设音频分别写入两个声道。录音后先做能量起音检测,从主叫首次发声处切出 10 秒窗送商用检测器;并行地,从起音处切出 15 秒窗算梅尔倒谱特征做全两两比对找重放;再对双轨做语音活动检测得到通话形态。文本侧用人设实时语音识别的转写做分类与结尾标注,与音频检测器相互独立。

交互式语音蜜罐 × 双轨录音: 交互式语音蜜罐负责接起电话并用大语言模型人设先说你好、持续应答,分工是制造一段可分析的对话并留住主叫;双轨录音负责把主叫音频与蜜罐自己的人设语音写到两个独立声道,分工是保证检测器只打分主叫而不混入蜜罐的合成语音;二者搭配的原因是若混音则无法区分谁是机器,组合后新增的作用是得到可单独切窗、可单独送检的主叫开场。

整体有 3 个乐器加 1 个耳朵。指纹普查不依赖训练数据,负责录音行;商用检测器负责新鲜音频行,但阈值与聚合由作者选定;双轨语音活动负责沉默行与通话形态;11 名内部听众的盲听负责估计旗标精度。

顺序很关键:先判沉默,再判重放,最后才按检测器拆新鲜音频,使每通电话恰落一行,避免同一证据被重复计算。故障日的处理也写成规则:11 日中人设静默、过半主叫听到死寂,这些日子的无声通话丢弃,有跨通话复现的录音或脚本仍计为机器,其余记为未定。

切窗、打分与听审:三个动作如何各自防污染?

切窗动作防的是前导非语音。来电开场多为回铃、排队噪声与接起静音,固定取前 10 秒会量到噪声。做法是按每文件自身噪声底的十分位估计底噪,30 毫秒帧、10 毫秒跳,能量连续 250 毫秒高出底噪 10 分贝才算起音,并保留 200 毫秒预卷,再取固定 10 秒。选 10 秒的理由来自反欺骗文献:语音太短时误差陡增,且与 ASVspoof 5 的工作点对齐;起音对齐还堵住一个已知捷径,即前导静音时长本身在某些语料上能以约 85% 区分真伪,而电话开场恰好有长静音。

打分动作防的是人设污染与口径不明。每个片段送商用对话智能服务的语音钓鱼预设,原样使用不调参,返回每句的 deepfake 分数、说话人与转写;因主叫轨只有一个人,归属无歧义。作者取句级最大值作为整通分,理由是一句明显合成即足以说明主叫非实时真人,同时报告均值作敏感性分析。阈值取 0.85,明确不在分布谷底 0.45 到 0.50 处;若取谷底,阳性率将从 29.3% 升至 39.6%,因此 0.85 是可辩护范围内的保守端。

音频指纹重放普查 × 合成语音检测器: 音频指纹重放普查分工是判断同一段波形是否在 2 次通话中被播放,它不需要训练数据也不判断人声或合成声;合成语音检测器分工是对每次通话都新鲜的音频给出合成分数,它能进入指纹无法判断的单次音频;搭配的原因是前者免于厂商依赖但需要重现,后者覆盖广但误差未知,组合后新增的作用是把机器发声拆成录音播放与新鲜合成两行。

听审动作防的是自证。11 名听众在盲界面听与检测器同一来源的 10 秒窗,个人身份信息被静音约 8% 片段,编码为 64 kbps 单声道。界面只问人类或合成加不确定,不显示分数、分层、话术簇与他人判断,也不给训练与注意力检查。设计是分层的:被旗标的 1816 通做普查,另抽未被旗标样本估漏检,加已知来源金标准;但实际入库的旗标池是 0.50 以上更宽的池,且因脱敏、12 词门限与同脚本封顶,878 通有决定性判断的子集更长、分数更高,因此精度需自助法按片段平均,且向普查分数混合加权回校。

最大聚合 × 操作阈值: 最大聚合负责把一个 10 秒窗内多个语句级分数取最大值作为整通分,分工是执行只要一句很像合成即判整通的逻辑或规则;操作阈值负责把连续分数二值化为合成或人类,本文取 0.85,分工是固定报告口径;搭配的原因是不同聚合与阈值会移动同一分布的阳性率,组合后新增的作用是让 29.3% 这类数字必须连同阈值与聚合一起复述才有意义。

估计量的组织方式需要单独写清。设旗标普查为 Nf,已确认合成比例为 pf;未旗标总体为 Nu,抽样 nu,已确认比例为 pu,则语料流行率按加权平均计算。原文给出显式公式,符号含义与输入如下:分子是两层确认数的和,分母是全部通话,目标是把普查层与抽样层按各自规模合并,避免直接合并判断数而高估旗标层。

\[\hat{P}\,=\,\frac{N_{f}\hat{p}_{f}\,+\,N_{u}\hat{p}_{u}}{N_{f}+N_{u}}.\]

该公式的计算目标与实现要点是:在设计下 pf 视为普查值,抽样不确定性只在 pu,因此对未旗标样本做按主叫号码聚类的自助;不确定作两端界。但本版未旗标层只有 23 个标注,其中 5 个被听为合成,区间宽到只能给出 23% 到 46% 的括号,无法报告为估计;已旗标层的 54.4% 也只是协议估计而非真值,因为没有已知人类负类来量听众自身的假阳性。

本研究训练了什么,没有训练什么?

本研究没有训练合成语音检测器,也没有训练说话人编码器与大语言模型人设的声学部分。商用检测器是闭源成品,按出厂设置调用;说话人向量来自公开的广义端到端损失编码器,只做前向推理;转写一路由人设实时语音识别在通话中写日志,一路由检测器附带返回,但文本标签与音频分数保持仪器分离。把未训练等同于确定性是错的:同一波形 2 次送检仍可能跨阈值,说明线路、编解码与仪器噪声本身带来随机性。

实际计算发生在三处。第一处是指纹:每窗取 20 维梅尔倒谱并窗内归一,先用快速傅里叶互相关在至多 5 秒时滞内提名每通最匹配的十六窗,再用余弦相似在最优对齐处确认;无关语音约 0.1,同声音新鲜渲染约 0.2 到 0.5,同一文件播放 2 次约 0.85 到 0.98;0.70 记为同录音,0.85 记为同波形,连通分量即重放组。第二处是说话人阈值标定:用作者 10 个人设在数百通中念不同文本的渲染对作已知同声,用同波形对与随机对定上下界,在听审池上 95% 通过点为 0.826,更严为 0.93,全量上重标为 0.776 与 0.925。

第三处是通话形态:双轨能量语音活动给出时长、双方说话秒数与主叫语轮数,按沉默、单发、短交换与对话四形划分。分析代码与哈希后的号码随表发布,这是复现的抓手。

语料、划分与统计口径如何固定?

采集从 2026 年 5 月 28 日到 7 月 21 日共 55 天正语料,分析的录音从提前 10 天的测试期开始、延后 1 天结束,共 66 天 11087 通中的 10987 通主叫轨。十一日为人设静默故障日共 2711 通,按规则排除在分解之外;其余 55 天 8276 通中人设打了招呼的 7233 通是表 1 分母。双轮语料是其中至少含人设问候加一条可转写项的 6619 通,其中 6192 通有可打分主叫语音;427 通无可打分语句,5 通全无语音能量,110 通有起音但切不出片段,312 通送出但无返回。检测器标签率一般以 6192 为分母,含 318 通人设未打招呼但仍可打分的通话,纳入与否 headline 仍为 29.3%。

播种史是理解分母的关键。多数时间只有一个诱饵号码收话,2026 年 7 月 1 日新增 10 个号码使舰队从一到十一,第十二条低量线路仅 9 通不入暴露年龄分析。新号码以零暴露年龄进入,老号码自五月已循环;正是这种错峰播种让年龄与日期得以分离,但有效独立单元接近两个而非 6192,因此作者对回归系数不附 p 值,只报效应量与拟合优劣。

统计口径按号码聚类。通话聚在 3814 个主叫号码内,平均簇大小 1.62 但 Kish 有效簇大小 6.45,设计效应 4.9,因此区间用按号码重抽样的聚类自助百分位,而非把通话当独立的 Wilson 区间。全文约五十处比较未做 family-wise 校正,作者要求按探索性阅读;其中 robocall 开场富集在 Bonferroni 50 倍后边缘显著,时长与轮次分层比较则不再显著。缺失证据要明说:未旗标层标注不足、金标准无已知人类音频、部分分析未按 campaign 聚类,这些都是复现前必须补的验证。

机器发声占多少,录音与合成如何拆分?

先提出比较问题:在人设打了招呼的正常日通话里,若按沉默优先、重放其次、检测器最后的顺序单归因,机器发声行合计多少,沉默与未打分行又各占多少,指标方向是占比越高机器化越重,公平条件是同一 7,233 分母与同一指纹阈值。下表即该分解,区间为按主叫号码聚类的自助百分位,机器发声两行合计 26.9%,另有 9.9% 沉默与 9.0% 未打分。

Opening of the callCallsShare95% CI
Caller never spoke after our greeting (under 0.5 s of caller speech; median call 16 s)7179.9%9.0–10.9%
Recording also played on another call (audio fingerprint, §3.5)99513.8%11.3–16.7%
Fresh audio the detector labels synthetic (maximum per-utterance score at or above 0.85)94913.1%12.0–14.3%
Fresh audio the detector labels human (score below 0.85)3,92154.2%51.9–56.4%
Caller spoke but was never scored (outside the two-turn corpus, or no scorable utterance)6519.0%8.1–9.9%

表后解释要同时给收益与代价。收益是两行机器证据相互独立:重放行不依赖厂商,合成行覆盖新鲜音频;代价是拆分随指纹阈值移动,在 0.85 严格口径下重放从 995 通降至 666 通即 9.2%,合成行升至 1,207 通即 16.7%,机器合计从 26.9% 微移至 25.9%。未胜出项是 54.2% 判人类行,它背负未被测量的漏检率,只能读作检测器说人类而非真人类;沉默行中位 16 秒的判断依据是人设先说话且不重问、不主动挂断,真人想要这通电话应当会出声,但误拨后静听的人会被计为机器。

通话形态提供第二个对照。同一 7,233 通按双轨行为分为沉默、单发、短交换与对话共 4 种形状,问题是机器信号是否集中在短而浅的形状里,公平条件是同分母、形态定义只用时长与语轮数。下表显示 67.2% 进入长对话,单发中位仅 18 秒;重放与旗标集中在短交换而非单发,单发反而是发声形状中旗标最少的。

ShapeCallsShareMedian lengthAI-labeled
Silent: under 0.5 s of caller speech7179.9%16 s14.8%
One shot: at most two runs of caller speech, under 20 s, then hang-up99313.7%18 s22.0%
Short exchange: at most three runs, under 60 s6639.2%40 s35.2%
Conversation4,86067.2%206 s29.9%

表后必须说明代价:各形态可打分比例从 8.5% 到 94.1%,因此形态内的合成占比是在已打分子集上的条件率;两轮过滤掉的 1,845 通中 63% 沉默、22% 单发、中位 18 秒、仅 2.1% 为跨通话重放,说明过滤掉的是未接通的拨号器尾巴而非录音轰炸。这也解释了为何分解用 7,233 而非语料库:语料过滤移除的是沉默机器,不是说话机器。

看图路径: 1. 先看左图堆叠条中 26.9% 括号覆盖哪两段,再核对右侧四种通话形态的时长中位数;2. 比较沉默、单发、短交换和长对话四行中已打分通话的合成占比变化;3. 确认左图 9.9% 沉默段与右图沉默行是否指向同一批 717 通电话

原论文 Figure 1:What the 7,233 greeted calls opened with, and what shape they took.

论文图 1。原论文 Figure 1::“What the 7,233 greeted calls opened with, and what shape they took.”。

上图左面板把表 1 每一行画成一段堆叠条,括号标出音频证据下的机器发声 26.9%,右面板把表 2 中 4 种形态按通话数与中位时长画条形,并在行尾标注已打分中的合成占比。可见沉默与未打分两段不可忽视,而短交换的合成条件率高于单发。复述时要强调分母是打了招呼的通话,若换成全部录音或双轮语料,数字都会变。

合成集中在高量低害的哪里,播种史如何扭曲趋势?

先问机器发声坐落在哪里。按作者垃圾与欺诈分类器划分,问题是合成是否更多出现在欺诈,公平条件是同为 6192 中已分类的 5962 通、区间按号码聚类。下表显示直觉被反转:非欺诈商业营销的垃圾类 33.8% 最高,欺诈类 21.1% 明显更低,未定与合法类约 20%。

ClassSynthetic / totalShare95% CI
Spam1,291 / 3,81833.8%30.6–37.2%
Scam192 / 91021.1%17.5–25.1%
Unsure179 / 87620.4%17.2–23.9%
Legit74 / 35820.7%11.5–31.5%

表后解释收益与边界。收益是该反转在聚类区间下仍成立,且以索取凭证为窄口径的 698 通欺诈中仅 15.9%,支持量本经济解释:固定话术的线索生成适合把边际成本压到零,而套取凭证需要即兴。代价有三:未按时长调整,而时长与标签混杂;未按暴露年龄调整,而年龄效应更大;若检测器部分量的是非实时性,则预录轰炸本就集中在垃圾类。

未胜出项是合法行,其区间最宽,混有 disclosed 商务语音机器人与分类错误。另一个强分离是结尾:以转接给己方第二个人收尾的 366 通中 69.9% 被标合成,对其余 5826 通的 26.8%,优势比约 6.36,调时长轮次后约 7.29,但仅 1 通转接以 robocall 开场,说明不是简单的 IVR 前端转真人。

暴露年龄 × 日历时间: 暴露年龄指诱饵号码自首次收到来电起经过的天数,分工是刻画该号码在转售链条中循环了多久;日历时间指采集所处的自然周,分工是刻画外部生态是否随时间变化;搭配的原因是二者在单号码阶段完全混杂,只有 staggered 播种才能分离,组合后新增的作用是揭示按周上升的曲线可能是蜜罐自身变老而非全网变坏。

再问按周上升是生态还是仪器变老。问题是同一批 6192 通按日历周看似陡升,公平条件是把每通归属到接听它的诱饵号码并同时看暴露年龄。下图左按年龄从首周 15.2% 升至六周后 60.7%,20 天后只剩单号码;右图按日历周拆队列,五月老号码随年龄爬升,而七月 10 个新号码在同一周仍处低位。自然实验是 7 月 1 日到 20 日:10 个新号码 1759 通中 18.6%,老号码 1088 通中 59.4%。

若按各自首 20 天对齐,老号码 18.4% 对新号码 18.6%,仅差 0.2 个百分点。逻辑回归中年龄斜率每天 0.0505,日历每天负 0.0004,年龄单变量 AIC 6888 优于日期的 7372,双变量几乎无增益,但作者只作描述性拟合而不检验,因为有效单元接近二。机制推断为线索转售下沉到更大更自动化的运营,但未被直接观测,且与 484 本地区号邻里伪造的上升相关。

看图路径: 1. 在左图按暴露年龄看合成占比从首周到第六周的爬升,并注意 20 天后阴影只剩单号码;2. 在右图对比五月播种号码与七月十个新号码在同一日历周的位置高低;3. 核对灰色混合序列为何上升,而按队列拆开后新号码仍处低位

原论文 Figure 6:The apparent trend is our instrument aging, not the ecosystem changing.

论文图 6。原论文 Figure 6::“The apparent trend is our instrument aging, not the ecosystem changing.”。

上图 teaching 点是分母的时间属性:混合序列上升是因为老号码权重与年龄同时增长;一旦按队列拆开,趋势消失。复述 headline 29.3% 时必须加一句它平均了作者自己的播种计划,老号码循环一月后可达 59%,新号码同期仅 19%。

阈值与聚合的稳定性需要一张可运行的对照表。问题是同一 6192 通在不同阈值与最大或均值聚合下阳性率走多远,公平条件是同一分数、同一分母。下表把原文连续句中的 5 个数字摆成两行,方向是阈值越低、取最大时越高。

聚合规则阈值 0.50阈值 0.85阈值 0.90口径说明
取最大39.6%29.3%27.5%整通最大值,逻辑或
取均值32.8%21.8%未报告均值聚合敏感性分析

表后解释代价:估计在 21.8% 到 39.6% 之间摆动 1.8 倍,作者报告全距而非仅最大聚合的窄窗;0.85 落在上峰肩部而非谷底,故为保守端。未胜出项是谷底阈值 0.45 到 0.50,它会给出 39.6%,但作者不取。任何引用 29.3% 而不提 0.85 与最大聚合的复述都是不完整的。

看图路径: 1. 沿横轴 0 到 1 找到低分模式与高分模式的峰位,再看 0.45 到 0.50 附近的谷;2. 确认 0.85 虚线落在上行肩部而非谷底,理解保守口径的含义;3. 对比两端堆积与中部稀疏,记住双峰只说明分离得开不证明轴就是合成

原论文 Figure 2:Per-call detector scores are sharply bimodal (n=6,192; one maximum per-utterance score per call).

论文图 2。原论文 Figure 2::“Per-call detector scores are sharply bimodal (n=6,192; one maximum per-utterance score per call).”。

上图显示每通最大值分数的强双峰,1909 通低于 0.10,1703 通不低于 0.90,中部稀疏。教学上要纠正误解:双峰只说明检测器在某轴上分得开,不能证明该轴就是合成,编解码、带宽与中继类型同样能产生自信的双峰。

披露、行为与持久资产:机器在话术里留下什么?

披露问题要先立 construct。真披露指说明本次通话或系统是自动化的;营销同意模板中请求未来自动拨打许可的是合规动作,不是承认现在是谁在说话;人工智能记笔记指工具在场,不是说话者。若混为一谈,人类判分组中 42 处疑似有 37 处是同一自动拨打模板。

在 1816 通旗标中真披露仅 8 通即 0.44%,其中 306 通只说录音或监控,1502 通二者都不说;录音披露约 17% 说明主叫愿意念合规前言,缺的是关于说话者的一句。8 条原文见表 4,多数是平台前置横幅,仅最后一条我是机器人是被直接追问后承认。

行为侧先看可单通计算的信号。回答文不对题的规则是:人设以问句结尾,主叫回复无内容词、无是否与数字、仍长达八词以上即算答非所问。合成标通话 32.8% 的问题被晾置对人类标 22.7%,半数以上问题被忽略的通话占比 29.7% 对 14.9%;三拆为重放 39.0%、新鲜合成 28%、新鲜人类 22%,恰在录音处最宽。轮次间隙上重放中位 1.3 秒、新鲜合成 1.6 秒、新鲜人类 1.8 秒,过半轮次压着人设说话的比例分别为 29%、22% 与 16%。

通话内自重放分别为 24.8%、2.7% 与 1.1%。这些是手持端无需语料库即可算的候选特征,但作者明确尚未构成分类器。

持久资产看话术与声音。开场实质轮归一化后 token 集 Jaccard 0.50 单链接聚出 420 个 2 人以上 campaign,最大链化成分 656 通被排除;中位 campaign 跨 14.3 天而其内最长寿号码中位 0 天,极端为 68 通来自 68 号跨 31 天。但置换零模型显示随机 68 通即有 66.5 个不同号,全不同概率 23%,说明号码 1 次性是全库供给属性。campaign 真正增加的是另一端:24 个二十通以上 campaign 中十一接近每通换号、五守一两号长达 18 到 47 天,零模型从不产生单号模式。

脚本越复用越被标合成,从 1 次性 14.5% 到二十通以上 60.0%。音频资产上 239 个重放组含 1177 通,三分之二跨多号,34 组跨多 campaign,最大是 22 通 8 号 6 campaign 共用的录音合规通知;一个合成声可服务 9 个 campaign。

话术簇 × 主叫号码: 话术簇负责把开场措辞近乎相同的通话归为同一 campaign,分工是捕捉跨号码仍稳定的脚本资产;主叫号码负责标识每次拨打的显示号码,分工是传统封堵与声誉系统的作用单元;搭配的原因是二者寿命不同才能检验封堵打在哪里,组合后新增的作用是说明脚本持续数周而号码多在 1 天内丢弃,封堵号码多数时候追的是易耗品。

声音集中度印证分工:严格余弦 0.925 下新鲜人类 4180 通中 84% 声音只出现 1 次,前五十覆盖仅 5%,即数千真人;新鲜合成 999 通中 47% 1 次性,前五十覆盖 32%,重放前五十覆盖 73%。互信息上声音与 campaign 在新鲜合成中 0.52 高于新鲜人类 0.29,声音与号码在新鲜人类中 0.59 而合成仅 0.30。4 个预期落空也要复述:控制时长后转化差异不显著;凭证索取在欺诈层内消失。

robocall 开场与转接结尾几乎不交叠;五特征 k 为 2 聚类轮廓 0.326 对噪声 0.262,未能分出预录与对话 2 物种,而音频指纹能分。

检测器错在哪里,人耳又确认了多少?

先问检测器分数是否全无信息。问题是盲听确认率是否随分数单调上升,公平条件是同一 10 秒窗、按 0.1 分档、听众不知分数。下表把原文两句连续证据整理为 5 档,方向是分数越高确认越高,但低段几乎走平,上升主要由顶档带动。

分数段0.5 到 0.60.6 到 0.70.7 到 0.80.8 到 0.90.9 到 1.0
按片段平均确认率14.6%16.8%17.8%27.2%55.5%
片段数61757890841

表后解释收益与反例。收益是排序有效而校准很差:0.97 远比 0.6 更可能合成,但 0.97 不等于就是合成;8 名双侧各 15 个以上判断的听众,阈上确认都高于阈下 8 到 44 个百分点,排除构成假象。代价是阈上 882 片段的均值确认仅 54.4%,区间 51.5% 到 57.3%,按号码重抽为 48.4% 到 60.0%;剔除最不合群听众为 58.1%,限至少听 5 秒为 52.6%。

未胜出项是低分 4 档,它们之间只差 1 到 2 个百分点且每档仅 60 到 90 片段。把 54.4% 外推到 1816 通得占已打分 15.9%,按分数混合加权回校为 53.2% 即 15.6%,但仍是单侧验证。

再问无需听众的下限误差。问题是同一波形 2 次送检是否同侧,公平条件是 15 秒普查窗内对齐相似度不低于 0.85 且包含所打分的 10 秒。下图每个点是 1 对同波形通话的低分与高分,中位绝对差 0.008 但 90 分位 0.28,13.6% 的 2756 对被 0.85 阈值拆开;3 成员以上 69 组中 11.6% 同时跨过 0.50。横幅实例更直观:人工智能记笔记开场 15 通中 14 通 0.97 到 0.98 而 1 通 0.14。

自动调查问候同脚本可得 0.94、0.21 与 0.09。结论是线路、编解码与噪声 alone 就能把检测器带过决策边界,这是听审单片段看不到的下限。

看图路径: 1. 先找对角线与 0.85 横竖虚线划分的四个象限,区分同侧与跨侧点对;2. 数左下密集的双低点与右上密集的双高点,再看橙色跨阈值点的散布;3. 结合 2,756 对中 13.6% 被阈值拆开,理解线路与仪器自身带来的下限误差

原论文 Figure 4:The same waveform, scored twice.

论文图 4。原论文 Figure 4::“The same waveform, scored twice. Each point is a pair of calls whose opening waveforms match, plotted by the lower and the higher of the two detector scores; matched means the…”。

上图教学点是把误差归于仪器与线路而非声音:同一点在散点中偏离对角线越远,说明同声不同分;橙色跨阈值点即约七分之一的成对错误。复述时要说这是每通误差的下限,且整通标签应读作 1 次抽样而非判决。听众自身也不稳:两两 kappa 均值仅 0.267,单听众按 50 判断分块的合成占比可漂 10 到 20 点,后段因重送争议片段而更难,但首判断的混合方向仍说明标准在游走。

哪些边界会让数字移动,哪些不能说?

总体趋势不等于每组都成立,相关不是因果,缺失证据不是技术错误,这些都要逐项点名。第一,流行率是开场 10 分钟窗的属性而非整通属性,中位 138 秒通话中只打分约 7.3%,合成开场后转真人或真人后转机器都看不见;所有比较同规则施加故比较仍成立,但不能说成整通合成率。第二,重放普查只在同一录音至少来 2 次时命中,每号只拨 1 次的谨慎运营会躲进新鲜音频行,因此 13.8% 在 0.70 下是下限,0.85 下 9.2% 是经校准的更严下限;播放与合成的拆分是全文随更好仪器最可能移动的数。

第三,听审只有精度没有流行率。未旗标层仅 23 个决定性判断,其中 5 个听为合成,Wilson 区间 0.10 到 0.42 把流行率括号定在 23% 到 46%,含 29.3% 但太宽而不能报告;金标准无已知人类音频,答全合成的听众不会被抓住;界面无类别定义、无练习、无录音加真人规则的说明;10 秒窗中位仅 4.1 秒真语音,被判片段经 12 词门限后中位 5.8 秒仍有 18% 不足 4 秒。第二轮 20 秒去静音把争议从 0.56 推到 0.79 但对照也从 0.39 到 0.56,差值的差 0.06 区间含零,说明更多语音让 2 名听众整体向合成偏移而非解决分歧,且与检测器证据不再同窗故不并入精度。

第四,样本与推断单位。号码是主动种入特定垂直引流漏斗的单合成身份下游买家,非全生态;分类器二值粗判约 75% 与人一致,表 3 约 1/4 错标但未传入区间;检测器标的是通话而非号码,187 号跨标签;约 50 比较未校正,按 campaign 聚类未做,而 campaign 是更强的依赖。

停电日排除移除了更多老号码流量,但年龄效应算在已打分语料上故不受该排除驱动。回声检查显示主叫轨基本不带人设串音,超过零分布百分位的数量不超随机期望。训练资源与推理延迟未测量,不能承诺手持小模型或网络侧部署的成本与误报 trade-off 得到改善。

要复现这套测量,先做什么,后补什么?

值得尝试的时机是已有转写管线并能拿到双轨录音时。先做的是固定分母与规则:只在人设打招呼的正常日上报告分解,沉默先行、重放其次、检测器最后;起音检测按文件自适应底噪而非绝对电平,保留预卷;检测器取句最大并固定 0.85,同时扫 0.50 与 0.90 及均值聚合给出 21.8% 到 39.6% 的全距;指纹同时报 0.70 与 0.85 两档。统计一律按主叫号码聚类自助,报告 Kish 有效簇与设计效应,不把通话当独立。

再做的是分离播种史:至少保留两个播种批次并记录每号码首呼日期,把每通归属到接听号码,同时画按年龄与按日历的两条曲线;若只有单号码历史,不发布按周趋势。话术聚类前做小写、去数字、去人名归一化,警惕单链接链化,链化成分单独排除并声明;声音计数用严格余弦并报告随机对通过率,避免合并陌生人。披露计数必须手审区分自动拨打授权与本次自动化自白,并单独处理记笔记横幅。

还需补的验证按原文未来工作清单:把 651 通发声未打分与停电日未定通话同检测器打分并抽听单发;补完未旗标层抽样与已知人类金标准,加录音第三标签与练习;换第二家检测器看 29.3% 与 13.6% 翻转是否共现;做词对齐模板普查以抓改名拼接;录制降噪前原始线路以看机房噪声与合成伪影。

多窗打分看开场后是否换声,重跑去号码的结尾标注,并把推断聚类到 campaign。资源状态是正文开源声明的唯一依据:本次未发现来源绑定且完成验证的资源,不得声称代码模型数据已公开;能承诺的是按哈希发布号码的每通导出特征、标注界面与切窗参数,而非音频本身。

收束:能带走的三条结论与一句使用警告

第一条,机器发声至少 26.9%,其中重放与新鲜合成各约一成三,另有一成沉默极可能是拨号器无坐席可接;若计入沉默则 36.8%。重放半边不依赖厂商,拆分随指纹阈值在 13.8% 与 9.2% 之间移动;合成半边以 0.85 最大聚合得 6192 中 29.3%,全距 21.8% 到 39.6%,盲听确认 54.4% 且同波形约七分之一跨阈值,因此只能读作检测器条件下的开场率。第二条,自动化坐在高量低害处:垃圾营销 33.8% 高于欺诈 21.1%,转接结尾 69.9% 被标合成,行为上是压着人说话、重复自己、答非所问,而时长、凭证与转化差异多为构成或调后消失。

第三条,持久的是脚本与资产而非号码:中位 campaign 14.3 天而其内号码多为单日 1 次性,一个合规录音跨六 campaign,一个合成声服务 9 个;号码 1 次性是全库供给属性,campaign 额外增加的是少数长期守号模式。

使用警告是播种史:同一号码循环一月后 59%,新号码同期 19%,混合平均的 29.3% 只在作者播种计划下成立。复述任何一个百分比时,必须连同分母、阈值、聚合与播种队列一起说,否则就是把仪器读数当成了生态常数。

📎 论文与评分元数据

排名:前50% | 文档类型:应用研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-12 语音/音乐/音频论文速递