压缩后才加税:Whisper 权重压缩如何重分人口组的时间负担
论文在 Whisper 家族内比较剪枝、量化与蒸馏的部署后公平性,发现 50% Wanda 剪枝使 large-v3 的 Black/AA 与 Asian 时间税差扩大 111%,INT4 在小模型上使西非口音灾难循环成倍增加,而蒸馏在 27 格中 21 格缩小差距。
论文在 Whisper 家族内比较剪枝、量化与蒸馏的部署后公平性,发现 50% Wanda 剪枝使 large-v3 的 Black/AA 与 Asian 时间税差扩大 111%,INT4 在小模型上使西非口音灾难循环成倍增加,而蒸馏在 27 格中 21 格缩小差距。
论文审计六个英语语音技术数据集,发现可测量的酷儿占比仅 0–1.4% 而不足以做稳健差异度量,并以两个酷儿社群语音库为对照,提出规模化与包容、效率与参与、开放与自主、静态类别与流动身份四组张力,且代价是现有众包与开放流程难以覆盖小而易受污名群体。
本文以酷儿群体为案例指出众包难以建立长期信任与性别多样覆盖,进而提出社区、项目制定、参与方式与个人自主权四阶段双向框架,其代价是协调成本上升且本文未做新的模型训练与定量验证。
该文用 120 文本×24 声音画像×10 风格的合成正交网格审计 10 个开源音频编码器与 2 个闭源语音问答系统,以主夹角泄漏解释探针差距并用正交残差对比适配器降低泄漏与差距,代价是需要合成感知属性假设与额外适配训练。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
论文在五个语音情绪数据集上零样本评测 Qwen2-Audio 并用多组多类公平指标审计,发现其总体预测分布较均衡但总体准确率平等性差距大,且解码温度超过 0.7 会同时损害准确率与公平性。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该文把群体差异拆成嵌入偏置与嵌入方差,用单群体训练的线性音素探针检验偏置、用同音素近邻距离检验方差,发现方差与识别错误稳定相关而同域训练收益有限,且领域增强对抗微调未改变两项几何指标。
论文用同一段母语录音配不同种族照片的匹配假象法,测 9 个语音视觉模型,发现高能力闭源模型在英语中把亚裔降为近母语、在韩语中给外群体加能力分,而小模型多为无差别的视觉干扰降分。
该研究用声音性别与头像外观正交变化的协作游戏二选一任务审计 10 个多模态大模型,发现闭源模型近乎强制声音外观一致、开源模型偏向高风险场景选男性且两种偏置可独立出现,而降低写实度只在部分强配对模型中减弱声音效应。
该研究把文化敏感提问译成 10 种语言再合成 1315 小时语音来考 12 个大音频语言模型,报告 MERaLiON 相关性最高也未过 0.5,而 LTU 等模型的零有害只是因为答非所问。
该研究把文本选择题改写为可朗读的三语语音题,用同一批题目比较语言、口音、性别与选项顺序的稳定性,发现选项顺序与语言扰动最大而性别与口音较小,推理加深与先转写后作答能部分缓解不稳定,但语音总体放大了文本中已有的敏感性。
该研究陈述针对带口音语音识别中口音表征混入说话人身份的问题,提出用宽松划分对比与探针等方法度量纠缠,再以梯度反转去说话人化加有界条件适配在冻结 Whisper 上缓解,但全文是研究计划而非已验证结果,未报告词错误率数字与公平性收益。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
该研究用男声女声交叉朗读男性刻板、中性、女性刻板长文本检验五款英西汉语音到语音模型,报告输出声音无可靠漂移但说出的性别判断全部跟随内容,错配时集中误判而固定音色审计看不见该偏差。
共分析 38 篇语音/AI 论文
该文把语音客服审计对象定为固定服务事实下的完整服务事件,用七道验证门和六类指标区分最终结果与过程负担,并以全合成退款实例说明方法,全程不报告真系统比较结果。
共分析 38 篇语音/AI 论文
语音识别 | 5.0/10