论文解读

压缩后才加税:Whisper 权重压缩如何重分人口组的时间负担

论文在 Whisper 家族内比较剪枝、量化与蒸馏的部署后公平性,发现 50% Wanda 剪枝使 large-v3 的 Black/AA 与 Asian 时间税差扩大 111%,INT4 在小模型上使西非口音灾难循环成倍增加,而蒸馏在 27 格中 21 格缩小差距。

 · 约 20 分钟 · 9749 字 阅读 →
论文解读

开放收集为何仍数不出酷儿声音:六个语音数据集审计与四组实践张力

论文审计六个英语语音技术数据集,发现可测量的酷儿占比仅 0–1.4% 而不足以做稳健差异度量,并以两个酷儿社群语音库为对照,提出规模化与包容、效率与参与、开放与自主、静态类别与流动身份四组张力,且代价是现有众包与开放流程难以覆盖小而易受污名群体。

 · 更新于 2026-09-25 · 约 19 分钟 · 9464 字 阅读 →
论文解读

谁来定义酷儿语音数据:从众包采集到共同设计的策展转向

本文以酷儿群体为案例指出众包难以建立长期信任与性别多样覆盖,进而提出社区、项目制定、参与方式与个人自主权四阶段双向框架,其代价是协调成本上升且本文未做新的模型训练与定量验证。

 · 更新于 2026-09-25 · 约 21 分钟 · 10463 字 阅读 →
论文解读

纠缠托底差距:用三轴合成网格审计并解耦音频表征的人口公平性

该文用 120 文本×24 声音画像×10 风格的合成正交网格审计 10 个开源音频编码器与 2 个闭源语音问答系统,以主夹角泄漏解释探针差距并用正交残差对比适配器降低泄漏与差距,代价是需要合成感知属性假设与额外适配训练。

 · 更新于 2026-09-25 · 约 17 分钟 · 8493 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 247 分钟 · 123292 字 阅读 →
论文解读

零样本能认情绪,却认得不公平:Qwen2-Audio 多类别公平性审计

论文在五个语音情绪数据集上零样本评测 Qwen2-Audio 并用多组多类公平指标审计,发现其总体预测分布较均衡但总体准确率平等性差距大,且解码温度超过 0.7 会同时损害准确率与公平性。

 · 更新于 2026-09-25 · 约 18 分钟 · 8849 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 433 分钟 · 216709 字 阅读 →
论文解读

音素嵌入为何不公平:偏置与方差两类几何误差的拆分检验

该文把群体差异拆成嵌入偏置与嵌入方差,用单群体训练的线性音素探针检验偏置、用同音素近邻距离检验方差,发现方差与识别错误稳定相关而同域训练收益有限,且领域增强对抗微调未改变两项几何指标。

 · 更新于 2026-09-25 · 约 20 分钟 · 9734 字 阅读 →
论文解读

看着脸听声音:多模态大模型为何在英语里幻听口音、在韩语里加分

论文用同一段母语录音配不同种族照片的匹配假象法,测 9 个语音视觉模型,发现高能力闭源模型在英语中把亚裔降为近母语、在韩语中给外群体加能力分,而小模型多为无差别的视觉干扰降分。

 · 更新于 2026-09-25 · 约 17 分钟 · 8234 字 阅读 →
论文解读

声音对不上长相时,多模态队友先信谁:配对偏置与场景刻板印象的分流

该研究用声音性别与头像外观正交变化的协作游戏二选一任务审计 10 个多模态大模型,发现闭源模型近乎强制声音外观一致、开源模型偏向高风险场景选男性且两种偏置可独立出现,而降低写实度只在部分强配对模型中减弱声音效应。

 · 更新于 2026-09-25 · 约 17 分钟 · 8353 字 阅读 →
论文解读

转写不等于回答:ACID 用语音输入揭开大音频模型的文化安全假象

该研究把文化敏感提问译成 10 种语言再合成 1315 小时语音来考 12 个大音频语言模型,报告 MERaLiON 相关性最高也未过 0.5,而 LTU 等模型的零有害只是因为答非所问。

 · 更新于 2026-09-25 · 约 18 分钟 · 8956 字 阅读 →
论文解读

语音把选择题变难了吗:语言、口音、性别与选项顺序如何动摇语音问答

该研究把文本选择题改写为可朗读的三语语音题,用同一批题目比较语言、口音、性别与选项顺序的稳定性,发现选项顺序与语言扰动最大而性别与口音较小,推理加深与先转写后作答能部分缓解不稳定,但语音总体放大了文本中已有的敏感性。

 · 更新于 2026-09-25 · 约 22 分钟 · 10946 字 阅读 →
论文解读

口音表征记住说话人:先测泄漏再做去说话人化

该研究陈述针对带口音语音识别中口音表征混入说话人身份的问题,提出用宽松划分对比与探针等方法度量纠缠,再以梯度反转去说话人化加有界条件适配在冻结 Whisper 上缓解,但全文是研究计划而非已验证结果,未报告词错误率数字与公平性收益。

 · 更新于 2026-09-25 · 约 19 分钟 · 9114 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 75 分钟 · 37568 字 阅读 →
论文解读

固定音色查不出偏置:语音到语音模型跟内容误判说话人性别

该研究用男声女声交叉朗读男性刻板、中性、女性刻板长文本检验五款英西汉语音到语音模型,报告输出声音无可靠漂移但说出的性别判断全部跟随内容,错配时集中误判而固定音色审计看不见该偏差。

 · 更新于 2026-09-25 · 约 21 分钟 · 10471 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-11

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 69 分钟 · 34318 字 阅读 →
论文解读

终点相同不等于负担相同:语音客服审计为何要先过验证门

该文把语音客服审计对象定为固定服务事实下的完整服务事件,用七道验证门和六类指标区分最终结果与过程负担,并以全合成退款实例说明方法,全程不报告真系统比较结果。

 · 更新于 2026-09-25 · 约 17 分钟 · 8354 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-08

共分析 38 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 72 分钟 · 35908 字 阅读 →
论文解读

Responsible Benchmarking of Fairness for Automatic Speech Recognition

语音识别 | 5.0/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7970 字 阅读 →