论文解读

固定音色查不出偏置:语音到语音模型跟内容误判说话人性别

该研究用男声女声交叉朗读男性刻板、中性、女性刻板长文本检验五款英西汉语音到语音模型,报告输出声音无可靠漂移但说出的性别判断全部跟随内容,错配时集中误判而固定音色审计看不见该偏差。

 · 更新于 2026-09-25 · 约 21 分钟 · 10471 字 阅读 →
论文解读

扩散克隆打的是多步去噪,VoiceCloak 就从身份与轨迹两端同时设障

针对扩散语音克隆的先验防御梯度消失与动态条件问题,VoiceCloak 用异性中心引导加注意力上下文发散做身份混淆、用分数幅值放大加噪声引导语义破坏做质量降级,在相同扰动预算下报告了更高的防御成功率,但保护音频本身仍需付出可感知性代价。

 · 更新于 2026-09-25 · 约 18 分钟 · 8686 字 阅读 →
论文解读

解耦分词与多词元预测为何能同时改善语音对齐与合成质量

该研究在统一的以大语言模型为中心的语音语言模型框架下比较耦合与解耦语音分词器并引入多词元预测与说话人感知建模,最强证据是 12 倍压缩下词错误率从 6.07 降到 3.01 且合成成功率保持 100%,代价是主观质量指标 UTMOS 随压缩略有下降且高压缩更依赖说话人嵌入。

 · 更新于 2026-09-25 · 约 22 分钟 · 10835 字 阅读 →
论文解读

在词元空间同时回答谁在说、说了什么、何时说:WhisperDiari 的联合建模

针对说话人日志与语音识别分开建模带来的切分错位和语义断裂,WhisperDiari 在 Whisper 上增加说话人适配器与说话人解码器做词元级说话人标注,LibriDiari 与 AMI 证据显示其词元级误差更低,但其帧级时间戳精度仍受解码器时间戳限制。

 · 更新于 2026-09-25 · 约 19 分钟 · 9303 字 阅读 →
论文解读

证据分散且多解:用分角色辩论与淘汰赛留下更站得住的关系判断

针对从双人对话推断熟人与陌生人及具体熟人关系的问题,论文提出免训练的多角色辩论与竞争裁决流程,在同一过滤测试集上比较零样本与辩论基线,结构化交互在文本与音文结合上取得宏 F1 领先,但纯音频提升不稳定且多次调用带来更高推理成本。

 · 更新于 2026-09-25 · 约 21 分钟 · 10210 字 阅读 →
论文解读

先出声再等文本:用原生语音令牌在波形之前跟踪读到哪

增量文本流式语音合成需要在线知道说到原文何处,X2-NativeCursor 用原生语音令牌加局部匹配做可修正估计再输出单调光标,在 80 毫秒前视下中文平均绝对误差 0.151 字,对比在线波形基线 320 毫秒前视下 1.253 字,代价是每个主干需单独训练观察器且对未见音色敏感。

 · 更新于 2026-09-25 · 约 19 分钟 · 9189 字 阅读 →
论文解读

同域满分、跨域随机:XMAD-Bench 逼出音频伪造检测的泛化缺口

论文以 7 语种 668.8 小时配对语料构造说话人、生成方法和真实源三重隔离的跨域评测,报告同域准确率常达 100% 而跨域大幅跌落甚至近随机,最强的 wav2vec 2.0 与 Whisper+MLP 也只在部分语言保持可用,代价是生成方法随语言不同且需持续更新。

 · 更新于 2026-09-25 · 约 18 分钟 · 8590 字 阅读 →
论文解读

再嵌入一次就换主人:神经音频水印为何挡不住覆盖攻击

论文把音频水印威胁从删除与伪造推进到再嵌入伪造消息并劫持归属的覆盖攻击,在 AudioSeal、Timbre、WavMark 上按白盒、灰盒、黑盒验证了接近 100% 的原水印失效率,代价是暴力堆叠会让信噪比明显下降而查询筛选能省下一半以上训练开销。

 · 更新于 2026-09-25 · 约 19 分钟 · 9480 字 阅读 →
论文解读

整段对话只换一句话:冻结检测器如何给出伪造时间戳

论文把多说话人对话中的手术式伪造注入形式化为时序定位问题,用冻结二分类器加滑窗与迟滞解码器实现零样本定位,在 180 段构造对话上以强骨干达到时序交并比 0.90 左右,但边界位移约 3.5 秒且短时域外生成器注入仍接近全漏检。

 · 更新于 2026-09-25 · 约 16 分钟 · 7725 字 阅读 →
论文解读

干净高分守不住转码:音频来源归属的编解码压力实测

该文在两个闭集溯源任务上冻结支撑区做前瞻性单阶段编解码压力测量,显示干净 Macro-F1 超 0.97 的表示仍可单点损失超 50 点且损失随条件与表示剧烈变化,而预注册的匹配保真度比较因无共同支撑不可估计。

 · 更新于 2026-09-25 · 约 20 分钟 · 9590 字 阅读 →
论文解读

并行解耦全局与局部:E-Branchformer 在音频伪造检测中的可复述设计

针对语音伪造检测中自监督表示难以同时捕捉长程与短程线索的问题,论文用并行全局注意力与局部卷积分支加解耦类令牌与 DWConv-SE 融合的 E-Branchformer,在 ASVspoof 2021 LA/DF 与 ITW 上取得 0.88%/1.85%/6.30% EER 并在 ASVspoof 5 上取得 5.44% EER,代价是四层编码器与细粒度融 …

 · 更新于 2026-09-25 · 约 16 分钟 · 7822 字 阅读 →
论文解读

不对称不确定性分解:用确定性锚点保口型、用随机残差补倾听

在仅双路音频输入的整段对话生成任务中,ECHO 以确定性锚点建立语音主导的稳定基线、再以残差流匹配与语义组缩放补充一对多的倾听变化,在约 120 小时对话基准上同时改善说话保真与倾听真实感与多样性,代价是时序稳定性与单样本实时因子未全面领先且依赖弱条件窗口的提纯。

 · 更新于 2026-09-25 · 约 22 分钟 · 10846 字 阅读 →
论文解读

在允许改写的前提下如何判定语义丢失:EviSI 的证据对齐与分层扣分

针对同传中为控延迟而产生的改写与概括,EviSI 用共享源证据与 Anchor/Event/Logic/Fluency 分工配合调和与确定性扣分来区分可接受变体与事实错误,在英中方向上恢复了人类系统总排序但在逐条输出上仍表现混杂。

 · 更新于 2026-09-25 · 约 20 分钟 · 9804 字 阅读 →
论文解读

分数之外保留证据:可审计决策记录如何改进语音伪造检测的复核

在 ASVspoof 5 Track 1 的 4,080 条匹配子集上,用被动分数、键控探针、检索与说话人轮廓四路证据组成可审计记录并做晚期校准,使检索增强的固定融合从 15.84% 降至 11.91% EER、校准后达 8.43% EER 并在 33.75% 复核预算下覆盖 82.85% 错误,但最强被动 WavLM 仍为 6.71% EER。

 · 更新于 2026-09-25 · 约 20 分钟 · 9747 字 阅读 →
论文解读

用可控的音素光栅把重叠说出来:KABURI-TTS 如何做双通道对话合成

针对双人对话中后通道、打断与重叠难以可控生成的问题,KABURI-TTS 以每说话人的音素光栅与由此导出的语音活动为条件在双通道上渲染对话语音,人在真实对话数据上的主观评测与语音活动统计显示其交互自然度与重叠频次优于强基线,但仍未达到真人对话上限且依赖外部光栅构造的质量。

 · 更新于 2026-09-25 · 约 25 分钟 · 12192 字 阅读 →
论文解读

口吃与成人插话并存时,音频语言模型为何流畅却不忠实

论文在 22 名口吃儿童的 44 段朗读与访谈音频上用儿童专属摘要与三类蕴含判断对比端到端音频语言模型与 Whisper 与 Granite 转录后接文本大模型的级联基线,发现端到端能生成流畅且纯净的摘要但忠实度偏低且蕴含判断普遍偏向肯定类,口吃密度升高与成人干扰会进一步拉低保真度与矛盾类准确率。

 · 更新于 2026-09-25 · 约 24 分钟 · 11807 字 阅读 →
论文解读

轻量时序建模如何兼顾精度与跨库泛化:SETEAB 的下采样、通道校准与双向加权融合

针对语音情感识别中时序依赖不稳定与计算冗余问题,SETEAB 在 TIM-Net 基础上引入深度可分离下采样、SE-Res2Block、TEAB 与全局加权双向融合,在 5 个库平均上以 0.06 - 0.12 GFLOPs 实现 47.69% UA 与 45.23% F1,并在跨库平均 WA 上达到 37.53% 且保持 0.4 - 0.5M 参数量级。

 · 更新于 2026-09-25 · 约 19 分钟 · 9189 字 阅读 →
论文解读

指令 supervision 不稳:先把改写漂移管住,再把覆盖面铺开

论文把 Instruct-TTS 训练不稳归因于标签转指令中超过 40% 的语义漂移,用可控改写扩大覆盖、用大模型校验过滤保真、再用音高语速音量扰动补齐韵律监督,在中文评测上把平均指令遵循率做到 56.4%,代价是组合过滤只保留约 61.5% 候选。

 · 更新于 2026-09-25 · 约 17 分钟 · 8092 字 阅读 →
论文解读

停顿不等于结束:泰米尔电话语音的语义轮次终点如何被验证与复现

针对泰米尔电话语音在每次停顿判断是否说完的问题,论文用 116 通双通道电话切出 18485 个边界并以音频大模型重标,再把 Smart Turn v3 微调为 8.7 MB 与 21 MB 两个纯音频模型,在 30 通未见来电的 4168 条上把准确率从 70.30% 提到 86.13%,代价是生产端 VAD 与流式切窗再扣约 2.60 点且部分边界根本不 …

 · 更新于 2026-09-25 · 约 18 分钟 · 8617 字 阅读 →
论文解读

先定语义再补声音:TontaubeV1 用分层编解码与有界上下文做流式语音合成

TontaubeV1 把 12.5 Hz 分层编解码的语义流交给大模型定韵律与时长、三个小模型逐层补声学细节,并用配对边界与有界窗口做长文本流式合成,代价是四阶段串行与非因果解码需二次转码,在 400 段英文有声书评测中韵律与 ElevenLabs Flash v2.5 持平并领先其余三家。

 · 更新于 2026-09-25 · 约 18 分钟 · 9018 字 阅读 →