iwslt-2026 论文深度解读
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
该工作以中库尔德语到英语自发语音翻译为目标,对比用真实语音经语音识别加机器翻译做伪标签与用语音合成加机器翻译造数据两条路线,最强证据是伪标签训练的端到端模型在开发集 25.73、测试集 21.09 的 BLEU,代价是依赖已微调好的识别与翻译模型以及严格过滤,而纯合成数据在自发语音上明显偏弱。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
Pinch-AST 针对最长约 2.5 小时无切分音频同时翻译,用 Qwen3-ASR 加 Qwen3.5-4B 每语言对 LoRA 级联与字符级最长公共前缀只增发,在单张 H100 上报告 En→De、En→It、En→Zh 相对基线 XCOMET-XL 提升 4.1、5.7、2.6 分,代价是靠固定块重解码与前缀截断训练控制延迟。
针对现代语音整体质量高但损伤只出现在局部而难定位难分类的问题,该工作用部分混合生成帧级伪标签并加帧级监督对比损失训练双头帧级模型,在域内与域外混合数据上把嵌入检测做到交集面积 0.91 左右,代价是多重并发损伤下类型纯度下降且干净帧取舍需在检测稳定与聚类纯度间权衡。
论文把电话传输拆成降带宽与过编码分别测量,发现未见过的编码是退化主因,并用窄带重采样加随机量化加 RawBoost 加 G711 仿真在未见真实 VoIP/PSTN 上把 EERc 从 18.9% 降到 15.1%,代价是训练条件变多且干净宽带上的匹配性能不再是最优。
论文以白盒 Qwen2-Audio 为对象,用梯度优化构造定向唤醒与有害指令噪声和非定向降质噪声,并用平移、加噪与 SpecAugment 增强实现经 Chromebook 播放、iPhone 录音的空中攻击,最强证据是数字定向 12 组条件 100% 成功与真实录制定向 100% 成功,代价是对采样率扰动敏感且可被 EnCodec 压缩大幅抑制。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对半监督歌声旋律提取中频域增强敏感与一致性正则化丢弃约半数无标注数据的问题,论文提出分频带扩散增强、全局-类别置信筛选与通道交叉注意力三模块组合,在 ADC2004 等四套测试上相对 MCSSME 的 OA 提升 0.9% 至 7.7%,代价是引入扩散迭代与记忆库等额外结构与调参面。
针对统一输入空间大音频语言模型音频窗短的问题,论文提出只改音频区旋转位置编码的部分 YaRN 与训练时随机虚拟长度的位置增强虚拟长音频训练,在 1 至 10 分钟问答上用免训练与微调对照验证长音频泛化收益与调参代价。
针对语音到文本翻译在真实噪声下不稳定的问题,论文用可解释环境模拟器加功率谱模板原型约简与 27 组小规模超参数搜索组织鲁棒训练,在相同数据预算下使模拟噪声训练与真实噪声训练表现接近,代价是混响与精细调度需另行取舍且最优配置只在搜索范围内成立。
针对听诊数据稀缺且正常与异常声音频谱特性不同,PASA 把增强选择建模为马尔可夫决策过程并用混合批量-样本策略执行,在三个基准上提升诊断分数,但个性化依赖验证集奖励与样本统计积累,计算代价高于固定增强。
针对中英双语带标签转写任务,论文用词汇重映射让 Whisper-medium 统一生成词与 16 类非言语声标签,并用公开语料增强过滤加影视挖掘把最终分从 33.32 提到 53.61,代价是英文纯文本词错率上升且细粒度类别仍偏弱。
针对音频对抗样本跨模型迁移弱的问题,论文先用时间打乱与可解释性热图证明三类语音模型依赖局部时序与冗余特征,再提出可叠加的时间打乱梯度增强框架,在九个模型上取得更强的迁移效果,但粒度错配与权重过大会带来波动与额外开销。
论文把 Instruct-TTS 训练不稳归因于标签转指令中超过 40% 的语义漂移,用可控改写扩大覆盖、用大模型校验过滤保真、再用音高语速音量扰动补齐韵律监督,在中文评测上把平均指令遵循率做到 56.4%,代价是组合过滤只保留约 61.5% 候选。
GhostWord 用约 400 毫秒触发音与目标词的码本做词级时间定位投毒,在 Common Voice 英、立陶宛语和多种骨干上报告约 89.3% 攻击成功率,而 ABL、ANP、SAU、I-BAU 等优化防御把成功率压到约 29.1% 时干净 WER 从约 21.5% 升到约 45.0%。
生成模型 | 7.5/10
语音识别 | 6.2/10
语音识别 | 8.5/10
数据集 | 10/10