每日研究速递

iwslt-2026 论文深度解读

共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 80 分钟 · 39666 字 阅读 →
论文解读

不用人工标注的语音翻译数据从哪里来:伪标签真实语音与合成语音的对照

该工作以中库尔德语到英语自发语音翻译为目标,对比用真实语音经语音识别加机器翻译做伪标签与用语音合成加机器翻译造数据两条路线,最强证据是伪标签训练的端到端模型在开发集 25.73、测试集 21.09 的 BLEU,代价是依赖已微调好的识别与翻译模型以及严格过滤,而纯合成数据在自发语音上明显偏弱。

 · 更新于 2026-09-24 · 约 19 分钟 · 9066 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

长音频不等说完再译:Pinch-AST 用级联重翻译与噪声前缀训练换单卡实时

Pinch-AST 针对最长约 2.5 小时无切分音频同时翻译,用 Qwen3-ASR 加 Qwen3.5-4B 每语言对 LoRA 级联与字符级最长公共前缀只增发,在单张 H100 上报告 En→De、En→It、En→Zh 相对基线 XCOMET-XL 提升 4.1、5.7、2.6 分,代价是靠固定块重解码与前缀截断训练控制延迟。

 · 更新于 2026-09-24 · 约 15 分钟 · 7135 字 阅读 →
论文解读

整句高分掩盖局部损伤:用部分混合与帧对比学习做可定位的质量嵌入

针对现代语音整体质量高但损伤只出现在局部而难定位难分类的问题,该工作用部分混合生成帧级伪标签并加帧级监督对比损失训练双头帧级模型,在域内与域外混合数据上把嵌入检测做到交集面积 0.91 左右,代价是多重并发损伤下类型纯度下降且干净帧取舍需在检测稳定与聚类纯度间权衡。

 · 更新于 2026-09-24 · 约 19 分钟 · 9061 字 阅读 →
论文解读

电话线抹掉了谁的指纹:带宽与编码对音频深度伪造溯源的分解影响

论文把电话传输拆成降带宽与过编码分别测量,发现未见过的编码是退化主因,并用窄带重采样加随机量化加 RawBoost 加 G711 仿真在未见真实 VoIP/PSTN 上把 EERc 从 18.9% 降到 15.1%,代价是训练条件变多且干净宽带上的匹配性能不再是最优。

 · 更新于 2026-09-24 · 约 17 分钟 · 8261 字 阅读 →
论文解读

背景噪声也能操纵语音大模型:从数字优化到空中播放的定向与非定向攻击

论文以白盒 Qwen2-Audio 为对象,用梯度优化构造定向唤醒与有害指令噪声和非定向降质噪声,并用平移、加噪与 SpecAugment 增强实现经 Chromebook 播放、iPhone 录音的空中攻击,最强证据是数字定向 12 组条件 100% 成功与真实录制定向 100% 成功,代价是对采样率扰动敏感且可被 EnCodec 压缩大幅抑制。

 · 更新于 2026-09-24 · 约 21 分钟 · 10264 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →
论文解读

无标注数据用不满:用分频带扩散扰动与全局-类别置信留住更多样本

针对半监督歌声旋律提取中频域增强敏感与一致性正则化丢弃约半数无标注数据的问题,论文提出分频带扩散增强、全局-类别置信筛选与通道交叉注意力三模块组合,在 ADC2004 等四套测试上相对 MCSSME 的 OA 提升 0.9% 至 7.7%,代价是引入扩散迭代与记忆库等额外结构与调参面。

 · 更新于 2026-09-24 · 约 21 分钟 · 10192 字 阅读 →
论文解读

只拉伸音频位置、不动文本位置:部分 YaRN 与虚拟长音频训练的长音频泛化

针对统一输入空间大音频语言模型音频窗短的问题,论文提出只改音频区旋转位置编码的部分 YaRN 与训练时随机虚拟长度的位置增强虚拟长音频训练,在 1 至 10 分钟问答上用免训练与微调对照验证长音频泛化收益与调参代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9547 字 阅读 →
论文解读

不追求逼真、追求可控:用功率谱模板与小规模搜索做语音翻译鲁棒训练

针对语音到文本翻译在真实噪声下不稳定的问题,论文用可解释环境模拟器加功率谱模板原型约简与 27 组小规模超参数搜索组织鲁棒训练,在相同数据预算下使模拟噪声训练与真实噪声训练表现接近,代价是混响与精细调度需另行取舍且最优配置只在搜索范围内成立。

 · 更新于 2026-09-24 · 约 18 分钟 · 8894 字 阅读 →
论文解读

为每段呼吸声选增强:PASA 用两阶段混合策略平衡效率与个性化

针对听诊数据稀缺且正常与异常声音频谱特性不同,PASA 把增强选择建模为马尔可夫决策过程并用混合批量-样本策略执行,在三个基准上提升诊断分数,但个性化依赖验证集奖励与样本统计积累,计算代价高于固定增强。

 · 更新于 2026-09-24 · 约 25 分钟 · 12377 字 阅读 →
论文解读

词与笑声同序列解码:面向双语非言语声的源自适应数据整理

针对中英双语带标签转写任务,论文用词汇重映射让 Whisper-medium 统一生成词与 16 类非言语声标签,并用公开语料增强过滤加影视挖掘把最终分从 33.32 提到 53.61,代价是英文纯文本词错率上升且细粒度类别仍偏弱。

 · 更新于 2026-09-24 · 约 17 分钟 · 8423 字 阅读 →
论文解读

打乱顺序仍能听对:语音模型依赖局部特征与冗余线索

针对音频对抗样本跨模型迁移弱的问题,论文先用时间打乱与可解释性热图证明三类语音模型依赖局部时序与冗余特征,再提出可叠加的时间打乱梯度增强框架,在九个模型上取得更强的迁移效果,但粒度错配与权重过大会带来波动与额外开销。

 · 更新于 2026-09-24 · 约 16 分钟 · 7967 字 阅读 →
论文解读

指令 supervision 不稳:先把改写漂移管住,再把覆盖面铺开

论文把 Instruct-TTS 训练不稳归因于标签转指令中超过 40% 的语义漂移,用可控改写扩大覆盖、用大模型校验过滤保真、再用音高语速音量扰动补齐韵律监督,在中文评测上把平均指令遵循率做到 56.4%,代价是组合过滤只保留约 61.5% 候选。

 · 更新于 2026-09-24 · 约 17 分钟 · 8092 字 阅读 →
论文解读

GhostWord:把后门藏进单词时间轴里,防御为何越洗越伤干净转写

GhostWord 用约 400 毫秒触发音与目标词的码本做词级时间定位投毒,在 Common Voice 英、立陶宛语和多种骨干上报告约 89.3% 攻击成功率,而 ABL、ANP、SAU、I-BAU 等优化防御把成功率压到约 29.1% 时干净 WER 从约 21.5% 升到约 45.0%。

 · 更新于 2026-09-24 · 约 20 分钟 · 9612 字 阅读 →
论文解读

A First Exploration of Neuromorphic OT-CFM for Multi-Speaker VSR

生成模型 | 7.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8817 字 阅读 →
论文解读

Adapting Foundation ASR Models to Dysarthric Speech: A Case Study

语音识别 | 6.2/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5802 字 阅读 →
论文解读

Building an ASR Solution for Training and Assessing Children's Reading

语音识别 | 8.5/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5557 字 阅读 →
论文解读

Dilemmadata: On the Interoperability of Heterogeneous Roman Numeral Datasets

数据集 | 10/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4937 字 阅读 →