声音去哪了:末层仍可线性读出却在选项字母上失准的读出瓶颈
论文把 ASR 监督前端是否丢弃声学信息当作可证伪假设,在同一 Qwen3.5-4B 流水线中对比 Whisper 与三类重建式编解码器,并用分层探针、几何比值与仅调 LM 头选项行的因果小手术证明声学结构在最终隐状态仍可恢复而 MCQA 失效主要来自读出对齐,但换前端本身不能解决情绪与环境声字幕的欠利用。
论文把 ASR 监督前端是否丢弃声学信息当作可证伪假设,在同一 Qwen3.5-4B 流水线中对比 Whisper 与三类重建式编解码器,并用分层探针、几何比值与仅调 LM 头选项行的因果小手术证明声学结构在最终隐状态仍可恢复而 MCQA 失效主要来自读出对齐,但换前端本身不能解决情绪与环境声字幕的欠利用。
针对单遍硬提交流式中文识别,X2Streaming-ASR 用监听与解码交替的等待或提交决策加三阶段训练,在五个测试集上报告平均字符提交延迟为 27 毫秒到 84 毫秒,并在 AISHELL-1 和 AISHELL-3 上取得参评流式系统中最优字符错误率,代价是部分测试集离线能力上限弱于基线。
共分析 44 篇语音/AI 论文
针对单模态易受噪声与信息缺失影响的问题,论文用 Wav2Vec2、MFCC 与统计声学特征经 BiLSTM 建模音频、用 ResNet50-BiLSTM 建模视频,并以多头交叉注意力做特征级融合,在 MELD 上微平均 93.7% 与 IEMOCAP 上 90.3% 准确率上验证效果,但未报告训练超参细节与统计显著性。
共分析 1 篇语音/AI 论文
该文把语音客服审计对象定为固定服务事实下的完整服务事件,用七道验证门和六类指标区分最终结果与过程负担,并以全合成退款实例说明方法,全程不报告真系统比较结果。
该研究把 Whisper 用于含英语、粤语、台山话与毛利语的口述史转写,以人工转写的 9 分 33 秒片段为参照比较不同尺寸与语言指定条件,最好的语言未指定 LARGE-V3 词错误率为 12.10,但代价是对非英语片段的转写与区分能力不足,而全库 12 小时 42 分钟机转仅用 5 小时,约为估计人工时间的 1%。
AVENUE 用 1291 个源片段和 7957 条指令把音频、视频与音视频耦合编辑分开考核,并用样本级四维评测揭示现有三类范式在保持未编辑模态上普遍失效,且反演式音频模型在保真与可编辑性间最均衡。
论文用 50 首带真分轨的歌曲检验 4 代分离模型,显示 onset 位置随 SDR 变好而变准,但攻击斜率与动态包络的失真与 SDR 几乎无关,且固定片段的渲染会随输入长度漂移。
BioSync 用多头自注意力建模模态间交互并并联线性拼接分支,在两个合成队列上以认知队列 AUC 0.928 和代谢队列准确率 0.764 为最强证据,代价是干净数据优势微弱且临床推断仍待真实队列验证。
针对尝试发声下无对齐声学目标且数据只有约 5 小时伪语音的问题,Brain2Speech-Net 用可微音素瓶颈加深度隐马尔可夫模型对齐到预训练语音合成隐空间做单遍合成,闭集语音词错率做到 0.068 并以约 0.5 实时因子运行,代价是开集词错率升至 0.472 且仍依赖合成伪语音目标。
针对全模态大模型中音频视觉联合预测不可靠融合的问题,论文提出免训练的冲突感知解码 CAD,用潜在冲突量与任务空间可干预性决定是否把联合分支权重转给单模态分支,在 Qwen2.5-Omni-7B 上把 CMM 整体准确率提到 85.0% 与 AVHBench 提到 84.1%,代价是每步要跑四个分支并依赖人工阈值。
论文针对修复任务中全局时间 t 无法刻画样本相关退化程度的问题,提出以冻结判别编码器表示替代时间条件来驱动流匹配速度场,在语音增强上报告了可复核的提升,并以额外编码器开销和自适应推理换取计算节省。
EffVOC 用因果卷积加 LSTM 的上采样声码器从幅度谱或 Mel 系数直接重建宽带与全频带波形,在 20 毫秒算法延迟下宽带 MOS 达到 4.17 与 4.15、全频带达到 4.14 与 4.11,代价是更高帧率带来的计算量与对短窗高重叠的依赖。
针对长时同步音视频生成中视频连贯、音频连贯与跨模态同步三重耦合难题,Encore 以重叠运动帧迭代与参考锚点分工配合可学习的自适应信号路由实现无限长度生成,并在扩展的 VerseBench 上以更低的时序漂移与更高的身份与同步指标验证效果,同时保留高分辨率与语音能力。
针对低码率下仅靠语音表示难以保留上下文与发音信息的问题,论文在 MDCTCodec 上增加语义与图像两个辅助分支并用交叉注意力融合,以直接拼接的融合模式和蒸馏后纯语音推理的蒸馏模式组织实验,在 TaL80 上把 ViSQOL 从 3.86 提升到 4.01,代价是融合模式推理需要额外的唇部图像与预训练语义输入。
GEPARD 为实时对话把文本与 32 通道 GroupFSQ 音频在同一标准全注意力 Transformer 中联合自回归生成并用 NanoCodec 流式解码,以 vLLM 原生可服务为首要约束,通过 prefill 前缀克隆、单步并行采样与 DPO 蒸馏 CFG 实现单流 RTF 约 0.067 与 256 并发约 204 倍加速,代价是帧级并行带来的 …
GhostWord 用约 400 毫秒触发音与目标词的码本做词级时间定位投毒,在 Common Voice 英、立陶宛语和多种骨干上报告约 89.3% 攻击成功率,而 ABL、ANP、SAU、I-BAU 等优化防御把成功率压到约 29.1% 时干净 WER 从约 21.5% 升到约 45.0%。
该工作把确定性增强输出当作有观测支撑但不完美的证据,用有限标量量化码空间的汉明距离在解码时约束自回归大语言模型,并按残余信噪比自适应接地强度再做局部重排,在低信噪比下保住内容忠实度的同时挽回感知质量,但强接地仍会带来感知代价且极端尾部错误不能完全消除。
针对单乐器身份未知的乐器无关转录,Harmonica 以 CQT 输入与多深度谐波卷积在多源温度采样训练下实现 26.3K 至 15.1M 的规模化,x-large 在多数测试集上取得最高帧 F1,medium 以 848.5 倍实时保持可比精度,nano 以 1622.5 倍实时仍显著超过同量级基线。