论文解读

噪声越大越要看嘴型:AV-STE 在冻结对话模型前修复语义口令

针对全双工语音对话在背景噪声和重叠说话下语义口令损坏的问题,AV-STE 用流式视听编码器加噪声自适应融合在冻结 Moshi 之前恢复第一码本语义口令,同数据集多人干扰下 GPT-4o 连贯性平均从 1.42 提到 1.91,代价是干净语音存在口令失配且依赖可靠唇部视频。

 · 更新于 2026-09-25 · 约 22 分钟 · 10743 字 阅读 →
论文解读

把打断、等待与做任务放进同一个流:Gander 如何用块展平与小脑-大脑分工实现可打断的全双工 Omni 智能体

针对语音视觉文本连续输入下既要低延迟可打断对话又要长程工具执行的问题,Gander 用小脑负责流式交互与块级控制、大脑免训练负责长程推理并通过编排运行时协同,在 Full-Duplex-Bench 上以 100% 合时接管与 8.0 抢话率取得交互最优,同时在 SpokenQA 上保持 75.60 与 59.30 的流式问答能力,代价是 WorldSense …

 · 更新于 2026-09-25 · 约 29 分钟 · 14523 字 阅读 →
论文解读

跨航次重识别为何难:去重门控与原始波形选择性核的诚实评估

论文将水下舰船识别形式化为开放集跨航次重识别,用航次级音频裁决去重与源纯画廊堵住录音复用捷径,提出原始波形 4 尺度选择性核编码器 SKANN 并在 40 船 IARA 画廊上显示 rank-1 仅 0.25 且去重本身就抹掉 16 至 21 个点的虚高。

 · 更新于 2026-09-25 · 约 20 分钟 · 10002 字 阅读 →
论文解读

把波形峰值关进语义空间:MAPS 如何在非线性功放下同时做对齐与 PAPR 抑制

针对多用户 OFDM 下多模态 Token 经 Modified Rapp 功放非线性失真导致任务精度与能效下降的问题,MAPS 用两阶段训练在嵌入空间联合优化跨模态对齐与均衡 PAPR 抑制,在 IBO=3 dB 时相对同条件基线获得约 64.5% AVQA 精度提升与约 64.4% 任务导向能效提升,代价是引入方差均衡与锚定重构等额外约束以稳定训练。

 · 更新于 2026-09-25 · 约 22 分钟 · 10894 字 阅读 →
论文解读

从逐字转写到可直接归档:Qwen-Audio-3.0-ASR 如何把指令、上下文与热词塞进同一遍解码

针对方言、动态实体、口语不流利和长上下文的生产转写问题,该报告用混合专家大语言模型解码器统一控制语言、热词、历史与润色,并在中英文与多语基准及工业集上给出可核对的误差率与延迟对照,其代价是依赖大规模数据管线与指令组合训练。

 · 更新于 2026-09-25 · 约 26 分钟 · 12726 字 阅读 →
论文解读

不对称残差融合能否替代双向跨模态 Transformer:RAFM-SER++ 的轻量化权衡

RAFM-SER++ 以文本为查询、语音为键值的单向残差注意力替代双向跨模态 Transformer,结合 BYOL 式对齐与注意力池化,在 IEMOCAP 上达到 81.10% BACC、ESD 上 95.39% BACC,同时将可训练参数从 8.9M 降至 3.6M 并提升推理吞吐。

 · 更新于 2026-09-25 · 约 20 分钟 · 9994 字 阅读 →
论文解读

口吃与成人插话并存时,音频语言模型为何流畅却不忠实

论文在 22 名口吃儿童的 44 段朗读与访谈音频上用儿童专属摘要与三类蕴含判断对比端到端音频语言模型与 Whisper 与 Granite 转录后接文本大模型的级联基线,发现端到端能生成流畅且纯净的摘要但忠实度偏低且蕴含判断普遍偏向肯定类,口吃密度升高与成人干扰会进一步拉低保真度与矛盾类准确率。

 · 更新于 2026-09-25 · 约 24 分钟 · 11807 字 阅读 →
论文解读

当打击乐手拿起鼓刷:用持续手势对抗鼓机映射的技术俘获

本研究通过与职业鼓手四个月的协同设计,将仅支持离散打击检测的映射扩展为连续手势 RNN 与离散分类协同的 Max4Live 工具包,并以十首曲目录制检验其在真实创作中能否抵御技术俘获,代价是连续特征时域精度与循环稳定性仍有限。

 · 更新于 2026-09-25 · 约 22 分钟 · 10805 字 阅读 →
论文解读

冻结表征上分离对比损失与正确配对的语义精炼

在 BEST-RQ、mel 与 chroma 重建和 CTC 构成的声学词汇基座上叠加音频描述对比对齐,并以配对内打乱对照与双读出冻结评测分离对应关系贡献,正确配对在三粒种子上使域均衡分类线性探针提升 4.66 点、序列感知 LLM 提升 2.59 点且每域均为正,其中线性增益的 87% 来自正确对应而非额外对比目标。

 · 更新于 2026-09-25 · 约 23 分钟 · 11277 字 阅读 →
论文解读

轻量时序建模如何兼顾精度与跨库泛化:SETEAB 的下采样、通道校准与双向加权融合

针对语音情感识别中时序依赖不稳定与计算冗余问题,SETEAB 在 TIM-Net 基础上引入深度可分离下采样、SE-Res2Block、TEAB 与全局加权双向融合,在 5 个库平均上以 0.06 - 0.12 GFLOPs 实现 47.69% UA 与 45.23% F1,并在跨库平均 WA 上达到 37.53% 且保持 0.4 - 0.5M 参数量级。

 · 更新于 2026-09-25 · 约 19 分钟 · 9189 字 阅读 →
论文解读

耳朵有了,还要给手表:用外部节拍网格锚定实时伴奏

针对严格因果实时伴奏中自回归节奏漂移问题,Silent Metronome 用与生成音频无关的外部节拍相位加速度拍子条件做逐帧锚定并辅以未来词元预测塑形表示,在 Slakh2100 上把 Beat-F 从 0.133 提升到 0.432 并超过 1 秒前视的非因果参照,代价是参数量增加与分布保真度的轻微回落。

 · 更新于 2026-09-25 · 约 17 分钟 · 8370 字 阅读 →
论文解读

在单通道约束下用稀疏相对脉冲响应重建空间:HOA 参数化编码的显式房间建模

针对三阶 HOA 在约 27 kbps 单传输通道下混响建模不足的问题,论文以波束成形参考盲估计相对空间房间脉冲响应并拆为稀疏波包与残差包络进行参数化,在未见 SRIR 上取得与 32 kbps IVAS 相当且验证集上略优的 QASTANet 分数,同时把空间参数压到约 2 kbps。

 · 更新于 2026-09-25 · 约 24 分钟 · 12011 字 阅读 →
论文解读

指令 supervision 不稳:先把改写漂移管住,再把覆盖面铺开

论文把 Instruct-TTS 训练不稳归因于标签转指令中超过 40% 的语义漂移,用可控改写扩大覆盖、用大模型校验过滤保真、再用音高语速音量扰动补齐韵律监督,在中文评测上把平均指令遵循率做到 56.4%,代价是组合过滤只保留约 61.5% 候选。

 · 更新于 2026-09-25 · 约 17 分钟 · 8092 字 阅读 →
论文解读

音频幻觉为何总说“有”:用静默对照与首步门控校正肯定偏差的 TAD

针对二元音频问答中模型因语言先验而虚报存在的幻觉,TAD 以静默音频为对照做对比解码并仅在首步用音频增益门控惩罚肯定词,在 AudioCaps-Hallucination 与 Clotho-AQA 上提升拒绝能力但在部分设置下以精度与准确率下降为代价。

 · 更新于 2026-09-25 · 约 20 分钟 · 9866 字 阅读 →
论文解读

停顿不等于结束:泰米尔电话语音的语义轮次终点如何被验证与复现

针对泰米尔电话语音在每次停顿判断是否说完的问题,论文用 116 通双通道电话切出 18485 个边界并以音频大模型重标,再把 Smart Turn v3 微调为 8.7 MB 与 21 MB 两个纯音频模型,在 30 通未见来电的 4168 条上把准确率从 70.30% 提到 86.13%,代价是生产端 VAD 与流式切窗再扣约 2.60 点且部分边界根本不 …

 · 更新于 2026-09-25 · 约 18 分钟 · 8617 字 阅读 →
论文解读

序列不等长就保不住语义:TASTE2 用一词一隐变量走向可打断对话

TASTE2 把每个文本词元配一个连续音频隐变量使序列长度严格等于文本,用 56.3% 对 57.3% 保留 98.2% 文本问答能力并以 0.060 秒停下响应用户打断,代价是流畅接话需 1.207 秒、部署首音频 2701 毫秒且显式副语言控制不稳定。

 · 更新于 2026-09-25 · 约 19 分钟 · 9448 字 阅读 →
论文解读

先定语义再补声音:TontaubeV1 用分层编解码与有界上下文做流式语音合成

TontaubeV1 把 12.5 Hz 分层编解码的语义流交给大模型定韵律与时长、三个小模型逐层补声学细节,并用配对边界与有界窗口做长文本流式合成,代价是四阶段串行与非因果解码需二次转码,在 400 段英文有声书评测中韵律与 ElevenLabs Flash v2.5 持平并领先其余三家。

 · 更新于 2026-09-25 · 约 18 分钟 · 9018 字 阅读 →
论文解读

Tri-PvP:用感知与命题的正交冲突把模态偏置从证据形式偏置中剥离

为解决全模态大模型在图文声三路互斥时把模态偏置与证据形式偏置混为一谈的问题,Tri-PvP 以 8000 样本的四条件匹配反事实与五模型对照揭示视觉主导且视听在感知与命题上不对称,并以早期线性可分与对比解码仅部分缓解且引入文本残余为代价验证偏置的表征根源。

 · 更新于 2026-09-25 · 约 25 分钟 · 12503 字 阅读 →
论文解读

打断时模型以为说了什么与用户实际听到什么不一致:用已播放语音回灌来锚定进度

论文把全双工中的打断恢复问题定义为锚定中断,提出把已播放的模型语音回灌到语音输入通路的三通道自监听架构,并在同源构造的 AnchorSpeech 上用播放边界判定正确性,报告三通道模型达到 73.0% 锚定准确率且停止与响应延迟基本不变,同时在通用全双工指标上出现轮次管理与锚定的权衡。

 · 更新于 2026-09-25 · 约 24 分钟 · 11696 字 阅读 →
论文解读

从隐式注意力到可编辑的时滞轨迹:音视同步如何为发音评估提供可解释时序依据

针对仅靠音频评估无法诊断唇动与语音时序错位的问题,论文用跨模态注意力显式建模帧级对齐并导出时滞轨迹与稳定性指标,在 8 类录制条件下以线性复杂度和可视化分析实现可解释的同步性诊断。

 · 更新于 2026-09-25 · 约 23 分钟 · 11297 字 阅读 →