把专家混合塞进卷积-Transformer:MECT 如何在小参数下做说话人确认与流式推理
MECT 针对全监督说话人确认中卷积局部建模与 Transformer 全局建模难以兼顾的问题,把四种混合专家结构放进 Transformer 前馈位置,用帧级稠密 4 专家在 VoxCeleb 上取得 minDCF 0.012、0.026、0.048 的报告结果,代价是参数从 9.40M 增至 9.57M 并需因果重训才支持 100 ms 流式。
MECT 针对全监督说话人确认中卷积局部建模与 Transformer 全局建模难以兼顾的问题,把四种混合专家结构放进 Transformer 前馈位置,用帧级稠密 4 专家在 VoxCeleb 上取得 minDCF 0.012、0.026、0.048 的报告结果,代价是参数从 9.40M 增至 9.57M 并需因果重训才支持 100 ms 流式。
共分析 42 篇语音/AI 论文
该研究把双耳声波形直接映射为连续高采样率脑电,用约 250 小时异构数据训练一个因果编码器解码器,并在并行脑干响应、语音时间响应函数与双耳交互成分三类范式上复现了已知的形态与刺激依赖效应,但串行呈现幅值与部分响应幅度仍存在系统性偏差。
共分析 36 篇语音/AI 论文
论文复活 Etter 双向自回归插值,用前后向预测残差能量最小导出线性方程组求缺口样本,并给出短缺口高阶模型和因果丢包隐藏两种扩展,在 80 毫秒内音乐缺口上与多数基线相当但弱于逐缺口 Janssen 迭代法且外插简化版更快。
共分析 29 篇语音/AI 论文
该文针对 CHiME-9 Task2 多通道助听增强的延迟与跨通道建模矛盾,采用延迟感知外壳加单向时间 Mamba 核心的解耦结构,在助听器开发集上因果配置以 1.36M 参数和 0.005 实时率超越官方基线,离线加深配置进一步提升指标但延迟增至秒级。
共收录 14 篇 chime-2026 会议论文的 Reader 深度解读
DriftSE 把语音增强写成潜空间分布对齐问题,用冻结编码器的帧级漂移场在训练时牵引生成分布、推理时丢弃漂移只做一次前向,在四个数据集上以 1 次函数求值取得词错误率最优,但纯声学潜空间会出现幻觉而非配对训练会损失语义保真度。
共分析 27 篇语音/AI 论文
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对声学回声控制中深度模型计算量过大而直接缩小模型会明显掉性能的问题,论文用大教师指导小学生的知识蒸馏训练轻量 CGGN16,在双讲条件下保住近端语音并有效抑回声,代价是仍需先训练大教师且依赖仿真数据条件。
针对具身对话需要因果、低延迟且富有表现力的手势问题,MIBURI 直接复用 Moshi 语音文本模型的内部 token 流,用身体分区残差码本与时间加运动学双变换器逐帧生成手势,并以 36 ms 每帧的在线演示和多说话人评测支撑其因果实时主张,但仍未达到真值自然度且未建模用户身体。
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对对话中模态缺失切断细粒度跨模态因果链的问题,CaM-HG 采用先由历史条件混合专家补全再由非对称因果动态超图挖掘的路线,在 IEMOCAP 等 3 套基准上报告了高缺失率下更慢的衰减,但连续极端缺失与结构因果解耦仍是边界。
针对松标注训练导致边界过松、而因果-反因果伪标签又收得过紧并增加漏检的问题,论文用保边界去停顿填充、预热上下文和非因果感知协同训练来缓解,并在 AMI 与 AliMeeting 上把与理想紧标签上限的 DER 差距缩小约四到六成,代价是虚警与漏检之间仍需权衡。
UniStream 针对 48 kHz 因果流式语音、音乐与环境声共用一套残差码本容量不足的问题,用多专家残差向量量化扩大每层量化容量并靠已解码状态确定性复现路由,用训练期最优传输条件流匹配正则化量化隐空间,在 12 kbps Top-1 和 22.5 kbps Top-2 两档下以 ViSQOL、Mel 失真和消融证明多专家是主要增益来源,而流正则只带来语 …
共分析 38 篇语音/AI 论文
针对严格因果实时伴奏中自回归节奏漂移问题,Silent Metronome 用与生成音频无关的外部节拍相位加速度拍子条件做逐帧锚定并辅以未来词元预测塑形表示,在 Slakh2100 上把 Beat-F 从 0.133 提升到 0.432 并超过 1 秒前视的非因果参照,代价是参数量增加与分布保真度的轻微回落。