aaai-2026 论文深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
该文把 HuBERT 的 Transformer 层替换为 Mamba 做语音自监督预训练,在因果与长上下文语音识别上验证线性复杂度与更低计算量优势,并以音素纯度、典型相关分析和 SUPERB 探测说明表征特点,代价是 Base 尺寸双向 Mamba 整体探测分数落后于 Transformer。
针对聚类式说话人日志把多人同时说话和背景语音误并入单说话人簇的问题,论文用多说话人态与背景态增广 HMM 状态空间并引入外部说话人切换点约束,在 DoPaCo 无重叠上相对基线降低约 55% 说话人错误率,代价是默认非重叠输出在重叠区漏检较高,需外接重叠检测才可做重叠感知输出。
针对喙鲸回声定位点击序列中因转向或停叫造成的长检测空缺,论文用基于置信传播的多目标跟踪先产生碎片轨迹,再经平滑与拼接补全连续轨迹,在仿真与 5 段真实数据上以 GOSPA 总误差下降为证据,但拼接同时抬高了定位与虚假目标误差。
针对重复扩展使时长只改变出现位置而不改变表示取值的问题,该文把音素加时间通道作控制路径并用神经向量场求解受控微分方程产生连续隐状态,在情感语音上以单层每步一音素取得宏观 Spearman 排序相关 0.53 高于微调基线 0.08,但绝对校准与感知质量仍随情绪和分辨率变化。
针对音视频时间伪造定位中边界模糊、伪造稀疏和长距离衰减问题,DeformTrace 用可变形自扫描、中继令牌与可变形交叉扫描改造状态空间模型,在 LAV-DF 与 AV-Deepfake1M 上取得精度与效率优势,但依赖冻结特征与固定超参数组合。
该工作把受限对角复数状态空间等价为并联二阶全极点模态滤波器组,并在 DAFx 板式混响基准上用矩阵铅笔引导的特征值初始化拟合脉冲响应,报告显示合成误差与频率和衰减辨识优于常用初始化,但增益匹配仍存在离群与正则化代价。
论文把带噪标注起点建模为真实起点加偏移并用期望最大化估计数据集级均值来校正起始偏差,同时用对角状态空间模型 S4VAD 实现流式低延迟检测,在合成朗读混合与真实电影语音上报告了更低的起始偏差与延迟分布尾部,但结论依赖参考模型质量与有界独立噪声等假设且本次无可用代码资源。
该文把平板混响脉冲响应看作大量二阶全极点模态叠加,先估计总模态数,再用矩阵铅笔得到低频极点并外推高频极点,最后用对角复数状态空间模型的状态响应以最小二乘一次性求增益,在自生成 17 条脉冲响应上改善了频率与总数估计,但增益与衰减估计仍弱且本次未能确认挑战隐藏测试集表现。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对纯因果状态空间模型难以全局检索频域伪造痕迹的问题,论文提出 XLSR 前端加 Mamba 与注意力混合后端的模块化框架,最强证据是 MamBo-3-Hydra-N3 在三组跨域评测上取得有竞争力的等错误率,代价是堆叠深度与变体选择敏感且浅层检查点方差大。
在文本+ 语音输入上用固定编码-时序-融合流水线对比 Transformer 与 Mamba 时序主干,并用二维高斯软目标训练 9×9 Valence-Arousal 联合分布头,在说话人无关 LOSO 协议下主系统达 73.0%±0.3 UA 且分布质心可跟踪连续效价/唤醒,但延迟优势在该句长下未出现。
TurnFSM 把语义 VAD 与 utterance 级拒绝写成先提交后接受或拒绝的有限状态转移并用一阶依赖实现流式预测,在内部语义 VAD 上报告成功率 82.41% 与成功延迟 80.9 ms,在拒绝上报告 FAR 3.35% 与 FRR 16.04%,代价是仍需两阶段对齐与大模型推理开销。
语音合成 | 6.5/10
语音克隆 | 7.5/10
歌唱旋律提取 | 7.5/10
音频深度伪造检测 | 7.5/10
神经解码 | 7.0/10
语音增强 | 7.0/10