每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

把 Transformer 换成 Mamba 做语音自监督:长语音更快,但双向扩展仍有代价

该文把 HuBERT 的 Transformer 层替换为 Mamba 做语音自监督预训练,在因果与长上下文语音识别上验证线性复杂度与更低计算量优势,并以音素纯度、典型相关分析和 SUPERB 探测说明表征特点,代价是 Base 尺寸双向 Mamba 整体探测分数落后于 Transformer。

 · 更新于 2026-09-24 · 约 20 分钟 · 9889 字 阅读 →
论文解读

把混杂语音赶出说话人簇:增广状态空间如何净化 HMM 聚类

针对聚类式说话人日志把多人同时说话和背景语音误并入单说话人簇的问题,论文用多说话人态与背景态增广 HMM 状态空间并引入外部说话人切换点约束,在 DoPaCo 无重叠上相对基线降低约 55% 说话人错误率,代价是默认非重叠输出在重叠区漏检较高,需外接重叠检测才可做重叠感知输出。

 · 更新于 2026-09-24 · 约 19 分钟 · 9056 字 阅读 →
论文解读

回声定位时断时续时,如何把碎裂的鲸轨迹重新连成一条

针对喙鲸回声定位点击序列中因转向或停叫造成的长检测空缺,论文用基于置信传播的多目标跟踪先产生碎片轨迹,再经平滑与拼接补全连续轨迹,在仿真与 5 段真实数据上以 GOSPA 总误差下降为证据,但拼接同时抬高了定位与虚假目标误差。

 · 更新于 2026-09-24 · 约 21 分钟 · 10264 字 阅读 →
论文解读

时长不只决定贴多少次:用受控微分方程让音素表示随时间演化

针对重复扩展使时长只改变出现位置而不改变表示取值的问题,该文把音素加时间通道作控制路径并用神经向量场求解受控微分方程产生连续隐状态,在情感语音上以单层每步一音素取得宏观 Spearman 排序相关 0.53 高于微调基线 0.08,但绝对校准与感知质量仍随情绪和分辨率变化。

 · 更新于 2026-09-24 · 约 16 分钟 · 7997 字 阅读 →
论文解读

可变形状态空间如何盯住稀疏而模糊的伪造边界

针对音视频时间伪造定位中边界模糊、伪造稀疏和长距离衰减问题,DeformTrace 用可变形自扫描、中继令牌与可变形交叉扫描改造状态空间模型,在 LAV-DF 与 AV-Deepfake1M 上取得精度与效率优势,但依赖冻结特征与固定超参数组合。

 · 更新于 2026-09-24 · 约 17 分钟 · 8507 字 阅读 →
论文解读

把板式混响学成可读模态:对角复数状态空间与矩阵铅笔初始化

该工作把受限对角复数状态空间等价为并联二阶全极点模态滤波器组,并在 DAFx 板式混响基准上用矩阵铅笔引导的特征值初始化拟合脉冲响应,报告显示合成误差与频率和衰减辨识优于常用初始化,但增益匹配仍存在离群与正则化代价。

 · 更新于 2026-09-24 · 约 20 分钟 · 9763 字 阅读 →
论文解读

标注起点系统性偏早时,如何量出语音检测的真实反应速度

论文把带噪标注起点建模为真实起点加偏移并用期望最大化估计数据集级均值来校正起始偏差,同时用对角状态空间模型 S4VAD 实现流式低延迟检测,在合成朗读混合与真实电影语音上报告了更低的起始偏差与延迟分布尾部,但结论依赖参考模型质量与有界独立噪声等假设且本次无可用代码资源。

 · 更新于 2026-09-24 · 约 19 分钟 · 9291 字 阅读 →
论文解读

不做梯度迭代:用矩阵铅笔定极点、最小二乘定增益恢复平板混响模态

该文把平板混响脉冲响应看作大量二阶全极点模态叠加,先估计总模态数,再用矩阵铅笔得到低频极点并外推高频极点,最后用对角复数状态空间模型的状态响应以最小二乘一次性求增益,在自生成 17 条脉冲响应上改善了频率与总数估计,但增益与衰减估计仍弱且本次未能确认挑战隐藏测试集表现。

 · 更新于 2026-09-24 · 约 22 分钟 · 10875 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

以混合检索补压缩短板:XLSR-MamBo 如何用 Mamba 与注意力检出伪造语音

针对纯因果状态空间模型难以全局检索频域伪造痕迹的问题,论文提出 XLSR 前端加 Mamba 与注意力混合后端的模块化框架,最强证据是 MamBo-3-Hydra-N3 在三组跨域评测上取得有竞争力的等错误率,代价是堆叠深度与变体选择敏感且浅层检查点方差大。

 · 更新于 2026-09-24 · 约 17 分钟 · 8208 字 阅读 →
论文解读

把情绪当分布输出:在严格说话人无关评估下用 9×9 V-A 网格做可复述的多模态情绪识别

在文本+ 语音输入上用固定编码-时序-融合流水线对比 Transformer 与 Mamba 时序主干,并用二维高斯软目标训练 9×9 Valence-Arousal 联合分布头,在说话人无关 LOSO 协议下主系统达 73.0%±0.3 UA 且分布质心可跟踪连续效价/唤醒,但延迟优势在该句长下未出现。

 · 更新于 2026-09-24 · 约 21 分钟 · 10137 字 阅读 →
论文解读

把级联状态机装进大模型:TurnFSM 如何串行做提交与拒绝

TurnFSM 把语义 VAD 与 utterance 级拒绝写成先提交后接受或拒绝的有限状态转移并用一阶依赖实现流式预测,在内部语义 VAD 上报告成功率 82.41% 与成功延迟 80.9 ms,在拒绝上报告 FAR 3.35% 与 FRR 16.04%,代价是仍需两阶段对齐与大模型推理开销。

 · 更新于 2026-09-24 · 约 19 分钟 · 9518 字 阅读 →
论文解读

MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control

语音合成 | 6.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4034 字 阅读 →
论文解读

MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control

语音克隆 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4919 字 阅读 →
论文解读

A Hybrid Convolution-Mamba Network with Tone-Octave Contrastive Learning for Stratified Semi-Supervised Singing Melody Extraction

歌唱旋律提取 | 7.5/10

 · 更新于 2026-09-24 · 约 13 分钟 · 6269 字 阅读 →
论文解读

Combining SSL Speech Features, Contextual Transformers and Mamba Models for Realistic Audio Spoofing Detection

音频深度伪造检测 | 7.5/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4304 字 阅读 →
论文解读

Condition-Invariant fMRI decoding of speech intelligibility with deep state space model

神经解码 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4075 字 阅读 →
论文解读

DECAF: Dynamic Envelope Context-Aware Fusion for Speech-Envelope Reconstruction from EEG

语音增强 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4453 字 阅读 →