论文解读

只改一小段也要逐帧定界:用边界差分与段内一致性做部分伪造定位

针对同一句话中真假语音共存且需逐帧定位的问题,BISL 在帧分类主任务之外增加相邻帧差分的边界学习和段内均值标准差加紧致性的段学习,在 PartialSpoof 上报告 EER 为 2.52% 与 F1 为 97.40%,代价是跨数据集到 LPS 时仍只达到 EER 为 37.10% 与 F1 为 53.61% 且推理时仅保留帧头。

 · 约 22 分钟 · 10585 字 阅读 →
论文解读

删掉画面还要删掉声音:文本与已编辑视频如何共同指定要压制的声源

针对视频物体移除后原声残留导致视听不一致的问题,TV-AudioRemover 用已编辑视频加文字指令做选择性声移除,并用百万级单物体对齐数据、多任务与由易到难的两阶段混合训练支撑细粒度区分,其代价是对上游视觉编辑质量和纠缠声源仍有依赖。

 · 约 17 分钟 · 8034 字 阅读 →
论文解读

把情感拆成方向与强度:瓶颈专家分治处理多模态情绪

该文把视频多模态情感分析拆为极性判别与强度回归,用极性与强度瓶颈专家分别压缩各模态信息再做跨模态路由融合,在四个中英文数据集与多种语言模型上报告了路由设置与专家分工证据,但未公开代码与完整训练预算。

 · 更新于 2026-09-24 · 约 8 分钟 · 3732 字 阅读 →
论文解读

一边听一边说还要实时写字:给全双工语音对话模型加一个并行流式识别头

针对全双工语音到语音模型缺用户侧流式转写的问题,论文在复用同一解码器大模型主干上并行增加轻量 ASR 头并用帧级强制对齐训练,在双工框架内报告平均 WER 为 10.21%,独立识别配置报告为 7.73%,代价是平滑轮转延迟上升与部分打断指标未占优。

 · 更新于 2026-09-24 · 约 22 分钟 · 10535 字 阅读 →
论文解读

粗粒度保语义、细粒度保波形:DualSpecSE 为何要双路同时增强 Mel 与复谱

针对单做 Mel 需外接声码器而失真、单做复谱难学且伤识别的问题,DualSpecSE 用 Mel 分支保可识别成分、复谱分支保波形细节并以交互与融合连接,在 DNS2020 上 WB-PESQ 达 3.25、CHiME-4 波形输出 WER 降至 14.76%/13.21%,代价是双分支与多损失联合训练的复杂度。

 · 更新于 2026-09-24 · 约 18 分钟 · 8732 字 阅读 →
论文解读

遮挡下先听后看:用未来潜表示预训练同时数车辨车型判方向

针对多车同时遮挡的非视距预警问题,该工作在原始 8 通道波形上做隔帧未来潜表示预测预训练,再用双向长短期记忆网络做三头微调,在 T 路口验证取得方向与计数与车型同步提升,代价是仅验证至多 2 辆车且跨场景需少样本适配。

 · 更新于 2026-09-24 · 约 18 分钟 · 8797 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-15

共分析 19 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 38 分钟 · 18639 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
论文解读

不重建波形也能帮识别:在中间表示上练目标说话人提取

针对多人同时交谈的重叠语音识别问题,该工作在 AV-HuBERT 识别主路径之外并联一个在 FBank 特征层面重建目标与干扰的 AV-TSE 辅助任务,并在 MCoRec 开发集上把词错误率从 49.90% 降到 49.55%,代价是需要仿真混合数据提供干净特征监督且推理时不使用提取分支。

 · 更新于 2026-09-24 · 约 16 分钟 · 7630 字 阅读 →
论文解读

想让人想买,先让人感到愉悦:用知觉情绪约束合成广告语音

该研究比较有无知觉情绪中间约束的语音嵌入-购买意愿模型,用反向传播改写语音嵌入再做零样本合成,听评显示有约束语音在开放与封闭说话人上都显著提升购买意愿和愉悦感,但 arousal 未拉开差距且语速被推得过快时反而有害。

 · 更新于 2026-09-24 · 约 22 分钟 · 10640 字 阅读 →
论文解读

只看标签会看错位置:用空间监督把分类依据拉回事件 footprint

针对埋地供水管道分布式声传感数据的多标签识别与时空定位问题,论文用事件级标签加像素级掩膜联合训练并在推理时用类激活图输出热力图,在保持多标签分类的同时把定位从零提升到可用水平,代价是需要人工矩形掩膜标注且只在单一工况 testbed 上验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8592 字 阅读 →
论文解读

用颜色说情绪:把语音情绪变成可回归、可解释的色相、饱和度与明度

针对类别标签难表混合情绪、维度分数难直观解释的问题,该研究把日语表演性情绪语音标注为色相、饱和度、明度并用回归直接预测,留一说话人交叉验证下多任务学习在色相角误差约 29.7 度、饱和度与明度一致性相关系数约 0.560 与 0.803、六分类准确率 90.8% 上同时优于单任务,但结论限于表演性日语与小规模众包标注条件。

 · 更新于 2026-09-24 · 约 17 分钟 · 8482 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

多声源共享房间参数时:频谱变准了,混响尾巴为何更难对齐

该研究把 DiffRIR 从单声源扩展为多声源联合优化并把学习率调到 3×10-2,用 24 条 RIR 实现频谱误差下降,同时揭示空间不变晚期残响在多声源下存在时间衰减精度的结构性代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8644 字 阅读 →
论文解读

人声与人脸为何总对不上:用不对称时间窗口重建音画同步

针对以人为中心联合生成中唇同步偏差与语义情绪脱节,UniAVGen 采用对称双分支加不对称跨模态交互、面部感知调制与模态感知引导实现单模型多任务生成,论文报告在更少联合样本下取得音色与情绪一致性优势,同时存在主体一致性未胜出与大模型打分客观性不足等边界。

 · 更新于 2026-09-24 · 约 20 分钟 · 9864 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →