论文解读

不用表情图片,只用情感语音的差向量去改脸:C-MET 的跨模态情绪编辑

针对说话人视频中情绪编辑受限于离散标签和参考图像的问题,C-MET 用语音与表情空间的情绪语义向量差做跨模态回归,在 MEAD 上把情绪准确率做到最高,同时保留唇动与身份,且能处理训练未见的扩展情绪。

 · 更新于 2026-09-25 · 约 22 分钟 · 10870 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 181 分钟 · 90282 字 阅读 →
论文解读

病理语音不够、又不一样:三类数据增强到底谁能补上增强性能

针对帕金森病理语音增强数据少且声学 atypical 的问题,论文在 PC-GITA 上系统比较变换型、生成型与噪声增强对预测式 CR 与生成式 SB 模型的影响,最强证据是噪声增强带来最稳健的大幅提升,而生成式合成在比例增大时反而损害性能,且病理与常态语音间的差距依然存在。

 · 更新于 2026-09-25 · 约 19 分钟 · 9355 字 阅读 →
论文解读

只共享频谱不共享空间:去中心化 ILRMA 如何在分布式麦克风阵列上分离

针对分布式子阵列间通信贵、难同步的问题,论文提出只在子阵列间共享非负矩阵分解变量的三种去中心化独立低秩矩阵分析,并报告基共享变体在混响与采样时间偏移下保持稳定分离的主要证据与建模代价。

 · 更新于 2026-09-25 · 约 16 分钟 · 7714 字 阅读 →
论文解读

注意力也会分心:用差分门控让 Conformer 在噪声中保持对比度

针对 Conformer 在噪声下注意力分散导致上下文建模退化的问题,论文提出混合式修正差分门控注意力 Conformer,在保持参数量基本一致时于 Librispeech 干净与加噪测试上取得相对词错误率下降,但小模型增益有限且早期全量替换会损害表征。

 · 更新于 2026-09-25 · 约 18 分钟 · 8592 字 阅读 →
论文解读

把削波变成可逆折叠:用溢出对抗削波的音频采集

针对模数转换器动态范围不足导致的削波与绕回溢出,该文在模拟前端引入模折叠并用分帧离散余弦变换加矩阵铅笔法恢复丢失的高位,硬件实验报告在严重削波下提升超过 25 dB,但依赖过采样与带限平滑先验且对硬件非理想折叠需鲁棒处理。

 · 更新于 2026-09-25 · 约 15 分钟 · 7277 字 阅读 →
论文解读

不重建人体动作:把音频当风格信号直接驱动人形机器人跳舞与演讲

论文把音乐与语音当作隐式风格控制信号,用音频-动作对齐加残差混合专家教师与内容加风格扩散学生实现免重定向的音频到关节动作映射,在 FineDance 与 BEAT2 上报告了检索与跟踪指标,但跨仿真与真机泛化仍受数据集与物理条件限制。

 · 更新于 2026-09-25 · 约 19 分钟 · 9367 字 阅读 →
论文解读

双人对话手势为何要先分清谁在说话:DyaDiT 用解耦音频与社会条件生成可控动作

DyaDiT 针对双人对话中两路语音互相干扰和社会上下文缺失的问题,用正交化交叉注意力分离双路音频并以关系与人格为条件做扩散生成,在 Seamless Interaction 子集上报告了更低的 FD 和更高偏好度,但人格可控性仍受音频隐含线索干扰。

 · 更新于 2026-09-25 · 约 19 分钟 · 9490 字 阅读 →
论文解读

帧长跟着声门走:用基音周期对齐傅里叶分析的动态帧谱特征

针对固定帧与浊音基音周期非整数比造成频谱失真的问题,该文用声门闭合时刻定帧界并重采样到统一时频网格,在 TIMIT 音素分类上以 6 ms 表观支撑达到 47.3% 准确率,超过 24 ms 固定帧的 46.8%,代价是依赖 GCI 估计与二维插值且未建模上下文。

 · 更新于 2026-09-25 · 约 18 分钟 · 8640 字 阅读 →
论文解读

房间脉冲响应里自带的噪声底:卷积进语音后为何造成训练与真实录音失配

该研究用受控仿真对比卷积噪声与加性噪声对房间脉冲响应表征的影响,显示在能量交点附近截断卷积噪声并在增强时加入加性噪声能改善潜空间可分性与混响时间估计,而把过长噪声尾保留进训练会损害向真实混响语音的泛化。

 · 更新于 2026-09-25 · 约 17 分钟 · 8189 字 阅读 →
论文解读

情绪语音为何更难对齐:用结构先验把口型与情绪分开建模

针对有情绪语音下少样本说话头几何不稳定与音画情绪错位问题,EmoTaG 选择在 FLAME 参数空间预测运动并用门控残差分离音素与情绪,证据是在 5 秒适配的自重建与跨人跨语评测中取得更优的图像质量与运动误差,代价是适配仍需约 11 分钟与上脸辅助输入。

 · 更新于 2026-09-25 · 约 17 分钟 · 8286 字 阅读 →
论文解读

用电刺激逼近正常听觉神经响应:闭环耳蜗植入框架的概念验证

该研究把正常听觉与电刺激听觉都写成可微模型,用同一段语音驱动两条通路并以螺旋神经节神经元包络误差为目标训练双网络刺激器,在 TIMIT 干净语音上把包络平均绝对误差从 0.6261 降到 0.0934,代价是仅用单一包络指标、干净语音和 8 kHz 以下频带且允许同时刺激。

 · 更新于 2026-09-25 · 约 17 分钟 · 8245 字 阅读 →
论文解读

同位置配准的瞬时相对传递函数为何比声纹和波达方向更适合混响多麦提取

该文研究混响加定向噪声下两人混合的多麦目标说话人提取,对比瞬时相对传递函数、已知波达方向和单通道声纹三种配准线索,随机位置上瞬时相对传递函数取得 9.2 dB 和 0.81 的分离与可懂度,同波达方向下仍保持 8.8 dB,代价是需要与目标同位置的无噪配准信号。

 · 更新于 2026-09-25 · 约 17 分钟 · 8207 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-25 · 约 247 分钟 · 123292 字 阅读 →
论文解读

用音素识别度量声道形状合成:当逐点距离看不出时间稳定性时怎么办

该文把声道发音合成的评价转为发音特征上的音素识别问题,用同一识别器比较真实轮廓与三种合成轮廓的音素错误率,最强证据是加浊音编码后无模型合成达到 20.59 的错误率,代价是单说话人法语实时磁共振数据与缺声源信息的固有限制。

 · 更新于 2026-09-25 · 约 20 分钟 · 9554 字 阅读 →
论文解读

大规模与噪声下还要控准基频:VAE-SiFiGAN 用重合成误差筛掉 F0 提取错误

针对 F0 可控声码器在大规模多说话人训练和噪声下是否仍可控的问题,论文用概率潜变量替代确定性特征并以重合成谱误差做数据筛选,报告显示筛选能阻止错误数据拖累训练、上移 F0 时清浊判断更准而下移与高频区仍有挑战、噪声下优于基线,但筛选阈值仍需人工设定。

 · 更新于 2026-09-25 · 约 19 分钟 · 9402 字 阅读 →
论文解读

浊擦音难分时,比值特征为何能拉开齿音与齿龈音的距离

该研究针对波兰儿童浊卷舌擦音发音部位分类,用支持向量机比较梅尔倒谱、谱描述子、摩擦噪声与新提出谱比值特征及多种特征选择方法,最强证据是梅尔倒谱加谱描述子加谱比值配合套索选择达到灵敏度 0.72 与特异度 0.81,代价是小样本与类别不平衡下的稳定性仍需更多验证。

 · 更新于 2026-09-25 · 约 21 分钟 · 10022 字 阅读 →
论文解读

在低频要降噪、高频要保方向时:按频点凸切换松绑双耳约束

针对双耳助听中降噪与干扰声方向保持的矛盾,论文提出按频点在高降噪与严格保方向之间做凸组合切换,并在与松弛联合双耳约束相同方向误差下获得更高信干噪比,其代价是在大松弛量时部分频点仍需求解松弛优化而耗时增加。

 · 更新于 2026-09-25 · 约 18 分钟 · 8529 字 阅读 →
论文解读

把转录文本连成图:用主体词关系检测阿尔茨海默症

该文把轻量语音转文本后的饼干失窃描述转成词共现图,用两层图卷积区分阿尔茨海默症与健康人,在 ADReSS-o 上主体词图达到 88.73%、精炼版 90.14%,代价是词表依赖该图片描述任务且只用文本模态。

 · 更新于 2026-09-25 · 约 16 分钟 · 8007 字 阅读 →