dafx-2026 论文深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对无声视频生成语音时视觉稀疏而语音稠密的不对称问题,HiCoDiT 用残差向量量化的 12 层离散 token 层级先验把唇动身份与表情解耦注入低层和高层扩散块,在未训练的 LRS3 与 LRS2 上以 A/B 偏好 57.0% 对 38.1% 胜过 AlignDiT 等基线,代价是身份多样性受限且部分客观指标未全面领先。
LiveGesture 针对实时对话中不能等待整句语音的手势生成问题,采用可流式解码的分区运动词表加区域专家与因果空时融合,在 BEAT2 上以零前视达到与离线方法可比的真实感与节拍同步,但面部顶点误差与首包延迟仍受音频编码与自回归漂移约束。
针对具身对话需要因果、低延迟且富有表现力的手势问题,MIBURI 直接复用 Moshi 语音文本模型的内部 token 流,用身体分区残差码本与时间加运动学双变换器逐帧生成手势,并以 36 ms 每帧的在线演示和多说话人评测支撑其因果实时主张,但仍未达到真值自然度且未建模用户身体。
针对无线声传感器网络中集中式传输原始麦克风信号开销大且难扩展的问题,论文提出传输平面波与边界元物理映射加低秩先验的隐坐标并做反向注水比特分配,仿真报告在相同估计误差下分配策略比均匀量化需要更少总速率,但低秩与高噪声会抬高误差下限。
针对固定通道神经音频编解码器换通道数就要换结构的问题,VCNAC 用分流卷积加统一量化瓶颈实现单套参数原生支持 1 通道、2 通道和 6 通道,在 7.9 kbit/s 量级取得与更高码率基线可比的主客观重建质量,代价是依赖合成环绕声训练且中置与后置通道客观指标仍偏低。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
针对神经语音编解码器量化后情绪线索易失真的问题,AffectCodec 用量化前情感语义调制、第 1 层关系蒸馏和情绪加权语义对齐 3 步保留情绪,同时报告了在重建相似度、EMO-SUPERB 识别和零样本合成上的增益与内容保真代价。
针对延续式语言模型把提示音色和韵律一起复制而无法独立控制的问题,DisCo-Speech 用三因子解耦编码器加内容韵律融合重建实现韵律延续与音色注入,消融显示软约束兼顾自然度与音色一致,代价是单阶段自回归的克隆相似度仍弱于多阶段流匹配系统。
FC-TTS 要解决用两段不同参考语音分别控制音色与风格的问题,它用音色先定模糊谱、风格再细化的方法组织生成,并在 RAVDESS 音色控制上报告保持可用质量,而代价是放弃部分内容与细节信息并引入中间瓶颈。
该工作把任意输入音频的频谱特征映射到在 7999 个电子舞曲鼓循环上学到的 256 个离散节奏原型,再用力度解码器恢复动态并用用户原声合成,在验证集上重建汉明距离为 0.0064、力度误差相对均值基线降低 77.4%,代价是 2000 个环境声音只激活 50% 码本且弱音表现不足。
针对每秒仅 25 个 token 重建 24 kHz 波形时语义丢失与高频失真问题,论文用条件流匹配迭代生成波形并以分层表示对齐与稠密单层量化组织语义和声学信息,最强证据是 8 层 RVQ 对照与频带误差表显示的语义保持与高频改善,代价是四步 ODE 采样与大规模 Transformer 解码器的推理开销。
该文针对仅混淆音色后韵律节奏仍会泄露身份的问题,用离散语音单元加时长预测与单元声码器同时改写音色与节奏,在非音色攻击下半知情评估取得相对 32% 的提升,代价是词错误率上升到 7% 量级且自然度轻微下降。
共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读
针对单路编码器难以同时保语义和保音质的问题,SAC 把冻结语义流与可训练声学流分开量化再融合解码,在 LibriSpeech 重建与 ARCH 语义探测上取得低词错误率和高自然度,但低码率下音色相似度仍有代价。
针对约 1 kbps 下语义对齐与波形重建互相冲突的问题,XY-Tokenizer 用语义与声学双编码器加残差矢量量化与先联合对齐后冻结细化的两阶段训练,在英中多数据集上同时取得低识别错误率与高说话人相似度,代价是更大的编码器规模与更重的训练流程。
ZipCodec 针对流式语音 token 序列过长问题,用因果 log-mel 前端加 16 帧组块把帧率压到 6.25 Hz 与 0.80 kbps,再以约 94000 小时英文语音上的 WavLM 第 6 层蒸馏加标量球面量化保持重建与下游表征质量,代价是 842M 参数与严格的流式因果约束。
针对文本大模型向语音统一理解与生成迁移时模态鸿沟大、单一种词元难以兼顾语义与声学的问题,该文提出理解驱动分词器与双词元建模并用约 4500 小时数据验证,理解与生成可相互促进,但细粒度声学保留与翻译类任务仍有代价与边界。