每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

按语音层级拆开看:低层管内容音色、高层管韵律的视频到语音生成

针对无声视频生成语音时视觉稀疏而语音稠密的不对称问题,HiCoDiT 用残差向量量化的 12 层离散 token 层级先验把唇动身份与表情解耦注入低层和高层扩散块,在未训练的 LRS3 与 LRS2 上以 A/B 偏好 57.0% 对 38.1% 胜过 AlignDiT 等基线,代价是身份多样性受限且部分客观指标未全面领先。

 · 更新于 2026-09-24 · 约 17 分钟 · 8430 字 阅读 →
论文解读

零前视下全身协调:LiveGesture 用分区域专家加因果融合做流式手势

LiveGesture 针对实时对话中不能等待整句语音的手势生成问题,采用可流式解码的分区运动词表加区域专家与因果空时融合,在 BEAT2 上以零前视达到与离线方法可比的真实感与节拍同步,但面部顶点误差与首包延迟仍受音频编码与自回归漂移约束。

 · 更新于 2026-09-24 · 约 21 分钟 · 10263 字 阅读 →
论文解读

不等未来语音:MIBURI 如何用对话模型的内部 token 流直接生成全身手势

针对具身对话需要因果、低延迟且富有表现力的手势问题,MIBURI 直接复用 Moshi 语音文本模型的内部 token 流,用身体分区残差码本与时间加运动学双变换器逐帧生成手势,并以 36 ms 每帧的在线演示和多说话人评测支撑其因果实时主张,但仍未达到真值自然度且未建模用户身体。

 · 更新于 2026-09-24 · 约 20 分钟 · 9813 字 阅读 →
论文解读

不传原始波形:用物理先验的隐编码在带宽受限下估计声场

针对无线声传感器网络中集中式传输原始麦克风信号开销大且难扩展的问题,论文提出传输平面波与边界元物理映射加低秩先验的隐坐标并做反向注水比特分配,仿真报告在相同估计误差下分配策略比均匀量化需要更少总速率,但低秩与高噪声会抬高误差下限。

 · 更新于 2026-09-24 · 约 19 分钟 · 9024 字 阅读 →
论文解读

一套参数如何同时装下单声道、立体声和 5.1 环绕声

针对固定通道神经音频编解码器换通道数就要换结构的问题,VCNAC 用分流卷积加统一量化瓶颈实现单套参数原生支持 1 通道、2 通道和 6 通道,在 7.9 kbit/s 量级取得与更高码率基线可比的主客观重建质量,代价是依赖合成环绕声训练且中置与后置通道客观指标仍偏低。

 · 更新于 2026-09-24 · 约 17 分钟 · 8221 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

把情绪当作首要优化目标:AffectCodec 如何在离散量化中留住情绪

针对神经语音编解码器量化后情绪线索易失真的问题,AffectCodec 用量化前情感语义调制、第 1 层关系蒸馏和情绪加权语义对齐 3 步保留情绪,同时报告了在重建相似度、EMO-SUPERB 识别和零样本合成上的增益与内容保真代价。

 · 更新于 2026-09-24 · 约 21 分钟 · 10128 字 阅读 →
论文解读

把音色和韵律拆开再拼回去:DisCo-Speech 的两阶段解耦与独立控制

针对延续式语言模型把提示音色和韵律一起复制而无法独立控制的问题,DisCo-Speech 用三因子解耦编码器加内容韵律融合重建实现韵律延续与音色注入,消融显示软约束兼顾自然度与音色一致,代价是单阶段自回归的克隆相似度仍弱于多阶段流匹配系统。

 · 更新于 2026-09-24 · 约 19 分钟 · 9379 字 阅读 →
论文解读

分开给音色和风格:FC-TTS 用两阶段管线约束解耦的边界

FC-TTS 要解决用两段不同参考语音分别控制音色与风格的问题,它用音色先定模糊谱、风格再细化的方法组织生成,并在 RAVDESS 音色控制上报告保持可用质量,而代价是放弃部分内容与细节信息并引入中间瓶颈。

 · 更新于 2026-09-24 · 约 18 分钟 · 8837 字 阅读 →
论文解读

任意声音如何借到电子舞曲的鼓点:离散节奏原型库的频谱检索

该工作把任意输入音频的频谱特征映射到在 7999 个电子舞曲鼓循环上学到的 256 个离散节奏原型,再用力度解码器恢复动态并用用户原声合成,在验证集上重建汉明距离为 0.0064、力度误差相对均值基线降低 77.4%,代价是 2000 个环境声音只激活 50% 码本且弱音表现不足。

 · 更新于 2026-09-24 · 约 20 分钟 · 10020 字 阅读 →
论文解读

极低码率下保住语义再重建波形:FlowTokenizer 的分层对齐与单层稠密量化

针对每秒仅 25 个 token 重建 24 kHz 波形时语义丢失与高频失真问题,论文用条件流匹配迭代生成波形并以分层表示对齐与稠密单层量化组织语义和声学信息,最强证据是 8 层 RVQ 对照与频带误差表显示的语义保持与高频改善,代价是四步 ODE 采样与大规模 Transformer 解码器的推理开销。

 · 更新于 2026-09-24 · 约 20 分钟 · 9967 字 阅读 →
论文解读

只换音色不够:用离散单元同时改写节奏的匿名化

该文针对仅混淆音色后韵律节奏仍会泄露身份的问题,用离散语音单元加时长预测与单元声码器同时改写音色与节奏,在非音色攻击下半知情评估取得相对 32% 的提升,代价是词错误率上升到 7% 量级且自然度轻微下降。

 · 更新于 2026-09-24 · 约 17 分钟 · 8068 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

语义与声学分流:SAC 用双路量化兼顾可懂度与可重建性

针对单路编码器难以同时保语义和保音质的问题,SAC 把冻结语义流与可训练声学流分开量化再融合解码,在 LibriSpeech 重建与 ARCH 语义探测上取得低词错误率和高自然度,但低码率下音色相似度仍有代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8613 字 阅读 →
论文解读

低码率下语义与音质为何互相拖累:XY-Tokenizer 用双塔与两阶段分开建模

针对约 1 kbps 下语义对齐与波形重建互相冲突的问题,XY-Tokenizer 用语义与声学双编码器加残差矢量量化与先联合对齐后冻结细化的两阶段训练,在英中多数据集上同时取得低识别错误率与高说话人相似度,代价是更大的编码器规模与更重的训练流程。

 · 更新于 2026-09-24 · 约 24 分钟 · 11812 字 阅读 →
论文解读

把每秒 token 压到 6.25 个:ZipCodec 如何在流式与 160 ms 时延下保住语义和音质

ZipCodec 针对流式语音 token 序列过长问题,用因果 log-mel 前端加 16 帧组块把帧率压到 6.25 Hz 与 0.80 kbps,再以约 94000 小时英文语音上的 WavLM 第 6 层蒸馏加标量球面量化保持重建与下游表征质量,代价是 842M 参数与严格的流式因果约束。

 · 更新于 2026-09-24 · 约 19 分钟 · 9318 字 阅读 →
论文解读

语义不够声学来凑行不通:用理解型词元做输入、声学词元做输出的统一建模

针对文本大模型向语音统一理解与生成迁移时模态鸿沟大、单一种词元难以兼顾语义与声学的问题,该文提出理解驱动分词器与双词元建模并用约 4500 小时数据验证,理解与生成可相互促进,但细粒度声学保留与翻译类任务仍有代价与边界。

 · 更新于 2026-09-24 · 约 17 分钟 · 8046 字 阅读 →