会议总览

interspeech-2026 论文深度解读

共收录 1354 篇 interspeech-2026 会议论文的 Reader 深度解读

 · 更新于 2026-10-01 · 约 2613 分钟 · 1309023 字 阅读 →
论文解读

只看脸说方言:K-DIALECT 如何把说话人身份与方言韵律分开建模

K-DIALECT 针对参考音频稀缺的韩语方言合成问题,用双分支人脸编码器定身份风格、用方言条件基频预测器定韵律,并以 FiLM 融合生成语音,在六种方言上以主观方言流利度和自然度领先语音基线,代价是说话人相似度仍低于有参考音频的 XTTS-v2。

 · 更新于 2026-10-01 · 约 20 分钟 · 9919 字 阅读 →
论文解读

不从头学生成器,只学对齐时长:LipAdapter 用文本到视频对齐改造冻结 TTS

针对无声唇视频生成可懂、自然且口型同步语音的问题,LipAdapter 冻结视觉语音识别与多语 TTS、只训练文本到视频对齐以预测唇形引导的音素时长,在 LRS3 上用 30 小时训练达到 21.2% 词错率,但短于 1 秒的片段同步置信度明显下降且依赖上游识别文本质量。

 · 更新于 2026-10-01 · 约 18 分钟 · 8622 字 阅读 →
论文解读

先看听者再说话:用回应前一秒表情规划下一句怎么说

针对对话语音只看文本历史会漏掉听者即时非言语线索的问题,用回应前 1 秒听者人脸时序做显式回应规划,在严格双人 MELD 协议上时序模型宏平均 F1 和 VAD 一致性略高于纯文本而准确率基本不变,合成阶段仅证明可端到端连通而未改善可懂度。

 · 更新于 2026-10-01 · 约 18 分钟 · 8603 字 阅读 →
会议总览

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-10-01 · 约 212 分钟 · 106059 字 阅读 →
论文解读

按语音层级拆开看:低层管内容音色、高层管韵律的视频到语音生成

针对无声视频生成语音时视觉稀疏而语音稠密的不对称问题,HiCoDiT 用残差向量量化的 12 层离散 token 层级先验把唇动身份与表情解耦注入低层和高层扩散块,在未训练的 LRS3 与 LRS2 上以 A/B 偏好 57.0% 对 38.1% 胜过 AlignDiT 等基线,代价是身份多样性受限且部分客观指标未全面领先。

 · 更新于 2026-10-01 · 约 17 分钟 · 8430 字 阅读 →
会议总览

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-10-01 · 约 307 分钟 · 153423 字 阅读 →
论文解读

不预测离散口令而直写连续声学潜向量:子空间扩散如何重连唇动与声音

针对唇到语音中视觉到声学一对多映射难保留细节的问题,SLD-L2S 用层次子空间潜流匹配直写预训练音频编解码器连续潜向量并辅以语义与语音语言模型损失,在 LRS3 上以 10 步函数求值取得 UTMOS 4.2096 等质量领先,代价是可懂度仍受视觉信息瓶颈与辅助损失权衡约束。

 · 更新于 2026-10-01 · 约 21 分钟 · 10025 字 阅读 →
论文解读

不用中间文本转写:以识别语义直接约束唇手到语音的统一生成

针对中文唇读辅以手编码的视频到语音任务,UniCUE 用姿态感知的识别通路提供细粒度视觉语义并经适配器条件化潜在扩散语音生成,在统一听障语料上报告了识别与生成的词错率下降,但训练只用健听者数据且推理开销未量化。

 · 更新于 2026-10-01 · 约 20 分钟 · 9918 字 阅读 →
论文解读

AnyTalk: Speech Animation for Arbitrary Characters Leveraging a Video Generation Model

音视频语音合成 | 6.7/10

 · 更新于 2026-10-01 · 约 16 分钟 · 7543 字 阅读 →
论文解读

CineDub: Scaling End-to-End Video Dubbing to Multi-Speaker Dialogues with Coherent Sound Effects

音视频语音合成 | 7.3/10

 · 更新于 2026-10-01 · 约 14 分钟 · 6606 字 阅读 →