论文解读

同形异读被折叠时:用注音绑定把读音留存在监督目标里

针对日语音形多对多导致正字法监督折叠词位读音的问题,论文把目标细化为 span 绑定的 ruby 序列并用 Qwen3-ASR 加 mora 级 CTC 联合训练,在五项基准上以加权 Kana CER 3.75% 改善读音直读而字形转写未退化,但自发语音与罕见词形仍是主要瓶颈。

 · 约 20 分钟 · 9862 字 阅读 →
论文解读

先想好怎么说,再开口说:COT-TTS 把对话历史变成可检查的说话计划

COT-TTS 研究给定历史对话音频、固定目标文本和参考音色时如何先显式推理说话方式再合成语音,最强证据是 0.6B/1.7B 端到端模型在时长一致性和人评上接近 34-39B 级联基线,代价是可编辑推理大幅改动时会降低客观音质并引入推理与语音错位风险。

 · 更新于 2026-09-24 · 约 21 分钟 · 10461 字 阅读 →
论文解读

整场会议的自回归日志:事件式输出更稳,跨段身份仍需显式链接

该工作把完整会议说话人日志写成条件于声学输入的自回归结构化词元生成,对比事件式与帧式表示并引入语音活动与重叠等辅助线索,最强可运行证据是事件式 SAD 到 OD 再到 SD 链经 VBx 链接后在 AMI 上达到 24.40% 日志错误率,代价是原始输出跨段身份混乱且重叠区漏检仍然很高。

 · 更新于 2026-09-24 · 约 18 分钟 · 8820 字 阅读 →
论文解读

连续自回归做钢琴渲染:全局作曲、局部演奏与全序列精修如何分工

针对给定提示音色与目标 MIDI 的钢琴渲染任务,论文用 Composer 自回归预测连续隐状态、Performer 做局部流匹配生成 24 kHz 声学特征、Refiner 上采样到 48 kHz,并报告目标 MIDI 跟随提升 2.7 个百分点的证据,代价是音色相似度仍略低于全序列流匹配基线。

 · 更新于 2026-09-24 · 约 18 分钟 · 8939 字 阅读 →
论文解读

缺口比模型阶数还短时,Etter 的双向自回归插值还能解吗

论文复活 Etter 双向自回归插值,用前后向预测残差能量最小导出线性方程组求缺口样本,并给出短缺口高阶模型和因果丢包隐藏两种扩展,在 80 毫秒内音乐缺口上与多数基线相当但弱于逐缺口 Janssen 迭代法且外插简化版更快。

 · 更新于 2026-09-24 · 约 18 分钟 · 8983 字 阅读 →
论文解读

把笑声叹息放进指定位置:连续隐变量、长尾补数据与多指标选样的可控语音

为在指定文本位置可靠生成 16 类非言语发声,该工作用连续隐变量 DiTAR 加专用标签与停顿判别建模,以双语预训练加针对性合成与频率重采样补长尾,再用解码参数搜索与五选一多指标选样提升鲁棒性,最终以双语加权 62.786 获 Track 2 总分第一,代价是额外推理计算与英文控制仍待加强。

 · 更新于 2026-09-24 · 约 20 分钟 · 9653 字 阅读 →
论文解读

边说边想边办事:Realtime-Venus 如何把全双工对话与异步委派放在同一时间线上

Realtime-Venus 用两个 9B 前端分别处理音视频与纯音频全双工对话,用双环运行时把即时说话与后台推理工具执行解耦,最强证据是 Omni 在六项视频基准领先与 Audio 在 MMAU 等四项音频问答领先,代价是打断响应与参数准确率仍落后及委派判断存在漏委派与过度委派的权衡。

 · 更新于 2026-09-24 · 约 24 分钟 · 11780 字 阅读 →
论文解读

先规划后演奏:StepAudio 3 Music 用单码本与 ABC 计划平衡长曲连贯与音质

StepAudio 3 Music 针对完整歌曲的长程结构与高保真渲染矛盾,采用 50 赫兹 65536 表项单码本离散表示加混合专家自回归组织音乐序列再由流匹配扩散渲染 48 千赫音频,并以 ABC 记谱作显式编曲计划,在 339 条歌词到歌曲与 316 条人声条件上取得内容享受 7.7086 与文本相似 0.4465 的最高均值,代价是自回归序列翻倍与符 …

 · 更新于 2026-09-24 · 约 22 分钟 · 10836 字 阅读 →
论文解读

瓶颈不断搬家:从 CosyVoice 到 Qwen-Audio-3.0-TTS 的接口契约与分阶段对齐

该回顾把四代系统的进步归因于规划器与渲染器之间接口契约的四次搬迁,用同篇消融支持表示与归属判断,以分阶段联合训练解决低码率与跨模块协同问题,代价是更长的训练流水线与更复杂的条件控制。

 · 更新于 2026-09-24 · 约 18 分钟 · 8722 字 阅读 →
论文解读

长语音越说越飘、难句反复打转:DiTAR+ 用扩张视野与分层遮蔽稳住自回归扩散

针对连续隐变量自回归扩散在长句和难句上的发音错误与语义幻觉,DiTAR+ 用扩张上下文采样扩大历史视野、用分层声学遮蔽先对齐语义再渲染声学,在 ZH-Hard 上把词错误率从 12.478% 降到 9.893%,在 25 到 35 秒长句上把说话人相似度从 0.741 提升到 0.759,同时词错误率从 2.778% 降到 2.173%,代价是质量主观分相对 …

 · 更新于 2026-09-24 · 约 20 分钟 · 9543 字 阅读 →
每日研究速递

nime-2026 论文深度解读

共收录 160 篇 nime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 332 分钟 · 166159 字 阅读 →
论文解读

离散自回归统一音频生成:以首层码本规划与残差声学补全分工控制干扰

StepAudio 3 Gen 用 12.5 Hz 共享 16 码本离散表示把语音、歌声、音效和音乐放在一个自回归流中建模,以主干预测首码本加轻量预测器补全残差码本的分工,在四阶段渐进预训练与零初始化适配下保持文本能力,并在中文人声相似度与声音设计指令遵循上报告了可核对的胜率与一致性得分,其代价是长序列声学建模与多阶段训练流程的复杂度。

 · 更新于 2026-09-24 · 约 24 分钟 · 11918 字 阅读 →
论文解读

以笔速问音:书法动作如何外部控制符号音乐生成的时机与织体

该文把毛笔旋转速度作为外部控制层,用距离积分触发主旋律、用阈值开关控制和声层,调用公开 Notochord 模型生成多轨 MIDI 并经 Ableton Live 发声,以一次约五分钟的水写布现场演示验证可演性,代价是只用陀螺仪而缺压力与长结构建模。

 · 更新于 2026-09-24 · 约 20 分钟 · 9816 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

dafx-2026 论文深度解读

共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 181 分钟 · 90282 字 阅读 →
论文解读

零前视下全身协调:LiveGesture 用分区域专家加因果融合做流式手势

LiveGesture 针对实时对话中不能等待整句语音的手势生成问题,采用可流式解码的分区运动词表加区域专家与因果空时融合,在 BEAT2 上以零前视达到与离线方法可比的真实感与节拍同步,但面部顶点误差与首包延迟仍受音频编码与自回归漂移约束。

 · 更新于 2026-09-24 · 约 21 分钟 · 10263 字 阅读 →
论文解读

不等未来语音:MIBURI 如何用对话模型的内部 token 流直接生成全身手势

针对具身对话需要因果、低延迟且富有表现力的手势问题,MIBURI 直接复用 Moshi 语音文本模型的内部 token 流,用身体分区残差码本与时间加运动学双变换器逐帧生成手势,并以 36 ms 每帧的在线演示和多说话人评测支撑其因果实时主张,但仍未达到真值自然度且未建模用户身体。

 · 更新于 2026-09-24 · 约 20 分钟 · 9813 字 阅读 →
论文解读

把口型习惯和情绪拆开控制:PC-Talk 用隐式关键点变形做可控说话人脸

针对音频驱动说话人脸只求口型对齐而说话风格单一、情绪不可控的问题,PC-Talk 用隐式关键点上的唇同步变形与纯情绪变形分别建模,在 HDTF 上以视频输入 9.03 与图像输入 9.37 的 LSE-C 显示口型优势,并以情绪分类准确率 46.19 与 72.32 显示情绪优势,代价是需要分开训练两个控制模块并固定渲染器参数。

 · 更新于 2026-09-24 · 约 25 分钟 · 12326 字 阅读 →
论文解读

把长相交给参考图:参考引导深度压缩如何让说话人像视频实时可流式生成

针对语音驱动说话人像需要同时满足实时流式、高保真和大范围躯干动态的问题,该工作用参考图引导的因果视频 VAE 把压缩率做到 768 并用块自回归整流流 Transformer 生成潜变量,在单卡实现 512×512 下 42 FPS,代价是强依赖参考图质量与训练数据分布且本次未能确认代码模型可达。

 · 更新于 2026-09-24 · 约 20 分钟 · 9937 字 阅读 →
论文解读

一次生成一小段连续潜块:SCAPES 如何用轻量流模型做语义可控的环境声

针对环境声语义描述粗疏而波形稠密、离散量化破坏连续性、非因果编解码拼接易产生边界伪影的问题,SCAPES 冻结 EnCodec 连续潜空间并用条件连续归一化流做段级自回归生成,在约 34 分钟 10 类数据上以约 36M 参数单卡约 1 小时训练实现长稳可控合成,代价是对语音音乐等长结构建模不足且部分类别指标未胜出。

 · 更新于 2026-09-24 · 约 18 分钟 · 8698 字 阅读 →