倾听塌缩的拆解:先学自发先验再用双轨音频调制的 UniLS
针对直接联合训练让倾听分支塌缩为静态表情的问题,UniLS 用无音频自回归预训练学习内在运动先验,再用双轨音频交叉注意力微调实现端到端说听生成,在 Seamless Interaction 测试与 25 人偏好比较中报告说话对齐与倾听分布同时改善,代价是更大算量与仍缺语义理解。
针对直接联合训练让倾听分支塌缩为静态表情的问题,UniLS 用无音频自回归预训练学习内在运动先验,再用双轨音频交叉注意力微调实现端到端说听生成,在 Seamless Interaction 测试与 25 人偏好比较中报告说话对齐与倾听分布同时改善,代价是更大算量与仍缺语义理解。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
共收录 199 篇 acl-2026 会议论文的 Reader 深度解读
Affectron 针对开放场景下非言语发声数据少且无对齐监督的问题,用解耦小语料上的情感驱动匹配与情感感知路由构造增广样本并微调 VoiceCraft 主干,报告显示非言语真实感与多样性提升而口语自然度基本保持,代价是重叠语音未建模且依赖伪标签与小规模干净语料。
针对符号音乐中音符属性被强加固定单向顺序的问题,Amadeus 采用音符级自回归加属性级双向离散扩散的两级架构并引入 CIEM,在 AMD 大规模数据上以 16.23 notes/s 实现文本条件与可控生成的提升,代价是扩散步数与速度需权衡且数据存在风格偏置。
针对长序列符号音乐自回归生成中误差累积导致结构漂移的问题,论文提出先预测块级语义再重建音符细节并用已生成块回嵌为锚的循环范式与分草图细化的层次框架,最强证据是预测特征与真值余弦距离平均降低 34.7% 且长序列主客观评价接近真值,代价是钢琴卷表示压缩可能丢失细微时值与目前主要面向钢琴。
该工作用流式语音识别加文本预处理加机器翻译加两阶段大模型压缩的级联管线做英译中自动字幕,在开发集上以压缩换合规并略微改善 SubER,而代价是保留时间戳不动且依赖确定性改写与人工规则阈值。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
KALL-E 针对离散语音切分的信息损失与高帧率不稳定问题,用 Flow-VAE 提取 512 维 12.5 Hz 连续隐分布并让自回归 Transformer 逐帧预测均值方差,以 KL 散度为目标在 Seed-TTS 上取得 0.96 中文 CER 与 1.94 英文 WER,代价是保留强 KL 约束与单样本测试时微调的额外开销。
针对重构训练的编码器与自回归语言模型目标不一致导致词元难学的问题,论文用未来词元预测与语义对齐改造编码器,在 SALMon 上报告 61.6% 准确率与 35 倍困惑度下降,同时语音 Mel 距离改善 5.0%,代价是需要配对文本与额外训练开销。
针对并行三元组稀缺与合成目标封顶质量的问题,MimicLM 把 TTS 合成语音做源、真录音做目标并配合交错文本建模与偏好对齐,在保持音色口音情感相似度可比的同时提升自然度,代价是仍需大规模合成过滤与两阶段训练且真实输入词错率高于纯音色转换。
针对非归一化位移脉冲响应中数千个重叠平板模态难以逐个分辨的问题,该工作用匹配追踪锚定加原始与一阶二阶差分三视图子带自回归极点收割、饱和频带递归分裂与饱和指示补数,最后做全局岭最小二乘增益回填,其代价是相距不足 1 Hz 的邻近模态增益仍无法分离。
针对零样本语音克隆中对齐脆弱、时长不可控和长于训练则崩溃的问题,VoiceStar 用进度监控旋转位置编码与延续加提示混合训练实现时长控制与外推,最强证据是 40s-50s 外推下词错率 11.91 对 F5-TTS 的 52.44,代价是长上下文下说话人相似度略低与自回归推理慢。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对自回归文本到音频在复杂事件上指令跟随下降的问题,论文用前缀隐式计划探测加 Plan-Critic 早期剪枝做引导解码,在相同 token 预算下把 AudioCaps 总体 CLAP 从 26.67 提升到 36.47,代价是需要额外训练一个轻量打分器并依赖 CLAP 作为代理目标。
IndexTTS2 针对自回归零样本语音合成难以精确控时长与情感易混入音色的问题,用语义标记数约束、风格与音色双提示解耦与 GPT 隐状态增强做级联合成,在多数据集上报告了词错误率、说话人相似度和情感相似度的领先结果,但强情感下清晰度与极端变速仍有代价。
针对连续语音表示自回归预测中误差沿时间累积导致的隐变量漂移问题,SphereVAE 用单位超球面 Power Spherical 隐空间固定模长只留方向变化,在重建指标低于标准 VAE 的代价下,在 VoxCPM 零样本合成中取得英文 5.305% 词错误率与中文 1.141% 字错误率的最低内容错误并在长文本中保持更高的说话人相似度。
针对整序列扩散在超长语音上泛化下降与延迟随长度增长的问题,该文用固定窗口历史运动加当前音频生成动态条件,再用单层扩散头逐帧去噪,在 BIWI 长序列与消融对照上显示出同步与稳定优势,但短序列口型开合仍有可比基线。
针对严格因果实时伴奏中自回归节奏漂移问题,Silent Metronome 用与生成音频无关的外部节拍相位加速度拍子条件做逐帧锚定并辅以未来词元预测塑形表示,在 Slakh2100 上把 Beat-F 从 0.133 提升到 0.432 并超过 1 秒前视的非因果参照,代价是参数量增加与分布保真度的轻微回落。
TontaubeV1 把 12.5 Hz 分层编解码的语义流交给大模型定韵律与时长、三个小模型逐层补声学细节,并用配对边界与有界窗口做长文本流式合成,代价是四阶段串行与非因果解码需二次转码,在 400 段英文有声书评测中韵律与 ElevenLabs Flash v2.5 持平并领先其余三家。