边说话边做事:用前后台分离让语音中断不再取消任务
针对多轮语音任务中对话与执行时间尺度不一致的问题,论文用前台对话加后台委托的编排运行时分离两者,并在 134 例座舱基准上以混合路由实现 91.04% 任务成功率,代价是需要维护任务状态、投递调度和跨会话记忆等额外机制。
针对多轮语音任务中对话与执行时间尺度不一致的问题,论文用前台对话加后台委托的编排运行时分离两者,并在 134 例座舱基准上以混合路由实现 91.04% 任务成功率,代价是需要维护任务状态、投递调度和跨会话记忆等额外机制。
论文把短到长训练拆成呈现顺序、批次组成与损失归一化三件事来测,在 87M 语音词元模型上发现固定组批后排序本身不降困惑度,首轮分组的增益只出现在按批平均的损失下并随词元均衡归一化而消失,而持续排序反而更差。
针对日语音形多对多导致正字法监督折叠词位读音的问题,论文把目标细化为 span 绑定的 ruby 序列并用 Qwen3-ASR 加 mora 级 CTC 联合训练,在五项基准上以加权 Kana CER 3.75% 改善读音直读而字形转写未退化,但自发语音与罕见词形仍是主要瓶颈。
针对串行先想后说导致长时间无声等待的问题,该工作用推理主路加轻量报幕支路的异步结构,在保持串行推理问答精度基本相当的同时,把用户可感知的静音大幅压低,代价是需要额外的报幕生成与动态调度。
本文以酷儿群体为案例指出众包难以建立长期信任与性别多样覆盖,进而提出社区、项目制定、参与方式与个人自主权四阶段双向框架,其代价是协调成本上升且本文未做新的模型训练与定量验证。
针对注意力编码器解码器语音基座模型在无语音与弱证据下产生无声学支撑文本的问题,AURA 冻结原模型并只编辑解码器交叉注意力的少量头输出,用交叉注意力不确定性做逐词门控,在非语音上把幻觉率从 89.18% 降到 1.94%,代价是训练轮数增加后干净语音词错误率上升的权衡。
该研究把二语节奏评估做成流利度和韵律分数回归,用一维卷积直接从语音幅度包络及其一阶导数学生节奏特征,最强证据是包络导数模型在低流利度组误差显著低于时长模型,代价是韵律维度仍受语调混杂与低分样本稀少限制。
针对大规模多语言话者确认中注册与测试语音可靠性差异大的问题,该文在常规逻辑回归融合之外增加一路按熵可靠性分位数加权的逻辑回归并各取一半相加,在自建大规模集与 SdSV、CommonBench、TidyVoice 上均降低等错率与实际检测代价,但 ECAPA2 分组出现例外且注册样本为 1 时增益变小。
针对用户语音输入后用英语俳句语音回应的任务,HaikuS2S 采用自动语音识别加大型语言模型加语音合成的级联路线,配合通用诗歌与自录俳句两段微调,最强证据是俳句微调后音高对齐与可懂度改善,而代价是会话自然度评分下降与小规模录音带来的泛化限制。
针对复杂风格指令一次合成难以兼顾音高、语速与情感的问题,该工作用同一大音频语言模型做草稿生成加文本批评加二次精修,并以组相对策略优化训练精修能力,在 InstructTTSEval 上精修输出相对零样本平均风格一致性提升约 6.5% 至 7.2%,代价是两遍推理与奖励建模依赖。
针对 16 类非言语发声联合转写任务,该工作用跨数据集标签归一加平方根采样后接均匀微调,在官方评测得到 63.86 分排名第四,代价是第二阶段在本地验证集上从 66.25 分回落到 58.91 分且多数类别 F1 下降。
MECT 针对全监督说话人确认中卷积局部建模与 Transformer 全局建模难以兼顾的问题,把四种混合专家结构放进 Transformer 前馈位置,用帧级稠密 4 专家在 VoxCeleb 上取得 minDCF 0.012、0.026、0.048 的报告结果,代价是参数从 9.40M 增至 9.57M 并需因果重训才支持 100 ms 流式。
针对卢旺达语正字法省略声调与音节时长导致端到端合成语调难的问题,该工作用词素编码器加音素到词素交叉编码器替换 VITS 文本编码,在 10 千句可懂度与 21 人主观评测上提升自然度与语调,但以 169M 词素参数与训练时长增加为代价且对未见词素敏感。
针对解耦不彻底导致内容与韵律流残留说话人可链接性的问题,该文在冻结说话人编码器下用针孔损失微调内容编码器、韵律编码器与波形生成器,探测显示学习型韵律泄漏明显下降而词错误率与情感召回仅小幅波动。
该文把语料看作语音相似 utterance 图,先用零模型检验其聚类与模块度,再按社区分层加稀有音素播种做时长预算选择,在孟加拉语和英语 20% 预算下均显著降低合成可懂度误差,孟加拉语还以 4.5 倍更少训练时间超过全量训练。
论文针对巴西葡萄牙语合成语音口音稀释问题,用多语言音素识别加传统声学分析构建说话人级音系画像,仅在自然语音上拟合核密度估计即显示可分性,并在自建集与公开反欺骗集上验证了对大模型的增益与跨域泛化,但语音克隆场景下增益收窄且需要较多同说话人语句聚合。
针对音节级声调标注缺数据、句子级数据切分噪声大的问题,ToneCL 用保持声调的增强做对比预训练再用每调 1 到 10 个样本微调,在六说话人普通话 10-shot 达到 91.6%,跨语言预训练仍达 91.0%,代价是自然连续语音与声门特征仍未解决。
论文研究角间隔 ECAPA-TDNN 分类器原型在单位超球面上的集中与有效维度坍缩问题,用铰链式 Riesz 对数能量与参与率最大化两项直接作用于原型的正则改善覆盖,并在 Fast-VGAN 零样本换声上以 WER 从 6.54% 到 5.97%、相似度从 0.65 到 0.69、UTMOSv2 从 2.47 到 2.70 为证据显示鲁棒性提升,而说话人识别 …
XSQ-AST 用冻结的 SQ-AST 做多维度打分、用 WhisperX 做音素对齐、用显著性加核密度估计定位时间毛刺,40 人听音验证显示 Rollout 等方法与听众标注呈中等相关且 AUC 高于随机,但不同伪影类型最优方法不同且存在未评测边界。
针对固定深度对所有语音做同样多次精修的浪费,ADER 用共享 TS-Transformer 块循环精修并以深度控制器硬早停加每步单专家残差适配,在 VCTK-DEMAND 上以平均 2.15 次迭代达到 WB-PESQ 3.37,代价是相对固定 3 步共享块仍有约 2.6% 的感知质量下降。