边说话边做事:用前后台分离让语音中断不再取消任务
针对多轮语音任务中对话与执行时间尺度不一致的问题,论文用前台对话加后台委托的编排运行时分离两者,并在 134 例座舱基准上以混合路由实现 91.04% 任务成功率,代价是需要维护任务状态、投递调度和跨会话记忆等额外机制。
针对多轮语音任务中对话与执行时间尺度不一致的问题,论文用前台对话加后台委托的编排运行时分离两者,并在 134 例座舱基准上以混合路由实现 91.04% 任务成功率,代价是需要维护任务状态、投递调度和跨会话记忆等额外机制。
论文要解决长音视频生产力任务中感知与长程规划脱节的问题,选择原生多模态共训加百万上下文与按需取证的智能体执行,证据是多说话人识别与长视频推理的大幅提升,代价是通用转写翻译仍有差距且实时交互需非思考模式换取低延迟。
论文把短到长训练拆成呈现顺序、批次组成与损失归一化三件事来测,在 87M 语音词元模型上发现固定组批后排序本身不降困惑度,首轮分组的增益只出现在按批平均的损失下并随词元均衡归一化而消失,而持续排序反而更差。
针对大音频语言模型在字幕中提到输入中不存在声音事件的问题,REVE 复用目标模型已算出的编码器帧状态做两尺度验证,在 AudioSet 上开发集召回约束下删掉 92.9% 无据提及,只增加 3.38M 参数和 0.57 ms 完整验证延迟。
针对野外遮挡噪声下说话人易误判问题,ROAM-ASD 联合音频、全脸与嘴部三流并用联合自注意力加模态丢弃融合,在五个基准上取得 98.8%、87.9% 等 mAP,代价是需要人脸跟踪与嘴部关键点定位。
针对日语音形多对多导致正字法监督折叠词位读音的问题,论文把目标细化为 span 绑定的 ruby 序列并用 Qwen3-ASR 加 mora 级 CTC 联合训练,在五项基准上以加权 Kana CER 3.75% 改善读音直读而字形转写未退化,但自发语音与罕见词形仍是主要瓶颈。
针对戏剧配音中角色跨轮音色漂移、高潮台词演绎不足与长句分段节奏断裂三类场景级失效,SceneTTS-Bench 用统一输入协议与 SCS、UAR、RDR 三条自动诊断链在 160 场双语剧本上测出四套系统的互补短板,且场景级排序与句级可懂度排序明显背离。
SE-MSB 用扩散薛定谔桥在干净与退化语音分布之间学习双向随机输运,并以端到端 Mamba 波形模型实现,在去混响与混合退化上报告可比拟配对方法的效果,同时保持少步采样与低计算量。
SPADE 针对长语音中局部篡改的检测与定位问题,用大模型改写文本加合成与编辑两类生成器构建 12 语言数据,并在定位模型上报告跨生成器、跨语言、跨声学环境三类泛化证据,主要代价是未见生成器下接近随机猜测且噪声下显著退化。
针对串行先想后说导致长时间无声等待的问题,该工作用推理主路加轻量报幕支路的异步结构,在保持串行推理问答精度基本相当的同时,把用户可感知的静音大幅压低,代价是需要额外的报幕生成与动态调度。
针对业余歌声跑调抢拍又要保留歌词与本嗓风格的问题,论文用整流流做梅尔谱补全并以业余谱作上下文约束,最强证据是中英双测试集上音准与音色相似度同时领先,代价是英文内容错误率略升与发音清晰度偶发受损。
论文以 Qwen2-Audio 为案例分离词汇输出、转录不足的波形依赖行为与打包实现测量,显示 6 比特翻译选中分配在冻结重放上 chrF 提升但情绪识别下降,而反例与对照说明文本分不能替代波形使用证据。
该挑战用约 2100 小时 14 语言双人对话同时考 diarization 加识别与整场理解,基线显示长时说话人对齐与语义推理是主要瓶颈,而参赛系统靠域内 diarization 适配与音频依赖监督把误差与准确率推到新水平。
本文以酷儿群体为案例指出众包难以建立长期信任与性别多样覆盖,进而提出社区、项目制定、参与方式与个人自主权四阶段双向框架,其代价是协调成本上升且本文未做新的模型训练与定量验证。
针对转写链式思维在有监督微调中用参考转写做前缀而推理用自生成转写的不一致,论文用 GRPO 同时奖励自生成转写和以其为条件的翻译,在相同 CoVoST 2 训练样本下 CoT GRPO 在两套测试上 BLEU 领先并把 WER 相对降低 8.8% 和 7.2%,代价是需要多样本 rollout 和显式调 ASR 权重。
针对视频物体移除后原声残留导致视听不一致的问题,TV-AudioRemover 用已编辑视频加文字指令做选择性声移除,并用百万级单物体对齐数据、多任务与由易到难的两阶段混合训练支撑细粒度区分,其代价是对上游视觉编辑质量和纠缠声源仍有依赖。
论文用 908072 段 AIS 标注录音说明部署间先验差超 200 倍、随机窗口验证比未见站点验证高出配对 0.049 的 ROC-AUC,因而主张按站点分组验证并扩大独立空间采样,空间专家模型仍只是待验证假设。
该文用 120 文本×24 声音画像×10 风格的合成正交网格审计 10 个开源音频编码器与 2 个闭源语音问答系统,以主夹角泄漏解释探针差距并用正交残差对比适配器降低泄漏与差距,代价是需要合成感知属性假设与额外适配训练。
共分析 62 篇语音/AI 论文
针对病理性语音可懂度评估需要准确且可解释的问题,ART-NAD 用说话人无关声学到发音反演得到的九通道准声道收缩变量替代 NAD 的 wav2vec2 特征做多变量 DTW,在 20 个参考音频协议上平均说话人级 Pearson 相关与 NAD-FA 持平而可定位到具体收缩通道,代价是反演模型只在英语 EMA 上训练导致非英语连贯语音出现差距。