先看听者再说话:用回应前一秒表情规划下一句怎么说
针对对话语音只看文本历史会漏掉听者即时非言语线索的问题,用回应前 1 秒听者人脸时序做显式回应规划,在严格双人 MELD 协议上时序模型宏平均 F1 和 VAD 一致性略高于纯文本而准确率基本不变,合成阶段仅证明可端到端连通而未改善可懂度。
针对对话语音只看文本历史会漏掉听者即时非言语线索的问题,用回应前 1 秒听者人脸时序做显式回应规划,在严格双人 MELD 协议上时序模型宏平均 F1 和 VAD 一致性略高于纯文本而准确率基本不变,合成阶段仅证明可端到端连通而未改善可懂度。
针对 27 人、每人不足半小时数据的封闭 50 句表面肌电解码任务,论文用已发布单被试检查点初始化、多被试预训练再加目标被试微调达到 21.7% 字符错误率和 31.9% 词错误率,而 3 分钟校准与约 13 分钟全量校准无显著差异,但评估句一旦从所有训练数据中移除则退化到 78.6% 字符错误率。
论文把多模态交互中的用户需求理解定义为先判存在再补全意图的上下文推理任务,用 2078 个合成与真人实录场景和五维指标测 14 个原生模型,最强系统在需上下文的关键信息上仅恢复 44.7% 且误触发普遍超过 50%,而给定标准需求标注能显著改善下游回复。
针对原生音视频直接对话缺数据、难评测的问题,该工作用多智能体合成对话同时做评测集与强化训练语料,报告在合成集从 0.465 到 0.652、在真人实拍集从 0.402 到 0.632 的提升,代价是回复变短且效率与风格奖励之间存在权衡。
针对漫射噪声下单目标实时提取问题,论文用最大加权似然把 NSR-ILRMA 与 RCSCME 改写为逐帧在线更新,并在静止与移动说话人仿真及真实录音中对比在线与分块批处理路线,其代价是每帧仍需矩阵求逆加速与稳定性控制且处理时间接近移位长度。
该研究在相同骨干与训练流程下比较按病因拆分与混合病因的严重度分类,报告脑瘫、帕金森、肌萎缩侧索硬化三个方向上按病因模型全面领先混合基线,代价是需要病因路由、单次训练与以英语为主的评测局限。
该文用 1000 组英文转写偏好标注比较词错率、字错率与多配置语义指标,发现词错率与人判断一致度最低而最优语义距离略优但未显著超过字错率,因此主张默认报告字错率并辅以语义指标。
论文把音乐语义定义为可测的检索任务能力,用冻结语义单码本加声学残差量化双流在混合信号上重建,报告显示完整配置在内容保持与重建上占优而纯声学配置虽重建略高却显著更难建模。
论文研究给定话题标题查询在语音转写中预测连续句子区间的问题,用冻结语音识别编码器状态做句子级声学表示并与文本嵌入融合,在两个主数据集上以轻量定位器验证严格边界指标的提升,同时报告自发会议上增益有限的代价。
Samsone 针对端侧音频问答,用 Whisper-Tiny 编码器加 SmolLM2 解码器与非线性映射器做单阶段训练,在 MMAU 与 MMAU-Pro 上超过同级小模型并接近部分大模型,代价是通用语言能力下降且未做移动端硬件级优化。
针对长语音强制对齐的二次方内存与时间瓶颈,论文用分治原地计算的赫希伯格维特比算法保证结果不变,再用随机游走先验加转写精度界做剪枝,三小时音频在单核中央处理器上以兆字节级内存完成对齐,剪枝后进一步提速但依赖精度假设。
针对赛车高层行为指令的离线语音控制问题,Jarvis 用唤醒词加本地转写加微调 Mistral 7B 做文本到指令分类,在 17 类 1645 样本条件下报告 97.63% 准确率与 1.39 s 平均延迟,但数据集仍部分合成且指令空间严格预定义。
论文以波兰语为重心研究数字归一化对词错误率的影响,方法是统一把逐字数字转成阿拉伯数字再评测,最强证据是议会数据上逐字与数字文本间差异大于 2% 并可归零,主要代价是归一器覆盖不全且会改变分母权重。
该研究针对可公开复现的大规模音乐与文本配对缺失问题,选择以互联网档案馆中声明为知识共享许可的音频为源、轻量音频语言模型初标加分类标签与档案元数据聚合精修为方法,最强证据是 1500 段抽样下与 JamendoMaxCaps 相当的参考无关分数与正确性完整性约 4.2 分以上的人评,主要代价是长时体裁欠采样与语言流畅性仍落后于人工标注。
该研究把朗读维基百科的语音按小节配上大模型规划加规则渲染的合成幻灯片,在英德荷三语上只用音频测出最佳平均微观词错率 10.23% 与字错率 6.48%,而全量幻灯片文本或图片的零样本提示因大段复制与插入错误而失效。
论文用线性硬弦偏微分方程加三角拨弦初值约束多层感知机做正演,在第一振动周期内与有限差分和断线实验做对照,随机傅里叶特征尺度越大高频细节越好,但评估只限首周期且存在幅值偏差。
该文把合成语音归属从闭集分类改写为音频对自然语言描述的跨模态检索,用冻结双编码器加小投影头在 MLAAD v9 上实现未见模型 58.4% 模型级 MRR,代价是闭集精度低于专用分类器且通用架构易混淆。
Voice-Light 研究全双工级联语音交互中的轮次判断与重叠处理,用共享流式识别编码器的因果适配器加可逆混合控制器与私有推测生成,在 1673 个静音候选的锁定测试中学习策略仅获 12.53% 召回而保留混合控制器,在 36 轮真机麦克风案例中取得 758 毫秒中位响应但以 800 毫秒超时兜底。
共分析 26 篇语音/AI 论文
AVTrace 把音画时间能力拆成七类可复算的定位与排序任务,用固定测试集显示现有全模态模型语义描述尚可但时间定位与同步判断偏弱,而针对 Gemma4-E4B 的时间后训练能在部分指标上提升但伴随外部任务的涨跌。