合不合语境比像不像情绪更难:CEAEval 如何评语音表达得体性
论文把问题定为普通话有声书语境下语音表达是否贴合叙事意图,提出规划器与评判器分离的 CEAEval-M,并报告在人工测试集上线性相关 0.72 与 70.80% 准确率,其代价是依赖人工标注语境与多阶段训练。
论文把问题定为普通话有声书语境下语音表达是否贴合叙事意图,提出规划器与评判器分离的 CEAEval-M,并报告在人工测试集上线性相关 0.72 与 70.80% 准确率,其代价是依赖人工标注语境与多阶段训练。
F-Actor 用冻结音频编码器加只微调语言模型的单阶段方案,在约 2000 小时数据上实现对音色、话题、打断与应答和起话方的指令跟随,最佳配置以词级文本对齐加 2 步音频延迟取得低困惑度和高起话准确率,但打断等稀有行为仍只能给出方向性控制且语音自然度未达真值。
FC-TTS 要解决用两段不同参考语音分别控制音色与风格的问题,它用音色先定模糊谱、风格再细化的方法组织生成,并在 RAVDESS 音色控制上报告保持可用质量,而代价是放弃部分内容与细节信息并引入中间瓶颈。
针对包含速度调性和弦的细粒度音乐检索,FIGMA 冻结 MuQ 与 E5 双编码器只训练投影头并联合全局与帧级对比损失,在 MusicBench 与 FMACaps-Eval 上报告最高 73.3% 相对提升,代价是依赖自动特征提取与单句客观描述的构造流程。
针对纯文本盈利预测依赖商业数据的问题,该研究构造 2688 场带逐词转录、全程音频和幻灯片的多模态基准并评测 26 个模型,最强证据是高准确率多为类别不平衡造成的假象而多模态增益有限,代价是长文本截断、采样幻灯片与类别严重偏斜。
针对片段级描述数据量大但无时间信息与帧级短语标注稀少难同训的问题,FineLAP 用全局与细粒度解耦音频适配器加片段与帧双流 Sigmoid 损失同训,在 AudioCaps 检索 R@1 取得 45.7 与 62.5 并在四组声音事件检测上领先,代价是固定 10 秒输入与合成数据分布偏差仍待验证。
针对共情语音指令数据稀缺与微调大模型易遗忘问题,论文用冻结大模型加语义适配器与情绪抽取器的解耦编码与三阶段对齐,仅用现有语音指令与情绪识别数据实现共情理解与富有表现力语音生成,在共情对话与情绪识别等任务上报告更强结果,但情绪标签随机指派与韵律监督仍有边界。
该文把语音智能体的文化能力重新定义为事件限定的交互能力,用语音事件与交互契约约束韵律时机与参与管理,并以附录的事件卡与最小对诊断补足词错率与平均意见分测不到的得体性,代价是增加人工判断与规范界定负担且不提供新数据集验证。
论文把语音质量评估从跨库不可比的平均意见分回归改为库内偏好比较,用 55333 对训练偏好的 MOS-Pref 统一训练三类奖励模型,最强标量模型整体准确率达 80.04%,而 MOS 感知的生成式奖励模型在小分差上进一步提升,代价是生成式路径仍弱于标量排序且依赖偏好标注质量。
针对全双工语音智能体多轮一致性缺乏可复现评测的问题,该文用合成语音自动考官加分阶段语义目标与快慢两种节奏做流式多轮交互,并以轮换流畅度、多轮指令遵循和任务专属三维打分报告了三系统随时间下滑且修正与实体跟踪最难的证据,代价是仅覆盖英语四类任务并依赖转写加模型打分。
针对音频语言模型提示调优在基类上过拟合、新类上掉点的问题,论文提出用大模型生成语义邻居并以带间隔的拉近推远损失约束文本空间,在 11 个数据集平均上把 CoOp 新类准确率从 34.09% 提升到 42.98%,代价是训练时每个类要多编码 10 个邻居文本。
针对语音、环境声、音乐三域音频幻觉缺少大规模可诊断评测的问题,HalluAudio 用 5720 对人工校验问答与对抗诱发设计做零样本评测,报告显示结构与感知幻觉普遍存在而准确率无法代替可靠性判断。
论文在 Archi 与 Kina Rutul 两种东高加索濒危语言上整理约 45 分钟与 75 分钟训练语音并统一为 IPA 转写,对比 CTC 专用模型与 Whisper 及音频大语言模型,发现音素 F1 随对数训练频次呈 S 形增长,而面向语音的专用结构加语言相关词表与平均初始化在可运行条件下取得更低错误率,但稀有复合音素仍近乎无法识别。
针对病理语音下神经音频编解码重合成伪造难以检出的问题,论文构建配对的中英多病症基准并提出保留多证据、在双曲空间用多原型建模伪造模式的 PHOENIX-Mamba,其 PaSST 版本在英抑郁等任务上达到 97.04 准确率并把等错率降到约 5 左右,代价是依赖预训练表示与受控重合成协议而未覆盖真实信道与 TTS 等攻击。
论文提出只用声纹推断八类隐私属性的 HearSay 基准,用 22,064 段真实音频证明模型在性别上平均达到 92.89% 准确率且几乎不拒绝,而思维链推理在强模型上进一步放大泄露,轻量提示防御难以根治生理属性泄露。
论文把全双工语音模型的知识退化归因于深层语义与声学梯度冲突,用共享浅层加并行深层头与语义对齐通道来分离优化,主证据是口语问答平均提升 7.4% 与 FullDuplexBench 1.5 提升 28.5%,代价是约 10B 参数与专用三通道训练数据依赖。
针对无界语音同传中合成读-写轨迹不准的问题,该工作用分层策略优化在质量达标后才优化延迟,在 1.5 秒延迟附近报告超过 +7 COMET 和 +1.25 MetricX 的提升,但 BLEU 与独立评测显示神经奖励仍有投机风险。
针对每秒仅 25 个 token 重建 24 kHz 波形时语义丢失与高频失真问题,论文用条件流匹配迭代生成波形并以分层表示对齐与稠密单层量化组织语义和声学信息,最强证据是 8 层 RVQ 对照与频带误差表显示的语义保持与高频改善,代价是四步 ODE 采样与大规模 Transformer 解码器的推理开销。
针对录音室训练的专用检测器在野外自发语音上泛化崩塌的问题,论文提出免训练的比较引导上下文学习框架,用成对证据生成与对账过滤幻觉,并用分布外路由把难样本交给音频语言模型,在三个野外数据集上报告了高于基线的宏平均 F1,但以录音室数据性能下降和依赖闭源模型生成证据为代价。
该文把群体差异拆成嵌入偏置与嵌入方差,用单群体训练的线性音素探针检验偏置、用同音素近邻距离检验方差,发现方差与识别错误稳定相关而同域训练收益有限,且领域增强对抗微调未改变两项几何指标。