论文解读
发音纠错不能只给分数:让音频语言模型说出错在哪、怎么练
论文研究朗读式聊天发音训练,用 L2-Arctic-plus 提供词级错误解释与可操作建议,通过两阶段指令微调音频语言模型,在误读检测与建议生成上超过级联 ASR 加 LLM 和现有开源模型,代价是依赖合成标注与朗读场景。
论文研究朗读式聊天发音训练,用 L2-Arctic-plus 提供词级错误解释与可操作建议,通过两阶段指令微调音频语言模型,在误读检测与建议生成上超过级联 ASR 加 LLM 和现有开源模型,代价是依赖合成标注与朗读场景。
针对噪声混响多人交叠耦合且需求因人而异的问题,StrixAE 用多模态大模型做控制器调度专家工具链,经 AcoustBench 思维链微调与音频感知强化学习后,在真实盲测多项感知指标上超过多数开源基线,但感知质量优化仍慢且依赖外部工具。
语音合成 | 7.0/10
语音交互 | 10.0/10
音频生成 | 7.1/10
音频生成 | 7.2/10
语音翻译 | 6.4/10
音视频问答 | 8/10
音频修复 | 8/10
语音交互 | 6.7/10
音乐情感识别 | 4.9/10
数据增强 | 8.2/10
多模态模型 | 6.4/10
语音情感识别 | 8.7/10
语音质量评估 | 7.5/10
语音生物标志物 | 6.5/10
音乐理解 | 7.5/10
语音合成评估 | 7.0/10
语音质量评估 | 7.5/10