倾听与报警并行:校园双语语音对话如何在共情流程中嵌入高风险检测
该工作针对校园咨询资源不足与高风险漏检问题,用主动倾听对话流程加提示驱动的四级风险分类与双语语音链路组织系统,并以 400 小时语音与 40 例模拟加 15 人实测日志支撑分析,代价是未报告检测精度、延迟与误报成本。
该工作针对校园咨询资源不足与高风险漏检问题,用主动倾听对话流程加提示驱动的四级风险分类与双语语音链路组织系统,并以 400 小时语音与 40 例模拟加 15 人实测日志支撑分析,代价是未报告检测精度、延迟与误报成本。
针对中英双语带标签转写任务,论文用词汇重映射让 Whisper-medium 统一生成词与 16 类非言语声标签,并用公开语料增强过滤加影视挖掘把最终分从 33.32 提到 53.61,代价是英文纯文本词错率上升且细粒度类别仍偏弱。
针对音频语言模型只靠粗粒度标题难以刻画力度、 timing 与声部进行的问题,该研究用对齐后的谱面加演奏 MIDI 构造文本表示 MuNo-SP 并自动生成长时间听觉分析与问答,在 MuSP-Bench 联合理解与人工偏好上报告了高于 ABC 与 MIDI 文本基线的准确率,代价是表示更长且仍限于古典钢琴与 MIDI 可表达的属性。
论文用 169 人临床确诊的多任务多模态数据比较任务与模态的判别力,并测试大模型精神科推理,报告音频与视频最有效、图片描述最能诱发标记、知识引导可提升约 10 个百分点 Macro-F1,但文本大模型仍落后于监督判别模型。
该文针对越南语开源语音文本对质量杂、格式不一、缺词级时间戳的问题,提出七步聚合清洗与对齐流水线,用约 502.67 小时高质量数据把微调后模型正字法词错误率降到 12.46%,代价是严格过滤丢掉约 38% 采样数据且仍偏向北部口音。
针对视频语言数据只写画面而把音乐当弱关联的问题,VMChill 以预告片为源做场景切分与视听分路标注,并在视频理解、视频生成与音乐生成上报告可复述的对照结果,其代价是自动合并标注仍需人工修正且分布偏向影视娱乐类预告片。
针对粤语标注少且口语现象复杂的问题,该工作用多系统投票与质量标注流水线构建 21800 小时语料,并在多测试集上验证微调后的识别与合成模型达到可比最优水平,但强标签与高音质子集的选择本身带来覆盖偏差代价。
针对全双工对话需要保留轮转、重叠与反馈时序但真实录音纠缠不清的问题,ConversationalVoice 用质量校验的分离、词面固定的重建与上下文约束的扩展三阶段产出共享格式的双轨数据,并在自动评估中保持 0.983 至 0.991 的同说话人相似度与正向区分度,同时以重建提升预测音质而扩展维持相近交互密度。
论文把全双工中的打断恢复问题定义为锚定中断,提出把已播放的模型语音回灌到语音输入通路的三通道自监听架构,并在同源构造的 AnchorSpeech 上用播放边界判定正确性,报告三通道模型达到 73.0% 锚定准确率且停止与响应延迟基本不变,同时在通用全双工指标上出现轮次管理与锚定的权衡。
该研究把 Whisper 用于含英语、粤语、台山话与毛利语的口述史转写,以人工转写的 9 分 33 秒片段为参照比较不同尺寸与语言指定条件,最好的语言未指定 LARGE-V3 词错误率为 12.10,但代价是对非英语片段的转写与区分能力不足,而全库 12 小时 42 分钟机转仅用 5 小时,约为估计人工时间的 1%。
音乐生成 | 6.7/10