论文解读

倾听与报警并行:校园双语语音对话如何在共情流程中嵌入高风险检测

该工作针对校园咨询资源不足与高风险漏检问题,用主动倾听对话流程加提示驱动的四级风险分类与双语语音链路组织系统,并以 400 小时语音与 40 例模拟加 15 人实测日志支撑分析,代价是未报告检测精度、延迟与误报成本。

 · 更新于 2026-09-24 · 约 17 分钟 · 8409 字 阅读 →
论文解读

词与笑声同序列解码:面向双语非言语声的源自适应数据整理

针对中英双语带标签转写任务,论文用词汇重映射让 Whisper-medium 统一生成词与 16 类非言语声标签,并用公开语料增强过滤加影视挖掘把最终分从 33.32 提到 53.61,代价是英文纯文本词错率上升且细粒度类别仍偏弱。

 · 更新于 2026-09-24 · 约 17 分钟 · 8423 字 阅读 →
论文解读

把谱面与演奏对齐成文本:MuNo-SP 如何让模型听见弹了什么与怎么弹

针对音频语言模型只靠粗粒度标题难以刻画力度、 timing 与声部进行的问题,该研究用对齐后的谱面加演奏 MIDI 构造文本表示 MuNo-SP 并自动生成长时间听觉分析与问答,在 MuSP-Bench 联合理解与人工偏好上报告了高于 ABC 与 MIDI 文本基线的准确率,代价是表示更长且仍限于古典钢琴与 MIDI 可表达的属性。

 · 更新于 2026-09-24 · 约 21 分钟 · 10070 字 阅读 →
论文解读

临床抑郁评估:行为信号能判病,大模型推理为何还差一截

论文用 169 人临床确诊的多任务多模态数据比较任务与模态的判别力,并测试大模型精神科推理,报告音频与视频最有效、图片描述最能诱发标记、知识引导可提升约 10 个百分点 Macro-F1,但文本大模型仍落后于监督判别模型。

 · 更新于 2026-09-24 · 约 17 分钟 · 8236 字 阅读 →
论文解读

越南语识别缺的不是模型,而是可复用的清洗与对齐流水线

该文针对越南语开源语音文本对质量杂、格式不一、缺词级时间戳的问题,提出七步聚合清洗与对齐流水线,用约 502.67 小时高质量数据把微调后模型正字法词错误率降到 12.46%,代价是严格过滤丢掉约 38% 采样数据且仍偏向北部口音。

 · 更新于 2026-09-24 · 约 19 分钟 · 9235 字 阅读 →
论文解读

预告片里画面与配乐为何总能卡点:VMChill 把细粒度视听协同做成可训练数据

针对视频语言数据只写画面而把音乐当弱关联的问题,VMChill 以预告片为源做场景切分与视听分路标注,并在视频理解、视频生成与音乐生成上报告可复述的对照结果,其代价是自动合并标注仍需人工修正且分布偏向影视娱乐类预告片。

 · 更新于 2026-09-24 · 约 19 分钟 · 9028 字 阅读 →
论文解读

用投票与多维标注把粤语长音频做成可训练语料

针对粤语标注少且口语现象复杂的问题,该工作用多系统投票与质量标注流水线构建 21800 小时语料,并在多测试集上验证微调后的识别与合成模型达到可比最优水平,但强标签与高音质子集的选择本身带来覆盖偏差代价。

 · 更新于 2026-09-24 · 约 18 分钟 · 8914 字 阅读 →
论文解读

从纠缠录音到可控双轨:分离、重建与扩展如何分工保留对话时序

针对全双工对话需要保留轮转、重叠与反馈时序但真实录音纠缠不清的问题,ConversationalVoice 用质量校验的分离、词面固定的重建与上下文约束的扩展三阶段产出共享格式的双轨数据,并在自动评估中保持 0.983 至 0.991 的同说话人相似度与正向区分度,同时以重建提升预测音质而扩展维持相近交互密度。

 · 更新于 2026-09-24 · 约 21 分钟 · 10184 字 阅读 →
论文解读

打断时模型以为说了什么与用户实际听到什么不一致:用已播放语音回灌来锚定进度

论文把全双工中的打断恢复问题定义为锚定中断,提出把已播放的模型语音回灌到语音输入通路的三通道自监听架构,并在同源构造的 AnchorSpeech 上用播放边界判定正确性,报告三通道模型达到 73.0% 锚定准确率且停止与响应延迟基本不变,同时在通用全双工指标上出现轮次管理与锚定的权衡。

 · 更新于 2026-09-24 · 约 24 分钟 · 11696 字 阅读 →
论文解读

混语口述史里英文指标最好的一档,为何恰恰丢掉了非英语片段

该研究把 Whisper 用于含英语、粤语、台山话与毛利语的口述史转写,以人工转写的 9 分 33 秒片段为参照比较不同尺寸与语言指定条件,最好的语言未指定 LARGE-V3 词错误率为 12.10,但代价是对非英语片段的转写与区分能力不足,而全库 12 小时 42 分钟机转仅用 5 小时,约为估计人工时间的 1%。

 · 更新于 2026-09-24 · 约 14 分钟 · 6766 字 阅读 →
论文解读

Persian MusicGen: A Large-Scale Dataset and Culturally-Aware Generative Model for Persian Music

音乐生成 | 6.7/10

 · 更新于 2026-09-24 · 约 14 分钟 · 6651 字 阅读 →