先学发音再学音色:用合成语音开路、真人语音纠偏的低资源适配
针对缅甸语和老挝语缺少人工标注配对数据的问题,该研究先用固定音色合成语音建立文本到语音的对应,再用真人录音加双识别器一致性加权恢复目标音色控制,证据显示内容准确率得到保持而相似度被拉回,但逆序训练仍在发音准确率上占优且一致性只是不可靠程度的代理指标。
针对缅甸语和老挝语缺少人工标注配对数据的问题,该研究先用固定音色合成语音建立文本到语音的对应,再用真人录音加双识别器一致性加权恢复目标音色控制,证据显示内容准确率得到保持而相似度被拉回,但逆序训练仍在发音准确率上占优且一致性只是不可靠程度的代理指标。
该研究在相同骨干与训练流程下比较按病因拆分与混合病因的严重度分类,报告脑瘫、帕金森、肌萎缩侧索硬化三个方向上按病因模型全面领先混合基线,代价是需要病因路由、单次训练与以英语为主的评测局限。
论文把电话诈骗检测写成弱监督增量打分问题,用冻结语音编码器加有界窗口循环建模与聚合器实现每 2 秒更新,在受控英文合成基准上报告终局 ROC-AUC 约 0.9953,而消融显示循环上下文是主要贡献且全局模型终局数值更强。
共收录 14 篇 chime-2026 会议论文的 Reader 深度解读
针对多人多会话同时进行的真实鸡尾酒会转写与会话聚类问题,论文采用先用 CTRnet 消除近讲串扰再用其输出做伪标签微调 AV-TFGridNet 视听目标说话人提取的两阶段路线,在开发集上用 AV-HuBERT 转写达到 33.78% 联合错误率,代价是仍依赖说话人活动时间戳弱监督与未做提取后 ASR 适配时约 48% 说话人词错误率。
该文用图像字幕先建视觉词表再过滤语音,用无监督词发现做两两对齐与堆叠评分定位关键词,在视觉监督下超过神经基线,但共现词与字幕噪声仍带来明显定位损失与计算代价。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
问题是弱监督时间伪造定位中训练只做整段二分类而推理要输出边界,方法选择两阶段分类回归加隐属性分解与时序图精炼,最强证据是在两个基准上平均 mAP 分别提升约 8% 和 4%,代价是定位阶段引入约 45M 回归参数与伪标签噪声管理。
针对 2-30 分钟长录音只给整段有无鲸叫标签的问题,论文用双流多示例学习以注意力权重同时做包分类与实例定位,在 300-1800 秒上报告 F1 为 0.88-0.91 而强监督 CNN 基线降至 0.19-0.64,代价是长包下定位精度因注意力稀释而下降。
共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读
针对只有视频级标签的稠密音视事件定位,CLASP 用双模态预测一致性找出显著锚点再向全时序传播语义,在 UnAV-100 与 ActivityNet1.3 上取得弱监督最优,但与全监督约 50% 平均精度仍有明显差距且更依赖锚点超参数。
针对松标注训练导致边界过松、而因果-反因果伪标签又收得过紧并增加漏检的问题,论文用保边界去停顿填充、预热上下文和非因果感知协同训练来缓解,并在 AMI 与 AliMeeting 上把与理想紧标签上限的 DER 差距缩小约四到六成,代价是虚警与漏检之间仍需权衡。
针对菲律宾语重音需靠句子上下文消歧但句子级音素标注稀缺的问题,该研究用 Wiktionary 词典加 LLM 辅助管线合成句子级弱监督数据微调 CharsiuG2P 初始化的 ByT5,在 1173 句人工校对集上把音素错误率从约 19.74% 降到约 0.54%、字符错误率降到约 2.50%,代价是 malumi 类与非标准词仍易错且大合成集增益主要体现在 …
音频事件检测 | 5.8/10
音频事件检测 | 8.0/10
音频质量评估 | 7.5/10
语音增强 | 6.0/10
音视频 | 7.0/10
音乐信息检索 | 8.0/10