论文解读

先学发音再学音色:用合成语音开路、真人语音纠偏的低资源适配

针对缅甸语和老挝语缺少人工标注配对数据的问题,该研究先用固定音色合成语音建立文本到语音的对应,再用真人录音加双识别器一致性加权恢复目标音色控制,证据显示内容准确率得到保持而相似度被拉回,但逆序训练仍在发音准确率上占优且一致性只是不可靠程度的代理指标。

 · 约 18 分钟 · 8807 字 阅读 →
论文解读

按病因分开训练为何胜过混合训练:多语种构音障碍严重度的对照实验

该研究在相同骨干与训练流程下比较按病因拆分与混合病因的严重度分类,报告脑瘫、帕金森、肌萎缩侧索硬化三个方向上按病因模型全面领先混合基线,代价是需要病因路由、单次训练与以英语为主的评测局限。

 · 更新于 2026-09-24 · 约 20 分钟 · 9859 字 阅读 →
论文解读

不等电话挂断:只用通话级标签从原始语音做增量诈骗打分

论文把电话诈骗检测写成弱监督增量打分问题,用冻结语音编码器加有界窗口循环建模与聚合器实现每 2 秒更新,在受控英文合成基准上报告终局 ROC-AUC 约 0.9953,而消融显示循环上下文是主要贡献且全局模型终局数值更强。

 · 更新于 2026-09-24 · 约 18 分钟 · 8637 字 阅读 →
每日研究速递

chime-2026 论文深度解读

共收录 14 篇 chime-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 30 分钟 · 14943 字 阅读 →
论文解读

先消近讲串扰再做视听提取:用增强近讲语音做伪标签弥合仿真与真实鸡尾酒会差距

针对多人多会话同时进行的真实鸡尾酒会转写与会话聚类问题,论文采用先用 CTRnet 消除近讲串扰再用其输出做伪标签微调 AV-TFGridNet 视听目标说话人提取的两阶段路线,在开发集上用 AV-HuBERT 转写达到 33.78% 联合错误率,代价是仍依赖说话人活动时间戳弱监督与未做提取后 ASR 适配时约 48% 说话人词错误率。

 · 更新于 2026-09-24 · 约 18 分钟 · 8626 字 阅读 →
论文解读

没有文字转写时,如何用图像字幕把语音和书面词连起来

该文用图像字幕先建视觉词表再过滤语音,用无监督词发现做两两对齐与堆叠评分定位关键词,在视觉监督下超过神经基线,但共现词与字幕噪声仍带来明显定位损失与计算代价。

 · 更新于 2026-09-24 · 约 19 分钟 · 9158 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

只给整段真假标签,如何找回伪造片段的起止时间

问题是弱监督时间伪造定位中训练只做整段二分类而推理要输出边界,方法选择两阶段分类回归加隐属性分解与时序图精炼,最强证据是在两个基准上平均 mAP 分别提升约 8% 和 4%,代价是定位阶段引入约 45M 回归参数与伪标签噪声管理。

 · 更新于 2026-09-24 · 约 20 分钟 · 9981 字 阅读 →
论文解读

只给整段录音一句话标签,如何同时学会判断与定位鲸叫

针对 2-30 分钟长录音只给整段有无鲸叫标签的问题,论文用双流多示例学习以注意力权重同时做包分类与实例定位,在 300-1800 秒上报告 F1 为 0.88-0.91 而强监督 CNN 基线降至 0.19-0.64,代价是长包下定位精度因注意力稀释而下降。

 · 更新于 2026-09-24 · 约 17 分钟 · 8201 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
论文解读

只给视频级标签,如何把可靠时刻的语义铺满整条时间线

针对只有视频级标签的稠密音视事件定位,CLASP 用双模态预测一致性找出显著锚点再向全时序传播语义,在 UnAV-100 与 ActivityNet1.3 上取得弱监督最优,但与全监督约 50% 平均精度仍有明显差距且更依赖锚点超参数。

 · 更新于 2026-09-24 · 约 17 分钟 · 8118 字 阅读 →
论文解读

松标注学出松边界:因果一致性伪标签为何收得过紧

针对松标注训练导致边界过松、而因果-反因果伪标签又收得过紧并增加漏检的问题,论文用保边界去停顿填充、预热上下文和非因果感知协同训练来缓解,并在 AMI 与 AliMeeting 上把与理想紧标签上限的 DER 差距缩小约四到六成,代价是虚警与漏检之间仍需权衡。

 · 更新于 2026-09-24 · 约 19 分钟 · 9379 字 阅读 →
论文解读

浅正字法不等于无重音:用弱监督让 ByT5 在句子级学会菲律宾语重音

针对菲律宾语重音需靠句子上下文消歧但句子级音素标注稀缺的问题,该研究用 Wiktionary 词典加 LLM 辅助管线合成句子级弱监督数据微调 CharsiuG2P 初始化的 ByT5,在 1173 句人工校对集上把音素错误率从约 19.74% 降到约 0.54%、字符错误率降到约 2.50%,代价是 malumi 类与非标准词仍易错且大合成集增益主要体现在 …

 · 更新于 2026-09-24 · 约 16 分钟 · 7843 字 阅读 →
论文解读

EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing

音频事件检测 | 5.8/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9380 字 阅读 →
论文解读

DBFT-SD: Weakly Supervised Multimodal Detection of Sensitive Audio-Visual Content

音频事件检测 | 8.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 4008 字 阅读 →
论文解读

Deepaq: A Perceptual Audio Quality Metric Based on Foundational Models and Weakly Supervised Learning

音频质量评估 | 7.5/10

 · 更新于 2026-09-24 · 约 10 分钟 · 4761 字 阅读 →
论文解读

Is Phase Really Needed for Weakly-Supervised Dereverberation?

语音增强 | 6.0/10

 · 更新于 2026-09-24 · 约 8 分钟 · 3528 字 阅读 →
论文解读

Look, Listen and Segment: Towards Weakly Supervised Audio-Visual Semantic Segmentation

音视频 | 7.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4187 字 阅读 →
论文解读

Subsequence SDTW: Differentiable Alignment with Flexible Boundary Conditions

音乐信息检索 | 8.0/10

 · 更新于 2026-09-24 · 约 9 分钟 · 4127 字 阅读 →