少资源语言先补数据质量:LELD 用混合转写把捷克语等三语 ASR 做上去
针对捷克语、爱沙尼亚语和希腊语自动语音识别性能落后问题,论文用统一预处理加三阶段混合转写构建每语 1500 小时转写语料,以独立 5 小时测试集上标准化词错误率降至 3.38%-5.54% 为证据,代价是高度依赖母语者校验与语言归一化且未公开可下载资源。
针对捷克语、爱沙尼亚语和希腊语自动语音识别性能落后问题,论文用统一预处理加三阶段混合转写构建每语 1500 小时转写语料,以独立 5 小时测试集上标准化词错误率降至 3.38%-5.54% 为证据,代价是高度依赖母语者校验与语言归一化且未公开可下载资源。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
论文以 129 万条英语 VoxTube 语音为共同源集,用嵌入变换、隐空间转换与负引导合成三族七种方法生成内容对齐的匿名语料,并以每版独立训练说话人验证模型与会话级链接实验,报告了强抑制压缩说话人空间而高效用版本残留可链接线索的权衡。
该文把约 1500 条房间脉冲响应的模态分解结果压缩成每频带阻尼与密度回归、等分能量幅度与明晰度恒等式,用六个感知控制生成数千个二阶共振器参数,阻尼鲁棒决定系数达 0.75 至 0.94 而两端频带密度仅约 0.5。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
针对第一视角视频中模型重视觉轻音频、声源对应差的问题,EgoAVU 用模块化解耦叙述增强与多模态上下文图生成联合叙述,再派生问答,报告显示微调后在 EgoAVU-Bench 上最高相对提升 113.3%,代价是依赖开源单模态模型输出噪声与大规模微调资源。
该文要解决现场表演中表达意图与听众感受难以对齐记录的问题,选择设计一套从练习曲到即兴的可重复多模态采集协议,用 16 场录音的阶段与表达性对照趋势验证流程可行,代价是商用低通道传感器保真度有限且样本存在西方与人口偏斜。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对拟音数据缺乏动作与材质细粒度标注的问题,论文用两层人工分类体系组织 10000 段拟音并给出可复现基线,最强证据是大类准确率 0.82 而 73 类降至 0.64,代价是长尾分布与单标注者带来的细类混淆。
针对 FSD50K 存在背景干扰、重叠与稀疏标注的问题,该工作用扩散模型生成干净单源样本再构造受控混合来训练 BEATs 加 Bi-LSTM 判别器,在专家整理的 BSE 集上报告 95.51% 准确率与 98.58% 精确率,并据此筛选出 32,880 条的 FSD50K-Solo,代价是未验证对未见类别的泛化。
针对立体声到 5.1 盲上混中环绕声缺乏可学习目标的问题,该工作用 CCD 加 ELAE 合成 PAEDB 主次对并训练 Mel-RoFormer 与 MLP 做氛围提取,最强证据是 VPA-Mel-RoFormer 主观总分 14.45 接近 VPA-ELAE 的 14.63,代价是客观重建分数偏低且训练目标受限于合成算法上限。
论文以持续一年的生成式广播 In Search of Good Ancestors 为案例,提出再活化框架把数据集制作、迭代再训练与长期聆听当作现场性所在,证据是四层异步系统与四轮工作坊加巩固期的可复述过程,代价是放弃低延迟 virtuosity 式控制与可重复定量评价。
针对音效数据集标签体系互不兼容导致无法合并与比较的问题,论文用通用类别系统做共享标签空间,以规则四级流水线加冲突消解完成重标注与分层划分,最强证据是三库自动映射率达 98.49% 至 100% 并建成 58057 条的 EnvSound-UCS,代价是混合训练并未超越单库训练且存在标注噪声与划分泄漏风险。
该研究用一路混合音频同时生成同处一室的双人 3D 表情、头姿、位移和眼球注视,以共享权重的双流扩散加跨说话人注意力解耦轮流,用两阶段数据策略兼顾交互与口型,并在用户研究中获得约 73 至 78% 的偏好,但推理依赖声纹分离出的说话概率与首帧空间条件。
论文以摆锤乐器 Chowndolo 为案例,用故意省略关键制作细节、保留结构与语境的 Obstruction Manual 把复刻变成主动学习,报告了从程序式手册到双层文档生态的迭代过程,但未做外部使用者验证,代价是初学者无法直接照做。
该文把预训练瓶颈定位为监督源弱而散,用高保真描述器加统一标签系重建强监督,并在同量音频上比较多种目标,显示数据质量与覆盖决定泛化而目标决定任务分化,但域内事件任务仍需更大规模验证。
论文把视频会议中的识别崩溃拆成传输失真与人类过度表达两条链路,用 MLD-VC 配对数据与声学分布证据定位到语音增强导致的第一二共振峰上移,并以跨平台微调平均降低 17.5% 字符错误率为收益验证该机制。
WildFX 针对 DAW 托管插件链缺乏成对音频与图标签的问题,用 REAPER 加容器化批量渲染生成带路由和参数标注的多轨数据,盲图估计实验显示浅层图比深层图更易估计但节点识别仍是主要失败模式,且受限于小规模插件库和短训练预算。
该文研究未见伪造方法下的泛化问题,选择先量化来源与生成器多样性的扩展规律再做异构数据混合,用 12k 小时 DOSS 加权训练在公开集和商用 API 集上超过 74k 小时基线,但大 Nc 与极端温度仍会退化且多语覆盖有限。