声音没有空间位置时,如何让三维人脸知道嘴该动哪里
针对语音特征缺少显式人脸空间结构导致口唇与表情不准的问题,该文用音频预测的 68 点地标做局部空间增强与全局补偿来修正三维高斯属性偏移,并在自驱动与跨驱动条件下验证同步与重建,同时以阈值与几何正则的取舍为代价。
针对语音特征缺少显式人脸空间结构导致口唇与表情不准的问题,该文用音频预测的 68 点地标做局部空间增强与全局补偿来修正三维高斯属性偏移,并在自驱动与跨驱动条件下验证同步与重建,同时以阈值与几何正则的取舍为代价。
针对不规则麦克风阵列难以得到可用 FOA 的问题,该文用常规编码加信号相关残差构成四通道接口,并用理论 FOA 教师做帧级置换不变蒸馏来优化事件与定位信息,代价是信号级重建误差反而变大。
在 3100 段 31 类无人机音频上,论文系统比较卷积与 Transformer 架构加全量微调与四种参数高效微调,最强证据是 EfficientNet-B7 批归一化微调加三倍增强取得最高验证精度且只训练极小比例参数,而轻量卷积在精度与训练效率上普遍优于 Transformer。
该研究用 9 支葫芦丝的 81 个平均音和 7 个心理声学特征训练自组织映射,报告只有频谱质心、锐度和分形关联维能形成音高聚类,其中高音 fa、sol、la 混沌度最低且亮度反直觉偏低,代价是低音区无稳定聚类且录音未公开。
针对被动视觉缺失与误导导致的音频视觉导航失败,论文用高层 Transformer 令牌融合选 3×3 局部目标、低层碰撞惩罚图规划转原子动作,在 Replica 与 MP3D 的听过与未听过电话声划分上报告了路径效率与成功率提升,但碰撞图依赖静态假设且仍受深度噪声与仿真条件限制。
针对文本到音乐系统条件格式与访问方式不同难以直接比较的问题,TTM-Bench 用共享音乐规格加系统适配表达分别度量音乐内容对齐与计算效率,案例研究显示内容对齐更高并不系统性对应更低的计算需求。
针对只检内容而忽略说话人的不足,论文用文本查内容加参考语音定说话人的混合查询,构建 VoiceTrace-Bench 并训练统一音频语言模型的两阶段检索重排框架,在语义基准和混合基准上报告了可复现的召回与排序提升,但重排带来额外推理开销且多说话人仍明显更难。
共分析 29 篇语音/AI 论文
针对从已知声源镜像源点云插值新声源点云的问题,该文用物理位移等于镜像位移的不变性构造最优传输地面代价并求重心,交替估计关联与位置,在 3×4 米二维二阶反射仿真和 400 次蒙特卡洛下 One-PC 初始化最优,但近墙密集混叠与大扰动下误差放大且无实测验证。
论文把在干净视频会议数据上训练的预测性轮次模型放到高重叠鸡尾酒会数据上检验,发现多模态加权 F1 从干净域掉到新域约三分之一,微调能提升多模态约三成但伴随原域遗忘,而纯音频分支几乎无法适应。
针对大音频语言模型时间定位不准的问题,论文冻结大模型只取查询语义表示并外挂帧级定位模型,在多个接地基准上提高严格阈下召回与平均交并比,并在推理阶段把定位结果作为外部时间证据回填给大模型。
BioDCASE 用固定 PerchV2 嵌入和两层分类头比较了 14 种批量主动采样策略,最强方法以四子集平均学习曲线下面积 0.507 超过随机采样的 0.401,但增益在 HSN 高达 67.1% 而在 ATBFL 仅 8.0%,且更小批量带来两倍计算代价。
针对对话历史决定说话方式的 CoT-TTS 任务,论文用三阶段清洗续训、545K 合成蒸馏与级联过滤的 CA-DPO 对齐官方基线,并在 500 样本中英测试上报告全面超越,但偏好判断依赖大模型打分且未验证延迟与成本。
针对 5 分钟以上医患对话直接生成 SOAP 病历的问题,论文用统一端到端架构比较 3B 轻量与 30B 重量模型,报告四阶段训练把 Concept F1 从零样本的 0.26 和 0.18 分别推到 0.4082 和 0.5167,并以级联基线为对照说明直接优化的收益与容量代价。
该工作从社区采样标注中挖掘出 9.2 万条标注并揭示按边随机切分会使 54% 测试音轨泄漏,提出基于连通分量切分并修剪巨型分量得到 11.4 万/0.6 万/1 万音轨的 WhoSampled130k,代价是丢弃 23% 节点并保留有界泄漏风险。
针对非侵入式 MOS 预测中语音基础模型层利用不稳定的问题,论文在 10 个骨干与 4 个数据集上对比末层探测、最优单层、朴素加权融合与全量微调,并评估逐层适配器校准后聚合的冻结骨干方案,最强证据是 Wav2BERT A+M 在四库平均上达到话语级 0.388/0.749 与系统级 0.052/0.932,代价是仍需为每个层训练独立适配器与回归头且最优深度随 …
针对一分钟语义和音位流畅性任务中整段平均会抹掉检索动态的问题,CCMAN 用词级多模态序列加双向跨模态注意与迁移学习建模时间不稳定性,在 843 人语料上语义二分类宏 F1 达到 0.81 而多分类仅 0.59,代价是三分类区分 MCI 与痴呆仍不显著且依赖 ASR 时间戳质量。
口语讽刺检测难分词汇与韵律贡献,CLASH 用同一句话的四条件配对变换固定模型做反事实审计,最强证据是目标句 Qwen3-Omni 在时长平衡后词汇保留领先韵律保留 0.135 至 0.148 的 AUROC,代价是声学分数移动常不带来判别增益与二值判决变化。
针对推理时拿不到参考音频文本的跨语言克隆问题,该文用预训练 F5-TTS 合成同说话人提示做监督微调并配合静音鲁棒语速预测器,在 LibriSpeech-PC 上 WER 为 2.014% 且相似度提升,代价是自然度小幅下降。
针对构音障碍语音识别中离散 token 与识别目标错位且随严重程度漂移的问题,该文用迭代伪标签更新、可微端到端优化与严重程度不变正则学习 DSI token,在 UASpeech 与 TORGO 上显著优于可比 HuBERT 连续与离散基线,系统组合后最低词错误率分别为 18.90% 和 6.38%,代价是需内容平行的健康对照与额外的端到端训练。