不训练生成器,只做部分编辑:PACE 在冻结表征里权衡口音与保留
PACE 针对非平行口音转换,用冻结 WavLM 上的口音预测子空间更新加检索融合实现推理时可调的转换强度,默认点以 16.0% 词错误率和 39.0% 分类器准确率优于复现基线,代价是说话人相似度降到 0.583。
PACE 针对非平行口音转换,用冻结 WavLM 上的口音预测子空间更新加检索融合实现推理时可调的转换强度,默认点以 16.0% 词错误率和 39.0% 分类器准确率优于复现基线,代价是说话人相似度降到 0.583。
该系统针对 NCERT 课本问答做个性化教学视频,用检索增强生成锁定课本依据并写出多场景脚本,再经 Stable Diffusion 配图、DynamiCrafter 做动效、Google TTS 配音并由 MoviePy 对齐合成,演示显示师生觉得比纯文本更易跟随,但原文只报告定性反馈而未给出可比的定量指标与对照代价。
论文研究长音频中分散证据的定位与整合问题,采用离线结构化元数据加按需音频片段的混合检索智能体路线,最强证据是混合检索加多模态证据比单模态平均答案准确率提高约 10 个百分点、理由准确率提高约 6 个百分点,代价是声学任务仍需灵活选择证据模态且答案正确会高估真实 grounding 能力。
共收录 60 篇 icmc-2026 会议论文的 Reader 深度解读
ScorePrompts 针对用自然语言探索 MusicXML 乐谱结构的问题,选择先用固定 MIR 组件栈构造音符、拍、小节、乐曲四级对齐表示再做受约束语言生成与确定性问答, demo 贯穿单谱四阶段流程,代价是只面向机器可读西方调性乐谱且未验证生成句与证据的语义忠实性与音乐学正确性。
该研究以检索加规则检验做古典钢琴符号混搭,用 8 小节可控听辨分离和声、终止逻辑、动机可辨识度和织体四个因素,发现终止逻辑与可辨识度及复调并置更关键,代价是仅在短片段、均匀钢琴音色和小样本条件下成立。
该文用离线描述符分析加四种可堆叠查询在 Max/MSP 里动态形成空间化声音组,并以四组共用 150 个声源的固定媒体作品验证流程,其代价是离线分析耗时、堆叠与动态查询受限和空间化带来的 CPU 压力。
共收录 160 篇 nime-2026 会议论文的 Reader 深度解读
针对沉浸式空间音频意图难落实的问题,Satie 用音频优先领域专用语言加浏览器运行时承载大模型代码生成与文本生音频,行数对比显示同需求下脚本约为游戏引擎代码五分之一,而代价是依赖第三方接口与浏览器空间保真度限制。
该研究把文本转音乐从一次生成波形改为持续解析为 34 字段可读合成器配置,用后台解析加前台交叉淡出的实时生成器维持不断声,最强证据是 200 条提示下嵌入检索后端全部成功且配置生成约 0.3 秒而外部大模型后端成功 178/200 且需约 5.6 秒,代价是音色泛化弱于神经音频且检索覆盖不足时会出现语义错配。
该文把自然语言行为描述经分解、按需挑选领域知识、分头合成图形处理器核函数再组装为可执行草图,在 8 个提示上把零样本与全文档 p 档的零通过率提升到管线条件下约五至七成,但只验证 12 秒无错运行而不验证行为保真与音乐可用性。
AutoCut 针对广告视频制作中多模态松散耦合与剪辑不可控问题,用残差向量量化把视频与音频变成与文本共享的离散词元并经两阶段训练统一推理,在 364 个样本的同一评测上取得排序准确率 0.10714 与脚本质量 84.6255 等最佳结果,代价是依赖已有素材库检索而不能从零生成像素。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
共收录 91 篇 dafx-2026 会议论文的 Reader 深度解读
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对小时级视频上下文过长与朴素切分检索导致碎片化的问题,论文提出离线构建全局-场景-片段-实体四层索引并用说话人身份做跨模态实体黏合,再由智能体按需多粒度检索,在 LVBench 上以 30 秒粗切分与至多 10 步推理达到 84.1% 整体准确率,但高密度采样与多工具调用仍带来离线与在线开销。
针对无监督异常声音检测中正常与异常机器声高度相似、单条通用描述难以支撑差异总结的问题,论文提出推理时两阶段多样且判别性束搜索解码,用多条组内多样加跨音频互斥的描述供给大语言模型汇总,主观评估显示更具体可辨但未承诺延迟与误判改善。
论文要解决陌生人跨时间合奏的体验问题,选择五块木板加卷积发声与四维特征最近邻召回过去同时录音的路线,公共展出的观察显示参与方式多样但仍缺乏可量化的音乐性评估,而单人触发与多人优先的仲裁规则是其主要代价与边界。
针对音视频问答中共享嵌入检索错位与单跳图证据太浅的问题,论文用三步多智能体构造多跳多模态知识图并以模态内检索加 GRASP 接地剪枝供给答案有用子图,在 AudioCaps-QA、VCGPT 和 VALOR 上一致提升但强依赖阈值与外部接地模型。
该研究把现场编程的共享文本缓冲作为舞台,用三斜线指令召唤多个逐字打字的可见智能体并以冲突无关复制数据类型维持并发一致,再用检索增强保证 Strudel 语法可用,作者自研究显示角色转向策展与协商但伴随认知负荷与失控失效。