英文题目:Listening to Motion in Space: Vision-Grounded Event-wise Video-to-Audio Generation and Rendering
会议身份:
conference:interspeech:2026:conference-paper-id:park26m_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#多模态学习 #实时处理 #空间音频信号 #空间音频渲染 #视频到声音生成
评分:5.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.4/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前50% | 文档类型:系统技术报告
👥 作者与机构
- Hyeonwoo Park:机构信息未能从会议 PDF 纯文本可靠映射
- Dayeon Ku:机构信息未能从会议 PDF 纯文本可靠映射
- Hong Kook Kim:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
面向无声视频的视频到音频生成需以无声画面为输入、以可编辑双耳音频为输出,其难点在于多声源混合叠加、事件时间同步与空间听感难以兼顾,传统单轨单声道更无法支持分轨编辑。VisionSFX先由视觉语言模型Gemma 4-VL解析视频,将其分解为带起止时间与声音描述的事件表和环境提示,并把分段视频与提示向后传递。接着事件音由预训练视频音频模型在5秒填充裁剪内独立生成并加窗截取,环境音则由视频无关文本音频模型单独生成,从而避免事件混合进入环境轨。随后光流质心经自运动校正得到方位、单目深度得到距离,再经头相关传输函数渲染为双耳分轨并混音输出,任一重提示、重定位或时间注入仅影响对应磁盘分轨。与依赖配对双耳语料的端到端双耳生成相比,该后验渲染与独立分轨机制免训练且格式可重渲染,具有编辑隔离性。在展位演示任务下,10秒片段生成的延迟指标为约1分钟,低于通用视频上传后初始化的延迟指标1至2分钟。当前结论仅适用于演示级短片与受控展示环境,对复杂遮挡、快速运镜与密集重叠事件的外推尚未验证。原文未披露训练成本,推理与交互依赖两台NVIDIA DGX Spark图形处理器并在1至2分钟内完成短片初始化。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,什么信息必须保留?
输入是一段无声视频,目标是为它配上能听出方向和距离的声音,并且每个声音可以单独改。初学者可以这样理解任务:白话的输入是画面里谁在动、在哪里动、动了多久;白话的输出是戴上耳机能感到左边、右边、远处各有不同声音,同时剪辑师能单独选中其中一个声音换掉或挪位置。必须保留的信息有 3 类。第一是时间信息,也就是每个声音从哪 1 秒开始到哪 1 秒结束,例如篮球拍了几次、每次落在哪个时间点。
第二是语义信息,也就是这是什么声音,例如原文例子写的是硬木地板上的篮球弹跳声,而不是篮球长什么样。第三是空间信息,也就是声源在画面中的平面位置和相对远近,因为最终要做双耳渲染。传统做法是把整段视频丢给一个视频到音频模型,直接输出一路单声道混音。这种做法丢失了分轨结构,改一个声音就要整段重来,也没有方向感。本文要讲的工作把流程拆开:先分解事件,再分轨生成,最后做空间化。
这样做的学习意义在于,后续每一节都可以对照这 3 类信息去检查:分解是否保住了时间,生成是否保住了语义,渲染是否保住了空间。
已有路线在什么条件下成立,又在哪里不够用?
第一条路线是常规单声道视频到音频,代表是原文提到的 MMAudio 和 FoleyCrafter。它的输入是视频,输出是一路把所有声源混在一起的单声道波形。成立条件是用户只关心整体听起来像不像、有没有同步,不需要后期逐个声源编辑。在电影后期、游戏引擎和增强现实与虚拟现实流程中,这种一路混音不够用,因为调音师需要单独控制每个声源的音量、替换和空间位置。第二条路线是逐步式视频到音频,原文引用了用训练过的负音频引导模块在预训练主干上逐事件生成的方法。
它能给出分轨,但原文指出输出仍然是单声道,所以换了播放环境仍然缺少空间表达。第三条路线是端到端立体声或双耳生成,原文引用了 ViSAudio 和 FoleySpace。这类方法直接输出空间化音频,但输出格式被训练数据固定,并且需要大量配对的视频与双耳音频语料。原文明确给出一个例子,ViSAudio 为此构建了 9 万 7 千对量级的专用视频与双耳语料。这意味着如果场景、设备或渲染格式变了,端到端路线需要重新准备数据和训练。
本文选择第四条路线:不训练新的空间生成模型,而是组合现成的视觉语言模型、预训练生成模型和经典信号处理做后处理空间化。理解这个分类后,读者不会把免训练误解为不需要任何模型,而是没有为双耳配对训练新模型。
沿一个样本走完:从一段拍球视频到可编辑双耳混音
假设输入是一段 10 秒的室外拍球视频。第一步,系统要回答画面里有哪些可听事件,例如连续的环境风声算一个长事件,多次篮球触地算多个短事件,每个事件有开始时间、结束时间和声音提示词。第二步,对每个事件切出对应的视频小段,加上该事件的声音提示词,独立生成一段音频;环境声则不看画面,只按环境提示词生成一段铺底声。第三步,对每个事件估计它在画面中的运动轨迹和远近,换算成方位角和仰角,再用头相关传输函数把单声道事件变成双耳信号。
环境声则变成没有明确方向的立体声。第 4 步,把环境立体声和所有事件双耳信号相加并做限幅,得到耳机可听的混音,同时保留每个分轨文件。后续编辑沿同一条链操作:如果觉得篮球声像排球声,只重写该事件提示词并重新生成该轨;如果觉得球应该从左边滚到右边,只改该轨的空间参数并重新渲染混音,不动其他轨道。这个例子是教学用的具体走查,不是原文报告的实测数值,数值证据要到后面的配置和演示条件表中核对。
全流程由哪四个阶段组成,谁调用谁?
按原文图 1 的结构,全流程可以分为场景分解、分源生成、空间化与渲染、输出 4 个阶段。第一阶段输入是完整视频,输出是事件列表和每个事件的视频小段,外加一个全片通用的环境提示词。第二阶段输入是这些事件小段和提示词,输出是每个事件的单声道音频和一路环境音频。第三阶段输入是单声道音频加视频运动与深度信息,输出是双耳事件信号和立体声环境信号。第四阶段输入是这些空间化后的轨道,输出是可听混音和可导出的分轨文件。
关键设计是并行独立调用:每个声源在自己的时间窗内被独立模型调用生成,存成独立的双耳信号。环境声走另一条与视频无关的分支,避免把前景事件混进来。空间化是后处理,不需要配对双耳数据做训练。下面的导读帮助读者带着阶段问题去看原图,先确认主路径,再确认分支在哪里分开、在哪里汇合。
从输入视频到可听混音,先确认 4 个阶段的先后顺序,再确认前景与背景分支的分合点,这是读懂后文每个组件的前提。
看图路径: 1. 从最左侧输入视频出发,沿箭头数出四个阶段方框的顺序;2. 观察中间绿色分支如何分成环境声一路和每事件一路;3. 观察右侧橙色空间化分支如何汇入蓝色双耳混音与分轨输出;4. 核对每条箭头上的符号标注对应哪一类中间表示
论文图 1。原论文 Figure 1:“A pipeline of the proposed VisionSFX workflow.”。
这张流程图从像素上可以分成 4 个横向色块。最左侧是事件级场景分解,中间绿色是分源音频生成,接着橙色是空间化与渲染,最右侧蓝色是输出。前景一路从事件视频小段进入视频到音频模型,再进入光流与深度分支和头相关传输函数渲染;背景一路从环境提示词进入文本到音频模型,再进入单声道转立体声模块,两路最后汇入双耳混音,同时向下引出可编辑分轨。箭头上的符号标注区分了时间窗、提示词、坐标和音频信号等不同中间表示,说明语义判断和声学计算在最后混音前才汇合,这正是可编辑性的结构来源。
场景分解做了什么操作,长事件和短事件如何处理?
场景分解的输入是完整视频,使用的模型是 Gemma 4-VL,规模为 31B 参数。输出是一个事件列表,每个元素包含开始时间、结束时间、声音提示词和对应的视频小段。提示词描述的是听起来像什么,而不是看起来像什么,这是初学者容易忽略的一点。例如同样是篮球,视觉描述可能是橙色圆球,声音描述必须是硬木地板上的弹跳声,因为后者才是音频生成模型需要的条件。原文还给出一条分组规则:一个声源、一个事件。
连续声音例如雨声会被编组为长持续事件,短促重复事件例如多次弹跳保持原样不合并。同时模型还会给出全片一致的环境提示词,保证铺底声在整段视频中连贯。分解结果直接传给分源生成模块。这个阶段没有训练,只是调用现成视觉语言模型做推理。
视觉语言模型 × 事件级场景分解: 视觉语言模型负责看懂画面里发生了什么声音事件,给出起止时间和声音描述;事件级场景分解负责把连续视频切成离散的可处理单元。二者搭配的理由是前者提供语义判断,后者提供时间与任务边界,组合后每个声音可以独立生成和独立修改,而不必重新生成整段混音。
分解阶段的可靠性决定了后文一切时间窗的正确性。如果开始结束时间切错,后续生成会错位;如果提示词写成视觉描述,生成模型会失去声音质感线索。复现时应先检查事件列表的时间格式和提示词写法,再往下运行生成。
每个声源的音频如何生成,时间窗和淡入淡出怎么切?
分源生成的输入是每个事件的视频小段和声音提示词,使用的视频到音频模型是 MMAudio large-44k-v2。做法是对每个事件取一个填充后长度为 5 s 的裁剪,中心放在该事件起止时间的中间点,然后生成音频。生成后再按事件真实区间向外扩展一个小窗口截取,窗口为开始前 23 ms 到结束后 232 ms,边界用升余弦包络做淡入淡出,其中攻击段长度对应开始前的部分,释放段长度对应结束后的部分。这种先放宽再收紧的做法是为了保留起振和尾音,同时避免硬截断带来咔哒声。
环境声不走这条分支,而是用与视频无关的文本到音频模型 TangoFlux 按环境提示词生成第 0 轨。原文解释了切换原因:最初把全片长度当作事件区间交给视频到音频模型时,模型会把已检测事件和真实环境混在一起生成,不干净。推理超参数在原文中明确给出,TangoFlux 用扩散步数 25、分类器自由引导率 4.5,MMAudio 用引导率 4.5。每个声源由并行模型调用独立生成,保证改一个不影响其他。
视频到音频模型 × 文本到音频模型: 视频到音频模型分工是看事件视频片段生成与画面同步的前景声音;文本到音频模型分工是不看画面、只按环境提示词生成铺底的环境声。搭配原因是原文报告直接用视频到音频模型生成环境声会把已检测事件的声音混进来,组合后前景保持同步、背景保持干净且互不污染。
下面这张表把本节涉及的模型选择、时间窗和推理参数放在一起,阅读时先提出问题:在相同事件划分下,前景同步和背景干净分别由谁保证,代价是多 1 次模型调用。表前需要确认比较条件是同一事件列表,指标方向是时间精度和可编辑性,而不是主观音质分数。
| 模块 | 输入 | 输出 | 关键参数 | 调用方式 |
|---|---|---|---|---|
| 视觉语言模型分解 | 完整视频 | 事件起止加声音提示词 | 31B 参数规模 | 免训练直接推理 |
| 视频到音频前景生成 | 事件视频小段加事件提示词 | 事件单声道音频 | 5 s 填充裁剪 | 每事件独立并行调用 |
| 音频截取加淡化 | 生成长音频 | 事件区间音频 | 23 ms 攻击加 232 ms 释放 | 升余弦包络 |
| 文本到音频背景生成 | 环境提示词 | 环境铺底音频 | 扩散步数 25 加引导率 4.5 | 与视频无关调用 |
| 视频到音频引导设置 | 事件视频小段 | 同前景音频 | 引导率 4.5 | 预训练模型推理 |
表后解释如下。前景分支用视频加声音提示词保证同步,背景分支用纯文本保证不混入前景,这是主要收益。具体代价是系统要维护两类生成模型和两套提示词,环境提示词写不好会导致铺底声与画面氛围脱节。未胜出的一项是直接用视频到音频模型生成环境声的方案,原文报告它会混入所有已检测事件的声音,因此被放弃,这是一个明确的负结果。表中数字与单位的写法保留原文,引导率等无量纲量按原文裸值记录。
平面运动和远近如何变成耳机里的方向?
空间化的输入是每个事件的单声道音频和原始视频,输出是双耳事件信号。第一步用稠密 Farneback 光流计算每个事件随时间变化的坐标场。如果相机本身在动,直接用原始光流会把相机运动误当成声源运动,因此要减去每帧光流的中位数作为自运动,再得到修正后的光流。然后在修正光流上求质心,归一化到 0 到 1 范围,作为声源平面位置,用来把物体和声音对齐。
第二步用单目深度模型 Depth Anything 3,在质心位置采样相对深度,范围同样是 0 到 1,注意它是尺度平移不变的相对量,不是米制绝对距离。第三步由平面质心和相对深度推导方位角和仰角,再用头相关传输函数定位每个音频。环境声不做定位,而是用希尔伯特去相关器把单声道转成立体声,去掉耳间强度差线索,使其听起来是弥散的背景。最终可听混音是环境立体声加所有事件双耳信号之和再过双曲正切限幅,可以在不重新生成的情况下为不同格式重渲染。
光流质心 × 单目深度: 光流质心负责给出声源在画面左右上下的位置随时间如何移动;单目深度负责在该位置采样远近,补上 2 维画面缺失的距离维。搭配原因是只有平面坐标无法决定双耳渲染需要的方位角、仰角和距离感,组合后才能把每个单声道事件放到 3 维空间中定位。
这条链的每一步都有明确输入输出,初学者应按顺序检查:光流场、自运动中位数、修正质心、深度采样、角度、双耳信号。任何一步用错坐标归一化或把相对深度当绝对距离,都会导致方向正确但远近不可信。原文未给出定位误差的定量评测,这是后文限制节要强调的缺项。
本研究训练了什么,没有训练什么,真实计算是什么?
本研究没有训练阶段,没有微调,也不需要配对双耳数据。这是原文反复声明的免训练路线,不能把它理解为确定性求解或输出确定。真实计算全部是调用现成模型做推理加经典信号处理。视觉语言模型只做推理得到事件列表,不更新参数。MMAudio 和 TangoFlux 只做推理生成音频,不更新参数,超参数按上表冻结使用。
光流、深度估计、头相关传输函数渲染和希尔伯特去相关都不需要训练,其中光流和深度是现成算法的前向计算,渲染是查表或滤波式空间化。梯度路径、监督来源和参数重置时机在原文中均未报告,因为根本没有反向传播。需要指出的缺项是原文未说明视觉语言模型的解码温度、采样策略和失败重试机制,也未说明生成模型的随机种子管理方式,因此即使参数冻结,多次运行仍可能因采样随机性得到不同波形。
分轨存储 × 实时重渲染: 分轨存储分工是每个事件和环境声生成后独立保存为磁盘上的音频轨道;实时重渲染分工是在不重新生成音频的前提下只重新计算空间位置和混音。搭配原因是生成耗时而渲染便宜,组合后拖动声源位置可以瞬时在耳机中听到变化,只有改提示词才需要重新生成该轨。
理解这一点后,复现工作的重点不是准备训练数据和优化器,而是准备模型权重与运行环境、固定推理参数、记录随机种子,并把分轨文件落盘以支持后续只渲染不生成。
演示系统在什么硬件和界面条件下运行?
本文是演示论文,没有传统的数据集划分、基线对比和统计检验,实验条件就是现场演示条件。硬件是展位上一台双屏笔记本加双耳播放耳机,通过局域网路由器连接放在桌下的 NVIDIA DGX Spark,原文明确写的是两台该设备承担全流程。软件界面包含导航与传输条、视频源、提示词编辑器、空间控制、源列表、逐源时间线波形和音量推子。操作流程分 4 步。上传步骤 stripping 掉原视频自带音频并保留为对比参考。
生成步骤自动运行分解、分源生成和渲染。编辑步骤支持改提示词后只重新生成该源、在时间线空白处拖拽注入新事件、用方位仰角滑杆和俯视深度视图实时挪动声源。渲染步骤支持导出纯音频混音、音视频混音或分轨文件。时间条件见下表,阅读时不要把演示时延当成通用基准,因为它与视频长度、事件数量和现场负载有关。
从操作视角看界面截图,先确认上传与渲染按钮在哪里,再确认时间线与空间控件如何联动,这是复现交互时最容易遗漏的信息。
看图路径: 1. 先找到顶部导航条与上传渲染按钮,再看左侧视频源面板;2. 对比中间源列表与右侧多轨波形时间线的事件对应关系;3. 观察左下空间控制面板中方位与距离控件的位置
论文图 2。原论文 Figure 2:“Screenshot of the VisionSFX workflow:”。
从像素上看,这张截图被彩色框分成 7 个区域。顶部红色长条是导航与传输条,左上橙色框是视频源,可见户外人物画面。左侧黄色框是原始音频参考,绿色框是空间控制,可见俯视深度视图中的声源点。中间蓝色窄列是源列表,右侧紫色大面积是逐源时间线,可见多条长短不一的波形按时间错开排布,最右侧青色窄条是音量推子。时间线与源列表在行方向上对齐,说明每一行对应一个可独立开关和独奏的声源,拖动空间控件只改变该行的渲染参数而不改变波形本身,这与分轨存储的设计一致。
下面这张表整理原文明确给出的部署与时延条件,表前先提出问题:在给定硬件下,从上传到可编辑、从挪动到听到变化各需要多久,公平条件是同一现场管线,指标方向是时间越短越好。
| 阶段 | 输入 | 输出 | 关键时间 | 硬件与条件 |
|---|---|---|---|---|
| 全管线首次生成 | 10 s 视频片段 | 独立分轨时间线 | 1 min 内 | 2 台 DGX Spark |
| 上传后完整体验 | 用户上传视频 | 可编辑时间线 | 1–2 min | 现场全管线 |
| 空间重定位 | 拖动方位深度控件 | 更新后双耳混音 | 0.3 s 级 | 无需重新生成 |
| 分轨编辑 | 重写提示词 | 仅该源重生成 | 随单源生成耗时 | 其他轨道不变 |
| 导出 | 混音或分轨选择 | 音频或音视频文件 | 随导出格式而定 | 多编码器容器可选 |
表后解释如下。主要收益是首次生成后编辑便宜,尤其是空间移动无需重新生成,约 0.3 秒即可在耳机中反映,支持反复试听。代价是首次生成仍需约 1 分钟处理 10 秒片段,上传视频较长或事件较多时等待更久。未评测的边界是原文未报告并发用户、长视频内存占用和网络抖动下的时延分布,也未报告客观音质或定位精度,因此不能把演示流畅等同于所有视频都达到同样质量。
论文直接报告了什么,什么没有用数字证明?
论文直接报告的是系统可行性和交互属性,不是胜过某个基线的分数。第一,系统能在约 1 分钟内为 10 秒片段生成独立分轨,并在约 1–2 分钟内让用户开始编辑。第二,编辑一个声源不影响其他声源,因为每个声源独立生成并独立存盘。第三,重定位声源在 3 维空间中是瞬时的,因为只重算渲染不重算生成,约为 0.3 秒。第四,双耳渲染能产生单声道波形无法传达的空间深度,这是定性表达,原文没有给出定位误差、分离度或主观评分。
初学者要注意区分报告、支持和推测。报告的是上述流程能跑通;支持的是分轨结构带来编辑隔离;待验证的是音质更好或定位更准,因为没有对照实验和指标。原文致谢部分提到多项韩国机构资助,生成式人工智能声明提到用 Claude Opus 4.6 做了英文润色且经作者审阅,这些与方法正确性无关,但复现时应知道文本经过语言润色,关键以参数和流程为准。
资源状态方面,本次未发现来源绑定且完成验证的资源,因此不得声称代码、模型或数据已公开。
关键选择有无对照,哪条失败路径最有教学价值?
原文没有给出消融表,但给出一组有价值的失败对照:环境声生成方案的选择。初始方案是把全片长度当作事件区间交给视频到音频模型,结果模型生成了所有已检测事件与真实环境的混合声,不符合铺底声应干净的要求。替代方案是改用与视频无关的文本到音频模型单独生成环境声,问题解决。这个对照说明视频条件是一把双刃剑:对前景事件它是同步线索,对背景它反而是污染源。另一个隐含对照是自运动修正。
如果不减去帧级光流中位数,相机平移会被误读为声源移动,质心轨迹会整体漂移;减去之后才能对齐物体与声音。原文未报告拿掉深度分支或拿掉去相关器会怎样,也未报告不同引导率或扩散步数的影响,因此不能推断这些超参数最优。教学上应把环境分支切换记为本研究最重要的已验证选择,把其他未做消融的部分记为复现时可补的验证,而不是默认它们不重要。
哪些边界未被测量,哪些结论不能推广?
第一,未测量误判率。视觉语言模型可能漏检、误检或切错时间,原文未报告检测精度,错误会向后传播到生成和渲染。第二,未测量定位精度。相对深度是尺度平移不变的,方位仰角推导细节未完全公开,头相关传输函数是否个性化也只在图注层面提及,耳机试听的主观差异未量化。第三,未测量可扩展性。
事件很多、声音重叠严重、相机剧烈抖动或遮挡时,光流质心可能落在背景上,原文未给出失败率。第四,未测量成本与延迟分布。除现场两台设备的约定时延外,没有给出显存占用、每事件生成耗时随长度的变化、长视频分段策略。第五,总体趋势不等于每步成立。分轨隔离成立的前提是事件划分正确,如果两个声源被并入同一事件,它们仍会被混在一起生成。
因此何时值得尝试的判断是:当任务需要分轨可编辑和空间可控,且能接受无客观指标保证、愿意人工检查事件列表时,这条免训练后处理路线值得一试;当任务要求经过验证的定位精度或大规模自动评测时,还需补验证。
复现先做什么,需要保留哪些超参数和信息条件?
第一步先复现分解。准备 Gemma 4-VL 或等效视觉语言模型,输入无声视频,输出包含开始、结束、声音提示词和视频小段的事件列表,并执行一个声源一个事件的分组规则,同时单独保存全片环境提示词。先人工检查时间窗和提示词写法,不要直接进入生成。第二步复现生成。调用 MMAudio large-44k-v2 对每个事件做 5 秒填充裁剪生成,再按开始前 23 毫秒到结束后 232 毫秒截取并加升余弦淡入淡出。
调用 TangoFlux 按环境提示词生成背景,扩散步数设 25,两处引导率均设 4.5。每个事件独立存盘,文件名保留事件序号与起止时间。第三步复现渲染。对每个事件算稠密 Farneback 光流并减去帧中位数求质心,用 Depth Anything 3 在质心处采样相对深度,推导方位仰角后做头相关传输函数渲染;环境声用希尔伯特去相关器转立体声。
最后相加过双曲正切得到混音。第 4 步复现交互。实现改提示词只重生成该轨、拖动空间控件只重渲染、时间线空白处可注入新事件 3 类操作,并记录随机种子和实际耗时。由于未发现可验证的公开资源链接,复现应按论文文字和上述参数从零搭建,不假设代码已公开。
如何一句话记住这项工作的取舍?
记住这条取舍:用事件分解换可编辑性,用后处理空间化换免训练,但代价是把质量保证交给了上游模型的推理质量和人工检查。常规单声道方法把所有声音混成一路,改动成本高;端到端双耳方法把空间能力锁在训练数据里,数据成本高;本文把语义判断交给视觉语言模型,把同步生成交给预训练音频模型,把方向感交给光流加深度加头相关传输函数,每一步都不训练,只做推理和计算。
组合意义在方法总览的概念桥中已经说明:前景要定位,背景要弥散,两路汇合才有层次。初学者复述时应沿样本顺序讲:输入视频如何变成事件列表,事件如何变成独立音频,独立音频如何变成双耳分轨,拖动和改词分别触发哪条重算路径。最后要补的验证也很明确:事件检测精度、定位主观或客观误差、重叠与抖动下的失败率、长视频成本分布。补上这些,才能从能演示推进到可部署。
头相关传输函数 × 希尔伯特去相关器: 头相关传输函数分工是把离散事件声源渲染成有方向感的双耳信号;希尔伯特去相关器分工是把单声道环境声变成没有明确方向的立体声铺底。搭配原因是前景需要可定位、背景需要包围感但不应抢方向,组合后形成前景双耳加背景立体的最终混音。
这段收束不重复摘要,而是给出行动顺序:先检查事件切分,再听分轨是否干净,最后戴耳机检查方向变化是否跟随拖动,每一步都对应一个可独立排查的模块。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

