英文题目:Adapting offline models to a streaming context for music source separation

标签:#音乐源分离 | #信号处理 | #流式处理 | #实时处理 | #高效推理

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 1/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 1/1.5

👥 作者与机构

  • Dylan Sechet:机构信息未在 arXiv HTML 中可靠披露
  • Marc Evrard:机构信息未在 arXiv HTML 中可靠披露
  • Matthieu Kowalski:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

音乐源分离(music source separation)需从混合录音恢复人声、鼓、贝斯与其他(vocals/drums/bass/other)波形,离线模型依赖整段未来上下文而难以满足低时延在线推理。第一步以单短时傅里叶变换跳长滑动固定长度上下文窗口并送入未修改的原模型,前一步滑窗输出的整段多源估计直接构成后续读出的候选池。第二步按前视参数选择输出中的单跳读出位置以决定算法时延,上一步候选池的位置索引进入本步并被换算为未来上下文量。第三步对选中跳段做逆变换合成与重叠相加并连续发射,前一步选定的读出点决定本步合成可用的真实上下文与填充方式。与改造为因果卷积与单向循环并重训的专用实时模型不同,该方法保留原非因果权重与变换管线,仅用读出点控制未来上下文量。在 MUSDB18-HQ 上以信号失真比(signal-to-distortion ratio, SDR)为指标,流式 SCNet 与 HT-Demucs 在 23 ms 处达到约 7.0 dB,持平同条件专用实时模型最佳水平;在 93 ms 处达到约 8.5 dB,领先因果化 SCNet 变体约 0.7 dB。结论仅在单通道四轨分离与中型模型上验证,时延低于单变换窗长时合成被迫依赖反射填充而质量陡降,跨大模型与多采样率的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,这次解读要保留什么?

本文输入是一段音乐混合波形,目标是把它分解为人声、鼓、贝斯与其他 4 个 stems,输出是每个声部各自的波形。研究对象不是新训练一个实时模型,而是把已经发布、原本为离线设计的 3 个中等规模模型拿来直接流式运行。离线在这里的意思是训练和推理时都可以看到整首歌,包含当前时刻之后的信息;流式的意思是音频一边到来一边输出,只能用已到达的采样加有限的前视。

这次解读必须保留 3 类信息。第一是实验条件:数据集是 MUSDB18-HQ,指标是 museval 计算的信号失真比,聚合是中位数并带自助法置信区间,实时因子是在单张显卡上批量为 1 测得。第二是可复述的方法:上下文窗口每次滑动一个短时傅里叶变换跳长,模型每次输出全部上下文对应的估计,但只读出一跳,读出位置决定延迟。第三是边界:哪些模型在什么延迟下与专用实时模型相当,哪些仍慢于实时,以及质量拐点出现在什么延迟。

算法延迟 × 计算延迟: 算法延迟是算法设计本身决定的理论等待时间,与机器快慢无关,例如必须看到未来多少采样才能输出当前采样;计算延迟是实际跑一次前向需要的时间,取决于算力和实现。两者分工不同:前者决定输出读出点能设多靠前,后者决定每跳能否按时算完;搭配理由是实时系统必须同时满足两者,组合意义是本文只压缩前者到单跳而不增加前向次数,因此计算负担另需单独测量。

对刚入门的读者,先建立判断顺序。看到延迟数字先问这是算法延迟还是计算延迟;看到分离分数先问数据集、基线、是否同训练数据、同延迟;看到流式做法先问输入动了还是读出动了。本文的答案很固定:输入滑动方式固定为一跳,读出位置可变,计算量不随读出变化,质量随前视变化。

实时路线与离线路线此前如何分开比较?

音乐源分离的离线路线追求最高保真,常用较大的频域窗口和双向上下文,1 次处理整段录音。实时路线则同时收紧两个约束:算法延迟要小到几十毫秒,计算量要轻到能在受限设备上跑。文中列出的专用实时模型包括直接在时域隐空间估计掩码的 Deep Latent Masking,结合波形与频谱分支并用单向循环的 HS-TasNet,基于 DTTNet 轻量化并达到 23 毫秒的 RT-STT,以及把 SCNet 因果化的 Online SCNet 和进一步加跨频带模块的 Band-SCNet。

过去的比较习惯把离线模型排除在外,或者把它的算法延迟记为整个输入长度,也就是 2 到 15 秒,另立非实时类别。这种记法隐含一个误解:延迟由输入长度决定。语音增强领域已有反例,有人把离线语音分离器按 0.5 秒步进流式推进并研究前视影响,但其步进太大,从未进入子窗口延迟区。本文要纠正的正是这一点:在音乐分离中,延迟应由输出读出配置决定,而不是输入长度。

理解这段对照时不要把类别差异当成同条件胜负。专用实时模型通常参数更少、窗口更小、结构因果,离线模型通常更大、非因果、有重叠相加。本文的公平做法是把离线模型流式化到与专用模型相同的算法延迟再比分离质量,同时单独报告实时因子,不把质量相当说成可部署性相当。

为什么离线模型的延迟会被高估两个数量级?

如果把模型 1 次输出的全部 C 个采样都发射出去,延迟自然是 C,几秒量级。但流式场景不需要 1 次发射全部,只需要在每个输入步进到达时交出对应的一小段。离线模型每次前向本来就对上下文内每个采样都给出了估计,只是离线流水线会等整段算完再做重叠相加后处理。于是问题变成:在不改模型、不改短时傅里叶变换流水线的前提下,能否每次只读一跳,并且让延迟等于该跳相对输入末尾的位置。

答案取决于合成约束。一个输出跳的波形是由多个逆变换合成帧重叠相加得到,这些帧有的完全落在已观测输入内,有的会伸到尚未到达的未来。当读出点过于靠前,合成所需的未来采样只能用短时傅里叶变换的填充代替,例如反射填充,质量就会下降。这就预告了两个区间:延迟大于等于一个窗口时填充缺席或不影响发射跳,延迟小于一个窗口时填充占比随前视减小而增大。

教学上可以举一个不带数值的例子:把读出窗口想象成从模型输出尾部向前数若干跳,越靠尾延迟越大、看到的未来越多,越靠前延迟越小、看到的未来越少。输入长度只决定每次算多少,读出位置才决定等多久。本文的中心判断是把延迟等于输入长度看成众多工作点中的一个,而不是最小值,最小值可以低两个数量级。

不改权重如何跑出从 23 毫秒到 3 秒的整条曲线?

全景分 3 步。第一步固定输入推进:维护一个长度为 C 的缓冲区,每到来 H 个新采样就丢掉最旧 H 个并拼入新块,H 是短时傅里叶变换跳长,本文 3 个模型都是 1024 采样。第二步固定前向:把该缓冲区送入原样预训练模型,得到每个声部 C 个采样,不做任何结构修改与重训练。第 3 步可变读出:按整数前视 k 取输出中的一段 H 采样发射,k 可为负,对应延迟公式为窗口加 k 倍跳长。

通过扫描 k 的全部可行范围,就得到一条延迟对质量曲线。k 的上界取到 128 跳,对应 3 秒以上延迟,用于逼近离线性能;k 的下界由输出不越界决定,对应单跳延迟。对每个 k 只改变发射位置,不改变输入与前向次数,因此整条曲线的计算量相同,实时因子沿曲线为常数。这是后文说延迟换质量但不换计算量的原因。

沿一个样本走一遍更直观。假设采样率 44.1 千赫,跳长 1024 对应约 23.2 毫秒。某时刻缓冲区装着最近 C 个混合采样,模型输出 C 个鼓估计。若 k 等于 0,读出位置避开需要未来填充的区域,延迟等于一个窗口;若 k 取最小值,读出最靠前的一跳,延迟等于一跳。

若 k 取很大的正值,读出靠近尾部,延迟数秒并带有大量未来上下文。同一模型、同一权重,仅读出不同,就覆盖了从最快专用实时模型到接近离线的全部工作点。

读出位置与延迟公式如何对应到合成帧?

先解释符号。C 是上下文窗口长度,W 是短时傅里叶变换窗口长度,H 是跳长,k 是以前视跳数计的读出参数,nk 是发射跳在输出中的起始样点。发射区间取为从 nk 到 nk 加 H,其中 nk 等于 C 减 W 减 k 乘 H。延迟记为 L 等于 W 加 k 乘 H,因此 k 每加一,延迟加一跳。

上下文窗口 × 前视: 上下文窗口是每次送入模型的最近 C 个采样,是模型能看到的全部历史加未来范围;前视是读出跳相对窗口末尾预留的未来上下文量,用跳数 k 参数化。上下文窗口负责提供表示,前视负责在延迟与质量间取舍,搭配理由是滑动窗口时输入不变而读出点可动,组合意义是增加 k 只增加延迟而不增加计算量。

该构造的下界来自输出不越界条件,要求 nk 加 H 不超过 C,解得 k 不小于 1 减 W 除以 H,对应最小延迟等于 H。这不是流式的结构下界,只是在该缓冲构造下的可达下界。按文中采样率与跳长,最小延迟对 3 个模型都是 23.2 毫秒;k 等于 0 时延迟等于 W,对 HT-Demucs 与 SCNet 是 92.9 毫秒,对 DTTNet 是 139.3 毫秒,因为后者窗口更大。

短时傅里叶变换窗口 × 单跳读出: 短时傅里叶变换窗口是做频域分析的一帧长度 W,决定一次合成需要多少相邻帧做重叠相加;单跳读出是每次只从模型输出的 C 个采样中取出 H 个采样发射。窗口负责频率分辨率与合成约束,单跳读出负责把延迟压到一跳,搭配理由是离线输出本已包含逐跳估计,组合意义是不改 STFT 流水线即可把延迟从输入长度降到跳长。

再对应到合成。当 k 大于等于 0,发射跳的全部合成帧都落在已观测输入内,每增加一跳前视只在右侧增加上下文;当 k 小于 0,部分合成帧伸到最后观测采样之后,只能用模型自带的反射填充补足。填充在延迟大于等于 W 时缺席,在延迟小于 W 时随 k 的负向增大而增多,因此在延迟等于 W 处出现质量拐点。注意该阈值随各模型的短时傅里叶变换配置而变,不是固定毫秒数。

每步滑动一跳时具体算什么、丢什么?

伪过程可复述为循环。初始化读出起点由 k 决定;对每个到来的 H 采样块,先把缓冲区左移一跳并拼入新块,再对整个缓冲区做 1 次模型前向得到每声部 C 采样,最后发射预定位置的一跳。k 大于等于 0 时发射跳的合成帧与离线设置相同,但网络上下文在该跳之后只延续 L 个采样,因此估计仍不同于离线;k 小于 0 时相当于剥夺未来上下文的离线模型。两种区间都无法使用离线常用的块间重叠相加交叉淡化,因为每步只产出一跳且必须立即发射。

重叠相加 × 流式丢弃: 重叠相加是离线流水线在分块间用交叉淡化平滑拼接以抑制边界伪影;流式丢弃是本文每步算出 C 个输出采样但只保留 H 个、其余丢弃。重叠相加负责质量平滑,流式丢弃负责保持固定低延迟,搭配理由是逐跳发射无法等待下一块做淡化,组合意义是这部分平滑损失成为流式代价的一小部分,需在对照中单独估计。

计算代价需要单独算。每次前向算 C 个输出采样但只保留 H 个,大部分输出被丢弃,所以流式比离线浪费。k 不影响输入与前向次数,故计算量不随延迟缩小而增加,这是本文反复强调的性质。但浪费程度与模型大小有关,文中为控制每跳重算全上下文的开销,只选中等规模模型而不选 50M 参数以上的大模型,否则实时因子会远大于 1。

实现细节按原文交代:上下文按一跳推进即 1024 采样;前视扫描从下界到 128 跳,覆盖 23.2 毫秒到 3 秒多;离线基线包含必要的重叠相加,流式版本按上述过程运行;所有结果使用作者发布的预训练权重,不做重训练与结构修改,只有消融节的微调例外。

本研究训练了什么,没有训练什么?

本研究的主结果没有训练任何模型。DTTNet、HT-Demucs 与 SCNet 都是直接调用作者发布的现成检查点,比较的是完全离线流水线与按上节流式化的同一检查点。文中明确最好的现成检查点还带有额外训练数据:HT-Demucs 在 MUSDB18-HQ 之外多用了 800 首歌,SCNet 在 MUSDB18-HQ 之外用了 MoisesDB。因此主结果的分离分数包含训练数据的差异,解读时不能把全部领先都归于流式方法本身。

唯一的训练是消融节的微调,用于检验低前视损失是否可通过改变损失消除。对 SCNet 与 HT-Demucs 各做两种微调:受限损失只监督读出缓冲区,对照损失用模型原始无约束损失以隔离继续训练本身的效果。条件按原文保留:都用 MUSDB18-HQ,20 轮,学习率 5 乘 10 的负 5 次方,分别在 k 等于 0 与 k 取最小值负 3 下试验。结果是受限损失相对对照至多增益 0.1 分贝,支持损失为结构性的判断。

缺项需要点名。原文未报告微调时的优化器种类、批量大小、数据划分细节与随机种子,也未说明是否冻结编码器或只更新部分参数,更未给出梯度是否截断到单跳。由于未报告,不能从模型名称推定实现,也不能把无训练等同于确定性求解:冻结权重只说明参数不变,浮点并行与填充仍可能带来实现差异,但本文未测量这部分。

数据、指标与计时口径如何保证可比?

数据与指标按原文交代。评估集是标准 MUSDB18-HQ,指标是 museval 计算的信号失真比,方向是越高越好。聚合用中位数,并用自助法给出 95% 置信区间,文中还用按曲目的配对差值中位数分析前视增益。模型侧比较 3 类:完全离线流水线、同一检查点的流式化版本、专用实时架构在原论文报告的分数。专用模型分数直接引用原论文,其中 Deep Latent Masking 评估在 MUSDB18 而非 HQ,比较时需留出数据集差异。

计时口径需要仔细复述,因为它决定实时结论。实时因子是计算时间除以音频时长,小于 1 表示有实时能力。测量在单张显卡上批量为 1、用静态输入形状编译后进行,取 25 次热身后 50 次前向的中位数。流式模型每跳 1 次前向,按跳长归一化为每采样处理时间;离线重叠相加流水线每步长 1 次前向,步长取上下文一半,按步长归一化。DTTNet 是 4 个单声部模型共享架构的集成,原文报告单个模型时间并假设 4 模型可并行,这是一个有利于 DTTNet 的假设,实际串行会更慢。

比较条件的不一致也要保留。参数量与训练数据并不一致:HT-Demucs 约 42M,SCNet 约 10M,DTTNet 为 4 个 5M 模型;额外训练数据对 HT-Demucs 离线约值 1.5 分贝,对 SCNet 约值 0.25 分贝。于是同延迟质量相当的结论是在此不均衡下成立,专用实时模型在参数效率上仍占优。

23 毫秒下流式离线模型真的追上专用模型吗?

要回答这个问题,需要把延迟固定到 23 毫秒,再看同指标下的分离质量与计算代价。本表把 4 个可运行策略放在同一延迟下,指标方向都是越高越好,最后一列是实时因子,越小越快。流式三行来自本文的同一检查点不改权重运行,专用一行引用原论文分数,数据集差异已在表注保留。

条件指标专用基线流式 HT-Demucs流式 SCNet流式 DTTNet
23 毫秒延迟中位数 SDR6.476.97 [6.29, 7.34]6.99 [6.50, 7.36]6.06 [5.42, 6.36]
23 毫秒延迟鼓 SDR7.058.177.655.67
23 毫秒延迟人声 SDR6.916.907.458.10
23 毫秒延迟实时因子未报告0.891.591.57

表中流式 HT-Demucs 与 SCNet 在 23 毫秒下都达到约 7 分贝中位数,领先 Deep Latent Masking 约 0.5 分贝,但领先幅度与置信区间宽度相当,不能说成大胜。DTTNet 在该延迟下为 6.06 分贝,落后专用基线 0.41 分贝,是本表明确的未胜出项。更关键的代价在最后一行:只有 HT-Demucs 的实时因子低于 1,SCNet 与 DTTNet 都在 1.5 以上,说明质量相当不等于都可实时部署。按原文 1 次前向约 20.6 毫秒估算,23 毫秒算法延迟叠加计算后每采样约 44 毫秒离开流水线。

93 毫秒与 3 秒处质量如何随前视变化?

把延迟放宽到 93 毫秒,专用实时模型的最强项是 Band-SCNet,流式模型的前视更大,因此要看增益是否持续。本表仍是同延迟比较,指标越高越好,并加入 3 秒逼近离线的证据作为上限参考。流式行仍是现成检查点直接运行,专用行引用原论文,训练数据差异不变。

条件指标专用最强流式 HT-Demucs流式 SCNet流式 DTTNet
93 毫秒延迟中位数 SDR7.798.47 [7.64, 9.07]8.51 [7.73, 9.07]7.51 [6.62, 8.10]
93 毫秒延迟贝斯 SDR7.139.439.177.16
93 毫秒延迟人声 SDR8.748.498.679.69

表后解释需要同时讲收益与反例。收益是流式 SCNet 在 93 毫秒下领先 Band-SCNet 0.72 分贝,流式 HT-Demucs 领先约 0.68 分贝,且 3 模型在 3 秒延迟下都回到离线 0.12 分贝以内,说明大前视已基本恢复离线性能。反例是 DTTNet 在 93 毫秒下为 7.51 分贝,落后 Band-SCNet 0.28 分贝,且它在 93 毫秒已处于负前视,因为它的窗口阈值是 139.3 毫秒。分声部看,鼓的前视增益最小,贝斯在 HT-Demucs 与 SCNet 上增益最大,原文解释为低频需要更长上下文,该解释是有限推测而非因果证明。

拐点为何恰好落在各自窗口长度而非固定毫秒?

本文的理论预测是质量在延迟等于 W 处出现拐点,W 随模型而变。要验证它,需要把延迟扫过窗口 2 侧,并看 3 条曲线的陡降点是否分别对齐各自 W。本表整理拐点两侧的关键数字,指标仍是越高越好,延迟越小代表条件越苛刻。

延迟条件含义计算代价变化
最小延迟单跳实时因子不变
零前视延迟等于窗口实时因子不变
93 到 23 毫秒跌入填充区实时因子不变
实时门限能否部署仅 HT-Demucs 达标

因果化改造 × 未来上下文缺失: 因果化改造是把非因果卷积与双向循环改为因果单向结构,属于架构改动;未来上下文缺失是保持权重不变、仅把读出点前移导致看不到未来,属于运行条件变化。前者负责满足实时结构,后者负责量化信息损失,搭配理由是两者都会降分但原因不同,组合意义是本文用同延迟流式 SCNet 与 Online SCNet 对比,把 1.86 分贝总差距拆为至多 0.74 分贝的信息损失与至少 1.1 分贝的架构损失。

表后机制解释如下。当延迟从 93 毫秒降到 23 毫秒,3 模型都损失约 1.5 分贝,且在 k 小于 0 后陡降,支持填充假说;DTTNet 的陡降点更高,与其 6144 采样窗口对应,说明拐点跟随各自短时傅里叶变换配置而非公共毫秒数。k 大于等于 0 后,HT-Demucs 与 SCNet 随延迟对数上升,DTTNet 近乎平坦,说明后者较少利用未来上下文。听感上,负前视的不完美重建在半个窗口延迟内表现为背景嗡鸣而非咔哒声,这是原文报告的主观描述,未经正式听音实验验证。

因果化对比进一步拆分代价。流式 SCNet 在同延迟下只付未来上下文损失约 0.74 分贝,该值还吸收了失去重叠相加的损失故为上界;Online SCNet 相对离线落后 1.86 分贝,扣除训练数据 0.25 分贝后,至少 1.1 分贝来自架构因果化与参数缩减。微调消融显示受限损失至多 0.1 分贝增益,支持低前视损失是结构性的,微调不能消除。

哪些代价与边界在主结论之外?

第一个局限是计算效率。质量在同算法延迟下相当,但流式离线模型每跳重算全上下文,实时因子沿整条曲线不变且普遍偏高。只有 HT-Demucs 在测试显卡上低于 1,SCNet 与 DTTNet 都在 1.5 以上,离线流水线的实时因子则低两个数量级。因此专用实时模型在嵌入式与边缘硬件上的优势仍然很大,本文的实时结论仅限所测显卡与批量为 1 个条件。

第二个局限是比较口径。专用模型分数引用自原论文,训练数据、评估版本与超参数并不统一;HT-Demucs 的额外 800 首歌约值 1.5 分贝,超过它的领先幅度,SCNet 的额外数据约值 0.25 分贝,小于它的领先幅度。Deep Latent Masking 的分数在非 HQ 版本上测得,直接比较会偏向流式侧。原文未做统一训练数据重训,因为方法卖点正是不需重训练即可换更强检查点,但读者不能把表内差距都解读为方法增益。

第 3 个局限是未测量项。原文未报告误判率、正式听音分、内存占用、CPU 实时因子与量化后性能,也未评估 50M 参数以上大模型的流式成本。总体趋势不等于每曲目成立,置信区间宽度与 0.5 到 0.7 分贝领先相当,个别曲目可能反转。填充用反射的结论只覆盖所测 3 个模型,换填充方式或换架构需重新验证拐点。

复现时先做什么才能得到同一条曲线?

先准备数据与权重。下载 MUSDB18-HQ 并按 museval 流程算信号失真比,取中位数与自助法 95% 区间;下载 3 模型作者发布的预训练权重,保持短时傅里叶变换的窗口、跳长与填充不变,尤其确认填充为反射,否则拐点位置与陡降幅度会对不上。采样率按 44.1 千赫、跳长 1024 核对最小延迟 23.2 毫秒,HT-Demucs 与 SCNet 窗口 4096 对应 92.9 毫秒,DTTNet 窗口 6144 对应 139.3 毫秒。

再实现流式循环。每到来一跳更新长度为 C 的缓冲区,对全缓冲做 1 次前向,按 k 从下界到 128 发射对应一跳,不加块间交叉淡化。离线基线保留原重叠相加,步长取上下文一半。计时时固定批量为 1 与静态形状,热身 25 次后取 50 次中位数,流式按跳长归一化,离线按步长归一化;DTTNet 若要复现原文数字需按单个模型计时并注明并行假设,否则串行 4 个模型会显著变慢。

资源状态需要如实写:本次收到的证据未绑定完成验证的代码与模型链接,不得声称代码、模型或数据已公开。若要检验微调消融,需在 MUSDB18-HQ 上分别跑原始损失对照与只监督读出缓冲的受限损失,各 20 轮与小学习率,并比较相对对照的增益而非绝对分数。还需补的验证是换填充、换窗口与 CPU 计时,否则不能把单跳可达推广为任意配置可达。

何时值得尝试这种流式化,何时坚持专用模型?

当已有强离线检查点、且场景允许几十到上 100 毫秒延迟时,值得先尝试本文的流式化。卡拉 OK 或广播重混等对 100 毫秒量级可接受的任务,可把延迟设在窗口附近,用不到 1 分贝的损失换来免重训练;对 23 毫秒苛刻预算,可直接用 HT-Demucs 的现成检查点在显卡上跑出与专用模型相当的质量。选择时先看窗口:延迟目标若低于该模型窗口,就要接受约 1.5 分贝量级的陡降,并检查嗡鸣伪影是否可接受。

当部署在单 CPU 线程、嵌入式或需极低功耗的设备上,应坚持专用轻量模型。Band-SCNet 类模型参数仅数 M 且在单线程下实时因子远低于 1,而流式离线模型每跳重算全上下文,多数仍慢于实时。此时质量差距应让位于可部署性,或考虑未来工作提到的每前向发射多跳与权重量化,但原文未给出这些方向的数字,不能预支效果。

一句话收束:延迟由读出决定而非输入长度,窗口决定拐点,前视在计算量不变下换质量;同算法延迟下质量可相当,但同硬件下可部署性仍只有 HT-Demucs 达标,是否采用取决于延迟预算、算力与训练数据差异能否接受。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-30 语音/音乐/音频论文速递