英文题目:Anatomy-aware cross-speaker adaptation of complete vocal-tract acoustic-to-articulatory inversion

标签:#语音属性识别 | #领域适应 | #语音 | #发声与构音

评分:5.9/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1/1.5 | 清晰度 0.8/1 | 影响力 0.7/1.5 | 开源 0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.7/1.5

👥 作者与机构

  • Nhat-Nam Nguyen:机构信息未在 arXiv HTML 中可靠披露
  • Pierre-Andre Vuissoz:机构信息未在 arXiv HTML 中可靠披露
  • Yves Laprie:机构信息未在 arXiv HTML 中可靠披露

📌 核心摘要

该工作处理跨说话人声学到发音反演,输入为声学倒谱特征,输出为从声门到唇部的10个声道结构轮廓,难点在于解剖形态与发音策略个体差异导致固定模型几何失配。方法链分为三步:先用双全连接加双向长短时记忆网络固定模型在参考人空间预测轮廓,再以单帧/u/标定提取椎体与牙齿为主的解剖标志点估计仿射变换实现全局尺度姿态对齐,最后以薄板样条对仿射后标志点做非刚性插值并逐点映射全部轮廓。仿射输出的变换后标志点直接作为样条插值的源端约束进入下一步,单说话人映射复用于全部录音而无需重训。与纯仿射基线相比,该机制用光滑形变显式分离全局对齐与局部解剖差异,新增下切牙对应点约束下颌区域。在八说话人跨说话人适应评测下,所提Affine12+TPS14配置的指标平均点到最近点距离P2CPmean为3.19 mm,低于主要仿射基线Affine14的指标平均点到最近点距离P2CPmean 3.69 mm。该结论的适用边界受限于法语单参考人、中矢状面轮廓与单帧/u/标定,喉部与唇部残留较大误差且P4出现退化,跨语言与多参考人场景尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。

可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,为什么直接套用会失败?

这篇论文的输入是声音的声学特征,目标是重建正中矢状面上的完整声道轮廓。研究对象不是识别说了什么音素,而是从每 1 帧声音反推发音器官在磁共振图像中的形状。训练只用一个法国女性说话人的长时间实时磁共振数据,测试是另一个多说话人库中的 8 个人。

必须保留的关键信息是输出包含 10 个结构:上唇、下唇、舌、软腭中线、咽后壁、会厌、杓状软骨、声带、上门齿和下门齿,每个结构用 50 个 2 维点表示,因此 1 帧输出是 1000 个坐标。评价用毫米为单位的轮廓距离。资源状态方面,本次没有发现来源绑定且完成验证的资源,因此不得声称代码模型或数据已公开。

声学到发音反演 × 完整声道轮廓: 声学到发音反演负责从声音推断发音动作,完整声道轮廓负责规定要推断到什么粒度;前者是任务方向,后者把输出从稀疏电磁点扩展到从声门到唇的 10 条连续轮廓,二者搭配的理由是只有轮廓才能同时约束舌、咽壁和喉部,组合意义是把评价从几个点的回归变成整条声道的几何重建。

研究生复述时要抓住矛盾:同一个音在声学上接近,但在不同人的声道里对应的几何位置完全不同。如果把单说话人模型直接用于新说话人,论文报告未适应时 8 个目标说话人的平均误差达到 8.87 mm,而模型在训练说话人自身上只有 1.40 mm 左右。这说明主要困难不是声学建模不够强,而是解剖几何失配。后续所有设计都是为了解决这个失配,同时不重新训练反演模型。

已有路线解决了哪一段,还剩哪一段没有解决?

与本论文同输入同目标的工作包括用电磁发音仪跟踪稀疏传感器点,以及用实时磁共振重建图像或分割轮廓。电磁发音仪只能贴在易触及的发音体上,看不到咽部和喉部,而实时磁共振能看到从声门到唇的完整正中矢状解剖。论文沿用的是从声音直接预测完整轮廓的路线,因此输出比稀疏点更完整,但对说话人差异更敏感。

同运行阶段的适应方法包括声道长度归一化和自监督语音表示,它们主要在声学端做归一化。几何配准方面已有工作在电磁发音仪系统之间做仿射映射,也有人用网格定义标志点加薄板样条把多说话人数据归一化到公共模板。还有工作联合估计解剖与发音,或用静态磁共振条件生成动态磁共振。

本论文的不同点是调用阶段固定反演模型,只用 1 帧解剖标定做参考到目标的几何搬运。它不更新网络权重,不需要目标说话人的连续轮廓序列,只需要 1 帧元音/u/上的骨性和齿性标志点对应关系。这种单帧标定加复用的约束是理解实验设计的关键,也是与多说话人联合训练路线的区别。

要把一个说话人的预测搬到另一个人身上,难在哪里?

可以把问题拆成两步。第一步是反演:给定声学帧序列,输出参考说话人坐标系下的 10 条轮廓。第二步是适应:给定参考说话人与目标说话人在某 1 帧上的标志点对应,把第一步输出的每一点搬到目标说话人坐标系。难点在于 2 人的头姿、口腔咽腔比例、下颌位置和喉位置都不同,简单的整体平移缩放不够,而逐帧配准则需要目标真值,不符合实际部署条件。

论文把标定帧选为/u/元音,取自 ASD2 的 pour 和 ASD1 每个目标说话人的 pourri 中/u/中点附近帧。选择/u/的理由是其发音构型相对受限,但论文明确说明不假设不同说话人发音完全相同。举例来说,这只是一个教学例子:好比让两个人分别发同一个/u/拍照,即使舌位不完全一样,牙齿和颈椎的位置仍可提供稳定的锚点。标定只做 1 次,每个目标说话人估计一个映射,之后所有录音复用该映射。

另一个难点是评价。跨说话人时预测轮廓与真值轮廓的点序号不一定对应,不能直接算逐点误差。论文因此采用双向最近点平均距离,它对点的采样方式不敏感,更适合评价形状是否贴合。

固定模型加外挂映射的全流程是怎样的?

沿一个样本走完流程有助于复述。输入是一段语音,先提取 13 维梅尔频率倒谱系数及其 1 阶 2 阶差分,共 39 维,窗长 25 毫秒,帧移 10 毫秒。磁共振轮廓每 20 毫秒采样 1 次,通过在相邻轮廓之间取坐标平均对齐到 10 毫秒声学网格。反演主干是两层全连接层加两层双向长短时记忆网络,每层 300 个单元,输出是参考说话人空间下归一化后的 1000 维坐标,再用训练集全局均值方差反归一化回毫米坐标。

得到参考轮廓后,进入几何适应。对每个目标说话人,事先在其/u/标定帧上标出 12 或 14 个标志点,在参考说话人标定帧上也有对应点。先用 12 点估计仿射变换,再把仿射后的 14 点作为控制点拟合薄板样条。推理时每 1 帧的每一条预测轮廓都先做仿射,再做样条,逐点映射到目标空间。这个映射在该说话人的所有测试句中保持不变。

需要强调的是反演模型在适应阶段被冻结,论文保留验证集均方根误差最低的检查点,不再更新。适应不使用目标说话人的轮廓序列来估计归一化统计量,归一化始终用参考训练数据的全局统计量。这保证了方法在只有 1 帧标定图像时仍可运行。

12 个点和 14 个点分别锚定哪里,为什么这样选?

标志点设计是本方法的核心操作。12 点配置包括沿上门齿与硬腭下边界采样的 5 个点 I1 到 I5,6 个颈椎中心 C1 到 C6,以及咽壁上的后部点 P1。P1 定义为经过 I5 与 C1 中心直线与咽壁轮廓的交点。骨性和齿性点随发音变化小,适合做锚点,P1 补充咽壁对应。14 点配置在 12 点基础上增加 M1 和 L6,分别是正中矢状图像上下门齿轮廓的上极值与下极值,用于扩展到下前口腔并约束下颌对齐。

解剖标志点 × 仿射变换: 解剖标志点负责给出跨说话人可对应的骨性和齿性锚点,仿射变换负责用平移旋转缩放错切做全局对齐;前者提供对应关系,后者提供自由度受限的整体映射,二者搭配是因为骨性结构随发音变化小,组合意义是先把参考说话人坐标系整体搬到目标说话人附近,再留残差给非刚性步骤处理。

下面导读图 1,图前需要先明确要比较的对象。该图左右并排显示 12 点与 14 点配置,灰线为声道示意轮廓,蓝色圆点为共用点,橙色菱形为新增点,时间范围是单帧标定示意,不涉及曲线随时间变化。

看图路径: 1. 对比左右两幅子图,确认蓝色圆点 12 个与橙色菱形 2 个的位置差异;2. 沿上门齿 I1 到 I5 连线看口腔前上边界,再沿 C1 到 C6 看颈椎纵列;3. 找到右侧新增的 M1 在上门齿下方与 L6 在下端极值处

原论文 Figure 1:Anatomical landmark configurations used for geometric adaptation.

论文图 1。原论文 Figure 1::“Anatomical landmark configurations used for geometric adaptation.”。

从像素可见,左图上门齿区从前向后依次标出 I1 到 I5,右侧纵列从上到下为 C1 到 C6,P1 位于咽壁上部靠近 C1 高度。右图在左图基础上于前下口腔增加 M1 与 L6 两个橙色菱形,M1 靠近上门齿下缘,L6 位于更下方的极值处。图下方图例明确区分共用标志点与新增下门齿标志点。这说明新增点的作用是把下颌信息显式加入控制点集,为后续非刚性变形在前下区域提供约束。

仿射加薄板样条如何分工计算?

先解释符号与输入。设参考标志点为 lR,k,目标标志点为 ls,k,均为 2 维坐标。仿射参数包括 2 乘 2 矩阵 A 与 2 维偏置 b,作用于任意参考点 p 得到整体对齐后的点。薄板样条输入为仿射后的控制点 cs,k 与目标对应点 ls,k,输出为最终目标坐标。核函数为 U(r) 等于 r 平方乘 log r,r 为欧氏距离,零处取零。拟合采用精确插值,零平滑,1 次多项式项。

计算目标是最小化 12 个共用点上的平方误差得到仿射,再以 14 个仿射后点为基拟合样条系数。原文明确的实现是先用 12 点估计仿射,然后把全部 14 个参考标志点经仿射变换得到 cs,k,再从 cs,k 到 ls,k 拟合样条。完整映射为先仿射后样条的串联,逐点作用于预测轮廓。

\[(\mathbf{A}_{R\to s},\mathbf{b}_{R\to s})=\underset{\mathbf{A},\mathbf{b}}{\arg\min}\sum_{k=1}^{12}\lVert\mathbf{A}\mathbf{l}_{R,k}+\mathbf{b}-\mathbf{l}_{s,k}\rVert_{2}^{2}.\]

上式是仿射估计目标,对 12 个点求最小二乘。它只允许平移旋转缩放与错切,因此自由度少,不易过拟合,但无法表达局部弯曲。薄板样条在此基础上增加以控制点为中心的径向基弯曲,保证经过控制点的同时整体光滑。

\[G_{R\rightarrow s}(\mathbf{p})=T_{R\rightarrow s}^{\mathrm{TPS}}\bigl(T_{R\rightarrow s}^{\mathrm{Affine}}(\mathbf{p})\bigr).\]

上式是完整映射的串联形式。复述时要记住顺序不能颠倒:必须先仿射,再以仿射后点为自变量做样条。论文比较的 4 种配置正是围绕这一点展开:A12 与 A14 为纯仿射,A12 加 T12 与 A12 加 T14 为仿射后加样条,其中 T 后面的数字表示样条使用的控制点数。

仿射变换 × 薄板样条变形: 仿射变换负责全局线性对齐,薄板样条变形负责在标志点约束下做光滑非刚性弯曲;前者解决身高和头姿带来的整体尺度与旋转差异,后者解决咽腔长短和下颌位置等局部形状差异,搭配理由是先线性后非线性可以避免样条在远离标志点处过度弯曲,组合意义是得到公式 4 的 2 级串联映射。

模型在单说话人库上如何训练,适应时冻结了什么?

训练发生在 ASD2 单说话人库,约 3.5 小时语音,约 2100 句,153 次采集。该说话人同时作为 ASD1 中的 P10 出现,但论文指出两库头姿不同,会改变声道形状特别是咽部,因此参考标定帧使用配准后的 ASD2 帧,而不是 ASD1 中 P10 的帧,以匹配模型预测的几何。ASD2 采集先做静态头配准,参考标志点在配准后与训练轮廓同一坐标系中标定。

与前人局部滑动归一化不同,本研究为几何适应改用全局坐标统计量,只从参考训练数据计算均值与方差,验证与推理复用该统计量反归一化。这意味着没有用目标说话人轮廓序列估计归一化参数。训练划分与设置沿用前人工作,保留验证均方根误差最低的检查点并在适应中固定。

全局归一化 × 几何适应: 全局归一化负责把发音坐标按训练集均值方差转到模型输入输出空间,几何适应负责把模型输出的参考空间轮廓搬到目标说话人空间;前者在训练和推理时都只用参考说话人统计量,后者在推理后作用于坐标点,二者分工使反演模型本身不需要见到目标说话人,组合意义是冻结模型加外挂映射即可跨库测试。

没有训练的环节必须说清楚:适应阶段没有训练神经网络,没有梯度更新,没有重置优化器,也没有用目标语音做微调。真实计算只有两部分,一是用最小二乘求仿射矩阵与偏置,二是解线性方程组求薄板样条系数与多项式项。每个目标说话人各求解 1 次,之后纯前向应用。因此复现时不需要准备目标说话人的大量标注语音,只需要 1 帧标定图像上的标志点坐标。原文未报告求解耗时与硬件预算,这是缺项,不猜测延迟。

在谁身上测,与谁比,指标如何聚合?

评估库是 ASD1 多说话人库,5 男 5 女母语者,每人约 15 分钟 77 句,分布在 16 个会话。评估用 P1 与 P3 到 P9 共 8 人,排除 P2 是因为喉部可见性不足无法可靠评价保留结构。评估数据约 13 万非静音帧。输出的 10 个结构在评价前各自用 20 个子区间 2 次 B 样条正则化,正则参数 0.1,再重采样到 50 点。

指标为平均点到最近点距离,方向是越小越好。公式先对两条曲线双向求最近距离再平均,距离单位为毫米。聚合方式是先在会话内按帧平均,再在会话与说话人间等权重平均,结构间总体平均也等权重。标准差描述帧级误差的离散。统计用双侧配对 t 检验,未校正显著性水平 0.05,结构级与总体检验以 8 个说话人的会话平衡均值为配对观测,会话内检验以会话均值为观测。

\[\mathrm{P2CP}_{\mathrm{mean}}(\mathbf{u},\mathbf{v})=\frac{1}{2N}\sum_{i=1}^{N}\left[\min_{j}d(\mathbf{u}_{i},\mathbf{v}_{j})+\min_{j}d(\mathbf{v}_{i},\mathbf{u}_{j})\right],\]

上式中 u 与 v 为两条各 50 点的轮廓,d 为欧氏距离,N 为 50。它不要求点序号对应,适合跨说话人几何评价。

点到最近点平均距离 × 逐点均方根误差: 逐点均方根误差要求预测点与真值点序号一一对应,点到最近点平均距离只要求两条曲线在双向最近距离上接近;前者在跨说话人采样不一致时不适用,后者允许轮廓点分布不同,搭配理由是评价几何形状而非点序号,组合意义是论文用 P2CPmean 作为跨说话人主指标并先做 B 样条正则化重采样。

比较条件方面,所有配置共享同一组预测、同一标定帧、同一评价数据与公共标志点定义。基线包括未适应的 Raw,只用 12 点或 14 点做仿射的 A12 与 A14,以及仿射加样条的 A12 加 T12 与 A12 加 T14。其中 A14 是主仿射基线,因为它与所提 A12 加 T14 使用相同的总体标志点集。另设 Full7 子集,排除杓状软骨、会厌与声带三喉部结构,用于检验改善是否超出喉部。

最好配置把误差降到多少,代价在哪里?

先提出比较问题:在相同预测与相同标定条件下,增加标志点与增加非刚性变形各自带来多少收益,指标方向为毫米误差越小越好。下表整理总体误差,公平条件是共享预测与评价集,主基线为 14 点仿射。

配置评价范围未适应 Raw仿射 12 点仿射 14 点基线所提仿射 12 加样条 14比较对象
总体Full108.87 mm4.10 mm3.69 mm3.19 mm8 个目标说话人平均
总体参考自身1.40 mm4.10 mm3.69 mm3.19 mm跨库失配对照
总体样条 12 点对照8.87 mm4.10 mm3.69 mm3.75 mm相同 12 点加样条

表后解释主要收益与具体代价。所提 A12 加 T14 的 Full10 为 3.19 mm,相对主基线 A14 的 3.69 mm 下降约 13.6%,配对检验 p 等于 0.025。所有适应配置都优于 Raw 的 8.87 mm,说明几何搬运本身是最大收益来源。但代价是改善不均匀,会厌与软腭误差略有上升,P4 说话人从 2.95 mm 升到 3.17 mm 且显著,说明固定映射不能保证每人每结构都获益。参考说话人自身的 1.40 mm 仍远低于跨说话人最好结果,表明残差依然明显。

下面导读图 2,该图为 P8 在 avec 中/k/帧的单样本可视化,不是分布曲线。五幅面板共享同一磁共振背景,橙色实线为预测,青色虚线为真值,下方标注该帧 P2CP 值,左下文字给出说话人会话帧号音素与单词。

看图路径: 1. 先看左下图例,确认橙色实线为预测、青色虚线为真值;2. 对比(a) 未适应与(e) 最好配置下舌体与咽壁曲线贴合程度;3. 读每幅子图下方 P2CP 数值,确认从 12.84 mm 到 1.89 mm 的变化

原论文 Figure 2:Adaptation example for P8 containing /k/ in avec.

论文图 2。原论文 Figure 2::“Adaptation example for P8 containing /k/ in avec. Orange solid: predictions; cyan dashed: ground truth. Frame-level P2CP errors are shown below each panel.”。

从像素可见,(a) 未适应时橙色曲线与青色真值大面积错位,该帧达 12.84 mm。(b) 仿射 12 点降到 3.36 mm,(c) 仿射 14 点为 3.01 mm,(d) 仿射 12 加样条 12 为 3.23 mm,(e) 所提配置为 1.89 mm。可见舌体穹隆与咽壁在(e) 中最贴合,但喉部分叉处仍有残差。该单帧不能推广为全程结论,需结合总体均值与说话人表一起读。

多两个点与加样条各自贡献多少,哪个结构最敏感?

本节的比较问题是标志点覆盖与非线性对齐的独立贡献。公平条件仍是相同预测与标定,指标为分结构 P2CPmean,方向越小越好。下表聚焦论文明确报告差值的结构,保留原文数值与单位。

结构指标仿射 14 点基线所提方法绝对变化显著性
声带P2CPmean6.07 mm4.86 mm下降 1.21 mm未报告显著
舌P2CPmean4.06 mm3.62 mm下降 0.44 mm不显著

表后解释机制与反例。A14 相对 A12 的提升来自多两个下门齿点对仿射的约束,A12 加 T12 相对 A12 的提升来自相同点集下增加非线性,而 A12 加 T14 最好,支持新增点有助于约束非刚性适应的判断。舌误差下降 10.8% 但不显著,说明舌体改善有限。分结构仅杓状软骨与下门齿显著,会厌从 4.29 mm 升到 4.39 mm,软腭从 2.83 mm 升到 2.88 mm,表明样条在标志点稀疏区可能带来轻微负作用。未胜出项必须指出:A12 加 T12 的 Full10 为 3.75 mm,差于纯仿射 A14 的 3.69 mm,说明只加非线性而不补点并不稳定。

残差与回退说明什么,哪些验证还没有做?

论文直接报告的是误差数值下降与部分显著性,有限解释是解剖标志信息与非刚性对齐的联合价值,未验证推测是性别相关口咽比例与喉位置的具体贡献。原文讨论明确说残差喉部误差可能与解剖差异有关,但其贡献在此未分离,这是待验证而非定论。

必须就近说明未评测边界。第一,固定映射只能部分刻画说话人特异发音,ASD1 录音未经配准的姿态差异会跨帧影响形状,单帧标定无法补偿动态姿态变化。第二,对标定帧选择与标志点标注的敏感性尚未量化,P4 的显著回退提示标注或解剖特殊性可能主导个别结果。第三,唇部变异性大,上唇在 A14 为 3.89 mm 而 A12 为 3.42 mm,说明不同配置对唇的效应方向不一致。

从部署角度看,原文未测量误判率之外的延迟、标注成本与推理开销,也未报告求解样条的计算预算,因此不能承诺该方法改善了实时性。总体趋势不等于每组每步成立:7 人显著改善不代表第 8 人改善,6 个结构最低不代表 10 个结构都最低。复述时要用报告显示与支持可能待验证区分语气,避免把相关性说成因果。

下表整理说话人级反证,公平条件为相同评价协议,指标越小越好。

说话人指标未适应主基线仿射 14所提方法结论
P4Full108.14 mm2.95 mm3.17 mm显著回退
P8Full1014.22 mm3.79 mm3.24 mm改善最大者之一
全部 8 人范围8.87 mm3.69 mm3.19 mm总体显著但不均匀
P5 最佳Full104.42 mm2.93 mm2.46 mm最低绝对误差
P1Full109.71 mm5.33 mm3.95 mm大幅改善仍偏高

表后补充代价。P8 未适应高达 14.22 mm,说明初始失配最大者经适应仍可降到 3.24 mm,但 P4 本已较低的 2.95 mm 反而被样条推高,提示对已对齐较好的说话人应谨慎使用强非刚性。说话人级误差范围 2.46 到 3.95 mm,离散仍大,说明单帧标定不能抹平个体差异。

要复现这个结果,第一步先做什么,需要哪些超参数?

复现先做数据与标定准备,而不是先调网络。需要 ASD2 单说话人训练集与 ASD1 的 8 个评估说话人,排除 P2。声学按 25 毫秒窗 10 毫秒跳提取 13 维梅尔倒谱加一二阶差分共 39 维,轮廓每 20 毫秒采样后经相邻平均对齐到 10 毫秒网格。反演主干为两层全连接加两层双向长短时记忆网络各 300 单元,用训练集全局均值方差归一化,保留验证均方根误差最低检查点并冻结。

标定操作是为每个目标说话人选 1 帧/u/中点附近帧,ASD2 用 pour,ASD1 用 pourri,依据人工校正的 TextGrid 分段且与重建误差无关。参考帧排除在评价之外。在该帧上按定义标出 I1 到 I5、C1 到 C6、P1 以及 M1 与 L6,其中 P1 为过 I5 与 C1 中心直线与咽壁交点,M1 与 L6 为下门齿上下极值。先用 12 点最小二乘求仿射,再用 14 个仿射后点精确插值求薄板样条,零平滑,1 次多项式。

评价前对预测与真值轮廓各自做 20 子区间 2 次 B 样条正则化,正则参数 0.1,重采样到 50 点,再算双向最近点平均距离,先会话内平均再等权重平均到说话人与总体。统计用未校正 0.05 双侧配对 t 检验。缺项是代码权重与标注工具链不可用,本次只能按文字复述流程,不能声称系统可运行。若要补验证,应先做标定帧扰动与多人重复标注一致性,再报告推理耗时与内存。

何时值得尝试这个方法,如何一句话记住它?

当你只有一个说话人的高质量配对数据,又必须在新说话人上输出完整声道形状,且只能负担 1 帧磁共振标定时,这个仿射加样条的外挂映射值得尝试。它不碰声学模型,只搬几何,因此适合跨库冷启动。反之,若目标说话人已有连续标注语音,或唇与喉部精度是首要目标,则应先补多说话人训练与局部约束,而不是指望固定样条解决全部残差。

一句话记住:用牙齿与颈椎把整体对齐,用下门齿两点把前下口腔压住,再让薄板样条做光滑弯曲。论文的证据支持新增点加非线性的组合,但也显示会厌软腭与个别说话人可能回退。学习时先沿单样本走完声音到参考轮廓再到目标轮廓,再回看公式与表格,才能把数字与机制对应起来,避免把单帧示例当成总体保证。

📎 论文与评分元数据

排名:前50% | 文档类型:方法研究 | arXiv 原文

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1

  • 评分模型:muse-spark-1.3-contributor

  • 评分请求协议:openai_responses


← 返回 2026-09-25 语音/音乐/音频论文速递