STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

📄 STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation #音频生成 #变分自编码器 #正则化微调 8.8/10 | 创新 1.8/2 | 严谨 1.4/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.8/10 | 前25% | #音频生成 | #变分自编码器 | #正则化微调 | arxiv 👥 作者与机构 未说明机构信息。作者:Huadai Liu, Wen Wang, Kaicheng Luo, Qian Chen, Xiangang Li, Wei Xue。 💡 毒舌点评 这篇论文定位清晰,问题(R-D-R三难困境)定义具有洞察力,提出的STAR正则化在理论上合理且实验上有效。STAR-VAE的混合架构设计和STAR-Gen的LLM流匹配框架都展示了不错的工程整合能力。然而,论文的“开源”声明需要澄清——实际上只提供了项目主页,并未开源代码或模型权重,这对于一篇声称“通用”和“优越范式”的工作来说略显不足。实验比较全面,但部分消融分析(如Appendix C.1的γ值选择)可以更深入。最大的弱点在于对“Reconstruction Drift”现象的实证分析主要依赖间接指标(如ablation),缺乏更直接的可视化或量化证据来证明高容量编码器在各向同性约束下会优先丢失纹理信息。 📌 核心摘要 本文针对连续音频变分自编码器(VAE)中各向同性高斯先验导致的“率-失真-正则化三难困境”提出了系统解决方案。通过形式化定义三难困境,作者指出平坦的潜空间拓扑无法容纳音频的层级信息结构(结构化的低频与随机的高频)。为此,提出结构化拓扑感知正则化(STAR),通过Gamma增长函数对潜空间通道施加非均匀的KL惩罚,诱导形成与音频信息密度对齐的容量梯度,从而将结构信息路由至高容量通道,随机纹理分配至低容量通道。基于此,构建了STAR-VAE,采用混合CNN-Mamba架构,在保证线性复杂度全局建模能力的同时,借助STAR正则化避免了高容量编码器可能出现的“重建漂移”。进一步,提出了STAR-Gen,一个基于LLM的流匹配框架,利用STAR-VAE的结构化潜空间实现高质量的文本到音频生成,避免了向量量化伪影。大量实验表明,STAR-VAE在相同潜空间率下显著优于现有基线,STAR-Gen也达到了文本到音频生成的新水平。 ...

2026-06-23 · 更新于 2026-07-30 · 5 min · 1004 words

Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead

📄 Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead #语音合成 #知识蒸馏 #自回归模型 6.7/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.4/0.5 | 工程 0.6/1.5 ✅ 6.7/10 | 前25% | #语音合成 | #知识蒸馏 | #自回归模型 | arxiv 👥 作者与机构 作者:Muyang Du, Jason Roche, Junjie Lai 机构:NVIDIA China, NVIDIA USA 💡 毒舌点评 这篇工作像是给“语音合成流水线”加了个“预读窗口”。想法很直接——别等整句文字吐完再开始发声,看着前面几个词就能动嘴了。技术包装上,T5架构加上精心设计的掩码和对齐模块,看起来挺唬人。但仔细想想,所谓的“有限前瞻”本质上是对注意力机制的硬约束,有点“削足适履”的味道。实验部分倒是花了不少力气,各种消融和对比,但baselines的选择和训练数据的差异(特别是与SOTA对比时)让说服力打了折扣。最让人皱眉的是“开源”部分的空白,这对于一个号称实用且解决了实际问题的工作来说,有点说不过去——你解决了延迟,却不让我们方便地验证和使用,这“实用价值”就悬在半空了。 📌 核心摘要 本文提出了S5-TTS,一个基于T5的流式文本到语音合成模型,旨在解决级联LLM-TTS系统中因TTS需要完整上下文而产生的高端到端延迟问题。S5-TTS通过引入前瞻因果掩码(lookahead-causal masking)机制和基于卷积的辅助注意力模块,实现了在有限前瞻(即每个词合成时仅能看到其自身、前面所有词和k个未来词)下的词级增量语音合成。为了补偿有限前瞻造成的自然度损失,作者采用了交错多源蒸馏(Interleaved Multi-Source Distillation, IMSD)策略,利用全上下文的T5-TTS作为教师模型,同时使用配对的文本-音频数据和经过ASR过滤的合成文本数据进行监督。实验表明,当k=2时,S5-TTS在可懂度(WER)和说话人相似度(SSIM)上与全上下文T5-TTS相当,主观质量(MOS)接近,同时显著降低了端到端语音响应延迟。 🔗 开源详情 代码:论文中未提及代码链接。 模型权重:论文中未提及模型权重链接。 数据集:论文中使用了LibriTTS、HiFiTTS和UltraChat-200k数据集,但未提供这些数据集的具体下载链接、处理脚本或合成数据的详细获取方式。 Demo:https://s5-tts.github.io/ 复现材料:论文中提及了详细的训练配置(GPU型号、批量大小、优化器、学习率等),但未提供完整的训练代码、配置文件或检查点下载链接。 论文中引用的开源项目:T5-TTS, NeMo, phonemizer, Parakeet-TDT, E2-TTS, FireRedTTS, MaskGCT, CosyVoice, Llama 3.3 70B, Ollama。论文引用了这些项目,但未提供直接链接,也未说明S5-TTS的开源实现依赖于其中哪些项目的官方代码库。 🏗️ 方法概述和架构 S5-TTS的核心架构是基于T5的编码器-解码器Transformer,专为流式合成设计。 ...

2026-06-23 · 更新于 2026-07-30 · 3 min · 514 words

Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS

📄 Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS #语音合成 #流匹配 7.2/10 | 创新 1.4/2 | 严谨 0.9/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.2/10 | 前50% | #语音合成 | #流匹配 | arxiv 👥 作者与机构 Seymanur Akti, Alexander Waibel。单位:卡尔斯鲁厄理工学院 (KIT), 卡内基梅隆大学 (CMU), KIT Campus Transfer (KCT)。 💡 毒舌点评 这篇工作在“模拟朗伯效应”这个实际问题上动了心思,双轴控制的概念也直观。但作为顶会论文,细节经不起推敲。伪标签的定义像“拍脑袋”,词级控制把 \(\beta\) 拉到 1.5 超出范围,理论依据一句“为了感知显著性”就带过了,这很不严谨。实验基线用简单信号处理,这有点欺负人,和最新的神经网络可控TTS比比看?作者自己都承认WER在极端条件下可能失效,但又拿它作为主要可懂度指标,结论的基石就有点晃。总的来说,想法不错,但打磨和验证的功夫还差火候,离“扎实”的距离比评分显示的要远。 ...

2026-06-23 · 更新于 2026-07-30 · 2 min · 282 words

The Anatomy of the CTC Oracle Gap: Acoustic Exhaustion and Linguistic Recovery

📄 The Anatomy of the CTC Oracle Gap: Acoustic Exhaustion and Linguistic Recovery #语音识别 7.3/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.3/10 | 前50% | #语音识别 | #语音识别 | arxiv 👥 作者与机构 作者: Ivan Novosad 邮箱: ivan.novosad@hse.ru 机构: HSE University 💡 毒舌点评 这篇论文做了一件干净利落的事:给CTC的解码能力办了场“追悼会”,然后证明了“续命”的唯一方法是找外援(语言模型)。其诊断部分(11种内部方法全军覆没)堪称经典,像一场精心设计的尸检,无可辩驳地指出了CTC“声学力竭”的死因。提出用RoBERTa PLL构建MBR后验的方案也确实有效,跨条件泛化实验做得扎实。最有趣的是对MWER训练失败的剖析,那两个失败模式的对比(没信号 vs 扭曲地形)颇有深度。不过,作者在理论连接上似乎有些“手软”——Rao-Blackwell化这部分明明是个漂亮的理论卖点,却主要停在了经验验证层面。另外,计算开销这个“房间里的大象”被完全忽略了。总的来说,这是一篇分析透彻、实验严谨的“诊断式”论文,其最大价值在于清晰地划定了CTC模型的能力边界,并指明了突破方向。 📌 核心摘要 本研究深入剖析了基于连接主义时间分类(CTC)的自动语音识别(ASR)系统在解码阶段的能力瓶颈。研究首先通过系统性实验(11种CTC内部评分策略)证明,在波束宽度\(G=16\)时,任何基于CTC后验或编码器特征的重排序方法均无法带来统计显著的词错误率(WER)降低,其根本原因在于CTC的评分与WER之间的排名相关性(Spearman \(\rho\))随候选列表增大而急剧下降(从\(G=4\)时的-0.574降至\(G=128\)时的-0.270),表现出“声学力竭”。这表明瓶颈存在于声学模型与语言逻辑之间,而非声学模型内部。作为验证,研究引入外部语言信息:使用预训练RoBERTa模型计算候选句子的伪对数似然(PLL)分数,并以此构建后验概率分布进行最小风险(MBR)解码,损失函数为字符错误率(CER)。在LibriSpeech test-other数据集上,该方法(\(G=128\), \(\tau=10\))取得了5.42%的WER,相比贪心解码(5.96%)有9.0%的相对降低,且该结果在13个跨架构、跨领域、跨噪声的测试条件中的11个中显著,无需参数调整。在训练侧,研究分析了最小字错误率(MWER)序列级微调在接近收敛的CTC模型上失败的机制,识别出两种模式:在CR-CTC模型上因训练集oracle gap极小(0.007 pp)导致的奖励信号缺失和灾难性崩溃;在标准CTC模型上因损失曲面几何性质导致的轻微漂移或RA FT微调的坍塌。本研究核心结论是,CTC模型的解码瓶颈是表征性的而非架构性的,MBR与PLL的结合有效突破了该瓶颈。 ...

2026-06-23 · 更新于 2026-07-30 · 3 min · 586 words

The Watermark Shortcut: How Provenance Marking Sabotages Audio Deepfake Detection

📄 The Watermark Shortcut: How Provenance Marking Sabotages Audio Deepfake Detection #数据增强 6.8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0.3/1.5 | 复现 0.4/0.5 | 工程 0.7/1.5 ✅ 6.8/10 | 前50% | #数据增强 | #数据增强 | arxiv 👥 作者与机构 Nicolas M. Müller, Pascal Debus 德国联邦教育与研究部(BMBF)项目 AIgenCY 💡 毒舌点评 这篇论文抓住了一个行业实践的痛点,问题本身是有趣且重要的。但作为一篇声称揭示“漏洞”的论文,其技术深度和评估的全面性值得商榷。所谓的“捷径学习”是机器学习老生常谈的概念,本文将其应用于音频水印与检测的特定场景,新颖性有限。实验部分,白盒验证设计得不错,控制变量清晰;但黑盒实验仅针对一个未知商业API,结论的普适性存疑。提出的缓解方法——在训练时对所有语音都加水印——过于简单,甚至有点“天真”,完全没有考虑水印本身的引入是否会影响检测器对真实伪造伪迹的判别能力,或者引入新的脆弱性。论文更像是对一个现象的观察报告,而非一篇具有深度分析和稳健解决方案的顶会工作。更令人不满的是,论文声称发布了WASP数据集,但代码和模型权重均未开源,这在当今顶会标准下是明显减分项。 📌 核心摘要 本文指出,在音频深度伪造检测领域,一种普遍的行业实践——仅为合成语音添加溯源水印——会在训练数据中引入“水印 ⇨ 假货”的虚假相关性。这导致检测器学习到一个简单的“捷径”特征,而非真正的语音伪造伪迹。该捷径引发三种耦合的失败模式:1)泛化能力下降,在标准(无水印)数据上表现变差;2)“去除水印以规避”:移除假货上的水印可使其逃脱检测;3)“添加水印以栽赃”:给真实语音添加水印会被误判为假货。通过白盒实验(AASIST检测器,ASVspoof19数据集)和黑盒实验(商用API测试),论文证实了这一现象。作者发布了配对的“干净-水印”语音数据集WASP以供研究,并提出了一种简单的训练增强策略(对所有语音都应用水印)来消除此捷径。 🔗 开源详情 代码:论文中未提及代码链接,未开源。 模型权重:论文中未提及,未开源。 数据集:WASP (Watermarked Audio for Spoofing Paired)。 论文中给出的获取链接为:https://huggingface.co/datasets/mueller91/WASP Demo:论文中未提及。 复现材料:论文中未提及具体复现材料(如配置文件、脚本或检查点)。论文中描述了实验设置(使用AASIST检测器、ASVspoof19数据集、三个种子进行训练),但未提供可下载的完整材料。 论文中引用的开源项目: Chatterbox (及 Chatterbox-Turbo):由Resemble AI开发的文本到语音系统,开源并默认嵌入了PerTh水印。论文中未提供具体链接。 DramaBox:论文中提及的TTS系统之一,具体链接未提供。 Kyutai:论文中提及的TTS系统之一,具体链接未提供。 Orpheus:论文中提及的TTS系统之一,具体链接未提供。 Sesame CSM:论文中提及的TTS系统之一,具体链接未提供。 PerTh:由Resemble AI开发的神经音频水印技术,集成于Chatterbox中。论文中未提供独立链接。 WavMark:由微软开发的水印��术。论文中未提供链接。 AudioSeal:由Meta开发的音频水印技术,论文中提及“has open implementations”。论文中未提供具体链接。 SilentCipher:由索尼开发的水印技术。论文中未提供链接。 VITS, VALL-E, F5-TTS, CosyVoice:论文在相关工作中提及的神经语音合成系统,具体链接未提供。 M-AILABS, AISHELL-3:论文中提及的用于提供真实语音的数据集,具体链接未提供。 🏗️ 方法概述和架构 本文的方法主要分为现象验证(白盒与黑盒实验)和缓解策略提出两大部分。其核心架构并非提出新的检测模型,而是通过严谨的实验设计揭示现有训练范式下的漏洞,并验证一种训练策略的有效性。 ...

2026-06-23 · 更新于 2026-07-30 · 1 min · 199 words

Time-Frequency Weighted Losses for Phoneme Reconstruction in DNN-Based Speech Enhancement

📄 Time-Frequency Weighted Losses for Phoneme Reconstruction in DNN-Based Speech Enhancement #语音增强 #语音识别 7.8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.8/10 | 前25% | #语音增强 | #语音识别 | arxiv 👥 作者与机构 Nasser-Eddine Monir, Paul Magron, Romain Serizel Université de Lorraine, CNRS, Inria, LORIA, F-54000 Nancy, France 💡 毒舌点评 这篇论文的动机不错,抓住了标准SDR损失“一刀切”的痛点,并试图从语音感知角度进行改进。所提出的TF加权框架,特别是引入频谱通量来捕捉辅音瞬态,是一个合理的思路。实验设计比较系统,对比了多种加权策略在不同噪声和SIR下的表现,并做了音素级别的细致分析,这点值得肯定。 然而,作为一篇顶会论文,其深度和广度仍有欠缺。首先,实验场景过于单一(仅限于FaSNet在4通道助听器配置下的任务),这严重限制了方法的普适性声称。其次,对关键负面结果(如可学习权重ℒ_learn在语音形状噪声下性能恶化)的分析流于表面,缺乏深入的机制探讨。第三,方法引入了多个超参数(τ₁, τ₂, γ, k),但论文对其敏感性几乎只字未提,仅报告了k的调优,这让人对方法的稳健性和易用性存疑。最后,缺少主观听感评估是一个明显的短板,毕竟最终目标是提升人类感知。总的来说,工作扎实但创新点不够突出,分析可以更深入,实验可以更全面。 ...

2026-06-23 · 更新于 2026-07-30 · 2 min · 408 words

Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings

📄 Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings #多模态模型 7.8/10 | 创新 1.6/2 | 严谨 1.3/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.8/10 | 前25% | #多模态模型 | #多模态模型 | arxiv 👥 作者与机构 作者:Byoungjun So, Jaejun Lee, Kyogu Lee 机构:首尔大学 (Department of Intelligence and Information, Interdisciplinary Program in AI, AI Institute) 💡 毒舌点评 论文的立意清晰,将说话人属性预测从闭集分类扩展到基于LLM嵌入的开放集空间,这个方向本身很有价值。关键词附加策略的设计很巧妙,其发现也颇具启发性——哪怕加个完全不相关的“apple”都能起到稳定流形的作用,这暗示其作用可能超越了简单的语义对齐,更像一种结构性的正则化。实验设计合理,不仅评估了闭集性能,还通过同义词任务验证了开放集能力,并进行了深入的几何分析来解释机理。然而,论文的“开放集”验证方式略显单薄,仅使用同义词作为测试案例,这本质上仍属于训练时见过的语义簇内的泛化,对真正“未见”属性的泛化能力未做验证。此外,所有实验均在单一、可能受限的LibriTTS-P数据集上进行,且未与更复杂的基线(如直接使用LLM进行零样本预测)对比,其结论的普适性和优越性有待更强证据支撑。代码未开源也限制了其可复现性和影响力。 📌 核心摘要 本论文针对传统说话人属性预测依赖闭集分类、缺乏语义丰富性和零样本泛化能力的问题,提出了一种基于LLM嵌入的开放集预测新框架。核心思想是将离散的属性标签映射到由LLM定义的连续语义空间中。为解决跨模态对齐的挑战,论文提出了两项关键技术:1) 关键词附加策略:为每个属性词附加一个领域关键词(如“speech”),将语义锚定到语音领域,从而将广泛语义表示结构化为紧凑、有判别力的流形。2) Top-k负损失:针对紧凑流形中可能出现的语义拥挤问题,该损失通过惩罚与预测结果相似度最高的k个负样本,建立更清晰的决策边界。在LibriTTS-P数据集上的实验表明,该方法在闭集任务上显著优于传统多标签分类基准,并在零样本同义词预测任务上保持了高性能,证明了其开放集泛化能力。进一步的几何分析(如Center Sim, Total Variance, PCA Log-det)定量证实了关键词附加策略能有效收缩和规整嵌入流形,而Top-k负损失在更紧凑的流形中能带来更大的性能提升。 ...

2026-06-23 · 更新于 2026-07-30 · 2 min · 388 words

Towards Detecting Neural Audio Codec Synthesized Heart Sounds

📄 Towards Detecting Neural Audio Codec Synthesized Heart Sounds #自监督学习 8.7/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 🔥 8.7/10 | 前50% | #自监督学习 | #自监督学习 | arxiv 👥 作者与机构 Chetia Phukan (UPES, India), Mujtaba Akhtar (NTHU, Taiwan), Kuwar Behera (VBSPU, India), Buduru (VBSPU, India), Girish Orcha (Independent Researcher, India), Mohd Bhavinkumar Vinodbhai (IIIT-Delhi, India), Swarup Ranjan (IIIT-Delhi, India), Arun Balaji (IIIT-Delhi, India)。 注:已有分析未提供此信息,根据原文补充。 ...

2026-06-23 · 更新于 2026-07-30 · 3 min · 523 words

Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio

📄 Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio #联邦学习 7/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7/10 | 前50% | #联邦学习 | #联邦学习 | arxiv 👥 作者与机构 Ran Piao (1), Tsai-Ning Wang (1), Martijn den Dekker (2), Linda Moonen (3), Hareld Kemps (4), Yuan Lu (1), Aaqib Saeed (1) 1 Eindhoven University of Technology, The Netherlands 2 Erasmus MC, The Netherlands 3 Rijnstate Hospital, The Netherlands 4 Máxima MC Hospital, The Netherlands ...

2026-06-23 · 更新于 2026-07-30 · 2 min · 357 words

Using Phonological-Level Wav2Vec2 for Mandarin Automatic Mispronunciation Detection and Diagnosis

📄 Using Phonological-Level Wav2Vec2 for Mandarin Automatic Mispronunciation Detection and Diagnosis #语音识别 #自监督学习 8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 8.3/10 | 前25% | #语音识别 | #自监督学习 | arxiv 👥 作者与机构 作者:Chen, Shahin, Ahmed 机构:School of Electrical Engineering and Telecommunications, UNSW, Australia 💡 毒舌点评 论文提出解决一个实际问题(普通话MDD的细粒度诊断),动机合理,框架设计也系统。但问题在于“硬伤”太明显:评估集LATIC只有4个说话人、4小时数据,这简直像是玩具集,用来验证一个旨在解决“多样化学习者”问题的框架,说服力严重不足。作者声称“第一个系统框架”,但未充分论证该框架相较于先前属性建模工作(在非普通话上)或简单端到端模型的核心增量价值。声调建模部分的分析浅尝辄止,Tone-PT在T1/T2上高FRR的根源到底是什么?是属性定义问题(Offset-5)还是模型本身抓不住高平调特征?论文只是描述了现象,没有深挖。与更近期、更强的基线(如Conformer)对比的缺失,让人怀疑性能提升究竟是来自精巧的属性建模,还是仅仅因为用了XLSR-53这个强力骨干。代码开源是好事,但无法弥补方法和实验上的上述短板。 📌 核心摘要 本文针对普通话L2学习者的自动发音错误检测与诊断(MDD)任务,提出一种基于语音学属性的建模框架。核心动机在于,现有端到端MDD系统虽能提升检测准确率,但诊断反馈粗粒度,未显式区分段音(声母、韵母)和声调错误。本文贡献在于:1)设计并映射了一个涵盖段音发音方式、发音部位、元音特征和声调(包括类别标签和音高目标描述符两种表示)的二值化语音学属性清单;2)在一个统一的wav2vec2-CTC架构内,通过多标签目标联合预测这些属性序列;3)设计多层次诊断流程,在推理时通过比较预测与参考属性向量提供属性级反馈,并通过“属性到音素转录器”生成音素级反馈。实验在Common Voice 13 (CN)上训练,在AISHELL-1上进行跨语料库属性识别评估,在专用非母语者语料库LATIC上进行MDD评估。结果表明,与基线音素模型相比,所提方法在LATIC上将错误接受率(FAR)降低了10.1%,诊断错误率(DER)降低了23.6%。消融研究比较了不同的音素表示(IPA-S vs. IPA-D)和声调建模策略(Tone-Cat vs. Tone-PT),发现分解双元音(IPA-D)对降低属性识别错误率(AER)贡献显著,而Tone-PT在声调诊断上能降低DER但可能增加FAR。 ...

2026-06-23 · 更新于 2026-07-30 · 3 min · 447 words