研究条目

SAM Audio: Segment Anything in Audio

📄 SAM Audio: Segment Anything in Audio #音频分离 #流匹配 #多模态模型 #基准测试 #音视频 9.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.4/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1.4/1.5 🔥 9.2/10 | 前10% | #音频分离 | #流匹配 | #多模态模型 #基准测试 | arxiv 👥 作者与机构 第一作者:Bowen Shi(Meta SuperIntelligence Labs) 通讯作者:Bowen Shi(Meta SuperIntelligence Labs)、Andros Tjandra(Meta SuperIntelligence Labs) 作者列表:Bowen Shi、Andros Tjandra、John Hoffman、Helin Wang、Yi-Chiao Wu、Luya Gao、Julius Richter、Matthew Le、Apoorv Vyas、Sanyuan Chen、Christoph Feichtenhofer、Piotr Dollár、Wei-Ning Hsu、Ann Lee(均来自 Meta SuperIntelligence Labs) 💡 毒舌点评 SAM AUDIO以统一架构首次整合文本、视觉和时间跨度提示,在通用音频分离任务上取得了令人瞩目的SOTA,其精心设计的伪标签数据流水线和大规模评测体系颇具工程借鉴价值。然而,视觉提示的实际表现远逊于文本提示,且整个系统严重依赖大规模预训练和高性能硬件,在实时性或低资源场景下的适用性仍存疑。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 651 字 阅读 →
研究条目

SARSteer: Safeguarding Large Audio Language Models via Safe-Ablated Refusal Steering

📄 SARSteer: Safeguarding Large Audio Language Models via Safe-Ablated Refusal Steering 6.5/10 | 创新 0.8/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.6/1 | 影响 0.7/1.5 | 开源 1.2/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 6.5/10 | 前50% | #测试时自适应 | arxiv 👥 作者与机构 第一作者:Weilin Lin(香港科技大学(广州)) 通讯作者:Li Liu(香港科技大学(广州)) 作者列表:Weilin Lin(香港科技大学(广州))、Jianze Li(中山大学理学院)、Hui Xiong(香港科技大学(广州))、Li Liu(香港科技大学(广州)) 💡 毒舌点评 这篇论文精准抓住了LALM安全对齐中的一个真实痛点——音频模态为何让现有激活引导方法惨败,并用t-SNE和CKA双重视角给出了还算有说服力的解释。然而,方法本质上是"文本侧拒绝提示引导 + PCA投影去安全子空间"的组合,像一道精巧的工程菜,但缺乏任何让人眼前一亮的新调料。更致命的是:所有实验均在TTS合成的干净音频上进行,一到真实语音场景就靠附录里零星的探索来搪塞,审稿人完全有理由质疑其实际部署有效性。声称代码开源却缺乏文档,评估全靠有系统性保守偏差的LLM裁判,这些硬伤很难让顶会审稿人爽快放行。 📌 核心摘要 解决问题:大型音频语言模型(LALM)面临严峻的音频输入安全隐患——语音输入相比文本更容易诱导模型输出有害内容,而直接迁移LLM/LVLM的安全对齐方法到LALM时遭遇两大失败:(1) 基于音频对比的激活引导因音频模态与文本模态的隐空间分布鸿沟而完全失效,反而恶化安全性能;(2) 提示型防御在语义相近的良性查询上引发显著的过度拒绝问题。 方法核心:SARSteer是一个纯推理时安全防御框架,其两大组件分别是:(1) 文本派生拒绝引导——不对比音频激活,而是从追加的纯文本拒绝提示(默认"I cannot assist with that.")中提取激活差异向量,完全绕开不可引导的音频激活空间;(2) 分解安全空间消融——在安全样本激活上用PCA提取安全语义主成分子空间,将拒绝引导向量投影到该子空间的正交补上,确保引导信号只压制有害方向而不干扰良性输入。 与已有方法的关键区别:不同于LLM中基于harmful-safe文本对或合规-拒绝对的激活引导(如MDSteer-h2s和MDSteer-c2r),SARSteer首次揭示了音频模态下harm-to-safe方向因分布完全分离而不可靠,转而从纯文本拒绝语义中提取模态无关的引导方向;同时引入PCA安全空间消融来显式解耦拒绝信号与安全语义,缓解了提示型防御和原生引导方法中严重的过度拒绝问题。 主要实验结果:在Qwen2-Audio和Kimi-Audio两个主要模型上,SARSteer均取得了较好的安全-效用平衡。在Figstep-audio上,Qwen2-Audio的ASR从51.60%降至10.80%,BRR从70.20%升至79.95%;Kimi-Audio的ASR从15.60%降至10.00%,BRR从61.40%升至88.80%。消融实验证实了文本派生拒绝向量和PCA消融各自的必要性。 主要安全性能表 模型 方法 Figstep-audio ASR(↓%) SORRY-Bench-audio ASR(↓%) AJailBench ASR(↓%) AdvBench-audio ASR(↓%) Figstep-audio BRR(↑%) AdvBench-audio BRR(↑%) Qwen2-Audio NoDefense 51.60 27.50 48.76 2.88 70.20 85.19 Qwen2-Audio AdaShield 30.00 20.45 19.00 1.15 69.80 79.81 Qwen2-Audio FSD 12.00 10.55 19.00 0.78 63.20 63.95 Qwen2-Audio MDSteer-h2s 84.00 75.45 38.50 26.35 60.80 81.15 Qwen2-Audio MDSteer-c2r 90.80 78.41 49.00 23.46 54.20 84.23 Qwen2-Audio SARSteer 10.80 13.41 18.00 0.58 79.95 85.00 Kimi-Audio NoDefense 15.60 12.50 17.00 0.00 61.40 60.77 Kimi-Audio AdaShield 0.00 0.23 1.50 0.00 52.60 45.29 Kimi-Audio FSD 19.60 11.14 12.50 0.00 61.20 54.81 Kimi-Audio MDSteer-h2s 72.40 55.00 43.50 10.38 68.80 81.25 Kimi-Audio MDSteer-c2r 30.71 21.59 24.00 0.00 79.68 83.62 Kimi-Audio SARSteer 10.00 6.14 11.00 0.00 88.80 86.83 实际意义:SARSteer首次为LALM提供了无需微调、纯推理时的轻量级安全防御方案,有望直接集成到现有语音助手、音频理解系统中,在保持良性交互能力的同时显著阻止有害语音查询,为语音AI的安全部署提供了新思路。 主要局限性:(1) 论文明确承认只在TTS合成数据集上测试,对真实世界语音的鲁棒性尚未充分验证;(2) PCA子空间的提取依赖安全样本,在安全样本极度匮乏的零样本场景下适用性受限;(3) 引导系数α和主成分数k需手动调节,缺少自动化选择机制;(4) 所有实验均在离线batch模式下进行,未涉及实时流式推理的适配讨论。 🔗 开源详情 代码:https://github.com/linweiii/SARSteer 模型权重:论文未提供(使用现有LALM进行评测,无需额外模型权重) 数据集:作者构建的音频领域有害-安全配对数据集(Figstep-audio、AdvBench-audio、SORRY-Bench-audio、AJailBench等)随代码发布 Demo:论文未提及 复现材料:核心算法流程在正文及附录A.5中给出,超参数和实现细节在正文及附录A.3、A.5中说明,代码仓库中将包含实验配置;无独立检查点或训练脚本提供 论文引用的开源项目: Qwen2-Audio: https://github.com/QwenLM/Qwen2-Audio Kimi-Audio: 未提供公开代码仓库(参考技术报告 arXiv:2504.18425) OpenAI TTS-1-hd: https://platform.openai.com/docs/models/tts-1-hd DeepSeek-R1: https://github.com/deepseek-ai/DeepSeek-R1 SORRY-Bench: https://github.com/Social-AI-Studio/SORRY-Bench AdvBench (Zou et al. 2023): https://github.com/llm-attacks/llm-attacks FigStep (Gong et al. 2025): AAAI 2025论文,未提供独立代码仓库 AJailBench (Song et al. 2025): https://github.com/op7586/AJailBench AirBench (Yang et al. 2024b): https://github.com/OpenAIRLLM/AIR-Bench AdaShield: https://github.com/AdaShield/AdaShield FSD (FigStep defense): 与FigStep攻击论文相同,未提供独立防御代码仓库 LLM-as-judge (Mistral-7B fine-tuned): https://huggingface.co/sorry-bench/ft-mistral-7b-instruct-v0.2-sorry-bench-202406 Jailbreak-AudioBench (Cheng et al. 2025): https://github.com/hczhao328/Jailbreak-AudioBench Qwen2.5-Omni, Qwen3-Omni, Voxtral-Mini: 未在正文中提供额外链接,可在HuggingFace或官方文档中检索 🏗️ 方法概述和架构 SARSteer是一个纯推理时的安全对齐框架,输入为音频信号与文本指令的联合查询 \(Q=(a,t)\),输出为经过激活引导修正后的安全响应。整体算法在每一层Transformer的隐藏状态上独立操作,分为三个阶段: ...

 · 更新于 2026-09-05 · 约 3 分钟 · 483 字 阅读 →
研究条目

Scaling Behavior in Model Fine-tuning for Audio DeepFake Detection

📄 Scaling Behavior in Model Fine-tuning for Audio DeepFake Detection 5.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 📝 5.9/10 | 前50% | #音频伪造检测 | #参数高效微调 | arxiv 👥 作者与机构 第一作者:Xiang Li(Fordham University, Department of Computer and Information Science) 通讯作者:Xiang Li(Fordham University) 作者列表:Xiang Li(Fordham University)、Pin-Yu Chen(IBM Research)、Wenqi Wei(Fordham University) 💡 毒舌点评 这篇论文首次用受控实验拆解了音频深伪检测中的缩放不对称性,明确指出“大模型不一定更鲁棒”这一反直觉结论,对盲目追逐容量的人是一记当头棒喝。但毛病也同样刺眼:分析完全束缚在Whisper一族之内,既无其他检测器的横向对比,也无任何代码或模型公开,让整套漂亮曲线变成了一场孤独的独白——读者只能看,没法摸。更令人不安的是,文中多处关键训练细节(如batch size、损失函数)语焉不详,让人觉得这场实验可能只有作者自己玩得转。 📌 核心摘要 研究问题:音频深伪检测中,检测性能、鲁棒性和泛化能力如何随模型容量和微调数据量变化,是否存在可预测的缩放规律。 方法核心:以Whisper模型族为受控平台,通过LoRA微调构建检测器,系统改变模型尺寸(Tiny 39M、Base 74M、Small 244M、Medium 769M、Large 1.55B)与训练数据比例(2%至100%,共13档),在分布内、分布外、扰动、跨语言、跨TTS条件下评估等误率(EER),并用幂律函数 \(L(x)=\alpha x^{-\beta}+\epsilon\) 拟合缩放曲线。 与已有方法之新意:首次将缩放定律研究从预训练阶段迁移到后训练音频深伪检测,同时将评价从单一准确率拓展到鲁棒性和泛化性多轴分析,揭示缩放效益在不同评价轴上严重不对称。 主要实验结果:论文以曲线图呈现缩放趋势,未提供具体数值表格。ID条件下,大模型样本效率更高,EER随数据呈稳定幂律下降;OOD条件下收益变弱且方差大;高斯噪声扰动下鲁棒性近似跟随ID曲线,但pitch shift和Encodec失真下鲁棒性曲线明显扁平甚至饱和;跨语言和跨TTS泛化也呈现较慢的缩放率和持续的误差间隙。计算最优实验中,小模型在低算力下更优,大模型需足够算力才能超越。论文通过拟合Whisper-Large的ID缩放曲线外推,预测若误差地板降至3%,需约2400万样本才能达到5% EER;若为零地板则约需700万样本。 实际意义:为工业部署提供了明确的算力-模型匹配指导,警示仅靠扩大模型无法自动获得鲁棒性,需结合多样性数据或鲁棒训练策略。 主要局限性:分析局限于单一模型家族,未公开代码、模型权重;缩放系数的拟合仅有定性演示,缺少统计置信度;未对SOTA检测器做横向对比;关键训练超参数(batch size、损失函数)缺失;缩放行为对LoRA秩、学习率等超参数的敏感性未做消融实验。 🔗 开源详情 代码:论文中未提及代码链接。 模型权重:论文中未提及模型权重下载链接。 数据集:论文使用多个公开数据集进行训练和评估。训练数据集包括ASVspoof2019、ASV5、CodecFake (Wu et al., 2024版)、LibriTTS-train-clean-360、DFADD、LJSpeech、WaveFake、CD-ADD;评估数据集包括In-the-Wild、ADD2022(Track 1和3)、ADD2023(Round 1和2)、ASVspoof2021 LA/DF、Fake-or-Real、CodecFake (Xie et al., 2025版)、SONAR、LibriSeVoc、SpeechFake(跨语言评估)等,但未给出统一下载链接或具体获取方式。 Demo:论文中未提及。 复现材料:论文描述了训练设置(LoRA rank=16, α=32, dropout=0.1,学习率2×10⁻⁴,权重衰减5×10⁻⁴等),但未提供代码、配置文件或检查点,且缺失batch size和损失函数等关键信息。 论文中引用的开源项目: OpenAI Whisper:https://github.com/openai/whisper LoRA(Low-Rank Adaptation):https://github.com/microsoft/LoRA 🏗️ 方法概述和架构 论文并非提出新的检测模型架构,而是设计了一套受控实验框架来研究后训练音频深伪检测中的缩放行为。整体方法为一个多轴评估流水线。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 279 字 阅读 →
研究条目

Scaling Transformers for End-to-End Discrete Audio Tokenization

📄 Scaling Transformers for End-to-End Discrete Audio Tokenization #音频编码 #语音合成 #语音识别 #Transformer #自回归模型 #多任务学习 #流式处理 7.1/10 | 创新 1.4/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.2/0.5 | 工程 0.9/1.5 ✅ 7.1/10 | 前50% | #音频编码 | #Transformer | #语音合成 #语音识别 | arxiv 👥 作者与机构 第一作者:Yitian Gong(复旦大学、上海创新研究院、MOSI Intelligence) 通讯作者:Xipeng Qiu(复旦大学、上海创新研究院、MOSI Intelligence) 作者列表:Yitian Gong、Kuangwei Chen、Zhaoye Fei、Xiaogui Yang、Ke Chen、Yang Wang、Kexin Huang、Mingshu Chen、Ruixiao Li、Qinyuan Cheng、Shimin Li、Xipeng Qiu 💡 毒舌点评 TAC 把 ConvNet、预训练编码器、语义蒸馏这些被社区用了好几年的“拐杖”全扔掉,用一套纯因果 Transformer 从零开始联合优化所有模块,重建质量和下游任务效果确实能打。但“统一可扩展接口”的口号,在代码、模型、数据全部闭源面前,听起来更像是为自家闭源生态写的一份白皮书。另外,靠着碾压同行的内部数据量去比公开数据训出来的模型,然后说架构更好——这种“降维打击”,审稿人心里是不会给足创新分和公平性分的。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 638 字 阅读 →
研究条目

Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment

📄 Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment 7.5/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前25% | #语音编码 | #知识蒸馏 | arxiv 👥 作者与机构 第一作者:Xiang Li(清华大学深圳国际研究生院,鹏城实验室) 通讯作者:Zhiyong Wu(清华大学深圳国际研究生院,邮箱 zywu@sz.tsinghua.edu.cn) 作者列表:Xiang Li(清华大学深圳国际研究生院,鹏城实验室)、Yixuan Zhou(清华大学深圳国际研究生院)、Jingran Xie(清华大学深圳国际研究生院,鹏城实验室)、Zhiyong Wu(清华大学深圳国际研究生院)、Hui Wang(鹏城实验室) 💡 毒舌点评 这篇论文的聪明之处在于把难题丢给解码器,用几行MSE loss就换来了可观的保真度提升和4倍码本压缩,是典型的"视角转换"式创新。方法即插即用,零推理开销,工业落地极其友好。然而,技术核心实在单薄——就是拿自己没量化的特征去教量化后的特征,本质上是个巧妙的特征蒸馏,理论深度匮乏。实验虽覆盖面广,但全在LibriSpeech这样干净的录音室数据上打转,一到真实场景能不能打,还是未知数。下游TTS只拿了个0.5B小模型试水,说服力有限。总的感觉是,工程价值拉满,学术贡献差口气。 📌 核心摘要 本文针对VQ-VAE驱动的神经语音编解码器中,量化误差导致重建保真度下降的核心瓶颈,提出了一种名为self-guidance (SG)的训练机制。其核心思想并非改进量化器本身,而是增强解码器对量化误差的鲁棒性。具体做法是在训练时,额外将编码器输出的预量化连续嵌入\(z_e\)送入解码器,得到一个高保真的"教师"特征路径。然后,通过一个简单的stop-gradient MSE损失,强制对齐量化路径的"学生"特征\(h_q\)与连续路径的"教师"特征\(h_e\),使得解码器学会从有损的离散token中产生与无损连续信号相似的输出,从而在输出端抑制量化伪影。该方法无需修改推理流程,仅在训练阶段增加一个无反向传播的前向通路,额外计算代价<0.5%。在XCodec2上应用SG后,在LibriSpeech test-clean上全面超越原模型:使用65k码本时PESQ-WB从2.28升至2.39,且仅需16k码本即可匹配原始65k码本的性能(实现4×码本压缩)。进一步的下游自回归TTS实验显示,码本缩小显著降低了语言建模难度,大幅提升了合成自然度。方法在多种量化器(FSQ、SimVQ、Residual FSQ)和解码器架构(Transformer、CNN/RNN)上均获得一致增益,表明其可以作为通用的解码器增强策略。主要局限是尚未完全消除所有量化伪影,且跨领域泛化(如图像VQ-VAE)仍需验证。作者声称达到了SOTA,但实际PESQ提升绝对值有限。 🔗 开源详情 代码:论文主要基于XCodec2进行实现,其开源代码为 https://github.com/zhenye234/X-Codec-2.0 ;对比实验中的BigCodec使用 https://github.com/Aria-K-Alethia/BigCodec 。论文未单独提供包含自身修改代码的独立项目仓库。 模型权重:论文中未提及训练后模型权重的下载链接。 数据集:训练与评估主要使用LibriSpeech(http://www.openslr.org/12)的train-clean-100和test-clean子集,下游TTS实验使用LibriTTS-R。均为公开数据集。 Demo:论文提供了演示网站 https://sgvqvae.github.io/sgvqvae-demo 。 复现材料:论文附录A.1给出了完整的模型配置、超参数及权重的敏感性分析。未单独提供训练检查点,复现需基于XCodec2代码和论文配置进行。 论文中引用的开源项目: XCodec2: https://github.com/zhenye234/X-Codec-2.0 BigCodec: https://github.com/Aria-K-Alethia/BigCodec HuBERT (用于WER计算): https://huggingface.co/facebook/hubert-large-ls960-ft WavLM (speaker verification): https://github.com/microsoft/UniSpeech/tree/main/downstreams/speaker_verification PESQ Python 实现: https://github.com/ludlows/PESQ UTMOS: https://github.com/tarepan/SpeechMOS Vocos (iSTFT 头): 论文中引用了Siuzdak, 2024的Vocos。 🏗️ 方法概述和架构 整体流程:基于标准VQ-VAE编解码框架。输入语音信号经卷积编码器生成连续隐变量\(z_e\),经向量量化器离散化为\(z_q\),再由解码器重建波形。Self-guidance在训练阶段额外增加一条并行解码通路:直接将\(z_e\)送入同一个解码器,但通过stop-gradient截断其回传梯度,使其作为固定的"教师"指导信号,避免干扰编码器和量化器的学习。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 303 字 阅读 →
研究条目

Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis

📄 Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis #音视频生成 #流匹配 #自监督学习 #多模态模型 #扩散模型 7.2/10 | 创新 1.5/2 | 严谨 1.5/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.4/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 1/1.5 ✅ 7.2/10 | 前50% | #音视频生成 | #流匹配 | #自监督学习 #多模态模型 | arxiv 👥 作者与机构 第一作者:Hila Chefer (Black Forest Labs) 与 Patrick Esser (Black Forest Labs)(并列第一作者) 通讯作者:Hila Chefer hila@blackforestlabs.ai, Patrick Esser patrick@blackforestlabs.ai 作者列表:Hila Chefer(Black Forest Labs),Patrick Esser(Black Forest Labs),Dominik Lorenz(Black Forest Labs),Dustin Podell(Black Forest Labs),Vikash Raja(Black Forest Labs),Vinh Tong(Black Forest Labs),Antonio Torralba(MIT, Black Forest Labs),Robin Rombach(Black Forest Labs) 💡 毒舌点评 这篇工作用一个巧妙的双时间步噪声调度在流匹配中灌入了自监督表征学习,彻底摆脱了对冻住外部编码器的依赖,多模态齐头并进的效果让人眼前一亮。然而,音频实验更像顺带的点缀,真正的音频领域读者难以从中获得实质推动力,且没有任何开源承诺,工业界光鲜的“self-flow”目前还止于纸上。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 596 字 阅读 →
研究条目

Simultaneous Speech-to-Speech Translation Without Aligned Data

📄 Simultaneous Speech-to-Speech Translation Without Aligned Data #语音翻译 #强化学习 #多语言 #低资源 #流式处理 8/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.8/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1.2/1.5 🔥 8/10 | 前25% | #语音翻译 | #强化学习 | #多语言 #低资源 | arxiv 👥 作者与机构 第一作者:Tom Labiausse(Kyutai, Paris, France) 通讯作者:未指定个人通讯作者,提供团队邮箱 hibiki@kyutai.org 作者列表:Tom Labiausse(Kyutai)、Romain Fabre(Kyutai)、Yannick Estève(LIA, University of Avignon)、Alexandre Défossez(Kyutai / Gradium)、Neil Zeghidour(Gradium) 💡 毒舌点评 通过消除词级对齐数据并用单BLEU奖励驱动RL,Hibiki-Zero简化了同时语音翻译的训练范式,并在多语言环境下取得了有竞争力的质量-延迟折衷,尤其在新语言适应方面展现出潜力。但过程奖励完全依赖BLEU,回避了对翻译自然度、韵律和语义保真度的直接建模;且评测数据及训练目标语音均为合成数据,存在生成-评估偏差风险,在实际场景下的泛化能力仍存疑。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 326 字 阅读 →
研究条目

SONAR: Spectral‑Contrastive Audio Residuals for Generalizable Deepfake Detection

📄 SONAR: Spectral‑Contrastive Audio Residuals for Generalizable Deepfake Detection #语音伪造检测 #对比学习 #鲁棒性 #高效推理 7.8/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ✅ 7.8/10 | 前25% | #语音伪造检测 | #对比学习 | #鲁棒性 #高效推理 | arxiv 👥 作者与机构 第一作者:Ido Nitzan Hidekel(Tel Aviv University, School of Electrical Engineering) 通讯作者:Ido Nitzan Hidekel(Tel Aviv University, School of Electrical Engineering) 作者列表:Ido Nitzan Hidekel(Tel Aviv University, School of Electrical Engineering)、Gal Lifshitz(Tel Aviv University, School of Electrical Engineering)、Khen Cohen(Tel Aviv University, School of Physics and Astronomy)、Dan Raviv(Tel Aviv University, School of Electrical Engineering) 💡 毒舌点评 SONAR巧妙地将低频语义与高频残差的一致性作为深度伪造检测的关键信号,可学习SRM与Jensen-Shannon对齐损失的组合简洁有效,收敛速度大幅领先基线,并且在跨域测试中表现稳健。但整体架构仍属双流融合的增量改进,创新高度有限,对输入带宽高度敏感,依赖16kHz以上的高频信息,一旦低频信号被压制或带宽受限,性能会明显退化,实际部署的边界条件尚需更充分的讨论。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 356 字 阅读 →
研究条目

SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering

📄 SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering #音频修复 #流匹配 #多模态模型 #指令微调 8/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8/10 | 前25% | #音频修复 | #流匹配 | #多模态模型 #指令微调 | arxiv 👥 作者与机构 第一作者:Jan Melechovsky (Singapore University of Technology and Design) 通讯作者:Jan Melechovsky (Singapore University of Technology and Design) 作者列表:Jan Melechovsky(Singapore University of Technology and Design)、Ambuj Mehrish(Ca’ Foscari University of Venice)、Abhinaba Roy(Singapore University of Technology and Design)、Dorien Herremans(Singapore University of Technology and Design) 💡 毒舌点评 SonicMaster在"All-in-One"音乐修复上的尝试是勇敢且及时的,用一套流匹配框架统一了19种退化类型的处理,避免了以往的级联错误。但数据生成高度依赖模拟退化,而真实世界录音的退化远比参数化函数复杂和混沌得多,模型对真实复杂混合退化的泛化能力仍是未知数。VAE潜在空间的引入确实提升了效率,但也带来了可闻的编解码伪影——论文自己都承认会出现“机器人嗓音”和清晰度损失,这在一个标榜“专业级”的母带处理场景下显得不够“clean”。与效应移除模型的对比更像是一场不公平的“表演赛”,高得惊人的SI-SDR背后,很可能只是模型学会了把音频“母带化”得更响、更亮,而非真正忠实地修复了信号。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 556 字 阅读 →
研究条目

Sparse Autoencoders for Interpretable Emotion Control in Text-to-Speech

📄 Sparse Autoencoders for Interpretable Emotion Control in Text-to-Speech #语音合成 #语音情感识别 #大语言模型 #可解释性 #零样本 7/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.1/1.5 ✅ 7/10 | 前50% | #语音合成 | #大语言模型 | #语音情感识别 #可解释性 | arxiv 👥 作者与机构 第一作者:Hongfei Du(威廉玛丽学院计算机系) 通讯作者:Ye Gao(威廉玛丽学院计算机系) 作者列表:Hongfei Du、Jiacheng Shi、Sidi Lu、Gang Zhou、Ye Gao(均来自威廉玛丽学院计算机系) 💡 毒舌点评 用SAE在LLM-TTS语义残差流中寻找情感稀疏特征的想法颇具启发性,论证了情感并非单一全局向量偏移,而是少数几个潜在方向协调作用的结果,构成了本文最核心的分析贡献。但方法高度耦合于IndexTTS2单个骨干,且在特征选择上完全依赖配对情感数据,让“即插即用”的承诺在通用性上打了折扣;缺乏与最新激活转向工作(如EmoSteer-TTS)的直接对比,也让SOTA声明略显仓促。 📌 核心摘要 本文针对LLM-based TTS系统情感控制缺乏可解释性的问题,提出利用稀疏自编码器(SAE)在语义骨干中学习并调控情感相关稀疏特征。核心管线的第一步是在冻结的TTS骨干(IndexTTS2)上训练一个过完备的Top-k SAE(维度1280→4096→1280, k=32),将残差流中稠密的隐状态分解为可解释的稀疏特征激活。第二步,在离线分析阶段,通过对齐文本和说话人音色,构建配对的中性-情感样本,并基于提出的句子级情感选择性评分(emotion selectivity score,简化为配对激活频率差),可靠地筛选出与目标情感高度相关的Top-m个潜在特征。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 440 字 阅读 →
研究条目

Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

📄 Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization #模型剪枝 #可解释性 5.9/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 0.6/1.5 | 开源 0/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.9/10 | 前50% | #模型剪枝 | #模型剪枝 | #可解释性 | arxiv 👥 作者与机构 第一作者:Zheng Fang(武汉大学) 通讯作者:Shenyi Zhang(武汉大学数学与人工智能研究所) 作者列表:Zheng Fang(武汉大学)、Xiaosen Wang(华中科技大学)、Shenyi Zhang(武汉大学数学与人工智能研究所)、Shaokang Wang(上海交通大学)、Zhijin Ge(西安电子科技大学) 💡 毒舌点评 本文以一个直观的梯度能量集中现象为切入点,提出稀疏token选择优化替代传统密集波形更新,想法简单,实验在三款主流ALM上也展示了不错的攻击成功率。但问题同样刺眼:整个方法深绑白盒威胁模型,离实际攻防场景太远;更致命的是无代码、无模型、无Demo,连复现的最小诚意都没有,让其宣称的“促进安全对齐研究”显得像个空口号。 📌 核心摘要 本文研究音频语言模型(ALM)的越狱攻击,质疑密集波形更新的必要性。通过分析token对齐的梯度能量,发现梯度高度集中在少数音频token上(例如Qwen3-Omni上前16% token占90%梯度能量)。据此提出Token-Aware Gradient Optimization (TAGO),在每步迭代中仅保留梯度能量最高的top-k token对应的波形区域进行稀疏更新,并辅以模型兼容的前缀模板和早停(EOS)抑制。在Qwen3-Omni、Qwen2.5-Omni和LLaMA-Omni上,TAGO在token保留率0.25时仍能维持86%的LLM-Judge ASR(Qwen3-Omni),远超随机后剪枝的Post-hoc prune基线,且攻击扰动SNR均在20dB以上,不易察觉。结果表明密集波形更新存在大量冗余,稀疏token级优化足以实现高效越狱。不足之处在于仅适用于白盒设定,且完全未提供开源代码或模型权重。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 323 字 阅读 →
研究条目

SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations

📄 SPEAR: A Unified SSL Framework for Learning Speech and Audio Representations #音频理解 #语音识别 8.4/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.8/1 | 影响 1.3/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 0.8/1.5 🔥 8.4/10 | 前25% | #音频理解 | #自监督学习 | #语音识别 | arxiv 👥 作者与机构 第一作者/通讯作者:Xiaoyu Yang(Department of Engineering, University of Cambridge) 作者列表:Xiaoyu Yang(University of Cambridge)、Yifan Yang(Shanghai Jiao Tong University)、Zengrui Jin(Tsinghua University)、Ziyun Cui(Tsinghua University, Shanghai Artificial Intelligence Laboratory)、Wen Wu(Shanghai Artificial Intelligence Laboratory)、Baoxiang Li(Shanghai Artificial Intelligence Laboratory)、Chao Zhang(Tsinghua University, Shanghai Artificial Intelligence Laboratory)、Phil Woodland(University of Cambridge) 💡 毒舌点评 SPEAR 用多码本矢量量化(MVQ)这把快刀,把语音和音频两个域的知识剁成离散 token,再让 Zipformer 用掩码预测全吞下去。思路直接有效,在 SUPERB 和 HEAR 上双线刷榜,token mixing 更是让分离任务表现惊艳。但整个框架的命门在于强依赖教师模型质量,训练 pipeline 重得像个工程怪兽,且音频数据仅 13k 小时,想在纯音乐或环境声上压制音频大模型还差火候。说是统一框架,但目前还是个理解专才,生成任务的门都没摸到。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 1028 字 阅读 →
研究条目

Speech-Audio Compositional Attacks on Multimodal LLMs and Their Defense with SALMONN-Guard

📄 Speech-Audio Compositional Attacks on Multimodal LLMs and Their Defense with SALMONN-Guard #音频理解 #SFT #基准测试 #内容审核 #数据集 8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 1.1/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 🔥 8.3/10 | 前25% | #音频理解 | #SFT | #基准测试 #内容审核 | arxiv 👥 作者与机构 第一作者:Yudong Yang(清华大学) 通讯作者:Guangzhi Sun(剑桥大学)、Chao Zhang(清华大学) 作者列表:Yudong Yang(清华大学)、Xuezhen Zhang(清华大学)、Zhifeng Han(清华大学)、Siyin Wang(清华大学)、Jimin Zhuang(清华大学)、Zengrui Jin(清华大学)、Jing Shao(上海人工智能实验室)、Guangzhi Sun(剑桥大学)、Chao Zhang(清华大学) 💡 毒舌点评 本文亮点在于首次系统性地将语音-非语音音频的语义和语境组合引入多模态LLM安全红队评测,攻击方式真实且具有现实威胁性,提出的SALMONN-Guard联合模态守卫设计也展现了防御此类攻击的可行性。然而,攻击构造仍依赖人工预设的声学参数与对话脚本,缺乏自适应的攻击策略优化,使得benchmark的攻击上限不明确;防御仅使用SFT,未与对抗训练等更强基线对比,说服力不足;MSD评估将“理解错误”也计入攻击成功,该设定存在争议,可能高估了实际威胁。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 738 字 阅读 →
研究条目

Spherical Procrustes Alignment for Reliable Medical Audio Diagnosis

📄 Spherical Procrustes Alignment for Reliable Medical Audio Diagnosis #音频分类 #音频事件检测 #低资源 8.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 0.8/1.5 | 开源 1.2/1.5 | 复现 0.4/0.5 | 工程 1/1.5 🔥 8.2/10 | 前25% | #音频分类 | #知识蒸馏 | #音频事件检测 #低资源 | arxiv 👥 作者与机构 第一作者:Ying Wang(Faculty of Applied Sciences, Macao Polytechnic University, Macao SAR, China) 通讯作者:Xiaochen Yuan(Faculty of Applied Sciences, Macao Polytechnic University, Macao SAR, China) 作者列表:Ying Wang(Faculty of Applied Sciences, Macao Polytechnic University)、Guoheng Huang(School of Computer Science and Technology, Guangdong University of Technology)、Chan-Tong Lam(Faculty of Applied Sciences, Macao Polytechnic University)、Xiaochen Yuan(Faculty of Applied Sciences, Macao Polytechnic University) 💡 毒舌点评 这篇论文精准地抓住了医疗音频模型过度自信的几何病根——范数偏差,用球形约束和动态Procrustes对齐的组合拳切断了特征幅度与置信度的虚假耦合,理念清晰且动机扎实。实验校准效果惊人,将BEATs的ECE从28.51%拉低到4.44%,且做到了零额外推理成本,这一点很漂亮。然而,方法论层面更多是已知几何工具(L2归一化、ETF、SVD)在特定问题上的精巧组装,而非基础性突破。此外,验证局限于两个公开的呼吸音/心音数据集,在标签噪声、跨中心/跨设备泛化上的鲁棒性论证几乎为零,结论的临床闭环说服力仍需大量补充。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 901 字 阅读 →
研究条目

Stable Spectral Copula Alignment for Robust Multimodal Learning

📄 Stable Spectral Copula Alignment for Robust Multimodal Learning #鲁棒性 #多模态模型 5.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 0.9/1.5 | 清晰 0.4/1 | 影响 0.5/1.5 | 开源 0/1.5 | 复现 0.1/0.5 | 工程 1.1/1.5 📝 5.2/10 | 后50% | #鲁棒性 | #多模态模型 | arxiv 👥 作者与机构 第一作者:Hongkang Zhang(Tsinghua Shenzhen International Graduate School, Tsinghua University) 通讯作者:Shao-Lun Huang(Tsinghua Shenzhen International Graduate School, Tsinghua University) 作者列表:Hongkang Zhang, Shao-Lun Huang, Yanlong Wang, Ercan Engin KURUOGLU(均为Tsinghua Shenzhen International Graduate School) 💡 毒舌点评 这篇论文试图构建一个“可审计”的多模态对齐协议,利用Copula理论与光谱扰动理论提供一种部署阶段抵御分布偏移的稳定契约精神。将错误的溯源与可执行的门控决策结合起来,想法在MLOps导向的多模态学习里算是有新意。然而,作品的写作风格沉重拖沓,导论部分沉迷于宏观宣誓而技术细节被稀释殆尽;更致命的是,全文完全没有提供任何形式的代码或数据链接,在这个号称“可审计”的协议里,自身的可复现性却是零。实验虽覆盖了不少漂移场景,但主要聚焦于情感分析和图像-文本检索,在音频处理的核心高地(如语音识别/分离)上毫无建树,这让它在多模态社区内难以跨越“小圈子自嗨”的界限。 ...

 · 更新于 2026-09-05 · 约 2 分钟 · 356 字 阅读 →
研究条目

STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

📄 STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation #音频生成 7.9/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.5/1.5 | 复现 0.4/0.5 | 工程 1.1/1.5 ✅ 7.9/10 | 前25% | #音频生成 | #变分自编码器 | arxiv 👥 作者与机构 第一作者:Huadai Liu(香港科技大学、阿里巴巴通义 Fun Team) 通讯作者:Wei Xue(香港科技大学) 作者列表:Huadai Liu(香港科技大学、阿里巴巴通义 Fun Team)、Wen Wang(阿里巴巴通义 Fun Team)、Kaicheng Luo(阿里巴巴通义 Fun Team)、Qian Chen(阿里巴巴通义 Fun Team)、Xiangang Li(阿里巴巴通义 Fun Team)、Wei Xue(香港科技大学) 💡 毒舌点评 这篇论文将音频 VAE 中一个被长期默认的实践——各通道均等 KL 惩罚——上升到"三元悖论"的理论高度,并用一个幂律增长的通道方向约束场(Gamma-Growth)优雅地重构了潜在空间拓扑。洞察清晰、动机扎实,实验也相当全面。然而,方法核心高度依赖对 γ=2.0 这一具体取值的经验消融,缺乏信息论或谱分析层面的严格理论支撑来解释"为何是幂律而非其他函数族",更缺少对该参数的数据驱动自适应机制;且论文将 STAR 包装为"适用于任何 VAE 架构"的通用正则化器,但在纯 CNN 上的收益幅度远小于结合 Mamba 的跃升,通用性声明的力度可能需要更审慎的限定。此外,无开源代码和模型权重,在当前顶会生态中属于较大减分项。 ...

 · 更新于 2026-09-05 · 约 7 分钟 · 1335 字 阅读 →
研究条目

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

📄 STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits #音视频生成 #语音合成 #扩散模型 #自回归模型 #多模态模型 6.8/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 1.2/1.5 ✅ 6.8/10 | 前50% | #音视频生成 | #扩散模型 | #语音合成 #自回归模型 | arxiv 👥 作者与机构 第一作者:Foivos Paraperas Papantoniou(Imperial College London, UK) 通讯作者:Foivos Paraperas Papantoniou(Imperial College London, UK) 作者列表:Foivos Paraperas Papantoniou(Imperial College London, UK)、Stathis Galanakis(Imperial College London, UK)、Rolandos Alexandros Potamias(Imperial College London, UK)、Bernhard Kainz(Imperial College London, UK; FAU Erlangen–Nürnberg, Germany)、Stefanos Zafeiriou(Imperial College London, UK) 💡 毒舌点评 这篇论文把一个音频驱动说话人脸生成和一个新视角合成任务塞进了同一个框架,工程整合能力值得肯定,自强迫训练策略和纯ID驱动生成确实让动画没那么“僵尸”了。但本质上,它就是拿Arc2Face当骨架,套上AnimateDiff的时间层,加个ReferenceNet,再用自强迫和唇读损失微调一下——每个组件都是现成的,论文没在理论或架构上给出让人眼前一亮的新洞见。最致命的还是不提供代码和模型,在如今“没有开源就别想拿高分”的顶会气氛下,这种做法无异于自断一臂,尤其是实验结果里那些微小的LSE-C领先,没给置信区间,完全是给人留质疑的把柄。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 761 字 阅读 →
研究条目

Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage

📄 Stream RAG: Instant and Accurate Spoken Dialogue Systems with Streaming Tool Usage #流式处理 7.2/10 | 创新 1.2/2 | 严谨 1.2/1.5 | 实验 1.1/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.5/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.2/10 | 前50% | #流式处理 | #流式处理 | arxiv 👥 作者与机构 第一作者:Siddhant Arora(Meta AI / Carnegie Mellon University) 通讯作者:Siddhant Arora(siddhana@meta.com)、Zhaojiang Lin(zhaojiang@meta.com) 作者列表:Siddhant Arora(Meta AI, USA / Carnegie Mellon University, USA)、Haidar Khan(Meta AI, USA)、Kai Sun(Meta AI, USA)、Xin Luna Dong(Meta AI, USA)、Sajal Choudhary(Meta AI, USA)、Seungwhan Moon(Meta AI, USA)、Xinyuan Zhang(Meta AI, USA)、Adithya Sagar(Meta AI, USA)、Surya Teja Appini(Meta AI, USA)、Kaushik Patnaik(Meta AI, USA)、Sanat Sharma(Meta AI, USA)、Shinji Watanabe(Carnegie Mellon University, USA)、Anuj Kumar(Meta AI, USA)、Ahmed A Aly(Meta AI, USA)、Yue Liu(Meta AI, USA)、Florian Metze(Meta AI, USA)、Zhaojiang Lin(Meta AI, USA) 💡 毒舌点评 本文提出了一种将语音对话系统的工具调用从“端点后”推进到“流式并行”的工程框架,其“边听边查”的思路以及对延迟的大幅改善(结合vLLM后达57%)无疑是务实且有效的。然而,这也是一篇典型的工业界系统工程论文:核心的Model-Triggered策略本质上是对LLM的一次精巧适配和指令微调,学术深度有限,未能对“为何流式查询不损害准确率”提供理论层面的洞见。此外,论文回避了Reflector机制在关键实体后置时的失效问题,且对多轮、嘈杂环境的鲁棒性验证严重不足,使其宣称的泛化能力打了折扣。 ...

 · 更新于 2026-09-05 · 约 3 分钟 · 570 字 阅读 →
研究条目

SURF: Separation via Unsupervised Remixing Flow

📄 SURF: Separation via Unsupervised Remixing Flow #语音分离 #生成模型 #自监督学习 #无监督学习 6.2/10 | 创新 1.2/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.7/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.3/0.5 | 工程 0.9/1.5 ✅ 6.2/10 | 前50% | #语音分离 | #流匹配 | #生成模型 #自监督学习 | arxiv 👥 作者与机构 第一作者:Henry Li (Google), 共同一作:Robin Scheibler (Google DeepMind) 通讯作者:Henry Li (lihenry@google.com) 作者列表:Henry Li (Google)、Robin Scheibler (Google DeepMind)、Efthymios Tzinis (Google)、Matt Shannon (Google DeepMind)、Arnaud Doucet (Google DeepMind)、John R. Hershey (Google DeepMind) 备注:Arnaud Doucet 与 John R. Hershey 为共同高级作者 (equal senior contribution) 💡 毒舌点评 这篇论文用Wake-Sleep给“借鸡生蛋”的Remixing套上了一层概率外衣,又将Flow Matching的生成能力引入无监督分离,想法很漂亮,画面很美好。但现实很骨感:AudioSet上三四个源的场景直接“掉链子”,理论分析的强假设(人口极限B→∞)在实际中脆弱得像纸糊,加上代码闭源、关键超参数缺失,让人严重怀疑这套花哨的pipeline复现起来是不是一场工程噩梦。 ...

 · 更新于 2026-09-05 · 约 5 分钟 · 1043 字 阅读 →
研究条目

T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

📄 T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation #基准测试 #多模态模型 #音视频生成 7.9/10 | 创新 1.2/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 0.9/1 | 影响 1.2/1.5 | 开源 0.7/1.5 | 复现 0.3/0.5 | 工程 1.3/1.5 ✅ 7.9/10 | 前25% | #音视频生成 | #多模态模型 | #基准测试 | arxiv 👥 作者与机构 第一作者:Zhe Cao, Tao Wang, Jiaming Wang, Yanghai Wang(并列一作,均标注为南京大学) 通讯作者:Jiaheng Liu(南京大学) 其他作者:Yuanxing Zhang(快手科技 Kling Team)、Jiahao Wang(南京大学)、Jialu Chen(快手科技 Kling Team)、Miao Deng(南京大学)、Chenxi Liao(南京大学)、Yize Zhang(南京大学)、Yubin Guo(南京大学)、Zhaoxiang Zhang(中国科学院自动化研究所) 💡 毒舌点评 这篇论文在 T2AV 评估领域迈出了扎实的一步:500条高复杂度prompt配合同一框架下的双层级评估,确实暴露了SOTA模型在“音频真实感”和“长时叙述”上的系统性瓶颈,诊断价值明确。但MLLM-as-a-Judge的可靠性验证仅覆盖50个样本且音频Realism一致性较弱(L1高达1.420),若不能规模化解决judge bias,这套框架的权威性就只能停留在“参考级”而非“标准级”。 ...

 · 更新于 2026-09-05 · 约 4 分钟 · 663 字 阅读 →