Exploring LLMs for South Asian Music Understanding and Generation

📄 Exploring LLMs for South Asian Music Understanding and Generation #音乐理解 #音乐生成 #低资源 #大语言模型 7.7/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 1.1/1.5 | 清晰 0.9/1 | 影响 1/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.7/10 | 前50% | #音乐生成 | #音乐理解 | #低资源 #大语言模型 | arxiv 👥 作者与机构 Faria Binte Kader, Mohtasim Hadi Rafi, Shah Wasif Sazzad, Santu Karmaker University of Central Florida, Auburn University ...

2026-06-05 · 更新于 2026-08-03 · 1 min · 187 words

F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation

📄 F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation #语音合成 #音频生成 #语音识别 #自监督学习 #多任务学习 7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 0.8/1 | 影响 0.7/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.9/1.5 ✅ 7.2/10 | 前25% | #语音合成 | #自监督学习 | #音频生成 #语音识别 | arxiv 👥 作者与机构 Dinghao Zhou, Xingchen Song, Di Wu, Pengyu Cheng, Shengfan Shen, Sixiang Lv。第一作者单位为南京大学,第二作者单位为WeNet开源社区。论文标注作者贡献相等。 💡 毒舌点评 这篇论文的工作量扎实,试图解决音频标记器在“理解”与“生成”目标间的固有矛盾,技术路线清晰。但“新颖性”的成色需要仔细考量,其核心组件(归一化瓶颈、RQ-MTP、流匹配头)均为已有技术的组合与适配,缺少原理层面的根本性突破。更令人皱眉的是,作为一篇顶会论文,在“开源”和“可复现性”上的表现堪称“裸奔”——不提供代码、模型权重或详细的训练配置,这让所有令人印象深刻的实验结果都成了“黑箱表演”,极大地削弱了其可验证性和社区贡献度。实验部分虽然全面,但在生成任务上与最新SOTA(如Qwen3-TTS、Ming-Omni系列)的比较略显取巧,Token Rate不统一且SIM分数缺失,难以进行公平对比。总体来说,这是一篇完成度不错、但“诚意”不足的“应用整合式”论文。 ...

2026-06-05 · 更新于 2026-08-03 · 2 min · 355 words

FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition

📄 FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition #语音识别 #参数高效微调 #低资源 #语音问答 8.0/10 | 创新 6/2 | 严谨 7/1.5 | 实验 6/1.5 | 清晰 8/1 | 影响 5/1.5 | 开源 7/1.5 | 复现 7/0.5 | 工程 6/1.5 🔥 8.0/10 | 前50% | #语音识别 | #参数高效微调 | #低资源 #语音问答 | arxiv 👥 作者与机构 Fernando López, Santosh Kesiraju, Jordi Luque Telefónica Innovación Digital Spain, Universidad Autónoma de Madrid Spain, Brno University of Technology Czech Republic ...

2026-06-05 · 更新于 2026-08-03 · 3 min · 514 words

FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors

📄 FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors #大语言模型 #音频生成 #语音合成 #数据增强 7.5/10 | 创新 1.6/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.9/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7.5/10 | 前25% | #音频生成 | #数据增强 | #大语言模型 #语音合成 | arxiv 👥 作者与机构 作者:Sepehr Dehdashtian, Jacob H. Seidman, Vishnu Naresh Boddeti, Gaurav Bharaj 机构:未明确说明作者所属机构。 💡 毒舌点评 优点: ...

2026-06-05 · 更新于 2026-08-03 · 5 min · 911 words

Forgive or forget: Understanding the context of hate in audio retrieval systems

📄 Forgive or forget: Understanding the context of hate in audio retrieval systems #多模态模型 7.4/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7.4/10 | 前50% | #音频检索 | #多模态模型 | arxiv 👥 作者与机构 论文未在提供的正文中明确提及作者及机构信息。根据arXiv元数据,需查阅论文首页确认。 💡 毒舌点评 这篇论文处理了一个重要但尴尬的问题:你正用音频检索系统找个安静的雨声白噪音助眠,结果它热情地给你推送了一段充满人身攻击的“雨声”——因为那音频里恰好有人在暴雨中激烈争吵。文章提出的“忘掉”(Forget)和“原谅”(Forgive)双管齐下的后处理框架,试图让检索系统在“记住”语义的同时“忘掉”毒性,思路清晰且有实用价值。然而,正如审稿人总会怀疑“后处理是不是万能膏药”一样,其因果框架的简化(假设模型M是唯一混杂因子)和依赖第三方组件(LLM生成提示、ASR转录、毒性分类器)的鲁棒性,在当前实验中未得到充分压力测试。更关键的是,论文如同“自产自销”的闭环:用自己的新指标,在有限的两个数据集上,评估自己提出的方法。虽然结果“一致提升”,但缺乏在更复杂、更真实的有毒音频场景(如隐蔽的讽刺、跨语言仇恨)下的验证。对于一篇旨在解决实际安全问题的论文,这种实验的“温室”感,让人对其声称的广泛影响力打个问号。总分给到7.0,因为它确实提出了解决新问题的完整框架,但距离经得起推敲的顶会标准论文,实验的硬度和理论的深度还需捶打。 📌 核心摘要 本文针对文本到音频检索系统中可能无意返回有害/仇恨音频的问题,提出了一个新颖的后处理因果去偏框架。该框架包含两个互补策略:“Forget”策略通过生成六类反事实有毒提示并应用基于Noise2Noise原理的对数平均,从模型层面系统性抑制有毒偏置;“Forgive”策略则对检索到的音频进行转录和毒性分类,通过softmax重新归一化对有毒音频进行降级,同时保留语义相关但无害的内容。为评估效果,论文提出了成功率(Success Rate)、准确性(Accuracy)和敏感度(Sensitivity)三个新指标。在AUDIOCAPS和CLOTHO数据集上,针对ATNLL、TUAR和WavCaps三个基线模型的实验表明,结合“Forget+Forgive”的方法在所有评估设置下均显著提升了成功率(即毒性抑制效果),同时保持了较高的检索准确性和敏感性。论文的消融研究显示,“Forget”在抑制毒性方面更强,而“Forgive”在保持准确性上更优。此外,音频质量分析表明处理后音频与原始参考高度相似。 🔗 开源详情 代码:论文中未提及代码链接。 模型权重:论文中未提及。 数据集: AUDIOCAPS: 论文使用了AUDIOCAPS的测试集。该数据集由一篇论文介绍,可通过其官方渠道获取。获取详情请参考原始论文:AUDIOCAPS: Creating a Data Set for Descriptive Video Description and Training。 CLOTHO: 论文使用了CLOTHO的测试集。该数据集的获取方式请参考其论文及官方发布渠道:CLOTHO: An Audio Captioning Dataset。 Demo:论文中未提及。 复现材料:论文中未提及。 论文中引用的开源项目: Silero Speech-to-Text (ASR) Model: 用于将检索到的音频转换为文本。项目地址:https://github.com/snakers4/silero-vad (论文中引用为 [14])。 Detoxify: 用于对转录文本进行毒性分类。项目地址:https://github.com/unitaryai/detoxify (论文中引用为 [6])。 Noise2Noise: 论文中的Forget策略应用了其原理来平均化对数概率。相关论文:Image-to-Image Translation via Conditional Adversarial Networks (Noise2Noise) (论文中引用为 [8])。 NOMAD (Non-Matching Audio Distance): 用于评估过滤后音频质量的指标。相关论文:NOMAD: A Metric for Evaluating Generative Audio Models (论文中引用为 [12])。 基准模型 (论文中作为对比基线,但未提供其官方代码链接): ATNLL: 引用文献 [15]。 TUAR: 引用文献 [11]。 WavCaps: 引用文献 [9]。 🏗️ 方法概述和架构 本文提出一个后处理(post hoc)因果去偏框架,旨在不修改原有检索模型参数的前提下,集成到任何文本到音频检索系统中,以抑制有害音频的返回。该框架的核心是应用“前门调整”(front-door adjustment)来处理未观测的混杂因子(即检索模型M)。框架包含两个互补的策略模块:“Forget”和“Forgive”,其整体架构如论文图1所示。 ...

2026-06-05 · 更新于 2026-08-03 · 3 min · 531 words

FORTE: FOL-guided Optimal Refinement for Text-audio rEtrieval

📄 FORTE: FOL-guided Optimal Refinement for Text-audio rEtrieval #参数高效微调 #对比学习 8.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | #参数高效微调 | #参数高效微调 | #对比学习 | arxiv 👥 作者与机构 作者:Arghya Pal, Sailaja Rajanala 机构:Monash University 💡 毒舌点评 这篇工作试图用一阶逻辑(FOL)给跨模态检索注入“形式化理性”,想法很有野心,像是要给充满直觉的深度学习模型戴上一副逻辑眼镜。其核心流程(FOL精炼 -> 投影对齐 -> 谓词重排)设计得相当工整,消融实验也做得扎实,证明了每一环都不是摆设。但问题在于,这副“眼镜”太重且太挑剔:FOL解析器的性能直接决定了上限,对音频本体的覆盖(642个谓词)依然有限,遇到“electrical interference”这种词就趴窝了。更关键的是,论文在展示结果时,对绝对数值的解读有些过于乐观,比如在Clotho上R@1从16.75%提到20.4%是显著进步,但离真正“解决”细粒度检索还很远。总的来说,这是一个有价值的、工程上颇为完整的尝试,展示了符号推理的潜力,但距离成为通用、鲁棒的解决方案还有明显差距。 📌 核心摘要 本文提出了FORTE(FOL-guided Optimal Refinement for Text-audio rEtrieval),一个用于改进文本到音频检索的三阶段统一框架。其核心思想是将自然语言查询转化为形式化的一阶逻辑表示,并通过结构化搜索进行精炼,以引入更具区分性的声学属性,同时保持核心语义不变。精炼后的查询通过一个轻量级投影模块与音频嵌入进行参数高效对齐,最后在推理时应用一个基于谓词重叠的重排序步骤,以进一步提升语义一致性。在AudioCaps和Clotho数据集上的实验表明,FORTE在多个骨干网络(CLAP, LAION-CLAP, Pengi)上均能带来一致的性能提升,尤其在细粒度检索场景下。 ...

2026-06-05 · 更新于 2026-08-03 · 2 min · 381 words

GLASS: GRPO-Trained LoRA for Acoustic Style Steering in Zero-Shot Text-to-Speech

📄 GLASS: GRPO-Trained LoRA for Acoustic Style Steering in Zero-Shot Text-to-Speech #语音合成 #强化学习 #参数高效微调 8.2/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.3/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 🔥 8.2/10 | 前25% | #语音合成 | #强化学习 | #参数高效微调 | arxiv 👥 作者与机构 作者:Jaehoon Kang, Yejin Lee, Kyuhong Shim 单位:Department of Artificial Intelligence, Sungkyunkwan University, Korea 联系邮箱:{morateng, yj.lee, khshim}@skku.edu 💡 毒舌点评 “这篇工作就像给一个功能完备的智能音箱装上了几个精心调校的‘情绪旋钮’。思路清晰、模块化做得不错,实验也扎实地证明了‘旋钮’拧得动。但旋钮种类目前只有两个(语速和音高),且背后的‘电机’(奖励函数)设计得有点简陋——主要靠查字数(WER)和量音调(F0),这让‘情绪’的丰富性大打折扣。最大的槽点在于,作者自己都承认在组合多个旋钮时可能会‘翻车’(过冲),这使得其宣称的‘可组合性’打了折扣。整体而言,是一篇合格的工程优化论文,离‘优雅的学术突破’还差那么点意思。” ...

2026-06-05 · 更新于 2026-08-03 · 3 min · 519 words

InfoShield: Privacy-Preserving Speech Representations for Mental Health Screening via Information-Theoretic Optimization

📄 InfoShield: Privacy-Preserving Speech Representations for Mental Health Screening via Information-Theoretic Optimization 7.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.9/1.5 ✅ 7.1/10 | 前50% | arxiv 👥 作者与机构 作者:Xueyang Wu, Siyuan Liu, Kezhuo Yang, Guang Ling 机构:1. 深圳NeurStar Inc., 中国; 2. 约克大学, 英国; 3. 上海交通大学, 中国 💡 毒舌点评 这篇论文直面了一个真实且重要的临床痛点:如何在利用语音进行心理健康筛查的同时保护用户隐私。其信息论框架(InfoShield)的设计思路清晰且具有理论动机,特别是识别了标准MINE在序列数据上的时间-静态对齐问题并提出TimeAwareMINE,这一技术洞察是值得肯定的。然而,作为顶会级别的投稿,其“可行性验证”的定位和相对有限的实验(仅一个数据集,规模小)严重限制了结论的强度。论文声称“优于先前SOTA”,但基线SOTA仅有一篇,且该基线是否真的是“先前SOTA”存疑。将年龄推断准确率降至30.3%(低于33.3%随机猜测)是亮眼结果,但考虑到数据集仅118人且年龄分为三类,高方差结果(±14.6%)使得这一结论的鲁棒性存疑。此外,代码未开源、复现细节虽有但模型权重和数据集链接缺失,对于依赖复杂训练过程的信息论方法,这无疑降低了工作的可验证性和影响力。总体而言,这是一项有潜力的探索性工作,但距离一个令人信服、可推广的解决方案还有相当距离。 📌 核心摘要 本文提出了InfoShield,一个用于语音心理健康筛查中隐私保护表示学习的信息论框架。该框架旨在同时最小化语音表示与敏感属性(性别、年龄)之间的互信息,并保留用于抑郁分类的诊断效用。研究识别了标准互信息神经估计器(MINE)在处理序列语音数据时存在的“时间-静态对齐”问题(即变长的语音帧与静态的属性标签不匹配),并提出了时间感知MINE(TimeAwareMINE)作为解决方案,其通过跨模态注意力机制将声学帧与文本属性嵌入进行对齐,从而更准确地估计互信息。实验在Androids语料库上进行,表明InfoShield能将性别推断准确率从92.6%降至55.5%,年龄推断准确率从55.7%降至30.3%,同时抑郁分类F1值仅损失约6%(从0.834降至0.784),且优于先前报告的最佳结果(F1: 0.723)。论文的主要贡献在于提出了针对序列数据的TimeAwareMINE机制、统一了VIB与MI最小化的框架,并在特定数据集上验证了其有效性。 🔗 开源详情 代码:论文中未提及代码仓库链接。 模型权重:论文中未提及模型权重下载链接。 数据集:论文使用了Androids Corpus,该数据集来源于参考文献[tao2023androids]。论文中未提供该数据集的直接下载链接或获取说明。 Demo:论文中未提及。 复现材料:论文提供了详细的架构参数、超参数配置(\(\beta=0.001, \gamma=0.01\))、优化器设置(AdamW,lr=1e-4)、训练细节(5 epochs,batch size 32)以及课程学习策略。这些信息构成了较强的复现指南,但缺乏代码和数据,实际复现仍有障碍。 论文中引用的开源项目: sentence-BERT:用于文本编码,论文未提供链接。 Opacus:用于实现差分隐私(DP-SGD)的PyTorch库,论文未提供链接。 🏗️ 方法概述和架构 InfoShield框架(如图1所示)是一个端到端的系统,旨在学习既可用于抑郁检测又不泄露敏感人口统计信息的语音表示。其核心架构包含三个主要组件:语音编码器、诊断分类器以及隐私度量与最小化模块TimeAwareMINE。整体优化目标由三项损失函数加权求和构成:\(\mathcal{L} = \mathcal{L}_{\text{utility}} + \beta\mathcal{L}_{\text{VIB}} + \gamma\mathcal{L}_{\text{MI}}\)。 ...

2026-06-05 · 更新于 2026-08-03 · 2 min · 376 words

Learning Emotion-discriminative Representations for Zero-Shot Cross-lingual Speech Emotion Recognition

📄 Learning Emotion-discriminative Representations for Zero-Shot Cross-lingual Speech Emotion Recognition #对比学习 8.1/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 🔥 8.1/10 | 前25% | #语音情感识别 | #对比学习 | arxiv 👥 作者与机构 作者:Jinyi Mi, Ding Ma, Tomoki Toda 机构:日本名古屋大学信息学研究生院、信息技术中心 💡 毒舌点评 论文工作扎实,像一位勤恳的工程师,把两个已知的技术(监督对比学习、对抗训练)缝合得不错,在一个定义明确的任务上取得了显著的、可复现的提升。然而,其“创新”更像是一种有效的工程整合,而非开辟新范式。作者们很聪明地避开了与顶级SOTA在资源充足场景下的硬碰硬,选择了“零样本”这个对实际应用很有吸引力但相对小众的赛道。最大风险在于其核心假设——情感概念跨语言高度一致——虽然被实验部分验证,但缺乏更深入的理论或跨文化心理学探讨,这可能会被严谨的审稿人挑战。总的来说,这是一篇很好的“系统性”工作,但离“突破性”还有距离。 📌 核心摘要 本文针对零样本跨语言语音情感识别(SER)任务,提出了一种结合监督对比学习和说话人对抗学习的情感判别性表示学习框架。该方法旨在仅使用源语言和部分辅助语言(非目标语言)的标注数据,学习跨语言对齐且说话人不变的情感表示,从而在无目标语言标注数据的场景下提升泛化性能。基于预训练的wav2vec 2.0特征提取器,模型通过联合优化情感分类损失、带有语言感知权重的监督对比损失以及说话人对抗损失进行训练。在九种不同的零样本跨语言设置(涉及英语、普通话、德语、法语、乌尔都语)上的实验表明,所提方法在平均UAR和F1指标上显著优于所有基线方法(相对提升9.05%和9.38%),并接近使用目标语言数据训练的性能上界。消融研究证实了监督对比学习和说话人对抗学习各自的有效性。t-SNE可视化进一步展示了该方法能够学习到情感类别聚类更清晰、跨语言对齐更好的表示空间。 🔗 开源详情 代码:论文中未提及官方代码仓库或开源链接。 模型权重:未提供训练后的模型权重下载链接。论文中使用的预训练wav2vec 2.0模型为公开模型,例如: 英语:facebook/wav2vec2-base-960h 普通话:TencentGameMate/chinese-wav2vec2-base 德语:facebook/wav2vec2-base-de-voxpopuli-v2 法语:facebook/wav2vec2-base-fr-voxpopuli 数据集:论文详细描述了实验使用的5个数据集(MELD, ESD, EMO-DB, CaFE, URDU),但未提供直接下载链接。数据集的详情和获取方式需参考论文中引用的原始文献或项目页面。 复现材料:论文详细描述了实验设置(超参数、采样策略等),但未提供训练脚本、配置文件、数据预处理代码或模型检查点。 论文中引用的开源项目/工具: wav2vec 2.0:核心特征提取器。项目:wav2vec 2.0。 WavLM:在引言中作为其他SSL模型提及。论文:WavLM。 LoRA (Low-Rank Adaptation):用于微调的方法之一。论文:LoRA。 Parameter-Efficient Fine-Tuning:论文提及了Bottleneck Adaptor和Weight Gating作为其他微调方法,但未提供具体链接。 t-SNE:用于可视化分析。论文:Visualizing Data using t-SNE。 数据集项目:论文引用了各数据集的原论文,链接如下: MELD: https://github.com/declare-lab/MELD ESD: https://github.com/ESD-Benchmark/ESD EMO-DB: https://www.tu-chemnitz.de/ikt/prod/forschung/rohde/projects/emodb/ CaFE: https://github.com/MilaNLProc/cafe URDU: https://github.com/numbersdontlie/USSentimentBank 🏗️ 方法概述和架构 本文提出了一种用于零样本跨语言SER的情感判别性表示学习框架,其核心目标是学习同时具有情感区分性、语言不变性和说话人不变性的语音表示。该框架建立在预训练的SSL模型wav2vec 2.0之上,整体架构(如图1所示)包含以下核心组件和数据流: ...

2026-06-05 · 更新于 2026-08-03 · 2 min · 318 words

M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition

📄 M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition #多模态模型 #自监督学习 #语音识别 #音视频 9/10 | 创新 1.6/2 | 严谨 1.4/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 9/10 | 前25% | #语音识别 | #自监督学习 | #多模态模型 #音视频 | arxiv 👥 作者与机构 作者:Fei Su, Cancan Li, Ming Li, Juan Liu。 机构:武汉大学人工智能学院与计算机科学学院;香港中文大学(深圳)人工智能学院;武汉大学人工智能学院。 💡 毒舌点评 这篇论文工作扎实,动机明确,旨在解决真实世界AVSR中视角变化和模态退化的核心痛点。方法上,将多视角自监督学习(MVL编码器)与细粒度的模态感知融合(同时考虑质量和同步性)相结合,思路清晰且有新意。新发布的AISHELL8-RealScene数据集(室外、多视角)填补了部分空白,实验也较为全面。主要问题在于:1)部分实验对比可能受限于特定设置(如LLM基线未完全对齐训练数据规模),使得“最优”结论需谨慎解读;2)模态感知模块的计算开销和实际部署时的延迟未充分讨论;3)合成多视角数据的真实性和多样性可能限制MVL编码器的泛化上限。总体是一篇达到顶会门槛的工作,但部分细节的论证和工程实践考量有待加强。 📌 核心摘要 本文提出了M2S-AVSR,一个用于鲁棒音视觉语音识别(AVSR)的模态感知多视角自监督表征框架。该框架针对真实场景下常见的视角变化、音频失真和视觉遮挡等问题,主要包含两个核心创新:1)一个多视角表征学习(MVL)编码器,通过结合真实与合成视角的多视角自监督学习策略,学习视角不变的视觉表征;2)一个模态感知融合机制,在解码时显式建模视觉模态质量与跨模态同步性,实现细粒度的自适应信息注入。此外,论文发布了新的公开数据集AISHELL8-RealScene,包含多场景(室内/室外)、多视角的真实世界对话数据,用于建立更贴近现实的基准。在LRS3、MISP2021-AVSR和AISHELL8-RealScene上的实验表明,M2S-AVSR在应对视角扰动和视觉退化时显著优于现有方法,并在MISP2021-AVSR测试集上取得了新的最先进性能。 🔗 开源详情 代码:论文中未提及代码链接。 模型权重:论文中未提及模型权重链接。 数据集:AISHELL8-RealScene。论文中明确声明该数据集公开可用,并提供了具体链接和开源协议。 名称:AISHELL8-RealScene 获取链接:https://huggingface.co/datasets/SMIIP-lab/AISHELL8-RealScene 开源协议:CC BY-NC-SA 4.0 Demo:论文中未提及在线演示链接。 复现材料:论文中未提及完整的复现配置包或检查点下载链接,但提供了详细的实验设置(如网络配置、学习率、批大小、GPU型号等)。 论文中引用的开源项目: Whisper:OpenAI的开源语音识别模型。GitHub: https://github.com/openai/whisper;HuggingFace模型库: https://huggingface.co/openai/whisper-large-v3 AV-HuBERT:Facebook AI Research的音视频自监督表征学习模型。GitHub: https://github.com/facebookresearch/av_hubert LRS3:大规模的视听语音识别数据集。项目主页: https://www.robots.ox.ac.uk/~vgg/data/lip_reading/lrs3.html VoxCeleb2:大规模的视听人物识别数据集。项目主页: https://www.robots.ox.ac.uk/~vgg/data/voxceleb/vox2.html MISP2021-AVSR:多模态远场语音识别挑战赛数据集。项目主页: https://mispchallenge.github.io/ OuluVS2:多视角视听语音数据集。论文中未提供具体链接,但为已知公开数据集。 MUSAN:用于噪声增强的开源噪声数据集。论文中未提供具体链接,但为已知公开数据集。 WPE:加权预测误差法(盲解混响算法)。论文中未提供具体链接,但为已知公开工具。 GSS:引导源分离法。论文中未提供具体链接,但为已知公开工具。 ResNet-18:深度残差网络模型,广泛使用。论文中未提供具体链接,但为已知开源模型。 LLaMA:Meta的大语言模型系列。论文中未提供具体链接,但为已知开源模型。 Fun-ASR:阿里云达摩院的开源语音识别框架。GitHub: https://github.com/modelscope/FunASR FireRed-ASR:论文中提及为LLM-based ASR模型。论文中未提供具体链接。 Qwen3-ASR:论文中提及为LLM-based ASR模型。论文中未提供具体链接。 🏗️ 方法概述和架构 M2S-AVSR的整体框架如图2所示。其核心思想是分别从音频和视觉模态中提取鲁棒表征,并通过模态感知机制在解码器中进行融合。 ...

2026-06-05 · 更新于 2026-08-03 · 1 min · 195 words