Speech-Driven End-to-End Language Discrimination towards Chinese Dialects

📄 Speech-Driven End-to-End Language Discrimination towards Chinese Dialects #语音识别 5.8/10 | 创新 1/2 | 严谨 1/1.5 | 实验 1/1.5 | 清晰 0.8/1 | 影响 0.5/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 📝 5.8/10 | 前50% | #语音识别 | #语音识别 | arxiv 👥 作者与机构 作者:FAN XU, JIAN LUO, MINGWEN WANG (江西师范大学),GUODONG ZH�OU (苏州大学,通讯作者)。均为中国高校研究人员。 💡 毒舌点评 一篇想法直白、工程痕迹明显的论文。其核心主张是“语音驱动”比“文本驱动”更适合方言识别,这本身是个合理且值得探索的方向。然而,实现路径相当保守:用一个不算先进的HMM-DNN模型做ASR生成带��误的文本,然后用最基础的word2vec和CNN做融合。所谓“端到端”其实是个伪命题,因为中间的ASR和后面的分类器是脱节的。论文最大的亮点在于实验上对“语音驱动”有效性的验证,但受限于数据集规模(尤其是非重复说话人场景下样本极少)和ASR的高错误率,其声称的“有效性”说服力大打折扣。更像是一篇数据集验证和初步方法探索的报告,技术深度和创新性均不足以达到顶级会议的标准。 📌 核心摘要 本文探索了语音驱动特征在细粒度中文方言识别任务上的有效性,以应对传统文本驱动方法因词汇歧义而效果不佳的问题。作者首先系统性地验证了基于MFCC的声学特征在卷积神经网络(CNN)框架下的适用性。接着,设计了一个基于HMM-DNN的语音识别模块,用于预测方言文本。然后,采用注意力机制对预测出的文本进行加权,以提取判别性词汇的向量表示。最终,通过一个共享的CNN框架,将语音驱动的MFCC特征与文本驱动的词向量特征进行拼接输入和联合学习,以实现分类。在两个中文方言基准数据集上的评估表明,所提出的语音驱动方法是合适且有效的,结合特征的模型在多数设置下优于单一模态基线。 🔗 开源详情 代码:未提供。论文引用了第三方开源项目代码(如Coltekin的DNN模型),但未公开本研究自身的代码实现。 模型权重:未提供。 数据集: Gan Chinese Dialect Corpus:论文中引用自Xu et al. [35],但未提供直接下载链接。 iFLYTEK Chinese Dialect Corpus:论文中提及来自iFLYTEK 2018竞赛,但未提供公开下载链接。 DSLCC v4.0:http://ttg.uni-saarland.de/resources/DSLCC (此数据集在本文中未直接使用,仅在相关工作中提及)。 Demo:未提及。 复现材料:论文中提及使用以下工具和设置,但未提供具体的配置文件或检查点下载链接。 语音识别工具包:Kaldi (http://www.kaldi-asr.org/) 中文分词工具:jieba (https://pypi.org/project/jieba/)、ICTCLAS (http://ictclas.nlpir.org/downloads) 语言模型工具:SRILM (http://www.speech.sri.com/projects/srilm/) 词向量模型:word2vec (http://code.google.com/p/word2vec/) 分类器工具:Scikit-learn (https://scikit-learn.org/) 关键训练参数:嵌入维度156,MFCC维度39,卷积层数2,学习率0.008,小批量大小64。 论文中引用的开源项目(用于基线对比或工具,非本文核心代码): Coltekin & Rama (2016) DNN模型: https://github.com/coltekin/dsl2016-source jieba中文分词: https://pypi.org/project/jieba/ ELAN语言标注工具: https://tla.mpi.nl/tools/tla-tools/elan/ SRILM语言模型工具: http://www.speech.sri.com/projects/srilm/ word2vec: http://code.google.com/p/word2vec/ Kaldi语音识别工具包: http://www.kaldi-asr.org/ Scikit-learn机器学习库: https://scikit-learn.org/ ICTCLAS分词系统: http://ictclas.nlpir.org/downloads 🏗️ 方法概述和架构 本文提出一个由四个模块组成的框架,用于语音驱动的方言识别,其核心思想是利用语音直接产生的声学特征,并辅以由语音间接产生的文本特征进行联合分类。具体架构如下: ...

2026-06-18 · 更新于 2026-08-14 · 5 min · 999 words

An Analysis of the Effectiveness of Synthetic Speech Data for ASR Fine-tuning in Selected Indic Languages

📄 An Analysis of the Effectiveness of Synthetic Speech Data for ASR Fine-tuning in Selected Indic Languages #语音合成 #语音识别 #数据增强 #低资源 5.7/10 | 创新 1/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.3/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 📝 5.7/10 | 前50% | #语音识别 | #数据增强 | #语音合成 #低资源 | arxiv 👥 作者与机构 作者:Pulikodan, Basu, Kumar, Bhat, Sanka, Desai, Kumar Ghosh, Sujith Agneedh, Pavan, Pranav, Visruth, Nihar, Prasanta 机构:1 AI & Robotics Technology Park (ARTPARK), I-Hub @ IISc, Bangalore, India; 2 Department of Electrical Engineering, Indian Institute of Science, Bangalore, India ...

2026-06-17 · 更新于 2026-08-14 · 3 min · 587 words

Are you speaking my languages? On spoken language adherence in multimodal LLMs

📄 Are you speaking my languages? On spoken language adherence in multimodal LLMs #多语言 #语音识别 #大语言模型 8/10 | 创新 1/2 | 严谨 1/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 1.5/1.5 🔥 8/10 | 后50% | #语音识别 | #多语言 | #大语言模型 | arxiv 👥 作者与机构 作者:Hyungwon Kim, Kandarp Joshi, Lillian Zhou, Pavel Golik, Petar Aleksic 机构:未明确说明,从作者背景推测与Google/DeepMind相关。 💡 毒舌点评 这篇论文像是在为大厂现有系统的一次“用户体验优化”写报告,而非一项基础研究突破。核心工作是将三种已知的“补丁”(提示、微调、思维链)打包比较,用以解决一个工程上常见但学术上不够性感的问题——模型“说错话”。虽然结论“给个正确提示就行”听起来实用,但这更像是产品经理的发现,而非计算机科学家的贡献。依赖无法公开复现的专有模型和数据集,使得整个验证过程像个黑箱演示,严重削弱了学术说服力。LAVR度量标准的提出有一定价值,但其字符级的粗糙性与论文讨论的复杂语言现象(如代码混合)之间存在张力,限制了分析的深度。 📌 核心摘要 本文聚焦于多模态大语言模型(LLM)在自动语音识别(ASR)中存在的“语言遵循性”问题,即模型常生成与输入音频语言不符的转录文本。作者将此问题形式化定义为“语言遵循违规”,并提出了字符级的“语言遵循违规率”(LAVR)作为量化度量。为缓解该问题,论文系统性地比较了三种策略:零样本提示工程、监督微调(SFT)和链式思维(CoT)推理。实验在专有的单语和语码切换数据集上进行,覆盖多种语言。主要发现包括:提供正确的语言提示能显著降低LAVR和词错率(WER);三种方法在同等提示条件下性能相近,凸显了提示本身的决定性作用;SFT和CoT在无提示条件下因训练数据比例问题性能下降。论文最终建议集成上游语言识别模块以提供可靠的语言提示。 ...

2026-06-17 · 更新于 2026-08-14 · 2 min · 401 words

Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning

📄 Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning #语音识别 #语音问答 #语音摘要 #多模态模型 #参数高效微调 8.5/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 0.8/1 | 影响 1.2/1.5 | 开源 1.3/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 🔥 8.5/10 | 前25% | #语音识别 | #参数高效微调 | #语音问答 #语音摘要 | arxiv 👥 作者与机构 作者:Alexander Polok, Samuele Udupa, Sathvik Udupa, Jan Černocký, Shinji Watanabe, Lukáš Burget 机构:Speech@FIT, Brno University of Technology, Czechia;Language Technologies Institute, Carnegie Mellon University, USA ...

2026-06-17 · 更新于 2026-08-14 · 3 min · 432 words

Improving low-resource ASR using bilingual fine-tuning with language identification: a cross-linguistic evaluation

📄 Improving low-resource ASR using bilingual fine-tuning with language identification: a cross-linguistic evaluation #语音识别 #低资源 #自监督学习 #正则化微调 #数据增强 7.5/10 | 创新 1.2/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 0.4/1.5 | 复现 0.5/0.5 | 工程 1.2/1.5 ✅ 7.5/10 | 前50% | #语音识别 | #自监督学习 | #低资源 #正则化微调 | arxiv 👥 作者与机构 Reihaneh Amooie1, Yun Hao1, Wietse de Vries1, Jelske Dijkstra2, Matt Coler1, Martijn Wieling1,3。机构:1 University of Groningen, 2 Fryske Akademy, 3 Vrije Universiteit Brussel。 ...

2026-06-17 · 更新于 2026-08-14 · 2 min · 335 words

MLLP-VRAIN UPV system for the IWSLT 2026 Simultaneous Speech Translation task

📄 MLLP-VRAIN UPV system for the IWSLT 2026 Simultaneous Speech Translation task #语音识别 #大语言模型 6.9/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.6/1.5 | 开源 0.4/1.5 | 复现 0.4/0.5 | 工程 1/1.5 ✅ 6.9/10 | 前50% | #语音识别 | #大语言模型 | arxiv 👥 作者与机构 作者:Jorge Iranzo-Sánchez, Gerard Mas-Mollà, Adrià Giménez, Jorge Civera, Albert Sanchis, Alfons Juan 机构:Machine Learning and Language Processing, VRAIN, Universitat Politècnica de València ...

2026-06-17 · 更新于 2026-08-14 · 5 min · 917 words

Next-Turn: Duration-Aware Streaming Endpoint Detection via Time-to-Next-Speech-Onset Prediction

📄 Next-Turn: Duration-Aware Streaming Endpoint Detection via Time-to-Next-Speech-Onset Prediction #语音合成 #语音识别 #流式处理 #多任务学习 #自监督学习 #参数高效微调 #实时处理 7.9/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.3/1.5 ✅ 7.9/10 | 前50% | #语音合成 | #多任务学习 | #语音识别 #流式处理 | arxiv 👥 作者与机构 Tristan Tsoi, Jiajun Deng, Yingke Zhu, Huu Quyen Dang, Tianxiang Cao, Nikita Kuzmin, Tao Zhong, Simon Lui 华为中央媒体技术学院, 香港中文大学, 南洋理工大学 ...

2026-06-17 · 更新于 2026-08-14 · 3 min · 585 words

SpeechDx: A Multi-Task Benchmark for Clinical Speech AI

📄 SpeechDx: A Multi-Task Benchmark for Clinical Speech AI #语音识别 #语音合成 #语音增强 7.6/10 ✅ 7.6/10 | 前25% | #语音识别 | #语音合成 | #语音增强 | arxiv 👥 作者与机构 作者:Sejal Bhalla, Larry Kieu, Aina Merchant, Eyal de Lara, Alex Mariakakis 机构:多伦多大学 💡 毒舌点评 这篇论文就像是临床语音AI领域的“标准化考试大纲”——它精心设计了“考场”(基准),并给所有“考生”(模型)安排了“统一考试”(线性探测)。考试题目(任务)的分类法(按言语生产机制)设计得颇有生物启发性,这比随意堆砌任务要高级不少。最大的亮点是“考试成绩”很诚实:考出了当前所有“考生”的“偏科”现象(领域特定模型的局限性)和“集体短板”(跨条件泛化失败)。然而,这份“考试大纲”的“试题库”(数据集)本身就存在“出题不公”(标签噪声、生态效度)和“地域偏见”(英语为主)的问题,这在一定程度上削弱了“考试”结论的绝对说服力。作者在讨论“考试”局限性时还算坦诚,但“考试”后的“错题本”分析(失败分析、可解释性)做得不够深入。总的来说,它是一份扎实的“考卷”,但“考生”们离“满分毕业”(临床部署)还远着呢。 📌 核心摘要 本文针对临床语音AI领域因数据集孤立、评估协议不一致导致的难以比较结果和评估泛化能力的困境,提出了SpeechDx基准。该基准包含12个公开数据集、27个任务,其核心创新在于依据Berisha和Liss提出的言语生产生理阶段框架,将任务划分为概念化、构思和发音三个类别。利用该基准,作者系统评估了12个代表不同预训练范式(自监督、监督、领域特定)和数据规模的音频编码器。评估分为两部分:一是所有任务上的线性探测性能,二是零样本跨条件迁移性能。主要结论是:大规模通用语音模型(如Whisper, Qwen3)表现最稳健;领域特定模型(如emotion2vec+)仅在紧密匹配的狭窄任务上有优势;当前尚无一种表示能够可靠地泛化到整个临床语音景观。零样本迁移分析揭示了跨条件学习的非对称性,例如从低级声学特征(如呼吸/发声)向高级认知任务(如概念化)的迁移效果优于反向。 🔗 开源详情 代码:提供了匿名代码仓库链接:https://anonymous.4open.science/r/SpeechDx-F584。 模型权重:论文中未提供所评估模型(如wav2vec 2.0, Whisper等)的权重下载链接。这些权重需从各模型原始出处获取。 数据集:论文中列出了12个数据集的详细信息和访问方式(见附录A表2)。大部分数据集需申请访问或遵循特定许可证。 Demo:未提及。 复现材料:论文在附录D和E中提供了详细的实验复现信息,包括数据增强、训练设置、超参数优化方法及数据效率分析配置。所有复现脚本和说明包含在代码仓库中。 论文中引用的开源项目: SpeechBrain:用于数据增强(编号[81, 82])。 🏗️ 方法概述和架构 SpeechDx的基准方法流程可分为数据准备、模型评估和迁移分析三个核心阶段,其架构体现了系统性与可复现性的设计思想。 数据准备与任务定义: 数据集整合与划分:基准整合了12个公开的临床语音数据集(如表1所示)。对于每个数据集,论文明确了数据划分策略:优先使用官方划分;若无,则采用基于说话人隔离的策略,包括70/10/20的训练/验证/测试集划分(针对说话人数量大的数据集)或5折交叉验证(针对说话人数量小的数据集)。所有划分均尽可能按标签、性别和年龄进行分层。特别地,针对COVID-19 Sounds数据集中存在的说话人泄漏问题,作者替换了其官方划分,采用了自定义的说话人隔离划分。 任务分类与形式化:所有27个任务被系统地归类到三个言语生产阶段:概念化(如抑郁检测、情绪分类)、构思(如痴呆检测、失语症检测)和发音。任务类型包括分类(C)、多标签分类(M)和回归(R)。表1详细列出了每个任务的ID、类型、划分方式及样本量。 模型评估协议: 模型选择:评估了12个覆盖不同范式和规模的音频/语音编码器,具体模型列表见表4及附录C。这些模型分为三大类:语音模型(如wav2vec 2.0, HuBERT, Whisper)、通用音频模型(如AudioMAE, AST)和领域特定模型(如emotion2vec+, OPERA-GT)。 线性探测:核心评估方法采用冻结预训练编码器权重、仅训练顶层线性层的线性探测协议。编码器输出经过平均池化以处理变长输入。对于分类任务,线性层输出类别数维度的logits;对于回归任务,输出单个值。这种方法计算高效,且在小数据量临床任务中可减少过拟合风险。 实现细节:所有音频预处理为16kHz单声道并归一化。嵌入提取在8xH100 GPU上进行,耗时约288 GPU小时。线性层训练使用交叉熵损失(分类)或加权MSE损失(回归),并通过逆频率加权处理类别不平衡。超参数(学习率、权重衰减)通过Optuna在5次试验中基于验证损失进行优化。数据增强(添加噪声、混响、速度扰动)仅应用于训练集,使用SpeechBrain库实现。 零样本跨条件迁移分析: ...

2026-06-17 · 更新于 2026-08-14 · 2 min · 243 words

When Multiple Scripts Matter: Evaluating ASR in Clinical Settings

📄 When Multiple Scripts Matter: Evaluating ASR in Clinical Settings #语音识别 #多语言 #数据集 #基准测试 #低资源 9.1/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 1.1/1 | 影响 1.0/1.5 | 开源 1.3/1.5 | 复现 1.2/0.5 | 工程 1.1/1.5 🔥 9.1/10 | 前10% | #语音识别 | #多语言 | #数据集 #基准测试 | arxiv 👥 作者与机构 Jean Seo (1,2), Minkyu Kim (1), Jeonguk Lee (1), Jisoo Jung (1), Wooseok Han (3), Eunho Yang (1)。机构:1 AITRICS, 2 University of Copenhagen, 3 KAIST。 ...

2026-06-17 · 更新于 2026-08-14 · 2 min · 398 words

AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction

📄 AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction #语音识别 #强化学习 7.4/10 | 创新 1.5/2 | 严谨 1.1/1.5 | 实验 1.2/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 1.1/1.5 ✅ 7.4/10 | 前50% | #语音识别 | #强化学习 | arxiv 👥 作者与机构 Pengfei Zhang: University of California Irvine Hoang H Nguyen: University of Illinois Chicago Yutong Song: University of California Irvine Wenjun Huang: University of California Irvine Tahmid Imtiaz Imu: Kennesaw State University Henry Peng Zou: University of Illinois Chicago Jiang Wu: University of California Irvine Honghui Xu: Kennesaw State University Amir M. Rahmani: University of California Irvine ...

2026-06-16 · 更新于 2026-08-14 · 4 min · 729 words