MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data

📄 MindAlign: Decoding Inner Speech from fMRI Signals via Multimodal Embedding Alignment under Limited Data #语音识别 #低资源 #数据增强 #多模态模型 #自监督学习 #参数高效微调 5.8/10 | 创新 1.3/2 | 严谨 1.1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 0.4/1.5 | 开源 0.1/1.5 | 复现 0.3/0.5 | 工程 0.8/1.5 📝 5.8/10 | 前50% | #语音识别 | #数据增强 | #低资源 #多模态模型 | arxiv 👥 作者与机构 作者:Muxuan Liu, Ichiro Kobayashi, Satoshi Nishida。第一作者Muxuan Liu和第二作者Ichiro Kobayashi隶属于日本御茶水女子大学(Ochanomizu University)人文与科学研究生院;第三作者Satoshi Nishida隶属于日本国立信息通信技术研究所(NICT)先进ICT研究所信息与神经网络中心(CiNet)。 ...

2026-06-23 · 更新于 2026-07-27 · 1 min · 163 words

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

📄 On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models #语音合成 #语音生成 #自监督学习 #低资源 #数据增强 7.4/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 0.8/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7.4/10 | 前25% | #语音合成 | #自监督学习 | #语音生成 #低资源 | arxiv 👥 作者与机构 Shunsuke Kando (东京大学) Wataru Nakata (庆应义塾大学) Shinnosuke Takamichi (东京大学) Yusuke Miyao (庆应义塾大学) ...

2026-06-23 · 更新于 2026-07-27 · 3 min · 608 words

Online Predictive Coding for Dual-Mode Self-Supervised Speech Model

📄 Online Predictive Coding for Dual-Mode Self-Supervised Speech Model #语音识别 #自监督学习 #预训练 7.2/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.3/1.5 | 清晰 1/1 | 影响 0.5/1.5 | 开源 0.5/1.5 | 复现 0.5/0.5 | 工程 0.6/1.5 ✅ 7.2/10 | 前50% | #语音识别 | #自监督学习 | #预训练 | arxiv 👥 作者与机构 Keita Goto\(^{1}\), Takashi Maekaku\(^{1}\), Jin Sakuma\(^{1}\), Jinchuan Tian\(^{2}\), Yusuke Shinohara\(^{1}\), Shinji Watanabe\(^{1}\) \(^{1}\) LY Corporation, Tokyo, Japan \(^{2}\) Carnegie Mellon University, PA, USA ...

2026-06-23 · 更新于 2026-07-27 · 4 min · 678 words

Physics-Informed Neural Operator for Speech Production Analysis

📄 Physics-Informed Neural Operator for Speech Production Analysis #语音合成 #自监督学习 6.7/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0/1.5 | 复现 0.5/0.5 | 工程 0.7/1.5 ✅ 6.7/10 | 前50% | #语音合成 | #自监督学习 | arxiv 👥 作者与机构 Yokota, Kazuya (1) Luan, Xinmeng (2) Mohapatra, Debasish Ray (3) Scavone, Gary (2) Fels, Sidney (3) 1 Department of Mechanical Engineering, Nagaoka University of Technology, Japan 2 Schulich School of Music, McGill University, Canada 3 Department of Electrical and Computer Engineering, University of British Columbia, Canada ...

2026-06-23 · 更新于 2026-07-27 · 2 min · 358 words

SDP-Codec: A Speaker-Decoupled Speech Codec with Pitch Injection for Low-Bitrate Coding and Zero-Shot Voice Conversion

📄 SDP-Codec: A Speaker-Decoupled Speech Codec with Pitch Injection for Low-Bitrate Coding and Zero-Shot Voice Conversion #语音编码 #自监督学习 7.2/10 | 创新 1.5/2 | 严谨 1.2/1.5 | 实验 1/1.5 | 清晰 1/1 | 影响 0.7/1.5 | 开源 0.8/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 ✅ 7.2/10 | 前50% | #语音编码 | #自监督学习 | arxiv 👥 作者与机构 作者:Hounsu Kim, Juhan Nam 机构:Graduate School of Culture Technology, KAIST, Daejeon, South Korea 💡 毒舌点评 亮点:终于有人想着别让编解码器把说话人信息都塞进内容token里了。单阶段训练的设计很务实,避免了那些花里胡哨的多阶段对抗训练。把FCPE的soft-label loss拿来做pitch reconstruction,思路清晰。在说话人相似度(SECS)和F0相关性上的提升是实打实的,特别是16kHz的大模型版本,在VC任务上吊打了BiCodec和MSRCodec,这个结果很有说服力。消融实验也做得扎实,把连续特征、pitch loss和F0注入的作用讲得比较明白。 ...

2026-06-23 · 更新于 2026-07-27 · 2 min · 290 words

Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach

📄 Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach #说话人验证 #知识蒸馏 #自监督学习 9.1/10 | 创新 1.4/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1.5/1.5 | 开源 1/1.5 | 复现 0.5/0.5 | 工程 1/1.5 🔥 9.1/10 | 前25% | #说话人验证 | #知识蒸馏 | #自监督学习 | arxiv 👥 作者与机构 Tzu-Chieh Wei (jeff20020302@gmail.com), Yi-Cheng Lin (even.dlion8@gmail.com), Huang-Cheng Chou, Kuan-Yu Chen, Hsin-Yen Sung (tlkagkb93901106@gmail.com), Shrikanth Narayanan, Hung-yi Lee. 机构: ...

2026-06-23 · 更新于 2026-07-27 · 2 min · 390 words

Towards Detecting Neural Audio Codec Synthesized Heart Sounds

📄 Towards Detecting Neural Audio Codec Synthesized Heart Sounds #自监督学习 8.7/10 | 创新 1.5/2 | 严谨 1.3/1.5 | 实验 1.4/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.5/1.5 🔥 8.7/10 | 前50% | #自监督学习 | #自监督学习 | arxiv 👥 作者与机构 Chetia Phukan (UPES, India), Mujtaba Akhtar (NTHU, Taiwan), Kuwar Behera (VBSPU, India), Buduru (VBSPU, India), Girish Orcha (Independent Researcher, India), Mohd Bhavinkumar Vinodbhai (IIIT-Delhi, India), Swarup Ranjan (IIIT-Delhi, India), Arun Balaji (IIIT-Delhi, India)。 注:已有分析未提供此信息,根据原文补充。 ...

2026-06-23 · 更新于 2026-07-27 · 3 min · 523 words

Using Phonological-Level Wav2Vec2 for Mandarin Automatic Mispronunciation Detection and Diagnosis

📄 Using Phonological-Level Wav2Vec2 for Mandarin Automatic Mispronunciation Detection and Diagnosis #语音识别 #自监督学习 8.3/10 | 创新 1.5/2 | 严谨 1/1.5 | 实验 0.8/1.5 | 清晰 1/1 | 影响 1.2/1.5 | 开源 1.5/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 🔥 8.3/10 | 前25% | #语音识别 | #自监督学习 | arxiv 👥 作者与机构 作者:Chen, Shahin, Ahmed 机构:School of Electrical Engineering and Telecommunications, UNSW, Australia 💡 毒舌点评 论文提出解决一个实际问题(普通话MDD的细粒度诊断),动机合理,框架设计也系统。但问题在于“硬伤”太明显:评估集LATIC只有4个说话人、4小时数据,这简直像是玩具集,用来验证一个旨在解决“多样化学习者”问题的框架,说服力严重不足。作者声称“第一个系统框架”,但未充分论证该框架相较于先前属性建模工作(在非普通话上)或简单端到端模型的核心增量价值。声调建模部分的分析浅尝辄止,Tone-PT在T1/T2上高FRR的根源到底是什么?是属性定义问题(Offset-5)还是模型本身抓不住高平调特征?论文只是描述了现象,没有深挖。与更近期、更强的基线(如Conformer)对比的缺失,让人怀疑性能提升究竟是来自精巧的属性建模,还是仅仅因为用了XLSR-53这个强力骨干。代码开源是好事,但无法弥补方法和实验上的上述短板。 📌 核心摘要 本文针对普通话L2学习者的自动发音错误检测与诊断(MDD)任务,提出一种基于语音学属性的建模框架。核心动机在于,现有端到端MDD系统虽能提升检测准确率,但诊断反馈粗粒度,未显式区分段音(声母、韵母)和声调错误。本文贡献在于:1)设计并映射了一个涵盖段音发音方式、发音部位、元音特征和声调(包括类别标签和音高目标描述符两种表示)的二值化语音学属性清单;2)在一个统一的wav2vec2-CTC架构内,通过多标签目标联合预测这些属性序列;3)设计多层次诊断流程,在推理时通过比较预测与参考属性向量提供属性级反馈,并通过“属性到音素转录器”生成音素级反馈。实验在Common Voice 13 (CN)上训练,在AISHELL-1上进行跨语料库属性识别评估,在专用非母语者语料库LATIC上进行MDD评估。结果表明,与基线音素模型相比,所提方法在LATIC上将错误接受率(FAR)降低了10.1%,诊断错误率(DER)降低了23.6%。消融研究比较了不同的音素表示(IPA-S vs. IPA-D)和声调建模策略(Tone-Cat vs. Tone-PT),发现分解双元音(IPA-D)对降低属性识别错误率(AER)贡献显著,而Tone-PT在声调诊断上能降低DER但可能增加FAR。 ...

2026-06-23 · 更新于 2026-07-27 · 3 min · 447 words

A Comparative Study of Pretrained Transformer Models for Quranic ASR: Speech Representations, Label Formats, and Dataset Composition

📄 A Comparative Study of Pretrained Transformer Models for Quranic ASR: Speech Representations, Label Formats, and Dataset Composition #语音识别 #自监督学习 7.2/10 | 创新 1/2 | 严谨 1.2/1.5 | 实验 1.5/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.2/1.5 | 复现 0.5/0.5 | 工程 0.8/1.5 ✅ 7.2/10 | 前50% | #语音识别 | #自监督学习 | arxiv 👥 作者与机构 作者: Nabil Mosharraf Hossain (Greentech Apps Foundation), Riasat Islam (Queen Mary University of London), Unaizah Obaidellah (University of Malaya) ...

2026-06-19 · 更新于 2026-07-27 · 2 min · 317 words

A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine

📄 A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine #语音合成 #语音识别 #自监督学习 #数据集 7.4/10 | 创新 1.3/2 | 严谨 1.2/1.5 | 实验 0.6/1.5 | 清晰 1/1 | 影响 1/1.5 | 开源 0.8/1.5 | 复现 0.5/0.5 | 工程 1/1.5 ✅ 7.4/10 | 前50% | #语音合成 | #自监督学习 | #语音识别 #数据集 | arxiv 👥 作者与机构 作者:Jingyu Lu, Yuhan Wang, Jianming Luo, Yifu Chen, Tianle Liang, Shengpeng Ji, Ziyue Jiang, Xiaoda Yang, Yu Zhang, Xize Cheng, Chenyuhao Wen, Changhao Pan, Haoxiao Wang, Chen Ye, Jian Wu, Xiaoxi Jiang, Guanjun Jiang, Zhou Zhao。 机构:浙江大学(1),阿里巴巴通义事业群(2),腾讯混元团队(3),字节跳动(4)。 ...

2026-06-19 · 更新于 2026-07-27 · 3 min · 517 words